پرش به محتوای اصلی
پرش به محتوای مقاله

شکاف دقت در مدل‌های بازشناسی گفتار به زیر یک درصد رسید

·۱ مرداد ۱۴۰۵۹ دقیقه مطالعه
تحلیل
مقایسه بهترین مدل‌های بازشناسی گفتار ۲۰۲۶: نرخ خطا، زبان‌ها، تاخیر و مجوز
مقایسه بهترین مدل‌های بازشناسی گفتار ۲۰۲۶: نرخ خطا، زبان‌ها، تاخیر و مجوز
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر پارادایم انتخاب مدل ASR از «دقت محور» به «تدارکاتی محور». برای نخستین بار، تفاوت دقت مدل‌های برتر Open-Weight به قدری ناچیز شده که لایسنس و توان عملیاتی به تنها معیارهای تصمیم‌گیر تبدیل شده‌اند.

شما احتمالاً تصور می‌کنید برای انتخاب بهترین مدل بازشناسی گفتار (ASR)، کافی است به جدول رده‌بندی (Leaderboard) نگاه کنید و مدلی با کمترین نرخ خطا را بردارید. اما حقیقت این است که در سال ۲۰۲۶، نمرات این جدول دیگر پیش‌بینی‌کننده موفقیت مدل در محیط عملیاتی نیستند.

طبق تحلیل فنی Marktechpost، تفاوت بین مدل‌های پیشتاز در جدول Open ASR متعلق به Hugging Face، در ژوئیه ۲۰۲۶ به کمتر از یک نقطه در نرخ خطای کلمه (Word Error Rate - WER) رسیده است. این یعنی رقابت از سطح «صحت مطلق» به سطح «بهینگی عملیاتی» منتقل شده است.

همان‌طور که در تحلیل قبلی ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، گذار از مدل‌های غول‌پیکر به مدل‌های تخصصی، باعث می‌شود معیارهای ارزیابی تغییر کند. طی ۱۲ ماه گذشته، انحصار مدل Whisper شکسته شد. در مارس ۲۰۲۶، شرکت Cohere مدل Transcribe را (یک مدل ۲ میلیارد پارامتری با لایسنس Apache 2.0) معرفی کرد که با نرخ خطای ۵.۴۲٪ صدر جدول را گرفت. تنها پنج هفته بعد، IBM مدل Granite Speech 4.1 2B را با نرخ ۵.۳۳٪ عرضه کرد و پس از آن مدل‌های ARK-ASR-3B و MOSS-Transcribe-preview-2B اعداد پایین‌تری را ثبت کردند.

این هم‌گرایی یعنی «بهترین» مدل دیگر آن نیست که کمترین امتیاز خطا را دارد، بلکه تصمیم‌گیری به متغیرهای تدارکاتی منتقل شده است: نوع لایسنس، پوشش زبانی و شکاف معماری بین پردازش دسته‌ای (Batch) و استریمینگ در لحظه (Real-time). رتبه دیگر متغیر تعیین‌کننده نیست؛ بلکه لایسنس و هزینه به ازای هر ساعت صوت، تصمیم‌گیرنده است.

توهم جدول رده‌بندی

به گزارش منابع فنی، بسیاری از توسعه‌دهندگان فریب اعداد جدول را می‌خورند؛ چراکه میانگین جدول یک مقدار ثابت و واحد نیست و مدل‌هایی که در کنار هم لیست شده‌اند، همگی به روش یکسانی امتیاز نگرفته‌اند.

برای مثال، مدل Cohere Transcribe (2B) ادعای میانگین ۵.۴۲٪ WER را در ۸ مجموعه داده تست انگلیسی دارد. جزئیات این تفکیک به شرح زیر است:

  • LibriSpeech clean: ۱.۲۵٪
  • TED-LIUM: ۲.۴۹٪
  • SPGISpeech: ۳.۰۸٪
  • VoxPopuli: ۵.۸۷٪
  • AMI: ۸.۱۳٪
  • GigaSpeech: ۹.۳۴٪
  • Earnings-22: ۱۰.۸۶٪
  • LibriSpeech other: ۲.۳۷٪

اما مدل‌های جدیدتر مانند ARK-ASR-3B و MOSS-Transcribe-preview-2B اغلب مجموعه داده ساده‌تر TED-LIUM را از میانگین‌های خود حذف کرده‌اند. در کارت مدل MOSS-Transcribe-preview-2B صراحتاً ذکر شده است که TED-LIUM در حال حاضر بخشی از اجرای رده‌بندی نیست. حذف این مجموعه ساده، میانگین سایر مدل‌ها را بالا می‌برد اما باعث می‌شود این مدل‌های خاص قوی‌تر به نظر برسند. اگر امتیازهای Cohere را با همان هفت مجموعه ARK دوباره محاسبه کنیم، نرخ خطای آن از ۵.۴۲٪ به ۵.۸۴٪ افزایش می‌یابد. به همین ترتیب، مدل Granite Speech 4.1 2B از ۵.۳۳٪ به ۵.۶۵٪ تغییر می‌کند. این نشان می‌دهد که در یک مقایسه برابر (Like-for-like)، برتری ARK بیشتر از اعداد تیتروار است، اما در عین حال ثابت می‌کند که تفریق یک عدد منتشر شده از عدد دیگر، پاسخ معناداری نمی‌دهد.

علاوه بر این، پدیده‌ی «برازش روی بنچمارک» (Leaderboard-fitting) رایج شده است. طبق مستندات MOSS-Transcribe-preview-2B، این مدل با استفاده از یادگیری تقویتی (Reinforcement Learning) روی داده‌های آموزشی خودِ جدول Open ASR تنظیم شده است؛ این یعنی امتیاز به‌دست‌آمده بیشتر اندازه‌گیریِ بنچمارک است تا توانایی واقعی مدل.

داده‌های شرکت Appen این پیچیدگی را بیشتر می‌کند. Appen مجموعه‌های ارزیابی محرمانه‌ای را فراهم کرد که لهجه‌های استرالیایی، کانادایی، هندی و آمریکایی را در هر دو شرایط «متن‌خوانده» و «محاوره‌ای» پوشش می‌داد. وقتی این مجموعه‌های خصوصی فعال می‌شوند، مدل zoom/scribe_v1 از رتبه چهارم به رتبه اول صعود می‌کند، در حالی که پیشتاز جدول عمومی سقوط می‌کند. مدل‌هایی که برای گفتار پاک و خوانده‌شده تنظیم شده‌اند، در مواجهه با صوت‌های محاوره‌ای و خودجوش به شدت افت می‌کنند. این تضاد میان بنچمارک‌های آزمایشگاهی و محیط‌های واقعی، یادآور چالش‌های محیط‌های Far-field است که در آن نرخ خطای مدل‌ها در شرایط نویز زیاد به شدت افزایش می‌یابد. بنابراین، از جدول رده‌بندی برای ساخت یک لیست کوتاه استفاده کنید، نه برای انتخاب برنده نهایی.

لایه‌ی صحت و پایداری

برای کسانی که به دنبال پایداری در تولید (Production-ready) هستند، Cohere Transcribe (لایسنس Apache 2.0، پشتیبانی از ۱۴ زبان) با بیش از ۶۲۰ هزار دانلود در ماه گذشته، به یک نیروی مسلط تبدیل شده است. این مدل از یک رمزگذار Conformer با یک رمزگشای Transformer سبک استفاده می‌کند که از ابتدا آموزش دیده است. Cohere پشتیبانی اجرای گسترده‌ای را در transformers، vLLM، mlx-audio برای اپل سیلیکون، یک پورت Rust و یک بیلد WebGPU ایجاد کرده است.

شرکت Cohere ارزیابی‌های ترجیح انسانی را اجرا کرد که در آن ارزیابان آموزش‌دیده، متن‌ها را از نظر موجودات نام‌دار (Named Entities)، توهمات (Hallucinations) و حفظ معنا امتیاز دادند. این مدل به نرخ پیروزی میانگین ۶۱٪ دست یافت، که شامل ۷۸٪ پیروزی در برابر IBM Granite 4.0 1B Speech و ۶۴٪ در برابر Whisper large-v3 بود. با این حال، این مدل فاقد تشخیص خودکار زبان، برچسب‌های زمانی (Timestamps) و تفکیک گوینده (Diarization) است. به دلیل اینکه مدل تمایل دارد سکوت‌ها را هم ترنسکریب کند، Cohere توصیه می‌کند که قبل از آن یک VAD یا Noise Gate قرار دهید. توجه داشته باشید که اگرچه لایسنس آن Apache 2.0 است، اما مخزن کد همچنان پشت یک توافق‌نامه اطلاعات تماس (Gated) قرار دارد.

مدل IBM Granite Speech 4.1 2B (Apache 2.0) برای کسانی که «قابلیت» را به «امتیاز خام» ترجیح می‌دهند، انتخاب بهتری است. این مدل از ۶ زبان برای ASR علاوه بر ترجمه گفتار دوطرفه پشتیبانی می‌کند و شامل قابلیت Keyword-list biasing برای نام‌ها و اصطلاحات تخصصی است. این مدل علائم نگارشی و Truecasing (به ویژه حروف بزرگ اسامی در زبان آلمانی) را مدیریت می‌کند. این مدل روی ۱۷۴ هزار ساعت صوت آموزش دیده و به RTFx (ضریب زمان واقعی) ۲۳۱.۲۹ می‌رسد. IBM همچنین دو مدل خواهر عرضه کرده است: نسخه «-plus» که برچسب‌های زمانی در سطح کلمه و ASR با attributing گوینده را اضافه می‌کند، و نسخه «-nar» برای سرعت بیشتر.

سایر رقبای سطح بالای دقت عبارتند از:

  • Canary-Qwen-2.5B (لایسنس CC-BY-4.0، انگلیسی): این مدل یک رمزگذار FastConformer را با رمزگشای Qwen3-1.7B جفت می‌کند. دارای دو حالت است: ترنسکریب خالص و حالت LLM برای خلاصه‌سازی یا پاسخ به سوالات درباره صوت. این مدل WER ۵.۶۳٪ را در RTFx ۴۱۸ ثبت کرده است. چون داده‌های AMI به طور بیش‌نمونه‌برداری (حدود ۱۵٪ داده‌های آموزشی) وارد شده‌اند، این مدل متن‌های دقیقی شامل «ناپیوستگی‌های گفتاری» (Disfluency) تولید می‌کند؛ ویژگی‌ای که برای کارهای حقوقی مفید است اما برای یادداشت‌های جلسات آزاردهنده است.
  • Qwen3-ASR-1.7B (Apache 2.0): انتخاب اصلی برای ماندارین و گفتار منطقه‌ای چین. این مدل ۵۲ زبان و گویش را پوشش می‌دهد (۳۰ زبان به‌علاوه ۲۲ گویش چینی) با WER ۵.۷۶٪. این مدل با یک ابزار کامل استنتاج و یک مدل جداگانه برای تراز اجباری (Forced-alignment) جهت ایجاد برچسب‌های زمانی در ۱۱ زبان عرضه می‌شود.

توان عملیاتی و بهره‌وری

در حالی که دقت مدل‌ها تنها در حد یک نقطه تفاوت دارد، توان عملیاتی (Throughput) بیش از یک مرتبه بزرگی (Order of magnitude) تفاوت می‌کند. در بسیاری از موارد، توان عملیاتی است که مبلغ فاکتور نهایی را تعیین می‌کند.

مدل Parakeet TDT 0.6B v3 (CC-BY-4.0) با RTFx خیره‌کننده ۳۳۳۲.۷۴ در ۲۵ زبان اروپایی، در میدان مدل‌های چندزبانه پیشتاز است. این مدل می‌تواند تا ۲۴ دقیقه صوت را در یک پاس روی یک کارت A100 80GB پردازش کند. این مدل مقدار کمی از دقت (۶.۳۲٪ WER) را فدا می‌کند تا تقریباً ۱۴ برابر بیشتر از Granite 4.1 2B، صوت را در هر ثانیه GPU پردازش کند.

مدل IBM's Granite Speech 4.1 2B-NAR نتیجه یک مهندسی غیرخودبازگشتی (Non-autoregressive) است. این مدل یک فرضیه CTC را در یک پاس پیشرو با استفاده از یک LLM دوطرفه ویرایش می‌کند و به RTFx حدود ۱۸۲۰ روی یک H100 با Batch size 128 می‌رسد. برای دستیابی به این سرعت، پشتیبانی از زبان ژاپنی، ترجمه گفتار و Keyword biasing را کنار گذاشته است.

مدل Qwen3-ASR-0.6B تمامی ۵۲ زبان برادر بزرگتر خود را حفظ کرده و در عین حال به توان عملیاتی ۲۰۰۰ برابری در Concurrency 128 می‌رسد.

استریم و پوشش زبانی

برای عامل‌های صوتی (Voice Agents)، تأخیر در ترنسکریب و مدیریت نوبت‌های گفتگو (Turn-taking) معیارهای حیاتی هستند. WER دسته‌ای (Batch) اغلب یک تست بی‌ربط برای این مدل‌هاست. مدل‌های Voxtral Realtime (۷.۶۸٪) و Kyutai STT 2.6B (۶.۴۰٪) هر دو نمراتی پایین‌تر از Whisper دارند، اما این اعداد بازتاب‌دهنده کاربرد مورد نظر آن‌ها نیستند.

مدل Voxtral Mini 4B Realtime 2602 (Apache 2.0، ۱۳ زبان) شامل یک مدل زبانی ۳.۴ میلیارد پارامتری و یک رمزگذار صوتی علی (Causal) ۹۷۰ میلیون پارامتری است. هر دو از «توجه با پنجره لغزان» (Sliding-window attention) برای استریمینگ عملاً نامحدود استفاده می‌کنند. تأخیر ترنسکریب در گام‌های ۸۰ میلی‌ثانیه‌ای از ۸۰ تا ۱۲۰۰ میلی‌ثانیه قابل تنظیم است و یک گزینه مجزای ۲۴۰۰ میلی‌ثانیه‌ای نیز دارد. Mistral مقدار ۴۸۰ میلی‌ثانیه را به عنوان نقطه بهینه توصیه می‌کند و ادعا می‌کند که با مدل‌های باز آفلاین پیشرو برابری می‌کند. این مدل روی یک GPU ۱۶ گیگابایتی اجرا شده و از روز اول از vLLM Realtime API پشتیبانی می‌کند.

مدل Kyutai STT (CC-BY-4.0) در دو نسخه عرضه شده است:

  • یک مدل حدود ۱ میلیارد پارامتری انگلیسی/فرانسوی با تأخیر ۰.۵ ثانیه و یک تشخیص‌دهنده فعالیت صوتی (VAD) معنایی داخلی.
  • یک مدل ۲.۶ میلیارد پارامتری فقط انگلیسی با تأخیر ۲.۵ ثانیه.

برای عامل‌ها، VAD معنایی از میزان تأخیر مهم‌تر است، زیرا پیش‌بینی می‌کند چه زمانی گوینده واقعاً صحبتش را تمام کرده است. یک H100 می‌تواند ۴۰۰ استریم همزمان را در زمان واقعی سرو کند.

در نهایت، در طیف افراطی پوشش زبانی، Omnilingual ASR متا (Apache 2.0، کورپوس CC-BY) به جای WER روی وسعت تمرکز کرده است. این مدل بیش از ۱۶۰۰ زبان را به‌طور بومی پوشش می‌دهد و از طریق یادگیری در بستر (Zero-shot in-context learning) این عدد را به بیش از ۵۴۰۰ زبان می‌رساند. این مدل بر پایه یک رمزگذار wav2vec 2.0 مقیاس‌بندی شده به ۷ میلیارد پارامتر ساخته شده و روی حدود ۴.۳ میلیون ساعت صوت پیش‌آموزش دیده است. مدل ۷ میلیاردی LLM-ASR آن به نرخ خطای نویسه (CER) زیر ۱۰٪ در ۷۸٪ از زبان‌های پشتیبانی شده دست می‌یابد، از جمله بیش از ۵۰۰ زبانی که هرگز توسط هیچ سیستم ASR دیگری پشتیبانی نمی‌شدند. اندازه رمزگذارها از ۳۰۰ میلیون تا ۷ میلیارد متغیر است. متا همچنین Omnilingual ASR Corpus را منتشر کرد که بیش از ۳۵۰ زبان کمتر دیده شده را پوشش می‌دهد.

مدل Whisper large-v3 (۱.۵۵ میلیارد پارامتر، لایسنس MIT، ۹۹ زبان) در دقت توسط حدود ۱۰ مدل باز شکست خورده است، اما همچنان یک انتخاب پیش‌فرض است. لایسنس MIT بازترین لایسنس ممکن است و اکوسیستم آن - شامل whisper.cpp، faster-whisper و WhisperX - بی‌رقیب است. اگر نیاز شما این است که «هر زبانی باشد، روی هر سخت‌افزاری اجرا شود و نیازی به وکیل لایسنس نباشد»، Whisper همچنان پاسخ است.

لبه پژوهشی و لایسنس‌ها

شرکت Interfaze یک مدل با معماری خلاقانه به نام diffusion-gemma-asr-small معرفی کرد. این مدل ترنسکریب‌ها را از طریق «پالایش نویز انتشاری موازی» (Parallel diffusion denoising) روی یک بوم ۲۵۶ توکنی در ۸ تا ۱۶ گام تولید می‌کند؛ به این معنی که هزینه رمزگشایی با طول متن افزایش نمی‌یابد. تنها حدود ۴۲ میلیون پارامتر (۰.۱۶٪ وزن‌ها) روی یک DiffusionGemma ۲۶ میلیاردی منجمد و یک رمزگذار whisper-small منجمد آموزش دیده‌اند. این مدل به WER ۶.۶٪ روی LibriSpeech test-clean با سرعت ۱۱ تا ۱۷ برابر زمان واقعی می‌رسد، اما روی FLEURS انگلیسی به ۱۵.۷٪ و روی FLEURS ماندارین به ۲۹.۶٪ CER سقوط می‌کند. اگرچه برای استقرار عملی مناسب نیست، اما برای پژوهشگران ASR متنی ضروری است.

برای کسانی که به برچسب‌های یکپارچه گوینده نیاز دارند، MOSS-Transcribe-Diarize 0.9B (Apache 2.0، ۵۰+ زبان) یک مشکل بزرگ را حل می‌کند. این مدل برچسب گوینده، زمان‌بندی کلمات و متن را در یک تولید (Generation) واحد ارسال می‌کند و نیاز به یک پشته جداگانه برای Diarization را از بین می‌برد. این مدل دارای کانتکست ۱۲۸ هزار توکنی است، تقریباً ۹۰ دقیقه صوت را در یک پاس مدیریت می‌کند و به RTF حدود ۰.۰۱۷ روی یک RTX 4090 با Hotword biasing می‌رسد.

لایسنس همچنان مانع نهایی برای عرضه محصول است و میدان به سه اردوگاه تقسیم می‌شود:

  • Apache 2.0: شامل Cohere Transcribe، تمام نسخه‌های Granite Speech 4.1، Qwen3-ASR، Voxtral Mini Realtime، مدل‌های Omnilingual ASR، ARK-ASR و MOSS-Transcribe. این لایسنس اجازه استفاده تجاری بدون محدودیت و بدون الزام به ذکر منبع را می‌دهد (هرچند Cohere توافق‌نامه تماس می‌خواهد).
  • MIT: مدل Whisper large-v3. بازترین گزینه ممکن.
  • CC-BY-4.0: شامل Canary-Qwen-2.5B، Parakeet TDT 0.6B v3 و Kyutai STT. این‌ها تجاری هستند اما نیاز به ذکر منبع (Attribution) دارند. برای APIهای White-label یا محصولات جاسازی شده، این یک الزام واقعی برای تطبیق حقوقی است و اغلب دلیل انتخاب یک مدل با دقت کمتر توسط تیم‌هاست.

تحلیل: گذار از پژوهش به تدارکات

این چشم‌انداز ثابت می‌کند که ASR برای اکثر کاربردهای زبان انگلیسی به یک سطح «به اندازه کافی خوب» رسیده است. رقابت از آزمایشگاه‌های پژوهشی به ترازنامه‌های مالی منتقل شده است. در سال ۲۰۲۶، مدل برنده آن نیست که دقیق‌ترین باشد، بلکه مدلی است که با بودجه GPU و محدودیت‌های حقوقی شرکت سازگار باشد.

برای متخصصان فنی، نکته کلیدی این است که رتبه‌بندی‌های جدول اکنون ابزاری برای «کوتاه کردن لیست» هستند، نه راهنمایی برای «انتخاب نهایی». شکاف بین بنچمارک‌های خوانده‌شده‌ی پاک و صوت‌های نویزی و لهجه‌دار در دنیای واقعی، اکنون منبع اصلی شکست در استقرار مدل‌هاست.

اگر در حال ساخت یک سیستم عملیاتی هستید، لایسنس و توان عملیاتی را بر WER ترجیح دهید. مدلی که ۰.۵٪ دقیق‌تر است اما ۱۰ برابر کندتر عمل می‌کند، احتمالاً باعث شکست شما در معیارهای تأخیر (Latency) شده و هزینه‌های استنتاج شما را به شدت افزایش می‌دهد.

برای انتخاب مدل مناسب، این ترتیب را دنبال کنید:
۱. لایسنس: اگر ذکر منبع یک مانع است، مدل‌های CC-BY-4.0 را حذف کنید.
۲. پوشش زبانی: بر اساس محدودیت‌های سخت فیلتر کنید (مثلاً ۱۴ زبان Cohere در مقابل ۵۲ زبان Qwen). به یاد داشته باشید که Cohere تشخیص خودکار زبان ندارد.
۳. معماری: تعیین کنید که به استریمینگ نیاز دارید یا Batch. رمزگذارهای آفلاین را نمی‌توان به مدل‌های استریمینگ با تأخیر کم تبدیل کرد.
۴. WER دامنه: مدل را روی صوت‌های نویزی و لهجه‌دار خودتان تست کنید؛ رتبه احتمالاً با جدول عمومی متفاوت خواهد بود.
۵. هزینه: هزینه هر ساعت صوت را روی GPUهای خودتان محاسبه کنید، زیرا اعداد RTFx سخت‌افزارهای دیتاسنتر مستقیماً منتقل نمی‌شوند.

خلاصه مفید سال ۲۰۲۶ این نیست که یک مدل خاص پیروز شد. بلکه این است که یک مدل ۲ میلیارد پارامتری با لایسنس باز، اکنون عملکردی بهتر از APIهای بسته‌ای دارد که ۱۸ ماه پیش برای آن‌ها هزینه پرداخت می‌شد. تصمیم باقی‌مانده، یک پرسش تدارکاتی است نه یک پرسش پژوهشی.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این وضعیت باعث می‌شود توسعه‌دهندگان از تکیه بر بنچمارک‌های عمومی دست بکشند و به سمت ارزیابی‌های دامنه-محور (Domain-specific) بروند. اعتبار مدل‌ها دیگر با نمره WER، بلکه با معیارهایی مثل RTFx و هزینه هر ساعت پردازش سنجیده می‌شود.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که با محدودیت منابع GPU مواجه‌اند، مدل‌های کوچک و بهینه like Parakeet TDT که توان عملیاتی بسیار بالایی دارند، گزینه‌های ایده‌آلی برای استقرار محلی هستند.

·نگاه ما
تحریریه دات‌هوش

اشباعِ دقت در مدل‌های ASR نشان می‌دهد که ما به یک «سقف کاربردی» رسیده‌ایم. اکنون رقابت از لایه‌ی ریاضی و پژوهشی به لایه‌ی تدارکاتی و مالی منتقل شده است؛ یعنی برنده کسی است که هزینه استنتاج را برای هر ساعت صوت به حداقل برساند، نه کسی که ۰.۱٪ دقت بیشتری دارد. این یک الگوی تکرارشونده در مدل‌های تخصصی است: ابتدا دقت به دست می‌آید، سپس بهینه‌سازی هزینه، و در نهایت لایسنس تعیین‌کننده است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.