پرش به محتوای اصلی
پرش به محتوای مقاله

مدل‌های Granite 4.2 آی‌بی‌ام با یادگیری تقویتی مرحله‌بندی‌شده استدلال می‌کنند

·۳ شهریور ۱۴۰۵۲۵ دقیقه مطالعه۲ بازدید
ساختار مدل‌های زبانی بزرگ Granite 4.2: معماری و روش آموزش
ساختار مدل‌های زبانی بزرگ Granite 4.2: معماری و روش آموزش
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

استفاده از یادگیری تقویتی مرحله‌بندی‌شده (Staged RL) که در آن مدل ابتدا استدلال‌های ریاضی و کد را یاد می‌گیرد و سپس به محیط‌های عامل‌محور واقعی (مانند ترمینال لینوکس) منتقل می‌شود، به جای آموزش یکپارچه.

اگر به دنبال جایگزینی برای مدل‌های استدلالی بسته هستید که بدون ریسک حریم خصوصی روی سخت‌افزار محلی اجرا شوند، خانواده Granite 4.2 دقیقاً برای همین هدف طراحی شده است. این مدل‌ها برخلاف اکثر مدل‌های زبانی که فقط دستورات را اجرا می‌کنند، بر روی «تفکر تأملی» متمرکز شده‌اند تا پاسخ‌هایشان صریح و قابل راستی‌آزمایی باشد.

طبق اعلام IBM در ۲۵ اوت ۲۰۲۶، این مدل‌ها به کاربران اجازه می‌دهند بین حالت‌های «متفکر» و «غیرمتفکر» سوئیچ کنند تا تعادلی میان سرعت استنتاج و عمق استدلال برقرار شود. هر مدل در این خانواده می‌تواند پیش از ارائه پاسخ نهایی، یک زنجیره تفکر (Chain-of-Thought) — شبیه وقتی شاگرد ریاضی پای تخته بلند بلند فکر می‌کند تا به جواب برسد — تولید کند. همچنین یک حالت «کم‌تلاش» (low-effort) برای پاسخ به سؤالات ساده پیش‌بینی شده تا بودجه محاسباتی کوتاهی صرف شود و منابع بیهوده مصرف نشود. این رویکرد بهینه‌سازی هزینه‌ها یادآور مدل‌های جدیدی است که تلاش می‌کنند هزینه استنتاج را از ساختار سنتی تعداد توکن‌ها جدا کنند تا بهره‌وری اقتصادی مدل‌ها افزایش یابد.

این عرضه در زمانی رخ می‌دهد که صنعت از رابط‌های چت ساده به سمت عامل‌های خودمختار (Autonomous Agents) حرکت می‌کند. همان‌طور که در تحلیل قبلی ما درباره‌ی گردش‌کارهای ترکیبی مدل‌های محلی و APIهای ابری اشاره کردیم، IBM مدل Granite 4.2 را به عنوان ستون فقرات آماده برای استقرار استک‌های عامل‌محور محلی معرفی می‌کند. این مدل‌ها تحت لایسنس Apache 2.0 منتشر شده‌اند و هدف آن‌ها توسعه‌دهندگانی هستند که به قابلیت‌های استدلالی بالا نیاز دارند اما نمی‌خواهند ریسک‌های حریم خصوصی APIهای بسته را بپذیرند. این مدل‌ها از طریق نقاط انتهایی سازگار با OpenAI (مانند vLLM) و همچنین SGLang قابل سرویس‌دهی هستند.

معماری و بنیاد پیش‌آموزش

خانواده Granite 4.2 شامل سه مدل ترنسفورمر (Transformer) متراکم و فقط-رمزگشا (decoder-only) در اندازه‌های ۳، ۸ و ۳۰ میلیارد پارامتر است. هر سه مدل از یک طراحی هسته‌ای مشترک بهره می‌برند که شامل مکانیزم توجه پرس‌وجوی گروهی (GQA) با ۴۰ سر توجه و ۸ سر KV است. همچنین از رمزگذاری موقعیت دورانی (RoPE) با مقدار $\theta = 10,000,000$ استفاده می‌کنند. در لایه‌های MLP از فعال‌ساز SwiGLU و نرمال‌سازی RMSNorm با $\epsilon = 1e-5$ بهره گرفته‌اند. نکته مهم این است که جاسازی‌های (embeddings) ورودی و خروجی در این مدل‌ها مجزا هستند (tied نیستند) و با دقت bfloat16 ارائه شده‌اند.

مشخصات فنی دقیق مدل‌ها به شرح زیر است:

  • مدل 3B Dense: دارای ۴۰ لایه، اندازه بردار معنایی ۲۵۶۰، اندازه پنهان MLP ۸۱۹۲، ۴۰ سر توجه و اندازه هر سر ۶۴.
  • مدل 8B Dense: دارای ۴۰ لایه، اندازه بردار معنایی ۴۰۹۶، اندازه پنهان MLP ۱۲۸۰۰، ۳۲ سر توجه و اندازه هر سر ۱۲۸.
  • مدل 30B Dense: دارای ۶۴ لایه، اندازه بردار معنایی ۴۰۹۶، اندازه پنهان MLP ۳۲۷۶۸، ۳۲ سر توجه و اندازه هر سر ۱۲۸.

بر اساس مستندات فنی، پیش‌آموزش این مدل‌ها یک عملیات عظیم بود که حدود ۱۵ تریلیون توکن (Token) را در بر می‌گرفت. آی‌بی‌ام از یک استراتژی پنج‌مرحله‌ای برای ساخت مدل‌های پایه استفاده کرد. دو فاز اول بر ایجاد دانش بنیادی متمرکز بود، در حالی که فازهای سوم و چهارم بر «میانی-آموزش» (mid-training) با استفاده از داده‌های پالایش‌شده با کیفیت بالاتر متمرکز شدند. در مرحله نهایی، آموزش با متن‌های طولانی (long-context training) معرفی شد که پنجره متنی (Context Window) — میزان متنی که مدل هم‌زمان در ذهن نگه می‌دارد — را به مقدار عظیم ۵۱۲ هزار توکن افزایش داد. هر فاز از یک ترکیب داده‌ای مجزا و برنامه نرخ یادگیری (learning-rate schedule) خاص استفاده کرد که به تدریج از داده‌های گسترده وب به سمت منابع منتخب و تخصصی تغییر یافت.

تنظیم نظارت‌شده (SFT) و کنترل کیفیت

برای تبدیل مدل‌های پایه به دستیاران هوشمند، آی‌بی‌ام از تنظیم نظارت‌شده (SFT) — شبیه وقتی به یک پزشک عمومی تخصص پوست می‌دهیم تا روی یک حوزه دقیق شود — با ۷.۲ میلیون نمونه (حدود ۱۰۰ میلیارد توکن) استفاده کرد که از این مقدار، حدود ۶۵ میلیارد توکن قابل آموزش بودند. توزیع داده‌ها به دو بخش تقسیم شد:

۱. داده‌های عامل‌محور (۳۱.۶٪): این مجموعه عمدتاً توسط مهندسی نرم‌افزار (۶۹٪) تسلط یافته بود و پس از آن فراخوانی ابزار (۱۲.۱٪)، استفاده از ترمینال (۸.۰٪)، ریاضیات (۳.۵٪)، جست‌وجو (۰.۸٪) و اکشن (۰.۲٪) قرار داشتند. این داده‌ها با استفاده از چارچوب‌هایی مانند OpenHands, OpenCode, Terminus-2, SWE-agent, OpenResearcher, MiniSWE, OpenSeeker, EnvScaler, Gemini CLI, Hermes, Codex و Goose تولید شده بودند. در این راستا، رقابت میان مدل‌های بزرگ و کوچک برای تسلط بر این حوزه شدت یافته است، به‌طوری که برخی مدل‌های بسیار کوچک حتی در فراخوانی ابزارها از مدل‌های بزرگ‌تر پیشی گرفته‌اند.

۲. داده‌های غیرعامل‌محور (۶۸.۴٪): شامل پیروی از دستورات (۱۸.۸٪)، کدنویسی (۱۸.۸٪)، ریاضیات (۱۴.۶٪)، چندزبانه (۷.۰٪)، علوم (۵.۴٪)، استدلال (۳.۰٪) و ایمنی (۰.۸٪) بود.

برای کنترل کیفیت، آی‌بی‌ام ابتدا داده‌ها را به فرمت استاندارد OpenAI Chat تبدیل کرد. سپس از مدل‌های Gemma 4 و GPT-OSS-120B به عنوان داور (LLM judges) استفاده کرد تا توهم (Hallucination) — وقتی مدل با اطمینان چیزی می‌گوید که وجود ندارد —، اطلاعات ساختگی و فراخوانی‌های نامعتبر ابزارها را حذف کند. همچنین برای اطمینان از اینکه مجموعه آموزشی فشرده و با سیگنال بالا باقی بماند، از حذف داده‌های تکراری (deduplication) مبتنی بر هش SHA-256 روی ترکیب فیلدهای ابزارها و پیام‌ها استفاده کردند.

آموزش SFT روی ۳۲ تا ۱۲۸ نود (بسته به اندازه مدل) با ۴ عدد Grace/GB200 در هر نود انجام شد. پیکربندی شامل طول توالی بسته‌بندی شده ۱۳۱,۰۷۲ (128K)، اندازه دسته جهانی (global batch size) ۱۲۸ و نرخ یادگیری 1.0e-5 (ثابت پس از گرم‌شدن ۲.۵٪) بود. موازی‌سازی با TP=2، PP=1 و CP=4 یا CP=2 تنظیم شده بود.

برای مدل 30B، آی‌بی‌ام یک فاز SFT دوم را اضافه کرد. این فاز به‌طور خاص داده‌های عامل‌محور، SWE و کدنویسی را افزایش داد (upsampled) تا توانایی مدل در مدیریت مخازن پیچیده نرم‌افزاری تقویت شود. حدود ۱۶٪ از ترکیب داده‌ها به عنوان داده‌های بازپخش (replay data) از مجموعه SFT اصلی حفظ شد و مدل برای حدود یک اپوک اضافی با نرخ یادگیری پایین‌تر 3.0e-6 تنظیم شد.

خط لوله یادگیری تقویتی (RL) مرحله‌بندی‌شده

قلب تپنده Granite 4.2، برنامه آموزشی یادگیری تقویتی است. آی‌بی‌ام به جای یک مرحله بزرگ، از زنجیره‌ای از مراحل متمرکز استفاده کرد که هر کدام از نقطه بازرسی (checkpoint) قبلی شروع می‌شدند.

ساختار مدل‌های زبانی بزرگ گرانیت ۴.۲: معماری و روش آموزش

همه مدل‌ها با RLVR (یادگیری تقویتی از پاداش‌های قابل تأیید) شروع کردند. در این مرحله از پاداش‌های عینی — مانند تست‌های واحد (Unit Tests) و بررسی‌کننده‌های ریاضی — استفاده شد تا استدلال بنیادی شکل بگیرد. RLVR گسترده‌ترین ترکیب داده‌ها را داشت و شامل ریاضیات (زنجیره تفکر با بررسی پاسخ‌های باکس‌شده و اثبات رسمی Lean)، کدنویسی رقابتی (تست‌های پنهان در محیط Sandbox)، سوالات چندگزینه‌ای STEM، پیروی از دستورات (خروجی‌های ساختاریافته) و پازل‌های استدلالی بود. RLVR برای مدل‌های 3B و 8B دو دور و برای مدل 30B سه دور اجرا شد.

پس از آن، «تقویت‌کننده‌های مهارت» (skill boosters) برای بهبود پیروی از دستورات (چت‌های چند-راند، inverse-IFEval، خروجی‌های ساختاریافته) و کدنویسی رقابتی اضافه شدند. این‌ها اجراهای کوچک و متمرکزی بودند که از جریمه KL سبک (۰.۰۵) استفاده می‌کردند تا مهارت‌های خاص را بدون تخریب رفتارهای موجود تقویت کنند.

برای مدل‌های 8B و 30B، یک بلوک «RL عامل‌محور» اضافه شد تا مدل‌ها در محیط‌های واقعی (Sandbox) به جای محیط‌های شبیه‌سازی شده عمل کنند.

ساختار مدل‌های زبانی بزرگ Granite 4.2: معماری و روش آموزش

این بلوک طبق توالی سخت‌گیرانه «مهندسی نرم‌افزار (SWE) $\rightarrow$ ترمینال $\rightarrow$ جست‌وجو» پیش رفت.

محیط‌های RL عامل‌محور:

  • عامل SWE: از هارنس OpenHands با مخازن واقعی در محیط‌های ایزوله استفاده می‌کند. مدل کدها را می‌خواند، فایل‌ها را ویرایش می‌کند و تست‌ها را اجرا می‌کند. پاداش به صورت باینری است: آیا تست‌های پنهان پاس شدند؟
  • عامل ترمینال: از Harbor / Terminus-2 برای تسک‌های چندمرحله‌ای در یک شل (shell) زنده استفاده می‌کند. این مرحله حلقه چند-راند را در سطح GRPO پیش می‌برد و خروجی‌ها تا ۶۴ نوبت محیطی ادامه می‌یابند.
  • عامل جست‌وجو: یک حلقه عامل مرورگر برای تحقیقات چند-گامی (multi-hop) است. چون درستی پاسخ‌ها باز است، پاداش توسط یک مدل داور (LLM judge) روی پاسخ نهایی داده می‌شود.

زیرساخت فنی و GRPO

آی‌بی‌ام از الگوریتم بهینه‌سازی سیاست نسبی گروهی (GRPO) استفاده کرد که نیاز به یک شبکه ارزش (value network) مجزا را از بین می‌برد و پاسخ‌ها را با میانگین پاداش یک گروه (یک خط مبنای leave-one-out) می‌سنجد. برای مثال، در RLVR، هر مرحله ۲۵۶ پرامپت را با ۱۶ پاسخ نمونه‌برداری شده برای یک دسته ۴,۰۹۶ نمونه‌ای جفت می‌کند.

ساختار مدل‌های زبانی بزرگ گرانیت ۴.۲: معماری و روش آموزش

این زیرساخت از طریق یک حلقه ناهمگام (asynchronous) با استفاده از NeMo-RL و NeMo-Gym پیاده‌سازی شد. کارگران تولید (generation workers) و آموزش‌دهندگان روی استخرهای GPU مجزا عمل می‌کردند تا از بیکار ماندن سخت‌افزار جلوگیری شود. برای مدیریت عدم تطابق بین آموزش‌دهنده و تولیدکننده، آی‌بی‌ام از نمونه‌برداری اهمیت کوتاه شده (truncated importance sampling) برای محدود کردن نسبت احتمال لگاریتمی استفاده کرد تا توکن‌های قدیمی بر به‌روزرسانی‌ها غلبه نکنند. کارگران از KV cache موجود خود استفاده می‌کنند و آن را دوباره نمی‌سازند، به شرطی که بیش از یک به‌روزرسانی از آموزش‌دهنده عقب نمانند.

جزئیات آموزش RL

ابرپارامترهای مشترک:

  • الگوریتم: GRPO (بدون شبکه ارزش؛ مزایای نسبی گروهی)
  • استک آموزشی: NeMo-RL (Megatron-Core + vLLM) با محیط‌های NeMo-Gym
  • Ratio Clip: 0.2 / 0.28
  • Micro-batch Size: 1
  • موازی‌سازی: Tensor-parallel 2–4؛ بدون موازی‌سازی خط لوله یا متن

تنظیمات خاص مراحل مدل 30B:

  • RLVR (x3): ۲۵۶ پرامپت/گام، ۱۶ تولید/پرامپت، حداکثر طول توالی 64K، KL 0، نرخ یادگیری 5e-7
  • IF Booster: ۲۵۶ پرامپت/گام، ۱۶ تولید/پرامپت، حداکثر طول توالی 64K، KL 0، نرخ یادگیری 5e-7
  • Code Booster: ۶۴ پرامپت/گام، ۱۶ تولید/پرامپت، حداکثر طول توالی 64K، KL 0.05، نرخ یادگیری 5e-7
  • SWE: ۱ پرامپت/گام، ۶۴ تولید/پرامپت، حداکثر طول توالی 128K، KL 0.01، نرخ یادگیری 5e-7
  • SWE 2: ۳۲ پرامپت/گام، ۱۶ تولید/پرامپت، حداکثر طول توالی 128K، ۱۲۸ نوبت rollout، KL 0، نرخ یادگیری 5e-7
  • Terminal: ۸ پرامپت/گام، ۳۲ تولید/پرامپت، حداکثر طول توالی 64K، ۶۴ نوبت rollout، KL 0.01، نرخ یادگیری 1e-6
  • Search: ۳۲ پرامپت/گام، ۱۶ تولید/پرامپت، حداکثر طول توالی 128K، ۶۴ نوبت rollout، KL 0.01، نرخ یادگیری 5e-7
  • RLHF: ۱۲۸ پرامپت/گام، ۱۶ تولید/پرامپت، حداکثر طول توالی 48K، KL 0.05، نرخ یادگیری 5e-7

تمام این استک روی یک خوشه NVIDIA GB200 NVL72 میزبانی شده توسط CoreWeave اجرا شد. سخت‌افزار یک دامنه NVLink با ۷۲ پردازنده گرافیکی و یک شبکه InfiniBand NDR 400 Gb/s Fat-Tree غیرمسدودکننده را فراهم کرد که برای همگام‌سازی هزاران GPU در طول rolloutهای عظیم RL ضروری بود. استک نرم‌افزاری در قالب تصاویر کانتینری .sqsh با استفاده از تصویر پایه NGC PyTorch (اوبونتو ۲۲.۰۴، CUDA ۱۲.۸، پایتون ۳.۱۲) بسته‌بندی شد.

عملکرد و محک‌ها

به نقل از گزارش فنی، مدل 30B در کدنویسی عامل‌محور پیشتاز است و امتیاز ۵۷.۰۰ را در SWE-Bench Verified و ۲۹.۲۴ را در Terminal-Bench کسب کرد. همچنین امتیاز ۴۱.۸۹ در SWE-Bench Multilingual و ۳۳.۲۹ در SWE-Bench Pro به دست آورد.

ساختار مدل‌های زبانی بزرگ Granite 4.2: معماری و روش آموزش

در زمینه استدلال خالص، مدل 30B در هر دو آزمون AIME25 و HMMT Feb25 به امتیاز ۸۹.۱۷ رسید که نشان‌دهنده پیروی از قوانین مقیاس‌پذیری (Scaling Laws) است؛ یعنی با افزایش اندازه مدل، توانایی استدلال به طور مستقیم بالا می‌رود. همچنین امتیاز ۶۶.۴۱ در GPQA و ۷۵.۷۷ در LiveCodeBench v6 را ثبت کرد.

ساختار مدل‌های زبانی بزرگ گرانیت ۴.۲: معماری و روش آموزش

قابلیت‌های عامل‌محور عمومی نیز در تمام مدل‌ها قوی بود. مدل 30B امتیاز ۶۸.۰۵ در $\tau^3$-bench و ۶۱.۳۹ در BFCL (v4) را به دست آورد که کارایی آن را به عنوان یک کاربر ابزار همه‌منظوره ثابت می‌کند. مدل 3B، با وجود نداشتن بلوک RL عامل‌محور، همچنان عملکرد خوبی در $\tau^3$-bench (۵۰.۹۹) و BFCL (۵۲.۴۱) داشت. سایر نتایج قابل توجه برای مدل 30B شامل ۴۲.۹۰ در ProfBench و ۱۲۲۵.۰۰ در GDPval است.

ساختار مدل‌های زبانی بزرگ Granite 4.2: معماری و روش آموزش

استقرار و کوانتش

برای دسترسی راحت‌تر، نسخه‌های کوانتش (Quantization) — یعنی کاهش دقت اعداد برای اشغال فضای کمتر در حافظه — در قالب‌های FP8، NVFP4 و MXFP4 بهینه‌شده برای vLLM منتشر شده‌اند. نسخه FP8 از وزن‌های پویا در هر کانال و فعال‌سازهای در هر توکن استفاده می‌کند. نسخه‌های FP4 با استفاده از GPTQ و کالیبراسیون روی ۲ هزار نمونه از مجموعه SFT با حداکثر طول متن ۲ هزار توکن کوانتیده شده‌اند.

برای کسانی که روی سخت‌افزارهای مصرف‌کننده اجرا می‌کنند، فرمت‌های GGUF از Q2_K تا Q8_0 از طریق llama.cpp در دسترس هستند. این شامل فرمت‌های خاصی مانند Q4_K_M، Q5_K_S و Q6_K است. توسعه‌دهندگان می‌توانند این مدل‌ها را با استفاده از کتابخانه Transformers پیاده‌سازی کنند. مدل‌ها از حالت تفکر low_effort برای سؤالات ساده پشتیبانی می‌کنند که با صرف حداقل بودجه استدلالی، در محاسبات صرفه‌جویی می‌کند.

تحلیل: تغییر به سمت عاملیت قابل راستی‌آزمایی

Granite 4.2 نشان‌دهنده تغییری در نحوه تفکر ما درباره آموزش مدل‌ها است. آی‌بی‌ام با قرار دادن پاداش‌های قابل راستی‌آزمایی (ریاضی، کد) در ابتدای مسیر و سپس حرکت به سمت پاداش‌های مبتنی بر ترجیحات (RLHF)، مدلی ساخته است که کمتر احتمال دارد یک مسیر استدلالی را «توهم» کند. مرحله نهایی RLHF یک جریمه برای طول استدلال اعمال می‌کند تا از رفتار بیش از حد پرحرف (verbose) که اغلب در طول RLVR به دست می‌آید، جلوگیری کند.

برای توسعه‌دهنده، این بدان معناست که مدل‌های 8B و 30B را می‌توان بدون نیاز به «کدهای چسب» (glue code) معمول برای رفع خطاهای فرمت‌بندی، مستقیماً در هارنس‌های عامل‌محور مانند OpenCode، Pi یا OpenHands قرار داد. پشتیبانی بومی از فراخوانی توابع سازگار با OpenAI، آن‌ها را به جایگزینی مستقیم برای مدل‌های استدلالی بسته در محیط‌های محلی تبدیل می‌کند. این مدل‌ها از طیف گسترده‌ای از زبان‌ها از جمله انگلیسی، آلمانی، اسپانیایی، فرانسوی، ژاپنی، پرتغالی، عربی، چکی، ایتالیایی، کره‌ای، هلندی و چینی پشتیبانی می‌کنند.

گام بعدی شما

  • توسعه‌دهندگان باید قابلیت‌های ترمینال مدل 30B را در یک محیط ایزوله تست کنند تا ببینند آیا می‌تواند جایگزین اسکریپت‌های دستی CLI شود.
  • برای بهینه‌سازی روی سخت‌افزارهای لبه، مجموعه Granite HF را برای دریافت وزن‌های کوانتیده جدید دنبال کنید.
  • حالت low_effort را برای تسک‌های ساده فعال کنید تا هزینه استنتاج را کاهش دهید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل‌ها با تکیه بر اعتبار معماری IBM و لایسنس باز، استدلال سطح بالا را از انحصار APIهای گران‌قیمت خارج کرده و به محیط‌های محلی می‌آورند. این تغییر، استقرار عامل‌های خودمختار در صنایع حساس که حریم خصوصی داده‌ها اولویت اول است را ممکن می‌سازد.

تأثیر برای ایران

به‌دلیل وزن‌های باز (Open Weights)، توسعه‌دهندگان ایرانی می‌توانند این مدل‌ها را بدون نیاز به API و دور زدن تحریم‌ها، روی سرورهای داخلی مستقر کنند. مدل 8B گزینه‌ای ایده‌آل برای استقرار در زیرساخت‌های با منابع محدود در ایران است.

·نگاه ما
تحریریه دات‌هوش

جایگزینی پاداش‌های ترجیحی (RLHF) با پاداش‌های قابل تأیید (مانند تست‌های کد) در مراحل ابتدایی، مدل را از «تظاهر به استدلال» به سمت «استدلال واقعی» سوق می‌دهد. این رویکرد احتمال توهم در مسیرهای منطقی را به شدت کاهش می‌دهد زیرا مدل یاد می‌گیرد که نتیجه درست، تنها راه دریافت پاداش است. در واقع آی‌بی‌ام با این کار، استدلال را از یک ویژگی احتمالی به یک فرآیند مهندسی‌شده تبدیل کرده است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.