تصور کنید بتوانید قدرت یک ابرکامپیوتر را در ابعاد یک لپتاپ شخصی داشته باشید؛ این دقیقاً همان اتفاقی است که در دنیای مدلهای زبانی رخ داده است. مدل Darwin-36B-Opus با وجود اندازه کوچکتر، توانست در یکی از دشوارترین آزمونهای استدلال هوش مصنوعی، با غولهای ۳۹۷ میلیاردی برابری کند. این مدل تنها ۳۶ میلیارد پارامتر دارد اما در برابر مدلهای بسیار عظیمتر ایستادگی کرده است.
به نقل از گزارش dev.to در ۲۳ اوت ۲۰۲۶، این مدل که توسط FINAL-Bench / VIDRAFT_LAB منتشر شده، توانست به امتیاز ۸۸.۴٪ در محک GPQA Diamond دست یابد. در حالی که مدلهای پیشرو معمولاً برای رسیدن به این سطح از استدلال، به هفتهها آموزش در خوشههای عظیم GPU (واحد پردازش گرافیکی) و ترابایتها داده نیاز دارند، این مدل مسیر متفاوتی را طی کرده است. این رویکرد در تضاد با استراتژیهای برخی شرکتهاست که همچنان بر افزایش مقیاس تکیه میکنند؛ برای مثال بایتدنس اخیراً برای رقابت با آنتروپیک، آموزش مدلی با ۱۰ تریلیون پارامتر را آغاز کرده است.
برای مهندسان، هزینه استقرار یک مدل ۳۹۷ میلیاردی اغلب کمرشکن و بازدارنده است. اما Darwin-36B-Opus با فعال کردن تنها ۳ میلیارد پارامتر به ازای هر توکن (Token) — تکههای کوچکی از متن، شبیه برشهای یک کیک طولانی که مدل تکهتکه میخورد — استدلال در سطح مدلهای پیشرو را روی سختافزارهای معمولی ممکن کرده است.
ریشه و پیشینه مدل
این مدل یک تنظیم دقیق (Fine-tuning) — مثل وقتی به یک پزشک عمومی، تخصص پوست میدهیم تا روی یک حوزه دقیق شود — سنتی نیست. بلکه حاصل «جفتگیری» دو مدل والد بر پایه معماری Qwen3 MoE (ترکیب خبرهها) است. یکی از والدین، مدل پایه Qwen3-35B MoE با توجه ترکیبی و ۲۵۶ خبره مسیریابی شده است. والد دیگر، یک نسخه استدلالمحور است که از طریق distillation (تقطیر) روی ردپاهای زنجیره تفکر (Chain-of-Thought) — شبیه وقتی شاگرد ریاضی پای تخته بلند بلند فکر میکند تا به جواب برسد — مدل Claude Opus 4.6 آموزش دیده است. این مدل از تبار خانواده Opus میآید که تحلیلهای دقیقی درباره تاریخ قطع دانش و متدولوژی استخراج دادههای آن منتشر شده است.
این تبار به مدل اجازه میدهد تا نقاط قوت مکمل هر دو والد را به ارث ببرد. این مدل استدلالهای طولانی زنجیره تفکر را از تبار تقطیرشده و دقت مسیریابی خبرهها را از مدل پایه میگیرد. در واقع، این رویکرد با وزنهای پیشآموزشدیده باکیفیت به عنوان یک کتابخانه ژنتیکی برخورد میکند تا بدون پرداخت هزینههای کلان آموزش کامل، ترکیبهای ممکن را کاوش کند.
برای ساخت این مدل، از موتور تکاملی Darwin V7 استفاده شده است. این سامانه با انجام فرآیند «breeding» یا پرورش مدل، نواحی خاصی از وزنها (Weights) را در مدلهای والد شناسایی و بازترکیب میکند. این مکانیسم باعث میشود رفتارهای استدلالی مدل «مادر» (نسخه تقطیر شده) حفظ شود و در عین حال، دقت ساختاری مدل «پدر» (نسخه پایه) باقی بماند.
سازوکار تکاملی
بر اساس مستندات منتشر شده، Darwin V7 برخلاف روشهای رایج توسعه، از گرادیان کاهشی (Gradient Descent) روی دادههای جدید استفاده نمیکند. این یعنی مدل نیازی به سرمایههای کلان و هفتهها آموزش در خوشههای GPU ندارد. این فرآیند دقیقاً شبیه به تقاطع ژنتیکی (Genetic Crossover) در تکامل بیولوژیک است که مستقیماً روی تانسورهای وزن در شبکه عصبی (Neural Network) — شبکهای از سلولهای کوچک، شبیه نقشهٔ مترو، که سیگنال را از ورودی به جواب میرساند — اعمال میشود. در همین راستا، تلاشهایی برای بهینهسازی معماریهای MoE صورت گرفته است، مانند کتابخانه Mixture-of-Kittens که توانست تأخیر آموزش این مدلها را ۵.۸ برابر کاهش دهد.
به دلیل اینکه این موتور به جای پسانتشار (Backpropagation) از بازترکیب وزنها استفاده میکند، کل این فرآیند روی یک تک GPU در کمتر از یک ساعت به پایان میرسد. این یک تضاد شدید با دورههای آموزشی چند هفتهای است. البته باید یادآور شد که مدل والدِ تقطیرشده، پیشتر از طریق روشهای تقطیر دانش آموزش دیده بود و بنابراین آموزشهای قبلی در تبار مدل نهفته است.
مشخصات فنی
- کل پارامترها: ۳۶ میلیارد
- پارامترهای فعال: ۳ میلیارد (۸ خبره فعال از ۲۵۶ خبره مسیریابی شده)
- پنجره زمینه (Context Window): ۲۶۲,۱۴۴ توکن — میزان متنی که مدل همزمان در ذهن نگه میدارد، شبیه میز کاری که جا برای چند ورق دارد.
- دقت: BF16
- مجوز: Apache 2.0 (مجاز برای استفاده تجاری)
- زبانهای پشتیبانی شده: انگلیسی، چینی، کرهای، ژاپنی، آلمانی، فرانسوی، اسپانیایی، روسی و عربی
تحلیل عملکرد
کارایی این روش خیرهکننده است. با تبدیل وزنهای پیشآموزشدیده به یک کتابخانه ژنتیکی، توسعهدهندگان میتوانند قابلیتهای تخصصی — مانند استدلالهای طولانی زنجیره تفکر — را در بستههای کوچکتر و قابل استقرار سنتز کنند.
در محک GPQA Diamond که یک آزمون سختگیرانه شامل ۱۹۸ پرسش در سطح تحصیلات تکمیلی فیزیک، شیمی و زیستشناسی است، Darwin-36B-Opus در حال حاضر رتبه سوم کلی را در اختیار دارد. این مدل با امتیاز ۸۸.۴٪ با Qwen3.5-397B-A17B برابری کرده و حتی از مدل GLM-5.1 با ۷۴۴ میلیارد پارامتر (امتیاز زیر ۸۶.۶٪) پیشی گرفته است.
سایر مقایسههای قابل توجه عبارتند از:
- TNSA/NGen-4-Pro: ۹۱.۱٪
- TNSA/NGen-4: ۹۰.۱٪
- Kimi-K2.5: ۸۷.۶٪
- Darwin-27B-Opus: ۸۶.۹٪
- Qwen3.5-122B-A10B: ۸۶.۶٪
این تغییر پارادایم نشان میدهد که مسیر رسیدن به هوش سطح پیشرو، لزوماً از طریق دادههای بیشتر یا محاسبات سنگینتر نمیگذرد. مدل Darwin-36B-Opus در حالی به این نتایج رسیده که از نظر تعداد پارامتر، تقریباً ۱۱ برابر کوچکتر از مدل ۳۹۷ میلیاردی است که با آن برابری میکند.
برای کاربر نهایی، این یعنی استدلالهای علمی سطح بالا در فیزیک، شیمی و زیستشناسی دیگر نیازی به مزرعههای عظیم سرور ندارد. همچنین مجوز Apache 2.0 به شرکتها اجازه میدهد تا این قابلیتها را بدون محدودیتهای حق امتیاز (Royalty)، در محصولات تجاری خود ادغام کنند.
گام بعدی شما
- اگر توسعهدهنده هستید، مدل را از طریق Hugging Face CLI با استفاده از شناسه مخزن موجود در کارت رسمی مدل دریافت کنید. برای نصب ابزار، ابتدا دستور
pip install huggingface_hubو سپسhuggingface-cli download <model-id-from-hf-page>را اجرا کنید. - عملکرد مدل را در حوزههای تخصصی STEM با مدلهای بزرگتر مقایسه کنید تا حد از خطای استدلال در مدلهای کوچکتر آگاه شوید.
- بررسی کنید که آیا موتور Darwin V7 میتواند مدلهایی از خانوادههای معماری مختلف را با موفقیت ادغام کند یا خیر، زیرا در حال حاضر به والدین سازگار نیاز دارد.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو