پرش به محتوای اصلی
پرش به محتوای مقاله

Darwin-36B در برابر مدل‌های غول‌پیکر؛ پیروزی بازترکیب تکاملی بر حجم داده

·۴ شهریور ۱۴۰۵۴ دقیقه مطالعه۱ بازدید
موتور تکاملی VIDRAFT: چگونه مدل ۳۶ میلیارد پارامتری، غول‌های ۳۹۷ میلیاردی را به چالش کشید
موتور تکاملی VIDRAFT: چگونه مدل ۳۶ میلیارد پارامتری، غول‌های ۳۹۷ میلیاردی را به چالش کشید
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی آموزش مبتنی بر گرادیان با «جفت‌گیری تکاملی» وزن‌ها؛ این روش زمان تولید مدل را از چندین هفته به کمتر از یک ساعت روی یک GPU کاهش داد.

تصور کنید بتوانید قدرت یک ابرکامپیوتر را در ابعاد یک لپ‌تاپ شخصی داشته باشید؛ این دقیقاً همان اتفاقی است که در دنیای مدل‌های زبانی رخ داده است. مدل Darwin-36B-Opus با وجود اندازه کوچک‌تر، توانست در یکی از دشوارترین آزمون‌های استدلال هوش مصنوعی، با غول‌های ۳۹۷ میلیاردی برابری کند. این مدل تنها ۳۶ میلیارد پارامتر دارد اما در برابر مدل‌های بسیار عظیم‌تر ایستادگی کرده است.

به نقل از گزارش dev.to در ۲۳ اوت ۲۰۲۶، این مدل که توسط FINAL-Bench / VIDRAFT_LAB منتشر شده، توانست به امتیاز ۸۸.۴٪ در محک GPQA Diamond دست یابد. در حالی که مدل‌های پیشرو معمولاً برای رسیدن به این سطح از استدلال، به هفته‌ها آموزش در خوشه‌های عظیم GPU (واحد پردازش گرافیکی) و ترابایت‌ها داده نیاز دارند، این مدل مسیر متفاوتی را طی کرده است. این رویکرد در تضاد با استراتژی‌های برخی شرکت‌هاست که همچنان بر افزایش مقیاس تکیه می‌کنند؛ برای مثال بایت‌دنس اخیراً برای رقابت با آنتروپیک، آموزش مدلی با ۱۰ تریلیون پارامتر را آغاز کرده است.

برای مهندسان، هزینه استقرار یک مدل ۳۹۷ میلیاردی اغلب کمرشکن و بازدارنده است. اما Darwin-36B-Opus با فعال کردن تنها ۳ میلیارد پارامتر به ازای هر توکن (Token) — تکه‌های کوچکی از متن، شبیه برش‌های یک کیک طولانی که مدل تکه‌تکه می‌خورد — استدلال در سطح مدل‌های پیشرو را روی سخت‌افزارهای معمولی ممکن کرده است.

ریشه و پیشینه مدل

این مدل یک تنظیم دقیق (Fine-tuning) — مثل وقتی به یک پزشک عمومی، تخصص پوست می‌دهیم تا روی یک حوزه دقیق شود — سنتی نیست. بلکه حاصل «جفت‌گیری» دو مدل والد بر پایه معماری Qwen3 MoE (ترکیب خبره‌ها) است. یکی از والدین، مدل پایه Qwen3-35B MoE با توجه ترکیبی و ۲۵۶ خبره مسیریابی شده است. والد دیگر، یک نسخه استدلال‌محور است که از طریق distillation (تقطیر) روی ردپاهای زنجیره تفکر (Chain-of-Thought) — شبیه وقتی شاگرد ریاضی پای تخته بلند بلند فکر می‌کند تا به جواب برسد — مدل Claude Opus 4.6 آموزش دیده است. این مدل از تبار خانواده Opus می‌آید که تحلیل‌های دقیقی درباره تاریخ قطع دانش و متدولوژی استخراج داده‌های آن منتشر شده است.

این تبار به مدل اجازه می‌دهد تا نقاط قوت مکمل هر دو والد را به ارث ببرد. این مدل استدلال‌های طولانی زنجیره تفکر را از تبار تقطیرشده و دقت مسیریابی خبره‌ها را از مدل پایه می‌گیرد. در واقع، این رویکرد با وزن‌های پیش‌آموزش‌دیده باکیفیت به عنوان یک کتابخانه ژنتیکی برخورد می‌کند تا بدون پرداخت هزینه‌های کلان آموزش کامل، ترکیب‌های ممکن را کاوش کند.

برای ساخت این مدل، از موتور تکاملی Darwin V7 استفاده شده است. این سامانه با انجام فرآیند «breeding» یا پرورش مدل، نواحی خاصی از وزن‌ها (Weights) را در مدل‌های والد شناسایی و بازترکیب می‌کند. این مکانیسم باعث می‌شود رفتارهای استدلالی مدل «مادر» (نسخه تقطیر شده) حفظ شود و در عین حال، دقت ساختاری مدل «پدر» (نسخه پایه) باقی بماند.

سازوکار تکاملی

بر اساس مستندات منتشر شده، Darwin V7 برخلاف روش‌های رایج توسعه، از گرادیان کاهشی (Gradient Descent) روی داده‌های جدید استفاده نمی‌کند. این یعنی مدل نیازی به سرمایه‌های کلان و هفته‌ها آموزش در خوشه‌های GPU ندارد. این فرآیند دقیقاً شبیه به تقاطع ژنتیکی (Genetic Crossover) در تکامل بیولوژیک است که مستقیماً روی تانسورهای وزن در شبکه عصبی (Neural Network) — شبکه‌ای از سلول‌های کوچک، شبیه نقشهٔ مترو، که سیگنال را از ورودی به جواب می‌رساند — اعمال می‌شود. در همین راستا، تلاش‌هایی برای بهینه‌سازی معماری‌های MoE صورت گرفته است، مانند کتابخانه Mixture-of-Kittens که توانست تأخیر آموزش این مدل‌ها را ۵.۸ برابر کاهش دهد.

به دلیل اینکه این موتور به جای پس‌انتشار (Backpropagation) از بازترکیب وزن‌ها استفاده می‌کند، کل این فرآیند روی یک تک GPU در کمتر از یک ساعت به پایان می‌رسد. این یک تضاد شدید با دوره‌های آموزشی چند هفته‌ای است. البته باید یادآور شد که مدل والدِ تقطیرشده، پیش‌تر از طریق روش‌های تقطیر دانش آموزش دیده بود و بنابراین آموزش‌های قبلی در تبار مدل نهفته است.

مشخصات فنی

  • کل پارامترها: ۳۶ میلیارد
  • پارامترهای فعال: ۳ میلیارد (۸ خبره فعال از ۲۵۶ خبره مسیریابی شده)
  • پنجره زمینه (Context Window): ۲۶۲,۱۴۴ توکن — میزان متنی که مدل هم‌زمان در ذهن نگه می‌دارد، شبیه میز کاری که جا برای چند ورق دارد.
  • دقت: BF16
  • مجوز: Apache 2.0 (مجاز برای استفاده تجاری)
  • زبان‌های پشتیبانی شده: انگلیسی، چینی، کره‌ای، ژاپنی، آلمانی، فرانسوی، اسپانیایی، روسی و عربی

تحلیل عملکرد

کارایی این روش خیره‌کننده است. با تبدیل وزن‌های پیش‌آموزش‌دیده به یک کتابخانه ژنتیکی، توسعه‌دهندگان می‌توانند قابلیت‌های تخصصی — مانند استدلال‌های طولانی زنجیره تفکر — را در بسته‌های کوچک‌تر و قابل استقرار سنتز کنند.

در محک GPQA Diamond که یک آزمون سخت‌گیرانه شامل ۱۹۸ پرسش در سطح تحصیلات تکمیلی فیزیک، شیمی و زیست‌شناسی است، Darwin-36B-Opus در حال حاضر رتبه سوم کلی را در اختیار دارد. این مدل با امتیاز ۸۸.۴٪ با Qwen3.5-397B-A17B برابری کرده و حتی از مدل GLM-5.1 با ۷۴۴ میلیارد پارامتر (امتیاز زیر ۸۶.۶٪) پیشی گرفته است.

سایر مقایسه‌های قابل توجه عبارتند از:

  • TNSA/NGen-4-Pro: ۹۱.۱٪
  • TNSA/NGen-4: ۹۰.۱٪
  • Kimi-K2.5: ۸۷.۶٪
  • Darwin-27B-Opus: ۸۶.۹٪
  • Qwen3.5-122B-A10B: ۸۶.۶٪

این تغییر پارادایم نشان می‌دهد که مسیر رسیدن به هوش سطح پیشرو، لزوماً از طریق داده‌های بیشتر یا محاسبات سنگین‌تر نمی‌گذرد. مدل Darwin-36B-Opus در حالی به این نتایج رسیده که از نظر تعداد پارامتر، تقریباً ۱۱ برابر کوچک‌تر از مدل ۳۹۷ میلیاردی است که با آن برابری می‌کند.

برای کاربر نهایی، این یعنی استدلال‌های علمی سطح بالا در فیزیک، شیمی و زیست‌شناسی دیگر نیازی به مزرعه‌های عظیم سرور ندارد. همچنین مجوز Apache 2.0 به شرکت‌ها اجازه می‌دهد تا این قابلیت‌ها را بدون محدودیت‌های حق امتیاز (Royalty)، در محصولات تجاری خود ادغام کنند.

گام بعدی شما

  • اگر توسعه‌دهنده هستید، مدل را از طریق Hugging Face CLI با استفاده از شناسه مخزن موجود در کارت رسمی مدل دریافت کنید. برای نصب ابزار، ابتدا دستور pip install huggingface_hub و سپس huggingface-cli download <model-id-from-hf-page> را اجرا کنید.
  • عملکرد مدل را در حوزه‌های تخصصی STEM با مدل‌های بزرگ‌تر مقایسه کنید تا حد از خطای استدلال در مدل‌های کوچک‌تر آگاه شوید.
  • بررسی کنید که آیا موتور Darwin V7 می‌تواند مدل‌هایی از خانواده‌های معماری مختلف را با موفقیت ادغام کند یا خیر، زیرا در حال حاضر به والدین سازگار نیاز دارد.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل ثابت می‌کند که استدلال سطح پیشرو را می‌توان بدون نیاز به زیرساخت‌های میلیاردی به لبه شبکه آورد. اعتبار این ادعا با رتبه سوم در محک سخت‌گیرانه GPQA Diamond تأیید شده است.

تأثیر برای ایران

به دلیل مجوز Apache 2.0 و نیاز به سخت‌افزار کم، توسعه‌دهندگان ایرانی می‌توانند بدون هزینه API و با سخت‌افزارهای موجود، استدلال سطح پیشرو را در برنامه‌های خود پیاده کنند.

·نگاه ما
تحریریه دات‌هوش

این دستاورد فرضیه «بزرگ‌تر یعنی باهوش‌تر» را در مدل‌های زبانی به چالش می‌کشد. ادغام وزن‌ها نشان می‌دهد که بسیاری از قابلیت‌های استدلالی در مدل‌های غول‌پیکر، به صورت پراکنده وجود دارند و می‌توان با یک «جراحی» هوشمندانه، آن‌ها را در مدل‌های کوچک‌تر متمرکز کرد. این رویکرد احتمالاً باعث می‌شود رقابت از روی تعداد پارامترها به سمت بهینه‌سازی ترکیب وزن‌ها تغییر جهت دهد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.