پرش به محتوای اصلی
پرش به محتوای مقاله

چرا Darwin-180B نخستین مدل با امتیاز ۱۰۰٪ در AIME است؟

·۸ مهر ۱۴۰۵۴ دقیقه مطالعه
مدل VIDRAFT Darwin-180B-RSI با کسب نمرات کامل AIME و HMMT و ۹۴.۴۴٪ در GPQA Diamond، صدرنشین ۵ جدول برتر Hugging Face شد.
مدل VIDRAFT Darwin-180B-RSI با کسب نمرات کامل AIME و HMMT و ۹۴.۴۴٪ در GPQA Diamond، صدرنشین ۵ جدول برتر Hugging Face شد.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

نخستین ثبت امتیاز ۱۰۰٪ در دو محک سخت‌گیرانه AIME و HMMT ۲۰۲۶ توسط یک مدل باز؛ همچنین معرفی مکانیزم ZTC برای امتناع مدل از پاسخ‌های غیرمطمئن.

سقف توانمندی‌های مدل‌های استدلالی با وزن‌های باز جابه‌جا شد. VIDRAFT Darwin-180B-RSI با کسب نخستین امتیاز کامل در محک‌های AIME 2026 و HMMT 2026، استانداردهای جدیدی را برای هوش مصنوعی در حوزه‌های STEM تعریف کرد. این نتیجه نشان‌دهنده یک تغییر جهت قابل توجه در هوش مصنوعی متمرکز بر علوم، فناوری، مهندسی و ریاضیات است، زیرا این مدل اکنون در سخت‌ترین ارزیابی‌های ریاضی و علمی موجود در Hugging Face، از تمامی سیستم‌های پیشرو (SOTA) قبلی پیشی گرفته است.

این دستاورد در حالی رخ می‌دهد که صنعت از مدل‌های زبانی بزرگ (LLM) عمومی به سمت مدل‌های استدلالی (Reasoning Model) متخصص حرکت می‌کند؛ مدل‌هایی که قادر به تفکر «سیستم ۲» یا همان تفکر کند، تحلیلی و متفکرانه هستند. در حالی که بسیاری از آزمایشگاه‌های هوش مصنوعی تنها اعداد داخلی خود را گزارش می‌کنند، نتایج VIDRAFT در جدول‌های رسمی و تأیید شده Hugging Face ثبت شده است که این موضوع تردیدهای معمول درباره ادعاهای خود-گزارشی شرکت‌ها را از بین می‌برد.

همان‌طور که در تحلیل‌های پیشین ما درباره تکامل مدل‌های استدلالی اشاره کردیم، تمرکز اکنون از افزایش صرف پارامترها به سمت بهینه‌سازی مسیرهای تفکر تغییر کرده است.

زمینه و مقیاس

این مدل یک مدل زبانی بزرگ با ۱۸۰ میلیارد پارامتر است که به‌طور خاص بر استدلال متمرکز شده است. عبارت «RSI» در نام آن به بهبود خودکار بازگشتی (Recursive Self-Improvement) اشاره دارد؛ متدولوژی آموزشی هسته‌ای که مدل را برای رسیدن به سطح پیشرو در ریاضیات، علوم و حوزه‌های چندوجهی به چالش می‌کشد.

شرکت VIDRAFT این فناوری را تنها به مقیاس ۱۸۰ میلیارد پارامتر محدود نکرده است. این شرکت به‌طور جداگانه فناوری ادغام «داروین» را به کلاس مدل‌های بزرگ‌تری با حدود ۳۹۷ میلیارد پارامتر گسترش داده است. این اقدام نشان‌دهنده یک مسیر مقیاس‌پذیر برای افزایش ظرفیت استدلال در مدل‌های آینده است. طبق گزارش منتشر شده در ۳۰ سپتامبر ۲۰۲۶، عملکرد این مدل بر سه انتخاب معماری اختصاصی استوار است:

جزئیات فنی و معماری

  • ادغام گزینشی داروین (Darwin Selective Merging): برخلاف روش‌های رایج ادغام مدل مانند SLERP یا TIES-merging که روی تمام تنسورهای وزن با دانه‌بندی درشت عمل می‌کنند، روش داروین عملکرد را در سطح لایه‌ها و واحدهای خبره (در سبک MoE) تحلیل می‌کند. این متد به‌جای میانگین‌گیری بی‌رویه از وزن‌ها، زیرساخت‌های با عملکرد بالا را به‌صورت جراحی‌گونه از چندین مدل منبع استخراج می‌کند. این امر به مدل ادغام‌شده اجازه می‌دهد تا نقاط قوت مکمل مدل‌های مختلف را به ارث ببرد.

  • بهبود خودکار بازگشتی (RSI): یک حلقه خود-تقویتی (Self-bootstrapping) است که در آن مدل به‌طور مستقل تلاش می‌کند مسائل را حل کرده و سپس بررسی می‌کند که آیا پاسخ‌هایش درست بوده‌اند یا خیر. در مرحله بعد، مدل بر روی این ردپاهای استدلالی (Reasoning Traces) تأیید شده و باکیفیت، دوباره آموزش می‌بیند. مدل بهبودیافته سپس به عنوان حل‌کننده برای تکرار بعدی تبدیل می‌شود و بدین ترتیب کیفیت استدلال بدون نیاز به پاسخ‌های برچسب‌گذاری شده توسط انسان در هر مرحله، افزایش می‌یابد.

  • اعتماد صفر-توکنی (Zero-Token Confidence - ZTC): یک مکانیزم کالیبراسیون است که وضعیت داخلی مدل را پیش از تولید هر پاسخ تحلیل می‌کند تا یک تخمین از میزان اطمینان به‌دست آورد. اگر سطح اطمینان از یک آستانه مشخص پایین‌تر باشد، مدل به‌گونه‌ای طراحی شده است که از پاسخ دادن خودداری کند. این گزینه «امتناع» اصولی، به‌طور خاص برای کاهش نرخ توهم (Hallucination) در نظر گرفته شده است.

عملکرد در محک‌ها (Benchmarks)

بر اساس داده‌های ۲۸ سپتامبر ۲۰۲۶ در بردهای تأیید شده Hugging Face، این مدل به‌طور هم‌زمان در پنج جدول برتر رتبه اول را کسب کرد:

  • AIME 2026: امتیاز ۱۰۰٪ (SOTA قبلی: ۹۷.۱٪). این مسائل در سطح المپیاد ریاضی هستند و این نخستین امتیاز کامل ثبت شده در این جدول است.
  • HMMT 2026: امتیاز ۱۰۰٪ (SOTA قبلی: ۹۲.۷٪). این محک نیز در سطح المپیاد ریاضی است و برای اولین بار امتیاز کامل در آن به دست آمده است.
  • GPQA Diamond: امتیاز ۹۴.۴۴٪ (SOTA قبلی: ۹۳.۵٪ توسط Kimi-K3). این محک شامل سوالات علمی است که توسط متخصصان در سطح دکترا طراحی شده‌اند.
  • MMLU-Pro: امتیاز ۸۸.۱۲٪. این ارزیابی ۱۴ حوزه تخصصی از جمله پزشکی، حقوق و اقتصاد را پوشش می‌دهد.
  • MMMU-Pro: امتیاز ۷۹.۴۸٪. این تست استدلال چندوجهی را در زمینه‌هایی مانند تصویربرداری پزشکی، نت‌های موسیقی و نمودارها می‌سنجد.

داده‌های تکمیلی نشان می‌دهد که امتیازات ۱۰۰٪ در AIME (۳۰ از ۳۰) و HMMT (۳۳ از ۳۳) با استفاده از رای‌گیری اکثریت (Majority Vote) در ۱۶ نمونه و با بودجه تفکر ۱۳۱ هزار توکن به‌دست آمده است. این رویکرد در راستای راهکارهای داروین برای رفع خطاهای توکنی در استدلال از طریق افزایش بودجه تفکر است که دقت مدل را در مسائل پیچیده تضمین می‌کند. نکته قابل توجه این است که دقت تک‌نمونه‌ای (Single-sample) مدل همچنان بسیار بالا است و در AIME بدون نیاز به رای‌گیری، امتیاز ۹۶.۶۷٪ را کسب کرده است.

علاوه بر دقت خام، این مدل ۱۱٪ کاهش در طول استنتاج (Inference Reasoning Length) نسبت به نسخه‌های قبلی دارد. برای مهندسین که این مدل‌ها را در محیط‌های عملیاتی مستقر می‌کنند، این کاهش مستقیماً به معنای هزینه‌های محاسباتی کمتر و کاهش تأخیر (Latency) بدون افت صحت پاسخ‌ها است. این سیگنالِ کارایی برای بارهای کاری حساس به تأخیر که در آن‌ها کاربران به‌ازای هر توکن هزینه پرداخت می‌کنند، بسیار ارزشمند است.

این تغییر رویکرد نشان می‌دهد که مسیر رسیدن به استدلال در سطح پیشرو، از افزایش ساده تعداد پارامترها (هرچند VIDRAFT این فناوری را به کلاس ۳۹۷ میلیارد پارامتر رسانده است) به سمت ادغام جراحی‌گونه مدل‌ها و حلقه‌های خود-اصلاحی سنتتیک در حال حرکت است.

با پیاده‌سازی ZTC، شرکت VIDRAFT مشکل «اعتماد به نفس کاذب» که در اکثر مدل‌های زبانی بزرگ نهفته است را هدف قرار داده است. توانایی یک مدل در امتناع اصولی از پاسخ به یک سوال علمی سطح دکترا، برای بارهای کاری تخصصی STEM بسیار ارزشمندتر از یک حدس با احتمال بالا است.

اگرچه وزن‌های مدل و نقاط انتهایی API در این گزارش به‌طور عمومی منتشر نشده‌اند، اما سابقه VIDRAFT در عرضه ابزارهای باز مانند AX-RAY (ابزار تشخیصی) و توزیع مدل‌ها در Hugging Face، جایی که تا سپتامبر ۲۰۲۶ بیش از ۱.۶ میلیون دانلود داشته‌اند، نشان می‌دهد که دسترسی عمومی به این مدل دور نیست.

گام بعدی شما

  • صفحه سازمان VIDRAFT در Hugging Face را برای انتشار رسمی کارت مدل (Model Card) دنبال کنید تا این توانمندی‌های استدلالی را روی مجموعه‌داده‌های خصوصی خود آزمایش کنید.
  • اگر در حال توسعه ابزارهای STEM هستید، مکانیزم ZTC را برای کاهش توهمات در سیستم خود بررسی کنید.
  • بودجه توکن‌های تفکر (Thinking Budget) را در مدل‌های استدلالی خود برای مسائل پیچیده ریاضی بهینه کنید.

اما تأثیر این مدل بر هزینه‌های استنتاج در مقیاس صنعتی حتی جذاب‌تر است — به تحلیل ما درباره بهینه‌سازی‌های VLLM مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر اعتبار بنچمارک‌های تأییدشده Hugging Face، ثابت می‌کند که مدل‌های باز می‌توانند در استدلال‌های پیچیده با مدل‌های بسته رقابت کنند. کاهش ۱۱ درصدی طول استنتاج نیز تخصص VIDRAFT در بهینه‌سازی هزینه در کنار دقت را نشان می‌دهد.

تأثیر برای ایران

به‌دلیل ماهیت وزن‌های باز (Open Weights) در Hugging Face، پژوهشگران ایرانی می‌توانند پس از انتشار مدل، آن را به‌صورت محلی اجرا کرده و برای کاربردهای تخصصی ریاضی و علوم فارسی‌سازی یا تنظیم دقیق کنند.

·نگاه ما
تحریریه دات‌هوش

دستیابی به امتیاز ۱۰۰٪ در AIME نشان می‌دهد که مدل‌های استدلالی از سد «حدس‌های احتمالی» عبور کرده و به سمت درک ساختاری ریاضیات حرکت کرده‌اند. استفاده از RSI ثابت می‌کند که داده‌های مصنوعی (Synthetic Data) تولید شده توسط خودِ مدل، اکنون به جای ایجاد چرخه تخریب، به موتور رشد مدل تبدیل شده است. این یک چرخش از «بیشتر یاد گرفتن» به «بهتر فکر کردن» است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.