سقف توانمندیهای مدلهای استدلالی با وزنهای باز جابهجا شد. VIDRAFT Darwin-180B-RSI با کسب نخستین امتیاز کامل در محکهای AIME 2026 و HMMT 2026، استانداردهای جدیدی را برای هوش مصنوعی در حوزههای STEM تعریف کرد. این نتیجه نشاندهنده یک تغییر جهت قابل توجه در هوش مصنوعی متمرکز بر علوم، فناوری، مهندسی و ریاضیات است، زیرا این مدل اکنون در سختترین ارزیابیهای ریاضی و علمی موجود در Hugging Face، از تمامی سیستمهای پیشرو (SOTA) قبلی پیشی گرفته است.
این دستاورد در حالی رخ میدهد که صنعت از مدلهای زبانی بزرگ (LLM) عمومی به سمت مدلهای استدلالی (Reasoning Model) متخصص حرکت میکند؛ مدلهایی که قادر به تفکر «سیستم ۲» یا همان تفکر کند، تحلیلی و متفکرانه هستند. در حالی که بسیاری از آزمایشگاههای هوش مصنوعی تنها اعداد داخلی خود را گزارش میکنند، نتایج VIDRAFT در جدولهای رسمی و تأیید شده Hugging Face ثبت شده است که این موضوع تردیدهای معمول درباره ادعاهای خود-گزارشی شرکتها را از بین میبرد.
همانطور که در تحلیلهای پیشین ما درباره تکامل مدلهای استدلالی اشاره کردیم، تمرکز اکنون از افزایش صرف پارامترها به سمت بهینهسازی مسیرهای تفکر تغییر کرده است.
زمینه و مقیاس
این مدل یک مدل زبانی بزرگ با ۱۸۰ میلیارد پارامتر است که بهطور خاص بر استدلال متمرکز شده است. عبارت «RSI» در نام آن به بهبود خودکار بازگشتی (Recursive Self-Improvement) اشاره دارد؛ متدولوژی آموزشی هستهای که مدل را برای رسیدن به سطح پیشرو در ریاضیات، علوم و حوزههای چندوجهی به چالش میکشد.
شرکت VIDRAFT این فناوری را تنها به مقیاس ۱۸۰ میلیارد پارامتر محدود نکرده است. این شرکت بهطور جداگانه فناوری ادغام «داروین» را به کلاس مدلهای بزرگتری با حدود ۳۹۷ میلیارد پارامتر گسترش داده است. این اقدام نشاندهنده یک مسیر مقیاسپذیر برای افزایش ظرفیت استدلال در مدلهای آینده است. طبق گزارش منتشر شده در ۳۰ سپتامبر ۲۰۲۶، عملکرد این مدل بر سه انتخاب معماری اختصاصی استوار است:
جزئیات فنی و معماری
ادغام گزینشی داروین (Darwin Selective Merging): برخلاف روشهای رایج ادغام مدل مانند SLERP یا TIES-merging که روی تمام تنسورهای وزن با دانهبندی درشت عمل میکنند، روش داروین عملکرد را در سطح لایهها و واحدهای خبره (در سبک MoE) تحلیل میکند. این متد بهجای میانگینگیری بیرویه از وزنها، زیرساختهای با عملکرد بالا را بهصورت جراحیگونه از چندین مدل منبع استخراج میکند. این امر به مدل ادغامشده اجازه میدهد تا نقاط قوت مکمل مدلهای مختلف را به ارث ببرد.
بهبود خودکار بازگشتی (RSI): یک حلقه خود-تقویتی (Self-bootstrapping) است که در آن مدل بهطور مستقل تلاش میکند مسائل را حل کرده و سپس بررسی میکند که آیا پاسخهایش درست بودهاند یا خیر. در مرحله بعد، مدل بر روی این ردپاهای استدلالی (Reasoning Traces) تأیید شده و باکیفیت، دوباره آموزش میبیند. مدل بهبودیافته سپس به عنوان حلکننده برای تکرار بعدی تبدیل میشود و بدین ترتیب کیفیت استدلال بدون نیاز به پاسخهای برچسبگذاری شده توسط انسان در هر مرحله، افزایش مییابد.
اعتماد صفر-توکنی (Zero-Token Confidence - ZTC): یک مکانیزم کالیبراسیون است که وضعیت داخلی مدل را پیش از تولید هر پاسخ تحلیل میکند تا یک تخمین از میزان اطمینان بهدست آورد. اگر سطح اطمینان از یک آستانه مشخص پایینتر باشد، مدل بهگونهای طراحی شده است که از پاسخ دادن خودداری کند. این گزینه «امتناع» اصولی، بهطور خاص برای کاهش نرخ توهم (Hallucination) در نظر گرفته شده است.
عملکرد در محکها (Benchmarks)
بر اساس دادههای ۲۸ سپتامبر ۲۰۲۶ در بردهای تأیید شده Hugging Face، این مدل بهطور همزمان در پنج جدول برتر رتبه اول را کسب کرد:
- AIME 2026: امتیاز ۱۰۰٪ (SOTA قبلی: ۹۷.۱٪). این مسائل در سطح المپیاد ریاضی هستند و این نخستین امتیاز کامل ثبت شده در این جدول است.
- HMMT 2026: امتیاز ۱۰۰٪ (SOTA قبلی: ۹۲.۷٪). این محک نیز در سطح المپیاد ریاضی است و برای اولین بار امتیاز کامل در آن به دست آمده است.
- GPQA Diamond: امتیاز ۹۴.۴۴٪ (SOTA قبلی: ۹۳.۵٪ توسط Kimi-K3). این محک شامل سوالات علمی است که توسط متخصصان در سطح دکترا طراحی شدهاند.
- MMLU-Pro: امتیاز ۸۸.۱۲٪. این ارزیابی ۱۴ حوزه تخصصی از جمله پزشکی، حقوق و اقتصاد را پوشش میدهد.
- MMMU-Pro: امتیاز ۷۹.۴۸٪. این تست استدلال چندوجهی را در زمینههایی مانند تصویربرداری پزشکی، نتهای موسیقی و نمودارها میسنجد.
دادههای تکمیلی نشان میدهد که امتیازات ۱۰۰٪ در AIME (۳۰ از ۳۰) و HMMT (۳۳ از ۳۳) با استفاده از رایگیری اکثریت (Majority Vote) در ۱۶ نمونه و با بودجه تفکر ۱۳۱ هزار توکن بهدست آمده است. این رویکرد در راستای راهکارهای داروین برای رفع خطاهای توکنی در استدلال از طریق افزایش بودجه تفکر است که دقت مدل را در مسائل پیچیده تضمین میکند. نکته قابل توجه این است که دقت تکنمونهای (Single-sample) مدل همچنان بسیار بالا است و در AIME بدون نیاز به رایگیری، امتیاز ۹۶.۶۷٪ را کسب کرده است.
علاوه بر دقت خام، این مدل ۱۱٪ کاهش در طول استنتاج (Inference Reasoning Length) نسبت به نسخههای قبلی دارد. برای مهندسین که این مدلها را در محیطهای عملیاتی مستقر میکنند، این کاهش مستقیماً به معنای هزینههای محاسباتی کمتر و کاهش تأخیر (Latency) بدون افت صحت پاسخها است. این سیگنالِ کارایی برای بارهای کاری حساس به تأخیر که در آنها کاربران بهازای هر توکن هزینه پرداخت میکنند، بسیار ارزشمند است.
این تغییر رویکرد نشان میدهد که مسیر رسیدن به استدلال در سطح پیشرو، از افزایش ساده تعداد پارامترها (هرچند VIDRAFT این فناوری را به کلاس ۳۹۷ میلیارد پارامتر رسانده است) به سمت ادغام جراحیگونه مدلها و حلقههای خود-اصلاحی سنتتیک در حال حرکت است.
با پیادهسازی ZTC، شرکت VIDRAFT مشکل «اعتماد به نفس کاذب» که در اکثر مدلهای زبانی بزرگ نهفته است را هدف قرار داده است. توانایی یک مدل در امتناع اصولی از پاسخ به یک سوال علمی سطح دکترا، برای بارهای کاری تخصصی STEM بسیار ارزشمندتر از یک حدس با احتمال بالا است.
اگرچه وزنهای مدل و نقاط انتهایی API در این گزارش بهطور عمومی منتشر نشدهاند، اما سابقه VIDRAFT در عرضه ابزارهای باز مانند AX-RAY (ابزار تشخیصی) و توزیع مدلها در Hugging Face، جایی که تا سپتامبر ۲۰۲۶ بیش از ۱.۶ میلیون دانلود داشتهاند، نشان میدهد که دسترسی عمومی به این مدل دور نیست.
گام بعدی شما
- صفحه سازمان VIDRAFT در Hugging Face را برای انتشار رسمی کارت مدل (Model Card) دنبال کنید تا این توانمندیهای استدلالی را روی مجموعهدادههای خصوصی خود آزمایش کنید.
- اگر در حال توسعه ابزارهای STEM هستید، مکانیزم ZTC را برای کاهش توهمات در سیستم خود بررسی کنید.
- بودجه توکنهای تفکر (Thinking Budget) را در مدلهای استدلالی خود برای مسائل پیچیده ریاضی بهینه کنید.
اما تأثیر این مدل بر هزینههای استنتاج در مقیاس صنعتی حتی جذابتر است — به تحلیل ما درباره بهینهسازیهای VLLM مراجعه کنید.




گفتگو