پرش به محتوای اصلی
پرش به محتوای مقاله

محک Hugging Face: مدل Darwin-180B-RSI در ۱۰ شاخص رتبه اول شد

·۱۴ مهر ۱۴۰۵۷ دقیقه مطالعه
از امتحانات تا کار واقعی: یک مدل باز ۱۸۰ میلیارد پارامتری صدرنشین ۱۰ رتبه‌بندی رسمی هاگینگ‌فیس
از امتحانات تا کار واقعی: یک مدل باز ۱۸۰ میلیارد پارامتری صدرنشین ۱۰ رتبه‌بندی رسمی هاگینگ‌فیس
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

استفاده از حلقه بهبود بازگشتی (RSI) برای دستیابی به انضباط ساختاری در خروجی‌ها، به‌جای تکیه بر داده‌های انسانی. همچنین معرفی ZTC برای قضاوت لحظه‌ای بدون تولید توکن اضافی.

اگر امروز در حال طراحی یک خط لوله اتوماسیون هستید که خروجی‌های مدل را مستقیماً به کد متصل می‌کند، احتمالاً با کابوس خطاهای JSON یا جداول به‌هم‌ریخته آشنا هستید. مدل Darwin-180B-RSI دقیقاً برای پایان دادن به این خطاهای کوچک اما مرگبار طراحی شده است.

این مدل اکنون در ۱۰ مورد از ۴۸ محک رسمی Hugging Face رتبه اول را در اختیار دارد؛ رقمی که در میان ۹۵ سازمان شرکت‌کننده، بالاترین است. برای درک این فاصله، کافی است بدانید رتبه دوم (سازمان Z.ai) تنها در ۴ محک پیشتاز است. این دستاورد نشان‌دهنده یک چرخش استراتژیک است: عبور از مدل‌هایی که فقط در امتحانات آکادمیک نمره می‌گیرند و رسیدن به مدل‌هایی که قادر به اجرای کارهای واقعی در سطح تولید (Production) هستند.

همان‌طور که در تحلیل‌های قبلی ما درباره تسلط سازمان‌های چینی بر فهرست‌های Hugging Face اشاره کردیم، این نقطه عطف جدید نیز متعلق به مدلی است که بر پایه Qwen3.8-Flash-Next از شرکت Alibaba ساخته شده است. در حالی که اکثر مدل‌ها به دنبال نمرات بالا در ریاضیات یا علوم سطح دکترا هستند، Darwin روی مراحل «نامرئی» اتوماسیون هوش مصنوعی تمرکز کرده است: تجزیه، استخراج و قالب‌بندی سخت‌گیرانه.

چرخش به سمت محک‌های «کار واقعی»

به نقل از گزارشی که در ۶ اکتبر ۲۰۲۶ منتشر شد، پیشتازی Darwin تنها در تعداد نیست، بلکه در حوزه کاربرد است. این مدل در آزمون‌های پررقابتی مانند MMLU-Pro (با ۱۴۱ مدل ثبت‌شده) و GPQA (با ۱۱۱ مدل) برنده شده است؛ جایی که پیروزی بسیار دشوارتر از آزمون‌های تخصصی و کوچک است.

در حالی که این مدل در حوزه‌های آکادمیک می‌درخشد — کسب نمره ۱۰۰ در AIME ۲۰۲۶ و HMMT ۲۰۲۶ (ریاضیات)، ۹۴.۴۴ در GPQA Diamond و ۸۸.۱۲ در MMLU-Pro (علوم) — حیاتی‌ترین پیروزی‌های آن در سه دسته جدید «سازمانی» است که کارهای واقعی شرکت‌ها را می‌سنجد. در این راستا، تحلیل دقیق‌تری درباره دلایل دستیابی Darwin به اولین نمره کامل در آزمون AIME پیش‌تر منتشر کرده‌ایم.

  • MDPBench (۸۳.۶۵): سنجش تجزیه اسناد چندزبانه. این محک توانایی تبدیل یک سند واقعی با جداول و سرتیترها به یک نمایش تمیز و قابل استفاده را می‌سنجد. این اولین قدم برای هر سامانه تولید بازیابی‌افزا (RAG) — شبیه دانش‌آموزی که قبل از جواب دادن، اول کتاب درسی را باز می‌کند و از آن نقل می‌آورد — است؛ اگر تجزیه اولیه شکست بخورد، تمام مراحل بعدی دچار خطا می‌شوند.
  • IFStruct (۹۸.۹۵٪): تست توانایی تولید JSON یا YAML معتبر که دقیقاً از یک طرح (Schema) پیروی کند بدون استفاده از رمزگشایی‌های محدود شده (restricted decoding). این محک انضباط خالص مدل را در شمارش دقیق عناصر، کلیدهای پوششی (wrapper keys) و طول لیست‌های تو در تو می‌سنجد. هر فیلد اضافی که در طرح درخواست نشده باشد، منجر به شکست مدل می‌شود.
  • ExtractBench (۹۰.۲۹): ارزیابی استخراج فیلدهای ساختاریافته از ۳۷۰ سند PDF. این اسناد از فرم‌های کوتاه تا فایل‌های نزدیک به ۲۰۰ صفحه را شامل می‌شوند. این نمره توسط نسخه دوم بهبود خودکار، یعنی Darwin-180B-RSI-R3 به دست آمده که از مدل پایه Qwen3.8-Flash-Next (۸۹.۸۸) پیشی گرفته است.

از امتحان تا کار واقعی: یک مدل باز ۱۸۰ میلیارد پارامتری صدر ۱۰ رتبه‌بندی رسمی هاگینگ‌فیس

کالبدشکافی محدودیت‌های IFStruct

در آزمون IFStruct، مدل Darwin از ۲۰۰۰ پرامپت، ۱۹۷۹ مورد را با موفقیت پاس کرد (با استفاده از مقادیر پیش‌فرض harness شامل دمای ۰، ۱۶ هزار توکن و فعال بودن استدلال). تنها یک مورد به دلیل اتمام زمان ۱۲۰ ثانیه‌ای شکست خورد، بنابراین نمره ۹۸.۹۵٪ یک تخمین محافظه‌کارانه است.

این تست بسیار سخت‌گیرانه است: تعداد دقیق عناصر (یا یک محدوده خاص)، وجود کلید پوششی درست و رعایت اینکه آیا یک بلوک کد مورد نیاز است یا ممنوع شده است را بررسی می‌کند. اگر مدل در جایی که ممنوع است کامنت اضافه کند، در رعایت Enums شکست بخورد یا از محدودیت‌های عددی فراتر رود، جریمه می‌شود.

طبق بررسی‌ها، وقتی قابلیت استدلال غیرفعال می‌شود، عملکرد مدل به ۸۹.۷٪ سقوط می‌کند. این یعنی فاز داخلی زنجیره تفکر (Chain-of-Thought) — مثل وقتی شاگرد ریاضی پای تخته بلند بلند فکر می‌کند تا به جواب برسد — همان چیزی است که تخلفات نهایی از قوانین را برطرف می‌کند. در مقایسه، مدل‌هایی مانند Agents-A1 (۹۳.۲۵٪)، gpt-oss-20b (۹۱.۹۵٪)، Nemotron-3-Nano-30B (۸۶.۸۰٪) و Granite 4.1 8B (۶۸.۴۵٪) از انضباط Darwin عقب‌تر هستند.

سازوکار: بهبود بازگشتی در سطح مدل (RSI)

مدل Darwin برای این پیشرفت‌ها به داده‌های برچسب‌گذاری‌شده توسط انسان تکیه نکرده است. در عوض، از بهبود بازگشتی در سطح مدل (Model-level Recursive Self-Improvement) استفاده می‌کند. این فرآیند یک حلقه سخت‌گیرانه است که بدون دستورالعمل‌های داخلی یا هایپرپارامترهای خاص پیش می‌رود:

۱. مدل مسائلی را حل می‌کند که پاسخ آن‌ها به‌طور خودکار قابل تأیید است.
۲. تنها پاسخ‌هایی که به عنوان «درست» تأیید شده‌اند، نگه داشته می‌شوند.
۳. مدل با استفاده از این مجموعه داده پالایش‌شده، دوباره آموزش می‌بیند.
۴. این فرآیند تکرار می‌شود.

به دلیل اینکه مدل هرگز از پاسخ‌های تأییدنشده یا غلط یاد نمی‌گیرد، خطاها تقویت نمی‌شوند. نکته جالب این است که تیم توسعه‌دهنده متوجه شد عادت به استدلال دقیق که در حین حل مسائل قابل تأیید شکل گرفته، به حوزه‌هایی منتقل شده که مدل هیچ آموزش صریحی در آن‌ها ندیده بود. البته این رویکرد بدون چالش نیست و برخی تحلیل‌ها به موانع فنی اشاره دارند که ممکن است باعث توقف تکامل خودکار مدل‌ها شوند.

این موضوع در عملکرد حقوقی مدل مشهود است، جایی که در محک‌هایی مانند LEXam (۶۸.۹۴) و LEXam-hard (۴۵.۷۲) و همچنین در استخراج اسناد پیشتاز است. مدل در واقع «چگونگی استدلال» را یاد گرفته و سپس آن را در زمینه‌های تخصصی حرفه‌ای به کار برده است.

اعتماد صفر-توکنی (ZTC) برای عامل‌ها

در کنار این مدل، تکنیک جدیدی به نام اعتماد صفر-توکنی (Zero-Token Confidence) در حال رایج شدن است. این روش که از طریق اپلیکیشن Gate Arcade در بخش «فضاهای هفته» Hugging Face (انتخاب شده در هفته ۲۸ سپتامبر از میان ۱.۵ میلیون اپلیکیشن) معرفی شد، یک مشکل حیاتی در عامل‌های (Agents) هوش مصنوعی را حل می‌کند: تصمیم‌گیری برای اجرای یک اقدام، بدون تأخیر ناشی از حضور یک مدل «داور» دوم.

در حالی که APIهای JEV از شرکت Typesafe یک فرمت مرجع برای «شاخص تصمیم‌گیری» (Decision Index) ایجاد کردند که اکنون بیش از ۷۰ مدل را شامل می‌شود، ZTC مسیر متفاوتی را می‌رود. در ۳۰ سپتامبر، شرکت Cloudflare یک مدل داور سازگار با JEV معرفی کرد و تیم‌هایی از استنفورد و NVIDIA نیز مدل‌های مشابهی را ارائه دادند. اما ZTC به‌طور کلی از تولید متن اجتناب می‌کند.

به جای اینکه از یک AI دیگر بپرسد «آیا این پاسخ درست است؟» و منتظر دریافت متن بماند، ZTC حالت داخلی مدل تولیدکننده را می‌خواند تا احتمال صحت را محاسبه کند. این یعنی صفر توکن اضافی و افزایش شدید سرعت:

  • تأخیر: ZTC برای هر قضاوت ۰.۰۶۱۵ ثانیه زمان می‌برد، در حالی که JEV به ۰.۵۹۱ ثانیه نیاز دارد.
  • توان عملیاتی: در ۳۰۰ ثانیه، ZTC تعداد ۱۷۷ مورد را پردازش کرد، در حالی که JEV تنها ۱۳۵ مورد را پیش برد.
  • صحت: سطح زیر منحنی (AUC) برای ZTC برابر ۰.۷۲۸۹ است که از نظر آماری با ۰.۷۳۵۰ در JEV برابر است.
  • نرخ پیروزی: در نبردی با ۲۰۰۰ راند، ZTC در ۷۳.۷٪ مواقع برنده شد.

پیامدهای عملیاتی

برای مهندسانی که خط لوله‌های عامل‌محور می‌سازند، این نتایج محاسبات قابلیت اطمینان را تغییر می‌دهد. وقتی خروجی مدل توسط کد مصرف می‌شود (نه انسان)، یک کلید JSON اشتباه، یک کلید ساختگی یا یک جدول بد تجزیه شده، کل فرآیند را متوقف می‌کند. نمرات بالای Darwin در IFStruct و ExtractBench نشان‌دهنده مدلی است که واقعاً می‌تواند در محیط تولید دوام بیاورد.

علاوه بر این، ZTC اجازه می‌دهد قضاوت‌های سریع در شبکه‌های ایزوله — مانند بانکداری، دفاع یا بخش دولتی — رخ دهد، زیرا داده‌ها هرگز GPU را ترک نمی‌کنند و نیازی به فراخوانی API خارجی نیست. این سیستم روی همان واحد پردازش گرافیکی (GPU) مدل اجرا می‌شود، مسیر رفت و برگشت به یک API خارجی را حذف می‌کند و هزینه‌های اضافی را تقریباً به صفر می‌رساند.

با اعمال ZTC، نسخه Darwin-397B-ZTC دقت خود-قضاوت را از ۰.۷۶ به ۰.۸۸ رساند. ترکیب بهبود بازگشتی و نظارت بر حالت داخلی نشان می‌دهد که مرز بعدی هوش مصنوعی، لزوماً مدل‌های «باهوش‌تر» نیست، بلکه مدل‌های «منضبط‌تر» هستند که می‌توانند کار خود را در میلی‌ثانیه‌ها تأیید کنند.

گام بعدی شما

  • اگر از مدل‌های باز برای استخراج داده استفاده می‌کنید، معماری RSI را برای پالایش داده‌های آموزشی خود بررسی کنید.
  • برای کاهش تأخیر در سیستم‌های عامل‌محور، به جای مدل‌های داور متنی، از روش‌های تحلیل حالت داخلی (مانند ZTC) استفاده کنید.
  • در طراحی پرامپت‌ها، برای مدل‌های استدلالی، محدودیت‌های ساختاری (Schema) را به‌صورت صریح تعریف کنید تا از قابلیت‌های انضباطی مدل بهره ببرید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این پیشرفت با تکیه بر اعتبار داده‌های تأییدشده (Verified Data)، ریسک توقف سیستم‌های اتوماسیون سازمانی را به‌شدت کاهش می‌دهد. توانایی مدل در خود-اصلاحی بدون نیاز به انسان، هزینه توسعه عامل‌های پیچیده را به طور چشم‌گیری پایین می‌آورد.

تأثیر برای ایران

به‌دلیل وزن‌های باز بودن مدل، توسعه‌دهندگان ایرانی می‌توانند بدون نیاز به APIهای گران‌قیمت و تحریم‌شده، این مدل را روی سرورهای داخلی برای استخراج داده‌های ساختاریافته از اسناد فارسی بهینه کنند.

·نگاه ما
تحریریه دات‌هوش

تمرکز Darwin بر روی «انضباط خروجی» به‌جای «دانش عمومی»، نشان می‌دهد که صنعت در حال عبور از دوران نمایش قدرت (Benchmark chasing) به دوران کاربرد صنعتی است. مدل‌هایی که می‌توانند خروجی‌های ۱۰۰٪ ساختاریافته تولید کنند، ارزش اقتصادی بسیار بیشتری نسبت به مدل‌هایی دارند که فقط در آزمون‌های ریاضی نمره می‌گیرند. در واقع، قابلیت ZTC ثابت می‌کند که آینده عامل‌های هوش مصنوعی در حذف لایه‌های متنی زائد و حرکت به سمت تحلیل مستقیم احتمالات در لایه سخت‌افزار است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.