پرش به محتوای اصلی
پرش به محتوای مقاله

مدل Darwin-180B-RSI در ۱۰ بنچمارک Hugging Face رتبه اول شد

·۱۴ مهر ۱۴۰۵۶ دقیقه مطالعه
مدل ۱۸۰ میلیارد پارامتری باز صدرنشین ۱۰ جدول رتبه‌بندی هوگینگ‌فیس و داور بدون توکن پشت آن
مدل ۱۸۰ میلیارد پارامتری باز صدرنشین ۱۰ جدول رتبه‌بندی هوگینگ‌فیس و داور بدون توکن پشت آن
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی تولید متن با تحلیل حالت‌های نهان (Hidden States) برای داوری اقدامات عامل‌ها، که منجر به حذف کامل توکن‌های اضافی و کاهش شدید تأخیر در لایه حفاظتی می‌شود.

اگر امروز برای استخراج داده‌های ساختاریافته از اسناد حجیم روی مدل‌های تجاری حساب می‌کنید، باید بدانید که یک مدل وزن‌باز (Open Weights) اکنون در این حوزه استانداردهای جدیدی تعریف کرده است. مدل Darwin-180B-RSI با تصاحب رتبه اول در ۱۰ بنچمارک (Benchmark) رسمی Hugging Face، نشان داد که تمرکز صنعت از نمرات آزمون‌های آکادمیک به سمت حل مسائل واقعی دنیای کسب‌وکار در حال چرخش است. این دستاورد که در ۶ اکتبر ۲۰۲۶ توسط وب‌سایت dev.to گزارش شد، سیگنالی از تغییر رویکرد کلی در توسعه مدل‌هاست.

در میان ۹۵ سازمان شرکت‌کننده، شکاف عملکردی بسیار چشمگیر است: این مدل بیشترین تعداد رتبه‌های اول را در ۴۸ محک ارزیابی منتخب کسب کرده است، در حالی که نزدیک‌ترین رقیب آن در رده دوم، تنها ۴ رتبه اول در اختیار دارد. این تفاوت نشان می‌دهد که Darwin-180B-RSI نه تنها پیشتاز است، بلکه فاصله زیادی با سایر رقبا ایجاد کرده است.

بسیاری از پیروزی‌ها در جداول رده‌بندی به‌طور سنتی به استدلال‌های سبک آزمونی پاداش می‌دهند. اما آخرین موفقیت‌های بازوی پژوهشی VIDRAFT با نام FINAL-Bench، دقیقاً روی نقاط اصطکاک و چالش‌هایی تمرکز دارد که تیم‌های فنی هنگام استقرار هوش مصنوعی در محصولات واقعی با آن مواجه می‌شوند: خروجی داده‌های ساختاریافته و تجزیه و تحلیل اسناد طولانی. این تغییر رویکرد بازتاب‌دهنده یک درک گسترده‌تر در صنعت است؛ این ایده که «ضریب هوشی» (IQ) یک مدل اگر نتواند یک طرحواره (Schema) سخت‌گیرانه JSON را دنبال کند یا یک فیلد خاص را از یک فایل PDF ۱۹۰ صفحه‌ای استخراج کند، عملاً بی‌فایده است.

همان‌طور که در تحلیل قبلی ما درباره‌ی مدل‌های استدلالی و نسخه‌های کوانتایز شده (Quantization) برای لپ‌تاپ‌ها اشاره کردیم، داده‌های جدید تأیید می‌کند که قابلیت‌های استدلالی این مدل به حوزه‌هایی منتقل شده که هرگز به‌طور صریح برای آن‌ها آموزش ندیده است. این مدل بر پایه Qwen3.8-Flash-Next شرکت علی‌بابا ساخته شده، اما برتری فعلی آن بیش از آنکه به وزن‌های پایه مربوط باشد، نتیجه‌ی حلقه آموزش خاص آن است.

تسلط بر وظایف سازمانی و محک‌های ارزیابی

مهم‌ترین پیروزی‌های این مدل در وظایفی است که مستقیماً با نیازهای سازمانی گره خورده‌اند. بر اساس مستندات، در محک IFStruct (ارائه شده توسط Liquid AI) که سخت‌گیری در رعایت ساختارهای JSON و YAML را می‌سنجد، Darwin-180B-RSI امتیاز ۹۸.۹۵ را کسب کرد و ۱۹۷۹ مورد از ۲۰۰۰ مورد را به‌درستی پاسخ داد. این عدد به‌طور قابل‌توجهی بالاتر از مدل‌های پیشین پیشتاز مانند Agents-A1 (۹۳.۲۵)، gpt-oss-20b (۹۱.۹۵) و Nemotron-3-Nano-30B (۸۶.۸۰) است. در یک خط لوله تولیدی که در آن یک برنامه باید خروجی مدل را بخواند تا مرحله بعد را اجرا کند، حتی یک کاراکتر اشتباه یا یک فیلد گم‌شده می‌تواند کل فرآیند را متوقف کند؛ بنابراین رعایت دقیق ساختار (Schema Adherence) یک پیش‌نیاز حیاتی برای پذیرش مدل در محیط‌های عملیاتی است.

در زمینه تحلیل اسناد، نسخه Darwin-180B-RSI-R3 در محک ExtractBench متعلق به LlamaIndex امتیاز ۹۰.۲۹ را به دست آورد. این آزمون شامل ۳۷۰ فایل PDF بود که حجم آن‌ها از چند صفحه تا تقریباً ۱۹۰ صفحه متغیر بود. این نتیجه حتی از مدل پایه خود یعنی Qwen3.8-Flash-Next که امتیاز ۸۹.۸۸ را کسب کرده بود، پیشی گرفت.

علاوه بر وظایف سازمانی، این مدل در چندین حوزه سخت آکادمیک نیز پیشتاز است. این نتایج صرفاً پیروزی‌های اتفاقی در حوزه‌های محدود (Thin-field) نیستند؛ زیرا مدل در شلوغ‌ترین جداول رده‌بندی، یعنی MMLU-Pro (با ۱۴۱ مدل شرکت‌کننده) و GPQA (با ۱۱۱ مدل شرکت‌کننده)، رتبه اول را در اختیار دارد:

  • علوم و دانش: GPQA Diamond (۹۴.۴۴) و MMLU-Pro (۸۸.۱۲)
  • ریاضیات: AIME ۲۰۲۶ (۱۰۰) و HMMT ۲۰۲۶ (۱۰۰)
  • حقوق: LEXam (۶۸.۹۴) و LEXam-hard (۴۵.۷۲)
  • تحلیل اسناد: MDPBench (۸۳.۶۵)
  • استدلال بصری: MMMU-Pro (۷۹.۴۸)

این عملکرد خیره‌کننده در ریاضیات، تداوم موفقیت‌های اخیر این مدل است که پیش‌تر به عنوان نخستین مدل با امتیاز ۱۰۰٪ در AIME معرفی شد و استانداردهای جدیدی برای استدلال پیچیده تعریف کرد.

مدل ۱۸۰ میلیارد پارامتری باز، صدرنشین ۱۰ جدول رسمی Hugging Face و قاضی بدون توکن پشت آن

سازوکار: بهبود خودکار بازگشتی (RSI)

به نقل از گزارش dev.to، این مدل به‌طور خاص برای متون حقوقی یا استخراج داده از PDF تنظیم دقیق (Fine-tuning) نشده است. در عوض، از روش بهبود خودکار بازگشتی (Recursive Self-Improvement یا RSI) در سطح مدل استفاده می‌کند. در این روش، مدل مسائل قابل‌راستی‌آزمایی را به‌طور مستقل حل می‌کند و تنها پاسخ‌هایی را نگه می‌دارد که از نظر ریاضی یا منطقی درست هستند.

مدل با آموزش روی این مجموعه داده‌های فیلترشده و تولیدشده توسط خودش، عادت‌های استدلالی را تقویت می‌کند بدون اینکه خطاهای خود را تکرار یا تقویت کند. این رویکرد در واقع پیاده‌سازی عملی استراتژی «افزایش بودجه تفکر» است که برای رفع خطاهای توکنی در استدلال‌های پیچیده به کار گرفته شده. از آنجا که در این حلقه نیازی به پاسخ‌های نوشته‌شده توسط انسان یا راهکارهای گام‌به‌گام انسانی نیست، مدل هوش خود را از طریق خوداصلاحی مقیاس می‌کند. موفقیت در حوزه‌های حقوق و استخراج داده، یک سیگنال قابل مشاهده است که نشان می‌دهد عادت‌های استدلالی کلی، به حوزه‌های تخصصی منتقل می‌شوند.

باید توجه داشت که نمرات جداول رده‌بندی بازتاب‌دهنده نحوه ارزیابی و ارسال هر بنچمارک است. از آنجا که هر جدول رده‌بندی روش نرمال‌سازی متفاوتی دارد، این رتبه‌ها باید به عنوان یک «پورتفولیو از قابلیت‌ها» دیده شوند، نه یک عدد واحد برای ضریب هوشی جهانی.

ZTC: داور بدون توکن

در کنار این مدل، VIDRAFT متد ارزیابی ZTC (Zero-Token Confidence) را برای عامل‌های هوش مصنوعی (AI Agents) معرفی کرد. وقتی عامل‌ها شروع به انجام کارهای حساسی مانند پرداخت وجه، ارسال ایمیل یا اجرای کد می‌کنند، شناسایی یک اقدام اشتباه پیش از اجرا، یک چالش مهندسی حیاتی است. حفاظ‌های (Guardrails) سنتی از مدل دومی می‌خواهند که نظر خود را به‌صورت متنی بنویسد که این کار باعث افزایش تأخیر (Latency)، مصرف توکن و اغلب نیاز به ارسال داده‌ها به یک API خارجی می‌شود.

اما ZTC به‌جای تولید متن، حالت‌های نهان (Hidden States) داخلی مدلی که اقدام را تولید کرده است، تنها یک بار می‌خواند و احتمال درست بودن آن اقدام را محاسبه می‌کند. در این روش، تعداد توکن‌های تولیدشده اضافی صفر است.

در یک تست رودررو روی محیط Gate Arcade (یک snapshot از استقرار شبکه بسته در ۲۴ سپتامبر ۲۰۲۶)، ZTC برتری چشمگیری در سرعت نشان داد:

  • زمان داوری: ZTC برای هر فراخوانی ۰.۰۶۱۵ ثانیه زمان برد، در حالی که داور API خارجی (JEV) به ۰.۵۹۱ ثانیه نیاز داشت.
  • توان عملیاتی (Throughput): ZTC در ۳۰۰ ثانیه ۱۷۷ داوری را انجام داد، در حالی که داور API تنها ۱۳۵ مورد را پردازش کرد.
  • صحت: سطح زیر منحنی (AUC) برای ZTC (۰.۷۲۸۹) از نظر آماری با داور API (۰.۷۳۵۰) برابر بود.

در یک رقابت ۲۰۰۰ دوره‌ای، ZTC بر اساس امتیاز ترکیبی سرعت و صحت، در ۷۳.۷ درصد دورها پیروز شد. با استفاده از این رویکرد، یک مدل مجزا توانست صحت داوری پاسخ‌های خودش را از ۰.۷۶ به ۰.۸۸ ارتقا دهد.

پیاده‌سازی ZTC و بستر عملیاتی

ZTC به‌صورت محلی روی GPU اجرا می‌شود و داده‌ها هرگز شبکه را ترک نمی‌کنند. این ویژگی آن را برای استقرارهای ایزوله (Air-gapped) در بخش‌های مالی، دفاعی یا دولتی ایده‌آل می‌کند. این سیستم مانند یک گیت ارزان‌قیمت عمل می‌کند و تنها در موارد مشکوک و نامطمئن، اقدام را به بررسی‌های سنگین‌تر سیاست‌گذاری (Policy Check) ارجاع می‌دهد.

مسیر فراخوانی مفهومی ZTC به‌طور کامل از حلقه تولیدی عبور می‌کند:
۱. مدل یک گذر پیشرو (Forward Pass) برای به‌دست آوردن لاجیت‌ها (Logits) و حالت‌های نهان انجام می‌دهد.
۲. اقدام کاندید از روی لاجیت‌ها رمزگشایی می‌شود.
۳. یک لایه مخصوص (ztc_head) حالت نهان را برای تعیین سطح اطمینان می‌خواند.
۴. اگر اطمینان زیر حد آستانه باشد، اقدام متوقف می‌شود؛ در غیر این صورت اجرا می‌گردد.

این فناوری در فضای شلوغی از داورها وارد شده است. APIهای JEV شرکت Typesafe یک رابط استاندارد (de facto) ایجاد کرده‌اند، جدول عمومی Decision Index بیش از ۷۰ مدل را لیست کرده و Cloudflare اخیراً یک داور سازگار با JEV عرضه کرده که در چند روز ۱۱۰۰ لایک در Hugging Face گرفت. گروه‌های پژوهشی در استنفورد و انویدیا نیز مدل‌های مشابهی منتشر کرده‌اند. تفاوت بنیادین ZTC در این است که به‌جای اینکه از مدل بخواهد «صحبت کند»، مستقیماً «درون» مدل را می‌خواند.

تحلیل: بازتعریف کاربرد مدل‌ها

برای جامعه فنی، این پیشرفت این فرض را تغییر می‌دهد که برای استخراج داده با عملکرد بالا یا استدلال حقوقی، حتماً به تنظیم دقیق (Tuning) دامنه خاص نیاز است. اگر RSI بتواند استدلال‌های قابل انتقال تولید کند، ارزش مجموعه‌داده‌های تخصصی که توسط انسان برچسب‌گذاری شده‌اند، در مقایسه با ارزش مجموعه‌های مسائل قابل‌راستی‌آزمایی کاهش می‌یابد.

علاوه بر این، سازوکار ZTC «مالیات تأخیر» (Latency Tax) در ایمنی هوش مصنوعی را برطرف می‌کند. VIDRAFT با انتقال از داوری‌های تولیدی به تحلیل حالت‌های داخلی ثابت کرد که می‌توانیم حفاظ‌های ایمنی را بدون قربانی کردن پاسخگویی آنی (Real-time) مورد نیاز برای عامل‌های خودمختار حفظ کنیم.

این تغییر نشان می‌دهد که مرز بعدی مدل‌های وزن‌باز، صرفاً افزایش تعداد پارامترها نیست، بلکه ایجاد حلقه‌های خوداصلاحی کارآمدتر و سیستم‌های نظارتی غیرتولیدی است. برای مشاهده این قابلیت‌ها در عمل، می‌توانید نسخه‌های پایه و R3 را که تحت سازمان FINAL-Bench در Hugging Face منتشر شده‌اند، بررسی کنید.

چرا این موضوع مهم است؟

این مدل با تکیه بر اعتبار بنچمارک‌های Hugging Face ثابت کرد که مدل‌های وزن‌باز می‌توانند در وظایف حساس سازمانی از مدل‌های بسته پیشی بگیرند. همچنین معرفی ZTC نشان می‌دهد که ایمنی هوش مصنوعی می‌تواند بدون پرداخت «مالیات تأخیر» در استنتاج محقق شود.

تأثیر برای ایران

به‌دلیل وزن‌باز بودن مدل، توسعه‌دهندگان ایرانی می‌توانند بدون نیاز به APIهای تحریمی، قابلیت‌های استخراج داده سطح بالا را به‌صورت محلی (On-premises) پیاده‌سازی کنند.

·نگاه ما
تحریریه دات‌هوش

این پیشرفت فرضیه نیاز به تنظیم دقیق (Fine-tuning) تخصصی برای استخراج داده‌های پیچیده را به چالش می‌کشد. اگر بهبود خودکار بازگشتی (RSI) بتواند استدلال‌های منتقل‌پذیر ایجاد کند، ارزش مجموعه‌داده‌های انسانی برچسب‌گذاری‌شده کاهش یافته و تمرکز بر ایجاد مجموعه‌های «مسائل قابل‌راستی‌آزمایی» افزایش می‌یابد. همچنین، حذف تأخیر در لایه ایمنی از طریق تحلیل حالت‌های نهان، مسیر را برای عامل‌های خودمختاری که نیاز به پاسخ‌دهی در میلی‌ثانیه دارند، هموار می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.