پرش به محتوای اصلی
پرش به محتوای مقاله

مدل Drex 1.5 عملکرد سیستم‌های تصمیم‌گیر بسته را روی یک GPU شبیه‌سازی کرد

·۱۸ مهر ۱۴۰۵۵ دقیقه مطالعه
مدل تصمیم‌گیری ۹ میلیارد پارامتری Drex 1.5 که گزینه‌ها را امتیازدهی می‌کند، نه متن را
مدل تصمیم‌گیری ۹ میلیارد پارامتری Drex 1.5 که گزینه‌ها را امتیازدهی می‌کند، نه متن را
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی نخستین مدل تصمیم‌گیر با وزن‌های باز که در بنچمارک‌های تخصصی تصمیم‌گیری، عملکردی برابر با مدل‌های تجاری بسته در مقیاس ۹ میلیارد پارامتر ارائه می‌دهد.

۹ میلیارد پارامتر برای رقابت با سیستم‌های انحصاری و بسته روی یک GPU ۲۴ گیگابایتی کافی است. در ۱۰ اکتبر ۲۰۲۶، شرکت Nace.AI مدل Drex 1.5 را به صورت وزن‌های باز (Open Weights) منتشر کرد؛ مدلی که به‌طور اختصاصی برای عامل‌ها (Agents) و گردش‌کارهای بک‌اِند طراحی شده تا مجموعه‌ای از گزینه‌های ثابت را در یک گذر پیشرو (Forward Pass) امتیازدهی کند.

این عرضه در حالی رخ می‌دهد که صنعت به سمت هوش مصنوعی «غیرچت» حرکت می‌کند؛ مدل‌هایی که به جای نوشتن متن، به عنوان لایه مسیریابی منطقی برای عامل‌های پیچیده عمل می‌کنند. این مدل‌ها برخلاف مدل‌های زبانی رایج، نثر نمی‌نویسند بلکه به عنوان یک لایه هدایت‌کننده برای عامل‌های پیچیده عمل می‌کنند. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، نیاز به جایگزین‌های محلی برای مدل‌های تجاری رو به افزایش است. Drex 1.5 با تکیه بر دسته‌بندی ایجاد شده توسط مدل بسته Jev از شرکت TypeSafe AI، یک جایگزین برای توسعه‌دهندگانی فراهم می‌کند که به تصمیم‌گیری قطعی (Deterministic) بدون هزینه‌های نمونه‌گیری توکن نیاز دارند. این رویکرد یادآور تلاش‌های اخیر برای بهینه‌سازی فرآیندهای طبقه‌بندی است، مشابه آنچه در بهینه‌سازی فرآیند طبقه‌بندی متنی توسط Decisions API مشاهده شد.

معمار پلتفرم «استنتاج مایع» را راه‌اندازی کرد: حراج لحظه‌ای برای پردازش مدل‌های زبانی بزرگ

به نقل از کارت مدل منتشر شده توسط Nace.AI، مدل Drex 1.5 در محک عمومی Decision Index 0.3.1 به امتیاز ۵۸.۰۸ دست یافت. این عدد از نظر آماری با مدل بسته Jev 1.13.0 (۵۷.۹۶) برابر است و از مدل‌های Bespoke Nimble 9B v3 (۵۷.۱۹) و Cloudflare clef-flash (۵۶.۱۵) پیشی گرفته است.

سازوکار و زمینه

مدل Drex 1.5 یک مدل مولد (Generative Model) نیست؛ یعنی متن، کد یا توضیح نمی‌نویسد. در عوض، یک وضعیت (که به صورت متن یا JSON ارائه شده) و پرسش‌های تایپ‌شده را می‌خواند تا برای هر گزینه ارائه شده، یک احتمال بازگرداند. از آنجا که هیچ توکنی نمونه‌برداری نمی‌شود، پارامترهای استاندارد مدل‌های زبانی بزرگ مانند دما (Temperature) و top_p در اینجا کاربردی ندارند.

این مدل از سه نوع پرسش خاص پشتیبانی می‌کند: انتخابی (choice)، بله/خیر (noul) و امتیاز رتبه‌ای (ordinal score). همچنین از API مدل /v1/systemone پشتیبانی می‌کند که همان فرمت درخواست‌های Jev است. Nace تأیید کرده است که کلاینت‌های فعلی Jev می‌توانند تنها با تغییر چند متغیر محیطی به Drex 1.5 مهاجرت کنند.

معماری فنی و مشخصات

  • ستون فقرات: بر پایه MiMo-V2.6-Distill-Qwen-9B، نسخه‌ای دیستیل‌شده (Distilled) از Qwen 3.5 9B.
  • مکانیزم توجه: ۳۲ لایه با توجه (Attention) ترکیبی؛ به ازای هر لایه توجه کامل، سه لایه توجه خطی وجود دارد.
  • سر خروجی: یک سر اشاره‌گر (pointer head) مجزا (head.pt) که گزینه‌ها را از حالت‌های نهان امتیازدهی می‌کند. هر پرسش یک بار روی وضعیت به علاوه آن پرسش اجرا می‌شود.
  • پنجره زمینه: به‌طور پیش‌فرض ۱۶,۳۸۴ توکن که تا ۱۳۱,۰۷۲ توکن قابل گسترش است.
  • وزن‌ها: ۸.۹۵ میلیارد پارامتر متراکم. وزن‌های bf16 حدود ۱۸ گیگابایت فضا می‌گیرند و نسخه Q8_0 GGUF در ۹.۵ گیگابایت در دسترس است.
  • آموزش: مدل بر روی بخش‌های رسمی آموزش بنچمارک‌های ایندکس آموزش دیده و تنها روی بخش‌های کنار گذاشته شده (held-out splits) ارزیابی شده است.

Meet Together Link: ابزار خط فرمان رایگان برای اجرای مدل‌های باز مانند Kimi K3 و GLM 5.3 در Claude Code، Codex و OpenCode

تحلیل بنچمارک‌ها

بر اساس مستندات منتشر شده، Drex 1.5 در ۲۰ مورد از ۳۷ تست Decision Index 0.3.1 از Jev پیشی گرفته است. این بنچمارک شامل ۳۷ تست تصحیح‌شده است. بیشترین قدرت این مدل در بخش ابزارها (۷۵.۰) و کمترین آن در دانش و استدلال (۴۴.۶) است. در نسخه قدیمی‌تر Decision Index 0.2.1، مدل Drex امتیاز ۵۸.۲۸ را در مقابل ۵۷.۹۱ برای Jev کسب کرد. این رقابت میان مدل‌های تصمیم‌گیر در حالی رخ می‌دهد که برخی مدل‌های طبقه‌بندی پیش‌آموزش‌دیده در سرعت و دقت از مدل‌های تصمیم‌گیر پیشی گرفته‌اند.

در آزمون‌های رودررو در هشت بازی OpenSpiel، مدل Drex 1.5 با نرخ برد ۵۶.۸٪ (۱۲۲ برد، ۴۷ تساوی و ۸۷ باخت) در برابر Jev قرار گرفت. در بنچمارک JevBench (شامل ۲۳۱ مورد عمومی)، Drex امتیاز ۸۶.۲٪ را در مقابل ۸۷.۰٪ برای Jev به دست آورد، هرچند هر دو مدل در موارد دشوار به عدد ۷۳.۹٪ رسیدند.

پردازش اسناد طولانی یکی از نقاط قوت اصلی این مدل است:

  • ۸ هزار تا ۳۲ هزار توکن: صحت ۸۹.۵٪ (میانه زمان ۰.۶۵ ثانیه).
  • ۳۲ هزار تا ۱۲۸ هزار توکن: صحت ۹۳.۴٪ (میانه زمان ۲.۰ ثانیه).
  • اثر برش: کوتاه کردن این درخواست‌ها به ۸ هزار توکن، صحت را به شدت تا ۷۶.۵٪ و ۷۸٪ کاهش می‌دهد.

با این حال، مدل در دانش عمومی گسترده ضعف دارد. امتیاز آن در GPQA Diamond تنها ۴۵.۴٪ بود (در مقابل ۷۸.۶٪ برای Jev) و در MMLU-Pro امتیاز ۵۸.۷٪ را کسب کرد (در مقابل ۸۲.۷٪ برای Jev). همچنین در تحلیل دقیق احساسات، امتیاز F1 آن در ACOS aspect sentiment تنها ۷.۴٪ بود، در حالی که Jev به ۲۹.۵٪ رسید.

معمار پلتفرم استنتاج مایع را راه‌اندازی کرد: حراجی لحظه‌ای برای پردازش مدل‌های زبانی بزرگ

مسیرهای استقرار

توسعه‌دهندگان می‌توانند Drex 1.5 را از چهار مسیر اصلی مستقر کنند که همگی از یک API واحد استفاده می‌کنند:

  • پایتون (Kev runtime): با استفاده از inference.py و serve.py روی GPUهای CUDA.
  • llama.cpp: فورکی از Nace که از GGUF در bf16 یا Q8_0 روی CUDA، Metal یا CPU پشتیبانی می‌کند. در این محیط، وضعیت یک بار کدگذاری شده و بین پرسش‌ها به اشتراک گذاشته می‌شود.
  • Ollama: فورکی از Nace که قابلیت‌های تصمیم‌گیری خاصی را اضافه کرده است.
  • میزبانی‌شده: در OpenRouter با هزینه ۰.۰۴ دلار به ازای هر ۱ میلیون توکن ورودی و ۰ دلار برای توکن خروجی (توسط DeepInfra) یا از طریق Console API خود Nace.

تست‌های سخت‌افزاری روی AWS g5.2xlarge (با A10G 24 GB) نشان داد که نسخه‌های bf16 و Q8_0 پاسخ‌های یکسانی تولید می‌کنند. همچنین نسخه Q8_0 GGUF روی Apple M5 Pro با استفاده از هر دو حالت Metal و CPU نتایج مشابهی داشت. برای یکپارچگی با عامل‌ها، یک مهارت (skill) اختصاصی Drex اجازه اتصال مدل به Claude Code، Codex، Cursor، OpenCode، Hermes Agent، Gemini CLI و GitHub Copilot را می‌دهد. این بهینه‌سازی‌های سخت‌افزاری در محیط‌های محلی، مشابه مکانیزم‌های کاهش تأخیر در مدل‌های Gemma 4 روی مک‌بوک‌ها است که تجربه استقرار محلی را بهبود می‌بخشد.

برای جامعه فنی، این عرضه این فرض را می‌شکند که منطق تصمیم‌گیری سطح بالا نیازمند APIهای بسته است. Nace.AI ثابت کرد که مدل‌های ۹ میلیاردی دیستیل‌شده می‌توانند مسیریابی «سیستم ۱» یک پشته عامل‌محور را بدون کاهش دقت مدیریت کنند. این اتفاق عملاً لایه تصمیم‌گیری را به یک کالای عمومی تبدیل می‌کند و اجازه می‌دهد منطق حیاتی مسیریابی از APIهای پولی به زیرساخت‌های محلی و خصوصی منتقل شود. هزینه این جابجایی، کاهش دانش عمومی جهان است؛ اما برای یک مدل تصمیم‌گیر تخصصی، این یک قربانی محاسبه‌شده و پذیرفتنی است.

کاربران باید محدودیت‌های لایسنس RAIL-M را برای استفاده‌های تجاری زیر نظر داشته باشند و منتظر به‌روزرسانی‌های شاخه‌های اصلی llama.cpp و Ollama باشند تا ببینند آیا این قابلیت‌های تصمیم‌گیری در شاخه‌های اصلی ادغام می‌شوند یا خیر. همچنین Nace یک پاداش ۲۵ دلاری برای ثبت‌نام کاربران ابری ارائه می‌دهد.

گام بعدی شما

  • اگر از مدل‌های Jev استفاده می‌کنید، متغیرهای محیطی خود را برای تست Drex 1.5 تغییر دهید تا هزینه استنتاج خود را کاهش دهید.
  • برای کاربردهای نیازمند پردازش اسناد طولانی (تا ۱۲۸ هزار توکن)، از نسخه GGUF روی سخت‌افزارهای Apple Silicon استفاده کنید.
  • محدودیت‌های لایسنس RAIL-M را برای استفاده‌های تجاری بررسی کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با تکیه بر اعتبار بنچمارک Decision Index، ثابت می‌کند که لایه تصمیم‌گیری عامل‌های هوش مصنوعی را می‌توان به صورت محلی و رایگان جایگزین کرد. این موضوع باعث کاهش وابستگی توسعه‌دهندگان به APIهای گران‌قیمت برای عملیات مسیریابی (Routing) می‌شود.

تأثیر برای ایران

به‌دلیل وزن‌های باز و قابلیت اجرا روی GPUهای مصرف‌کننده (مانند سری RTX)، توسعه‌دهندگان ایرانی می‌توانند بدون نیاز به پرداخت ارزی برای APIهای بسته، لایه‌های تصمیم‌گیر عامل‌های خود را به‌صورت محلی مستقر کنند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی مدل‌های زبانی مولد با مدل‌های امتیازدهی (Scoring Models) در لایه‌های مسیریابی، نقطه عطفی در بهینه‌سازی هزینه استنتاج است. این رویکرد نشان می‌دهد که برای تصمیم‌گیری‌های منطقی، نیازی به تولید توکن‌های متنی نیست و می‌توان با یک سر خروجی ساده، دقت مدل‌های بسته را شبیه‌سازی کرد. در واقع، ما شاهد تفکیک «توانایی استدلال» از «توانایی بیان» هستیم.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.