۹ میلیارد پارامتر برای رقابت با سیستمهای انحصاری و بسته روی یک GPU ۲۴ گیگابایتی کافی است. در ۱۰ اکتبر ۲۰۲۶، شرکت Nace.AI مدل Drex 1.5 را به صورت وزنهای باز (Open Weights) منتشر کرد؛ مدلی که بهطور اختصاصی برای عاملها (Agents) و گردشکارهای بکاِند طراحی شده تا مجموعهای از گزینههای ثابت را در یک گذر پیشرو (Forward Pass) امتیازدهی کند.
این عرضه در حالی رخ میدهد که صنعت به سمت هوش مصنوعی «غیرچت» حرکت میکند؛ مدلهایی که به جای نوشتن متن، به عنوان لایه مسیریابی منطقی برای عاملهای پیچیده عمل میکنند. این مدلها برخلاف مدلهای زبانی رایج، نثر نمینویسند بلکه به عنوان یک لایه هدایتکننده برای عاملهای پیچیده عمل میکنند. همانطور که در تحلیلهای پیشین ما دربارهی امنیت مدلهای بازمتن اشاره کردیم، نیاز به جایگزینهای محلی برای مدلهای تجاری رو به افزایش است. Drex 1.5 با تکیه بر دستهبندی ایجاد شده توسط مدل بسته Jev از شرکت TypeSafe AI، یک جایگزین برای توسعهدهندگانی فراهم میکند که به تصمیمگیری قطعی (Deterministic) بدون هزینههای نمونهگیری توکن نیاز دارند. این رویکرد یادآور تلاشهای اخیر برای بهینهسازی فرآیندهای طبقهبندی است، مشابه آنچه در بهینهسازی فرآیند طبقهبندی متنی توسط Decisions API مشاهده شد.

به نقل از کارت مدل منتشر شده توسط Nace.AI، مدل Drex 1.5 در محک عمومی Decision Index 0.3.1 به امتیاز ۵۸.۰۸ دست یافت. این عدد از نظر آماری با مدل بسته Jev 1.13.0 (۵۷.۹۶) برابر است و از مدلهای Bespoke Nimble 9B v3 (۵۷.۱۹) و Cloudflare clef-flash (۵۶.۱۵) پیشی گرفته است.
سازوکار و زمینه
مدل Drex 1.5 یک مدل مولد (Generative Model) نیست؛ یعنی متن، کد یا توضیح نمینویسد. در عوض، یک وضعیت (که به صورت متن یا JSON ارائه شده) و پرسشهای تایپشده را میخواند تا برای هر گزینه ارائه شده، یک احتمال بازگرداند. از آنجا که هیچ توکنی نمونهبرداری نمیشود، پارامترهای استاندارد مدلهای زبانی بزرگ مانند دما (Temperature) و top_p در اینجا کاربردی ندارند.
این مدل از سه نوع پرسش خاص پشتیبانی میکند: انتخابی (choice)، بله/خیر (noul) و امتیاز رتبهای (ordinal score). همچنین از API مدل /v1/systemone پشتیبانی میکند که همان فرمت درخواستهای Jev است. Nace تأیید کرده است که کلاینتهای فعلی Jev میتوانند تنها با تغییر چند متغیر محیطی به Drex 1.5 مهاجرت کنند.
معماری فنی و مشخصات
- ستون فقرات: بر پایه MiMo-V2.6-Distill-Qwen-9B، نسخهای دیستیلشده (Distilled) از Qwen 3.5 9B.
- مکانیزم توجه: ۳۲ لایه با توجه (Attention) ترکیبی؛ به ازای هر لایه توجه کامل، سه لایه توجه خطی وجود دارد.
- سر خروجی: یک سر اشارهگر (pointer head) مجزا (head.pt) که گزینهها را از حالتهای نهان امتیازدهی میکند. هر پرسش یک بار روی وضعیت به علاوه آن پرسش اجرا میشود.
- پنجره زمینه: بهطور پیشفرض ۱۶,۳۸۴ توکن که تا ۱۳۱,۰۷۲ توکن قابل گسترش است.
- وزنها: ۸.۹۵ میلیارد پارامتر متراکم. وزنهای bf16 حدود ۱۸ گیگابایت فضا میگیرند و نسخه Q8_0 GGUF در ۹.۵ گیگابایت در دسترس است.
- آموزش: مدل بر روی بخشهای رسمی آموزش بنچمارکهای ایندکس آموزش دیده و تنها روی بخشهای کنار گذاشته شده (held-out splits) ارزیابی شده است.

تحلیل بنچمارکها
بر اساس مستندات منتشر شده، Drex 1.5 در ۲۰ مورد از ۳۷ تست Decision Index 0.3.1 از Jev پیشی گرفته است. این بنچمارک شامل ۳۷ تست تصحیحشده است. بیشترین قدرت این مدل در بخش ابزارها (۷۵.۰) و کمترین آن در دانش و استدلال (۴۴.۶) است. در نسخه قدیمیتر Decision Index 0.2.1، مدل Drex امتیاز ۵۸.۲۸ را در مقابل ۵۷.۹۱ برای Jev کسب کرد. این رقابت میان مدلهای تصمیمگیر در حالی رخ میدهد که برخی مدلهای طبقهبندی پیشآموزشدیده در سرعت و دقت از مدلهای تصمیمگیر پیشی گرفتهاند.
در آزمونهای رودررو در هشت بازی OpenSpiel، مدل Drex 1.5 با نرخ برد ۵۶.۸٪ (۱۲۲ برد، ۴۷ تساوی و ۸۷ باخت) در برابر Jev قرار گرفت. در بنچمارک JevBench (شامل ۲۳۱ مورد عمومی)، Drex امتیاز ۸۶.۲٪ را در مقابل ۸۷.۰٪ برای Jev به دست آورد، هرچند هر دو مدل در موارد دشوار به عدد ۷۳.۹٪ رسیدند.
پردازش اسناد طولانی یکی از نقاط قوت اصلی این مدل است:
- ۸ هزار تا ۳۲ هزار توکن: صحت ۸۹.۵٪ (میانه زمان ۰.۶۵ ثانیه).
- ۳۲ هزار تا ۱۲۸ هزار توکن: صحت ۹۳.۴٪ (میانه زمان ۲.۰ ثانیه).
- اثر برش: کوتاه کردن این درخواستها به ۸ هزار توکن، صحت را به شدت تا ۷۶.۵٪ و ۷۸٪ کاهش میدهد.
با این حال، مدل در دانش عمومی گسترده ضعف دارد. امتیاز آن در GPQA Diamond تنها ۴۵.۴٪ بود (در مقابل ۷۸.۶٪ برای Jev) و در MMLU-Pro امتیاز ۵۸.۷٪ را کسب کرد (در مقابل ۸۲.۷٪ برای Jev). همچنین در تحلیل دقیق احساسات، امتیاز F1 آن در ACOS aspect sentiment تنها ۷.۴٪ بود، در حالی که Jev به ۲۹.۵٪ رسید.

مسیرهای استقرار
توسعهدهندگان میتوانند Drex 1.5 را از چهار مسیر اصلی مستقر کنند که همگی از یک API واحد استفاده میکنند:
- پایتون (Kev runtime): با استفاده از inference.py و serve.py روی GPUهای CUDA.
- llama.cpp: فورکی از Nace که از GGUF در bf16 یا Q8_0 روی CUDA، Metal یا CPU پشتیبانی میکند. در این محیط، وضعیت یک بار کدگذاری شده و بین پرسشها به اشتراک گذاشته میشود.
- Ollama: فورکی از Nace که قابلیتهای تصمیمگیری خاصی را اضافه کرده است.
- میزبانیشده: در OpenRouter با هزینه ۰.۰۴ دلار به ازای هر ۱ میلیون توکن ورودی و ۰ دلار برای توکن خروجی (توسط DeepInfra) یا از طریق Console API خود Nace.
تستهای سختافزاری روی AWS g5.2xlarge (با A10G 24 GB) نشان داد که نسخههای bf16 و Q8_0 پاسخهای یکسانی تولید میکنند. همچنین نسخه Q8_0 GGUF روی Apple M5 Pro با استفاده از هر دو حالت Metal و CPU نتایج مشابهی داشت. برای یکپارچگی با عاملها، یک مهارت (skill) اختصاصی Drex اجازه اتصال مدل به Claude Code، Codex، Cursor، OpenCode، Hermes Agent، Gemini CLI و GitHub Copilot را میدهد. این بهینهسازیهای سختافزاری در محیطهای محلی، مشابه مکانیزمهای کاهش تأخیر در مدلهای Gemma 4 روی مکبوکها است که تجربه استقرار محلی را بهبود میبخشد.
برای جامعه فنی، این عرضه این فرض را میشکند که منطق تصمیمگیری سطح بالا نیازمند APIهای بسته است. Nace.AI ثابت کرد که مدلهای ۹ میلیاردی دیستیلشده میتوانند مسیریابی «سیستم ۱» یک پشته عاملمحور را بدون کاهش دقت مدیریت کنند. این اتفاق عملاً لایه تصمیمگیری را به یک کالای عمومی تبدیل میکند و اجازه میدهد منطق حیاتی مسیریابی از APIهای پولی به زیرساختهای محلی و خصوصی منتقل شود. هزینه این جابجایی، کاهش دانش عمومی جهان است؛ اما برای یک مدل تصمیمگیر تخصصی، این یک قربانی محاسبهشده و پذیرفتنی است.
کاربران باید محدودیتهای لایسنس RAIL-M را برای استفادههای تجاری زیر نظر داشته باشند و منتظر بهروزرسانیهای شاخههای اصلی llama.cpp و Ollama باشند تا ببینند آیا این قابلیتهای تصمیمگیری در شاخههای اصلی ادغام میشوند یا خیر. همچنین Nace یک پاداش ۲۵ دلاری برای ثبتنام کاربران ابری ارائه میدهد.
گام بعدی شما
- اگر از مدلهای Jev استفاده میکنید، متغیرهای محیطی خود را برای تست Drex 1.5 تغییر دهید تا هزینه استنتاج خود را کاهش دهید.
- برای کاربردهای نیازمند پردازش اسناد طولانی (تا ۱۲۸ هزار توکن)، از نسخه GGUF روی سختافزارهای Apple Silicon استفاده کنید.
- محدودیتهای لایسنس RAIL-M را برای استفادههای تجاری بررسی کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو