تصور کنید یک برنامهنویس بخواهد هزاران درخواست ساده را بدون پرداخت هزینههای گزاف مدلهای غولپیکر مدیریت کند. مدل mtlm-router با ۷.۲ میلیون پارامتر، دقیقاً همین کار را انجام میدهد و در حدود ۱۵ میلیثانیه روی یک CPU لپتاپ، تصمیم میگیرد که هر درخواست به کجا برود.
طبق گزارشی که در ۲۴ سپتامبر ۲۰۲۶ منتشر شد، این پروژه ثابت میکند که یک مدل کوچک اگر آموزش ببیند در صورت عدم اطمینان «نه» بگوید، میتواند به طور موثری ترافیک درخواستها را مدیریت کند. در حال حاضر اکثر معماریهای هوش مصنوعی هر درخواستی — از یک جمع ساده تا یک مقاله پیچیده — را به مدلهای عظیم میفرستند که منجر به تأخیر بالا و هزینههای سنگین میشود.
این رویکرد با هر تعامل را مانند یک مسئله استدلالی سخت میبیند. اما mtlm-router مانند یک نگهبان در ورودی عمل میکند؛ او خودش به سؤال پاسخ نمیدهد، بلکه فقط تصمیم میگیرد که سؤال به کدام اتاق منتقل شود. همانطور که در بحثهای گذشته ما دربارهی بهینهسازی هزینههای استنتاج اشاره کردیم، جداسازی لایه تصمیمگیری از لایه پاسخدهی، کلید مقیاسپذیری است.
به نقل از گزارش dev.to، این سامانه کاملاً بدون چارچوبهای استاندارد یادگیری ماشین مانند PyTorch یا ONNX ساخته شده است. توسعهدهنده برای این کار از زبانی اختصاصی به نام machin/MFL استفاده کرده تا یک فایل باینری استاتیک و یک مدل ۸ مگابایتی با دقت int8 تولید کند.
مشخصات فنی
- اندازه مدل: ۷.۲ میلیون پارامتر
- تأخیر: حدود ۱۵ میلیثانیه برای هر فراخوانی روی CPU
- حجم نهایی: ۷.۵ مگابایت (کل بسته نرمافزاری)
- معماری: تنه ثابت با سرهای خطی بسیار کوچک (حدود ۷ کیلوبایت) برای مسیرهای مشتریان خاص
تصمیمات مسیریابی بر اساس کالیبراسیون (Calibration) — یعنی تطبیق میزان اطمینان مدل با احتمال درست بودن پاسخ — صورت میگیرد. اگر سرِ تصمیمگیرنده و تنه تولیدکننده با هم اختلاف داشته باشند یا امتیاز اطمینان پایین باشد، سیستم دستور «تفویض» صادر میکند تا درخواست به یک مدل بزرگتر ارجاع داده شود.
برای حل مشکل «اعتماد به نفس کاذب» که در آن مدلها با اطمینان زیاد پاسخ غلط میدهند، ابزاری به نام refit_temp.py معرفی شده است. این ابزار به کاربر اجازه میدهد با استفاده از حدود ۵۰ ردیف داده واقعی، دمای (Temperature) — که شبیه به پیچ تنظیم خلاقیت و ریسکپذیری مدل است — را بازتنظیم کند تا امتیاز ۰.۹ واقعاً به معنای ۹۰٪ احتمال درست بودن باشد. این دقت در کالیبراسیون برای عبور از شکاف ارزیابی و تبدیل مدلهای آزمایشگاهی به محصولات تجاری حیاتی است.
این تغییر رویکرد نشان میدهد که آینده هوش مصنوعی کارآمد، لزوماً در مدلهای بزرگتر نیست، بلکه در لایههای «تریاژ» هوشمندتر است. با تفکیک مسیریابی از استدلال، توسعهدهندگان میتوانند قدرت مدلهای پیشرو را حفظ کنند و همزمان هزینه عملیاتهای روتین را به شدت کاهش دهند.
برای کسانی که در حال ساخت گردشهای کاری عاملمحور (Agentic) هستند، این مدل ثابت میکند که استفاده از یک مدل ۰.۶ میلیارد پارامتری برای طبقهبندی نیت کاربر، اغلب زیادهروی است. در واقع، برای جلوگیری از شکست عاملهای هوشمند در محیطهای پیچیده، استفاده از ساختارهای منظم مانند DDD در کنار لایههای تریاژ، دقت سیستم را دوچندان میکند. یک مدل ۷ میلیونی که صادقانه عدم اطمینان خود را اعلام کند، برای محیطهای عملیاتی قابلاعتمادتر از مدلهای بزرگتری است که در مورد میزان اطمینان خود دچار توهم (Hallucination) — شبیه به دوستی که خاطرهای را اشتباه اما با اطمینان تعریف میکند — میشوند.
توسعهدهندگان میتوانند این پیادهسازی را از طریق مخزن گیتهاب پروژه تست کرده یا وزنهای منتشر شده در Hugging Face را مستقر کنند.
گام بعدی شما
- اگر از مدلهای گرانقیمت برای کارهای تکراری استفاده میکنید، معماری لایه تریاژ را در سیستم خود پیاده کنید.
- ابزار refit_temp.py را برای کالیبره کردن نرخ خطای مدلهای کوچک خود به کار بگیرید.
- بررسی کنید آیا طبقهبندی نیت (Intent Classification) در پروژه شما واقعاً به مدلهای میلیاردی نیاز دارد یا خیر. این بهینهسازی به شما کمک میکند تا حتی با سختافزارهای مصرفی، زیرساختهای تولیدی قدرتمندی ایجاد کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو