اگر امروز برای اجرای عاملهای کدنویسی هزینههای سنگینی میپردازید، احتمالاً نیمی از این مبلغ صرف پردازشهای سادهای میشود که نیازی به مدلهای گرانقیمت ندارند. طبق گزارش منتشر شده در ۳۰ سپتامبر ۲۰۲۶، ابزار متنباز Weave Router 2.0 توانسته است نرخ موفقیت مدل GPT-6 Astra را در محکهای کلیدی کدنویسی، اما با ۵۲٪ هزینه کمتر به دست آورد. این ابزار به عاملهای کدنویسی اجازه میدهد تا بر اساس پیچیدگی هر وظیفه، مدل مورد استفاده را بهصورت پویا تغییر دهند.
تصور کنید یک عامل کدنویسی بهجای اینکه برای هر کار کوچک از یک مغز فوقسنگین و گران استفاده کند، مانند تیمی از متخصصان عمل کند؛ یعنی برای طراحی معماری سیستم از یک مدل پیشرو و برای تغییرات سادهی CSS از یک مدل سبک استفاده کند. این رویکرد، مدل زبانی بزرگ (LLM) — که شبیه کتابخانهداری است که میلیاردها صفحه را خوانده و حالا با همان لحن جواب میدهد — را از یک همهفنحریف به یک عضو متخصص در یک تیم تبدیل میکند.
زمینه و موارد استفاده
همانطور که در تحلیلهای قبلی ما دربارهی بهینهسازی هزینههای استنتاج اشاره کردیم، جداسازی لایهی تصمیمگیری از لایهی تولید محتوا، کلید مقیاسپذیری است. Weave Router مستقیماً به عاملهای موجود مانند Claude Code یا Codex متصل میشود و وظایف را به هوشمندانهترین شکل ممکن به مناسبترین مدل در لیست موجود میسپارد. این رویکرد یادآور تلاشهای اخیر آنتروپیک است که در بازطراحی Projects برای تبدیل دستیار چت به یک موتور ارکستراسیون گامهای مشابهی را برای مدیریت موازی عاملها برداشت. برای مثال، کارهای دشوار عیبیابی یا طراحی پیچیده سیستم به Astra سپرده میشود، در حالی که بهروزرسانیهای سادهی فرانتاند توسط Deepseek v4 Flash انجام میگیرد.
این استراتژی فرضیه اولیه توسعهدهندگان را تأیید میکند: مجموعهای از مدلها (Ensemble) میتوانند از هر مدل واحدی بهتر عمل کنند. با جداسازی «هوش» از «مسیریابی»، تیمها میتوانند بدون کاهش کیفیت خروجی نهایی، تأخیر (Latency) و بودجه خود را بهینه کنند. این بهینهسازی در کنار پیشرفتهای مدلهای تخصصی، مانند مدل Muse Spark 1.3 متا که مصرف توکنها را در کدهای پیچیده کاهش داد، مسیر کاهش هزینههای عملیاتی را هموارتر میکند.
بر اساس مستندات فنی این پروژه، در محک Terminal Bench 4.0، این مسیریاب به نرخ موفقیت مشابه Astra رسید اما تنها ۵۲٪ هزینه داشت و ۲.۲ برابر سریعتر بود. نتایج مشابهی در محک SWE Atlas دیده شد؛ جایی که هزینه ۵۴٪ کمتر و سرعت ۲.۵ برابر بیشتر از مدل تکسرویس Astra بود.
جزئیات فنی و گشایش معماری
به نقل از توسعهدهندگان این ابزار، آموزش مدلی برای مسیریابی مؤثر یک مسئله دشوار است که نیازمند ایجاد تعادل بین قابلیتهای مدل، هزینهها و آگاهی از حافظه پنهان (Cache) است. دستیابی به این اعداد نیازمند سه تغییر معماری کلیدی بود:
- مسیریابی مبتنی بر HMM: در ابتدا از یک مدل یادگیری تقویتی (RL) بدون پیشفرضهای زیاد استفاده شد، اما هزینه اکتشاف کامل فضای مسیریابی بسیار بالا بود. اکنون آنها از مدل مارکوف پنهان (HMM) برای ردیابی وضعیت جلسه استفاده میکنند. این یعنی مسیریاب نه تنها پرامپت فعلی، بلکه تاریخچه تکامل جلسه و نحوه پیشرفت آن را هم میفهمد.
- کاهش فضای جستوجو: در یک جلسه معمولی با ۱۰۰ نوبت گفتگو و لیستی از ۱۰ مدل که بر اساس معیار پارتو (Pareto) بهینه شدهاند، ۱۰ به توان ۱۰۰ مسیر ممکن وجود دارد. HMM جلسات را به «دستههای» مدلهای مشابه تقسیم میکند و گزینههایی را که منطقاً نمیتوانند به جلسه خدمت کنند، حذف میکند تا فضای جستوجو بهشدت کوچک شود.
- منطق تخلیه حافظه پنهان: یک زیرسیستم جدید، ارزش مورد انتظار از جابهجایی بین مدلها را در برابر هزینه بالای یکبارهی پر کردن حافظه پنهان (Cache) مدل جدید میسنجد. این کار از جابهجاییهای بیمورد و گرانقیمت جلوگیری میکند، مگر اینکه مزیت جابهجایی بیشتر از هزینه آن باشد؛ موضوعی که عامل اصلی بهبود هزینههاست.
دادهها و آموزش
برای راهاندازی اولیه این مدلها، تیم توسعه از مدلهای پیشرو (Frontier LLMs) برای برچسبگذاری مجموعهدادههای بزرگتر و متنوعتری از جلسات کدنویسی استفاده کرد. این کار سیگنالهای پاداش غنیتری برای یادگیری تقویتی (RL) فراهم کرد و وضعیت مدل HMM و طبقهبندیکننده (Classifier) را بهبود بخشید.
این دستاورد نشان میدهد آیندهی هوش مصنوعی عاملمحور لزوماً در ساخت مدلهای غولپیکر نیست، بلکه در لایههای ارکستراسیون پیچیده نهفته است. برای توسعهدهندگان، این بدان معناست که میتوان کیفیت سطح «مدلهای پیشرو» را در عاملهای خود حفظ کرد، بدون اینکه هزینههای نجومی آنها را پرداخت کنند.
این موضوع همچنین این فرض را به چالش میکشد که قدرتمندترین مدل، همیشه بهینهترین انتخاب برای خط لولهی تولید است. اگرچه تیم توسعه هنوز در تلاش است تا بهجای تساوی، بهطور مداوم از مدلهای Astra و Fable پیشی بگیرد، اما رسیدن به عملکرد برابر با مدلهای پیشرو یک نقطه عطف بزرگ است.
در حال حاضر کاربران میتوانند این مسیریاب متنباز را از طریق گیتهاب به عاملهای خود اضافه کنند یا از نسخهی میزبانیشده در weaveos.com استفاده نمایند.
گام بعدی شما
- اگر از چندین مدل API استفاده میکنید، معماری مسیریاب (Router) را برای کاهش هزینههای استنتاج بررسی کنید.
- مدلهای سبکتر مانند Deepseek Flash را برای وظایف تکراری و ساده در خط لولهی خود جایگزین کنید.
- تاثیر مدیریت حافظه پنهان (Cache) را بر تأخیر پاسخدهی در عاملهای خود اندازه بگیرید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو