تصور کنید در یک پروژهٔ تحلیل دادههای پزشکی با ۴۰۰ هزار خط کد، تنها ۷.۵٪ از درخواستهای ارسالی به مدل، ۶۳٪ از کل بودجهٔ توکنهای شما را مصرف کنند. این عدد ثابت میکند که صورتحسابهای گرانقیمت هوش مصنوعی اغلب نتیجهٔ نقص در طراحی ابزارهاست، نه محدودیتهای مدل زبانی.
این یافتهها حاصل گزارش فنی KinetAios است؛ یک داشبورد چندموتوره برای اجرای همزمان عاملها که با مجوز GPLv3 برای سیستمهای مک و ویندوز عرضه شده است. اکثر توسعهدهندگان هزینه را تابعی از قیمت هر توکن میبینند، اما این محک نشان میدهد که نحوهٔ تعامل یک عامل (Agent) — شبیه دستیاری که ابزارهای مختلف را برای انجام کار به کار میگیرد — با فایلهای محلی میتواند «تقویتکنندهٔ توکن» ایجاد کند و بودجه را به سرعت تخلیه کند. این چالشهای عملیاتی در مدیریت عاملها، در حالی رخ میدهد که چارچوبهای پیشرفتهتری مانند LangGraph با نرخ موفقیت ۹۴.۴٪ توانستهاند در رقابت با سایر سیستمهای عاملمحور پیشی بگیرند.
به نقل از مستندات این پروژه، بدترین مورد در این آزمایش، فایلی حجیم را ۱۶ بار بهصورت متوالی خوانده و در هر بار، تمام تاریخچهٔ گفتگو را دوباره ارسال کرده است. در واقع مدل احمق نبود، بلکه طراحی ابزار ناقص بود.
همانطور که در تحلیلهای قبلی ما دربارهی بهینهسازی هزینههای استنتاج اشاره کردیم، مدیریت پنجرهٔ زمینه کلید سودآوری در مقیاس است. در این پروژه، یک مدل زبانی بزرگ (LLM) — مثل کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب میدهد — باید بتواند بدون تکرار دادهها، به اطلاعات دسترسی داشته باشد.
جزئیات محیط محک
وظیفهٔ محولشده یک کار واقعی و پیچیده بود: تحلیل متقاطع یک مجموعه دادهٔ CRM با ۴۰۰ هزار خط که شامل فایلهای اکسل چند-برگی (سطوح بیمارستان در بازههای زمانی مختلف) بود تا یک گزارش تعاملی ECharts تولید شود. این یک آزمون ساده نبود، بلکه تسکی چندساعته بود که در آن چهار موتور بدون دخالت انسان و با حسابداری دقیق توکنها رقابت کردند:
- Direct (حلقه ReAct داخلی): با امتیاز ۹.۲ از ۱۰ و مصرف ۱.۳۱ میلیون توکن. موفقیت این مدل مدیون استفاده از خوانندهٔ جریانی SAX بود که اجازه نمیداد فایلهای حجیم وارد پنجرهٔ زمینه (Context Window) — شبیه میز کاری که فقط جای چند ورق دارد — شوند.
- Claude Code (رابط خط فرمان آنتروپیک): امتیاز ۷.۰ با مصرف حدود ۲ میلیون توکن. بهترین مدیریت زمینه را داشت اما نبود ابزارهای افزونه، آن را مجبور کرد در هر مرحله مسیرهای طولانیتری را از طریق Bash و Python طی کند. این بهرهوری در ابزارهای آنتروپیک با رویکرد کلی این شرکت همسو است، چرا که مدل Claude اکنون هدایت ۲۶٪ از پژوهشهای داخلی خود این شرکت را بر عهده دارد.
- Codex (رابط خط فرمان OpenAI): امتیاز ۵.۵ با مصرف ۲.۴ میلیون توکن. طراحی این مدل که اولویت را به محیط ایزوله (Sandbox) میدهد، با نیازهای تحلیل دادههای تعاملی در تضاد بود.
- PEVJ V2 (برنامهریزی-اجرا-تأیید-قضاوت): امتیاز ۳.۵ با مصرف بیش از ۳.۸ میلیون توکن. مرحلهٔ تأیید بدون داشتن حفاظهای لازم، مانند یک تقویتکننده توکن عمل کرد و کمترین بهرهوری را داشت.
طبق این گزارش، راهکار کاهش هزینهها نه در پرامپتهای بهتر و نه در مدلهای ارزانتر، بلکه در پیادهسازی یک خوانندهٔ جریانی (Streaming Reader) است که گرانترین بخش بودجه را به صفر رساند. اگر ابزاری میسازید که به مدل اجازه میدهد با فایلهای حجیم تعامل کند، قبل از تنظیم پرامپتها، هزینهٔ هر فراخوانی ابزار را اندازهگیری کنید.
اقتصاد روزمره در دنیای واقعی
در یک روز کاری معمولی با KinetAios، میتوان جلسات موازی با موتورهای مختلف را برای تعادل بین هزینه و قدرت مدیریت کرد:
- جلسه الف: استفاده از Claude Code (Sonnet) برای بازنویسی یک ماژول ۸۰۰ خطی (۲.۴۱ دلار).
- جلسه ب: استفاده از Codex (o4-mini) برای رفع ۱۷ تست شکستخورده (۰.۸۷ دلار).
- جلسه ج: استفاده از Direct (GLM) برای بازیابی کد و پرسشوپاسخ مستندات (۰.۱۲ دلار).
- جلسه د: استفاده از Direct (GLM) برای خانهتکانی حافظه بلندمدت (۰.۰۳ دلار).
مجموع هزینه روزانه ۳.۴۳ دلار شد. این یعنی مدلهای گران برای کارهای سخت و مدلهای ارزان برای کارهای مکانیکی؛ اما این استراتژی تنها زمانی جواب میدهد که جلسات بهصورت موازی و با انتخاب مدل مجزا اجرا شوند.
درسهای مهندسی برای عاملهای چندموتوره
۱. ایزولاسیون کامل وضعیت: توسعهدهنده با باگی مواجه شد که در آن جلسه الف منتظر تأیید دستور بود، اما جلسه ب آن را مصرف میکرد. برای جلوگیری از این تداخل، هر جلسه اکنون صف تأیید و زمینه ابزار مخصوص به خود را دارد.
۲. زیرساخت SQLite WAL: استفاده از Write-Ahead Logging تضمین میکند که خوانندگان هرگز مانع نویسنده نشوند. این قابلیت اجازه میدهد تاریخچه جلسات را مرور کنید در حالی که جلسه جاری در حال نوشتن است.
۳. چالش FTS5: توکنساز پیشفرض unicode61 در FTS5 برای متون چینی فاجعهبار است. پروژه برای بهبود بازیابی کاربران غیرانگلیسی، از ایندکس سفارشی و bigram استفاده کرد.
مدل امنیتی «اول-محلی»
این معماری صرفاً یک ویژگی بازاریابی نیست، بلکه یک مدل تهدید است. عامل تمام دستورات شل، فایلها، تاریخچه SQLite و ایندکس برداری را روی ماشین کاربر اجرا میکند. تنها بخش ابری، کلید API کاربر برای استنتاج (Inference) — لحظهای که مدل واقعاً جواب تولید میکند — است. نسخه رایگان کاملاً روی مدلهای محلی Ollama اجرا میشود و هیچ سرور واسط یا تلهمتری وجود ندارد تا کدها از دست شخص ثالث عبور کنند.
چالشهای باقیمانده
برخی موانع همچنان وجود دارند؛ از جمله الگوی «تأیید مودال» که با بیش از ۳ عامل موازی دشوار میشود. همچنین خلاصهسازی بیش از ۴۰ ساعت متن جلسات بدون محدودیت، همچنان یک مسئله باز است و به دلیل تکنفره بودن توسعهدهنده، نسخه ویندوز معمولاً یک هفته عقبتر از مک است.
گام بعدی شما
- داشبورد KinetAios را از گیتهاب دریافت کنید تا قدرت اجرای موازی مدلهای مختلف را تجربه کنید.
- در ابزارهای خود، به جای بهینهسازی پرامپت، ابتدا مکانیزم خواندن فایلها را به حالت جریانی (Streaming) تغییر دهید.
- برای کارهای تکراری و مکانیکی، از مدلهای کوچکتر (SLM) در جلسات مجزا استفاده کنید تا هزینه استنتاج را کاهش دهید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو