پرش به محتوای اصلی
پرش به محتوای مقاله

چرا انتقال تعاریف ابزار به زمان اجرا، مصرف توکن عامل‌ها را ۹۸.۷ درصد کاهش داد؟

·۲۰ اردیبهشت ۱۴۰۵۲ دقیقه مطالعه
چرا انتقال تعاریف ابزار به زمان اجرا، مصرف توکن عامل‌ها را ۹۸.۷ درصد کاهش داد؟
اشتراک‌گذاری

باید بدانید که گلوگاه مقیاس‌پذیری عامل‌ها (Agents) دیگر هوش مدل نیست، بلکه بهره‌وری پنجره متنی (Context Window) است. تصور کنید برای هر درخواست ساده، مجبور باشید کل نقشه‌ی شهر را دوباره برای مدل ارسال کنید تا فقط یک کوچه را پیدا کند.

در طول سال ۲۰۲۵، مهندسان با پدیده‌ی تورم توکن (Token Bloat) دست‌وپنجه نرم می‌کردند؛ جایی که بارگذاری تمام طرح‌واره‌های ابزار در ابتدای هر جلسه، بخش بزرگی از حافظه مدل را می‌بلعید. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی تلاش‌های Anthropic در زمینه‌ی همراستاسازی (Alignment) و اخلاقیات اشاره کردیم، این شرکت اکنون به سراغ رفع تنگناهای عملیاتی در مقیاس صنعتی رفته است.

طبق گزارش dev.to، این تحول فنی از طریق Code Mode محقق شده است. در این رویکرد، تعاریف ابزارها از بافت جلسه خارج شده و به زمان اجرا (Runtime) منتقل می‌شوند. بر اساس مستندات این شرکت، این سازوکار بر دو رکن استوار است: استفاده از Bash برای فایل‌های باینری و واردات ماژول‌های تایپ‌شده (Typed Module Imports) برای APIهای اختصاصی. نتایج این تغییر در مقیاس واقعی خیره‌کننده است:

  • کاهش توکن: یک گردش‌کار با ۱۵۰ هزار توکن، به تنها ۲ هزار توکن کاهش یافت.
  • رشد زیرساختی: تعداد دانلودهای MCP SDK در سال ۲۰۲۶ از ۱۰۰ میلیون در ابتدای سال به ۳۰۰ میلیون رسید.
  • مقیاس سازمانی: شرکت Cloudflare توانست طرح‌واره‌ی API خود با ۲۵۰۰ نقطه-پایان (Endpoint) را که پیش‌تر ۱.۱۷ میلیون توکن می‌طلبید، به تنها ۱ هزار توکن برساند.

حل مناقشه MCP و CLI با Code Mode انثروپیک: کاهش ۹۸٫۷٪ توکن

در پارادایم قبلی، یک چیدمان MCP با ۵ سرور، پیش از شروع هر عملیات ۵۵ هزار توکن مصرف می‌کرد. اما Code Mode این منطق را برعکس می‌کند: مدل اکنون تنها چند خط TypeScript یا Bash می‌نویسد تا دقیقاً ابزارهای مورد نیاز برای آن لحظه را فراخوانی کند.

حل بحث MCP و CLI با حالت کد Anthropic: کاهش ۹۸.۷٪ توکن

این تغییر، تمرکز صنعت را از مهندسی پرامپت (Prompt Engineering) به سمت مهندسی زمان اجرا (Runtime Engineering) سوق می‌دهد. به باور تحلیلگران، اثر ثانویه این تحول، کاهش شدید هزینه‌های استنتاج (Inference) و تأخیر (Latency) برای عامل‌های سازمانی است.

گام بعدی شما

  • بررسی آخرین نسخه‌ی MCP SDK در سه ماهه‌ی دوم ۲۰۲۶ برای استقرار الگوی Runtime.
  • پیاده‌سازی الگوی «جستجو و اجرا» (Search-and-Execute) برای مدیریت APIهای حجیم.
  • تحلیل اثر کاهش توکن بر کاهش هزینه‌های ماهانه API در پروژه‌های عامل‌محور.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این تغییر با تکیه بر تخصص در مهندسی سیستم‌های توزیع‌شده، هزینه‌های عملیاتی عامل‌های هوش مصنوعی را به شدت کاهش می‌دهد. این یعنی سازمان‌ها می‌توانند بدون نگرانی از محدودیت توکن، هزاران ابزار تخصصی را در اختیار مدل قرار دهند.

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

موضوع‌ها

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.