پرش به محتوای اصلی
پرش به محتوای مقاله

مالیاتِ گرانِ عامل‌ها: هزینهٔ ۴۳۶ هزار توکنی برای هر زیرعامل در Claude Code

·۲۹ مرداد ۱۴۰۵۴ دقیقه مطالعه۱ بازدید
هزینه زیرعامل Claude Code: ~۴۳۶ هزار توکن پیش از خواندن اولین فایل، با محاسبه نقطه سربه‌سر
هزینه زیرعامل Claude Code: ~۴۳۶ هزار توکن پیش از خواندن اولین فایل، با محاسبه نقطه سربه‌سر
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کشف یک هزینهٔ ثابت و سنگین (۴۳۶ هزار توکن) برای مقداردهی اولیه زیرعامل‌ها در Claude Code که پیش از این به عنوان یک فرآیند بهینه تصور می‌شد.

تصور کنید برای باز کردن یک پوشه در کامپیوتر، مجبور باشید ابتدا یک کتابخانه کامل را بخوانید. در Claude Code، این کابوس مالی واقعی است: ۴۳۶ هزار توکن (Token) — تکه‌های کوچکی از متن که مثل برش‌های یک کیک طولانی هستند و مدل آن‌ها را می‌خورد — هزینهٔ ایجاد تنها یک زیرعامل است، پیش از آنکه حتی یک خط کد را بخواند.

این «مالیاتِ ایجاد» (Spawn Tax) یک تخلیه مالی پنهان است که اگر توسعه‌دهندگان بدون محاسبهٔ نقطهٔ سربه‌سر، وظایف را تفویض کنند، می‌تواند میلیون‌ها توکن را به سرعت بسوزاند. تا زمانی که عدد دقیق هزینهٔ سیستم خود را ندانید، هر تصمیم برای ایجاد عامل جدید، صرفاً یک حدس است. این چالش‌های مالی در کنار خطاهای عملیاتی قرار می‌گیرند؛ چنان‌که ابزار agentrace تلاش می‌کند شکست‌های پنهان در همین زیرعامل‌های Claude Code را شناسایی کند تا از اتلاف منابع جلوگیری شود.

بسیاری از توسعه‌دهندگان برای جداسازی زمینه یا موازی‌سازی کارها از زیرعامل‌ها استفاده می‌کنند، اما تعداد کمی از آن‌ها هزینهٔ واقعی مقداردهی اولیه را ردیابی می‌کنند. همان‌طور که در تحلیل قبلی ما درباره‌ی انتخاب مدل بر اساس نوع وظیفه اشاره کردیم، جایی که GPT-4o، Claude و Mistral را مقایسه کردیم، این یافته نشان می‌دهد که «چگونگی» اجرای یک وظیفه، اغلب تأثیر بیشتری نسبت به خودِ مدل انتخابی دارد.

به نقل از گزارشی که در ۲۰ اوت ۲۰۲۶ در وب‌سایت dev.to منتشر شد، این هزینهٔ ۴۳۶ هزار توکنی از چندین مؤلفهٔ بارگذاری خودکار ناشی می‌شود. وقتی یک عامل (Agent) — شبیه به کارمندی دیجیتال که می‌تواند ابزارها را مدیریت کند — ایجاد می‌شود، با یک صفحه سفید شروع نمی‌کند، بلکه یک حلقه کامل را به ارث می‌برد که شامل موارد زیر است:

  • پرامپت‌های سیستمی و طرحواره‌های ابزار: تمام تعاریف ابزارها، به‌ویژه موارد مربوط به سرورهای پروتکل زمینهٔ مدل (MCP)، در بستر متن سریال‌سازی می‌شوند. با اتصال سرورهای MCP، این بخش به تنهایی می‌تواند به اعداد شش‌رقمی از توکن‌ها برسد.
  • دستورالعمل‌های پروژه: فایل CLAUDE.md و تمام فایل‌های ارجاع‌شده به آن به‌طور خودکار بارگذاری می‌شوند. نویسندگان گزارش برای جلوگیری از هزینه‌های فاجعه‌بار در هنگام ایجاد عامل‌ها، حجم این فایل را از ۵۴۸ کیلوبایت به ۳۴ کیلوبایت کاهش دادند.
  • تعاریف عامل: هر مهارت یا تعریفی که برای عامل والد بارگذاری شده، برای فرزند نیز تکثیر می‌شود.
  • پرامپت وظیفه: دستورالعمل خاصی که شما برای زیرعامل می‌نویسید؛ این بخش به طور قابل اعتمادی کوچک‌ترین سهم را در هزینه کل دارد.

برای یافتن این عدد، پژوهشگران یک وظیفهٔ بررسی کد را به دو روش اجرا کردند: ارسال متن محصول به سه عامل (مجموعاً ۲,۱۵۰,۳۱۰ توکن) در برابر یک عامل (۸۰۹,۰۷۰ توکن). تفاوت این دو عدد، هزینهٔ ثابت ایجاد و نوشتن نهایی در حافظه پنهان (Cache) است.

ریاضیات نقطهٔ سربه‌سر

تصمیم برای تفویض کار به این بستگی دارد که جایگزین آن — یعنی خواندن داده‌ها در همان جریان اصلی (Inline) — چقدر هزینه دارد. اگر عامل والد ۲۰۰ هزار توکن از لاگ‌ها را خودش بخواند، این توکن‌ها در گفتگو باقی می‌مانند و با هر درخواست بعدی در آن جلسه دوباره ارسال می‌شوند.

اگرچه حافظه پنهان پرامپت (Prompt Caching) هزینه ارسال مجدد را کاهش می‌دهد، اما رایگان نیست. در یک جلسه طولانی با حدود ۳۰ درخواست باقی‌مانده، خواندن داخلی N توکن، عملاً معادل N × ۳ حجم توکن هزینه دارد. این پیچیدگی در محاسبهٔ هزینه‌ها باعث شده تا راهکارهای جدیدی مانند قراردادهای اندازه‌گیری برای جلوگیری از محاسبهٔ دوبرابره هزینه‌ها پیشنهاد شود.

برای هزینهٔ ثابت ۴۳۶ هزار توکنی، نقطهٔ تلاقی تقریباً ۱۴۵ هزار توکن است (۴۳۶ هزار تقسیم بر ۳). بنابراین اگر فایلی که باید خوانده شود کوچک‌تر از ۲۰۰ هزار توکن است — عددی که به عنوان حاشیهٔ امن برای جلوگیری از ایجاد بی‌رویهٔ عامل‌ها در نظر گرفته شده — ارزان‌تر است که آن را در حلقه اصلی بخوانید تا اینکه یک زیرعامل بسازید.

استراتژی‌های بهینه‌سازی

دو عامل اصلی این آستانه را به‌شدت تغییر می‌دهند:

۱. طول جلسه: در ابتدای یک جلسه طولانی، تفویض کار زودتر به‌صرفه می‌شود چون از متورم شدن بستر متن اصلی در درخواست‌های آینده جلوگیری می‌کند. اما در مراحل پایانی جلسه، تقریباً هیچ دلیلی برای ایجاد زیرعامل وجود ندارد.
۲. مسیریابی مدل: اگر سیستم اجازه دهد تعریف عامل به یک مدل کوچک‌تر متصل شود، هزینه ثابت به دلار کاهش می‌یابد. سپردن خواندن انبوه داده‌ها و جمع‌آوری اطلاعات به یک مدل میان‌رده و رزرو کردن قضاوت نهایی برای یک مدل بزرگ، می‌تواند نقطهٔ سربه‌سر را از صدها هزار توکن به ده‌ها هزار توکن کاهش دهد.

توسعه‌دهندگان می‌توانند «مالیات ایجاد» خود را با اجرای یک وظیفه ساده، یک‌بار با زیرعامل و یک‌بار بدون آن، و کسر تفاضل توکن‌ها محاسبه کنند. تکرار این کار سه بار و گرفتن مقدار میانی، یک بودجهٔ قابل تکرار به آن‌ها می‌دهد. همچنین کاهش حجم CLAUDE.md یک برد دوگانه است؛ چون هم هزینه عامل والد و هم تمام فرزندان را پایین می‌آورد.

این تغییر در رویکرد نشان می‌دهد که گردش‌کارهای عامل‌محور (Agentic) ذاتاً بهینه نیستند. اثر ثانویه این یافته، حرکت به سمت «مسیریابی بر اساس شکل وظیفه» (Task-shape routing) است؛ جایی که خواندن مکانیکی از قضاوت تحلیلی و تقابلی جدا می‌شود تا از بودجه محافظت شود. این فشار مالی تنها به توکن‌ها محدود نمی‌شود و استفاده از سندباکس‌های متری‌شده نیز می‌تواند هزینه‌های اجرای این عامل‌ها را تا دو برابر افزایش دهد.

قواعد سرانگشتی برای ایجاد عامل

برای جلوگیری از هزینه‌های نامرئی، توسعه‌دهندگان باید این قوانین کاربردی را دنبال کنند:

  • عدم استفاده برای حقایق تک‌فایلی: هرگز برای استخراج یک حقیقت از یک فایل واحد، زیرعامل ایجاد نکنید؛ خواندن یک فایل در جریان اصلی همیشه ارزان‌تر از ۴۳۶ هزار توکن است.
  • تجمیع دیدگاه‌ها: اگر دو بررسی‌کننده ۸۰٪ دغدغه‌های مشترک دارند، از یک عامل استفاده کنید. ایجاد عامل دوم، هزینهٔ ثابت جدید می‌آورد، نه لزوماً تفکر یا مغز دوم.
  • ایجاد زودهنگام یا اصلاً ایجاد نکنید: ارزش یک بستر متن (Context) پاک در عامل اصلی، در طول درخواست‌های باقی‌مانده جلسه، به صورت ترکیبی افزایش می‌یابد.
  • مسیریابی بر اساس شکل وظیفه: از مدل‌های کوچک برای خواندن مکانیکی، مدل‌های بزرگ برای قضاوت‌های تحلیلی و مدل پیش‌فرض جلسه برای هماهنگ‌سازی (Orchestration) استفاده کنید.
  • شفاف‌سازی هزینه‌ها: از عامل‌ها بخواهید هر بار که زیرعاملی ایجاد می‌کنند، آن را با یک تخمین هزینه گزارش کنند تا عادت‌های خوداصلاح‌گر ایجاد شود.

در ادامه، ابزارهایی مانند Rulestack در حال توسعه هستند تا الگوهای تعریف عامل را استاندارد کرده و سربار مقداردهی اولیه را به حداقل برسانند. اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این تحلیل با تکیه بر داده‌های تجربی، نشان می‌دهد که هزینه‌های پنهان در ابزارهای توسعه AI می‌تواند بودجه‌های سازمانی را به سرعت تخلیه کند. درک نقطه سربه‌سر بین خواندن داخلی و تفویض عامل، برای هر مهندس نرم‌افزاری که با مدل‌های زبانی کار می‌کند، یک ضرورت مالی است.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که با محدودیت بودجه دلاری و هزینه‌های بالای API مواجه‌اند، محاسبهٔ نقطهٔ سربه‌سر برای جلوگیری از اتلاف توکن‌ها حیاتی است.

·نگاه ما
تحریریه دات‌هوش

بهره‌وری در سیستم‌های عامل‌محور دیگر با تعداد عامل‌ها، بلکه با «بهینه‌سازی بستر متن» سنجیده می‌شود. این یافته ثابت می‌کند که معماری‌های چندعاملی بدون یک لایه مسیریابی هوشمند (Task-shape Routing)، صرفاً ابزاری برای افزایش هزینه‌های استنتاج هستند. در واقع، ما از عصر «بیشتر مدل، بهتر» به عصر «دقیق‌ترین مسیر برای هر توکن» وارد شده‌ایم.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.