پرش به محتوای اصلی
پرش به محتوای مقاله

بررسی‌های Claude Code: مدیریت بستر متن هزینه‌های API را به‌شدت کاهش می‌دهد

·۱۵ تیر ۱۴۰۵۲۱ دقیقه مطالعه۱ بازدید
راهنما
راهنمای توسعه‌دهندگان برای صرفه‌جویی در هزینه API کلود کد
راهنمای توسعه‌دهندگان برای صرفه‌جویی در هزینه API کلود کد
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

افشای تاثیر مستقیم «حشوهای متنی» (Politeness Tax) بر هزینه توکن‌ها و معرفی متد `/compact` برای مدیریت فعال پنجره زمینه در Claude Code.

«سهمیه استفاده شما در این نشست به پایان رسید.» برای بسیاری از برنامه‌نویسان، این هشدار دقیقاً زمانی ظاهر می‌شود که مدل در میانه یک بازسازی کد پیچیده در سه فایل مختلف، به نقطه اوج تمرکز (Flow State) رسیده است. مشکل معمولاً اشتراک کاربر نیست، بلکه یک خطای گردشِ کار است؛ جایی که رابط کاربری به‌جای یک منبع API هزینه‌دار، شبیه به یک پنجره چت نامحدود دیده می‌شود و باعث می‌شود سهمیه‌ها در حساس‌ترین لحظات تمام شوند.

همان‌طور که در پوشش پیشین ما از اپلیکیشن لینوکسی Claude Code و چالش‌های ادغام محلی آن دیدیم، اکنون تمرکز بر اقتصادِ استفاده از این ابزار است. برای یک برنامه‌نویس معمولی، مدیریت یک عامل کدنویسی هوش مصنوعی شبیه مدیریت بسته اینترنت گوشی است؛ اگر ویدیوهای 4K استریم کنید — یا در اینجا، نقشه کل پروژه را در هر پرامپت تزریق کنید — مدت‌ها پیش از پایان نشست، سرعت شما محدود می‌شود.

سیستم محدودیت دو لایه

آنتروپیک (Anthropic) اعلام کرده است که Claude Code از یک سیستم محدودیت دو لایه استفاده می‌کند. نخست، یک پنجرهٔ زمانی ۵ ساعته است که فعالیت‌های کوتاه را مدیریت می‌کند. این ساعت از اولین پرامپت شما شروع می‌شود، نه یک ساعت ثابت؛ بنابراین اگر ساعت ۱۰ صبح پیامی بفرستید، این پنجره ساعت ۳ بعدازظهر بازنشانی می‌شود، فارغ از اینکه چه حجم داده‌ای در آن جا داده‌اید.

لایه دوم، سقف هفتگی محاسبات (Compute) است که استفاده‌های مستمر را کنترل می‌کند. در اینجا زمان‌های بیکاری حذف شده و فقط پردازش‌های فعال و استدلال (Reasoning Model) محاسبه می‌شود. رسیدن به هر یک از این دو سقف، دسترسی شما را تا زمان بازنشانی می‌بندد. این موضوع توضیح می‌دهد چرا ممکن است در ساعت ۲:۰۰ بعدازظهر احساس کنید همه چیز عادی است، اما در ساعت ۲:۱۵ کاملاً مسدود شوید.

یک تلهٔ حیاتی این است که Claude Code، چت مرورگری Claude.ai و Claude Cowork همگی از یک مخزن اشتراک مشترک استفاده می‌کنند. اگر صبح خود را با ایده‌پردازی برای یک مقاله در مرورگر بگذرانید، مستقیماً از ظرفیتی که برای نشست ترمینال بعدازظهرتان نیاز دارید، می‌کاهید. اگر استفاده اصلی شما از کلود برای کدنویسی است، بهتر است چت‌های عمومی را در یک حساب جداگانه نگه دارید تا از مخزن اصلی سهمیه بر ندارید.

کمی‌سازی نرخ مصرف (Burn Rate)

طبق مستندات رسمی مدیریت هزینه آنتروپیک، هزینه متوسط برای هر برنامه‌نویس در روزهای فعال حدود ۱۳ دلار و در ماه بین ۱۵۰ تا ۲۵۰ دلار است. نکته مهم این است که ۹۰٪ کاربران در هر روز فعال کمتر از ۳۰ دلار هزینه می‌کنند. اگر هزینه شما بسیار بیشتر است، با یک مشکل در گردشِ کار مواجه هستید، نه سطح اشتراک. آنتروپیک توصیه می‌کند قبل از استقرار در سطح تیم، با گروه‌های کوچک آزمایشی شروع کنید و از ابزارهای ردیابی داخلی برای تعیین یک خط مبنا استفاده کنید.

برای کاهش این فشارها، آنتروپیک در سال ۲۰۲۶ دو افزایش سهمیه مهم را اجرا کرد. در ۶ مه ۲۰۲۶، محدودیت‌های نشست ۵ ساعته برای طرح‌های Pro، Max، Team و Enterprise به‌طور دائمی دو برابر شد. همچنین محدودیت‌های قدیمی ساعات اوج مصرف در روزهای هفته (۵ تا ۱۱ صبح به وقت PT) حذف گردید. سپس در ۱۳ مه ۲۰۲۶، محدودیت‌های هفتگی ۵۰٪ افزایش یافت که این طرح ترویجی تا ۱۳ جولای ۲۰۲۶ ادامه دارد.

از ۱۵ ژوئن ۲۰۲۶، استفاده‌های غیرتعاملی — مانند فراخوانی‌های Agent SDK، اسکریپت‌های claude -p و ادغام با GitHub Actions و برنامه‌های شخص ثالث — به یک اعتبار ماهانه مجزا منتقل شد (۲۰ دلار برای Pro، ۱۰۰ دلار برای Max 5x و ۲۰۰ دلار برای Max 20x). این تغییر مانع از آن می‌شود که خطوط لوله CI سهمیه نشست‌های تعاملی کدنویسی را مصرف کنند. توجه داشته باشید که این اعتبارات غیرتعاملی سقف ماهانه سخت‌گیرانه خود را دارند و باید به‌طور جداگانه نظارت شوند. این رویکرد برای مدیریت هزینه‌ها در مقیاس بزرگ است، هرچند دسترسی به کلود در مقیاس سازمانی از طریق AWS Bedrock معمولاً با ساختار هزینه‌ای متفاوت و گاهی بالاتری همراه است.

هزینه بالای حشوهای گفتگو (Politeness Tax)

یکی از هزینه‌های نادیده گرفته شده، «مالیات ادب» است. توکن (Token) در خروجی ۵ برابر گران‌تر از ورودی است، زیرا تولید متن یک فرآیند کند و متوالی است. عباراتی مثل «حتماً! خوشحال می‌شوم کمک کنم» رایگان نیستند؛ آن‌ها با گران‌ترین نرخ صورت‌حساب می‌شوند و سریع‌تر از خودِ کد، سهمیه شما را می‌سوزانند.

بر اساس تست‌های مستقل، دستور صریح برای حذف تمامی حشوهای متنی، مقدمه‌ها و امضاها، می‌تواند توکن‌های خروجی را تا ۷۰٪ کاهش دهد بدون اینکه کیفیت کد تغییر کند. یک تست نشان داد که پاسخ‌های استاندارد اغلب بیش از ۱۰۰ توکن «ادب خالص» دارند که هیچ کاربردی ندارد. افزودن دستور «مقدمه و امضا را حذف کن و فقط پاسخ را برگردان» به فایل CLAUDE.md یک راهکار رایگان است که در هر پاسخ اثر می‌گذارد و اثرات آن در طول زمان انباشته می‌شود.

تورم زمینه و مالیات فایل CLAUDE.md

فایل CLAUDE.md در هر درخواست تزریق می‌شود. یک فایل ۵۰۰۰ توکنی مانند یک مالیات دائمی روی هر پیام عمل می‌کند. توصیه می‌شود این فایل را زیر ۲۰۰ خط نگه دارید و راهنماهای سبکی را که مدل به‌طور طبیعی از کد می‌فهمد، حذف کنید. آنتروپیک پیشنهاد می‌کند دستورالعمل‌های خاص گردشِ کار که فقط گاهی نیاز هستند (مانند چک‌لیست‌های بررسی PR یا دفترچه‌های راهنمای مهاجرت) را به یک «مهارت» (Skill) تبدیل کنید تا فقط در زمان نیاز بارگذاری شوند.

گفتگوهای طولانی و فشرده‌نشده نیز باعث تخلیه سریع سهمیه می‌شوند. چون Claude کل تاریخچه را در هر Turn مجدداً می‌فرستد، پیام ۸۰ام بسیار گران‌تر از پیام ۸ام است. دستور /compact ابزار اصلی برای خلاصه‌سازی گفتگوها و آزاد کرده فضا بدون حذف زمینه است. آنتروپیک پاک‌سازی بین تکالیف را موثرترین اهرم برای افزایش مدت زمان استفاده می‌داند. یک عادت مفید این است که قبل از دستور /clear از دستور /rename استفاده کنید تا بتوانید نشست را بعداً پیدا کنید و در صورت نیاز از /resume استفاده نمایید.

انتخاب مدل و سربار عامل‌ها

استفاده پیش‌فرض از Claude Opus برای کارهای روتین یک اشتباه رایج است. در حالی که Opus برای استدلال‌های عمیق چندفایلی و معماری‌های پیچیده عالی است، اما سهمیه را ۵ تا ۱۰ برابر سریع‌تر از Claude Sonnet می‌سوزاند. می‌توانید در میانه نشست با دستور /model مدل را تغییر دهید.

همین منطق برای تیم‌های عامل (Agent Teams) نیز صادق است. در حالی که موازی‌سازی تکالیف کارآمد به نظر می‌رسد، اما هر عضو تیم پنجرهٔ زمینه (Context Window) مجزایی دارد. آنتروپیک تأیید می‌کند که این تیم‌ها در حالت Plan حدود ۷ برابر بیشتر از نشست‌های تک‌عاملی توکن مصرف می‌کنند، زیرا هر عضو در واقع یک نمونه مجزا از کلود است. تیم‌های عامل را فقط برای کارهای واقعاً موازی (مثلاً مجموعه‌های تست مستقل در سرویس‌های مختلف) رزرو کنید و بلافاصله پس از اتمام، آن‌ها را ببندید تا مصرف توکن متوقف شود. بهینه‌سازی این گردش‌کارها اهمیت زیادی دارد، به طوری که برخی توسعه‌دهندگان توانسته‌اند سیستم‌های اجرای خودکار Claude Code را برای ماه‌ها بدون نظارت فعال نگه دارند.

اهرم‌های بهینه‌سازی فنی

برای کاهش بیشتر هزینه‌ها، برنامه‌نویسان می‌توانند از پیکربندی‌های فنی خاص زیر استفاده کنند:

مدیریت فایل و زمینه:

  • .claudeignore: جلوگیری از ایندکس کردن node_modules/، dist/، build/، *.lock، coverage/، .next/، *.min.js و vendor/ مانع از صرف توکن‌های بیهوده برای فایل‌های اضافی می‌شود.
  • کش پرامپت (Prompt Caching): خواندن ورودی‌های کش‌شده حدود ۹۰٪ ارزان‌تر از خواندن‌های تازه است. با این حال، نوشتن کش گران‌تر است: ۱.۲۵ برابر برای پنجره‌های ۵ دقیقه‌ای و ۲ برابر برای پنجره‌های ۱ ساعته. در بازه‌های زمانی کوتاه کار کنید تا کش «گرم» بماند؛ بازگشت پس از یک استراحت ۱۵ دقیقه‌ای باعث پردازش مجدد و کامل زمینه با قیمت تمام می‌شود.
  • انتخاب سطح زمینه (Context Tier): تا زمانی که یک تکالیف خاصاً به پنجره ۱ میلیون توکنی نیاز نداشته باشد، روی سطح استاندارد ۲۰۰ هزار توکنی بمانید تا از افزایش قیمت جلوگیری کنید. سطح ۱ میلیون توکن یک گزینه پریمیوم است که باید برای دامپ‌های بزرگ لاگ، فایل‌های SQL غول‌آسای تولید شده یا خواندن کامل یک Monorepo رزرو شود.

گردشِ کار و ابزارها:

  • حالت برنامه-ریزی (Shift+Tab): استفاده از این حالت قبل از تکالیف مبهم، از «هزینه اکتشاف» جلوگیری می‌کند تا مدل چندین ویرایش اشتباه انجام ندهد. مدل ابتدا یک رویکرد را برای تأیید پیشنهاد می‌دهد و سپس فایل‌ها را تغییر می‌دهد.
  • عامل‌های فرعی (Subagents): واگذاری عملیات پرحجم، مانند اجرای کامل مجموعه تست یا تجزیه یک فایل لاگ عظیم به یک عامل فرعی، باعث می‌شود خروجی‌های شلوغ از زمینه اصلی گفتگو خارج شده و فقط یک خلاصه کوتاه بازگردانده شود.
  • قلاب‌های PreToolUse: این قلاب‌ها می‌توانند دستورات را قبل از اجرا بازنویسی کنند. برای مثال، یک قلاب می‌تواند یک فایل لاگ ۱۰,۰۰۰ خطی را ابتدا از طریق grep برای کلمه "ERROR" فیلتر کند و فقط نتایج مرتبط را به کلود بدهد، نه کل فایل را.
  • پلاگین‌های هوش کد (Code Intelligence Plugins): برای زبان‌های TypeScript، Python، Go و Rust، این پلاگین‌ها ناوبری دقیق «برو به تعریف» (go to definition) را فراهم می‌کنند و جایگزین خواندن حدسی فایل‌ها و استفاده از grep می‌شوند. این کار از خواندن ۱۰ تا ۲۰ فایل کاندید برای پیدا کردن تنها یک تابع جلوگیری می‌کند.

تله کلید API و جایگزین‌های محلی

برنامه‌نویسان باید تنظیمات شل خود (.zshrc, .bashrc, .env) را برای متغیر محیطی ANTHROPIC_API_KEY بررسی کنند. اگر این متغیر تنظیم شده باشد، Claude Code از طریق API احراز هویت می‌کند و هر توکن را با نرخ استاندارد محاسبه می‌کند که به‌طور کامل طرح‌های اشتراکی Pro یا Max را دور می‌زند. حالت احراز هویت خود را قفل کنید: فقط اشتراکی برای کارهای روزانه، و فقط کلید API برای پرداخت‌های تعمدی مازاد.

برای کسانی که به دنبال تجربه‌ای «بدون کنتور» هستند، متصل کردن Claude Code به مدل‌های محلی یک راه viable است. چون Claude Code فقط با فرمت API آنتروپیک صحبت می‌کند، مسیریابی به بک‌اندهای غیرآنتروپیک نیاز به پل (Bridge) دارد:

  • DeepSeek: از یک نقطه اتصال (Endpoint) سازگار با آنتروپیک استفاده می‌کند؛ با اشاره دادن ANTHROPIC_BASE_URL به آن، نیازی به پروکسی نیست.
  • Ollama: حالتی سازگار با آنتروپیک برای اجرای مدل‌ها روی سخت‌افزار خودتان فراهم می‌کند و هزینه توکن را با هزینه برق عوض می‌کند.
  • LiteLLM/Proxies: پروکسی‌های متن‌باز می‌توانند Claude Code را به Groq، بیش از ۱۲۰ مدل NVIDIA NIM و دیگران متصل کنند. این برای یک گردشِ کار ترکیبی ایده‌آل است: محلی/رایگان برای کارهای روتین و مدل‌های Sonnet یا Opus پولی برای ۱۰٪ از تکالیفی که نیاز به استدلال سطح بالا دارند.

Claude Code در مقابل Codex

در بنچمارک‌های رودررو، Claude Code از نظر مصرف توکن کمتر از Codex بهینه است. یک تست بازسازی در Express.js نشان داد که Claude Code حدود ۶.۲ میلیون توکن مصرف کرده، در حالی که Codex تنها ۱.۵ میلیون توکن مصرف کرد. این هزینه اضافی با تمایل کلود به «بلند فکر کردن»، تأیید کارهای خود و ایجاد تغییرات قطعی‌تر مرتبط است.

با این حال، برنامه‌نویسان خروجی کلود را تمیزتر و 符合 استانداردهای زبان (idiomatic) می‌دانند. این نشان می‌دهد که برای بازسازی‌های پیچیده چندفایلی، هزینه توکن بیشتر، ارزان‌تر از بازکاری دستی است که یک ابزار سطحی‌تر ممکن است ایجاد کند. بسیاری از توسعه‌دهندگان اکنون از یک مدل ترکیبی استفاده می‌کنند: Claude Code برای معماری و Codex برای اتوماسیون‌های حجیم و حساس به هزینه.

دید سازمان (Organizational Visibility)

برای مدیران تیم، تعداد خام توکن‌ها اغلب یک معیار ظاهری است. تمرکز باید به پیوند دادن نشست‌های Claude Code به Pull Requestهای ادغام شده واقعی از طریق معیارهای سازمانی گیت‌هاب تغییر کند.

  • داشبورد تحلیل‌ها: طرح‌های Team و Enterprise داشبوردی در claude.ai/analytics/claude-code فراهم می‌کنند که کاربران فعال روزانه، نشست‌ها و خطوط کد پذیرفته شده را نمایش می‌دهد.
  • راهنمای محدودیت نرخ: آنتروپیک توصیه‌هایی بر اساس اندازه تیم منتشر می‌کند، زیرا محدودیت‌های درخواست در دقیقه (RPM) و توکن در دقیقه (TPM) با افزایش تعداد نفرات به دلیل الگوهای همزمانی، کاهش می‌یابد.
  • پلتفرم‌های مهندسی: ابزارهایی مانند minware داده‌های مصرف را به فعالیت‌های Git و CI/CD متصل می‌کنند تا ببینند آیا پذیرش هوش مصنوعی واقعاً معیارهای تحویل مانند «زمان چرخه» (Cycle Time) و زمان بررسی PR را بهبود می‌بخشد یا خیر.
  • درگاه‌های LLM: ابزار Respan سقف هزینه برای هر کلید، هشدار-های Slack/ایمیل و کشینگ خودکار پرامپت را برای استقرارهای مقیاس تیم فراهم می‌کند و به عنوان یک ردیاب سهمیه سازمانی عمل می‌کند.

ابزارهای ردیابی و تحلیل

  • دستورات داخلی: /usage تعداد توکن‌های نشست، هزینه‌های تخمینی و تفکیک بر اساس مهارت/عامل فرعی را نشان می‌دهد (با دکمه d یا w برای بازه ۲۴ ساعت در برابر ۷ روز). /context شناسایی می‌کند که آیا CLAUDE.md یا سرورهای MCP منبع اصلی مصرف هستند. /usage-credits به کاربران Pro/Max اجازه می‌دهد سقف هزینه ماهانه تعیین کنند.
  • دسترسی به لاگ‌ها: تمام گفتگوها به‌صورت JSONL در مسیر ~/.claude/projects/ ذخیره می‌شوند که بر اساس پوشه‌های پروژه سازماندهی شده‌اند. این منبع داده خام برای اکثر ابزارهای جامعه کاربری است.
  • اپلیکیشن‌های نوار منو: اپلیکیشن‌های متن‌باز macOS می‌توانند این لاگ‌های JSONL یا نقطه اتصال مصرف آنتروپیک را بخوانند تا حلقه‌های رنگی برای سقف‌های ۵ ساعته و هفتگی با اعلان‌های آستانه در ۵۰٪، ۷۵٪ و ۹۰٪ نمایش دهند.
  • تحلیل‌گران محلی: تحلیل‌گران JSONL مبتنی بر CLI می‌توانند با تجزیه دایرکتوری لاگ‌های محلی، گزارش‌هایی برای تفکیک هزینه روزانه، هفتگی یا ماهانه تولید کنند.

چک‌لیست سریع نهایی

قبل از نشست بعدی خود، این موارد را بررسی کنید:

  • آیا CLAUDE.md زیر ۲۰۰ خط است و حشوهای متنی ندارد؟
  • آیا .claudeignore فایل‌های build و lock را پوشش می‌دهد؟
  • آیا از /compact در میانه تکالیف و /clear بین تکالیف استفاده شده است؟
  • آیا پیش‌فرض روی Sonnet است و از Opus فقط برای استدلال‌های سخت استفاده می‌کنید؟
  • آیا ANTHROPIC_API_KEY به‌طور تصادفی در شل تنظیم نشده است؟
  • آیا نمای مصرف زنده (/usage یا اپلیکیشن نوار منو) فعال است؟
  • آیا تیم‌های عامل فقط برای کارهای موازی استفاده می‌شوند؟
  • آیا در بازه‌های زمانی کوتاه کار می‌کنید تا کش ۵ دقیقه‌ای گرم بماند؟
  • آیا دستوراتی برای حذف حشوهای «Certainly!» درج شده است؟
  • آیا از /effort یا MAX_THINKING_TOKENS (مثلاً ۸۰۰۰) برای محدود کردن تفکر در کارهای روتین استفاده می‌کنید؟
  • آیا حالت Plan (Shift+Tab) برای تکالیف مبهم فعال است؟
  • آیا روی سطح زمینه ۲۰۰ هزار توکنی هستید مگر اینکه ۱ میلیون توکن واقعاً لازم باشد؟

شفافیت بر اراده پیروز است. برنامه‌نویسانی که هرگز به سقف سهمیه نمی‌رسند، عضو طرح سری نیستند؛ آن‌ها صرفاً ردیاب سهمیه خود را به بخشی دائمی از گردشِ کارشان تبدیل کرده‌اند. وقتی مصرف قابل مشاهده باشد، عادت‌های هزینه‌بر بدیهی شده و اصلاح آن‌ها آسان می‌شود.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این یافته‌ها نشان می‌دهد که بهره‌وری در عصر هوش مصنوعی تنها به قدرت مدل نیست، بلکه به مدیریت دقیق منابع محاسباتی وابسته است. متخصصانی که این متدها را اجرا کنند، می‌توانند بدون تغییر پلن، بازه زمانی فعالیت خود را تا چندین برابر افزایش دهند.

تأثیر برای ایران

به‌دلیل تحریم‌ها و نیاز به پرداخت‌های ارزی برای اکانت‌های Pro و Max، بهینه‌سازی مصرف توکن برای برنامه‌نویسان ایرانی حیاتی است تا هزینه‌های تمدید اشتراک کاهش یابد.

·نگاه ما
تحریریه دات‌هوش

به نظر ما، انتقال هزینه‌ی توکن‌ها از یک متغیر فنی به یک متغیر رفتاری، نشان‌دهنده‌ی بلوغ ابزارهای کدنویسی AI است. وقتی «ادب مدل» یا «حجم فایل پیکربندی» مستقیماً روی صورت‌حساب اثر می‌گذارد، مهندسی پرامپت از یک ترفند برای کیفیت به یک ضرورت برای بقای اقتصادی تبدیل می‌شود. این روند احتمالاً منجر به ظهور ابزارهای اتوماتیک «پاک‌سازی زمینه» (Context Pruning) در لایه‌ی IDE می‌شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.