پرش به محتوای اصلی
پرش به محتوای مقاله

چگونه ابزار متن‌باز جدید هزینه‌های توکن Claude Code را پایین می‌آورد؟

·۱۶ مهر ۱۴۰۵۱۲ دقیقه مطالعه
افزونه‌ای برای ساده‌سازی پاسخ‌های Claude: بدون مقاله، شعار و استعاره. پاسخ‌های مستقیم و عادی.
افزونه‌ای برای ساده‌سازی پاسخ‌های Claude: بدون مقاله، شعار و استعاره. پاسخ‌های مستقیم و عادی.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

استفاده از یک سیستم «یادآور پویا» (Dynamic Reminder) در هر پرامپت برای جلوگیری از انحراف سبک مدل در گفتگوهای طولانی، که بسیار مؤثرتر از پرامپت‌های سیستمی ثابت است.

اگر هر روز ساعت‌ها با دستیارهای کدنویسی AI کار می‌کنید، احتمالاً از پاسخ‌های طولانی و «مقاله-مانند» آن‌ها که برای یک تغییر ساده در کد، متنی ۶۰۰ کلمه‌ای می‌نویسند، خسته شده‌اید. حالا ابزاری آمده است که این حشوها را حذف کرده و فقط آنچه را که واقعاً نیاز دارید، تحویل می‌دهد.

پلاگین متن‌باز claude-terse که در ۷ اکتبر ۲۰۲۶ منتشر شد، طبق گزارش سازنده‌اش، حجم پاسخ‌های Claude Code را در تست‌های واقعی تا ۷۰٪ کاهش داده است. این ابزار دقیقاً پاسخ‌های «استایل مقاله» را هدف قرار داده است که اغلب توسعه‌دهندگان هنگام استفاده از دستیارهای کدنویسی AI با آن‌ها دست‌وپنجه نرم می‌کنند.

بسیاری از توسعه‌دهندگان معتقدند مدل‌های پیشرفته تمایل دارند پاسخ‌های فنی ساده را در لایه‌ای از استعاره‌ها، شعارهای تبلیغاتی و خلاصه‌های تکراری بپیچند. نویسنده این ابزار این نوع نثر متکلف را «slop» یا همان محتوای بی‌ارزش می‌نامد؛ متنی که جریان کاری فنی را کند می‌کند. نویسنده چندین هفته را صرف یادداشت کردن هر رفتار آزاردهنده و تعیین آنچه مدل «باید» به جای آن بگوید کرد تا این پلاگین را بسازد. اگرچه حالت concise داخلی در مدل‌های آنتروپیک وجود دارد، اما کاربران گزارش می‌دهند که این حالت همچنان ریشهٔ مشکل حشو را حل نمی‌کند.

این ابزار در حالی معرفی می‌شود که توسعه‌دهندگان به‌دنبال بهره‌وری بیشتر در گردش‌های کاری عامل‌محور (Agentic) هستند. همان‌طور که در تحلیل قبلی ما درباره‌ی دقت استفاده از ابزارها در AgentToolEval و Claude 5.5 اشاره کردیم، تمرکز صنعت اکنون از «توانایی مدل» به «دقت و سرعت اجرای عملیاتی» تغییر کرده است. این رویکرد در پروژه‌های پیچیده‌تر نیز کاربرد دارد، مشابه آنچه در طراحی وب‌سایت سه‌بعدی با ارتش عامل‌های Claude مشاهده کردیم که در آن هماهنگی دقیق عامل‌ها کلید موفقیت بود.

سازوکار حذف حشو

claude-terse برخلاف روش‌های معمول، تنها به پرامپت سیستمی (System Prompt) — که شبیه به دستورالعمل‌های کلی است و مدل پس از چند نوبت گفتگو آن‌ها را فراموش می‌کند — تکیه نمی‌کند. در عوض، این پلاگین یک «ساختار پاسخ» پیچیده شامل ۲۲ قانون و ۱۸ جفت نمونهٔ «قبل/بعد» را پیاده‌سازی کرده است که در مجموع ۸۷۷ کلمه را شامل می‌شود.

این ابزار ساختار خروجی را به‌شدت محدود می‌کند: یک جمله برای ارائه پاسخ، سپس یک لیست یا جدول، و در نهایت حداکثر یک جمله برای ذکر نکات احتیاطی پیش از توقف کامل. همچنین استفاده از ضمایر اول‌شخص مثل «من» یا «به نظر من» را به‌طور صریح ممنوع کرده تا تمایل مدل به روایتِ فرآیند تفکر خود (مثلاً «اکنون کد را بررسی می‌کنم») حذف شود.

برای جلوگیری از «انحراف سبک» (Style Drift) در گفتگوهای طولانی، پلاگین از یک قلاب (Hook) به نام UserPromptSubmit استفاده می‌کند. این مکانیزم یک یادآور فشردهٔ ۵۷۶ کاراکتری از قوانین را به هر پرامپت تزریق می‌کند تا مدل با پر شدن پنجرهٔ زمینه (Context Window) — که مثل میز کاری است و فقط مقدار محدودی کاغذ روی آن جا می‌شود — به عادت‌های قدیمی و پرحرفی بازنگردد. این یادآور حدود ۱۴۵ توکن (Token) — تکه‌های کوچکی از متن که مدل آن‌ها را می‌خواند — به هر نوبت ورودی اضافه می‌کند. بدون این یادآور، پاسخ‌های پرحرف اخیرِ خودِ مدل تبدیل به نزدیک‌ترین نمونه‌های استایلی برای او می‌شوند و مدل را دوباره به سمت استفاده از خط تیره‌ها، شعارها و چارچوب‌های «X، نه Y» سوق می‌دهند. متن این یادآور در فایل rules/REMINDER.md ذخیره شده است.

قوانین سخت‌گیرانه نگارش

بر اساس مستندات rules/RULES.md در گیت‌هاب، این پلاگین الگوهای زبانی خاصی را هدف قرار داده است که باعث ایجاد تورم متنی می‌شوند:

  • حذف استعاره‌ها: عبارات تصویری و مجازی با جملات صریح و تحت‌اللفظی جایگزین می‌شوند. مثلاً عبارت «یک ادغام ۳۰۰۰ خطی نیاز به دعا و شانس دارد» تبدیل می‌شود به «یک ادغام ۳۰۰۰ خطی نیاز به ۱۰ دقیقه مطالعه دارد و بررسی خط‌به‌خط نمی‌شود».
  • جایگزینی تضادها (X, not Y): برچسب‌های متضاد با توضیحات جایگزین می‌شوند. به جای جملاتی مثل «این یک قصد است، نه رفتار»، مدل باید مستقیماً بگوید «مستندات X را می‌گویند، اما کد Y را اجرا می‌کند».
  • ممنوعیت شعارها: جملات کوتاهی که شبیه اصول اخلاقی یا فلسفی هستند اما هیچ سازوکار فنی را توضیح نمی‌دهند (مثلاً «تصمیم، همان ویژگی است»)، ممنوع شده‌اند.
  • ریتم و آهنگ: پلاگین ریتم‌هایی که برای اثرگذاری بصری یا شنیداری ساخته شده‌اند، مانند گروه‌های سه‌تایی یا جملات ضربتی در پایان پاسخ را حذف می‌کند.
  • حذف حشو: هر جمله‌ای که هیچ حقیقت یا فکت جدیدی اضافه نکند، از جمله روایت‌های AI از فرآیندهای داخلی‌اش، حذف می‌شود.
  • قوانین فرمت‌بندی: بولت‌ها باید مستقیماً با حقیقت شروع شوند. استفاده از کلمات برجسته (Bold) در ابتدای خطوط یا خطوط برچسب‌گذاری ممنوع است. همچنین به جای نام‌های ابداعی، از کلمات ساده استفاده می‌شود.
  • علائم نگارشی و پایان‌بندی: استفاده از خط تیره بلند (Em dash) ممنوع است. مدل از برچسب‌گذاری خود یا ارائه پیشنهادهای کمکی در پایان پاسخ منع شده است.
  • محدودیت‌های حجمی: پاسخ‌های چت به ۱۵۰ کلمه محدود شده‌اند، مگر اینکه کاربر صراحتاً درخواست یک سند یا راهنمای گام‌به‌گام کرده باشد. لیست یافته‌ها به یک یا دو جمله برای هر مورد محدود شده و در صورت نیاز به بازنویسی (Redo)، مدل باید فقط تغییرات (Delta) را ارسال کند.

تحلیل عددی عملکرد

برای اعتبارسنجی، نویسنده یک چارچوب تست دقیق در docs/benchmark.md ایجاد کرده است. در این بنچمارک، نسخه «Vanilla» (بدون فایل CLAUDE.md، بدون پلاگین و بدون دستورالعمل سفارشی) در مقابل نسخه دارای پلاگین terse قرار گرفت.

  • داور: یک مدل Opus 5 به‌عنوان داور عمل کرده و هر پاسخ را با لیست قوانین تطبیق داده تا تعداد تخلفات استایلی را در هر ۱۰۰۰ کلمه بشمارد.
  • مجموعه داده: تست‌ها روی ۱۲ پرامپت عمومی و ۲۰ پرامپت خصوصی روی یک کدبیس واقعی انجام شد.
  • معیارها: تعداد کلمات، توکن‌های خروجی و انواع خاص تخلفات (استعاره‌ها، شعارها و استفاده از اول‌شخص) ردیابی شدند.

طبق داده‌های منتشر شده در github.com، در تستی با ۱۰ پاسخ چت توسط مدل Opus 5.5 (با تلاش بالا و یک بار اجرا)، تعداد کلمات از ۵۹۵۹ کلمه (حالت عادی) به ۱۷۹۳ کلمه (با پلاگین) کاهش یافت که معادل ۷۰٪ کاهش است.

یافته‌های کلیدی بنچمارک:

  • تعداد کلمات: میانگین پاسخ‌ها از ۶۳۶ کلمه به ۱۸۱ کلمه رسید (۷۲٪ کاهش).
  • تخلفات استایلی: نرخ تخلفات از ۱۱.۱ به ۱.۱ در هر ۱۰۰۰ کلمه رسید (۹۰٪ کاهش).
  • شعارها و استعاره‌ها: در مجموعه‌های پرامپت عمومی، هر دو به ۰.۰ در هر ۱۰۰۰ کلمه رسیدند. در ۲۰ پرامپت خصوصی، استفاده از استعاره در Opus 5.5 از ۳.۰۹ به ۱.۵۷ کاهش یافت. در مدل Fable 5.1 با متن نسخه ۱.۰.۰، استعاره‌ها در مجموعه عمومی از ۷.۲ به ۳.۳ رسید.
  • اول‌شخص: استفاده از ضمایر اول‌شخص از ۲.۷۹ به ۰.۴۷ در هر ۱۰۰۰ کلمه رسید (۸۳٪ کاهش).
  • توکن‌ها: تعداد توکن‌های خروجی در ۱۲ اجرا از ۱۹۳۱۰ به ۱۰۵۲۸ کاهش یافت (۴۵٪ کاهش). این موضوع بسیار حیاتی است زیرا هزینه توکن‌های خروجی در مدل‌های Opus و Fable حدود ۵ برابر بیشتر از توکن‌های ورودی است.
  • هزینه: در مجموعه عمومی کوتاه با متن ۱.۱.۰، هزینه ۲٪ و با متن ۱.۰.۰ بین ۹ تا ۱۲٪ کاهش یافت. در یک کدبیس واقعی با فایل CLAUDE.md بزرگ، هزینه برای Fable 5.1 تا ۵۱٪ و برای Opus 5.5 تا ۳۲٪ کاهش یافت.

افزونه‌ای برای ساده‌سازی پاسخ‌های Claude: بدون مقاله، شعار و استعاره. Claude را عادی صحبت کنید.

تأثیر بر مدل‌های مختلف

تست‌ها روی مدل‌های مختلف نشان داد که میزان پایبندی به قوانین متفاوت است (جداول دقیق در docs/models موجود است):

  • Fable 5.1: کاهش ۴۶ درصدی در تعداد کلمات و ۵۱٪ کاهش هزینه را نشان داد.
  • Opus 5.5: کاهش ۵۴ درصدی در تعداد کلمات و ۳۲٪ کاهش هزینه را ثبت کرد.
  • عامل‌های فرعی (Subagents): پلاگین از یک قلاب SubagentStart استفاده می‌کند تا همان قوانین را به عامل‌های فرعی منتقل کند. در جلسات Opus 5.5، عامل‌های فرعی بدون قوانین ۰.۴ خط تیره در هر ۱۰۰۰ کلمه می‌نوشتند که با قوانین به ۰ رسید. با این حال، عامل‌های نوع Explore در Fable 5.1 (که از Opus 5 استفاده می‌کنند) حتی با وجود قوانین، ۱۳ خط تیره در هر ۱۰۰۰ کلمه حفظ کردند. عامل‌های Fable بدون هیچ قانونی ۰.۱ خط تیره تولید می‌کردند. کاربران می‌توانند CLAUDE_CODE_SUBAGENT_MODEL را روی مدل اصلی خود تنظیم کنند تا رفتارها یکسان شود.

تفاوت در عمل: تست API فلاسک

برای نمایش تفاوت، یک پرسش دربارهٔ تایم‌اوت‌های دیتابیس Postgres در یک API فلاسک مطرح شد: «ما یک API فلاسک با دیتابیس Postgres داریم. درخواست‌ها هر روز حدود ساعت ۰۹:۰۰ تحت فشار تایم‌اوت می‌شوند. ابتدا کجا را بررسی می‌کنید و چرا؟»

Claude معمولی (۶۳۶ کلمه): پاسخ شامل ۶ تیتر، یک بخش توصیه‌های مفصل که مراحل قبلی را تکرار می‌کرد و پیشنهادی برای بررسی تنظیمات کاربر بود. از چارچوب‌های محاوره‌ای و روایت‌های گسترده‌ای مثل «جایی که من ابتدا برای تایم‌اوت‌های ساعت ۹ بررسی می‌کنم» و «زمان‌بندی ساعت ۹ مفیدترین سرنخ است» استفاده کرده بود.

Claude با پلاگین terse (۱۸۰ کلمه): پاسخ مستقیماً بازه زمانی نمونه‌برداری (۰۸:۵۵ تا ۰۹:۱۵)، محاسبات مربوط به Gunicorn (تعداد Workerها × Threadها در مقابل pool_size + max_overflow در SQLAlchemy) و دو تنظیم خاص لاگینگ (log_min_duration_statement و log_lock_waits) را ارائه داد. هیچ جمله‌ای دربارهٔ نویسنده یا تیترهای تکراری وجود نداشت. در چهار بار اجرای این پرامپت، تعداد کلمات ۱۴۸، ۱۷۶، ۱۸۰ و ۱۸۹ بود. دو مورد از این اجراها به دلیل استفاده از کلمات برجسته در ابتدای خط، قانون ۲۱ را نقض کردند.

مدیریت زمینه و حریم خصوصی

علاوه بر استایل، این پلاگین یک «سنجشگر زمینه» (Context Meter) به نوار وضعیت اضافه می‌کند که با سیستم رنگی کاربر را از پر شدن پنجره متنی باخبر می‌کند:

  • سبز: زیر ۳۷٪
  • زرد: از ۳۷٪
  • نارنجی: از ۴۹٪
  • آیکون جمجمه: از ۶۰٪

این آستانه به‌طور عمدی پایین تنظیم شده است. نویسنده با استناد به سه مطالعه — از جمله گزارش «Context Rot» شرکت Chroma (که افت کیفیت از ۵۰ هزار توکن در پنجره ۲۰۰ هزار تایی را در ۱۸ مدل نشان داد)، NoLiMa (که ۱۱ مدل از ۱۳ مدل در ۳۲ هزار توکن به نصف بازدهی پایه رسیدند) و مقاله «Lost in the Middle» — استدلال می‌کند که کیفیت بازیابی اطلاعات مدل‌ها بسیار زودتر از رسیدن به حد نظری پنجره متنی افت می‌کند. بنابراین، هشدار در ۶۰٪ کاربر را تشویق می‌کند تا با دستور /clear حافظه را پاک کرده و کیفیت استنتاج (Inference) را حفظ کند. این آستانه‌ها در statusline/context-meter.js تعریف شده‌اند. این تلاش برای بهینه‌سازی مصرف توکن‌ها در کنار راهکارهای دیگری مانند Jevmem برای مدیریت حافظه خودکار قرار می‌گیرد تا هزینه‌های استنتاج در پروژه‌های بزرگ کاهش یابد.

از نظر حریم خصوصی، این پلاگین هیچ تماس شبکه‌ای برقرار نمی‌کند و هیچ داده‌ای از کاربر جمع‌آوری نمی‌کند. تمام عملیات به‌صورت محلی با خواندن فایل‌های متنی در دایرکتوری پلاگین و تغییر فایل تنظیمات برای سنجشگر نوار وضعیت انجام می‌شود. جزئیات بیشتر در docs/privacy.md موجود است.

نصب و مشارکت

کاربران می‌توانند پلاگین را از طریق دایرکتوری Claude (با انتخاب Add to Claude Code) یا مستقیماً از گیت‌هاب با دستورات /plugin marketplace add lowenbjer/claude-terse و /plugin install terse@terse نصب کنند. پس از نصب، قوانین برای تمام جلسات جدید، پس از دستور /clear و در جلسات بازگشتی از طریق claude --resume اعمال می‌شوند. در یک جلسه فعال، دستور /reload-plugins آن را فوراً بارگذاری می‌کند.

برای فعال‌سازی سنجشگر زمینه، کاربران دستور /terse:install-meter را اجرا می‌کنند که یک اسکریپت ۲۶ خطی را به دایرکتوری داده‌های پلاگین کپی کرده و یک ورودی statusLine به فایل ~/.claude/settings.json اضافه می‌کند.

پروژه از جمع‌سپاری داده‌ها برای بهینه‌سازی قوانین تشویق می‌کند. کاربران می‌توانند با اجرای ۱۲ پرامپت عمومی از طریق bench/run.py و مستندسازی یافته‌ها در کاتالوگ docs/models مشارکت کنند (هزینه هر ردیف حدود ۱ دلار است). همچنین کاربران تشویق شده‌اند پاسخ‌های متخلف از قوانین را از طریق قالب Issue مخصوص «Post your worst reply» گزارش دهند.

تحلیل: جنگ با Slop در AI

برای یک توسعه‌دهنده حرفه‌ای، این تغییر فراتر از خواندن متن کمتر است؛ موضوع اصلی کاهش «بار شناختی» (Cognitive Load) است. وقتی یک AI برای یک اصلاح ۱۰ کلمه‌ای، یک مقاله ۶۰۰ کلمه‌ای ارائه می‌دهد، توسعه‌دهنده باید انرژی ذهنی صرف کند تا سیگنال را از نویز جدا کند. با اجبار مدل به تحویل «حقیقت-محور» (Fact-first)، claude-terse هوش مصنوعی را از یک شریک گفتگو به یک ابزار فنی با تراکم اطلاعاتی بالا تبدیل می‌کند.

این موضوع همچنین نشان‌دهنده یک روند رو به رشد در بخش «AI کاربردی» است: حرکت به سمت پلاگین‌های «نرده حفاظتی» (Guardrail) خارجی برای اصلاح رفتارهایی که ارائه‌دهندگان اصلی (مانند Anthropic یا OpenAI) نمی‌توانند از طریق RLHF کلی حل کنند. هرچه مدل‌ها بزرگ‌تر می‌شوند، تمایل آن‌ها به نثر «مؤدبانه» اما متورم افزایش می‌یابد و این ابزارهای جراحی‌گونه برای اعمال استایل در محیط‌های عملیاتی ضروری می‌شوند.

اگر با پرحرفی Claude دست‌وپنجه نرم می‌کنید، می‌توانید این قوانین را به‌صورت دستی تست کنید یا پلاگین را نصب کنید تا ببینید آیا کاهش ۷۰ درصدی نویز، سرعت کدنویسی شما را افزایش می‌دهد یا خیر.

اما داستان سخت‌افزاری این تحول و تأثیر آن بر هزینه توکن‌ها حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

کاهش ۷۰ درصدی حجم خروجی نه تنها بار شناختی توسعه‌دهنده را کم می‌کند، بلکه به‌دلیل قیمت بالای توکن‌های خروجی، هزینه‌های عملیاتی را به‌طور مستقیم کاهش می‌دهد. این رویکرد تخصص‌یافته در مدیریت استایل، الگویی برای بهینه‌سازی سایر عامل‌های AI در محیط‌های تولیدی است.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که با محدودیت‌های هزینه API یا سرعت اینترنت مواجه‌اند، کاهش ۴۵ درصدی توکن‌های خروجی به معنای کاهش هزینه و افزایش سرعت پاسخ‌دهی است.

·نگاه ما
تحریریه دات‌هوش

این ابزار نشان می‌دهد که در دنیای عملیاتی AI، «کمتر، بیشتر است». وقتی مدل‌های زبانی بزرگتر می‌شوند، تمایل آن‌ها به چاپلوسی و تولید متون مودبانه اما توخالی افزایش می‌یابد. claude-terse در واقع یک لایه کنترل کیفیت خارجی است که جایگزین RLHFهای کلی شرکت‌های سازنده می‌شود تا مدل را از یک «هم‌صحبت» به یک «ابزار فنی» تبدیل کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.