تصور کنید برای هر بار پرسیدن یک سؤال ساده از یک کتاب ۱۰۰۰ صفحهای، باید کل کتاب را دوباره با هزینه کامل بخرید. این دقیقاً همان «مالیات توکن» است که توسعهدهندگان در تحلیل اسناد حجیم با Claude میپردازند و Token Saver آمده تا این بازی را تغییر دهد.
طبق اعلام Marktechpost AI، افزونه جدید Token Saver در نسخه ۱.۰ توانسته است مصرف توکنها را بین ۹۲ تا ۹۹ درصد کاهش دهد. این ابزار با استفاده از پروتکل زمینهٔ مدل (MCP) — که شبیه به یک درگاه ارتباطی استاندارد برای وصل کردن ابزارهای خارجی به هوش مصنوعی است — اجازه میدهد اسناد بهجای آپلود در سرور، روی سیستم شما باقی بمانند. با نگه داشتن اسناد در ماشین محلی، این ابزار مالیات توکنی را که در هر نوبت گفتگو برای یک PDF هزار صفحهای هزاران توکن هزینه دارد و تحلیل اسناد در مقیاس بزرگ را بهشدت گران میکند، حذف میکند.
تیم توسعه و پیشینه
ابزار Token Saver در مجموعه Marktechpost AI Media Inc توسعه یافته است. توسعهدهنده اصلی این پروژه، «آرناو رای» (Arnav Rai) است؛ دانشجوی علوم کامپیوتر در مؤسسه فناوری روچستر (RIT) که در رشته اقتصاد نیز تحصیل میکند. رای تجربیات خود در توسعهبکاند را طی دوره کارآموزی در Marktechpost به این پروژه آورد، جایی که در کنار کدنویسی، در زمینه پژوهشهای AI/ML نیز مینویسد. نظارت بر این پروژه بر عهده «ژان-مارک مومسین» (Jean-marc Mommessin)، فارغالتحصیل MBA استنفورد و مدیر اجرایی کسبوکارهای هوش مصنوعی بود که در سال ۲۰۰۶ یک شرکت بینایی ماشین تأسیس کرد. همچنین «آصف رزاق» (Asif Razzaq)، مدیرعامل Marktechpost Media Inc و کارآفرینی که متعهد به بهرهگیری از هوش مصنوعی برای خیر اجتماعی است، در هدایت این پروژه نقش داشته است.
بسیاری از کاربران تصور میکنند آپلود PDF در Claude تنها یک استخراج متنی ساده است. اما در واقعیت، کلود برای حفظ چیدمان و نمودارها، صفحات را به تصویر تبدیل میکند و بهطور جداگانه متن را استخراج مینماید. به گزارش منابع فنی، این رفتار پیش از آنکه حتی یک توکن تصویر شمارش شود، حدود ۱,۵۰۰ تا ۳,۰۰۰ توکن برای هر صفحه هزینه دارد. از آنجا که تاریخچه گفتگو در هر نوبت دوباره ارسال میشود، هزینهها بهصورت نمایی رشد میکنند. همانطور که در تحلیل قبلی ما دربارهی Claude Code و چالشهای درآمدزایی آن در جلسات کسبوکار خودمختار به دلیل اصطکاکهای عملیاتی اشاره کردیم، این ناکارآمدی در مقیاس بالا میتواند حتی پیشرفتهترین ابزارها را غیربهصرفه کند.
علاوه بر هزینه، مجبور کردن یک مدل زبانی بزرگ (LLM) — مثل کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب میدهد — به جستوجوی دو پاراگراف مرتبط در یک کتاب ۱۰۰۰ صفحهای، نه تنها ناکارآمد است، بلکه ریسک توهم (Hallucination) — یا همان زمانی که مدل با اطمینان چیزی میگوید که وجود ندارد — را بالا میبرد. اگرچه ابزارهایی مانند Prompt Caching (کش کردن پرامپت) و Claude Projects اثر این ضربه را کاهش میدهند، اما مشکل اصلی را حل نمیکنند: کل سند همچنان باید از مرز دستگاه شما عبور کرده و به سرورهای ارائهدهنده ارسال شود. این چالشها باعث شده تا متخصصان به دنبال راهکارهای کاهش هزینههای عملیاتی از طریق کشینگ و مدلهای آبشاری باشند تا بهرهوری سیستمها را افزایش دهند.
Token Saver با تبدیل شدن به یک سرور MCP محلی، این جریان را عوض میکند. این برنامه یک نرمافزار سبک در پسزمینه ماشین شماست که کلود از آن به عنوان یک «ابزار» استفاده میکند. بهجای ارسال کل فایل، این افزونه از یک سیستم تولید بازیابی-افزا ترکیبی (Local Hybrid RAG) استفاده میکند تا فقط پاسخهای خاص را در هارد دیسک شما پیدا کرده و تنها تکههای مرتبط را به مدل ارسال کند. این مکانیسم تضمین میکند که دادههای اختصاصی و حساس هرگز دستگاه کاربر را ترک نکنند. این رویکرد با استفاده از RAG برای کاهش هزینههای استنتاج در مقیاس صنعتی همسو است و نشان میدهد چرا پنجرههای زمینه وسیع همیشه پاسخگو نیستند.
موتور Hybrid RAG
این ابزار برای رسیدن به بالاترین دقت، دو روش جستوجوی متمایز را با هم ترکیب میکند که در صنعت بازیابی اسناد بهعنوان «استاندارد طلایی» شناخته میشوند:
- تطابق کلیدواژه (BM25): این روش بر بستر جستوجوی داخلی FTS5 در SQLite اجرا میشود و با وزن ۰.۴ تنظیم شده تا اصطلاحات دقیق و عبارتهای خاص را پیدا کند.
- جستوجوی معنایی (Semantic Search): این بخش از مدل بردارساز محلی all-MiniLM-L6-v2 استفاده میکند. با وزن ۰.۶، این سیستم به مدل اجازه میدهد مفهوم مفهومی سؤال را درک کند، بهجای اینکه فقط به دنبال تطبیق کلمات باشد.

طراحی این سیستم بهگونهای است که در برابر خطا مقاوم باشد؛ اگر مدل بردارساز (Embedding) به هر دلیلی بارگذاری نشود، سیستم بهطور خودکار و بدون وقفه به حالت «تطابق صرفاً کلیدواژهای» بازمیگردد تا ابزار همچنان کاربردی باقی بماند.
خط لوله پردازش ۸ مرحلهای
Token Saver بهطور کامل درون یک فرآیند محلی طولانیمدت اجرا میشود. پیش از آنکه کلود هر متنی را ببیند، سیستم یک خط لوله سریع محلی شامل هشت مرحله را اجرا میکند:
۱. استخراج (Extract): متن را با استفاده از کتابخانه pypdfium2 بیرون میکشد و در صورت شکست، از pypdf به عنوان جایگزین استفاده میکند.
۲. تکهبندی (Chunk): متن را به قطعات ۱۸۰ کلمهای تقسیم میکند، با ۴۰ کلمه همپوشانی (Overlap) تا بستر معنایی متن بهصورت کورکورانه قطع نشود.
۳. امتیازدهی (Score): تکهها را با استفاده از رویکرد ترکیبی BM25 و مدل بردارساز محلی ارزیابی میکند.
۴. درگاه (Gate): یک حد نصاب کیفی را اعمال میکند. قطعاتی که کلیدواژههای دقیق ندارند، باید برای تأیید حداقل ۰.۲۵ شباهت معنایی داشته باشند.
۵. حذف تکرار (Deduplicate): قطعات تقریباً یکسان را حذف میکند تا فضای توکنها بیهوده اشغال نشود.
۶. هرس (Trim): متن را دقیقاً به جملاتی محدود میکند که به سؤال کاربر پاسخ میدهند.
۷. بودجه (Budget): کل حجم دادههای ارسالی به کلود را به ۸,۰۰۰ کاراکتر محدود میکند.
۸. پاکتبندی (Envelope): متن بازیابی شده را در یک المان document-chunk قرار میدهد که حاوی نام فایل منبع و شماره صفحه دقیق است.

نتایج عددی کاهش هزینه
بنچمارکهای اندازهگیری شده توسط tiktoken (با استفاده از cl100k_base بهعنوان جایگزین) نشان میدهد که در مقایسه سند کامل با تکههای بازیابی شده، صرفهجوییهای چشمگیری رخ میدهد. این ارقام با فرض یک سؤال برای هر سند و این پیشفرض که در حالت عادی کل سند در هر جستوجو محاسبه میشد، به دست آمدهاند:
- قوانین GDPR (EU 2016/679): ۸۸ صفحه | کاهش از ۷۰,۲۶۰ توکن به ۹۹۶ توکن (۹۸.۶٪ صرفهجویی).
- پرونده SFFA v. Harvard: ۲۳۳ صفحه | کاهش از ۱۳۳,۳۴۹ توکن به ۷۴۰ توکن (۹۹.۴٪ صرفهجویی).
- برچسب دارویی FDA: ۳۳ صفحه | کاهش از ۲۳,۹۵۹ توکن به ۱,۰۲۱ توکن (۹۵.۷٪ صرفهجویی).

برای متخصصانی که بهطور مکرر با آرای دادگاه، استانداردهای فنی، گزارشهای مالی یا کتابهای درسی متراکم کار میکنند، این یعنی حذف کامل مالیات توکنی تکراری.
امنیت و استقرار
در محیطهای حقوقی و سازمانی، حریم خصوصی دادهها غیرقابل مذاکره است. مدل امنیتی Token Saver بر سه پایه استوار است:
- صفر-آپلود: سند هرگز دستگاه شما را ترک نمیکند و روی هارد دیسک شما باقی میماند.
- لیست سفید پوشهها (Folder Allowlisting): شما یک پوشه خاص را پیکربندی میکنید و سرور بهطور فعال از خواندن هر فایلی خارج از این دایرکتوری تعیینشده امتناع میکند.
- ایزولاسیون شبکه: ارتباط با Claude Desktop منحصراً از طریق ورودی/خروجی استاندارد (stdio) انجام میشود. هیچ پورت شبکهای برای گوش دادن (Listening) وجود ندارد که این امر سطح حمله را بهشدت کاهش میدهد.

نصب این ابزار برای غیربرنامهنویسها طراحی شده و به هیچ محیط پایتون یا تنظیمات ترمینال نیاز ندارد. کاربران باید بسته token-saver-ccr.mcpb را از صفحه Releases گیتهاب پروژه دانلود کرده و از طریق تنظیمات Claude Desktop (بخش Extensions -> Install extension) نصب کنند و سپس پوشه PDF خود را انتخاب نمایند. در اولین درخواست، کاربران باید گزینه "Always allow" را انتخاب کنند.
انتخاب پوشه صحیح در اینجا حیاتی است؛ زیرا این انتخاب سه هدف را دنبال میکند: مرز خواندن را تعیین میکند، به کاربر اجازه میدهد فایل را فقط با نام صدا بزند (بهجای تایپ مسیر کامل)، و فهرستی را تولید میکند که سرور در شروع گفتگو به کلود نشان میدهد. یک پوشه کوچک حاوی اسناد مرتبط، بسیار مؤثرتر از اشاره دادن ابزار به کل دایرکتوری "Documents" است.
عملکرد مدلها: Sonnet در برابر Opus
Token Saver در هر سه سطح Claude 3.5 کار میکند، اما آزمایشها رفتارهای متفاوتی را نشان داد:
- Claude 3.5 Sonnet: این مدل گزینه پیشفرض توصیه شده است. ارجاعات غیردقیق به فایلها را بهخوبی مدیریت میکند و در صورت شباهت نام دو فایل، سؤالات شفافکننده میپرسد.
- Claude 3 Opus: این مدل در اسناد پیچیده با چندین گوینده (مانند احکام دادگاه که شامل نظر اکثریت و نظرات مخالف است) میدرخشد و میتواند تشخیص دهد چه زمانی استنتاج خود را بر اساس بستر متن انجام داده است نه متن صریح.
این چرخش به سمت «پیشپردازش محلی» نشان میدهد که در آینده، مدلهای زبانی دیگر موتور جستوجو نیستند، بلکه صرفاً ترکیبکنندهای (Synthesizer) از دادههای بازیابیشدهاند. با انتقال منطق بازیابی به لبه (Edge)، توسعهدهندگان میتوانند خطرات هزینه و حریم خصوصی پنجرههای زمینه (Context Window) عظیم را دور بزنند. برای کاربر، این یعنی تبدیل AI از یک جعبه سیاه گرانقیمت به یک شاخص دقیق و قابل راستیآزمایی از کتابخانه محلیاش، که اجازه میدهد ادعاها فوراً با ارجاع به شماره صفحات ارائه شده، بررسی شوند.
برای شروع صرفهجویی در توکنها، میتوانید مخزن گیتهاب پروژه (با لایسنس MIT) را بررسی کرده و آخرین بسته .mcpb را برای ایندکس کردن استانداردهای فنی یا گزارشهای مالی خود نصب کنید.
گام بعدی شما
- مخزن گیتهاب پروژه را بررسی کرده و آخرین بسته
.mcpbرا نصب کنید. - برای حداکثر بازدهی، بهجای کل پوشه Documents، پوشههای کوچک و تخصصی برای هر پروژه ایجاد کنید.
- تفاوت در دقت استخراج مفاهیم را با مقایسه پاسخهای Sonnet و Opus در اسناد حقوقی بسنجید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو