پرش به محتوای اصلی
پرش به محتوای مقاله

«حریم خصوصی و کاهش هزینه»؛ دستاوردهای Hybrid RAG در Token Saver

·۸ مرداد ۱۴۰۵۶ دقیقه مطالعه
توکن‌سیور: افزونه متن‌باز MCP با RAG ترکیبی محلی برای کاهش ۹۰-۹۹٪ هزینه توکن PDF در Claude
توکن‌سیور: افزونه متن‌باز MCP با RAG ترکیبی محلی برای کاهش ۹۰-۹۹٪ هزینه توکن PDF در Claude
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

پیاده‌سازی یک خط لوله ۸ مرحله‌ای محلی که پیش از ارسال داده به LLM، عملیات Chunking و Scoring را انجام می‌دهد؛ این یعنی مدل دیگر مسئول جست‌وجو در سند نیست و فقط پاسخ را سنتز می‌کند.

تصور کنید برای هر بار پرسیدن یک سؤال ساده از یک کتاب ۱۰۰۰ صفحه‌ای، باید کل کتاب را دوباره با هزینه کامل بخرید. این دقیقاً همان «مالیات توکن» است که توسعه‌دهندگان در تحلیل اسناد حجیم با Claude می‌پردازند و Token Saver آمده تا این بازی را تغییر دهد.

طبق اعلام Marktechpost AI، افزونه جدید Token Saver در نسخه ۱.۰ توانسته است مصرف توکن‌ها را بین ۹۲ تا ۹۹ درصد کاهش دهد. این ابزار با استفاده از پروتکل زمینهٔ مدل (MCP) — که شبیه به یک درگاه ارتباطی استاندارد برای وصل کردن ابزارهای خارجی به هوش مصنوعی است — اجازه می‌دهد اسناد به‌جای آپلود در سرور، روی سیستم شما باقی بمانند. با نگه داشتن اسناد در ماشین محلی، این ابزار مالیات توکنی را که در هر نوبت گفتگو برای یک PDF هزار صفحه‌ای هزاران توکن هزینه دارد و تحلیل اسناد در مقیاس بزرگ را به‌شدت گران می‌کند، حذف می‌کند.

تیم توسعه و پیشینه

ابزار Token Saver در مجموعه Marktechpost AI Media Inc توسعه یافته است. توسعه‌دهنده اصلی این پروژه، «آرناو رای» (Arnav Rai) است؛ دانشجوی علوم کامپیوتر در مؤسسه فناوری روچستر (RIT) که در رشته اقتصاد نیز تحصیل می‌کند. رای تجربیات خود در توسعه‌بک‌اند را طی دوره کارآموزی در Marktechpost به این پروژه آورد، جایی که در کنار کدنویسی، در زمینه پژوهش‌های AI/ML نیز می‌نویسد. نظارت بر این پروژه بر عهده «ژان-مارک مومسین» (Jean-marc Mommessin)، فارغ‌التحصیل MBA استنفورد و مدیر اجرایی کسب‌وکارهای هوش مصنوعی بود که در سال ۲۰۰۶ یک شرکت بینایی ماشین تأسیس کرد. همچنین «آصف رزاق» (Asif Razzaq)، مدیرعامل Marktechpost Media Inc و کارآفرینی که متعهد به بهره‌گیری از هوش مصنوعی برای خیر اجتماعی است، در هدایت این پروژه نقش داشته است.

بسیاری از کاربران تصور می‌کنند آپلود PDF در Claude تنها یک استخراج متنی ساده است. اما در واقعیت، کلود برای حفظ چیدمان و نمودارها، صفحات را به تصویر تبدیل می‌کند و به‌طور جداگانه متن را استخراج می‌نماید. به گزارش منابع فنی، این رفتار پیش از آنکه حتی یک توکن تصویر شمارش شود، حدود ۱,۵۰۰ تا ۳,۰۰۰ توکن برای هر صفحه هزینه دارد. از آنجا که تاریخچه گفتگو در هر نوبت دوباره ارسال می‌شود، هزینه‌ها به‌صورت نمایی رشد می‌کنند. همان‌طور که در تحلیل قبلی ما درباره‌ی Claude Code و چالش‌های درآمدزایی آن در جلسات کسب‌وکار خودمختار به دلیل اصطکاک‌های عملیاتی اشاره کردیم، این ناکارآمدی در مقیاس بالا می‌تواند حتی پیشرفته‌ترین ابزارها را غیربه‌صرفه کند.

علاوه بر هزینه، مجبور کردن یک مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب می‌دهد — به جست‌وجوی دو پاراگراف مرتبط در یک کتاب ۱۰۰۰ صفحه‌ای، نه تنها ناکارآمد است، بلکه ریسک توهم (Hallucination) — یا همان زمانی که مدل با اطمینان چیزی می‌گوید که وجود ندارد — را بالا می‌برد. اگرچه ابزارهایی مانند Prompt Caching (کش کردن پرامپت) و Claude Projects اثر این ضربه را کاهش می‌دهند، اما مشکل اصلی را حل نمی‌کنند: کل سند همچنان باید از مرز دستگاه شما عبور کرده و به سرورهای ارائه‌دهنده ارسال شود. این چالش‌ها باعث شده تا متخصصان به دنبال راهکارهای کاهش هزینه‌های عملیاتی از طریق کشینگ و مدل‌های آبشاری باشند تا بهره‌وری سیستم‌ها را افزایش دهند.

Token Saver با تبدیل شدن به یک سرور MCP محلی، این جریان را عوض می‌کند. این برنامه یک نرم‌افزار سبک در پس‌زمینه ماشین شماست که کلود از آن به عنوان یک «ابزار» استفاده می‌کند. به‌جای ارسال کل فایل، این افزونه از یک سیستم تولید بازیابی-افزا ترکیبی (Local Hybrid RAG) استفاده می‌کند تا فقط پاسخ‌های خاص را در هارد دیسک شما پیدا کرده و تنها تکه‌های مرتبط را به مدل ارسال کند. این مکانیسم تضمین می‌کند که داده‌های اختصاصی و حساس هرگز دستگاه کاربر را ترک نکنند. این رویکرد با استفاده از RAG برای کاهش هزینه‌های استنتاج در مقیاس صنعتی همسو است و نشان می‌دهد چرا پنجره‌های زمینه وسیع همیشه پاسخگو نیستند.

موتور Hybrid RAG

این ابزار برای رسیدن به بالاترین دقت، دو روش جست‌وجوی متمایز را با هم ترکیب می‌کند که در صنعت بازیابی اسناد به‌عنوان «استاندارد طلایی» شناخته می‌شوند:

  • تطابق کلیدواژه (BM25): این روش بر بستر جست‌وجوی داخلی FTS5 در SQLite اجرا می‌شود و با وزن ۰.۴ تنظیم شده تا اصطلاحات دقیق و عبارت‌های خاص را پیدا کند.
  • جست‌وجوی معنایی (Semantic Search): این بخش از مدل بردارساز محلی all-MiniLM-L6-v2 استفاده می‌کند. با وزن ۰.۶، این سیستم به مدل اجازه می‌دهد مفهوم مفهومی سؤال را درک کند، به‌جای اینکه فقط به دنبال تطبیق کلمات باشد.

معرفی Token Saver: افزونه متن‌باز MCP با RAG ترکیبی محلی برای کاهش ۹۰-۹۹٪ هزینه توکن PDF در Claude

طراحی این سیستم به‌گونه‌ای است که در برابر خطا مقاوم باشد؛ اگر مدل بردارساز (Embedding) به هر دلیلی بارگذاری نشود، سیستم به‌طور خودکار و بدون وقفه به حالت «تطابق صرفاً کلیدواژه‌ای» بازمی‌گردد تا ابزار همچنان کاربردی باقی بماند.

خط لوله پردازش ۸ مرحله‌ای

Token Saver به‌طور کامل درون یک فرآیند محلی طولانی‌مدت اجرا می‌شود. پیش از آنکه کلود هر متنی را ببیند، سیستم یک خط لوله سریع محلی شامل هشت مرحله را اجرا می‌کند:

۱. استخراج (Extract): متن را با استفاده از کتابخانه pypdfium2 بیرون می‌کشد و در صورت شکست، از pypdf به عنوان جایگزین استفاده می‌کند.
۲. تکه‌بندی (Chunk): متن را به قطعات ۱۸۰ کلمه‌ای تقسیم می‌کند، با ۴۰ کلمه هم‌پوشانی (Overlap) تا بستر معنایی متن به‌صورت کورکورانه قطع نشود.
۳. امتیازدهی (Score): تکه‌ها را با استفاده از رویکرد ترکیبی BM25 و مدل بردارساز محلی ارزیابی می‌کند.
۴. درگاه (Gate): یک حد نصاب کیفی را اعمال می‌کند. قطعاتی که کلیدواژه‌های دقیق ندارند، باید برای تأیید حداقل ۰.۲۵ شباهت معنایی داشته باشند.
۵. حذف تکرار (Deduplicate): قطعات تقریباً یکسان را حذف می‌کند تا فضای توکن‌ها بیهوده اشغال نشود.
۶. هرس (Trim): متن را دقیقاً به جملاتی محدود می‌کند که به سؤال کاربر پاسخ می‌دهند.
۷. بودجه (Budget): کل حجم داده‌های ارسالی به کلود را به ۸,۰۰۰ کاراکتر محدود می‌کند.
۸. پاکت‌بندی (Envelope): متن بازیابی شده را در یک المان document-chunk قرار می‌دهد که حاوی نام فایل منبع و شماره صفحه دقیق است.

توکن‌سیور: افزونه متن‌باز MCP با RAG ترکیبی محلی برای کاهش ۹۰-۹۹٪ هزینه توکن PDF در کلود

نتایج عددی کاهش هزینه

بنچمارک‌های اندازه‌گیری شده توسط tiktoken (با استفاده از cl100k_base به‌عنوان جایگزین) نشان می‌دهد که در مقایسه سند کامل با تکه‌های بازیابی شده، صرفه‌جویی‌های چشمگیری رخ می‌دهد. این ارقام با فرض یک سؤال برای هر سند و این پیش‌فرض که در حالت عادی کل سند در هر جست‌وجو محاسبه می‌شد، به دست آمده‌اند:

  • قوانین GDPR (EU 2016/679): ۸۸ صفحه | کاهش از ۷۰,۲۶۰ توکن به ۹۹۶ توکن (۹۸.۶٪ صرفه‌جویی).
  • پرونده SFFA v. Harvard: ۲۳۳ صفحه | کاهش از ۱۳۳,۳۴۹ توکن به ۷۴۰ توکن (۹۹.۴٪ صرفه‌جویی).
  • برچسب دارویی FDA: ۳۳ صفحه | کاهش از ۲۳,۹۵۹ توکن به ۱,۰۲۱ توکن (۹۵.۷٪ صرفه‌جویی).

آشنایی با Token Saver: افزونه متن‌باز MCP با RAG ترکیبی محلی برای کاهش ۹۰-۹۹٪ هزینه توکن PDF در Claude

برای متخصصانی که به‌طور مکرر با آرای دادگاه، استانداردهای فنی، گزارش‌های مالی یا کتاب‌های درسی متراکم کار می‌کنند، این یعنی حذف کامل مالیات توکنی تکراری.

امنیت و استقرار

در محیط‌های حقوقی و سازمانی، حریم خصوصی داده‌ها غیرقابل مذاکره است. مدل امنیتی Token Saver بر سه پایه استوار است:

  • صفر-آپلود: سند هرگز دستگاه شما را ترک نمی‌کند و روی هارد دیسک شما باقی می‌ماند.
  • لیست سفید پوشه‌ها (Folder Allowlisting): شما یک پوشه خاص را پیکربندی می‌کنید و سرور به‌طور فعال از خواندن هر فایلی خارج از این دایرکتوری تعیین‌شده امتناع می‌کند.
  • ایزولاسیون شبکه: ارتباط با Claude Desktop منحصراً از طریق ورودی/خروجی استاندارد (stdio) انجام می‌شود. هیچ پورت شبکه‌ای برای گوش دادن (Listening) وجود ندارد که این امر سطح حمله را به‌شدت کاهش می‌دهد.

معرفی Token Saver: افزونه متن‌باز MCP با RAG ترکیبی محلی برای کاهش ۹۰-۹۹٪ هزینه توکن PDF در Claude

نصب این ابزار برای غیربرنامه‌نویس‌ها طراحی شده و به هیچ محیط پایتون یا تنظیمات ترمینال نیاز ندارد. کاربران باید بسته token-saver-ccr.mcpb را از صفحه Releases گیت‌هاب پروژه دانلود کرده و از طریق تنظیمات Claude Desktop (بخش Extensions -> Install extension) نصب کنند و سپس پوشه PDF خود را انتخاب نمایند. در اولین درخواست، کاربران باید گزینه "Always allow" را انتخاب کنند.

انتخاب پوشه صحیح در اینجا حیاتی است؛ زیرا این انتخاب سه هدف را دنبال می‌کند: مرز خواندن را تعیین می‌کند، به کاربر اجازه می‌دهد فایل را فقط با نام صدا بزند (به‌جای تایپ مسیر کامل)، و فهرستی را تولید می‌کند که سرور در شروع گفتگو به کلود نشان می‌دهد. یک پوشه کوچک حاوی اسناد مرتبط، بسیار مؤثرتر از اشاره دادن ابزار به کل دایرکتوری "Documents" است.

عملکرد مدل‌ها: Sonnet در برابر Opus

Token Saver در هر سه سطح Claude 3.5 کار می‌کند، اما آزمایش‌ها رفتارهای متفاوتی را نشان داد:

  • Claude 3.5 Sonnet: این مدل گزینه پیش‌فرض توصیه شده است. ارجاعات غیردقیق به فایل‌ها را به‌خوبی مدیریت می‌کند و در صورت شباهت نام دو فایل، سؤالات شفاف‌کننده می‌پرسد.
  • Claude 3 Opus: این مدل در اسناد پیچیده با چندین گوینده (مانند احکام دادگاه که شامل نظر اکثریت و نظرات مخالف است) می‌درخشد و می‌تواند تشخیص دهد چه زمانی استنتاج خود را بر اساس بستر متن انجام داده است نه متن صریح.

این چرخش به سمت «پیش‌پردازش محلی» نشان می‌دهد که در آینده، مدل‌های زبانی دیگر موتور جست‌وجو نیستند، بلکه صرفاً ترکیب‌کننده‌ای (Synthesizer) از داده‌های بازیابی‌شده‌اند. با انتقال منطق بازیابی به لبه (Edge)، توسعه‌دهندگان می‌توانند خطرات هزینه و حریم خصوصی پنجره‌های زمینه (Context Window) عظیم را دور بزنند. برای کاربر، این یعنی تبدیل AI از یک جعبه سیاه گران‌قیمت به یک شاخص دقیق و قابل راستی‌آزمایی از کتابخانه محلی‌اش، که اجازه می‌دهد ادعاها فوراً با ارجاع به شماره صفحات ارائه شده، بررسی شوند.

برای شروع صرفه‌جویی در توکن‌ها، می‌توانید مخزن گیت‌هاب پروژه (با لایسنس MIT) را بررسی کرده و آخرین بسته .mcpb را برای ایندکس کردن استانداردهای فنی یا گزارش‌های مالی خود نصب کنید.

گام بعدی شما

  • مخزن گیت‌هاب پروژه را بررسی کرده و آخرین بسته .mcpb را نصب کنید.
  • برای حداکثر بازدهی، به‌جای کل پوشه Documents، پوشه‌های کوچک و تخصصی برای هر پروژه ایجاد کنید.
  • تفاوت در دقت استخراج مفاهیم را با مقایسه پاسخ‌های Sonnet و Opus در اسناد حقوقی بسنجید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این ابزار با تکیه بر تخصص در پروتکل MCP، هزینه تحلیل اسناد حجیم را از محدوده تجاری خارج کرده و به سطح رایگان یا بسیار ارزان می‌برد. همچنین با حذف ارسال داده به سرور، اعتماد سازمان‌های حساس را برای استفاده از مدل‌های ابری جلب می‌کند.

تأثیر برای ایران

به دلیل رایگان و متن‌باز بودن، توسعه‌دهندگان ایرانی می‌توانند بدون نیاز به پرداخت هزینه‌های دلاری توکن‌های بالا، تحلیل اسناد حجیم را روی سیستم‌های محلی خود پیاده کنند.

·نگاه ما
تحریریه دات‌هوش

انتقال لایه بازیابی از سرورهای ابری به محیط محلی (Local RAG)، پارادایم استفاده از پنجره‌های متنی عظیم را به چالش می‌کشد. به جای تکیه بر حافظه کوتاه‌مدت مدل، ابزارهایی مثل Token Saver تبدیل به «حافظه خارجی» مدل می‌شوند که هزینه استنتاج را به شدت پایین می‌آورد. این رویکرد احتمالاً پایان era-ی خواهد بود که در آن شرکت‌ها برای پذیرفتن اسناد بیشتر، فقط روی افزایش Context Window تمرکز می‌کردند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.