تصور کنید یک اسکرینشات از مکبوک با هزاران پیکسل عرض دارید، اما مدل هوش مصنوعی برای رفع یک خطای کدنویسی تنها به بخش کوچکی از آن نیاز دارد. برای حل این ناکارآمدی، طه حسین (Taha Hussein)، مهندس iOS و هوش مصنوعی، ابزار TokenSaver را بهعنوان یک بهینهساز تخصصی تصاویر برای مرورگر فایرفاکس عرضه کرد.
بسیاری از توسعهدهندگان بهطور منظم خروجیهای ترمینال، باگهای رابط کاربری یا پاسخهای API را برای دستیارهای هوش مصنوعی میفرستند. ارسال یک تصویر خام با ابعاد ۳۰۰۰ در ۲۰۰۰ پیکسل، حجم زیادی از توکن (Token) — شبیه برشهای کوچکی از متن یا تصویر که مدل تکهتکه میخورد — را مصرف میکند، بدون آنکه ارزش افزودهای برای درک مدل داشته باشد. برای درک عمیقتر از اینکه این واحدها چگونه دادهها را به زبان ماشین ترجمه میکنند، میتوانید بررسی ما دربارهی نقش توکنسازها در تبدیل ریاضیات به هوش مصنوعی را مطالعه کنید.
همانطور که در تحلیلهای پیشین ما دربارهی بهینهسازی هزینههای استنتاج اشاره کردیم، مدیریت ورودیها کلید کاهش هزینههاست. TokenSaver یک مرحلهٔ بهینهسازی را بین اسکرینشات و ابزار هوش مصنوعی قرار میدهد تا دادههای زائد را حذف کند. هدف این نیست که کیفیت تصویر از بین برود، بلکه دادههای غیرضروری حذف میشوند تا اطلاعات حیاتی باقی بمانند. این ابزار گردش کار را از «اسکرینشات $\rightarrow$ ابزار AI» به مسیر بهینهتر «اسکرینشات $\rightarrow$ TokenSaver $\rightarrow$ بهینهسازی ابعاد $\rightarrow$ تخمین توکن $\rightarrow$ ابزار AI» تغییر میدهد.

به نقل از مستندات توسعهدهنده، این افزونه سه حالت بهینهسازی مختلف را برای ایجاد تعادل بین وضوح و اندازه پشتیبانی میکند:
- Sharp: اولویت با کیفیت بالا برای کارهای دقیق، مانند اسکرینشاتهایی که حاوی متنهای ریز کد هستند.
- Auto: تعادل بین کیفیت و بهینهسازی برای استفادههای عمومی.
- Max Saving: اولویت با کوچکترین اندازه ممکن برای اسکرینشاتهای ساده از رابط کاربری.
کاربران میتوانند تصاویر را از طریق انتخاب فایل، کشیدن و رها کردن (Drag and Drop) یا چسباندن (Paste) مستقیم ارسال کنند. برای شفافیت بیشتر، این ابزار تعداد تخمینی توکنها را قبل و بعد از بهینهسازی نمایش میدهد تا کاربر متوجه تفاوت واقعی پیش از ارسال به مدل شود.
یک تصمیم راهبردی در طراحی این ابزار، پیادهسازی پردازش محلی است. طبق اعلام طه حسین، از آنجا که اسکرینشاتهای توسعهدهندگان اغلب حاوی اطلاعات حساس مانند پاسخهای API، کدهای منبع یا داشبوردهای داخلی است، تمام عملیات تغییر اندازه بهصورت محلی در مرورگر انجام میشود. هیچ سروری برای پردازش تصاویر وجود ندارد و دادهها هرگز دستگاه کاربر را ترک نمیکنند.
بهینهسازی برای هوش مصنوعی با فشردهسازی سنتی متفاوت است. در حالی که ابزارهای معمولی روی حجم فایل و کیفیت JPEG تمرکز میکنند، بهینهسازی برای مدلهای چندوجهی (Multimodal) — مدلهایی که همزمان متن، عکس و صدا را میفهمند، مثل ما که با چند حس دنیا را میخوانیم — این پرسش را مطرح میکند: مدل برای این وظیفه دقیقاً به چه مقدار اطلاعات بصری نیاز دارد؟
برای یک توسعهدهنده، این به معنای آپلود سریعتر و کاهش هزینهها در مدلهایی است که محدودیت توکن دارند. این ابزار باعث میشود بهجای آپلود کورکورانه فایلهای با رزولوشن بالا، سطح جزئیات مورد نیاز برای پرامپت بهطور آگاهانه انتخاب شود. این دقت در ورودیها میتواند از بروز خطاهای رایج در کدنویسی جلوگیری کند، مشابه برخی الگوهای CSS که دستیارهای AI معمولاً در محیط عملیاتی به اشتباه پیاده میکنند.
در حال حاضر این پروژه محدود به فایرفاکس است، اما هدف توسعهدهنده گسترش پشتیبانی از مرورگرهای دیگر و افزودن بهینهسازیهای جدید بر اساس بازخورد کاربران است. او بهطور خاص بهدنبال شناسایی مواردی است که ابزار در مواجهه با متنهای بسیار ریز یا قطعات پیچیده کد دچار مشکل میشود.
گام بعدی شما
- اگر از فایرفاکس استفاده میکنید، افزونه را نصب کنید و تفاوت تعداد توکنها را در حالت Max Saving بررسی کنید.
- برای کدهای پیچیده، حالت Sharp را امتحان کنید تا مطمئن شوید مدل همچنان قادر به خواندن متون ریز است.
- در صورت مواجهه با خطای تشخیص متن، این موارد را به عنوان Edge Case برای توسعهدهنده گزارش کنید.
اما بهینهسازی ورودیها تنها بخشی از ماجراست؛ برای درک اینکه چگونه مدلهای کوچکتر در حال جایگزینی غولهای پردازشی میشوند، تحلیل ما دربارهی مدلهای SLM را بخوانید.




گفتگو