پرش به محتوای اصلی
پرش به محتوای مقاله

چگونه TokenSaver مصرف توکن‌های تصویری را در لایهٔ مرورگر کنترل می‌کند؟

·۱۶ مهر ۱۴۰۵۳ دقیقه مطالعه
نمایی از رابط کاربری ابزار TokenSaver در حال بهینه‌سازی تصویر برای هوش مصنوعی
نمایی از رابط کاربری ابزار TokenSaver در حال بهینه‌سازی تصویر برای هوش مصنوعی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی یک لایه بهینه‌سازی محلی در مرورگر که به‌جای فشرده‌سازی سنتی فایل، بر اساس نیاز مدل‌های هوش مصنوعی به توکن‌های تصویری عمل می‌کند.

تصور کنید یک اسکرین‌شات از مک‌بوک با هزاران پیکسل عرض دارید، اما مدل هوش مصنوعی برای رفع یک خطای کدنویسی تنها به بخش کوچکی از آن نیاز دارد. برای حل این ناکارآمدی، طه حسین (Taha Hussein)، مهندس iOS و هوش مصنوعی، ابزار TokenSaver را به‌عنوان یک بهینه‌ساز تخصصی تصاویر برای مرورگر فایرفاکس عرضه کرد.

بسیاری از توسعه‌دهندگان به‌طور منظم خروجی‌های ترمینال، باگ‌های رابط کاربری یا پاسخ‌های API را برای دستیارهای هوش مصنوعی می‌فرستند. ارسال یک تصویر خام با ابعاد ۳۰۰۰ در ۲۰۰۰ پیکسل، حجم زیادی از توکن (Token) — شبیه برش‌های کوچکی از متن یا تصویر که مدل تکه‌تکه می‌خورد — را مصرف می‌کند، بدون آنکه ارزش افزوده‌ای برای درک مدل داشته باشد. برای درک عمیق‌تر از اینکه این واحدها چگونه داده‌ها را به زبان ماشین ترجمه می‌کنند، می‌توانید بررسی ما درباره‌ی نقش توکن‌سازها در تبدیل ریاضیات به هوش مصنوعی را مطالعه کنید.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی بهینه‌سازی هزینه‌های استنتاج اشاره کردیم، مدیریت ورودی‌ها کلید کاهش هزینه‌هاست. TokenSaver یک مرحلهٔ بهینه‌سازی را بین اسکرین‌شات و ابزار هوش مصنوعی قرار می‌دهد تا داده‌های زائد را حذف کند. هدف این نیست که کیفیت تصویر از بین برود، بلکه داده‌های غیرضروری حذف می‌شوند تا اطلاعات حیاتی باقی بمانند. این ابزار گردش کار را از «اسکرین‌شات $\rightarrow$ ابزار AI» به مسیر بهینه‌تر «اسکرین‌شات $\rightarrow$ TokenSaver $\rightarrow$ بهینه‌سازی ابعاد $\rightarrow$ تخمین توکن $\rightarrow$ ابزار AI» تغییر می‌دهد.

نمایی از رابط TokenSaver در حال بهینه‌سازی تصویر برای هوش مصنوعی

به نقل از مستندات توسعه‌دهنده، این افزونه سه حالت بهینه‌سازی مختلف را برای ایجاد تعادل بین وضوح و اندازه پشتیبانی می‌کند:

  • Sharp: اولویت با کیفیت بالا برای کارهای دقیق، مانند اسکرین‌شات‌هایی که حاوی متن‌های ریز کد هستند.
  • Auto: تعادل بین کیفیت و بهینه‌سازی برای استفاده‌های عمومی.
  • Max Saving: اولویت با کوچک‌ترین اندازه ممکن برای اسکرین‌شات‌های ساده از رابط کاربری.

کاربران می‌توانند تصاویر را از طریق انتخاب فایل، کشیدن و رها کردن (Drag and Drop) یا چسباندن (Paste) مستقیم ارسال کنند. برای شفافیت بیشتر، این ابزار تعداد تخمینی توکن‌ها را قبل و بعد از بهینه‌سازی نمایش می‌دهد تا کاربر متوجه تفاوت واقعی پیش از ارسال به مدل شود.

یک تصمیم راهبردی در طراحی این ابزار، پیاده‌سازی پردازش محلی است. طبق اعلام طه حسین، از آنجا که اسکرین‌شات‌های توسعه‌دهندگان اغلب حاوی اطلاعات حساس مانند پاسخ‌های API، کدهای منبع یا داشبوردهای داخلی است، تمام عملیات تغییر اندازه به‌صورت محلی در مرورگر انجام می‌شود. هیچ سروری برای پردازش تصاویر وجود ندارد و داده‌ها هرگز دستگاه کاربر را ترک نمی‌کنند.

بهینه‌سازی برای هوش مصنوعی با فشرده‌سازی سنتی متفاوت است. در حالی که ابزارهای معمولی روی حجم فایل و کیفیت JPEG تمرکز می‌کنند، بهینه‌سازی برای مدل‌های چندوجهی (Multimodal) — مدل‌هایی که هم‌زمان متن، عکس و صدا را می‌فهمند، مثل ما که با چند حس دنیا را می‌خوانیم — این پرسش را مطرح می‌کند: مدل برای این وظیفه دقیقاً به چه مقدار اطلاعات بصری نیاز دارد؟

برای یک توسعه‌دهنده، این به معنای آپلود سریع‌تر و کاهش هزینه‌ها در مدل‌هایی است که محدودیت توکن دارند. این ابزار باعث می‌شود به‌جای آپلود کورکورانه فایل‌های با رزولوشن بالا، سطح جزئیات مورد نیاز برای پرامپت به‌طور آگاهانه انتخاب شود. این دقت در ورودی‌ها می‌تواند از بروز خطاهای رایج در کدنویسی جلوگیری کند، مشابه برخی الگوهای CSS که دستیارهای AI معمولاً در محیط عملیاتی به اشتباه پیاده می‌کنند.

در حال حاضر این پروژه محدود به فایرفاکس است، اما هدف توسعه‌دهنده گسترش پشتیبانی از مرورگرهای دیگر و افزودن بهینه‌سازی‌های جدید بر اساس بازخورد کاربران است. او به‌طور خاص به‌دنبال شناسایی مواردی است که ابزار در مواجهه با متن‌های بسیار ریز یا قطعات پیچیده کد دچار مشکل می‌شود.

گام بعدی شما

  • اگر از فایرفاکس استفاده می‌کنید، افزونه را نصب کنید و تفاوت تعداد توکن‌ها را در حالت Max Saving بررسی کنید.
  • برای کدهای پیچیده، حالت Sharp را امتحان کنید تا مطمئن شوید مدل همچنان قادر به خواندن متون ریز است.
  • در صورت مواجهه با خطای تشخیص متن، این موارد را به عنوان Edge Case برای توسعه‌دهنده گزارش کنید.

اما بهینه‌سازی ورودی‌ها تنها بخشی از ماجراست؛ برای درک اینکه چگونه مدل‌های کوچک‌تر در حال جایگزینی غول‌های پردازشی می‌شوند، تحلیل ما درباره‌ی مدل‌های SLM را بخوانید.

چرا این موضوع مهم است؟

این ابزار با کاهش حجم داده‌های ارسالی، بهره‌وری مدل‌های چندوجهی را افزایش داده و ریسک نشت داده‌های حساس توسعه‌دهندگان را به حداقل می‌رساند. تکیه بر پردازش محلی، استانداردی جدید برای ابزارهای کمکی AI ایجاد می‌کند که حریم خصوصی را فدای راحتی نمی‌کنند.

تأثیر برای ایران

برای توسعه‌دهندگانی که با محدودیت‌های هزینه یا سرعت اینترنت در ایران مواجه‌اند، کاهش حجم تصاویر ارسالی به APIهای هوش مصنوعی می‌تواند سرعت پاسخ‌دهی را افزایش و هزینه‌های دلاری را کاهش دهد.

·نگاه ما
تحریریه دات‌هوش

TokenSaver نشان می‌دهد که گلوگاه فعلی مدل‌های بینایی-زبانی (VLM) نه در درک تصویر، بلکه در مدیریت ناکارآمد توکن‌های بصری است. این ابزار با انتقال لایهٔ تصمیم‌گیری دربارهٔ «کیفیت لازم» از مدل به کاربر، عملاً یک فیلتر پیش‌پردازش محلی ایجاد می‌کند که هم امنیت داده را تضمین می‌کند و هم هزینه استنتاج را کاهش می‌دهد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.