پرش به محتوای اصلی
پرش به محتوای مقاله

شبکه ۷۶۸ پیکسلی: راهکار گوگل برای بهینه‌سازی توکن‌های بصری Gemini

·۱۵ مرداد ۱۴۰۵۹ دقیقه مطالعه
راهنما
آیا توکن‌های تصویر می‌توانند ارزان‌تر از توکن‌های متن باشند؟ توضیح اقتصاد توکن تصویر در API جمینی
آیا توکن‌های تصویر می‌توانند ارزان‌تر از توکن‌های متن باشند؟ توضیح اقتصاد توکن تصویر در API جمینی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

افشای فرمول دقیق محاسبه توکن‌های تصویری در Gemini و معرفی نقطه بهینه ۷۶۸ پیکسلی برای کاهش هزینه‌ها بدون افت دقت OCR.

تصور کنید یک تصویر با وضوح بالا، دقیقاً به اندازه یک صفحه کامل متن هزینه داشته باشد. اگر از Gemini API برای کارهای چندوجهی استفاده می‌کنید، به‌روزرسانی‌های کوچک در پیش‌پردازش تصاویر می‌تواند فوراً ۷۵٪ از هزینه‌های شما را حذف کند. برای جلوگیری از اتلاف پنجره زمینه (Context Window) — که مثل میز کاری است که فقط جای چند ورق کاغذ دارد و مدل باید هر چه می‌خواهد روی آن نگه دارد — توسعه‌دهندگان باید درک دقیقی از نحوه تبدیل داده‌های بصری به توکن‌ها داشته باشند. برخلاف متن ساده که در آن هر توکن تقریباً معادل ۰.۷۵ کلمه است، پردازش تصویر در Gemini بر پایه ترنسفورمرهای بینایی (Vision Transformers)، برش تکه‌ای و کاشی‌بندی پویا کار می‌کند.

همان‌طور که در تحلیل قبلی ما درباره‌ی دسترسی‌های مرحله‌ای Gemini Notebook اشاره کردیم، توانایی بهینه‌سازی هزینه‌های ورودی اکنون برای مقیاس‌دهی اپلیکیشن‌های هوش مصنوعی در سطح تولید (Production) حیاتی است. این نیاز به مدیریت بهینه هزینه‌ها با رویکردهایی نظیر مدل Request-Based در Oxlo.ai که هزینه‌های پردازش پنجره‌های زمینه بلند را تا ۱۰۰ برابر کاهش می‌دهد، همسو است. اکثر توسعه‌دهندگان با ورودی‌های تصویری به صورت هزینه‌های ثابت برخورد می‌کنند، اما Gemini آن‌ها را از طریق یک سیستم کاشی‌بندی پویا پردازش می‌کند که ابعاد خاص را پاداش می‌دهد.

ریاضیات یک تک‌کاشی

بر اساس مستندات فنی، برای هر تصویری که هر دو بُعد آن ۳۸۴ پیکسل یا کمتر باشد، Gemini نرخ ثابتی معادل ۲۵۸ توکن را اعمال می‌کند. این عدد تصادفی نیست؛ بلکه مستقیماً از معماری ترنسفورمر بینایی (ViT) استخراج شده است. مدل از یک رزولوشن پایه محلی ۳۸۴ در ۳۸۴ پیکسل با اندازه تکه‌های (Patch size) ۲۴ در ۲۴ پیکسل برای هر توکن بصری استفاده می‌کند.

این ساختار یک شبکه ۱۶ در ۱۶ از تکه‌های بصری ایجاد می‌کند (۳۸۴ تقسیم بر ۲۴ برابر ۱۶) که در مجموع ۲۵۶ تکه می‌شود. Gemini سپس دو توکن ساختاری را که به‌طور خاص برای جهت‌بندی مکانی و کادربندی ردیف‌ها به کار می‌روند، اضافه می‌کند تا به عدد نهایی ۲۵۸ توکن برسد. چه تصویر شما یک آیکون کوچک ۱۲۸ در ۱۲۸ باشد و چه یک تامنیل ۳۰۰ در ۲۰۰، مدل آن را در همین یک پاس ۳۸۴ در ۳۸۴ پد (Pad) یا مقیاس کرده و دقیقاً ۲۵۸ توکن هزینه می‌کند.

آیا توکن تصویر می‌تواند ارزان‌تر از توکن متن باشد؟ توضیح اقتصاد توکن تصویر در API جمینی

منطق کاشی‌بندی در رزولوشن بالا

وقتی ابعاد تصویر در هر یک از جهت‌ها از ۳۸۴ پیکسل بیشتر شود، Gemini از نرخ ثابت تک‌مرحله‌ای به یک شبکه کاشی‌بندی پویا تغییر وضعیت می‌دهد. به نقل از یک راهنمای فنی منتشر شده در ۶ آگوست ۲۰۲۶، API تصاویر را به کاشی‌هایی با ابعاد ۷۶۸ در ۷۶۸ پیکسل تقسیم می‌کند.

هر کاشی — چه به‌طور کامل پر شده باشد و چه بخشی از آن ناقص باشد — ۲۵۸ توکن هزینه دارد. هزینه نهایی با استفاده از این فرمول ریاضی محاسبه می‌شود:
Total Tokens = (ceiling(Width / 768) x ceiling(Height / 768)) x 258.

برای درک عملی این ریاضیات در رزولوشن‌های رایج، مثال‌های زیر را بررسی کنید:

  • ۵۰۰ در ۵۰۰ پیکسل: هر دو بُعد بیشتر از ۳۸۴ هستند. شبکه: ۱ در ۱ = ۱ کاشی. مجموع: ۲۵۸ توکن.
  • ۱۲۸۰ در ۷۲۰ پیکسل: عرض بیشتر از ۷۶۸ است. شبکه: ۲ در ۱ = ۲ کاشی. مجموع: ۵۱۶ توکن.
  • ۱۰۰۰ در ۱۰۰۰ پیکسل: هر دو بُعد بیشتر از ۷۶۸ هستند. شبکه: ۲ در ۲ = ۴ کاشی. مجموع: ۱٬۰۳۲ توکن.
  • ۱۹۲۰ در ۱۰۸۰ پیکسل (FHD): عرض بیشتر از ۱۵۳۶ است. شبکه: ۳ در ۲ = ۶ کاشی. مجموع: ۱٬۵۴۸ توکن.
  • ۳۸۴۰ در ۲۱۶۰ پیکسل (4K): عرض بیشتر از ۳۰۷۲ است. شبکه: ۵ در ۳ = ۱۵ کاشی. مجموع: ۳٬۸۷۰ توکن.

تجسم بودجه توکن‌ها

برای درک اثر این هزینه‌ها، بررسی کنید ۵۱۶ توکن (هزینه یک تصویر ۱۲۸۰ در ۷۲۰) در دنیای متن واقعاً چه معنایی دارد. در زبان انگلیسی، ۵۱۶ توکن تقریباً معادل ۳۸۵ تا ۴۰۰ کلمه یا حدود ۲٬۰۰۰ کاراکتر است.

از نظر فیزیکی یا زمانی، ۵۱۶ توکن برابر است با:

  • یک صفحه کامل متن با فاصله تک‌خطی (با ظرفیت تقریبی ۵۰۰ کلمه).
  • سه تا چهار پاراگراف متراکم از توضیحات.
  • یک متن گفتاری (اسکریپت) که حدود ۱.۵ دقیقه زمان می‌برد.

وقتی یک تصویر ۱۲۸۰ در ۷۲۰ را به Gemini می‌فرستید، همان مقدار از بودجه پنجره زمینه را مصرف می‌کنید که یک مقاله ۳۸۷ کلمه‌ای مصرف می‌کند. برای مثال، متنی که نحوه تبدیل زبان به قطعات عددی یا توکن‌ها — شبیه برش‌های یک کیک طولانی که مدل تکه‌تکه می‌خورد —، کارایی مکانیزم توجه-خودکار (Self-attention) و تبدیل تکه‌های تصویر به معادل‌های توکنی را توضیح دهد و در مجموع ۵۱۰ کلمه باشد، در Google AI Studio حدود ۶۵۰ توکن مصرف می‌کند. این معادل‌سازی بصری به توسعه‌دهندگان کمک می‌کند تا هزینه و بازدهی پنجره زمینه را هنگام مقیاس‌دهی پیش‌بینی کنند.

موازنه دقت OCR و رزولوشن

کاهش رزولوشن برای صرفه‌جویی در توکن‌ها می‌تواند برای تصاویر متنی خطرناک باشد. این موضوع «دیلمای رزولوشن در برابر دقت OCR» را ایجاد می‌کند. Gemini برای نویسه‌خوانی نوری (OCR) — یعنی تبدیل عکس متن به متن قابل ویرایش — نیاز دارد که حروف در تصویر ورودی حداقل ۱۵ تا ۲۰ پیکسل ارتفاع داشته باشند تا شناسایی آن‌ها قابل اعتماد باشد.

در یک اسکن استاندارد ۱۹۲۰ در ۱۰۸۰، یک فونت ۱۲-پوینت معمولاً حروفی با ارتفاع حدود ۱۸ پیکسل تولید می‌کند و Gemini آن را در شبکه ۶ کاشی به‌راحتی می‌خواند. اما اگر همان سند را برای رسیدن به نرخ ثابت ۲۵۸ توکن، به ۶۴۰ در ۴۸۰ کاهش دهید، ارتفاع حروف تنها به ۳ یا ۴ پیکسل می‌رسد.

در این آستانه ۳ تا ۴ پیکسلی، اثرات Anti-aliasing باعث می‌شود حروف کوچک مانند 'e'، 'o' و 'c' به لکه‌های خاکستری بصری یکسانی تبدیل شوند. چون ترنسفورمر بینایی نمی‌تواند این ضربه‌های ظریف (Strokes) کاراکترها را تشخیص دهد، نتیجه خطاهای شدید در OCR یا توهم (Hallucination) — یعنی وقتی مدل با اطمینان چیزی می‌گوید که وجود ندارد، شبیه دوستی که خاطره‌ای را اشتباه تعریف می‌کند — خواهد بود.

استراتژی‌های پیش‌پردازش برای کاهش هزینه

توسعه‌دهندگان می‌توانند با استفاده از پنج استراتژی مشخص، دقت را در کمترین هزینه به حداکثر برسانند و از دیلمای رزولوشن عبور کنند:

  • تطبیق با مرزهای شبکه ۷۶۸ پیکسلی: چون Gemini از تقسیم سقفی (ceiling division) استفاده می‌کند، عبور حتی ۱۰ پیکسلی از مرز، یک کاشی کامل اضافه می‌کند. یک تصویر ۸۰۰ در ۸۰۰ پیکسل، ۱٬۰۳۲ توکن (۴ کاشی) هزینه دارد، اما تغییر اندازه آن به دقیقاً ۷۶۸ در ۷۶۸ پیکسل، هزینه را به ۲۵۸ توکن می‌رساند؛ یعنی ۷۵٪ صرفه‌جویی با تقریباً هیچ افت کیفیتی. برای رزولوشن Full HD (۱۹۲۰x۱۰۸۰)، کاهش اندازه به HD (۱۲۸۰x۷۲۰) «نقطه بهینه» (Sweet Spot) است.
  • برش فضاهای خالی و حاشیه‌ها: اسکن‌های PDF و فاکتورها اغلب حاشیه‌های خالی زیادی دارند. Gemini توکن‌ها را بر اساس ابعاد می‌شمارد، نه تراکم متن؛ این بدان معناست که پیکسل‌های حاشیه به اندازه پیکسل‌های متن هزینه دارند. حذف حاشیه‌ها در یک اسکن ۱۹۲۰ در ۱۰۸۰ می‌تواند ابعاد را به حدود ۱۲۰۰ در ۷۰۰ برساند و شبکه را از ۳ در ۲ (۱٬۵۴۸ توکن) به ۲ در ۱ (۵۱۶ توکن) کاهش دهد که منجر به ۶۶٪ کاهش هزینه می‌شود.
  • برش ستونی نواحی مورد نیاز (ROI): به‌جای ارسال یک مقاله دو ستونی پیچیده یا فاکتور چند صفحه‌ای به صورت یک تصویر بزرگ ۲۰۰۰ پیکسلی، ستون‌ها را به نوارهای عمودی با عرض ۷۶۸ پیکسل برش دهید. هر نوار در یک شبکه ۱ در N به‌طور بهینه پردازش شده و فضای افقی هدر نمی‌رود.
  • دو-رنگ‌سازی با کنتراست بالا و Deskewing: صاف کردن متن‌های کج (Deskewing) مانع از آن می‌شود که خطوط در چندین مرز تکه (Patch boundaries) پخش شوند. استفاده از روش آستانه‌گذاری Otsu برای دو-رنگ‌سازی (تبدیل تصویر به سیاه و سفید مطلق)، کنتراست خطوط را افزایش می‌دهد. این کار اجازه می‌دهد حروف حتی با اندازه کوچک ۱۵ پیکسل، پس از کاهش ابعاد شدید، خوانا باقی بمانند.
  • مقیاس‌بندی پویا بر اساس تعداد خطوط: از فرمول طلایی استفاده کنید: ارتفاع هدف (پیکسل) = تعداد خطوط متن ضرب‌در ۲۵ پیکسل. برای مثال، یک فاکتور ۲۰ خطی به حدود ۵۰۰ پیکسل ارتفاع نیاز دارد. جای دادن این مقدار در یک بوم ۷۶۸ در ۷۶۸، هزینه را به ۱ کاشی (۲۵۸ توکن) محدود می‌کند و در عین حال ۲۵ پیکسل برای هر خط تضمین می‌کند تا دقت نزدیک به ۱۰۰٪ باشد.

وقتی تصاویر ارزان‌تر از متن هستند

برخلاف تصور، ارسال تصویر اغلب ارزان‌تر از ارسال متن خام است. این اتفاق زمانی می‌افتد که تراکم اطلاعات payload متنی از هزینه ثابت کاشی بصری Gemini بیشتر شود. چون انگلیسی به‌طور میانگین ۱.۳۳ توکن به ازای هر کلمه و زبان‌های غیرلاتین ۲ تا ۴ توکن مصرف می‌کنند، تصاویر در سناریوهای خاص به انتخاب اقتصادی تبدیل می‌شوند:

۱. زبان‌های غیرلاتینی (هندی، عربی، عبری، CJK)
توکن‌سازهای Byte-Pair Encoding (BPE) برای این زبان‌ها ناکارآمد هستند و یک کاراکتر اغلب به ۲ تا ۴ توکن تبدیل می‌شود. یک پاراگراف ۲۰۰ کلمه‌ای به زبان هندی یا ژاپنی می‌تواند ۵۰۰ تا ۸۰۰ توکن متن مصرف کند. اما یک اسکرین‌شات از همان پاراگراف که در یک کاشی Gemini جا شود، تنها ۲۵۸ توکن هزینه دارد که تا ۶۵٪ کاهش هزینه است.

۲. فرمول‌های پیچیده ریاضی و LaTeX
کدهای LaTeX برای نمایش یک معادله ماتریسی ۴ در ۴ یا یک اثبات دیفرانسیلی چندخطی به سینتکس دستورات گسترده‌ای نیاز دارند و ممکن است ۴۰۰ تا ۶۰۰ توکن متن مصرف کنند. این چالش‌های محاسباتی در مدل‌های زبانی گاهی با به‌کارگیری جداکننده‌های هزارگان برای رفع خطاهای عددی مدیریت می‌شوند، اما استفاده از تصویر یک معادله در یک تک‌کاشی، تنها ۲۵۸ توکن هزینه دارد.

۳. جداول متراکم، صفحات گسترده (Spreadsheets) و چیدمان UI
توصیف یک جدول با ۱۰ ستون و ۲۰ ردیف در قالب Markdown، برای ثبت مختصات مکانی و مقادیر، نیاز به هزاران کلمه (بیش از ۱٬۵۰۰ توکن متن) دارد. یک اسکرین‌شات ساده، تمام نقاط داده را در ۱ یا ۲ کاشی (۲۵۸ یا ۵۱۶ توکن) ثبت می‌کند.

ماتریس مقایسه سریع:

نوع داده هزینه توکن متن هزینه توکن تصویر (۱ کاشی) Medium ارزان‌تر
ایمیل ۵۰ کلمه‌ای ~۶۵ توکن ۲۵۸ توکن متن
مقاله انگلیسی ۲۰۰ کلمه‌ای ~۲۶۵ توکن ۲۵۸ توکن مساوی / تصویر
یک صفحه PDF ۵۰۰ کلمه‌ای ~۶۷۰ توکن ۲۵۸ توکن تصویر
متن ۲۰۰ کلمه‌ای CJK/هندی ~۶۰۰ توکن ۲۵۸ توکن تصویر
خروجی JSON ۱۰۰ خطی ~۱٬۱۰۰ توکن ۲۵۸ توکن تصویر

این تغییر، یک تحول بنیادی در نحوه ارزیابی ورودی‌های چندوجهی توسط توسعه‌دهندگان است. تصمیم دیگر بر سر این نیست که «آیا مدل می‌تواند این را ببیند؟»، بلکه این است که «آیا نشان دادن ارزان‌تر است یا گفتن؟».

برای کسانی که خطوط لوله (Pipeline) OCR سازمانی می‌سازند، هدف دیگر رزولوشن حداکثری نیست، بلکه حداکثری کردن تطبیق با شبکه ۷۶۸ پیکسلی است. پیش‌پردازش هوشمند هر بار بر رزولوشن خام پیروز می‌شود. شما باید اکنون خطوط لوله‌های تصویری موجود خود را بازرسی کنید تا ببینید آیا ابعاد شما تنها چند پیکسل از مرز ۷۶۸ عبور کرده و باعث اتلاف هزاران توکن در هر ساعت شده است یا خیر.

گام بعدی شما

  • ابعاد تصاویری که به Gemini می‌فرستید را بررسی کنید و آن‌ها را دقیقاً روی مضارب ۷۶۸ پیکسل تنظیم کنید.
  • برای اسناد متنی با زبان‌های غیرلاتین یا فرمول‌های ریاضی، به‌جای ارسال متن، از اسکرین‌شات‌های بهینه‌شده استفاده کنید.
  • حاشیه‌های سفید اسکن‌های PDF را پیش از ارسال حذف کنید تا تعداد کاشی‌های پردازشی کاهش یابد.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مکانیزم به دلیل تکیه بر معماری ViT، هزینه‌های عملیاتی در مقیاس سازمانی را به‌شدت تغییر می‌دهد. تخصص در پیش‌پردازش بصری اکنون به اندازه مهندسی پرامپت برای کاهش صورت‌حساب‌های API اهمیت یافته است.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که با محدودیت بودجه دلاری برای APIها دست‌وپنجه نرم می‌کنند، استفاده از این ترفندها برای کاهش مصرف توکن‌ها در پروژه‌های استخراج داده از اسناد، یک ضرورت اقتصادی است.

·نگاه ما
تحریریه دات‌هوش

این یافته نشان می‌دهد که در دنیای مدل‌های چندوجهی، «تراکم اطلاعات» جایگزین «تعداد کلمات» به عنوان واحد هزینه شده است. جالب اینجاست که گوگل با این معماری، در واقع انگیزه‌ای ایجاد کرده تا توسعه‌دهندگان برای داده‌های ساختاریافته (مثل جداول و کدها) به جای متن، از بازنمایی‌های بصری استفاده کنند. این یک چرخش استراتژیک است؛ مدل‌های زبانی دیگر فقط متن نمی‌خوانند، بلکه یاد می‌گیرند که «دیدن» در بسیاری از موارد بهینه‌تر از «خواندن» است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.