پرش به محتوای اصلی
پرش به محتوای مقاله

«فراتر از چت»؛ کاربرد جدید GRPO در بهینه‌سازی لایوت‌های OCR

·۱۷ مهر ۱۴۰۵۶ دقیقه مطالعه
گردآورده
GRPO از چت‌بات خارج و OCR را اصلاح می‌کند، در حالی که DPO و GRPO از درون دیباگ می‌شوند.
GRPO از چت‌بات خارج و OCR را اصلاح می‌کند، در حالی که DPO و GRPO از درون دیباگ می‌شوند.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

انتقال الگوریتم GRPO از همراستاسازی چت‌بات‌ها به تسک‌های سختِ ساختاری مانند OCR و کاهش ۶۰ درصدی هزینه تقطیر مدل از طریق فیلتر کردن توکن‌های کم-سیگنال.

اگر امروز از مدل‌های هوش مصنوعی برای استخراج داده از فرم‌های پیچیده استفاده می‌کنید، احتمالاً با خطاهای ساختاری آزاردهنده‌ای روبرو شده‌اید. اما حالا مدل LightOnOCR-3 ثابت کرد که می‌توان با استفاده از یادگیری تقویتی، دقت استخراج داده‌ها را به سطح مهندسی برساند.

به نقل از پست وبلاگ Hugging Face در ۹ اکتبر ۲۰۲۶، این مدل توانسته است بهینه‌سازی سیاست نسبی گروهی (GRPO) را از دنیای چت‌بات‌ها به خط لوله تولیدی نویسه‌خوانی نوری (OCR) — یعنی تبدیل عکس متن به متن دیجیتال — منتقل کند. این مدل با استفاده از پاداش‌های قابل تأیید برای مکان‌یابی نواحی و اعتبارسنجی ساختاری، به امتیاز ۸۶.۳ در محک olmOCR-Bench رسید و در رده‌های مدل‌های ۰.۸ و ۴ میلیارد پارامتری در ParseBench پیشتاز شد. آموزش این مدل با اندازه گروه هشت و استفاده از آموزش‌دهنده asynchronous one-step-off-policy در کتابخانه verl انجام شده است.

سال‌ها بود که یادگیری تقویتی با بازخورد انسانی (RLHF) و بهینه‌سازی ترجیحات فقط برای این به کار می‌رفت که چت‌بات‌ها انسانی‌تر یا مفیدتر به نظر برسند. این تغییر مسیر، در واقع حرکت به سمتی است که از یادگیری تقویتی برای دقت‌های ساختاری «سخت» استفاده شود؛ جایی که درست یا غلط بودن پاسخ را می‌توان به‌صورت ریاضی تأیید کرد.

تصور کنید می‌خواهید به یک هوش مصنوعی یاد بدهید یک فرم مالیاتی پیچیده را بخواند. در این حالت، مدل به‌جای حدس زدن کلمه بعدی — شبیه به کسی که فقط سعی می‌کند جمله‌ای خوش‌آهنگ بسازد — حالا پاداش می‌گیرد اگر بتواند دقیقاً دور یک جدول کادر بکشد یا یک فرمول را درست شناسایی کند. این یعنی تبدیل یک بازی حدس زبانی به یک تسک مهندسی دقیق. این رویکرد در تحلیل داده‌های ساختاریافته شباهت‌های زیادی به بهینه‌سازی‌های جدید در پردازش داده‌های جدولی دارد که دقت مدل‌ها را در محیط‌های سخت‌گیرانه افزایش می‌دهد.

گسترش GRPO و یادگیری تقویتی

فراتر از پروژه LightOn، پژوهشگران دیگر نیز GRPO را به عنوان یک مسئله مهندسی قابل عیب‌یابی می‌بینند. طبق گزارشی در ۸ اکتبر ۲۰۲۶ با عنوان «وقتی منظم‌سازی KL خطا می‌کند»، هفت حالت شکست عینی شناسایی شد که در آن‌ها حذف منظم‌سازی KL در سیاست مرجع (reference-policy KL regularization) در واقع باعث بهبود عملکرد مدل شده است. این شکست‌ها شامل مسائلی مانند تداخلات برش پاداش (reward-clipping)، رشد KL نسبت به طول پاسخ، تمرکز توکن‌ها و نویز نمونه‌گیری است. برای حل این مشکل، نویسندگان روش بهینه‌سازی سیاست کالیبره شده مجموع-صفر (ZCPO) را پیشنهاد دادند که ضرایب پاداش را در گروه‌ها از طریق KL شرطی کالیبره می‌کند تا آموزش را تثبیت کند.

یک تغییر فنی دیگر به نام GRPODropout نیز برای جلوگیری از فروپاشی آنتروپی سیاست در RL سبک GRPO معرفی شده است. این روش با حذف تعداد کمی از خروجی‌های با احتمال بالا که دارای مزیت مثبت (positive-advantage rollouts) هستند و بازتنظیم مزایای باقی‌مانده عمل می‌کند. این یک تغییر ارزان در سطح پیاده‌سازی است که دقت و آنتروپی را تحت یک بودجه نمونه‌گیری ثابت، بدون تغییر در الگوریتم اصلی، افزایش می‌دهد.

در حوزه زبان عربی نیز، مدل Falcon OCR Arabic با استفاده از یک مدل ۲۷۰ میلیون پارامتری، رتبه دوم را در میان ۱۷ مدل در محک خود کسب کرد و به صحت ۸۱.۹٪ رسید (و تنها پس از Gemini 3.5 Flash قرار گرفت). این مدل همچنین رتبه اول را در Table TEDS به دست آورد. این تیم ترکیبی از تنظیم نظارت‌شده (SFT) روی ترکیبی از اسناد واقعی و مصنوعی و یک مرحله RL را به کار گرفت. این مرحله RL به‌طور خاص برای رفع خطاهای «نابینای زیان» (loss-blind) طراحی شده بود؛ مواردی مانند اعراب‌های ساختگی، نقطه‌گذاری غلط، خطوط جا افتاده یا تکرار حلقوی در جداول که توابع زیان استاندارد توکن را نادیده می‌گیرند.

GRPO از چت‌بات خارج و OCR را اصلاح می‌کند، در حالی که DPO و GRPO از درون دیباگ می‌شوند.

بهینه‌سازی تقطیر و PEFT

بهینه‌سازی در بخش تقطیر (Distillation) — یعنی انتقال دانش از یک مدل بزرگ به مدل کوچک‌تر — نیز به نقطه عطفی رسیده است. روش DIAL-OPD (منتشر شده در ۸ اکتبر ۲۰۲۶) نشان داد که آموزش روی تنها حدود ۴۰٪ از توکن‌ها و به‌طور خاص فیلتر کردن توکن‌های «کم-کم» (آن‌هایی که هم در مدل معلم و هم در مدل شاگرد احتمال پایینی دارند)، نتایج بهتری می‌دهد. این توکن‌های کم-کم اغلب پاداش‌های متورمی دریافت می‌کنند که به تقطیر روی-سیاست (on-policy distillation) آسیب می‌زند. این امتیازدهی وزن‌دار بر اساس احتمال، استدلال ریاضی را تا ۵.۲۵ درصد بهبود بخشید و حتی اجازه داد یک مدل معلم ۴ میلیارد پارامتری، از تقطیر استاندارد مدل ۸ میلیارد پارامتری پیشی بگیرد.

به همین ترتیب، روش SGUID کشف کرد که کمتر از ۲۵٪ از «مهارت‌های» بازیابی شده در تقطیر روی-سیاست، سیگنال یادگیری مفیدی ارائه می‌دهند. با انتخاب یک بانک مهارت فشرده که تا ۱۱ برابر کوچک‌تر است، توسعه‌دهندگان می‌توانند هزینه محاسبات و هزینه‌های جمع‌آوری داده را بدون کاهش کیفیت کم کنند. این موضوع در خانواده‌های مدل Olmo و Qwen تأیید شده است. این تلاش برای بهینه‌سازی منابع محاسباتی در کنار تکنیک‌های فشرده‌سازی حافظه KV قرار می‌گیرد تا بهره‌وری مدل‌های زبانی در مقیاس بالا افزایش یابد.

برای کسانی که از تنظیم کارآمد با پارامتر اندک (PEFT) استفاده می‌کنند، پژوهش جدید روی LoRA-RIP (۵ اکتبر ۲۰۲۶) معیاری وابسته به داده معرفی کرده که نشان می‌دهد رتبه (rank) ایده‌آل آداپتور به کیفیت داده‌ها بستگی دارد، نه به ویژگی‌های مدل یا نوع تسک. این یافته، حدس و گمان در انتخاب ابرپارامترها در تنظیمات PEFT را حذف می‌کند.

بررسی‌های بیشتر روی شش روش PEFT (از جمله LoRA، DoRA و PiSSA) در مدل‌های زبانی و مدل‌های انتشار (diffusion models)، تضادهای مشخصی را نشان داد:

  • DoRA: بالاترین امتیاز را در معیارهای تسک کسب کرد.
  • خانواده LoRA: بهترین عملکرد را در محدود کردن فراموشی فاجعه‌بار (catastrophic forgetting) داشتند.
  • PiSSA: هزینه‌های بیشتری در زمینه حفظ دانش (knowledge retention) داشت.

GRPO از چت‌بات خارج و OCR را اصلاح می‌کند، در حالی که DPO و GRPO از درون دیباگ می‌شوند

چرخش به سمت داده‌های مصنوعی هدفمند

اکنون شاهد چرخش از تولید «داده‌های مصنوعی بیشتر» به سمت تولید «داده‌های مصنوعی هوشمندتر» هستیم. ابزار SynCo (۸ اکتبر ۲۰۲۶) از یک ساختار دو-عاملی RL استفاده می‌کند که در آن یک عامل، تسک‌های آموزشی را متناسب با سطح مهارت فعلی عامل دوم سنتز می‌کند، در حالی که عامل دوم از آن‌ها یاد می‌گیرد. این باعث می‌شود توزیع آموزش هم‌زمان با مدل تکامل یابد و در محک‌های استدلال ریاضی، روش‌های فعلی داده‌های مصنوعی را شکست دهد.

مثال‌های دیگر از سنتز هدفمند عبارتند از:

  • DocDuck: ابزاری داخلی برای افزایش نمونه‌های سخت در خط لوله LightOnOCR-3، به‌طور خاص ۲ برابر برای فرمول‌ها و ۳ برابر برای جداول.
  • Falcon-Emirati: این مدل ساختار هیبریدی SSM+Transformer مدل Falcon-H1-Arabic را با گویش اماراتی تطبیق داد. با استفاده از پیش‌آموزش مستمر و SFT روی داده‌های مصنوعی که توسط واژه‌نامه‌های خاص گویشی کنترل می‌شدند، در محک Alyah به صحت ۸۴.۸۳٪ رسید و مدل‌های بسیار بزرگ‌تر را شکست داد.

اصلاحات در بهینه‌سازی ترجیحات

در نهایت، کارهای اخیر در حال اصلاح توابع زیان در بهینه‌سازی ترجیحات هستند. روش LSC-DPO (بهینه‌سازی ترجیحات مستقیم با کنترل سیگنال یادگیری) شناسایی کرد که زیان استاندارد DPO با رشد حاشیه ترجیحات، پاسخ‌دهی کمتری دارد. برای حل این مشکل، این روش سیگنال یادگیری را به‌صورت پویا با استفاده از فاکتور سیگموئید به عنوان شاخص حساسیت تنظیم می‌کند و یک قانون جبرانی را برای کاهش واریانس در شروع‌های مختلف (initializations) اعمال می‌کند. این تغییر ساده، بهبودهای ثابتی را در MT-Bench و AlpacaEval 2 نسبت به DPO معمولی ایجاد کرد.

تحلیل: پایان عصر «داده‌های بیشتر»

این موج از به‌روزرسانی‌ها نشان‌دهنده یک تغییر بنیادین در پس‌آموزش (post-training) است. صنعت از روش‌های «زور خالص» (توکن‌های بیشتر، رتبه‌های بزرگ‌تر، RLHF عمومی) به سمت مداخلات «جراحی» حرکت می‌کند. چه فیلتر کردن ۶۰٪ از توکن‌های تقطیر باشد و چه هدف قرار دادن خطاهای نقطه‌گذاری خاص در OCR، اکنون پیروزی در گرو گزینش (curation) است، نه حجم داده.

برای توسعه‌دهندگان، این بدان معناست که لبه رقابتی تغییر کرده است. هدف دیگر داشتن بزرگ‌ترین مجموعه داده نیست، بلکه داشتن دقیق‌ترین تابع پاداش و کالیبره‌ترین حلقه داده‌های مصنوعی است. موفقیت یک مدل ۲۷۰ میلیون پارامتری در شکست دادن رقبای بسیار بزرگ‌تر ثابت می‌کند که RL هدفمند می‌تواند بسیار فراتر از اندازه خود عمل کند.

برای پیاده‌سازی این دستاوردها، تیم‌ها باید با بازبینی خط لوله‌های تقطیر خود برای شناسایی توکن‌های «کم-سیگنال» شروع کنند و به‌جای تکیه بر بازخوردهای کلی مدل‌های زبانی (LLM-as-a-judge)، برای خروجی‌های ساختاریافته از پاداش‌های قابل تأیید ریاضی آزمایش کنند.

گام بعدی شما

  • خط لوله‌های تقطیر مدل خود را برای شناسایی و حذف توکن‌های «کم-سیگنال» بازبینی کنید تا هزینه محاسبات را کاهش دهید.
  • به‌جای تکیه بر بازخوردهای کلی مدل‌های زبانی (LLM-as-a-judge)، برای خروجی‌های ساختاریافته از پاداش‌های قابل تأیید ریاضی استفاده کنید.
  • در تنظیمات PEFT، به‌جای استفاده از رتبه‌های پیش‌فرض، کیفیت داده‌های خود را به عنوان معیار اصلی انتخاب رتبه آداپتور قرار دهید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این تحول باعث می‌شود استقرار مدل‌های هوش مصنوعی در محیط‌های صنعتی با دقت ریاضی جایگزین حدس‌های زبانی شود. بر اساس تجربه استقرار مدل‌های OCR، این رویکرد هزینه خطای عملیاتی را در پردازش اسناد رسمی به‌شدت کاهش می‌دهد.

تأثیر برای ایران

این پیشرفت‌ها برای توسعه‌دهندگان ایرانی که روی مدل‌های تخصصی فارسی (مانند استخراج داده از اسناد اداری) کار می‌کنند، مسیری برای رسیدن به دقت بالا با سخت‌افزار محدودتر فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

برتری مدل‌های کوچک‌تر در تسک‌های تخصصی نشان می‌دهد که عصر «بیشتر یعنی بهتر» در داده‌ها به پایان رسیده است. موفقیت مدل ۲۷۰ میلیونی Falcon در برابر غول‌های این صنعت، ثابت می‌کند که طراحی دقیق تابع پاداش و کالیبراسیون داده‌های مصنوعی، بسیار اثرگذارتر از افزایش حجم توکن‌هاست. در واقع، رقابت از میدانِ «داشتن داده» به میدانِ «مهندسی سیگنال» منتقل شده است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.