اگر امروز از مدلهای هوش مصنوعی برای استخراج داده از فرمهای پیچیده استفاده میکنید، احتمالاً با خطاهای ساختاری آزاردهندهای روبرو شدهاید. اما حالا مدل LightOnOCR-3 ثابت کرد که میتوان با استفاده از یادگیری تقویتی، دقت استخراج دادهها را به سطح مهندسی برساند.
به نقل از پست وبلاگ Hugging Face در ۹ اکتبر ۲۰۲۶، این مدل توانسته است بهینهسازی سیاست نسبی گروهی (GRPO) را از دنیای چتباتها به خط لوله تولیدی نویسهخوانی نوری (OCR) — یعنی تبدیل عکس متن به متن دیجیتال — منتقل کند. این مدل با استفاده از پاداشهای قابل تأیید برای مکانیابی نواحی و اعتبارسنجی ساختاری، به امتیاز ۸۶.۳ در محک olmOCR-Bench رسید و در ردههای مدلهای ۰.۸ و ۴ میلیارد پارامتری در ParseBench پیشتاز شد. آموزش این مدل با اندازه گروه هشت و استفاده از آموزشدهنده asynchronous one-step-off-policy در کتابخانه verl انجام شده است.
سالها بود که یادگیری تقویتی با بازخورد انسانی (RLHF) و بهینهسازی ترجیحات فقط برای این به کار میرفت که چتباتها انسانیتر یا مفیدتر به نظر برسند. این تغییر مسیر، در واقع حرکت به سمتی است که از یادگیری تقویتی برای دقتهای ساختاری «سخت» استفاده شود؛ جایی که درست یا غلط بودن پاسخ را میتوان بهصورت ریاضی تأیید کرد.
تصور کنید میخواهید به یک هوش مصنوعی یاد بدهید یک فرم مالیاتی پیچیده را بخواند. در این حالت، مدل بهجای حدس زدن کلمه بعدی — شبیه به کسی که فقط سعی میکند جملهای خوشآهنگ بسازد — حالا پاداش میگیرد اگر بتواند دقیقاً دور یک جدول کادر بکشد یا یک فرمول را درست شناسایی کند. این یعنی تبدیل یک بازی حدس زبانی به یک تسک مهندسی دقیق. این رویکرد در تحلیل دادههای ساختاریافته شباهتهای زیادی به بهینهسازیهای جدید در پردازش دادههای جدولی دارد که دقت مدلها را در محیطهای سختگیرانه افزایش میدهد.
گسترش GRPO و یادگیری تقویتی
فراتر از پروژه LightOn، پژوهشگران دیگر نیز GRPO را به عنوان یک مسئله مهندسی قابل عیبیابی میبینند. طبق گزارشی در ۸ اکتبر ۲۰۲۶ با عنوان «وقتی منظمسازی KL خطا میکند»، هفت حالت شکست عینی شناسایی شد که در آنها حذف منظمسازی KL در سیاست مرجع (reference-policy KL regularization) در واقع باعث بهبود عملکرد مدل شده است. این شکستها شامل مسائلی مانند تداخلات برش پاداش (reward-clipping)، رشد KL نسبت به طول پاسخ، تمرکز توکنها و نویز نمونهگیری است. برای حل این مشکل، نویسندگان روش بهینهسازی سیاست کالیبره شده مجموع-صفر (ZCPO) را پیشنهاد دادند که ضرایب پاداش را در گروهها از طریق KL شرطی کالیبره میکند تا آموزش را تثبیت کند.
یک تغییر فنی دیگر به نام GRPODropout نیز برای جلوگیری از فروپاشی آنتروپی سیاست در RL سبک GRPO معرفی شده است. این روش با حذف تعداد کمی از خروجیهای با احتمال بالا که دارای مزیت مثبت (positive-advantage rollouts) هستند و بازتنظیم مزایای باقیمانده عمل میکند. این یک تغییر ارزان در سطح پیادهسازی است که دقت و آنتروپی را تحت یک بودجه نمونهگیری ثابت، بدون تغییر در الگوریتم اصلی، افزایش میدهد.
در حوزه زبان عربی نیز، مدل Falcon OCR Arabic با استفاده از یک مدل ۲۷۰ میلیون پارامتری، رتبه دوم را در میان ۱۷ مدل در محک خود کسب کرد و به صحت ۸۱.۹٪ رسید (و تنها پس از Gemini 3.5 Flash قرار گرفت). این مدل همچنین رتبه اول را در Table TEDS به دست آورد. این تیم ترکیبی از تنظیم نظارتشده (SFT) روی ترکیبی از اسناد واقعی و مصنوعی و یک مرحله RL را به کار گرفت. این مرحله RL بهطور خاص برای رفع خطاهای «نابینای زیان» (loss-blind) طراحی شده بود؛ مواردی مانند اعرابهای ساختگی، نقطهگذاری غلط، خطوط جا افتاده یا تکرار حلقوی در جداول که توابع زیان استاندارد توکن را نادیده میگیرند.

بهینهسازی تقطیر و PEFT
بهینهسازی در بخش تقطیر (Distillation) — یعنی انتقال دانش از یک مدل بزرگ به مدل کوچکتر — نیز به نقطه عطفی رسیده است. روش DIAL-OPD (منتشر شده در ۸ اکتبر ۲۰۲۶) نشان داد که آموزش روی تنها حدود ۴۰٪ از توکنها و بهطور خاص فیلتر کردن توکنهای «کم-کم» (آنهایی که هم در مدل معلم و هم در مدل شاگرد احتمال پایینی دارند)، نتایج بهتری میدهد. این توکنهای کم-کم اغلب پاداشهای متورمی دریافت میکنند که به تقطیر روی-سیاست (on-policy distillation) آسیب میزند. این امتیازدهی وزندار بر اساس احتمال، استدلال ریاضی را تا ۵.۲۵ درصد بهبود بخشید و حتی اجازه داد یک مدل معلم ۴ میلیارد پارامتری، از تقطیر استاندارد مدل ۸ میلیارد پارامتری پیشی بگیرد.
به همین ترتیب، روش SGUID کشف کرد که کمتر از ۲۵٪ از «مهارتهای» بازیابی شده در تقطیر روی-سیاست، سیگنال یادگیری مفیدی ارائه میدهند. با انتخاب یک بانک مهارت فشرده که تا ۱۱ برابر کوچکتر است، توسعهدهندگان میتوانند هزینه محاسبات و هزینههای جمعآوری داده را بدون کاهش کیفیت کم کنند. این موضوع در خانوادههای مدل Olmo و Qwen تأیید شده است. این تلاش برای بهینهسازی منابع محاسباتی در کنار تکنیکهای فشردهسازی حافظه KV قرار میگیرد تا بهرهوری مدلهای زبانی در مقیاس بالا افزایش یابد.
برای کسانی که از تنظیم کارآمد با پارامتر اندک (PEFT) استفاده میکنند، پژوهش جدید روی LoRA-RIP (۵ اکتبر ۲۰۲۶) معیاری وابسته به داده معرفی کرده که نشان میدهد رتبه (rank) ایدهآل آداپتور به کیفیت دادهها بستگی دارد، نه به ویژگیهای مدل یا نوع تسک. این یافته، حدس و گمان در انتخاب ابرپارامترها در تنظیمات PEFT را حذف میکند.
بررسیهای بیشتر روی شش روش PEFT (از جمله LoRA، DoRA و PiSSA) در مدلهای زبانی و مدلهای انتشار (diffusion models)، تضادهای مشخصی را نشان داد:
- DoRA: بالاترین امتیاز را در معیارهای تسک کسب کرد.
- خانواده LoRA: بهترین عملکرد را در محدود کردن فراموشی فاجعهبار (catastrophic forgetting) داشتند.
- PiSSA: هزینههای بیشتری در زمینه حفظ دانش (knowledge retention) داشت.

چرخش به سمت دادههای مصنوعی هدفمند
اکنون شاهد چرخش از تولید «دادههای مصنوعی بیشتر» به سمت تولید «دادههای مصنوعی هوشمندتر» هستیم. ابزار SynCo (۸ اکتبر ۲۰۲۶) از یک ساختار دو-عاملی RL استفاده میکند که در آن یک عامل، تسکهای آموزشی را متناسب با سطح مهارت فعلی عامل دوم سنتز میکند، در حالی که عامل دوم از آنها یاد میگیرد. این باعث میشود توزیع آموزش همزمان با مدل تکامل یابد و در محکهای استدلال ریاضی، روشهای فعلی دادههای مصنوعی را شکست دهد.
مثالهای دیگر از سنتز هدفمند عبارتند از:
- DocDuck: ابزاری داخلی برای افزایش نمونههای سخت در خط لوله LightOnOCR-3، بهطور خاص ۲ برابر برای فرمولها و ۳ برابر برای جداول.
- Falcon-Emirati: این مدل ساختار هیبریدی SSM+Transformer مدل Falcon-H1-Arabic را با گویش اماراتی تطبیق داد. با استفاده از پیشآموزش مستمر و SFT روی دادههای مصنوعی که توسط واژهنامههای خاص گویشی کنترل میشدند، در محک Alyah به صحت ۸۴.۸۳٪ رسید و مدلهای بسیار بزرگتر را شکست داد.
اصلاحات در بهینهسازی ترجیحات
در نهایت، کارهای اخیر در حال اصلاح توابع زیان در بهینهسازی ترجیحات هستند. روش LSC-DPO (بهینهسازی ترجیحات مستقیم با کنترل سیگنال یادگیری) شناسایی کرد که زیان استاندارد DPO با رشد حاشیه ترجیحات، پاسخدهی کمتری دارد. برای حل این مشکل، این روش سیگنال یادگیری را بهصورت پویا با استفاده از فاکتور سیگموئید به عنوان شاخص حساسیت تنظیم میکند و یک قانون جبرانی را برای کاهش واریانس در شروعهای مختلف (initializations) اعمال میکند. این تغییر ساده، بهبودهای ثابتی را در MT-Bench و AlpacaEval 2 نسبت به DPO معمولی ایجاد کرد.
تحلیل: پایان عصر «دادههای بیشتر»
این موج از بهروزرسانیها نشاندهنده یک تغییر بنیادین در پسآموزش (post-training) است. صنعت از روشهای «زور خالص» (توکنهای بیشتر، رتبههای بزرگتر، RLHF عمومی) به سمت مداخلات «جراحی» حرکت میکند. چه فیلتر کردن ۶۰٪ از توکنهای تقطیر باشد و چه هدف قرار دادن خطاهای نقطهگذاری خاص در OCR، اکنون پیروزی در گرو گزینش (curation) است، نه حجم داده.
برای توسعهدهندگان، این بدان معناست که لبه رقابتی تغییر کرده است. هدف دیگر داشتن بزرگترین مجموعه داده نیست، بلکه داشتن دقیقترین تابع پاداش و کالیبرهترین حلقه دادههای مصنوعی است. موفقیت یک مدل ۲۷۰ میلیون پارامتری در شکست دادن رقبای بسیار بزرگتر ثابت میکند که RL هدفمند میتواند بسیار فراتر از اندازه خود عمل کند.
برای پیادهسازی این دستاوردها، تیمها باید با بازبینی خط لولههای تقطیر خود برای شناسایی توکنهای «کم-سیگنال» شروع کنند و بهجای تکیه بر بازخوردهای کلی مدلهای زبانی (LLM-as-a-judge)، برای خروجیهای ساختاریافته از پاداشهای قابل تأیید ریاضی آزمایش کنند.
گام بعدی شما
- خط لولههای تقطیر مدل خود را برای شناسایی و حذف توکنهای «کم-سیگنال» بازبینی کنید تا هزینه محاسبات را کاهش دهید.
- بهجای تکیه بر بازخوردهای کلی مدلهای زبانی (LLM-as-a-judge)، برای خروجیهای ساختاریافته از پاداشهای قابل تأیید ریاضی استفاده کنید.
- در تنظیمات PEFT، بهجای استفاده از رتبههای پیشفرض، کیفیت دادههای خود را به عنوان معیار اصلی انتخاب رتبه آداپتور قرار دهید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو