پرش به محتوای اصلی
پرش به محتوای مقاله

مدل تخصصی DharmaOCR در استخراج متون پرتغالی مدل‌های غول‌پیکر Mistral و

·۲۵ تیر ۱۴۰۵۹ دقیقه مطالعه
مدل‌های جدیدتر، همان برتری سابق
مدل‌های جدیدتر، همان برتری سابق
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

استفاده موفقیت‌آمیز از DPO برای حل مسئله تخریب خروجی (Degeneration) در OCR؛ در حالی که مدل‌های عمومی صرفاً روی دقت توکن تمرکز دارند، این مدل ثبات ساختاری خروجی در اسناد دشوار را تضمین کرده است.

دقت جراحی در پردازش داده‌ها، اغلب قربانی قابلیت‌های گسترده‌ی زبانی می‌شود. DharmaOCR، یک مدل تخصصی برای زبان پرتغالی برزنبل، با کسب امتیاز بالاتر از غول‌های عمومی در یک بنچمارک استخراج مستقیم، ثابت کرد که تخصص‌گرایی در آموزش می‌تواند بر معماری‌های سنگین‌تر و جدیدتر غلبه کند. این شواهد نشان می‌دهد که تخصص در دامنه (domain specialization) و آموزش هدفمند می‌تواند از معماری‌های جدیدتر و پرمصرف‌تر پیشی بگیرد.

در حالی که صنعت هوش مصنوعی به سمت مدل‌های چندوجهی (Multimodal) عظیم حرکت می‌کند که صدها زبان را پشتیبانی می‌کنند، «مالیات عمومی‌گرایی» همچنان یک نقطه شکست حیاتی در سیستم‌های عملیاتی نویسه‌خوانی نوری (OCR) است. وقتی پارامترها در یک فضای چندزبانه پخش می‌شوند، ظرفیت مدل برای درک تفاوت‌های ظریف فرهنگی، ریخت‌شناختی و نوشتاری هر زبان خاص کاهش می‌یابد و رقیق می‌شود. این شکاف دقیقاً جایی است که مدل‌های زبانی کوچک (SLM) تخصصی برتری خود را پیدا می‌کنند.

زمینه و محک‌زنی

سه ماه پیش، مقاله‌ای درباره DharmaOCR منتشر شد و یکی از مدل‌های آن به‌صورت متن‌باز (Open-source) عرضه گردید. هدف این پروژه بسیار مشخص و متمرکز بود: مهندسی یک سامانه OCR که صرفاً برای استخراج متون پرتغالی برزنبل بهینه شده باشد. برای آزمایش اثربخشی آن، مدل در برابر یک بنچمارک قرار گرفت که منحصراً حول محور کیفیت استخراج زبان پرتغالی طراحی شده بود.

بر اساس تحلیل‌های فنی، DharmaOCR به امتیاز کیفیت استخراج ۰.۹۲۵ دست یافت. در مقایسه، مدل جدیدتر Mistral OCR4 امتیاز ۰.۷۹۸ و مدل Unlimited-OCR با امتیاز ۰.۷۵۸۷ در رتبه‌های بعدی قرار گرفتند. این فاصله حتی با وجود عرضه مدل‌های رقیب پس از DharmaOCR و بهره‌مندی آن‌ها از منابع پژوهشی و محاسبات-ی بسیار بیشتر، پابرجا است. Mistral OCR4 تقریباً ۱۳ امتیاز و Unlimited-OCR بیش از ۱۶ امتیاز پایین‌تر از مدل تخصصی قرار دارند.

باید تأکید کرد که این رقبا پیشرفت‌های فنی واقعی هستند. Mistral OCR4 و Unlimited-OCR از تکنیک‌های آموزشی جدید و مجموعه‌داده‌های تازه‌تری استفاده می‌کنند و نتایج قدرتمندی را در چندین زبان مختلف نشان داده‌اند. آن‌ها استانداردهای رقابتی این حوزه را بالا برده‌اند. با این حال، در وظیفه‌ای که تصمیم بنیادین DharmaOCR در آن تمرکز کامل بر زبان پرتغالی بوده است، مزیت تخصص‌گرایی به‌طور ملموس و قابل اندازه‌گیری ظاهر می‌شود.

خط لوله‌ی آموزشی دو مرحله‌ای

برتری این مدل نه در دلیل معماری بزرگتر، بلکه در نحوه تخصیص پارامترهای موجود طی فرآیند آموزش است. معماری و تعداد پارامترها سقف یادگیری مدل را تعیین می‌کنند، اما این «آموزش» است که مشخص می‌کند این ظرفیت چگونه توزیع شود. در اینجا تخصص‌گرایی دیگر یک ترجیح در طراحی نیست، بلکه یک مسئله ساختاری است.

این فرآیند شامل دو مرحله متمایز بود:

  • تنظیم نظارت‌شده (SFT): این مرحله اول از مجموعه‌ای گسترده از فایل‌های زبان پرتغالی از منابع، فرمت‌ها و سطوح پیچیدگی مختلف بهره برد. مدل با تمرکز بر واژگان، نحو (Syntax) و ساختارهای سندی پرتغالی برزنبل، وزن‌های خود را با این دامنه خاص همراستا کرد. این کار از پخش شدن ظرفیت بازنمایی مدل در یک فضای چندزبانه گسترده جلوگیری کرده و آن را بر روی زبان مقصد متمرکز می‌کند.
  • بهینه‌سازی مستقیم ترجیح (DPO): مرحله دوم برای رسیدگی به مسئله «ثبات» (Stability) به‌جای دقت خام به‌کار رفت. مدل به‌جای آنکه صرفاً روی نسخه‌های «درست» آموزش ببیند، از داده‌های ترجیحی مقایسه‌ای بین خروجی‌های رقیب یاد گرفت. این امر به مدل آموخت که در زمان استنتاج (Inference)، به‌طور مداوم استخراج باکیفیت‌تر را انتخاب کند.

با سرکوب حالت‌های شکست (Failure modes) که باعث می‌شود مدل‌های مولد خروجی‌های تکراری یا بی‌معنی تولید کنند، DPO هم زمان استنتاج و هم هزینه را کاهش داد. نتیجه ترکیبی، مدلی بود که بالاترین امتیاز کیفیت استخراج و کمترین نرخ تخریب (Degeneration) را در یک بنچمارک پرتغالی‌محور کسب کرد. SFT صلاحیت دامنه را ساخت و DPO تضمین کرد که این صلاحیت در شرایطی که مدل‌ها معمولاً شکست می‌خورند، حفظ شود.

نقاط شکست مدل‌های چندزبانه

پردازش اسناد غیرساده پرتغالی دقیقاً نشان می‌دهد که مدل‌های عمومی کجا دچار فروپاشی می‌شوند. در این بنچمارک از مقاله‌های آزمون ENEM (امتحان سراسری دبیرستان برزیل) استفاده شد. این اسناد ترکیبی از دست‌خط، واژگانی خاص، اسامی خاص و ارجاعات فرهنگی مختص پرتغالی برزنبل هستند؛ دقیقاً همان اسنادی که آموزش‌های زبان‌محور در آن‌ها بازدهی بالایی دارند.

مدل‌های جدیدتر، همان برتری سابق

این اسناد یک شکست سیستماتیک در مدل‌های عمومی را برجسته می‌کنند: آن‌ها به‌صورت تصادفی خطا نمی‌کنند، بلکه دقیقاً در واژگانی شکست می‌خورند که زبان مقصد را از کل پیکره (Corpus) متمایز می‌کند. برای مثال، Mistral OCR4 در ارزیابی این مقاله‌ها، نام شاعر و موسیقی‌دان مشهور «Chico Buarque» را به‌اشتباه «Chico Barque» بازشناسی کرد.

Unlimited-OCR عملکرد بدتری داشت و نام را «chico bique» رندر کرد. وقتی این مدل با عبارت خاص «O Brasil não exclui, assimila» (برزیل حذف نمی‌کند، بلکه جذب می‌کند) — که نقل‌قولی از شیکو بوآرک است — مواجه شد، خروجی آن چنین بود: «a dose de chico bique, 'o Brasil no exclu, eliminila.'»

از آنجا که نام شیکو بوآرک در سطح ملی شناخته شده است و یک مورد گریز از چهره (Edge case) یا مبهم نیست، تخریب سیستماتیک آن گواه تشخیصی بر این است که آموزش مدل‌های عمومی به کجا نرسیده است. این یک خطای تصادفی نیست. DharmaOCR این موارد را به‌درستی مدیریت کرد زیرا منابع آن دقیقاً روی واژگان، ریخت‌شناسی (Morphology) و الگوهای نوشتاری پرتغالی برزنبل متمرکز شده بود.

حل مسئله تخریب خروجی (Degeneration)

دقت استخراج تنها یک بُعد از عملکرد است؛ اما ثبات در مواجهه با دشواری‌های بصری، اهمیت عملیاتی بسیار بیشتری دارد. وقتی یک مدل مولد با سیگنال‌های مبهم — مانند فونت‌های بسیار کوچک، کیفیت پایین اسکن یا دست‌خط‌های متراکم — مواجه می‌شود، با یک آسیب‌پذیری خاص روبرو است.

مدل‌هایی که عمدتاً بر اساس هدف «پیش‌بینی توکن بعدی» آموزش دیده‌اند، ممکن است به‌جای دنبال کردن سند منبع، شروع به تولید متن بر اساس الگوهای آموزی قبلی خود کنند. نتیجه این اتفاق، «تخریب خروجی» است: تولید متنی که تکراری، بی‌معنی و از نظر معنایی کاملاً گسسته از صفحه است.

مدل‌های جدیدتر، همان برتری سابق

در آزمایش‌هایی با اسناد دارای فونت کوچک، Mistral OCR4 خروجی‌هایی تولید کرد که هیچ ارتباطی با آنچه نوشته شده بود نداشت. این دیگر یک «ترجمه یا بازشناسی بی‌کیفیت» از منبع نیست، بلکه شکستی در یک دسته‌بندی کاملاً متفاوت است.

مدل‌های جدیدتر، همان برتری سابق

یک استخراج نادرست، خطایی است که به‌صورت قابل بازیابی رخ می‌دهد، زیرا همچنان رابطه‌ای با منبع دارد و در اصل می‌توان آن را شناسایی و اصلاح کرد. اما خروجی تخریب‌شده هیچ رابطه‌ای با منبع ندارد. این خروجی نمی‌تواند اصلاح شود زیرا اصلاً چیزی وجود ندارد که مدل به سمت آن اصلاح شود.

برای فرآیندهای پایین‌دستی — مانند طبقه‌بندی اسناد، استخراج اطلاعات و جریان‌های کاری تطبیق (Compliance) — این وضعیت منجر به تولید «داده‌های ساختاری-ناکارآمد» می‌شود. زمانی که خروجی دیگر «اطلاعات» نباشد، تمام بهره‌وری اتوماسیون از بین می‌رود. این رفتار تخریبی نشان‌دهنده شرایط شکست خاصی است که آموزش Mistral OCR4 و Unlimited-OCR در این دامنه به آن پرداخته نشده است.

مکانیزم DPO در مقابله با Drift

مدل DharmaOCR این مشکل را از طریق مرحله DPO کاهش می‌دهد. برای درک علت آن، باید به محدودیت‌های تنظیم نظارت‌شده (SFT) نگاه کرد. SFT روی پیش‌بینی‌های تک‌توکنی آموزش می‌بیند؛ یعنی مدل یاد می‌گیرد توکن درست بعدی را با توجه به متن قبلی پیش‌بینی کند.

در شرایط پیچگی بصری، اگر یک توکن اولیه از سند منبع منحرف شود، هر پیش‌بینی بعدی بر اساس آن حالت منحرف‌شده شکل می‌گیرد. این امر باعث «لغزش» یا Drift خروجی می‌شود. حلقه‌های تکرار و توالی‌های بی‌معنی، نتیجه قابل پیش‌بینی هدفی است که گام‌به‌گام بهینه شده اما انسجام کل استخراج را در نظر نگرفته است.

در مقابل، DPO با سیگنال کاملاً متفاوتی آموزش می‌بیند:

  • آموزش در سطح توالی: برخلاف SFT، مدل DPO در برابر کیفیت «خروجی‌های کامل» آموزش می‌بیند.
  • تمایز ترجیحی: این روش به مدل می‌آموزد که بین پاسخ‌های رقیب، بر اساس انسجام کل استخراج تصمیم بگیرد، نه بر اساس دقت تک‌تک پیش‌بینی‌ها.
  • جریمه برای انحراف: با جریمه کردن خروجی‌هایی که انسجام خود را در سطح استخراج از دست می‌دهند، احتمال اینکه مدل در مواجهه با سیگنال‌های بصری ضعیف، وارد یک مسیر منحرف‌کننده شود، به‌شدت کاهش می‌یابد.

منطق ساختاری تخصص‌گرایی

این نتیجه، این فرض را که «معماری‌های جدیدتر و بزرگ‌تر به‌طور خودکار نیاز به مدل‌های تخصصی را از بین می‌برند»، به‌چالش می‌کشد. در حالی که این حوزه به سمت قابلیت‌های بالاتر حرکت می‌کند، منطق ساختاری تخصیص منابع ثابت می‌ماند. توان محاسباتی، پارامترها و داده‌های آموزشی محدود هستند و باید هدایت شوند.

سیستمی که این منابع را به یک دامنه واحد اختصاص دهد، همواره در آن حوزه بازدهی بیشتری نسبت به سیستمی دارد که همان منابع را بین N زبان تقسیم کرده است. این یک واقعیت ریاضی مرتبط با اصل «برهم‌نهی نورون‌ها» (Neuron Superposition) است، جایی که پارامترهای فردی می‌توانند چندین ویژگی را به‌طور همزمان کدگذاری کنند. این تحلیل شباهت‌های ساختاری در مدل‌ها را یادآوری می‌کند، همان‌طور که در بررسی ردپای پنهان هوش مصنوعی در ساختار استدلال‌ها مشاهده شد، الگوهای تکرار شونده در مدل‌ها نشان‌دهنده منطق درونی آن‌هاست.

با این حال، مدلی که زمین گسترده‌تری را پوشش می‌دهد، تعهد کمتری به هر بخش خاص از آن دارد. این تقسیم‌بندی واقعی است و پیامدهای آن نیز ملموس است. DharmaOCR آموزش دید تا این محدودیت را به‌صورت معکوس بپذیرد: این مدل طراحی نشده تا بهترین گزینه برای زبان‌های دیگر باشد. در عوض، هر پارامتر موجود در شبکه، به سمت پرتغالی برزنبل جهت‌دهی شد.

این برتری ساختاری یک ترجیح در طراحی نیست، بلکه واقعیتی از نحوه تخصیص ظرفیت است. در حالی که مدل‌های جدیدتر مانند Mistral OCR4 و Unlimited-OCR پیشرفت‌های فنی واقعی هستند، مزیت تخصص‌گرایی در تسک‌هایی که کاملاً بر یک زبان متمرکز هستند، همچنان اندازه‌پذیر و چشمگیر باقی می‌ماند.

مسیر تکاملی و آینده

احتمالاً در آینده، معماری‌های پیشرفته‌تر و مجموعه‌داده‌های گسترده‌تر به مدل‌های عمومی اجازه دهند تا از نسخه‌های فعلی DharmaOCR پیشی بگیرند. معماران پیشرفت خواهند کرد و تکنیک‌های آموزشی تکامل خواهند یافت. این پیش‌بینی مورد انتظار و خوشامد است.

با این حال، دینامیک ساختاری — یعنی «تمرکز برابر است با دقت» — تغییر نمی‌کند. همان‌طور که در تحلیل «چرا تخصص‌گرایی اجتناب‌ناپذیر است» بررسی شد، شکاف بین متخصص و عمومی ممکن است تغییر کند، اما اصل آن پابرجا می‌ماند. فارغ از اینکه مدل عمومی چقدر توانمند شود، سیستمی که منابع محدود خود را تخصصی کند، همواره یک برتری تئوریک در آن دامنه خاص خواهد داشت.

هدف Dharma دفاع از یک جایگاه استاتیک در بنچمارک نیست، بلکه باقی ماندن در لبه تکنیک‌های نوظهور است. هدف این است که با به‌کارگیری معماری‌های جدید، روش‌های آموزشی تازه و رویکردهای نوین در همراستاسازی و ارزیابی در دامنه ثابت پرتغالی برزنبل، سیستمی ایجاد شود که بهترین بهره‌وری از منابع را با کمترین هزینه و سریع‌ترین زمان استنتاج فراهم کند. این تلاش برای کاهش هزینه‌های عملیاتی یادآور رویکردهای مشابه در سایر حوزه‌هاست، مانند زمانی که Oxlo AI توانست هزینه‌های ترجمه متون بلند را تا ۱۰۰ برابر کاهش دهد.

ابزارهای بهتر در تضاد با تخصص‌گرایی نیستند، بلکه آنچه تخصص می‌تواند به دست آورد را گسترش می‌دهند. شواهد سه ماه اخیر تأیید می‌کند که تمرکز آموزش بر یک دامنه خاص، مزیتی اندازه‌پذیر نسبت به سیستم‌های عمومی ایجاد می‌کند، صرف‌نظر از اینکه چه منابعی پشت سر رقبا باشد. همین اصل تعیین خواهد کرد که DharmaOCR چگونه تکامل یابد: نه با ثابت ماندن، بلکه با اعمال هر پیشرفتی که در این حوزه رخ می‌دهد بر روی دامنه‌ای که ثابت باقی مانده است.

گام بعدی شما

  • اگر برای استخراج داده از اسناد تخصصی (Domain-specific) پروژه دارید، به‌جای تکیه بر مدل‌های Generalist، ترکیب SFT و DPO را روی مدل‌های کوچک‌تر بررسی کنید.
  • در ارزیابی مدل‌های OCR، تنها به Accuracy اکتفا نکنید و نرخ Degeneration (تخریب خروجی) را در اسناد با کیفیت پایین بسنجید.
  • بررسی کنید آیا داده‌های ترجیحی (Preference Data) برای زبان مقصد شما در دسترس است تا بتوانید لایه DPO را پیاده‌سازی کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره بهینه‌سازی‌های Llama.cpp برای مدل‌های تخصصی مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر اعتبار بنچمارک‌های سختگیرانه، اثبات می‌کند که تخصص‌گرایی در آموزش می‌تواند هزینه‌های استنتاج را کاهش و دقت را به‌شدت افزایش دهد. این امر باعث تغییر استراتژی شرکت‌ها از مدل‌های «همه-کاره» به سمت معماری‌های ترکیبی (MoE) یا تخصصی می‌شود.

تأثیر برای ایران

این مدل به دلیل وزن‌های باز، برای توسعه‌دهندگان ایرانی که روی OCR زبان‌های کم-منبع (مانند فارسی) کار می‌کنند، یک نقشه راه عملی برای ترکیب SFT و DPO جهت کاهش توهمات مدل فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

برتری DharmaOCR نشان می‌دهد که «مقیاس» (Scaling) همیشه پاسخ نهایی نیست و در کاربردهای عملیاتی (Production)، دقت در لبه‌های داده‌ای مهم‌تر از جامعیت است. این رویکرد احتمالاً منجر به ظهور موجی از SLMهای بسیار ریز و فوق‌تخصصی می‌شود که به‌جای جایگزینی مدل‌های بزرگ، به‌عنوان «لایه‌های پالایش» در کنار آن‌ها قرار می‌گیرند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.