اگر برای طبقهبندی متون از APIهای گرانقیمت استفاده میکنید، احتمالاً هزینه و زمانی را تلف میکنید که با یک مدل کوچک و بهینه قابل حذف است. تفاوت ۱۲ درصد در صحت خروجی، فاصله میان یک مدل ۳۱۰ میلیون پارامتری و یکی از پیشرفتهترین APIهای تصمیمگیرنده است.
طبق یک ارزیابی فنی که در ۲۱ سپتامبر ۲۰۲۶ منتشر شد، مدل modernbert-ja-310m که تحت تنظیم دقیق (Fine-tuning) — شبیه وقتی که به یک پزشک عمومی، تخصص پوست میدهیم تا روی یک حوزه دقیق شود — قرار گرفته بود، در طبقهبندی موضوعی زبان ژاپنی، مدل Jev متعلق به شرکت TypeSafe AI را شکست داد. این مدل کوچک نهتنها در دقت برنده شد، بلکه ۴ تا ۲۰ برابر سریعتر از API مذکور عمل کرد.
این یافته در حالی منتشر میشود که صنعت هوش مصنوعی بر قابلیتهای Zero-shot (بدون نیاز به نمونه) تأکید دارد. بسیاری از توسعهدهندگان تصور میکنند مدلهای بزرگ و عمومی مثل Jev (سیستم One) به دلیل عدم نیاز به دادههای آموزشی، انتخاب پیشفرض هستند. Jev واقعاً مدل خوب و ارزانقیمتی است؛ هزینه آن ۰.۰۴۲ دلار بهازای هر ۱ میلیون توکن ورودی است، خروجیهای آن رایگان است و پنجره متنی تقریباً ۳۲ هزار توکنی دارد. این مدل در پاسخهای خود یک عدد برای میزان اطمینان (Confidence number) ارائه میدهد که آن را به یک معیار قدرتمند برای کسانی تبدیل میکند که دادههای برچسبدار ندارند. این رویکرد امتیازدهی سریع، یادآور راهکارهای Jevlike برای کاهش تأخیر است که در آن امتیازدهی جایگزین تولید کلمه میشود تا سرعت پاسخدهی افزایش یابد. اما همانطور که در بحثهای گذشته ما دربارهی امنیت مدلهای بازمتن اشاره کردیم، معماری مدل باید با «شکل» تسک سازگار باشد؛ یعنی اینکه آیا تسک به شناسایی واژگان نیاز دارد یا قضاوت ذهنی. این آزمایش ثابت میکند که برنده را نه شهرت مدل، بلکه ماهیت تسک تعیین میکند.
جزئیات آزمایش و متدولوژی
پژوهشگر شش سیستم مختلف را روی سه مجموعه داده ژاپنی آزمایش کرد که هر کدام شامل ۲۵۰ ردیف بودند. برای تضمین دقت علمی، پاسخها و ردیفها ثابت نگه داشته شدند و مدلهای آموزشدیده از اعتبارسنجی متقابل (Cross-validation) ۵-لایه استفاده کردند. این بدان معناست که مدل روی ۲۰۰ ردیف آموزش دید و ۵۰ ردیف باقیمانده را پیشبینی کرد و این چرخه ۵ بار تکرار شد؛ بنابراین تمام ۲۵۰ پیشبینی گزارششده از مدلی میآمد که هرگز آن ردیف خاص را در مرحله آموزش ندیده بود. این پروتکل برای هر دو سیستم (انکودر عصبی و مدل پایه خطی) اعمال شد تا اطمینان حاصل شود که نتایج مستقیماً قابل مقایسه هستند. این دقت در طراحی متدولوژی، مشابه رویکردهای جدید در ارزیابی ابزارهای کدنویسی است که در آن برای افزایش دقت، از روشهای تعاملی به جای بنچمارکهای ایستا استفاده شد.
تسکهای مورد بررسی به سه کلاس «شکل تسک» تقسیم شدند:
- مجموعه اخبار livedoor: طبقهبندی موضوعی اسناد بلند. این مجموعه دارای ۹ کلاس با میانگین طول ۱۱۷۴ کاراکتر بود. احتمال حدس درست در این تسک ۱۱.۱٪ بود.
- نظرات Rakuten: تشخیص قطبیت (مثبت/منفی) متون کوتاه. این مجموعه دارای ۲ کلاس با میانگین طول ۱۳۸ کاراکتر بود. احتمال حدس درست در اینجا ۵۰.۰٪ بود.
- دادههای chabsa: تشخیص قطبیت جملات مالی. این مجموعه دارای ۳ کلاس با میانگین طول ۹۲ کاراکتر بود. احتمال حدس درست در این تسک ۳۳.۳٪ بود.
سیستمهای مورد ارزیابی به دو دسته تقسیم شدند:
- بدون برچسب (Zero-shot): شامل Jev (نسخه ۱.۱۳.۰)، مدل محلی Gemma 4 26B-A4B با معماری ترکیب خبرهها (MoE) که نسخه Q4_K_M آن روی یک مینی-پیسی اجرا میشد، مدل SemIf (بر پایه Qwen3.5-4B)، مدل GLiClass multilang-mini (از خانواده GLiNER) و مدل Laya (که تصمیمات تایپشده ارائه میداد).
- آموزشدیده (۲۵۰ برچسب): مدل sbintuitions/modernbert-ja-310m به همراه یک لایه طبقهبندی (Classification head) و یک مدل پایه شامل n-gram کاراکتری + رگرسیون لجستیک.
تمام مقایسهها روی شناسههای ردیف یکسان و با استفاده از آزمون مکنمار (McNemar's test) انجام شد. این موضوع حیاتی بود زیرا در حجم نمونه ۲۵۰ تایی، بازه اطمینان مستقل تقریباً ۶± امتیاز است؛ بدون یک آزمون جفتشده، تفاوتی مانند ۰.۸۸۸ در برابر ۰.۹۴۴ را نمیتوان «معنادار» نامید.
شکاف عملکرد: موضوع در برابر معنا
در تسک موضوعی livedoor، مدل ۳۱۰ میلیونی آموزشدیده به صحت ۸۸.۸٪ رسید، در حالی که Jev تنها ۷۶.۸٪ را به دست آورد. این اختلاف ۱۲ امتیازی از نظر آماری کاملاً معنادار بود (p=0.00007). به نقل از گزارش این آزمایش، وقتی برچسب یک موضوع در خودِ کلمات «مرئی» است، یک مدل کوچک که تنها روی ۲۰۰ تا ۲۵۰ نمونه آموزش دیده، میتواند واژگان خاص را بسیار مؤثرتر از یک API عظیم Zero-shot یاد بگیرد. جالب اینجاست که حتی یک مدل ساده n-gram کاراکتری + رگرسیون لجستیک با ۸۸.۴٪، Jev را با اختلاف ۱۱.۶ امتیاز شکست داد (۰.۸۸۴ در برابر ۰.۷۶۸). این موضوع تایید میکند که سیگنال موضوعی در این تسک عمدتاً واژگانی (Lexical) است.
اما در تسک قطبیت Rakuten، نتایج یک تساوی آماری بود. مدل انکودر آموزشدیده به ۹۲.۸٪ و Jev به ۹۴.۴٪ رسید (p=0.50). مدل محلی 26B MoE نیز با ۹۴.۴٪ تساوی کرد (p=0.45). چون تشخیص احساسات (Sentiment) بیشتر یک قضاوت درباره کلمات است تا یک مسئله شناسایی واژگان، افزودن چند صد برچسب مزیت معناداری نسبت به استدلال ذاتی API ایجاد نکرد.
در تسک مالی chabsa، تمام مدلهای برتر روی سقف ۷۴ تا ۷۵ درصد متوقف شدند. مدل انکودر آموزشدیده ۷۵.۲٪، Jev مقدار ۷۴.۰٪ و مدل محلی MoE مقدار ۷۵.۲٪ را کسب کردند. این نشان میدهد که یک «سقف عملکرد» وجود دارد که در آن نه دادههای بیشتر و نه معماریهای متفاوت، مشکل را حل نمیکنند. این وضعیت نشاندهنده نیاز به دادههای باکیفیتتر یا یک خط لوله ارتقای چندمرحلهای است. نویسنده پیشنهاد میکند اگر تسکی روی ۷۵٪ متوقف شد، جستجو برای مدلهای جدید را متوقف کرده و در عوض دادهها را اصلاح کنید یا یک مدل قدرتمندتر را برای مدیریت ردیفهای با اطمینان پایین اضافه کنید.
شکست جایگزینهای Jev
این مطالعه بهطور خاص مدلهایی را هدف قرار داد که اغلب به عنوان جایگزینهای متنباز Jev بازاریابی میشوند. مدل GLiClass در حالت Zero-shot عملکرد ضعیفی داشت و نمرات ۶۲.۸٪ (livedoor)، ۸۷.۲٪ (rakuten) و ۴۴.۸٪ (chabsa) را کسب کرد. در تسک قطبیت ۳ کلاسی، عملکرد آن به سختی بالاتر از سطح حدس تصادفی (۳۳.۳٪) بود.
با این حال، وقتی همین معماری GLiClass روی همان ۲۵۰ برچسب آموزش دید، نمرات آن به ۸۸.۸٪ / ۹۲.۸٪ / ۷۵.۲٪ جهش کرد. شکاف بین حالت Zero-shot و آموزشدیده به ترتیب ۲۶.۰+ / ۵.۶+ / ۳۰.۴+ امتیاز بود که همگی معنادار بودند. این ثابت میکند که معماری مدل بهندرت گلوگاه اصلی است؛ بلکه وجود برچسبها اهرم واقعی برای افزایش عملکرد است. یک انکودر ۳۱۰ میلیونی با ۲۵۰ برچسب در یک تسک از API برتر است و در دو تسک دیگر با آن تساوی میکند، اما همان معماری بدون برچسب، در برابر همه میبازد.
سایر رقبای این میدان نیز نتایج چشمگیری نداشتند. مدل Laya در تسک ۹ کلاسی تنها ۲۹.۲٪ صحت داشت و میانگین اطمینان آن ۰.۰۲۹ بود که نشان میدهد مدل قادر به اتخاذ یک تصمیم قاطع نبود. مستندات Laya ادعای نمره ۰.۳۶۲ در حالت Zero-shot انگلیسی را دارد که نشان میدهد این یک نقص کلی در قابلیت Zero-shot است و نه مشکلی خاص زبان ژاپنی. علاوه بر این، در یک بنچمارک با سوالات ثابت، نمره «سخت» Laya مقدار ۳۴.۱٪ بود، در حالی که کارت مدل آن ادعای پیروزی بر Jev را داشت؛ این تضاد به این دلیل رخ داد که مدل روی بخش آموزشی (Training split) همان بنچمارک تنظیم دقیق شده بود. مدل SemIf نیز در هر سه تسک به Jev باخت و نمرات ۶۸.۸٪ / ۹۲.۰٪ / ۶۴.۰٪ را کسب کرد که دو مورد از این شکستها از نظر آماری معنادار بود.
واقعیتهای سختافزاری و تأخیر
تفاوت در تأخیر (Latency) خیرهکننده بود. مدل ۳۱۰ میلیونی آموزشدیده روی CPU در بازه ۰.۱۰ تا ۰.۴۵ ثانیه پاسخ داد. در مقابل، Jev بین ۱.۹ تا ۲.۴ ثانیه، مدل محلی 26B MoE مقدار ۱.۲۴ ثانیه و SemIf بین ۱.۳ تا ۶.۸ ثانیه زمان برد. این یعنی مدل آموزشدیده ۴ تا ۲۰ برابر سریعتر از API است، هزینه نهایی ندارد و به شبکه وابسته نیست. علاوه بر این، نمره اطمینان در مدل آموزشدیده یک Softmax است که کاربر میتواند خودش آن را کالیبره کند، به جای اینکه به عدد ارائه شده توسط فروشنده API تکیه کند.
پژوهشگر همچنین تلاش کرد از iGPU مدل AMD Radeon 780M (پردازنده Ryzen 9 7940HS, gfx1103) برای آموزش از طریق ROCm (نسخه torch 2.8.0+rocm7.14.0a20260519) استفاده کند. در حالی که میکرو-بنچمارکها شتاب ۱۳.۶ برابری را نشان دادند (۱.۲۱ ثانیه در هر گام در مقابل ۱۶.۴۱ ثانیه روی CPU)، اما آموزش در دنیای واقعی ناپایدار بود.
چالشهای آموزش با iGPU
- تلههای وابستگی: نصب از طریق ایندکس AMD اغلب باعث میشود pip در حل وابستگیهای معمولی شکست بخورد زیرا PyPI را جایگزین میکند. افزودن مجدد PyPI به عنوان ایندکس اضافی اغلب منجر میشود که نسخههای جدیدتر torch در PyPI برنده مقایسه نسخه شوند و در نتیجه نسخه CUDA و بستههای nvidia-* بهطور خاموش نصب شوند. همچنین جدیدترین torch در ایندکس nightly به نسخهای از rocm-bootstrap نیاز دارد که همان ایندکس آن را ارائه نمیدهد.
- تفاوت عملکرد: برای جملات کوتاه، iGPU در واقع کندتر بود (۲۳ دقیقه در مقابل ۲۱ دقیقه روی CPU) زیرا توالیهای کوتاه باعث بیکار ماندن GPU میشوند، در حالی که CPU در ماتریسهای کوچک کارآمد است. هزینههای ثابت هر لایه مانند بارگذاری مدل و توکنبندی میتواند از زمان خودِ آموزش بیشتر شود. تنها در اسناد بلند سود واقعی مشاهده شد (۴۴.۵ دقیقه در مقابل ۱۱۲ دقیقه، یعنی شتاب ۲.۵ برابری).
- مشکلات پایداری: درایور مکرراً GPU را با خطاهای "amgpu: ring gfx_0.0.0 timeout" ریست میکرد که منجر به شکستهای HIP unspecified launch میشد. این اتفاق با وجود اینکه دمای لبهها روی ۴۹ درجه سانتیگراد باقی مانده بود رخ داد، که تایید میکند مشکل مربوط به درایور است و نه گرمای بیش از حد. اجراهای موفق نیازمند سریالسازی اعزامهای کرنل، تثبیت سطوح عملکرد و اجرای هر لایه در یک پروسه مجزا با قابلیت تلاش مجدد (Retry) بود.
- افت دقت: استفاده از دقت fp16 باعث کاهش ۲.۸ تا ۴.۴ امتیازی در صحت شد. اگرچه در حجم نمونه ۲۵۰ تایی این اثر معنادار نبود، اما تأثیر آن روی هر دو تسک منفی بود.
در نهایت، نویسنده نتیجه میگیرد که برای مجموعههای داده کوچک، آموزش روی CPU بسیار قابلاعتمادتر از شتابدهندههای ناپایدار GPU است. صرف ۳۰ دقیقه برای هر مجموعه داده روی CPU، ترجیح داده میشود تا شتاب ۲.۵ برابری که منجر به کرش سیستم شود.
تله «شاگرد» در تولید برچسب
یک استراتژی رایج این است که از یک مدل قدرتمند مانند Jev برای تولید برچسبها استفاده شود و سپس یک مدل کوچکتر روی آن برچسبها آموزش ببیند. نویسنده هشدار میدهد که این کار یک سقف ایجاد میکند: اگر Jev بهتنهایی برچسبها را تولید کند، مدل شاگرد صرفاً یاد میگیرد که اشتباهات Jev را بازتولید کند. دقت شاگرد نمیتواند از دقت استاد فراتر رود.
برای شکستن این سقف، نویسنده یک رویکرد ترکیبی را توصیه میکند: Jev را روی همه دادهها اجرا کنید، سپس ردیفهایی را که اطمینان (Confidence) پایینی دارند جدا کرده و از یک مدل قدرتمندتر یا یک انسان بخواهید آنها را مجدداً برچسبگذاری کنند. این کار هزینه نهایی را در جایی صرف میکند که بیشترین ارزش را دارد، زیرا ردیفهای با اطمینان بالا را میتوان همانطور پذیرفت. در سطح ۲۵۰ برچسب، انکودر آموزشدیده در تسکهایی که Jev در آنها قوی است به تساوی رسیده و در جایی که Jev ضعیف است، از آن پیشی گرفته است. برچسبها اهرم اصلی هستند و صدتایی دوم و سوم برچسبها، ارزش بیشتری نسبت به صدتایی اول دارند.
چارچوب تصمیمگیری عملی
بر اساس این نتایج، نویسنده یک قانون معماری جدید برای طبقهبندی پیشنهاد میکند:
۱. بدون برچسب + تسک قضاوت: از یک API تصمیمگیرنده مانند Jev استفاده کنید (۷۴-۹۴٪ در حالت Zero-shot، بدون نیاز به تنظیمات).
۲. بدون برچسب + نیاز به اجرای آفلاین: از یک مدل محلی MoE مانند Gemma 4 26B استفاده کنید (در هر دو تسک قطبیت با Jev تساوی میکند).
۳. چند صد برچسب + تسک موضوعی: یک انکودر کوچک را آموزش دهید (۱۲ امتیاز بهتر از Jev و ۴ تا ۲۰ برابر سریعتر).
۴. چند صد برچسب + تسک معنایی: یک انکودر کوچک را آموزش دهید، اما تساوی با Jev را بپذیرید.
۵. توقف عملکرد در ۷۵٪: تعویض مدل را متوقف کنید و دادهها را اصلاح کنید یا یک مرحله نظارت انسانی (Human-in-the-loop) اضافه کنید.
۶. تولید برچسبها: از Jev برای حجم بالا استفاده کنید، اما برای ردیفهای با اطمینان پایین از مدلهای قویتر یا انسان کمک بگیرید.
این تغییر، نقش API را از مسیر اصلی به یک نقش پشتیبان (Fallback) تبدیل میکند. انکودر آموزشدیده حجم اصلی ترافیک را مدیریت میکند، در حالی که API برای ردیفهای با اطمینان پایین، ردیفهای با ظاهر جدید یا تشخیص رانش دادهها (Drift detection) رزرو میشود.
برای کسانی که خط لولههای تولیدی میسازند، نتیجه روشن است: پیش از انتخاب مدل، «شکل» تسک خود را اندازه بگیرید. اگر پاسخ در واژگان است، یک مدل کوچک آموزشدیده سریعتر، ارزانتر و دقیقتر از ترندترین APIها است. همچنین به هر بنچمارکی که ادعای «جایگزین متنباز Jev» دارد و مدلش روی خودِ آن بنچمارک آموزش دیده است، مشکوک باشید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو