پرش به محتوای اصلی
پرش به محتوای مقاله

ارزیابی فنی: مدل‌های کوچک تنظیم‌شده ۲۰ برابر سریع‌تر از APIها هستند

·۳۰ شهریور ۱۴۰۵۱۰ دقیقه مطالعه۲ بازدید
مقایسه Jev با انکدر ۳۱۰ میلیونی آموزش‌دیده: ۷۵۰ سطر، سه وظیفه، دو برنده متفاوت
مقایسه Jev با انکدر ۳۱۰ میلیونی آموزش‌دیده: ۷۵۰ سطر، سه وظیفه، دو برنده متفاوت
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

اثبات آماری برتری مدل ۳۱۰ میلیونی بر APIهای پیشرفته در تسک‌های واژگانی؛ این خبر نشان می‌دهد که برای طبقه‌بندی موضوعی، مقیاس مدل اهمیت کمتری نسبت به وجود برچسب‌های آموزشی دارد.

اگر برای طبقه‌بندی متون از APIهای گران‌قیمت استفاده می‌کنید، احتمالاً هزینه و زمانی را تلف می‌کنید که با یک مدل کوچک و بهینه قابل حذف است. تفاوت ۱۲ درصد در صحت خروجی، فاصله میان یک مدل ۳۱۰ میلیون پارامتری و یکی از پیشرفته‌ترین APIهای تصمیم‌گیرنده است.

طبق یک ارزیابی فنی که در ۲۱ سپتامبر ۲۰۲۶ منتشر شد، مدل modernbert-ja-310m که تحت تنظیم دقیق (Fine-tuning) — شبیه وقتی که به یک پزشک عمومی، تخصص پوست می‌دهیم تا روی یک حوزه دقیق شود — قرار گرفته بود، در طبقه‌بندی موضوعی زبان ژاپنی، مدل Jev متعلق به شرکت TypeSafe AI را شکست داد. این مدل کوچک نه‌تنها در دقت برنده شد، بلکه ۴ تا ۲۰ برابر سریع‌تر از API مذکور عمل کرد.

این یافته در حالی منتشر می‌شود که صنعت هوش مصنوعی بر قابلیت‌های Zero-shot (بدون نیاز به نمونه) تأکید دارد. بسیاری از توسعه‌دهندگان تصور می‌کنند مدل‌های بزرگ و عمومی مثل Jev (سیستم One) به دلیل عدم نیاز به داده‌های آموزشی، انتخاب پیش‌فرض هستند. Jev واقعاً مدل خوب و ارزان‌قیمتی است؛ هزینه آن ۰.۰۴۲ دلار به‌ازای هر ۱ میلیون توکن ورودی است، خروجی‌های آن رایگان است و پنجره متنی تقریباً ۳۲ هزار توکنی دارد. این مدل در پاسخ‌های خود یک عدد برای میزان اطمینان (Confidence number) ارائه می‌دهد که آن را به یک معیار قدرتمند برای کسانی تبدیل می‌کند که داده‌های برچسب‌دار ندارند. این رویکرد امتیازدهی سریع، یادآور راهکارهای Jevlike برای کاهش تأخیر است که در آن امتیازدهی جایگزین تولید کلمه می‌شود تا سرعت پاسخ‌دهی افزایش یابد. اما همان‌طور که در بحث‌های گذشته ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، معماری مدل باید با «شکل» تسک سازگار باشد؛ یعنی اینکه آیا تسک به شناسایی واژگان نیاز دارد یا قضاوت ذهنی. این آزمایش ثابت می‌کند که برنده را نه شهرت مدل، بلکه ماهیت تسک تعیین می‌کند.

جزئیات آزمایش و متدولوژی

پژوهشگر شش سیستم مختلف را روی سه مجموعه داده ژاپنی آزمایش کرد که هر کدام شامل ۲۵۰ ردیف بودند. برای تضمین دقت علمی، پاسخ‌ها و ردیف‌ها ثابت نگه داشته شدند و مدل‌های آموزش‌دیده از اعتبارسنجی متقابل (Cross-validation) ۵-لایه استفاده کردند. این بدان معناست که مدل روی ۲۰۰ ردیف آموزش دید و ۵۰ ردیف باقی‌مانده را پیش‌بینی کرد و این چرخه ۵ بار تکرار شد؛ بنابراین تمام ۲۵۰ پیش‌بینی گزارش‌شده از مدلی می‌آمد که هرگز آن ردیف خاص را در مرحله آموزش ندیده بود. این پروتکل برای هر دو سیستم (انکودر عصبی و مدل پایه خطی) اعمال شد تا اطمینان حاصل شود که نتایج مستقیماً قابل مقایسه هستند. این دقت در طراحی متدولوژی، مشابه رویکردهای جدید در ارزیابی ابزارهای کدنویسی است که در آن برای افزایش دقت، از روش‌های تعاملی به جای بنچمارک‌های ایستا استفاده شد.

تسک‌های مورد بررسی به سه کلاس «شکل تسک» تقسیم شدند:

  • مجموعه اخبار livedoor: طبقه‌بندی موضوعی اسناد بلند. این مجموعه دارای ۹ کلاس با میانگین طول ۱۱۷۴ کاراکتر بود. احتمال حدس درست در این تسک ۱۱.۱٪ بود.
  • نظرات Rakuten: تشخیص قطبیت (مثبت/منفی) متون کوتاه. این مجموعه دارای ۲ کلاس با میانگین طول ۱۳۸ کاراکتر بود. احتمال حدس درست در اینجا ۵۰.۰٪ بود.
  • داده‌های chabsa: تشخیص قطبیت جملات مالی. این مجموعه دارای ۳ کلاس با میانگین طول ۹۲ کاراکتر بود. احتمال حدس درست در این تسک ۳۳.۳٪ بود.

سیستم‌های مورد ارزیابی به دو دسته تقسیم شدند:

  • بدون برچسب (Zero-shot): شامل Jev (نسخه ۱.۱۳.۰)، مدل محلی Gemma 4 26B-A4B با معماری ترکیب خبره‌ها (MoE) که نسخه Q4_K_M آن روی یک مینی-پی‌سی اجرا می‌شد، مدل SemIf (بر پایه Qwen3.5-4B)، مدل GLiClass multilang-mini (از خانواده GLiNER) و مدل Laya (که تصمیمات تایپ‌شده ارائه می‌داد).
  • آموزش‌دیده (۲۵۰ برچسب): مدل sbintuitions/modernbert-ja-310m به همراه یک لایه طبقه‌بندی (Classification head) و یک مدل پایه شامل n-gram کاراکتری + رگرسیون لجستیک.

تمام مقایسه‌ها روی شناسه‌های ردیف یکسان و با استفاده از آزمون مک‌نمار (McNemar's test) انجام شد. این موضوع حیاتی بود زیرا در حجم نمونه ۲۵۰ تایی، بازه اطمینان مستقل تقریباً ۶± امتیاز است؛ بدون یک آزمون جفت‌شده، تفاوتی مانند ۰.۸۸۸ در برابر ۰.۹۴۴ را نمی‌توان «معنادار» نامید.

شکاف عملکرد: موضوع در برابر معنا

در تسک موضوعی livedoor، مدل ۳۱۰ میلیونی آموزش‌دیده به صحت ۸۸.۸٪ رسید، در حالی که Jev تنها ۷۶.۸٪ را به دست آورد. این اختلاف ۱۲ امتیازی از نظر آماری کاملاً معنادار بود (p=0.00007). به نقل از گزارش این آزمایش، وقتی برچسب یک موضوع در خودِ کلمات «مرئی» است، یک مدل کوچک که تنها روی ۲۰۰ تا ۲۵۰ نمونه آموزش دیده، می‌تواند واژگان خاص را بسیار مؤثرتر از یک API عظیم Zero-shot یاد بگیرد. جالب اینجاست که حتی یک مدل ساده n-gram کاراکتری + رگرسیون لجستیک با ۸۸.۴٪، Jev را با اختلاف ۱۱.۶ امتیاز شکست داد (۰.۸۸۴ در برابر ۰.۷۶۸). این موضوع تایید می‌کند که سیگنال موضوعی در این تسک عمدتاً واژگانی (Lexical) است.

اما در تسک قطبیت Rakuten، نتایج یک تساوی آماری بود. مدل انکودر آموزش‌دیده به ۹۲.۸٪ و Jev به ۹۴.۴٪ رسید (p=0.50). مدل محلی 26B MoE نیز با ۹۴.۴٪ تساوی کرد (p=0.45). چون تشخیص احساسات (Sentiment) بیشتر یک قضاوت درباره کلمات است تا یک مسئله شناسایی واژگان، افزودن چند صد برچسب مزیت معناداری نسبت به استدلال ذاتی API ایجاد نکرد.

در تسک مالی chabsa، تمام مدل‌های برتر روی سقف ۷۴ تا ۷۵ درصد متوقف شدند. مدل انکودر آموزش‌دیده ۷۵.۲٪، Jev مقدار ۷۴.۰٪ و مدل محلی MoE مقدار ۷۵.۲٪ را کسب کردند. این نشان می‌دهد که یک «سقف عملکرد» وجود دارد که در آن نه داده‌های بیشتر و نه معماری‌های متفاوت، مشکل را حل نمی‌کنند. این وضعیت نشان‌دهنده نیاز به داده‌های باکیفیت‌تر یا یک خط لوله ارتقای چندمرحله‌ای است. نویسنده پیشنهاد می‌کند اگر تسکی روی ۷۵٪ متوقف شد، جستجو برای مدل‌های جدید را متوقف کرده و در عوض داده‌ها را اصلاح کنید یا یک مدل قدرتمندتر را برای مدیریت ردیف‌های با اطمینان پایین اضافه کنید.

شکست جایگزین‌های Jev

این مطالعه به‌طور خاص مدل‌هایی را هدف قرار داد که اغلب به عنوان جایگزین‌های متن‌باز Jev بازاریابی می‌شوند. مدل GLiClass در حالت Zero-shot عملکرد ضعیفی داشت و نمرات ۶۲.۸٪ (livedoor)، ۸۷.۲٪ (rakuten) و ۴۴.۸٪ (chabsa) را کسب کرد. در تسک قطبیت ۳ کلاسی، عملکرد آن به سختی بالاتر از سطح حدس تصادفی (۳۳.۳٪) بود.

با این حال، وقتی همین معماری GLiClass روی همان ۲۵۰ برچسب آموزش دید، نمرات آن به ۸۸.۸٪ / ۹۲.۸٪ / ۷۵.۲٪ جهش کرد. شکاف بین حالت Zero-shot و آموزش‌دیده به ترتیب ۲۶.۰+ / ۵.۶+ / ۳۰.۴+ امتیاز بود که همگی معنادار بودند. این ثابت می‌کند که معماری مدل به‌ندرت گلوگاه اصلی است؛ بلکه وجود برچسب‌ها اهرم واقعی برای افزایش عملکرد است. یک انکودر ۳۱۰ میلیونی با ۲۵۰ برچسب در یک تسک از API برتر است و در دو تسک دیگر با آن تساوی می‌کند، اما همان معماری بدون برچسب، در برابر همه می‌بازد.

سایر رقبای این میدان نیز نتایج چشمگیری نداشتند. مدل Laya در تسک ۹ کلاسی تنها ۲۹.۲٪ صحت داشت و میانگین اطمینان آن ۰.۰۲۹ بود که نشان می‌دهد مدل قادر به اتخاذ یک تصمیم قاطع نبود. مستندات Laya ادعای نمره ۰.۳۶۲ در حالت Zero-shot انگلیسی را دارد که نشان می‌دهد این یک نقص کلی در قابلیت Zero-shot است و نه مشکلی خاص زبان ژاپنی. علاوه بر این، در یک بنچمارک با سوالات ثابت، نمره «سخت» Laya مقدار ۳۴.۱٪ بود، در حالی که کارت مدل آن ادعای پیروزی بر Jev را داشت؛ این تضاد به این دلیل رخ داد که مدل روی بخش آموزشی (Training split) همان بنچمارک تنظیم دقیق شده بود. مدل SemIf نیز در هر سه تسک به Jev باخت و نمرات ۶۸.۸٪ / ۹۲.۰٪ / ۶۴.۰٪ را کسب کرد که دو مورد از این شکست‌ها از نظر آماری معنادار بود.

واقعیت‌های سخت‌افزاری و تأخیر

تفاوت در تأخیر (Latency) خیره‌کننده بود. مدل ۳۱۰ میلیونی آموزش‌دیده روی CPU در بازه ۰.۱۰ تا ۰.۴۵ ثانیه پاسخ داد. در مقابل، Jev بین ۱.۹ تا ۲.۴ ثانیه، مدل محلی 26B MoE مقدار ۱.۲۴ ثانیه و SemIf بین ۱.۳ تا ۶.۸ ثانیه زمان برد. این یعنی مدل آموزش‌دیده ۴ تا ۲۰ برابر سریع‌تر از API است، هزینه نهایی ندارد و به شبکه وابسته نیست. علاوه بر این، نمره اطمینان در مدل آموزش‌دیده یک Softmax است که کاربر می‌تواند خودش آن را کالیبره کند، به جای اینکه به عدد ارائه شده توسط فروشنده API تکیه کند.

پژوهشگر همچنین تلاش کرد از iGPU مدل AMD Radeon 780M (پردازنده Ryzen 9 7940HS, gfx1103) برای آموزش از طریق ROCm (نسخه torch 2.8.0+rocm7.14.0a20260519) استفاده کند. در حالی که میکرو-بنچمارک‌ها شتاب ۱۳.۶ برابری را نشان دادند (۱.۲۱ ثانیه در هر گام در مقابل ۱۶.۴۱ ثانیه روی CPU)، اما آموزش در دنیای واقعی ناپایدار بود.

چالش‌های آموزش با iGPU

  • تله‌های وابستگی: نصب از طریق ایندکس AMD اغلب باعث می‌شود pip در حل وابستگی‌های معمولی شکست بخورد زیرا PyPI را جایگزین می‌کند. افزودن مجدد PyPI به عنوان ایندکس اضافی اغلب منجر می‌شود که نسخه‌های جدیدتر torch در PyPI برنده مقایسه نسخه شوند و در نتیجه نسخه CUDA و بسته‌های nvidia-* به‌طور خاموش نصب شوند. همچنین جدیدترین torch در ایندکس nightly به نسخه‌ای از rocm-bootstrap نیاز دارد که همان ایندکس آن را ارائه نمی‌دهد.
  • تفاوت عملکرد: برای جملات کوتاه، iGPU در واقع کندتر بود (۲۳ دقیقه در مقابل ۲۱ دقیقه روی CPU) زیرا توالی‌های کوتاه باعث بیکار ماندن GPU می‌شوند، در حالی که CPU در ماتریس‌های کوچک کارآمد است. هزینه‌های ثابت هر لایه مانند بارگذاری مدل و توکن‌بندی می‌تواند از زمان خودِ آموزش بیشتر شود. تنها در اسناد بلند سود واقعی مشاهده شد (۴۴.۵ دقیقه در مقابل ۱۱۲ دقیقه، یعنی شتاب ۲.۵ برابری).
  • مشکلات پایداری: درایور مکرراً GPU را با خطاهای "amgpu: ring gfx_0.0.0 timeout" ریست می‌کرد که منجر به شکست‌های HIP unspecified launch می‌شد. این اتفاق با وجود اینکه دمای لبه‌ها روی ۴۹ درجه سانتی‌گراد باقی مانده بود رخ داد، که تایید می‌کند مشکل مربوط به درایور است و نه گرمای بیش از حد. اجراهای موفق نیازمند سریال‌سازی اعزام‌های کرنل، تثبیت سطوح عملکرد و اجرای هر لایه در یک پروسه مجزا با قابلیت تلاش مجدد (Retry) بود.
  • افت دقت: استفاده از دقت fp16 باعث کاهش ۲.۸ تا ۴.۴ امتیازی در صحت شد. اگرچه در حجم نمونه ۲۵۰ تایی این اثر معنادار نبود، اما تأثیر آن روی هر دو تسک منفی بود.

در نهایت، نویسنده نتیجه می‌گیرد که برای مجموعه‌های داده کوچک، آموزش روی CPU بسیار قابل‌اعتمادتر از شتاب‌دهنده‌های ناپایدار GPU است. صرف ۳۰ دقیقه برای هر مجموعه داده روی CPU، ترجیح داده می‌شود تا شتاب ۲.۵ برابری که منجر به کرش سیستم شود.

تله «شاگرد» در تولید برچسب

یک استراتژی رایج این است که از یک مدل قدرتمند مانند Jev برای تولید برچسب‌ها استفاده شود و سپس یک مدل کوچک‌تر روی آن برچسب‌ها آموزش ببیند. نویسنده هشدار می‌دهد که این کار یک سقف ایجاد می‌کند: اگر Jev به‌تنهایی برچسب‌ها را تولید کند، مدل شاگرد صرفاً یاد می‌گیرد که اشتباهات Jev را بازتولید کند. دقت شاگرد نمی‌تواند از دقت استاد فراتر رود.

برای شکستن این سقف، نویسنده یک رویکرد ترکیبی را توصیه می‌کند: Jev را روی همه داده‌ها اجرا کنید، سپس ردیف‌هایی را که اطمینان (Confidence) پایینی دارند جدا کرده و از یک مدل قدرتمندتر یا یک انسان بخواهید آن‌ها را مجدداً برچسب‌گذاری کنند. این کار هزینه نهایی را در جایی صرف می‌کند که بیشترین ارزش را دارد، زیرا ردیف‌های با اطمینان بالا را می‌توان همان‌طور پذیرفت. در سطح ۲۵۰ برچسب، انکودر آموزش‌دیده در تسک‌هایی که Jev در آن‌ها قوی است به تساوی رسیده و در جایی که Jev ضعیف است، از آن پیشی گرفته است. برچسب‌ها اهرم اصلی هستند و صدتایی دوم و سوم برچسب‌ها، ارزش بیشتری نسبت به صدتایی اول دارند.

چارچوب تصمیم‌گیری عملی

بر اساس این نتایج، نویسنده یک قانون معماری جدید برای طبقه‌بندی پیشنهاد می‌کند:

۱. بدون برچسب + تسک قضاوت: از یک API تصمیم‌گیرنده مانند Jev استفاده کنید (۷۴-۹۴٪ در حالت Zero-shot، بدون نیاز به تنظیمات).
۲. بدون برچسب + نیاز به اجرای آفلاین: از یک مدل محلی MoE مانند Gemma 4 26B استفاده کنید (در هر دو تسک قطبیت با Jev تساوی می‌کند).
۳. چند صد برچسب + تسک موضوعی: یک انکودر کوچک را آموزش دهید (۱۲ امتیاز بهتر از Jev و ۴ تا ۲۰ برابر سریع‌تر).
۴. چند صد برچسب + تسک معنایی: یک انکودر کوچک را آموزش دهید، اما تساوی با Jev را بپذیرید.
۵. توقف عملکرد در ۷۵٪: تعویض مدل را متوقف کنید و داده‌ها را اصلاح کنید یا یک مرحله نظارت انسانی (Human-in-the-loop) اضافه کنید.
۶. تولید برچسب‌ها: از Jev برای حجم بالا استفاده کنید، اما برای ردیف‌های با اطمینان پایین از مدل‌های قوی‌تر یا انسان کمک بگیرید.

این تغییر، نقش API را از مسیر اصلی به یک نقش پشتیبان (Fallback) تبدیل می‌کند. انکودر آموزش‌دیده حجم اصلی ترافیک را مدیریت می‌کند، در حالی که API برای ردیف‌های با اطمینان پایین، ردیف‌های با ظاهر جدید یا تشخیص رانش داده‌ها (Drift detection) رزرو می‌شود.

برای کسانی که خط لوله‌های تولیدی می‌سازند، نتیجه روشن است: پیش از انتخاب مدل، «شکل» تسک خود را اندازه بگیرید. اگر پاسخ در واژگان است، یک مدل کوچک آموزش‌دیده سریع‌تر، ارزان‌تر و دقیق‌تر از ترندترین APIها است. همچنین به هر بنچمارکی که ادعای «جایگزین متن‌باز Jev» دارد و مدلش روی خودِ آن بنچمارک آموزش دیده است، مشکوک باشید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مطالعه با تکیه بر متدولوژی سخت‌گیرانه (McNemar's test)، اثبات می‌کند که مدل‌های کوچک تنظیم‌شده می‌توانند در محیط‌های عملیاتی، جایگزینی ارزان‌تر و سریع‌تر برای APIهای تجاری باشند. این موضوع هزینه استنتاج را برای شرکت‌ها به شدت کاهش می‌دهد.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که با محدودیت‌های پرداخت ارزی برای APIهای خارجی روبرو هستند، استفاده از مدل‌های کوچک محلی (SLM) که روی CPUهای معمولی قابل آموزش و اجرا باشند، بهینه‌ترین مسیر است.

·نگاه ما
تحریریه دات‌هوش

این نتایج فرضیه «بزرگ‌تر همیشه بهتر است» را در تسک‌های طبقه‌بندی به چالش می‌کشد. در واقع، برای وظایفی که سیگنال‌های واژگانی قوی دارند، سرمایه‌گذاری روی چند صد داده‌ی برچسب‌دار بسیار سودآورتر از استفاده از مدل‌های استدلالی عظیم است. این یک چرخش از رویکرد مدل‌محور به داده‌محور در مقیاس کوچک است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.