پرش به محتوای اصلی
پرش به محتوای مقاله

نوکیا: AnyJev سوگیری‌های موقعیتی LLM را بدون آموزش مجدد حذف می‌کند

·۱ مهر ۱۴۰۵۴ دقیقه مطالعه
لایه آموزش‌ندیده نوکیا برای تبدیل هر مدل زبانی باز به سیستم تصمیم‌گیری کالیبره‌شده
لایه آموزش‌ندیده نوکیا برای تبدیل هر مدل زبانی باز به سیستم تصمیم‌گیری کالیبره‌شده
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

حذف نیاز به آموزش مجدد (Training) برای تبدیل LLM به یک طبقه‌بند دقیق؛ AnyJev سوگیری‌های موقعیتی را در لایه استنتاج و با روش‌های هندسی حل می‌کند، نه با داده‌های آموزشی.

تصور کنید یک مدل هوش مصنوعی را برای تصمیم‌گیری‌های حساس استخدام کرده‌اید، اما متوجه می‌شوید جواب او فقط به ترتیب گزینه‌ها در لیست بستگی دارد، نه به محتوای سؤال. این نقص ساختاری که به سوگیری موقعیتی معروف است، اکنون با یک راهکار مهندسی بدون نیاز به آموزش (Training) برطرف شده است. با وجود نیاز رایج به آموزش‌های گسترده برای مدل‌های تخصصی، یک مدل تصمیم‌گیری جدید وارد PyPI شده است که به هیچ آموزشی نیاز ندارد. تیم پژوهشی کاربردی نوکیا (Nokia) کتابخانه AnyJev را به صورت متن‌باز منتشر کرد؛ یک کتابخانه پایتون که طراحی شده تا هر مدل زبانی بزرگ (LLM) باز را به یک موتور تصمیم‌گیری کالیبره شده برای انتخاب یک پاسخ واحد از میان مجموعه‌ای ثابت از گزینه‌ها تبدیل کند.

بسیاری از کاربردهای صنعتی هوش مصنوعی در محیط تولید (Production) به جای یک پاراگراف متن، به یک «انتخاب» یا تصمیم قطعی نیاز دارند. همان‌طور که در تحلیل قبلی ما درباره‌ی Jev (محصول شرکت TypeSafe AI که در سپتامبر ۲۰۲۶ عرضه شد) اشاره کردیم، تبدیل استدلال به تصمیمات ساختاریافته یک ضرورت است؛ AnyJev اکنون همین رابط کاربری را به اکوسیستم مدل‌های با وزن‌های باز (Open Weights) می‌آورد. این رویکرد در واقع تکامل یافته‌ی تلاشاتی است که مدل Jev برای کاهش تأخیر در تصمیم‌گیری‌های سریع به کار گرفته بود. این ابزار به توسعه‌دهندگان اجازه می‌دهد با LLM به عنوان یک طبقه‌بند (Classifier) برخورد کنند که برای هر گزینه یک احتمال برمی‌گرداند، به جای آنکه جمله‌ای تولید کند که سپس باید توسط کدهای دیگر تجزیه و تحلیل (Parse) شود.

زمینه و قابلیت‌ها

AnyJev وظایف رایج در محیط تولید را هدف قرار داده است که در آن باید یک پاسخ از میان مجموعه‌ای ثابت انتخاب شود. این کتابخانه احتمالات را مستقیماً از توزیع توکن بعدی (Next-token distribution) مدل می‌خواند؛ به این معنا که هیچ متنی تولید نمی‌شود، هیچ چیزی تجزیه نمی‌گردد و هیچ آموزشی صورت نمی‌گیرد.

این کتابخانه از سه نوع خاص از سؤالات پشتیبانی می‌کند:

  • سؤالات انتخابی (Choice questions): انتخاب یکی از K گزینه.
  • سؤالات نول (Noul questions): یک تصمیم ساده بله یا خیر.
  • سؤالات امتیازی (Score questions): قرار دادن پاسخ در یکی از چندین دسته‌بندی (Bin) مرتب شده.

طبق گزارش Marktechpost، خواندن مستقیم لاجیت‌ها (Logits) از مدل‌ها به دلیل سوگیری‌های پیشین (Prior Bias) — مانند ترجیح دادن «بله» نسبت به «خیر» فارغ از ورودی — و سوگیری موقعیتی (Position Bias) — ترجیح دادن جایگاه‌های خاص در یک لیست — دارای خطا است. AnyJev برای حل این مشکل از دو سطح متمایز اصلاح استفاده می‌کند:

مکانیزم کالیبراسیون

  • سطح L0 (پیش‌فرض): این سطح دو اصلاح اساسی اعمال می‌کند. اول، از چرخش‌های چرخشی (Cyclic Shifts) استفاده می‌کند؛ برای سؤالی با K گزینه، لیست در K چرخش مختلف نمایش داده می‌شود تا هر انتخاب دقیقاً یک‌بار در هر موقعیت قرار گیرد. سپس نتایج به صورت میانگین هندسی در فضای لگاریتمی ترکیب می‌شوند تا سوگیری موقعیتی جمعی حذف شود. دوم، کالیبراسیون دسته‌ای (Batch Calibration) را اعمال می‌کند؛ به این صورت که میانگین متحرکی از توزیع‌های پیش‌بینی‌شده روی ورودی‌های واقعی را نگه می‌دارد و پس از ۸ مورد اول، آن را با شدت ۰.۷۵ تقسیم می‌کند تا اثرات سیستماتیک حذف شوند.
  • سطح L1: این سطح برای سؤالاتی با ۱۰۰ تا ۵۰۰ برچسب طراحی شده است و علاوه بر L0، مقیاس‌بندی دما (Temperature Scaling) را اضافه می‌کند. مقادیر برازش شده به صورت یک فایل کوچک JSON ذخیره می‌شوند. L1 سطح اطمینان (Confidence) را بازتنظیم می‌کند اما رتبه‌بندی پاسخ‌ها را تغییر نمی‌دهد.

عملکرد و بنچمارک‌ها

در محک BANKING77 (با ۲۰ گزینه و ۳۰۰ مورد تست) با استفاده از مدل Qwen3-8B، نتایج بسیار واضح است. نرخ «تغییر پاسخ بر اثر جابجایی گزینه‌ها» (Order-flip rate) — جایی که مدل صرفاً به دلیل معکوس شدن ترتیب گزینه‌ها جوابش را تغییر می‌دهد — از ۰.۲۳۰ در حالت لاجیت‌های خام به ۰.۰۷۳ با استفاده از AnyJev L0 کاهش یافت. همچنین صحت (Accuracy) کلی از ۰.۷۴۷ به ۰.۸۰۳ افزایش یافت.

بسیار تأثیرگذارتر این است که میزان ترافیکی که با نرخ خطای ۵٪ «خود-تصمیم‌گیر» (Auto-decidable) بود، هنگام استفاده از L1 از ۷.۷٪ به ۵۲.۰٪ جهش کرد. خطای کالیبراسیون (ECE) نیز از ۰.۲۴۰ (خام) به ۰.۰۹۵ (L1) بهبود یافت.

برای کسانی که از مدل‌های بزرگ‌تر استفاده می‌کنند، مدل Qwen3-32B با لایه L1 به ECE ۰.۰۳۶ رسید که از مقدار ۰.۱۴۴ منتشر شده برای Jev اصلی بهتر است. اگرچه مدل Fine-tuned Laya همچنان در صحت پاسخ‌ها پیشتاز است، اما AnyJev در تمامی ۹ ردیف مدل و وظیفه آزمایش شده، از جمله مدل‌های Qwen، OLMo، Granite، Phi و Mistral، کاهش نرخ تغییر پاسخ‌ها را نشان داد.

برای توسعه‌دهندگان، این کتابخانه بسیار قابل استقرار است. AnyJev تحت لایسنس Apache-2.0 منتشر شده و از بک‌اندهای Hugging Face و vLLM با قابلیت امتیازدهی پیشوند مشترک (Shared-prefix scoring) پشتیبانی می‌کند. تیم نوکیا با استفاده از vLLM و حافظه پیش‌مخزن پیشوند (Prefix Caching)، توانست در دسته‌های ۳۲ تایی روی یک GPU H100 با K=20، به سرعت تقریبی ۰.۲۵ ثانیه برای هر تصمیم دست یابد.

این تغییر، فرض بنیادی مبنی بر اینکه LLMها برای تبدیل شدن به طبقه‌بندهای قابل‌اعتماد باید تنظیم دقیق (Fine-tuning) شوند را تغییر می‌دهد. نوکیا با تبدیل سوگیری از یک مسئله داده‌ای به یک مسئله هندسی، ثابت کرد که کالیبراسیون می‌تواند در لایه استنتاج (Inference) محقق شود. این رویکرد در تضاد با مدل‌های پیچیده‌تری است که با شبیه‌سازی واقعیت برای کاهش توهمات تلاش می‌کنند، چرا که AnyJev بر روی ساختار خروجی متمرکز است. پژوهشگر این پروژه، Wu، اشاره کرد که تیم آن‌ها پیش از این نتایج امیدوارکننده‌ای را در به‌کارگیری AnyJev برای یک مسئله مسیریابی داخلی در نوکیا مشاهده کرده است.

کاربران اکنون می‌توانند این ابزار را از طریق دستور pip install "anyjev[hf]" نصب کنند تا پیاده‌سازی سؤالات تایپ‌شده را آغاز کنند. گام بعدی برای جامعه توسعه‌دهندگان، آزمایش این لایه‌های کالیبراسیون در برابر جدیدترین مدل‌های وزن‌باز پیشرو خواهد بود تا مشخص شود آیا سوگیری موقعیتی با افزایش مقیاس مدل‌ها همچنان باقی می‌ماند یا خیر.

گام بعدی شما

  • اگر از مدل‌های باز برای طبقه‌بندی داده‌ها استفاده می‌کنید، کتابخانه را با دستور pip install "anyjev[hf]" نصب کنید.
  • مدل‌های Qwen3 را برای وظایفی با تعداد برچسب بالا (بیش از ۱۰۰ مورد) با لایه L1 تست کنید.
  • نرخ Order-flip مدل فعلی خود را با جابجا کردن ترتیب گزینه‌ها در پرامپت بسنجید تا میزان سوگیری را تشخیص دهید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این ابزار با تکیه بر تخصص تیم پژوهشی نوکیا، قابلیت اطمینان مدل‌های باز را برای استفاده در سیستم‌های بانکی و صنعتی که خطای پایین الزامی است، فراهم می‌کند. در واقع، اعتماد به خروجی مدل از یک حدس متنی به یک احتمال ریاضی کالیبره‌شده تغییر می‌یابد.

تأثیر برای ایران

برنامه‌نویسان ایرانی که به دلیل محدودیت‌های API یا هزینه، از مدل‌های Open-weights روی سرورهای شخصی استفاده می‌کنند، اکنون می‌توانند بدون نیاز به GPUهای قدرتمند برای Fine-tuning، دقت طبقه‌بندی مدل‌های خود را افزایش دهند.

·نگاه ما
تحریریه دات‌هوش

AnyJev ثابت می‌کند که بسیاری از ضعف‌های مدل‌های زبانی در وظایف طبقه‌بندی، ناشی از کمبود دانش نیست، بلکه نتیجه‌ی نقص در نحوه استخراج پاسخ است. این جابجایی از «آموزش داده‌های بیشتر» به «اصلاح لایه استنتاج»، هزینه‌ی عملیاتی مدل‌های صنعتی را به‌شدت کاهش می‌دهد زیرا نیاز به Fine-tuning‌های گران‌قیمت را برای هر تسک جدید حذف می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.