تصور کنید یک مدل هوش مصنوعی را برای تصمیمگیریهای حساس استخدام کردهاید، اما متوجه میشوید جواب او فقط به ترتیب گزینهها در لیست بستگی دارد، نه به محتوای سؤال. این نقص ساختاری که به سوگیری موقعیتی معروف است، اکنون با یک راهکار مهندسی بدون نیاز به آموزش (Training) برطرف شده است. با وجود نیاز رایج به آموزشهای گسترده برای مدلهای تخصصی، یک مدل تصمیمگیری جدید وارد PyPI شده است که به هیچ آموزشی نیاز ندارد. تیم پژوهشی کاربردی نوکیا (Nokia) کتابخانه AnyJev را به صورت متنباز منتشر کرد؛ یک کتابخانه پایتون که طراحی شده تا هر مدل زبانی بزرگ (LLM) باز را به یک موتور تصمیمگیری کالیبره شده برای انتخاب یک پاسخ واحد از میان مجموعهای ثابت از گزینهها تبدیل کند.
بسیاری از کاربردهای صنعتی هوش مصنوعی در محیط تولید (Production) به جای یک پاراگراف متن، به یک «انتخاب» یا تصمیم قطعی نیاز دارند. همانطور که در تحلیل قبلی ما دربارهی Jev (محصول شرکت TypeSafe AI که در سپتامبر ۲۰۲۶ عرضه شد) اشاره کردیم، تبدیل استدلال به تصمیمات ساختاریافته یک ضرورت است؛ AnyJev اکنون همین رابط کاربری را به اکوسیستم مدلهای با وزنهای باز (Open Weights) میآورد. این رویکرد در واقع تکامل یافتهی تلاشاتی است که مدل Jev برای کاهش تأخیر در تصمیمگیریهای سریع به کار گرفته بود. این ابزار به توسعهدهندگان اجازه میدهد با LLM به عنوان یک طبقهبند (Classifier) برخورد کنند که برای هر گزینه یک احتمال برمیگرداند، به جای آنکه جملهای تولید کند که سپس باید توسط کدهای دیگر تجزیه و تحلیل (Parse) شود.
زمینه و قابلیتها
AnyJev وظایف رایج در محیط تولید را هدف قرار داده است که در آن باید یک پاسخ از میان مجموعهای ثابت انتخاب شود. این کتابخانه احتمالات را مستقیماً از توزیع توکن بعدی (Next-token distribution) مدل میخواند؛ به این معنا که هیچ متنی تولید نمیشود، هیچ چیزی تجزیه نمیگردد و هیچ آموزشی صورت نمیگیرد.
این کتابخانه از سه نوع خاص از سؤالات پشتیبانی میکند:
- سؤالات انتخابی (Choice questions): انتخاب یکی از K گزینه.
- سؤالات نول (Noul questions): یک تصمیم ساده بله یا خیر.
- سؤالات امتیازی (Score questions): قرار دادن پاسخ در یکی از چندین دستهبندی (Bin) مرتب شده.
طبق گزارش Marktechpost، خواندن مستقیم لاجیتها (Logits) از مدلها به دلیل سوگیریهای پیشین (Prior Bias) — مانند ترجیح دادن «بله» نسبت به «خیر» فارغ از ورودی — و سوگیری موقعیتی (Position Bias) — ترجیح دادن جایگاههای خاص در یک لیست — دارای خطا است. AnyJev برای حل این مشکل از دو سطح متمایز اصلاح استفاده میکند:
مکانیزم کالیبراسیون
- سطح L0 (پیشفرض): این سطح دو اصلاح اساسی اعمال میکند. اول، از چرخشهای چرخشی (Cyclic Shifts) استفاده میکند؛ برای سؤالی با K گزینه، لیست در K چرخش مختلف نمایش داده میشود تا هر انتخاب دقیقاً یکبار در هر موقعیت قرار گیرد. سپس نتایج به صورت میانگین هندسی در فضای لگاریتمی ترکیب میشوند تا سوگیری موقعیتی جمعی حذف شود. دوم، کالیبراسیون دستهای (Batch Calibration) را اعمال میکند؛ به این صورت که میانگین متحرکی از توزیعهای پیشبینیشده روی ورودیهای واقعی را نگه میدارد و پس از ۸ مورد اول، آن را با شدت ۰.۷۵ تقسیم میکند تا اثرات سیستماتیک حذف شوند.
- سطح L1: این سطح برای سؤالاتی با ۱۰۰ تا ۵۰۰ برچسب طراحی شده است و علاوه بر L0، مقیاسبندی دما (Temperature Scaling) را اضافه میکند. مقادیر برازش شده به صورت یک فایل کوچک JSON ذخیره میشوند. L1 سطح اطمینان (Confidence) را بازتنظیم میکند اما رتبهبندی پاسخها را تغییر نمیدهد.
عملکرد و بنچمارکها
در محک BANKING77 (با ۲۰ گزینه و ۳۰۰ مورد تست) با استفاده از مدل Qwen3-8B، نتایج بسیار واضح است. نرخ «تغییر پاسخ بر اثر جابجایی گزینهها» (Order-flip rate) — جایی که مدل صرفاً به دلیل معکوس شدن ترتیب گزینهها جوابش را تغییر میدهد — از ۰.۲۳۰ در حالت لاجیتهای خام به ۰.۰۷۳ با استفاده از AnyJev L0 کاهش یافت. همچنین صحت (Accuracy) کلی از ۰.۷۴۷ به ۰.۸۰۳ افزایش یافت.
بسیار تأثیرگذارتر این است که میزان ترافیکی که با نرخ خطای ۵٪ «خود-تصمیمگیر» (Auto-decidable) بود، هنگام استفاده از L1 از ۷.۷٪ به ۵۲.۰٪ جهش کرد. خطای کالیبراسیون (ECE) نیز از ۰.۲۴۰ (خام) به ۰.۰۹۵ (L1) بهبود یافت.
برای کسانی که از مدلهای بزرگتر استفاده میکنند، مدل Qwen3-32B با لایه L1 به ECE ۰.۰۳۶ رسید که از مقدار ۰.۱۴۴ منتشر شده برای Jev اصلی بهتر است. اگرچه مدل Fine-tuned Laya همچنان در صحت پاسخها پیشتاز است، اما AnyJev در تمامی ۹ ردیف مدل و وظیفه آزمایش شده، از جمله مدلهای Qwen، OLMo، Granite، Phi و Mistral، کاهش نرخ تغییر پاسخها را نشان داد.
برای توسعهدهندگان، این کتابخانه بسیار قابل استقرار است. AnyJev تحت لایسنس Apache-2.0 منتشر شده و از بکاندهای Hugging Face و vLLM با قابلیت امتیازدهی پیشوند مشترک (Shared-prefix scoring) پشتیبانی میکند. تیم نوکیا با استفاده از vLLM و حافظه پیشمخزن پیشوند (Prefix Caching)، توانست در دستههای ۳۲ تایی روی یک GPU H100 با K=20، به سرعت تقریبی ۰.۲۵ ثانیه برای هر تصمیم دست یابد.
این تغییر، فرض بنیادی مبنی بر اینکه LLMها برای تبدیل شدن به طبقهبندهای قابلاعتماد باید تنظیم دقیق (Fine-tuning) شوند را تغییر میدهد. نوکیا با تبدیل سوگیری از یک مسئله دادهای به یک مسئله هندسی، ثابت کرد که کالیبراسیون میتواند در لایه استنتاج (Inference) محقق شود. این رویکرد در تضاد با مدلهای پیچیدهتری است که با شبیهسازی واقعیت برای کاهش توهمات تلاش میکنند، چرا که AnyJev بر روی ساختار خروجی متمرکز است. پژوهشگر این پروژه، Wu، اشاره کرد که تیم آنها پیش از این نتایج امیدوارکنندهای را در بهکارگیری AnyJev برای یک مسئله مسیریابی داخلی در نوکیا مشاهده کرده است.
کاربران اکنون میتوانند این ابزار را از طریق دستور pip install "anyjev[hf]" نصب کنند تا پیادهسازی سؤالات تایپشده را آغاز کنند. گام بعدی برای جامعه توسعهدهندگان، آزمایش این لایههای کالیبراسیون در برابر جدیدترین مدلهای وزنباز پیشرو خواهد بود تا مشخص شود آیا سوگیری موقعیتی با افزایش مقیاس مدلها همچنان باقی میماند یا خیر.
گام بعدی شما
- اگر از مدلهای باز برای طبقهبندی دادهها استفاده میکنید، کتابخانه را با دستور
pip install "anyjev[hf]"نصب کنید. - مدلهای Qwen3 را برای وظایفی با تعداد برچسب بالا (بیش از ۱۰۰ مورد) با لایه L1 تست کنید.
- نرخ Order-flip مدل فعلی خود را با جابجا کردن ترتیب گزینهها در پرامپت بسنجید تا میزان سوگیری را تشخیص دهید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو