اعتماد به امتیاز اطمینان یک مدل بهعنوان یک احتمال مطلق، میتواند منجر به شکستهای سیستمی در استقرار هوش مصنوعی شود. این هشدار محوریت تحلیل فنی ۲۳ سپتامبر ۲۰۲۶ در وبسایت alexmolas.com بود که ادعاهای بنیادین شرکت TypeSafe درباره کالیبراسیون مدل Jev را به چالش کشید. Jev بهعنوان اولین «مدل سیستم یک» (System One Model) از سوی TypeSafe معرفی شده است.
زمینه و پیادهسازی
مدل Jev تغییری بنیادین در خروجی مدلها ایجاد کرده است. این مدل بهجای تولید متنهای سنتی، ورودیهای بدون ساختار را میگیرد و تصمیماتی تایپشده (Typed Decisions) از میان مجموعهای از خروجیهای پیشتعریفشده برمیگرداند که هر کدام یک احتمال متصل به خود دارند.
همانطور که در پوشش پیشین ما درباره نحوه استخراج احتمالات از مدلهای زبانی (LLMs) توسط Jevper اشاره کردیم، تفاوت کلیدی Jev در این است که بهجای متن خام، تصمیمات دستهبندیشده را همراه با احتمالات متصل ارائه میدهد. طبق گزارش نویسنده، این قابلیت برای بسیاری از توسعهدهندگان یک مزیت بزرگ است؛ زیرا امکان طبقهبندی (Classification) را بدون نیاز به جمعآوری مجموعهدادههای عظیم آموزشی در ابتدا فراهم میکند.
برخلاف مدل BERT که تنظیم دقیق (Fine-tuning) شده و تنها برای تکلیفی خاص که روی آن آموزش دیده مفید است و به دادههای قابل توجهی نیاز دارد، Jev بهعنوان یک طبقهبندیکننده جهانی عمل میکند. شما میتوانید آن را فوراً روی هر مسئله طبقهبندی اعمال کنید و نتایج معقولی بگیرید.
شکاف کالیبراسیون
با این حال، یک شکاف جدی در کالیبراسیون وجود دارد. TypeSafe ادعا میکند Jev با استفاده از «یادگیری تقویتی برای تصمیمات کالیبرهشده» (RLCD) آموزش دیده است. آنها این ابزار را با این شعار بازاریابی میکنند که «تمام پاسخها با احتمالات کالیبرهشده و امتیازات اطمینان همراه هستند». اما بر اساس این تحلیل، کالیبراسیون (Calibration) یک ویژگی ایستا در مدل نیست، بلکه رابطهای بین مدل و یک توزیع خاص از دادهها است.
از نظر ریاضی، یک مدل زمانی کالیبره است که برای هر احتمال پیشبینیشده $p$، احتمال واقعی کلاس مثبت با توجه به آن پیشبینی، برابر با $p$ باشد. این رابطه بهصورت $P(Y = 1 \mid \hat{p} = p) = p$ بیان میشود. بهطور شهودی، اگر Jev برای گروهی از ایمیلها احتمال spam_probability=0.7 را پیشبینی کند، باید تقریباً ۷۰٪ از آن ایمیلها واقعاً هرزنامه باشند.
تحلیل مذکور سه نقطه ضعف اساسی را برمیشمارد:
- تغییر توزیع (Distribution Shift): مدلی که روی دادههای داخلی TypeSafe کالیبره شده، ممکن است روی دادههای عملیاتی خاص یک مشتری کاملاً کالیبره نباشد. شرکتهای مختلف ممکن است تعریف «هرزنامه» را یکسان بدانند، اما توزیع دادههای آنها متفاوت باشد.
- خروجیهای ایستا: Jev برای یک پرامپت یکسان، فارغ از توزیع دادههای زیربنایی کاربر، احتمال یکسانی ارائه میدهد؛ این بدان معناست که مدل نمیتواند بهصورت جهانی کالیبره باشد.
- شکستهای منطقی: شواهدی نشان میدهد Jev برای پرتاب یک سکه عادلانه، احتمال ۰.۹۲ را برای «شیر» گزارش کرده است، در حالی که احتمال واقعی (۰.۵) صراحتاً در متن پرامپت ذکر شده بود.
این شکست فراتر از یک تغییر توزیع ساده است و نشاندهنده یک گسست بنیادین در نحوه مدیریت احتمالات شناختهشده توسط مدل است. تحلیل اشاره میکند مدلهای دیگری مانند Noul در مسائل مشابه، کالیبراسیون بهتری نسبت به Choice دارند که این موضوع معنای «احتمالات کالیبرهشده» را پیچیدهتر میکند.
برای مهندسان، این یافته فرض بنیادین استفاده از Jev در سیستمهای مبتنی بر آستانه (Threshold-based) را تغییر میدهد. اگر برنامه شما به هزینههای مورد انتظار یا ترکیب چندین مدل وابسته است، نمیتوانید به اعداد خام ارائه شده توسط مدل در حالت پیشفرض اعتماد کنید.
نویسنده پیشنهاد میکند خروجیهای Jev را بهجای احتمال واقعی، بهعنوان امتیازاتی با کیفیت بالا در نظر بگیرید که نمونهها را بهخوبی رتبهبندی میکنند. برای رسیدن به کالیبراسیون واقعی، توسعهدهندگان باید روش Platt scaling را روی امتیازات Jev و با استفاده از مجموعه کوچکی از نمونههای برچسبدار از دادههای عملیاتی خود پیادهسازی کنند.
بازکالیبره کردن مدل نسبتاً ارزان است و اغلب تنها به چند صد نمونه برچسبدار نیاز دارد تا امتیازات با نتایج دنیای واقعی همسو شوند. این چرخش از «احتمال آماده برای استفاده» به «امتیاز و بازکالیبراسیون»، برای هر استقرار در محیطهای حساس و پرمخاطره ضروری است.
گام بعدی شما
- اگر از Jev برای تصمیمگیریهای خودکار استفاده میکنید، خروجیها را بهجای احتمال، بهعنوان رتبه (Rank) تحلیل کنید.
- یک مجموعه داده کوچک (۲۰۰ تا ۵۰۰ نمونه) از دادههای واقعی خود را برچسبگذاری کنید تا میزان خطای کالیبراسیون مدل را بسنجید.
- پیادهسازی لایه Platt scaling را برای تبدیل امتیازات خام به احتمالات واقعی در خط لوله استنتاج خود بگنجانید.
اما این چالشها تنها بخشی از معماری مدلهای تصمیمگیر است؛ برای درک بهتر نحوه مدیریت خطا در مقیاس صنعتی، تحلیل ما درباره لایههای معنایی دستی را بخوانید.




گفتگو