پرش به محتوای اصلی
پرش به محتوای مقاله

شکاف کالیبراسیون در مدل Jev؛ چرا امتیازات اطمینان در محیط عملیاتی شکست می‌خورند؟

·۱ مهر ۱۴۰۵۳ دقیقه مطالعه
تحلیل
جیو نمی‌تواند کالیبره شود
جیو نمی‌تواند کالیبره شود
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

افشای عدم توانایی مدل Jev در حفظ کالیبراسیون در برابر تغییر توزیع داده‌ها و شکست آن در تشخیص احتمالات بدیهی (مانند پرتاب سکه) راه‌اندازی می‌کند.

اعتماد به امتیاز اطمینان یک مدل به‌عنوان یک احتمال مطلق، می‌تواند منجر به شکست‌های سیستمی در استقرار هوش مصنوعی شود. این هشدار محوریت تحلیل فنی ۲۳ سپتامبر ۲۰۲۶ در وب‌سایت alexmolas.com بود که ادعاهای بنیادین شرکت TypeSafe درباره کالیبراسیون مدل Jev را به چالش کشید. Jev به‌عنوان اولین «مدل سیستم یک» (System One Model) از سوی TypeSafe معرفی شده است.

زمینه و پیاده‌سازی

مدل Jev تغییری بنیادین در خروجی مدل‌ها ایجاد کرده است. این مدل به‌جای تولید متن‌های سنتی، ورودی‌های بدون ساختار را می‌گیرد و تصمیماتی تایپ‌شده (Typed Decisions) از میان مجموعه‌ای از خروجی‌های پیش‌تعریف‌شده برمی‌گرداند که هر کدام یک احتمال متصل به خود دارند.

همان‌طور که در پوشش پیشین ما درباره نحوه استخراج احتمالات از مدل‌های زبانی (LLMs) توسط Jevper اشاره کردیم، تفاوت کلیدی Jev در این است که به‌جای متن خام، تصمیمات دسته‌بندی‌شده را همراه با احتمالات متصل ارائه می‌دهد. طبق گزارش نویسنده، این قابلیت برای بسیاری از توسعه‌دهندگان یک مزیت بزرگ است؛ زیرا امکان طبقه‌بندی (Classification) را بدون نیاز به جمع‌آوری مجموعه‌داده‌های عظیم آموزشی در ابتدا فراهم می‌کند.

برخلاف مدل BERT که تنظیم دقیق (Fine-tuning) شده و تنها برای تکلیفی خاص که روی آن آموزش دیده مفید است و به داده‌های قابل توجهی نیاز دارد، Jev به‌عنوان یک طبقه‌بندی‌کننده جهانی عمل می‌کند. شما می‌توانید آن را فوراً روی هر مسئله طبقه‌بندی اعمال کنید و نتایج معقولی بگیرید.

شکاف کالیبراسیون

با این حال، یک شکاف جدی در کالیبراسیون وجود دارد. TypeSafe ادعا می‌کند Jev با استفاده از «یادگیری تقویتی برای تصمیمات کالیبره‌شده» (RLCD) آموزش دیده است. آن‌ها این ابزار را با این شعار بازاریابی می‌کنند که «تمام پاسخ‌ها با احتمالات کالیبره‌شده و امتیازات اطمینان همراه هستند». اما بر اساس این تحلیل، کالیبراسیون (Calibration) یک ویژگی ایستا در مدل نیست، بلکه رابطه‌ای بین مدل و یک توزیع خاص از داده‌ها است.

از نظر ریاضی، یک مدل زمانی کالیبره است که برای هر احتمال پیش‌بینی‌شده $p$، احتمال واقعی کلاس مثبت با توجه به آن پیش‌بینی، برابر با $p$ باشد. این رابطه به‌صورت $P(Y = 1 \mid \hat{p} = p) = p$ بیان می‌شود. به‌طور شهودی، اگر Jev برای گروهی از ایمیل‌ها احتمال spam_probability=0.7 را پیش‌بینی کند، باید تقریباً ۷۰٪ از آن ایمیل‌ها واقعاً هرزنامه باشند.

تحلیل مذکور سه نقطه ضعف اساسی را برمی‌شمارد:

  • تغییر توزیع (Distribution Shift): مدلی که روی داده‌های داخلی TypeSafe کالیبره شده، ممکن است روی داده‌های عملیاتی خاص یک مشتری کاملاً کالیبره نباشد. شرکت‌های مختلف ممکن است تعریف «هرزنامه» را یکسان بدانند، اما توزیع داده‌های آن‌ها متفاوت باشد.
  • خروجی‌های ایستا: Jev برای یک پرامپت یکسان، فارغ از توزیع داده‌های زیربنایی کاربر، احتمال یکسانی ارائه می‌دهد؛ این بدان معناست که مدل نمی‌تواند به‌صورت جهانی کالیبره باشد.
  • شکست‌های منطقی: شواهدی نشان می‌دهد Jev برای پرتاب یک سکه عادلانه، احتمال ۰.۹۲ را برای «شیر» گزارش کرده است، در حالی که احتمال واقعی (۰.۵) صراحتاً در متن پرامپت ذکر شده بود.

این شکست فراتر از یک تغییر توزیع ساده است و نشان‌دهنده یک گسست بنیادین در نحوه مدیریت احتمالات شناخته‌شده توسط مدل است. تحلیل اشاره می‌کند مدل‌های دیگری مانند Noul در مسائل مشابه، کالیبراسیون بهتری نسبت به Choice دارند که این موضوع معنای «احتمالات کالیبره‌شده» را پیچیده‌تر می‌کند.

برای مهندسان، این یافته فرض بنیادین استفاده از Jev در سیستم‌های مبتنی بر آستانه (Threshold-based) را تغییر می‌دهد. اگر برنامه شما به هزینه‌های مورد انتظار یا ترکیب چندین مدل وابسته است، نمی‌توانید به اعداد خام ارائه شده توسط مدل در حالت پیش‌فرض اعتماد کنید.

نویسنده پیشنهاد می‌کند خروجی‌های Jev را به‌جای احتمال واقعی، به‌عنوان امتیازاتی با کیفیت بالا در نظر بگیرید که نمونه‌ها را به‌خوبی رتبه‌بندی می‌کنند. برای رسیدن به کالیبراسیون واقعی، توسعه‌دهندگان باید روش Platt scaling را روی امتیازات Jev و با استفاده از مجموعه کوچکی از نمونه‌های برچسب‌دار از داده‌های عملیاتی خود پیاده‌سازی کنند.

بازکالیبره کردن مدل نسبتاً ارزان است و اغلب تنها به چند صد نمونه برچسب‌دار نیاز دارد تا امتیازات با نتایج دنیای واقعی همسو شوند. این چرخش از «احتمال آماده برای استفاده» به «امتیاز و بازکالیبراسیون»، برای هر استقرار در محیط‌های حساس و پرمخاطره ضروری است.

گام بعدی شما

  • اگر از Jev برای تصمیم‌گیری‌های خودکار استفاده می‌کنید، خروجی‌ها را به‌جای احتمال، به‌عنوان رتبه (Rank) تحلیل کنید.
  • یک مجموعه داده کوچک (۲۰۰ تا ۵۰۰ نمونه) از داده‌های واقعی خود را برچسب‌گذاری کنید تا میزان خطای کالیبراسیون مدل را بسنجید.
  • پیاده‌سازی لایه Platt scaling را برای تبدیل امتیازات خام به احتمالات واقعی در خط لوله استنتاج خود بگنجانید.

اما این چالش‌ها تنها بخشی از معماری مدل‌های تصمیم‌گیر است؛ برای درک بهتر نحوه مدیریت خطا در مقیاس صنعتی، تحلیل ما درباره لایه‌های معنایی دستی را بخوانید.

چرا این موضوع مهم است؟

این موضوع اعتبار ادعاهای شرکت‌های توسعه‌دهنده درباره «اطمینان مدل» را زیر سؤال می‌برد. تکیه بر احتمالات کالیبره‌نشده در سیستم‌های مالی یا پزشکی می‌تواند منجر به تصمیمات اشتباه با ریسک بالا شود.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که از مدل‌های طبقه‌بندی آماده برای کاهش هزینه جمع‌آوری داده استفاده می‌کنند، این هشدار ضروری است تا به‌جای اعتماد به اعداد خام، لایه‌های بازکالیبراسیون محلی را پیاده کنند.

·نگاه ما
تحریریه دات‌هوش

ادعای «کالیبراسیون جهانی» در مدل‌های هوش مصنوعی زاینده بیشتر یک بازاریابی است تا واقعیت ریاضی. این تحلیل ثابت می‌کند که حتی مدل‌های تخصصی تصمیم‌گیر نیز نمی‌توانند از اثر توزیع داده‌های کاربر (Data Distribution) فرار کنند. در عمل، هر مهندسی که از این مدل‌ها در سیستم‌های حساس استفاده می‌کند، باید لایه‌ای از اعتبارسنجی آماری را پس از خروجی مدل اضافه کند تا از فجایع عملیاتی جلوگیری شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.