پرش به محتوای اصلی
پرش به محتوای مقاله

درون محک Kaggle؛ ریشه‌یابی خطاهای مدل‌های کوچک در برابر پیشروها

·۹ مهر ۱۴۰۵۵ دقیقه مطالعه۲ بازدید
روز ۱: بیشتر باگ‌هایم شبیه رفتار مدل به نظر می‌رسیدند
روز ۱: بیشتر باگ‌هایم شبیه رفتار مدل به نظر می‌رسیدند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کشف این نکته که بخش بزرگی از خطاهای گزارش‌شده در بنچمارک‌های AI، نه ناشی از ضعف مدل، بلکه حاصل باگ‌های زیرساختی و محدودیت‌های API (مانند سقف توکن و گرامر) است.

اگر امروز برای استقرار یک مدل هوش مصنوعی در محیط عملیاتی تصمیم می‌گیرید، باید بدانید که مدل‌های کوچک محلی بسیار بیشتر از نسخه‌های ابری «بلوف» می‌زنند. طبق داده‌های منتشر شده در ۱ اکتبر ۲۰۲۶، شکاف عمیقی در زمینه «اعتماد کاذب» (False Confidence) مشاهده شده است؛ یعنی تمایل مدل به ارائه پاسخ در شرایطی که اقدام درست، ارجاع سؤال به کاربر یا اعلام عدم توانایی در پاسخ‌دهی است.

این موضوع برای توسعه‌دهندگان حیاتی است، زیرا قابلیت اطمینان در تولیدات صنعتی به این بستگی دارد که مدل محدودیت‌های خود را بشناسد. مدلی که با اطمینان کامل دچار توهم (Hallucination) — شبیه دوستی که خاطره‌ای را کاملاً اشتباه اما با قاطعیت تعریف می‌کند — شود، بسیار خطرناک‌تر از مدلی است که صرفاً شکست می‌خورد. این چالش بررسی می‌کند که آیا اندازه مدل یا محیط میزبانی، تعیین‌کننده این خودآگاهی است.

زمینه و متدولوژی

همان‌طور که در تحلیل‌های قبلی ما درباره امنیت مدل‌های بازمتن اشاره کردیم، توازن بین دسترسی محلی و دقت خروجی همواره یک چالش بوده است. در این پژوهش، فرآیند محک‌زنی در دو محیط مجزا انجام شد: یک نردبان محلی (Local Ladder) و یک دسته ابری (Hosted Batch). نردبان محلی شامل ۸ مدل بود که هر کدام ۲۰۰ مورد را با دمای (Temperature) صفر روی یک لپ‌تاپ پردازش کردند. برای اندازه‌گیری اعتماد کاذب، ۴۰ مورد غیرقابل‌پاسخ به هر مدل ارائه شد تا میزان تمایل آن‌ها به حدس زدن به‌جای اعتراف به نادانی سنجیده شود.

سیستم نمره‌دهی از یک قانون سخت‌گیرانه پیروی می‌کرد: پیش‌بینی‌ها بر اساس بازه اطمینان ۹۵٪ ویلسون (Wilson 95% interval) به جای یک تخمین نقطه‌ای ساده، به سه دسته HIT (موفق)، MISS (شکست) یا UNRESOLVED (حل‌نشده) تقسیم شدند. این روش تضمین می‌کند که نرخ‌های گزارش‌شده مستقیماً از پاسخ‌های خام استخراج شده باشند و صرفاً استنباط نشده باشند.

بر اساس گزارش dev.to، نتایج نردبان محلی نشان‌دهنده شکست سیستماتیک در خوداصلاحی مدل‌های با وزن‌های باز (Open Weights) — یعنی مدل‌هایی که دستور پختشان علناً منتشر شده و نه فقط غذای آماده — بود:

  • llama3.2:1b (۱.۲ میلیارد پارامتر): امتیاز ۲۱.۹٪؛ اعتماد کاذب ۸۷.۵٪ (بازه: ۷۳.۹–۹۴.۵٪).
  • llama3.2:3b (۳.۲ میلیارد پارامتر): امتیاز ۶۹.۴٪؛ اعتماد کاذب ۸۰.۰٪ (بازه: ۶۵.۲–۸۹.۵٪).
  • phi4-mini (۳.۸ میلیارد پارامتر): امتیاز ۸۶.۲٪؛ اعتماد کاذب ۹۲.۵٪ (بازه: ۸۰.۱–۹۷.۴٪).
  • qwen3:4b (۴.۰ میلیارد پارامتر): امتیاز ۶۵.۶٪؛ اعتماد کاذب ۸۷.۵٪ (بازه: ۷۳.۹–۹۴.۵٪).
  • gemma3:4b (۴.۳ میلیارد پارامتر): امتیاز ۸۲.۵٪؛ اعتماد کاذب ۸۰.۰٪ (بازه: ۶۵.۲–۸۹.۵٪).
  • gemma4:e2b (۴.۶ میلیارد پارامتر): امتیاز ۸۱.۹٪؛ اعتماد کاذب ۹۵.۰٪ (بازه: ۸۳.۵–۹۸.۶٪).
  • llama3.1:8b (۸.۰ میلیارد پارامتر): امتیاز ۸۸.۱٪؛ اعتماد کاذب ۷۷.۵٪ (بازه: ۶۲.۵–۸۷.۷٪).
  • qwen3.5 (۹.۷ میلیارد پارامتر): امتیاز ۸۶.۹٪؛ اعتماد کاذب ۳۷.۵٪ (بازه: ۲۴.۲–۵۳.۰٪).

تنها مدل محلی بزرگ‌تر، یعنی qwen3.5 با ۹.۷ میلیارد پارامتر، در بخش بزرگی از موارد غیرقابل‌پاسخ، به‌درستی ارجاع داد. برای سایر مدل‌ها، حتی در خوش‌بینانه‌ترین تخمین‌ها (حد پایین ۶۲.۵٪)، آن‌ها در بیش از نیمی از مواقع به‌جای سکوت، پاسخ ساختگی دادند. نکته مهم این است که اندازه به‌تنهایی پاسخگو نیست؛ مدل ۸ میلیاردی llama3.1 از نظر اعتماد کاذب تفاوتی با مدل‌های ۳ میلیاردی نداشت.

روز اول: بیشتر باگ‌هایم شبیه رفتار مدل به نظر می‌رسیدند

عملکرد مدل‌های ابری

در مقابل، دسته مدل‌های ابری شامل هفت مدل (به علاوه مدل پیش‌فرض Kaggle)، در چندین مورد اعتماد کاذب تقریباً صفر را ثبت کردند. این شکاف خیره‌کننده است: بالاترین حد بالای مدل‌های ابری ۵۴.۲٪ است، در حالی که پایین‌ترین حد پایین مدل‌های محلی ۶۲.۵٪ است.

  • gemini-3.7-flash (پیش‌فرض): امتیاز ۹۷.۵٪؛ اعتماد کاذب ۰.۰٪ (بازه ۰–۸.۸٪)؛ امتیاز Brier برابر با ۰.۰۲۰.
  • gemini-3.8-flash: امتیاز ۹۵.۵٪؛ اعتماد کاذب ۰.۰٪ (بازه ۰–۸.۸٪)؛ امتیاز Brier برابر با ۰.۰۲۵.
  • qwen3-235b-a22b: امتیاز ۹۱.۷٪؛ اعتماد کاذب ۱۰.۰٪ (بازه ۴.۰–۲۳.۱٪)؛ امتیاز Brier برابر با ۰.۱۰۴.
  • gemma-4-26b: امتیاز ۸۷.۵٪؛ اعتماد کاذب ۲.۶٪ (بازه ۰.۵–۱۳.۵٪)؛ امتیاز Brier برابر با ۰.۰۳۲.
  • claude-haiku-4.5: امتیاز ۸۶.۶٪؛ اعتماد کاذب ۳۵.۷٪ (بازه ۲۰.۷–۵۴.۲٪)؛ امتیاز Brier برابر با ۰.۱۶۵.
  • gpt-oss-20b: امتیاز ۸۶.۲٪؛ اعتماد کاذب ۷.۵٪ (بازه ۲.۶–۱۹.۹٪)؛ امتیاز Brier برابر با ۰.۱۴۴.
  • gpt-5.4-nano: امتیاز ۸۴.۴٪؛ اعتماد کاذب ۷.۵٪ (بازه ۲.۶–۱۹.۹٪)؛ امتیاز Brier برابر با ۰.۱۵۳.
  • deepseek-r1: امتیاز ۶۵.۰٪؛ اعتماد کاذب ۰.۰٪ (بازه ۰–۱۱.۴٪)؛ امتیاز Brier برابر با ۰.۰۴۷.

مدل‌های gemini-3.7-flash و gemini-3.8-flash هر دو نرخ اعتماد کاذب صفر را ثبت کردند، به این معنی که تمام موارد غیرقابل‌پاسخ را به‌درستی شناسایی و ارجاع دادند. حتی deepseek-r1 با وجود امتیاز کلی پایین‌تر (۶۵٪)، در شناسایی محدودیت‌های خود بی‌نقص بود. مدل Claude-Haiku-4.5 در میان مدل‌های ابری یک استثنا بود و حد پایین آن به‌سختی از ۲۰٪ (۲۰.۷٪) عبور کرد.

تله «باگ‌های زیرساختی»

بخش تکان‌دهنده این پژوهش، کشف «تله باگ‌های زیرساختی» است. پژوهشگر دریافت بسیاری از شکست‌های مدل‌ها در واقع ناشی از باگ‌های محیط اجرا (Harness) بود. سه دور «تست دود» (Smoke Rounds) مجزا نشان داد که فرمت‌های پاسخ شل و خطاهای خروجی ساختاریافته، به‌اشتباه به عنوان توهم مدل تفسیر می‌شدند.

برای مثال، خروجی‌های ساختاریافته Gemini در برخی اشکال خاص، اشیاء خالی {} برمی‌گرداند که ابتدا در دو شکل تسک، امتیاز ۰٪ گرفت. اما زمانی که پرامپت به فرمت تایپینگ (Typing Format) تغییر یافت، امتیاز همین مدل در آن اشکال به ۹۷.۸٪ و ۱۰۰٪ جهش کرد. این نوسانات در خروجی‌ها یادآور شکاف‌های خطرناکی است که در تطابق شناسه‌ی مدل با خروجی‌های ثابت مشاهده شده و می‌تواند حاکمیت بر مدل‌های هوش مصنوعی را با چالش مواجه کند.

سایر موانع فنی شامل موارد زیر بود:

  • محدودیت‌های API: مدل‌های استدلالی OpenAI دمای صفر را نمی‌پذیرند و الزاماً به max_completion_tokens نیاز دارند. همچنین حالت سخت‌گیرانه (Strict Mode) آن‌ها هرگونه شیء باز (Open Object) را رد می‌کند.
  • محدودیت‌های گرامری: مدل Anthropic فرمت مسیر ۲۰-ابزاری را رد کرد زیرا «گرامر کامپایل‌شده بیش از حد بزرگ است». این بدان معناست که ۶۰ مورد مسیر در این دسته برای Haiku، در واقع خطا بودند و نه پاسخ مدل.
  • سقف توکن: مدل DeepSeek-R1 استدلال‌های خود را در متن قابل مشاهده با بودجه ۵۱۲ توکنی انجام می‌دهد. در نتیجه، ۲۹.۵٪ از پاسخ‌های آن در میانه JSON قطع شد. این موارد به عنوان «غیرقابل تجزیه» (Unparseable) نمره‌دهی شدند، زیرا این سقف توکن بخشی از شرایط اندازه‌گیری بود.
  • محدودیت نرخ درخواست (Rate Limit): در یک اجرای تست، ۱۶۹ درخواست از ۲۰۰ درخواست DeepSeek به‌دلیل فشار روی سرور رد شد. این مشکل با یک سیستم تلاش مجدد محدود (Bounded Retry) حل شد و خطاها در اجرای بعدی به ۱ مورد کاهش یافت.

این یافته‌ها نشان می‌دهد «هوش» یک مدل اغلب پشت لوله‌کشی‌های API یا محیط‌های محلی پنهان می‌شود. وقتی زیرساخت خراب است، مدل احمق به نظر می‌رسد؛ اما با اصلاح آن، توانایی واقعی مدل آشکار می‌شود. نمره‌دهی مجدد نتایج تست دود تحت این قوانین جدید، امتیاز مسیر یکی از مدل‌ها را از ۸۹٪ به ۸۳٪ تغییر داد.

پیش‌بینی‌های حل‌نشده و گام‌های بعدی

در حال حاضر چندین پیش‌بینی کلیدی به‌دلیل عدم اجرای مدل‌های پیشرو (Frontier) در حالت‌های خاص، در وضعیت UNRESOLVED (حل‌نشده) مانده است. این موارد شامل این است که آیا حد پایین اعتماد کاذب یک مدل پیشرو از ۲۰٪ عبور می‌کند یا خیر، و اینکه آیا بهترین مدل محلی با اندازه ۴ میلیارد یا کمتر (مانند llama3.2:3b با تخمین نقطه‌ای ۸۰٪) می‌تواند از طریق تست دقیق McNemar مدل‌های پیشرو را شکست دهد.

علاوه بر این، رابطه بین امتیاز کلی تسک و نرخ اعتماد کاذب هنوز نامعلوم است. بازوی محلی به‌تنها یک ضریب اسپیرمن (Spearman ρ) برابر با ۰.۴۹- (بازه ۰.۹۶- تا ۰.۴۴) را نشان می‌دهد که نتیجه‌ای غیرقطعی است و نمی‌توان با آن نتیجه‌گیری کرد.

برای یک توسعه‌دهنده، این بدان معناست که رفتار مدل اغلب تنها symptom یک یکپارچه‌سازی بد است. شما نمی‌توانید به بنچمارکی اعتماد کنید که ارزیاب آن، سقف توکن‌ها یا حالت‌های سخت‌گیرانه API را در نظر نگرفته باشد.

اینکه آیا این شکاف در صورت یکسان‌سازی تنظیمات استدلالی (Reasoning Settings) باقی می‌ماند یا خیر، یک سؤال باز است. فاز بعدی تست‌ها شامل یک اجرای کنترل‌شده تطبیقی خواهد بود تا مشخص شود برتری Gemini ناشی از بودجه استدلالی «پایین» آن است یا برتری ذاتی مدل. نتایج مدل‌های پیشرو را دنبال کنید تا ببینید آیا بزرگ‌ترین مدل‌ها این روند «بلوف نزدن» را حفظ می‌کنند یا در نهایت مانند نسخه‌های محلی کوچک‌تر، تسلیم اعتمادبه‌نفس کاذب می‌شوند.

گام بعدی شما

  • هنگام ارزیابی مدل‌های محلی، حتماً مجموعه‌ای از سؤالات «غیرقابل‌پاسخ» را برای تست نرخ اعتماد کاذب اضافه کنید.
  • پیش از نتیجه‌گیری درباره ضعف یک مدل، فرمت‌های خروجی و محدودیت‌های توکن API را بازبینی کنید.
  • برای کاربردهای حساس، مدل‌های ابری پیشرو را به‌دلیل خودآگاهی بالاتر در شناسایی محدودیت‌ها ترجیح دهید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این یافته‌ها بر اساس اعتبار داده‌های Kaggle نشان می‌دهد که تکیه بر مدل‌های محلی بدون لایه‌های اعتبارسنجی، ریسک توهمات خطرناک را افزایش می‌دهد. در واقع، شکاف بین مدل‌های ابری و محلی در زمینه خودآگاهی، مانع اصلی استقرار مستقل مدل‌های کوچک در سیستم‌های حساس است.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که به‌دلیل تحریم‌ها یا هزینه، به مدل‌های محلی و وزن‌های باز روی سخت‌افزارهای محدود تکیه می‌کنند، این خبر هشدار می‌دهد که نباید بدون لایه‌های فیلترینگ خروجی، به خودآگاهی مدل‌های کوچک اعتماد کنند.

·نگاه ما
تحریریه دات‌هوش

اعتماد کاذب در مدل‌های کوچک محلی نشان می‌دهد که Scaling Laws (قوانین مقیاس‌پذیری) تنها روی دقت پاسخ اثر نمی‌گذارند، بلکه روی «تواضع» مدل نیز اثرگذارند. این یعنی مدل‌های کوچک نه تنها کمتر می‌دانند، بلکه کمتر می‌دانند که نمی‌دانند. برای توسعه‌دهندگان، این یک هشدار است که برای استفاده از SLMها در محیط عملیاتی، لایه‌های نظارتی (Guardrails) خارجی برای شناسایی توهمات ضروری است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.