اگر امروز برای استقرار یک مدل هوش مصنوعی در محیط عملیاتی تصمیم میگیرید، باید بدانید که مدلهای کوچک محلی بسیار بیشتر از نسخههای ابری «بلوف» میزنند. طبق دادههای منتشر شده در ۱ اکتبر ۲۰۲۶، شکاف عمیقی در زمینه «اعتماد کاذب» (False Confidence) مشاهده شده است؛ یعنی تمایل مدل به ارائه پاسخ در شرایطی که اقدام درست، ارجاع سؤال به کاربر یا اعلام عدم توانایی در پاسخدهی است.
این موضوع برای توسعهدهندگان حیاتی است، زیرا قابلیت اطمینان در تولیدات صنعتی به این بستگی دارد که مدل محدودیتهای خود را بشناسد. مدلی که با اطمینان کامل دچار توهم (Hallucination) — شبیه دوستی که خاطرهای را کاملاً اشتباه اما با قاطعیت تعریف میکند — شود، بسیار خطرناکتر از مدلی است که صرفاً شکست میخورد. این چالش بررسی میکند که آیا اندازه مدل یا محیط میزبانی، تعیینکننده این خودآگاهی است.
زمینه و متدولوژی
همانطور که در تحلیلهای قبلی ما درباره امنیت مدلهای بازمتن اشاره کردیم، توازن بین دسترسی محلی و دقت خروجی همواره یک چالش بوده است. در این پژوهش، فرآیند محکزنی در دو محیط مجزا انجام شد: یک نردبان محلی (Local Ladder) و یک دسته ابری (Hosted Batch). نردبان محلی شامل ۸ مدل بود که هر کدام ۲۰۰ مورد را با دمای (Temperature) صفر روی یک لپتاپ پردازش کردند. برای اندازهگیری اعتماد کاذب، ۴۰ مورد غیرقابلپاسخ به هر مدل ارائه شد تا میزان تمایل آنها به حدس زدن بهجای اعتراف به نادانی سنجیده شود.
سیستم نمرهدهی از یک قانون سختگیرانه پیروی میکرد: پیشبینیها بر اساس بازه اطمینان ۹۵٪ ویلسون (Wilson 95% interval) به جای یک تخمین نقطهای ساده، به سه دسته HIT (موفق)، MISS (شکست) یا UNRESOLVED (حلنشده) تقسیم شدند. این روش تضمین میکند که نرخهای گزارششده مستقیماً از پاسخهای خام استخراج شده باشند و صرفاً استنباط نشده باشند.
بر اساس گزارش dev.to، نتایج نردبان محلی نشاندهنده شکست سیستماتیک در خوداصلاحی مدلهای با وزنهای باز (Open Weights) — یعنی مدلهایی که دستور پختشان علناً منتشر شده و نه فقط غذای آماده — بود:
- llama3.2:1b (۱.۲ میلیارد پارامتر): امتیاز ۲۱.۹٪؛ اعتماد کاذب ۸۷.۵٪ (بازه: ۷۳.۹–۹۴.۵٪).
- llama3.2:3b (۳.۲ میلیارد پارامتر): امتیاز ۶۹.۴٪؛ اعتماد کاذب ۸۰.۰٪ (بازه: ۶۵.۲–۸۹.۵٪).
- phi4-mini (۳.۸ میلیارد پارامتر): امتیاز ۸۶.۲٪؛ اعتماد کاذب ۹۲.۵٪ (بازه: ۸۰.۱–۹۷.۴٪).
- qwen3:4b (۴.۰ میلیارد پارامتر): امتیاز ۶۵.۶٪؛ اعتماد کاذب ۸۷.۵٪ (بازه: ۷۳.۹–۹۴.۵٪).
- gemma3:4b (۴.۳ میلیارد پارامتر): امتیاز ۸۲.۵٪؛ اعتماد کاذب ۸۰.۰٪ (بازه: ۶۵.۲–۸۹.۵٪).
- gemma4:e2b (۴.۶ میلیارد پارامتر): امتیاز ۸۱.۹٪؛ اعتماد کاذب ۹۵.۰٪ (بازه: ۸۳.۵–۹۸.۶٪).
- llama3.1:8b (۸.۰ میلیارد پارامتر): امتیاز ۸۸.۱٪؛ اعتماد کاذب ۷۷.۵٪ (بازه: ۶۲.۵–۸۷.۷٪).
- qwen3.5 (۹.۷ میلیارد پارامتر): امتیاز ۸۶.۹٪؛ اعتماد کاذب ۳۷.۵٪ (بازه: ۲۴.۲–۵۳.۰٪).
تنها مدل محلی بزرگتر، یعنی qwen3.5 با ۹.۷ میلیارد پارامتر، در بخش بزرگی از موارد غیرقابلپاسخ، بهدرستی ارجاع داد. برای سایر مدلها، حتی در خوشبینانهترین تخمینها (حد پایین ۶۲.۵٪)، آنها در بیش از نیمی از مواقع بهجای سکوت، پاسخ ساختگی دادند. نکته مهم این است که اندازه بهتنهایی پاسخگو نیست؛ مدل ۸ میلیاردی llama3.1 از نظر اعتماد کاذب تفاوتی با مدلهای ۳ میلیاردی نداشت.

عملکرد مدلهای ابری
در مقابل، دسته مدلهای ابری شامل هفت مدل (به علاوه مدل پیشفرض Kaggle)، در چندین مورد اعتماد کاذب تقریباً صفر را ثبت کردند. این شکاف خیرهکننده است: بالاترین حد بالای مدلهای ابری ۵۴.۲٪ است، در حالی که پایینترین حد پایین مدلهای محلی ۶۲.۵٪ است.
- gemini-3.7-flash (پیشفرض): امتیاز ۹۷.۵٪؛ اعتماد کاذب ۰.۰٪ (بازه ۰–۸.۸٪)؛ امتیاز Brier برابر با ۰.۰۲۰.
- gemini-3.8-flash: امتیاز ۹۵.۵٪؛ اعتماد کاذب ۰.۰٪ (بازه ۰–۸.۸٪)؛ امتیاز Brier برابر با ۰.۰۲۵.
- qwen3-235b-a22b: امتیاز ۹۱.۷٪؛ اعتماد کاذب ۱۰.۰٪ (بازه ۴.۰–۲۳.۱٪)؛ امتیاز Brier برابر با ۰.۱۰۴.
- gemma-4-26b: امتیاز ۸۷.۵٪؛ اعتماد کاذب ۲.۶٪ (بازه ۰.۵–۱۳.۵٪)؛ امتیاز Brier برابر با ۰.۰۳۲.
- claude-haiku-4.5: امتیاز ۸۶.۶٪؛ اعتماد کاذب ۳۵.۷٪ (بازه ۲۰.۷–۵۴.۲٪)؛ امتیاز Brier برابر با ۰.۱۶۵.
- gpt-oss-20b: امتیاز ۸۶.۲٪؛ اعتماد کاذب ۷.۵٪ (بازه ۲.۶–۱۹.۹٪)؛ امتیاز Brier برابر با ۰.۱۴۴.
- gpt-5.4-nano: امتیاز ۸۴.۴٪؛ اعتماد کاذب ۷.۵٪ (بازه ۲.۶–۱۹.۹٪)؛ امتیاز Brier برابر با ۰.۱۵۳.
- deepseek-r1: امتیاز ۶۵.۰٪؛ اعتماد کاذب ۰.۰٪ (بازه ۰–۱۱.۴٪)؛ امتیاز Brier برابر با ۰.۰۴۷.
مدلهای gemini-3.7-flash و gemini-3.8-flash هر دو نرخ اعتماد کاذب صفر را ثبت کردند، به این معنی که تمام موارد غیرقابلپاسخ را بهدرستی شناسایی و ارجاع دادند. حتی deepseek-r1 با وجود امتیاز کلی پایینتر (۶۵٪)، در شناسایی محدودیتهای خود بینقص بود. مدل Claude-Haiku-4.5 در میان مدلهای ابری یک استثنا بود و حد پایین آن بهسختی از ۲۰٪ (۲۰.۷٪) عبور کرد.
تله «باگهای زیرساختی»
بخش تکاندهنده این پژوهش، کشف «تله باگهای زیرساختی» است. پژوهشگر دریافت بسیاری از شکستهای مدلها در واقع ناشی از باگهای محیط اجرا (Harness) بود. سه دور «تست دود» (Smoke Rounds) مجزا نشان داد که فرمتهای پاسخ شل و خطاهای خروجی ساختاریافته، بهاشتباه به عنوان توهم مدل تفسیر میشدند.
برای مثال، خروجیهای ساختاریافته Gemini در برخی اشکال خاص، اشیاء خالی {} برمیگرداند که ابتدا در دو شکل تسک، امتیاز ۰٪ گرفت. اما زمانی که پرامپت به فرمت تایپینگ (Typing Format) تغییر یافت، امتیاز همین مدل در آن اشکال به ۹۷.۸٪ و ۱۰۰٪ جهش کرد. این نوسانات در خروجیها یادآور شکافهای خطرناکی است که در تطابق شناسهی مدل با خروجیهای ثابت مشاهده شده و میتواند حاکمیت بر مدلهای هوش مصنوعی را با چالش مواجه کند.
سایر موانع فنی شامل موارد زیر بود:
- محدودیتهای API: مدلهای استدلالی OpenAI دمای صفر را نمیپذیرند و الزاماً به
max_completion_tokensنیاز دارند. همچنین حالت سختگیرانه (Strict Mode) آنها هرگونه شیء باز (Open Object) را رد میکند. - محدودیتهای گرامری: مدل Anthropic فرمت مسیر ۲۰-ابزاری را رد کرد زیرا «گرامر کامپایلشده بیش از حد بزرگ است». این بدان معناست که ۶۰ مورد مسیر در این دسته برای Haiku، در واقع خطا بودند و نه پاسخ مدل.
- سقف توکن: مدل DeepSeek-R1 استدلالهای خود را در متن قابل مشاهده با بودجه ۵۱۲ توکنی انجام میدهد. در نتیجه، ۲۹.۵٪ از پاسخهای آن در میانه JSON قطع شد. این موارد به عنوان «غیرقابل تجزیه» (Unparseable) نمرهدهی شدند، زیرا این سقف توکن بخشی از شرایط اندازهگیری بود.
- محدودیت نرخ درخواست (Rate Limit): در یک اجرای تست، ۱۶۹ درخواست از ۲۰۰ درخواست DeepSeek بهدلیل فشار روی سرور رد شد. این مشکل با یک سیستم تلاش مجدد محدود (Bounded Retry) حل شد و خطاها در اجرای بعدی به ۱ مورد کاهش یافت.
این یافتهها نشان میدهد «هوش» یک مدل اغلب پشت لولهکشیهای API یا محیطهای محلی پنهان میشود. وقتی زیرساخت خراب است، مدل احمق به نظر میرسد؛ اما با اصلاح آن، توانایی واقعی مدل آشکار میشود. نمرهدهی مجدد نتایج تست دود تحت این قوانین جدید، امتیاز مسیر یکی از مدلها را از ۸۹٪ به ۸۳٪ تغییر داد.
پیشبینیهای حلنشده و گامهای بعدی
در حال حاضر چندین پیشبینی کلیدی بهدلیل عدم اجرای مدلهای پیشرو (Frontier) در حالتهای خاص، در وضعیت UNRESOLVED (حلنشده) مانده است. این موارد شامل این است که آیا حد پایین اعتماد کاذب یک مدل پیشرو از ۲۰٪ عبور میکند یا خیر، و اینکه آیا بهترین مدل محلی با اندازه ۴ میلیارد یا کمتر (مانند llama3.2:3b با تخمین نقطهای ۸۰٪) میتواند از طریق تست دقیق McNemar مدلهای پیشرو را شکست دهد.
علاوه بر این، رابطه بین امتیاز کلی تسک و نرخ اعتماد کاذب هنوز نامعلوم است. بازوی محلی بهتنها یک ضریب اسپیرمن (Spearman ρ) برابر با ۰.۴۹- (بازه ۰.۹۶- تا ۰.۴۴) را نشان میدهد که نتیجهای غیرقطعی است و نمیتوان با آن نتیجهگیری کرد.
برای یک توسعهدهنده، این بدان معناست که رفتار مدل اغلب تنها symptom یک یکپارچهسازی بد است. شما نمیتوانید به بنچمارکی اعتماد کنید که ارزیاب آن، سقف توکنها یا حالتهای سختگیرانه API را در نظر نگرفته باشد.
اینکه آیا این شکاف در صورت یکسانسازی تنظیمات استدلالی (Reasoning Settings) باقی میماند یا خیر، یک سؤال باز است. فاز بعدی تستها شامل یک اجرای کنترلشده تطبیقی خواهد بود تا مشخص شود برتری Gemini ناشی از بودجه استدلالی «پایین» آن است یا برتری ذاتی مدل. نتایج مدلهای پیشرو را دنبال کنید تا ببینید آیا بزرگترین مدلها این روند «بلوف نزدن» را حفظ میکنند یا در نهایت مانند نسخههای محلی کوچکتر، تسلیم اعتمادبهنفس کاذب میشوند.
گام بعدی شما
- هنگام ارزیابی مدلهای محلی، حتماً مجموعهای از سؤالات «غیرقابلپاسخ» را برای تست نرخ اعتماد کاذب اضافه کنید.
- پیش از نتیجهگیری درباره ضعف یک مدل، فرمتهای خروجی و محدودیتهای توکن API را بازبینی کنید.
- برای کاربردهای حساس، مدلهای ابری پیشرو را بهدلیل خودآگاهی بالاتر در شناسایی محدودیتها ترجیح دهید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما درباره تراشههای Blackwell مراجعه کنید.




گفتگو