پرش به محتوای اصلی
پرش به محتوای مقاله

مدل‌های کوچک در عیب‌یابی خطوط داده از مدل‌های پرچم‌دار پیشی گرفتند

·۲۰ مهر ۱۴۰۵۷ دقیقه مطالعه
جستجوی داده‌های گمشده: ارزیابی مدل‌های زبانی در تشخیص خطاهای خط لوله داده
جستجوی داده‌های گمشده: ارزیابی مدل‌های زبانی در تشخیص خطاهای خط لوله داده
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

اثبات اینکه مدل‌های زبانی کوچک (SLM) در شناسایی «پرونده‌های سرد» داده‌ای، نرخ توهم کمتری نسبت به مدل‌های پرچم‌دار دارند و دستورالعمل‌های سخت‌گیرانه (Rulebook) اثر اندازه مدل را خنثی می‌کنند.

ارزان‌ترین مدل‌های هوش مصنوعی، صادقانه‌ترین پاسخ‌ها را در لحظاتی می‌دهند که شواهد به‌طور کامل ناپدید شده‌اند. طبق گزارشی که در ۱۱ اکتبر ۲۰۲۶ منتشر شد، مدل GPT-6 Luna — مدل کوچک از جدیدترین نسل GPT — بدون هیچ حدس‌زدنی در پرونده‌های «سرد» (Cold Cases)، به صحت ۱۰۰ درصدی رسید، در حالی که هزینه هر ۱۰۰۰ بررسی آن تنها ۰.۱۸ دلار بود.

هر مهندس داده با این کابوس دست‌وپنجه نرم می‌کند: رکوردی در CRM وجود دارد اما در داشبورد ناپدید شده است. تصور کنید یکی از کارکنان بخش فروش گزارش دهد که مشتری‌ای مثل «شرکت آمبرلا» (Umbrella Corp) در CRM هست اما در داشبورد دیده نمی‌شود و بخواهد تا پایان روز مشکل حل شود. یافتن این رکورد مستلزم جست‌وجو در یک خط لوله (Pipeline) — شبیه به یک نوار نقاله صنعتی که داده‌ها را می‌گیرد، نام‌ها را استخراج می‌کند، موارد تکراری را ادغام می‌کند و در نهایت فیلتر می‌کند — است. بررسی‌کننده باید در میان لاگ‌هایی بگردد که نیمی از آن‌ها احتمالاً سه‌شنبه گذشته پاک شده‌اند.

در حالی که بسیاری از تیم‌ها می‌خواهند این تیکت‌ها را به یک مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — بسپارند، ریسک واقعی ناتوانی مدل در یافتن تطابق نیست، بلکه تمایل آن به حدس زدن در غیاب شواهد است. یک بررسی‌کننده بد، عبارت «Umbrella Corporation Inc» را در جدول نهایی می‌بیند و فرض می‌کند همان «Umbrella Corp» گمشده است؛ تیکت را می‌بندد و دو هفته بعد متوجه می‌شود داشبورد اعداد شرکت کاملاً متفاوتی را نشان می‌دهد. این نوع خطاها یادآور چالش‌های تایید منطق معیوب در تست‌های خودکار است که در آن مدل‌ها به‌جای شناسایی نقص، بر صحت فرضیات اشتباه صحه می‌گذارند.

همان‌طور که در تحلیل قبلی ما درباره‌ی استفاده CodeSmith از Python REPL برای رفع خطاهای محاسباتی اشاره کردیم، این چالش جدید روی نوع متفاوتی از شکست تمرکز دارد: «توهمات شباهت». در این سناریوها، مدل ممکن است نامی مشابه را ببیند و فرض کند همان موجودیت گمشده است، حتی اگر لاگ‌ها هیچ مدرکی برای این هویت ارائه ندهند.

چارچوب «داده‌های من کجا رفتند؟»

این محک ۱۵ سناریوی کوچک از خط لوله را شبیه‌سازی می‌کند. در هر مورد، نویسنده سرنوشت واقعی یک رکورد شرکتی را تعیین می‌کند. برای آزمایش احتیاط مدل‌ها، مقادیر متفاوتی از داده‌های لاگ حذف شده‌اند — گاهی هیچ، گاهی چند ردیف و گاهی تقریباً همه — تا «پرونده‌های سردی» ایجاد شود که در آن‌ها تنها پاسخ درست «نمی‌توانم تشخیص دهم» است.

دسته‌بندی احکام

مدل‌ها می‌توانند به شش حکم مختلف برسند که شبیه به کار یک کارآگاه است:

  • هرگز بارگذاری نشده: رکورد اصلاً وارد سیستم نشده است.
  • نام قابل خواندن نبود: رکورد وارد شد، اما نامش خوانده نشد.
  • فیلتر شد: رکورد توسط یک قانون تجاری (Business Rule) حذف شد.
  • ادغام اشتباه: سرقت هویت؛ رکورد به اشتباه به شرکت دیگری چسبانده شد.
  • با شناسه‌ای متفاوت: رکورد زنده است اما با یک نام مستعار زندگی می‌کند.
  • نمی‌توان تشخیص داد: پرونده سرد است و لاگ‌های باقی‌مانده برای حکم دادن کافی نیستند.

برای تضمین صداقت، این محک شامل «پرونده‌های دوقلو» است. این موارد لاگ‌های کاملاً یکسانی دارند، اما در یکی، نام مشابه همان شرکت درست است و در دیگری، شرکتی متفاوت با نامی مشابه است. در هر دو حالت، تنها پاسخ صادقانه «نمی‌توان تشخیص داد» است.

عملکرد در برابر قیمت

در این آزمایش طیفی از مدل‌ها، از مدل‌های اقتصادی مثل Claude Haiku 5.5 و Gemini 3.5 Flash-Lite تا مدل‌های گران‌قیمت Claude Sonnet 5 و GPT-6 Sol شرکت داشتند. نتایج این باور را که قیمت بالاتر به معنای احتیاط بیشتر است، به چالش می‌کشد.

بررسی عملکرد مدل‌های زبانی بزرگ در تشخیص خطاهای خطوط داده

GPT-6 Luna به عنوان پیشرو در بهره‌وری ظاهر شد و بدون هیچ قانون خاصی، نرخ حدس‌زنی صفر و صحت ۱۰۰ درصدی را حفظ کرد. در مقابل، Claude Sonnet 5 که مدل مرجع برای ساخت این محک بود، در ۳۰ درصد پرونده‌های سرد به صورت غریزی حدس زد.

مدل‌های Qwen 3 Next 80B و Gemini 3.5 Flash-Lite در زمینه احتیاط به‌شدت ضعیف بودند و به ترتیب در ۵۹ و ۴۵ درصد موارد حدس زدند. جالب است که Gemma 4 31B صحت بالایی (۹۹٪) داشت اما کندترین بود و در میزبانی Kaggle برای هر بررسی نزدیک به ۴۰ ثانیه زمان برد.

معیارهای تفصیلی مدل‌ها

بر اساس مستندات، هر مدل ۱۰۷ بررسی را در هر مسیر از طریق Model Proxy کگل انجام داد. ۱۵ مورد به ۳۳ نسخه با دسترسی‌های متفاوت به لاگ تبدیل شدند و سخت‌ترین موارد تا ۵ بار تکرار شدند. از این میان، ۴۴ مورد پرونده سرد بودند:

  • GPT-6 Luna: ۰.۱۸ دلار هر ۱ هزار بررسی | سرعت ۲.۴ ثانیه | حدس‌زنی ۰٪ | صحت ۱۰۰٪ (بدون قانون).
  • Claude Haiku 5.5: ۰.۴۳ دلار هر ۱ هزار بررسی | سرعت ۳.۰ ثانیه | حدس‌زنی ۷٪ | صحت ۹۷٪ (بدون قانون).
  • Qwen 3 Next 80B: ۰.۴۶ دلار هر ۱ هزار بررسی | سرعت ۱۰.۰ ثانیه | حدس‌زنی ۵۹٪ | صحت ۵۰٪ (بدون قانون).
  • Gemini 3.5 Flash-Lite: ۰.۸۸ دلار هر ۱ هزار بررسی | سرعت ۰.۹ ثانیه | حدس‌زنی ۴۵٪ | صحت ۷۰٪ (بدون قانون).
  • Gemma 4 31B: ۱.۱۸ دلار هر ۱ هزار بررسی | سرعت ۳۷.۷ ثانیه | حدس‌زنی ۰٪ | صحت ۹۹٪ (بدون قانون).
  • GPT-6 Sol: ۲.۸۰ دلار هر ۱ هزار بررسی | سرعت ۱.۸ ثانیه | حدس‌زنی ۰٪ | صحت ۹۶٪ (بدون قانون).
  • Claude Sonnet 5: ۶.۰۷ دلار هر ۱ هزار بررسی | سرعت ۲.۶ ثانیه | حدس‌زنی ۳۰٪ | صحت ۸۷٪ (بدون قانون).
  • Gemini 3.7 Flash: ۷.۱۰ دلار هر ۱ هزار بررسی | سرعت ۶.۹ ثانیه | حدس‌زنی ۹٪ | صحت ۹۰٪ (بدون قانون).

قدرت دفترچه قوانین

بر اساس بررسی‌ها، تکان‌دهنده‌ترین یافته این است که چند پاراگراف دستورالعمل — یک «دفترچه قانون» — می‌تواند عادت حدس‌زنی تقریباً هر مدلی را خنثی کند. وقتی به مدل‌ها گفته شد حدس نزنند و دقیقاً ردیف لاگ را به عنوان مدرک ذکر کنند، نرخ حدس‌زنی ۷ مدل از ۸ مدل به صفر رسید.

برای Qwen 3 Next 80B، این دفترچه نرخ حدس‌زنی را از ۵۹٪ به ۷٪ رساند. این تغییر باعث شد Claude Haiku 5.5 با وجود اینکه ۱۴ برابر ارزان‌تر است، عملکرد Claude Sonnet 5 را شبیه‌سازی کند. الزام به اشاره به یک ردیف خاص از لاگ حیاتی است؛ در زمان توسعه، حتی با وجود دفترچه قانون، اگر الزام به ذکر ردیف حذف می‌شد، Sonnet همچنان در ۴.۵ درصد موارد حدس می‌زد.

حالت‌های رایج شکست

حتی مدل‌های رده‌بالا دچار خطاهای انسانی شدند. Gemini 3.7 Flash و Flash-Lite به‌طور مداوم فقدان داده را به گردن فیلترها می‌انداختند و «ادغام بد» (Bad Merge) را که زودتر در لاگ‌ها رخ داده بود، نادیده می‌گرفتند. این نشان می‌دهد مدل‌ها تمایل دارند لاگ‌ها را از پایین به بالا بخوانند و در اولین خطای یافت‌شده متوقف شوند. این نوع تحلیل‌های دقیق بر روی لاگ‌ها و شناسایی الگوهای خطا، شباهت زیادی به قابلیت‌های جدید Gemini 2.5 در بازبینی Unlearning دارد که برای شناسایی کدهای گمراه‌کننده طراحی شده است.

مدل Qwen نقص متفاوتی داشت: فرض می‌کرد اگر رکوردی در یک لاگ ناقص نباشد، هرگز وجود نداشته است. این مدل دستورات صریح پرامپت را که می‌گفت «نبودِ ردیف در یک لاگ ناقص چیزی را ثابت نمی‌کند» نادیده گرفت و نتیجه گرفت رکورد هرگز بارگذاری نشده است، در حالی که شواهد خلاف آن را می‌گفت.

هزینه احتیاط بیش از حد

در حالی که حدس زدن خطرناک است، احتیاط بیش از حد نیز می‌تواند غیربهره‌ور باشد. GPT-6 Sol هرگز حدس نزد، اما گاهی ادعا کرد «نمی‌تواند تشخیص دهد»، حتی وقتی یک تطابق ساده در شماره ثبت (Registry Number) وجود داشت. در محیط عملیاتی، این منفی‌های کاذب تیکت را دوباره به میز مهندس انسان برمی‌گردانند.

این نتایج نشان می‌دهد استقرار ایده‌آل، استفاده از گران‌ترین مدل نیست، بلکه ترکیب یک مدل ارزان و توانمند با یک دفترچه قانون سخت‌گیرانه است. این محک ثابت می‌کند برای حسابرسی‌های روتین خط لوله، «غریزه» یک مدل کوچک مثل Luna اغلب قابل‌اعتمادتر از «استدلال» یک مدل پرچم‌دار است. جالب است که Gemma 4 31B پس از اعمال دفترچه قانون، عملکرد بدتری نسبت به حالت بدون قانون داشت.

در ادامه، این محک تکامل خواهد یافت تا به مدل‌ها اجازه دهد به‌جای دریافت یک بسته حجیم از داده‌ها، به‌طور فعال لاگ‌های خاصی را درخواست کنند. این کار آزمایش می‌کند که آیا مدل‌ها می‌توانند به‌طور استراتژیک به دنبال خطاهای ادغام بگردند، پیش از آنکه به‌سادگی تقصیر را به گردن فیلترها بیندازند.

گام بعدی شما

  • اگر از مدل‌های گران‌قیمت برای تحلیل لاگ استفاده می‌کنید، یک مدل کوچک‌تر (SLM) را با الزام به «ذکر ردیف دقیق مدرک» تست کنید.
  • در پرامپت‌های خود صراحتاً ذکر کنید که «نبودِ داده در لاگ‌های ناقص به معنای عدم وجود رکورد نیست» تا از خطاهای مدل‌های چینی مثل Qwen جلوگیری کنید.
  • برای کاهش هزینه‌های استنتاج، مدل‌های خانواده Flash یا Luna را جایگزین مدل‌های Pro کنید و تفاوت نرخ توهم را بسنجید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این یافته‌ها بر اساس تجربه عملی در محیط‌های تولیدی نشان می‌دهد که هزینه استنتاج را می‌توان بدون کاهش صحت، تا چندین برابر کاهش داد. اعتبار این نتایج از تست روی مدل‌های متنوع در محیط ایزوله کگل تأیید شده است.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که با محدودیت بودجه برای APIهای گران‌قیمت مواجه‌اند، این خبر نویدبخش است؛ چراکه مدل‌های ارزان‌تر با پرامپت‌نویسی دقیق، همان کیفیت عیب‌یابی را ارائه می‌دهند.

·نگاه ما
تحریریه دات‌هوش

این نتایج فرضیه رایج مبنی بر اینکه «مدل‌های بزرگ‌تر لزوماً استدلال دقیق‌تری دارند» را در کارهای تخصصیِ بازبینی داده به چالش می‌کشد. در واقع، مدل‌های کوچک‌تر به دلیل عدم تمایل به «تلاش برای خوش‌سرویس بودن» (Sycophancy)، در مواجهه با عدم قطعیت صادقانه‌تر عمل می‌کنند. استراتژی بهینه برای سازمان‌ها اکنون تغییر کرده است: به‌جای خرید توان پردازشی بیشتر، باید روی مهندسی دقیق‌ترِ دستورالعمل‌های محدودکننده سرمایه‌گذاری کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.