پرش به محتوای اصلی
پرش به محتوای مقاله

دقت GPT-4o در تبدیل متن به SQL از ۸۶٪ به ۶٪ سقوط کرد

·۲۶ تیر ۱۴۰۵۱ دقیقه مطالعه
عوامل تبدیل متن به SQL که در پایگاه‌های داده واقعی تولید دوام می‌آورند
عوامل تبدیل متن به SQL که در پایگاه‌های داده واقعی تولید دوام می‌آورند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

ارائه نخستین محک (Benchmark) که تفاوت فاحش میان عملکرد مدل‌ها در داده‌های ساده‌شده (Toy) و داده‌های واقعی سازمانی را با اعداد دقیق و تکان‌دهنده افشا می‌کند.

اگر امروز بر اساس بنچمارک‌های آکادمیک به قابلیت‌های SQL مدل‌های زبانی اعتماد می‌کنید، احتمالاً در محیط عملیاتی با یک شوک مواجه خواهید شد. داده‌های جدید نشان می‌دهند که فاصله میان دموهای جذاب و واقعیت‌های سختِ دیتابیس‌های سازمانی، بسیار عمیق‌تر از آن است که تصور می‌شد.

در نوامبر ۲۰۲۴، آزمایشگاه XLang Lab محک Spider 2.0 را منتشر کرد. این ابزار دقیقاً همان نقطه‌ای را هدف قرار داده که مدل‌های زبانی در آن «بلوف» می‌زنند: تفاوت میان داده‌های ساده‌شده و محیط‌های تولیدی واقعی. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی توهمات مدل‌های استدلالی اشاره کردیم، مدل‌ها تمایل دارند الگوهای ساده را با تخصص اشتباه بگیرند.

برای سال‌ها، صنعت بر پایه Spider 1.0 بود؛ مجموعه‌ای از طرح‌های ساده که صحت اجرای مدل‌ها را به بالای ۸۵٪ می‌رساند. همین موضوع باعث شد بسیاری از پلتفرم‌ها دکمه‌های «گفتگو با داده‌هایتان» را اضافه کنند، با این فرض که شکاف استدلالی بسته شده است. اما طبق گزارش AI Tech Connect، واقعیت در محیط‌های عملیاتی متفاوت است:

  • بازخوردهای مدل‌های کلاس GPT-4o در محیط‌های عامل‌محور (Agentic) از ۸۶.۶٪ در نسخه اول به تنها ۶.۰٪ در Spider 2.0 سقوط کرد.
  • مدل o1-preview — که در زمان مطالعه، قدرتمندترین مدل استدلالی (Reasoning Model) — شبیه شطرنج‌بازی است که چند حرکت جلوتر را می‌بیند اما در برابر پیچیدگی‌های واقعی دیتابیس، عملکردش از ۹۱.۲٪ به ۲۱.۳٪ رسید.

این سقوط آزاد ثابت می‌کند مشکل از نبودِ هوش خام در مدل‌ها نیست، بلکه ماهیت پرسش‌هاست. انتقال از داده‌های «اسباب‌بازی» به محیط‌های سازمانی، پیچیدگی‌هایی در منطق و ساختار ایجاد می‌کند که عامل‌های (Agents) فعلی نمی‌توانند به‌صورت خودکار آن‌ها را مدیریت کنند. در همین راستا، برخی تحلیل‌گران معتقدند که استفاده از داده‌های سنتتیک تنها راه برای مقیاس‌پذیری و آموزش دقیق‌تر این عامل‌ها در مواجهه با پیچیدگی‌های واقعی است.

برای معماران داده، این یعنی مهندسی پرامپت (Prompt Engineering) — که شبیه هنر سؤال درست پرسیدن از یک مشاور است — برای ساخت عامل‌های SQL در محیط تولید کافی نیست. شما نمی‌توانید به امتیازات لیدربورد اعتماد کنید اگر آن امتیازها بر اساس مجموعه‌های داده ساده‌شده باشد؛ باید مدل را دقیقاً با «آشفتگی‌های» واقعی دیتابیس خودتان بسنجید. برای مقابله با این چالش، ابزارهایی نظیر sqlsure برای شناسایی خطاهای معنایی توسعه یافته‌اند تا با استفاده از بازرسهای قطعی، جلوی توهمات مدل‌ها را در کوئری‌نویسی بگیرند.

گام بعدی شما

  • جایگزین کردن بنچمارک‌های عمومی با تست‌های داخلی بر اساس شمای (Schema) واقعی دیتابیس خودتان.
  • پیاده‌سازی سیستم‌های اعتبارسنجی سخت‌گیرانه و حضور انسان در چرخه (Human-in-the-loop) برای تایید کوئری‌ها.
  • تمرکز بر ساخت چارچوب‌های عامل‌محور که قابلیت اصلاح خطا (Error Recovery) دارند.

اما این شکست در SQL تنها بخشی از یک چالش بزرگ‌تر است؛ در حالی که SQL و پایتون همچنان مهارت‌های کلیدی در بازار کار هستند، اثر این محدودیت‌ها بر آینده‌ی تحلیل‌های خودکار داده را در گزارش‌های بعدی بررسی خواهیم کرد.

چرا این موضوع مهم است؟

این یافته بر اعتبار تکیه بر بنچمارک‌های آکادمیک برای استقرار تجاری ضربه می‌زند. شرکت‌ها اکنون باید استراتژی خود را از اعتماد مطلق به مدل‌ها به سمت اعتبارسنجی سخت‌گیرانه تغییر دهند.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که در حال ساخت ابزارهای تحلیل داده بر پایه APIهای خارجی هستند، این هشدار است که نتایج آزمایشگاهی هرگز تضمین‌کننده عملکرد در محیط عملیاتی نیست.

·نگاه ما
تحریریه دات‌هوش

سقوط شدید دقت در Spider 2.0 نشان می‌دهد که ما در عصر «بیش‌برازش روی بنچمارک‌ها» هستیم. مدل‌ها یاد گرفته‌اند چگونه آزمون‌ها را پاس کنند، نه اینکه واقعاً مسئله را حل کنند. این اتفاق مسیر توسعه را از «بهبود مدل خام» به سمت «طراحی سیستم‌های نظارتی» تغییر می‌دهد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.