پرش به محتوای اصلی
پرش به محتوای مقاله

Supabase Evals: محک جدید برای سنجش عامل‌های هوش مصنوعی در محیط‌های واقعی

·۱۰ مرداد ۱۴۰۵۳ دقیقه مطالعه۱ بازدید
معرفی Evals ساپابیس: معیار متن‌باز برای ارزیابی Claude Code، Codex و OpenCode در وظایف واقعی
معرفی Evals ساپابیس: معیار متن‌باز برای ارزیابی Claude Code، Codex و OpenCode در وظایف واقعی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر پارادایم ارزیابی از «بنچ‌مارک‌های ایستا» به «تست در محیط واقعی کانتینری»؛ جایی که مدل نه فقط کد می‌زند، بلکه باید با معماری زنده یک پلتفرم سازگار باشد.

یک سیاست اشتباه در دسترسی به داده‌ها (RLS) در بخش بک‌اندِ یک سامانه بهداشت‌درمانی، صرفاً یک باگ ساده نیست؛ بلکه یک حادثه امنیتی جدی است. برای جلوگیری از این شکست‌ها، Supabase چارچوب Supabase Evals را منتشر کرد تا دقت عامل‌های هوش مصنوعی (AI Agents) را در مواجهه با وظایف واقعی پایگاه‌داده بسنجد.

به گزارش وب‌سایت marktechpost.com، این ابزار برخلاف روش‌های سنتی که از داده‌های ساختگی استفاده می‌کنند، مدل‌ها را در محیط‌های ایزوله (Containerized) و واقعی آزمایش می‌کند. این رویکرد، در واقع گامی در جهت جایگزینی سنتی «سنجش کیفیت متن» با «صحت اقدام» در عامل‌های DevOps است تا اطمینان حاصل شود که مدل تنها ادعا نمی‌کند، بلکه واقعاً کد صحیح را اجرا می‌کند. این عرضه در حالی رخ می‌دهد که توسعه‌دهندگان از تعاملات ساده‌ی «پرسش و پاسخ» به سمت استقرار عامل‌های کامل حرکت می‌کنند. همان‌طور که در تحلیل قبلی ما درباره‌ی شناسایی شکست‌های پنهان در زیر-عامل‌های Claude Code اشاره کردیم، نیاز به ابزارهای نظارتی دقیق‌تر هرگز تا این حد حیاتی نبوده است. برای یک برنامه‌نویس، این ابزار شبیه به داشتن یک سیستم «تست خودکار» برای سنجش سطح هوش مدل است تا پیش از انتشار هر نسخه، از عدم پس‌رفت (Regression) قابلیت‌ها مطمئن شود.

سازوکار آزمایش

این چارچوب سه dimension اصلی را هدف قرار می‌دهد: محصولات (مانند احراز هویت، ذخیره‌سازی و بردارها)، موضوعات (شامل RLS و مهاجرت داده‌ها) و مراحل اجرا (ساخت، استقرار، بررسی و رفع مشکل). این سیستم از یک محیط اجرای سبک بر پایه @supabase/lite استفاده می‌کند و برای اجرا در محیط محلی، به یک موتور Docker و مدیریت بسته pnpm نیاز دارد.

یافته‌های کلیدی مدل‌ها

بر اساس مستندات این پروژه، نتایج خیره‌کننده و در عین حال نگران‌کننده‌ای به دست آمده است:

  • مدل‌های Opus 5 و Kimi K3 هر دو بدون هیچ کمکی به امتیاز کامل ۱۰۰٪ در مرحله ساخت دست یافتند.
  • مدل Sonnet 5 پس از بارگذاری مهارت‌های خاص، شاهد جهش امتیاز از ۷۸٪ به ۱۰۰٪ بود.
  • مدل GPT-5.6 Sol از ۸۹٪ به ۱۰۰٪ رسید و GPT-5.4 mini امتیاز خود را از ۷۸٪ به ۸۹٪ ارتقا داد.

با وجود این اعداد بالا، بنچ‌مارک‌ها سه نقطه ضعف بحرانی را افشا کردند. عامل‌ها به‌جای استفاده از طرح‌های تعریف‌محور (Declarative Schemas)، اغلب مهاجرت‌های داده را به‌صورت دستی می‌نویسند و احراز هویت را به‌جای استفاده از @supabase/server، به روش‌های دستی تایید می‌کنند. تکان‌دهنده‌ترین یافته مربوط به استفاده از مستندات است؛ در حالی که Codex و GPT-5.6 در هر سناریو حدود ۸ صفحه از مستندات را می‌خوانند، Claude Code در کمتر از ۴۰٪ موارد به مستندات مراجعه می‌کند، حتی وقتی مهارت‌های لازم بارگذاری شده باشند. این چالش در تحلیل مستندات، یادآور اهمیت بهینه‌سازی در فرآیندهای بازبینی است؛ برای نمونه، ابزار code-review-graph توانسته است مصرف توکن‌های بازبینی کد را با تحلیل ساختاری تا ۸۲ برابر کاهش دهد تا بهره‌وری مدل‌ها در مواجهه با کدهای حجیم افزایش یابد.

برای متخصصان، این یعنی «هوش» یک مدل لزوماً به «سواد ابزاری» تبدیل نمی‌شود. فاصله میان امتیاز ۷۸٪ و ۱۰۰٪ ثابت می‌کند که تنظیم دقیق (Fine-tuning) — شبیه وقتی به یک پزشک عمومی تخصص پوست می‌دهیم تا روی یک حوزه دقیق شود — برای مدل‌های کوچک‌تر جهت رسیدن به سطح تولید (Production-ready) همچنان اجباری است. ما شاهد تغییری هستیم که در آن معیار موفقیت دیگر «توانایی کدنویسی» نیست، بلکه «پیروی از الگوهای معماری خاص یک پلتفرم» است.

شما می‌توانید همین حالا این چارچوب را از مخزن گیت‌هاب supabase/evals تحت لایسنس Apache-2.0 مستقر کنید.

گام بعدی شما

  • اگر از مدل‌های کوچک‌تر برای اتوماسیون دیتابیس استفاده می‌کنید، مهارت‌های ابزاری (Tool-literacy) آن‌ها را با این بنچ‌مارک تست کنید.
  • بررسی کنید که آیا عامل‌های شما در حال بازنویسی دستی مهاجرت‌ها هستند یا از استانداردهای پلتفرم پیروی می‌کنند.
  • نرخ مراجعه مدل‌های خود را به مستندات بررسی نمایید تا از توهمات احتمالی در پیاده‌سازی جلوگیری کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این ابزار با انتقال تست‌ها از محیط‌های مجازی به استک‌های واقعی کانتینری، اعتبار سنجش عامل‌های هوش مصنوعی را بالا می‌برد. تخصص Supabase در این زمینه، استانداردی جدید برای نظارت بر رگرسیون مدل‌ها در محیط‌های عملیاتی ایجاد می‌کند.

تأثیر برای ایران

به‌دلیل متن‌باز بودن این چارچوب در گیت‌هاب، توسعه‌دهندگان ایرانی می‌توانند بدون نیاز به اشتراک‌های گران‌قیمت، کیفیت عامل‌های دیتابیس خود را در محیط محلی بسنجند.

·نگاه ما
تحریریه دات‌هوش

شکاف میان توان استدلالی و سواد ابزاری در مدل‌های جدید، نشان می‌دهد که عصر «مدل‌های همه‌فن-حریف» به پایان رسیده و جای خود را به تخصص‌های پلتفرمی می‌دهد. این نتایج ثابت می‌کند که حتی مدل‌های سطح بالا برای تبدیل شدن به عامل‌های قابل اعتماد، به لایه‌هایی از آموزش متمرکز بر معماری‌های خاص نیاز دارند تا از خطاهای امنیتی مرگبار جلوگیری شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.