اگر از اینکه مدلهای هوش مصنوعی در محیط تست عالی عمل میکنند اما در پروژههای واقعی شما شکست میخورند خسته شدهاید، اکنون فرصتی برای تبدیل این کلاف سردرگم به جایزه نقدی دارید. طبق اعلام Kaggle و DEV، رقابتی آغاز شده است که هدف آن جابهجایی تمرکز از جدولهای رتبهبندی عمومی به سمت ارزیابیهای مبتنی بر گردشکارهای واقعی است.
این چالش که در ۲۳ سپتامبر ۲۰۲۶ راهاندازی شد، بودجهای ۲۵۰۰ دلاری برای توسعهدهندگانی در نظر گرفته است که بتوانند دقیقاً نشان دهند مدلهای فعلی در کجا و چرا شکست میخورند. در واقع، این مسابقه از شما میخواهد یک محک (Benchmark) — شبیه به یک آزمون استخدامی سختگیرانه که فقط مهارتهای مورد نیاز یک شغل خاص را میسنجد — طراحی کنید تا رفتارهای مدل را در پروژههای خاص خودتان اندازه بگیرید.
همانطور که در تحلیلهای قبلی ما دربارهی نشت دادهها در آزمونهای عمومی اشاره کردیم، بسیاری از مدلها برای کسب نمره بالا در امتحانات کلی آموزش دیدهاند، اما وقتی با یک استایل کدنویسی شرکتی خاص یا یک استدلال تخصصی روبرو میشوند، دچار لکنت میشوند. این چالش با تلاشهای گستردهتری مانند سرمایهگذاری ۴۰ میلیون دلاری Vals برای پایان دادن به تقلب در محکهای AI همسو است تا استانداردهای ارزیابی از حالت صوری خارج شوند.

بر اساس مستندات این رقابت، شرکتکنندگان باید محک خود را در پلتفرم Kaggle Benchmarks بسازند و یافتههای خود را در وبسایت DEV منتشر کنند. الزامات این فرآیند شامل موارد زیر است:
- تعریف وظیفه: تبیین دقیق قابلیتی که تست میشود (مثلاً استدلال چندمرحلهای یا استفاده از ابزار).
- انتخاب مدل: مشخص کردن مدلهای مورد آزمایش و دلیل انتخاب آنها.
- ارائه بینش: فراتر رفتن از اعداد خام و توضیح اینکه نتایج چه معنایی برای کاربردی بودن مدل دارد.
- تأییدیه: ارائه لینک مستقیم به محک ساخته شده در Kaggle.
مهلت ارسال آثار تا ۱۱ اکتبر ۲۰۲۶ است و پنج برنده هر کدام ۵۰۰ دلار جایزه نقدی، عضویت DEV++ و یک نشان اختصاصی دریافت میکنند. برای کسانی که با ابزارهای این پلتفرم آشنا نیستند، گردشکار Kaggle Benchmarks شامل ایجاد وظایف خاص، گروهبندی آنها در یک محک و اجرای آنها روی مجموعهای از مدلها برای تولید یک جدول رتبهبندی است. توسعهدهندگان همچنین میتوانند از طریق Kaggle CLI و کتابخانه پایتون kaggle-benchmarks این فرآیند را در محیط محلی خود خودکار کنند.
این چرخش به سمت محکهای تعریفشده توسط کاربر، نشاندهنده نارضایتی فزاینده از «اشباع بنچمارکها» است؛ وضعیتی که در آن مدلها صرفاً برای پاس کردن تستهای موجود بهینهسازی شدهاند. این موضوع در مقایسههای اخیر نیز مشهود است، جایی که عاملهای هوش مصنوعی در برابر موتورهای جستوجوی سنتی در پردازش الگوها نقاط ضعف عمیقتری را در حافظه و بازیابی دادهها آشکار کردند. با برونسپاری ساخت تستهای غیرقابلپیشبینی به جامعه، میتوان «حالتهای شکست عجیب» را یافت که احتمالاً آزمایشگاههای بزرگ شرکتی آنها را نادیده گرفتهاند.
برای یک توسعهدهنده، این فرصتی است تا یک کلاف سردرگم فنی را به یک دارایی مستند تبدیل کند. اثبات نقص یک مدل در یک حوزه خاص، برای برنامهریزی تولید (Production) بسیار ارزشمندتر از اعتماد به ادعاهای بازاریابی شرکتهای سازنده است؛ بهویژه زمانی که میبینیم مدلهای کوچکتر اما بهینهتر، مانند مدل ZGCM-1 که توانست بر غولهای ۳۰ برابری خود غلبه کند، مسیرهای جدیدی را در ارزیابی کارایی باز میکنند.
گام بعدی شما
- کتابخانه
kaggle-benchmarksرا در گیتهاب بررسی کنید تا ساخت وظایف را خودکار کنید. - یک مورد از شکستهای تکراری مدل AI در پروژه فعلی خود را شناسایی و به شکل یک تست تبدیل کنید.
- قالب ارسال آثار در DEV را مطالعه کنید تا معیارهای داوری را دقیقتر بشناسید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو