پرش به محتوای اصلی
پرش به محتوای مقاله

شکاف ۱۸ امتیازی بین مدل‌های باز و بسته در وظایف پیچیدهٔ عامل‌محور

·۸ مهر ۱۴۰۵۵ دقیقه مطالعه۲ بازدید
تحلیل
مدل‌های باز‌منبع بهتر می‌شوند؛ اقتصادشان پیچیده‌تر.
مدل‌های باز‌منبع بهتر می‌شوند؛ اقتصادشان پیچیده‌تر.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کشف شکاف ۱۸ امتیازی در تست‌های واقعی (Pro) در مقابل شکاف نزدیک به صفر در تست‌های ایستا (Verified)؛ این نشان می‌دهد مدل‌های باز در ظاهر به مدل‌های بسته رسیده‌اند اما در عمل هنوز در تکالیف پیچیده شکست می‌خورند.

اگر امروز بر اساس رتبه‌بندی‌های عمومی مدل هوش مصنوعی خود را انتخاب می‌کنید، احتمالاً در محیط عملیاتی با شکست مواجه خواهید شد. نمرات ترکیبی که به عنوان «هوش» مدل فروخته می‌شوند، در واقع بازتابی از بودجهٔ محاسباتی، نرم‌افزارهای پیرامونی و زمینه‌ای هستند که مدل در آن قرار گرفته است.

به نقل از تحلیل جاسپریت سینگ که در ژوئیه ۲۰۲۶ منتشر شد، شرکت‌هایی که تنها به محک‌ها (Benchmarks) تکیه می‌کنند، نقش حیاتی مهندسی سیستم را در تعیین قابلیت اطمینان محصول نادیده می‌گیرند. این تغییر دیدگاه درست زمانی رخ می‌دهد که صنعت از پرسش‌وپاسخ‌های ساده به سمت عامل‌های هوش مصنوعی (AI Agents) حرکت می‌کند. سال‌ها رقابت بر سر افزایش درصدها در تست‌های ایستا بود، اما اکنون که هوش مصنوعی در گردش‌کارهای چندمرحله‌ای تجاری ادغام می‌شود، فاصله بین یک پاسخ «صیقل‌خورده» و یک محصول «قابل اتکا» بیش از هر زمان دیگری زیاد شده است.

زمینه و بستر تحلیل

پژوهش سینگ بر اساس این مشاهده شکل گرفت که توضیحات معمول برای پیشرفت هوش مصنوعی — مانند این ادعا که مدل‌ها صرفاً بزرگ‌تر شده‌اند — با واقعیت‌های موجود همخوانی ندارد. او همچنین دریافت که ادعای رایج مبنی بر اینکه «متن‌باز در حال پیروزی است»، تنها نیمی از حقیقت را بیان می‌کند و نمرات بنچمارک‌ها بسیار کمتر از آنچه انتظار می‌رفت، مفید هستند.

او برای یافتن حقیقت، داده‌های ۱۸ ماهه از ۴۶ مدل متعلق به ۸ آزمایشگاه مختلف را استخراج کرد. هدف او این بود که تعیین کند آیا هوش در حال تبدیل شدن به یک کالای عمومی (Commodity) است، آیا مدل‌های باز در حال رسیدن به سطح مدل‌های پیشرو (Frontier) هستند و شرکت‌ها هنگام انتخاب سیستم‌هایی که قرار است بر پایه آن‌ها محصول بسازند، واقعاً باید از چه معیارهایی استفاده کنند.

شکاف بنچمارک‌ها

داده‌های سینگ تضاد شدیدی را در نحوه اندازه‌گیری هوش برجسته می‌کند. وقتی مدل‌ها را به‌جای نمرات ترکیبی، تست به تست مقایسه می‌کنیم، شکاف بین مدل‌های پیشرو تجاری و مدل‌های وزن‌باز بسته به نوع تست به‌شدت نوسان می‌کند.

در آزمون SWE-bench Verified که تستی قدیمی‌تر است و در بسیاری از معرفی‌های مدل‌ها دیده می‌شود، شکاف تنها ۰.۲ امتیاز است و تقریباً ناچیز است. اما در SWE-bench Pro — تستی جدیدتر که حول محور کارهای واقعی نرم‌افزاری، چندزبانه و با یک ساختار استاندارد طراحی شده — این شکاف به ۱۸.۲ امتیاز جهش می‌کند.

سایر یافته‌های این تحلیل در مورد اشباع یا واگرایی تست‌ها عبارتند از:

  • GPQA Diamond: این تست اشباع شده است و سقف عملکرد در آن حدود ۹۲ تا ۹۵ درصد است (شکاف تنها ۲ امتیاز).
  • Terminal-Bench 2.1: یک تست عامل‌محور زنده که شکافی بین ۲.۱ تا ۴.۹ امتیاز را نشان می‌دهد.
  • Humanity’s Last Exam: تستی برای استدلال‌های پیشرو که شکافی ۹.۸ امتیازی دارد.
  • SWE-bench Verified: اشباع شده و احتمال نشت داده (Contamination) در آن گزارش شده است (شکاف ۰.۲ امتیازی).

حتی یک مدل واحد بسته به ارزیاب، نتایج متفاوتی می‌دهد. مدل Kimi K3 در یک ارزیابی مستقل امتیاز ۸۰.۹٪ در Terminal-Bench 2.1 گرفت، اما سازنده‌اش عدد ۸۸.۳٪ را گزارش کرد. این نوسان ۷.۴ امتیازی، از تفاوت مدل‌های باز و بسته در سه مورد از پنج بنچمارک تحلیل‌شده بیشتر است.

مکانیسم‌های سیستمیک

این بی‌ثباتی به این دلیل است که خروجی یک مدل توسط بودجهٔ استدلال (Reasoning Budget) و ابزارهایی که می‌تواند به آن‌ها دسترسی داشته باشد، تعیین می‌شود. مدل دستورالعمل‌ها را از طریق نرم‌افزارهای پیرامونی دریافت می‌کند و از زمینه‌های (Context) خاصی بهره می‌برد. اگر این شرایط تغییر کند، نتیجه نیز تغییر می‌کند.

این موضوع زمانی حیاتی می‌شود که هوش مصنوعی به سمت تکمیل توالی‌هایی از اقدامات حرکت می‌کند. در یک گردش‌کار ۲۰ مرحله‌ای، مدلی که در هر مرحله به صورت مجزا ۹۵٪ دقت دارد، در مجموع تنها ۳۶٪ شانس موفقیت در کل توالی را خواهد داشت. تفاوت بین شکست و پیروزی، به‌ندرت به تنهایی مربوط به خودِ مدل است، بلکه به مهندسی مربوط می‌شود که اجازه می‌دهد پیشرفت ذخیره شود، خروجی‌ها تأیید شوند، تلاش مجدد (Retry) به صورت ایمن انجام شود و سیستم از خطاها بازیابی شود.

برای معماران فنی، این بدان معناست که بحث «باز در برابر بسته» یک تقابل کاذب است. مدل‌های وزن‌باز اکنون برای کارهای کوتاه‌مدت و تعریف‌شده که نتایج آن‌ها مستقیماً قابل اندازه‌گیری است — مانند طبقه‌بندی، استخراج، خلاصه‌سازی و تولید ساختاریافته — بسیار رقابتی هستند.

با این حال، مدل‌های پیشرو (Frontier) همچنان برای تکالیف عامل‌محور با افق زمانی طولانی و رعایت دستورالعمل‌های حساس که هزینهٔ شناسایی خطا در آن‌ها بالاست، برتری دارند. این برتری در حالی است که غول‌هایی مانند OpenAI برای حفظ پیشتازی در لبه‌ی تکنولوژی، بخش بزرگی از پژوهش‌های خود را بر روی نسل‌های آینده مانند GPT-7 و GPT-8 متمرکز کرده‌اند تا شکاف عملکردی را در وظایف پیچیده بیشتر کنند. در این حوزه‌ها، شکاف عملکردی به ۱۸ امتیاز نزدیک‌تر است تا صفر، و لایه امنیتی که توسط فروشنده مدل ارائه می‌شود، ارزش قابل توجهی دارد.

اقتصاد هوش

علاوه بر این، اقتصاد هوش در حال تغییر است. در حالی که قابلیت‌های عمومی در حال تبدیل شدن به کالای ارزان هستند، دستیابی به ۹ درصد نهایی از عملکرد پیک، تقریباً ۱۰ برابر بیشتر از تمام مراحل قبلی هزینه می‌برد. اکثر سازمان‌ها برای هر درخواست به قدرتمندترین مدل نیاز ندارند، بلکه به «قضاوت» نیاز دارند تا بدانند کدام تکلیف ارزش هزینهٔ محاسباتی بالا را دارد.

قضاوت — یعنی توانایی تشخیص یک سؤال غلط، تشخیص اینکه کدام یک از پنج پاسخ محتمل درست است، یا تصمیم برای توقف و پرسش از انسان — را نمی‌توان به صورت توکن خرید. این قابلیت از طریق قوانین تجاری اختصاصی، دانش تاریخی و لایه‌های تأییدی که جلوی شکست را می‌گیرند، ساخته می‌شود.

استراتژی پیاده‌سازی

شرکت‌ها باید مدل‌ها را بر اساس نوع تکلیف انتخاب کنند، اما باید تشخیص دهند که تغییر مدل یک تصمیم معماری است، نه یک جابجایی رایگان. حافظه زمینه (Context)، استدلال و کش‌های پرامپت (Prompt Caches) به راحتی بین ارائه‌دهندگان مختلف منتقل نمی‌شوند. یک مدل ارزان‌تر می‌تواند گران‌تر تمام شود اگر تغییر سیستم باعث شود کارها از ابتدا شروع شوند یا لایه‌های نظارتی جدیدی اضافه شود.

برای پیشروی، سازمان‌ها باید تکیه بر لیدربوردهای عمومی را متوقف کنند و مجموعه‌های ارزیابی خصوصی متشکل از ۵۰ تا ۲۰۰ تکلیف واقعی تجاری بسازند. با ثابت نگه داشتن سیستم پیرامونی و اندازه‌گیری «هزینه به ازای نتیجهٔ پذیرفته‌شده» به‌جای «هزینه به ازای توکن»، شرکت‌ها می‌توانند از گمراه شدن توسط مدل‌هایی که زمان بیشتری برای استدلال صرف می‌کنند یا نیاز به تلاش‌های مجدد بیشتری دارند، جلوگیری کنند.

با تعداد کمی از مدل‌ها شروع کنید و مسیریابی کارها را در ابتدای پروژه انجام دهید، به‌جای اینکه در میانه راه ارائه‌دهنده را تغییر دهید. بار امنیتی و عملیاتی هر ارائه‌دهنده اضافی را در کنار قیمت آن محاسبه کنید. تنها بنچمارکی که واقعاً اهمیت دارد، بنچمارکی است که فقط شرکت شما می‌تواند آن را اجرا کند.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این تحلیل اعتبار بنچمارک‌های عمومی را به عنوان معیار انتخاب مدل در سطح سازمانی تخریب می‌کند. بر اساس تجربه استقرار مدل‌ها، تخصص در مهندسی سیستم (System Engineering) اکنون ارزشمندتر از دسترسی به قدرتمندترین مدل است.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که به‌دلیل هزینه‌های API به مدل‌های وزن‌باز متکی هستند، این خبر هشدار می‌دهد که برای پیاده‌سازی عامل‌های پیچیده، نمی‌توان صرفاً به مدل‌های رایگان تکیه کرد و باید لایه‌های تأیید انسانی و مهندسی سیستم را تقویت کنند.

·نگاه ما
تحریریه دات‌هوش

تمرکز صنعت بر روی نمرات بنچمارک، نوعی «توهم پیشرفت» ایجاد کرده است که در آن مدل‌ها برای تست‌ها بهینه‌ می‌شوند نه برای واقعیت. برتری مدل‌های بسته در وظایف طولانی‌مدت نشان می‌دهد که استدلال عمیق هنوز با مقیاس‌بندی ساده یا باز کردن وزن‌ها به دست نمی‌آید. استراتژی برنده دیگر انتخاب «بهترین مدل»، بلکه طراحی «بهترین سیستم پیرامونی» برای مدیریت خطاهای مدل است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.