پرش به محتوای اصلی
پرش به محتوای مقاله

گزارش Atria: عامل‌های هوش مصنوعی ۹۶٪ وظایف را انجام می‌دهند اما ۸۵٪ تصمیمات

·۵ مهر ۱۴۰۵۵ دقیقه مطالعه
عوامل هوش مصنوعی بخش بیشتری از توسعه مدل را انجام می‌دهند، اما انسان‌ها همچنان تصمیم‌گیرنده‌اند
عوامل هوش مصنوعی بخش بیشتری از توسعه مدل را انجام می‌دهند، اما انسان‌ها همچنان تصمیم‌گیرنده‌اند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کشف این نکته که AI کارهای «غیرممکن» را ممکن کرده است، نه اینکه فقط کارهای «موجود» را سریع‌تر کند. این یعنی تغییر در ماهیت خروجی‌های مهندسی، نه فقط در سرعت تولید آن‌ها.

تصور کنید برنامه‌نویسی هستید که دیگر درگیر نوشتن کدهای تکراری یا عیب‌یابی‌های خسته‌کننده نیست، اما هنوز هر تصمیم استراتژیک درباره معماری نرم‌افزار را شما می‌گیرید. طبق گزارشی که در ۲۷ سپتامبر ۲۰۲۶ منتشر شد، تیم Atria دریافت که هوش مصنوعی تنها سرعت گردش کار را زیاد نکرده، بلکه کارهای کاملاً جدیدی را برای طیف گسترده‌ای از کاربران ممکن ساخته است. در واقع، یک‌سوم از وظایف پیچیده توسعه AI هرگز بدون کمک یک عامل (Agent) مورد تلاش قرار نمی‌گرفتند.

این تحول در حالی رخ می‌دهد که صنعت درباره «خودبهبودی بازگشتی» (Recursive Self-Improvement) بحث می‌کند؛ وضعیتی که در آن مدل‌های هوش مصنوعی جانشینان خود را می‌سازند. در حالی که شرکت‌هایی مثل Anthropic و OpenAI در حال ادغام عمیق‌تر عامل‌ها در چرخه‌های پژوهشی خود هستند، یافته‌های Atria نگاهی واقع‌بینانه به محل قرارگیری گلوگاه واقعی ارائه می‌دهد: گلوگاه در قضاوت انسانی است، نه در قدرت اجرا.

عوامل هوش مصنوعی بخش بیشتری از توسعه مدل را انجام می‌دهند، اما انسان‌ها همچنان تصمیم‌گیرنده نهایی‌اند.

معماری مدل و عملکرد

این پروژه روی Atria Dawn Preview متمرکز بود؛ یک مدل ترکیب خبره‌ها (Mixture-of-Experts) — شبیه تیمی از متخصصان که هر کدام در یک موضوع خاص مهارت دارند و فقط فرد مناسب برای هر سؤال فراخوانده می‌شود — با ۷۴۴ میلیارد پارامتر که به‌طور خاص برای وظایف مهندسی طراحی شده است. این مدل از طریق خط لوله‌ای آموزش دیده که وظایف را به محیط‌های اجرای واقعی متصل می‌کند. این ساختار به مدل اجازه می‌دهد تا ابزارها را فراخوانی کند، نتایج میانی تولید کند و نتایج نهایی را در برابر معیارهای خارجی، تست‌ها یا شواهد منبع تأیید و بازبینی نماید.

به نقل از مستندات پروژه، این مدل در ۵ مورد از ۱۶ محک (Benchmark) پیشتاز بود و قدرت ویژه‌ای در جست‌وجوی وب و امنیت سایبری نشان داد. به‌طور مشخص، مدل Atria در آزمون‌های AutomationBench، CyberGym و MLE-Bench Lite برتری داشت، هرچند در GDPval و SWE-Bench Pro عقب‌تر از رقبا بود.

عوامل هوش مصنوعی بخش بیشتری از توسعه مدل را انجام می‌دهند، اما انسان‌ها همچنان تصمیم‌گیرنده نهایی‌اند.

جزئیات پروژه و نحوه اجرا

داده‌های این پروژه چهار هفته‌ای، گرایشی واضح به سمت اجرای عامل‌محور (Agentic) — یعنی سیستمی که مثل یک دستیار مستقل، خودش برنامه‌ریزی می‌کند و مراحل را پیش می‌برد — را نشان می‌دهد. این رویکرد در راستای توسعه سیستم‌های عامل صنعتی است که هدفشان تبدیل چت‌بات‌های ساده به دستیاران عملیاتی برای محیط‌های پیچیده است:

  • نفوذ در وظایف: هوش مصنوعی در ۹۶.۵٪ از تمام وظایف بررسی‌شده به کار گرفته شد.
  • حجم اجرا: نسبت میانگین اقدامات عامل به ورودی‌های انسانی در چهار هفته از ۱۱ به ۲۸.۵ رسید. تیم Atria اشاره می‌کند که این عدد نشان‌دهنده مراحل بیشترِ عامل برای هر تصمیم انسانی است، نه لزوماً افزایش استقلال مدل.
  • امکان‌پذیری: ۱۵۱ مورد از ۴۵۵ وظیفه تکمیل‌شده، بدون کمک AI غیرممکن ارزیابی شدند. این موارد بین ۲۷ نفر از ۵۶ شرکت‌کننده پخش شده بود که ثابت می‌کند اثر AI فقط محدود به چند کاربر حرفه‌ای (Power Users) نیست و به طیف وسیعی از کاربران گسترش یافته است.

همان‌طور که در تحلیل‌های قبلی ما درباره امنیت مدل‌های بازمتن اشاره کردیم، کنترل خروجی‌ها همیشه چالش‌برانگیز است. در اینجا نیز با وجود حجم بالای کار AI، «مغز» عملیات همچنان انسانی بود. برای متدها و پارامترها، رایج‌ترین الگو این بود که «AI پیشنهاد می‌دهد و انسان انتخاب می‌کند» که در ۵۵.۴٪ موارد رخ داد. انسان‌ها ۸۵.۵٪ تصمیمات نهایی درباره متدها و ۹۳.۴٪ تصمیمات مربوط به اهداف و محدوده پروژه را گرفتند. حتی در آن ۱۵۱ وظیفه‌ای که بدون AI غیرممکن بودند، انسان‌ها در ۹۵.۴٪ موارد هدف را تعیین کردند.

عوامل هوش مصنوعی بخش بیشتری از توسعه مدل را انجام می‌دهند، اما انسان‌ها همچنان تصمیم‌گیرنده‌اند

مداخله و حل مسئله

وقتی سیستم به بن‌بست می‌رسید، مداخله انسانی موتور اصلی پیشرفت بود. از ۵۸۸ وظیفه‌ای که دشواری آن‌ها ثبت شده بود، ۷۶٪ از طریق دخالت انسان پیش رفتند، در حالی که عامل تنها در ۲۳٪ موارد توانست مشکل را به‌تنهایی حل کند.

انسان‌ها به‌ندرت کارهای دستی را خودشان انجام دادند. در عوض، حمایت آن‌ها از طریق روش‌های زیر بود:

  • زمینه و الزامات: افزودن کانتکست یا شفاف‌سازی نیازها (۳۵.۲٪).
  • تشخیص: عیب‌یابی مشکلات و تغییر متدها (۳۴.۷٪).
  • ویرایش‌های دستی: تغییرات جزئی تنها ۳.۲٪ موارد را شامل می‌شد.
  • به‌دست‌گیری کامل: تسلط کامل انسان بر روند کار و جایگزینی عامل تنها در ۰.۷٪ موارد رخ داد.

عوامل هوش مصنوعی بخش بیشتری از توسعه مدل را انجام می‌دهند، اما انسان‌ها همچنان تصمیم‌گیرنده‌اند

این وضعیت پویایی عملیاتی جدیدی ایجاد می‌کند که در آن AI بازبینی‌ها را مدیریت می‌کند. پس از دریافت بازخورد انسانی، عامل در ۷۵.۴٪ موارد توانست تغییرات را خودش با موفقیت اعمال کند. تیم Atria این را فاز سوم تکامل AI می‌نامد: تبدیل از یک «موضوع پژوهشی» به یک «ابزار» و حالا به یک «شریک پروژه». فاز چهارم احتمالا شامل خودبهبودی بازگشتی خواهد بود که در آن مدل‌های قوی‌تر، جانشینان قوی‌تری می‌سازند.

عوامل هوش مصنوعی بخش بیشتری از توسعه مدل را انجام می‌دهند، اما انسان‌ها همچنان تصمیم‌گیرنده‌اند

ریسک تأیید کورکورانه و فضای صنعت

با این حال، این شراکت ریسک «تأیید کورکورانه» (Rubber-stamp risk) را به همراه دارد. وقتی زنجیره کارهای عامل طولانی‌تر از توان بررسی واقعی هر انسانی شود، این خطر وجود دارد که انسان‌ها خروجی‌های AI را بدون نظارت واقعی و صرفاً برای پیشبرد کار تأیید کنند. برخی شرکت‌کنندگان همین حالا هم برای راحتی و جلوگیری از وقفه در اجراهای طولانی، عامل‌ها را در حالت خودکار رها کرده‌اند، نه به دلیل یک تصمیم آگاهانه درباره تفویض اختیار.

این بحث در کل صنعت جاری است. داریو آمودی، مدیرعامل Anthropic، خواستار تعیین «حد سرعت» برای صنعت شده و پیشنهاد می‌کند که توسعه جانشینان توسط AI ممکن است زودتر از حد انتظار رخ دهد. آنتروپیک گزارش می‌دهد که انسان‌ها اکنون تنها درصد تک‌رقمی از تصمیمات مربوط به جهت پژوهش را می‌گیرند. در همین حال، OpenAI از GPT-5.6 Sol در سراسر چرخه توسعه خود استفاده می‌کند و Google و DeepMind از Dream-RSI برای اجازه دادن به عامل‌ها جهت کاوش در مسیرهای جست‌وجو بهره می‌برند، هرچند آن‌ها فقط استراتژی جست‌وجو را بهبود می‌بخشند، نه خودِ مدل را.

بیش از هزار کارمند در شرکت‌های پیشرو AI اخیراً هشدار دادند که سازمان‌هایشان در آستانه خودکارسازی پژوهش‌های AI هستند. این یافته با مطالعه جداگانه‌ای از پرینستون و مؤسسه امنیت AI بریتانیا همسو است؛ آن‌ها اشاره کردند که مدل‌های پیشرو در مهندسی پژوهش عالی هستند، اما در تصمیمات قضاوتی که واقعاً اهمیت دارند، شکست می‌خورند.

برای یک مدیر کسب‌وکار، این یعنی ارزش یک کارمند انسانی از «کسی که می‌تواند کار را انجام دهد» به «کسی که می‌داند چه کاری ارزش انجام دادن دارد» تغییر می‌کند. باید منتظر ماند و دید صنعت چگونه با بحث خودبهبودی بازگشتی برخورد می‌کند، به‌ویژه اینکه آیا مدل‌ها در نهایت می‌توانند بدون هدایت انسان، مسیرهای پژوهشی خود را پیشنهاد و ارزیابی کنند یا خیر.

برای یک مدیر کسب‌وکار، این یعنی ارزش یک کارمند انسانی از «کسی که می‌تواند کار را انجام دهد» به «کسی که می‌داند چه کاری ارزش انجام دادن دارد» تغییر می‌کند. باید منتظر ماند و دید صنعت چگونه با بحث خودبهبودی بازگشتی برخورد می‌کند، به‌ویژه اینکه آیا مدل‌ها در نهایت می‌توانند بدون هدایت انسان، مسیرهای پژوهشی خود را پیشنهاد و ارزیابی کنند یا خیر.

گام بعدی شما

  • اگر مدیر تیم فنی هستید، تمرکز ارزیابی خود را از «کیفیت کد» به «کیفیت تعریف هدف و نظارت» منتقل کنید.
  • در گردش‌های کاری خود، نقاطی را شناسایی کنید که ریسک «تأیید کورکورانه» خروجی‌های AI در آن‌ها بالاست و برایشان لایه‌های بازبینی انسانی سخت‌گیرانه تعریف کنید.
  • ابزارهای عامل‌محور را برای کارهایی به کار بگیرید که پیش‌تر به دلیل پیچیدگی فنی یا زمان‌بر بودن رها شده بودند.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مطالعه با تکیه بر داده‌های عملیاتی، مرز بین اتوماسیون و استقلال را مشخص می‌کند. اعتبار این یافته‌ها در این است که نشان می‌دهد حتی در پیشرفته‌ترین مدل‌ها، قضاوت انسانی همچنان تنها لایه امنیتی و هدایت‌کننده است.

تأثیر برای ایران

برای برنامه‌نویسان ایرانی، این تحول فرصتی است تا با تمرکز بر مهندسی پرامپت و مدیریت عامل‌ها، خروجی‌های فنی خود را به سطح استانداردهای جهانی برسانند، حتی اگر دسترسی به سخت‌افزارهای سنگین محدود باشد.

·نگاه ما
تحریریه دات‌هوش

ارزش نیروی انسانی در عصر عامل‌ها از «تولید» به «سایتی» (Curation) تغییر می‌کند. وقتی ۹۶٪ اجرا توسط ماشین است، تنها مزیت رقابتی انسان، توانایی تشخیص «مسیر درست» در میان هزاران مسیر ممکن است. این یعنی مهارت‌های مدیریت محصول و تفکر استراتژیک، حالا بیش از مهارت‌های پیاده‌سازی فنی اهمیت می‌یابند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.