تصور کنید برنامهنویسی هستید که دیگر درگیر نوشتن کدهای تکراری یا عیبیابیهای خستهکننده نیست، اما هنوز هر تصمیم استراتژیک درباره معماری نرمافزار را شما میگیرید. طبق گزارشی که در ۲۷ سپتامبر ۲۰۲۶ منتشر شد، تیم Atria دریافت که هوش مصنوعی تنها سرعت گردش کار را زیاد نکرده، بلکه کارهای کاملاً جدیدی را برای طیف گستردهای از کاربران ممکن ساخته است. در واقع، یکسوم از وظایف پیچیده توسعه AI هرگز بدون کمک یک عامل (Agent) مورد تلاش قرار نمیگرفتند.
این تحول در حالی رخ میدهد که صنعت درباره «خودبهبودی بازگشتی» (Recursive Self-Improvement) بحث میکند؛ وضعیتی که در آن مدلهای هوش مصنوعی جانشینان خود را میسازند. در حالی که شرکتهایی مثل Anthropic و OpenAI در حال ادغام عمیقتر عاملها در چرخههای پژوهشی خود هستند، یافتههای Atria نگاهی واقعبینانه به محل قرارگیری گلوگاه واقعی ارائه میدهد: گلوگاه در قضاوت انسانی است، نه در قدرت اجرا.

معماری مدل و عملکرد
این پروژه روی Atria Dawn Preview متمرکز بود؛ یک مدل ترکیب خبرهها (Mixture-of-Experts) — شبیه تیمی از متخصصان که هر کدام در یک موضوع خاص مهارت دارند و فقط فرد مناسب برای هر سؤال فراخوانده میشود — با ۷۴۴ میلیارد پارامتر که بهطور خاص برای وظایف مهندسی طراحی شده است. این مدل از طریق خط لولهای آموزش دیده که وظایف را به محیطهای اجرای واقعی متصل میکند. این ساختار به مدل اجازه میدهد تا ابزارها را فراخوانی کند، نتایج میانی تولید کند و نتایج نهایی را در برابر معیارهای خارجی، تستها یا شواهد منبع تأیید و بازبینی نماید.
به نقل از مستندات پروژه، این مدل در ۵ مورد از ۱۶ محک (Benchmark) پیشتاز بود و قدرت ویژهای در جستوجوی وب و امنیت سایبری نشان داد. بهطور مشخص، مدل Atria در آزمونهای AutomationBench، CyberGym و MLE-Bench Lite برتری داشت، هرچند در GDPval و SWE-Bench Pro عقبتر از رقبا بود.

جزئیات پروژه و نحوه اجرا
دادههای این پروژه چهار هفتهای، گرایشی واضح به سمت اجرای عاملمحور (Agentic) — یعنی سیستمی که مثل یک دستیار مستقل، خودش برنامهریزی میکند و مراحل را پیش میبرد — را نشان میدهد. این رویکرد در راستای توسعه سیستمهای عامل صنعتی است که هدفشان تبدیل چتباتهای ساده به دستیاران عملیاتی برای محیطهای پیچیده است:
- نفوذ در وظایف: هوش مصنوعی در ۹۶.۵٪ از تمام وظایف بررسیشده به کار گرفته شد.
- حجم اجرا: نسبت میانگین اقدامات عامل به ورودیهای انسانی در چهار هفته از ۱۱ به ۲۸.۵ رسید. تیم Atria اشاره میکند که این عدد نشاندهنده مراحل بیشترِ عامل برای هر تصمیم انسانی است، نه لزوماً افزایش استقلال مدل.
- امکانپذیری: ۱۵۱ مورد از ۴۵۵ وظیفه تکمیلشده، بدون کمک AI غیرممکن ارزیابی شدند. این موارد بین ۲۷ نفر از ۵۶ شرکتکننده پخش شده بود که ثابت میکند اثر AI فقط محدود به چند کاربر حرفهای (Power Users) نیست و به طیف وسیعی از کاربران گسترش یافته است.
همانطور که در تحلیلهای قبلی ما درباره امنیت مدلهای بازمتن اشاره کردیم، کنترل خروجیها همیشه چالشبرانگیز است. در اینجا نیز با وجود حجم بالای کار AI، «مغز» عملیات همچنان انسانی بود. برای متدها و پارامترها، رایجترین الگو این بود که «AI پیشنهاد میدهد و انسان انتخاب میکند» که در ۵۵.۴٪ موارد رخ داد. انسانها ۸۵.۵٪ تصمیمات نهایی درباره متدها و ۹۳.۴٪ تصمیمات مربوط به اهداف و محدوده پروژه را گرفتند. حتی در آن ۱۵۱ وظیفهای که بدون AI غیرممکن بودند، انسانها در ۹۵.۴٪ موارد هدف را تعیین کردند.

مداخله و حل مسئله
وقتی سیستم به بنبست میرسید، مداخله انسانی موتور اصلی پیشرفت بود. از ۵۸۸ وظیفهای که دشواری آنها ثبت شده بود، ۷۶٪ از طریق دخالت انسان پیش رفتند، در حالی که عامل تنها در ۲۳٪ موارد توانست مشکل را بهتنهایی حل کند.
انسانها بهندرت کارهای دستی را خودشان انجام دادند. در عوض، حمایت آنها از طریق روشهای زیر بود:
- زمینه و الزامات: افزودن کانتکست یا شفافسازی نیازها (۳۵.۲٪).
- تشخیص: عیبیابی مشکلات و تغییر متدها (۳۴.۷٪).
- ویرایشهای دستی: تغییرات جزئی تنها ۳.۲٪ موارد را شامل میشد.
- بهدستگیری کامل: تسلط کامل انسان بر روند کار و جایگزینی عامل تنها در ۰.۷٪ موارد رخ داد.

این وضعیت پویایی عملیاتی جدیدی ایجاد میکند که در آن AI بازبینیها را مدیریت میکند. پس از دریافت بازخورد انسانی، عامل در ۷۵.۴٪ موارد توانست تغییرات را خودش با موفقیت اعمال کند. تیم Atria این را فاز سوم تکامل AI مینامد: تبدیل از یک «موضوع پژوهشی» به یک «ابزار» و حالا به یک «شریک پروژه». فاز چهارم احتمالا شامل خودبهبودی بازگشتی خواهد بود که در آن مدلهای قویتر، جانشینان قویتری میسازند.

ریسک تأیید کورکورانه و فضای صنعت
با این حال، این شراکت ریسک «تأیید کورکورانه» (Rubber-stamp risk) را به همراه دارد. وقتی زنجیره کارهای عامل طولانیتر از توان بررسی واقعی هر انسانی شود، این خطر وجود دارد که انسانها خروجیهای AI را بدون نظارت واقعی و صرفاً برای پیشبرد کار تأیید کنند. برخی شرکتکنندگان همین حالا هم برای راحتی و جلوگیری از وقفه در اجراهای طولانی، عاملها را در حالت خودکار رها کردهاند، نه به دلیل یک تصمیم آگاهانه درباره تفویض اختیار.
این بحث در کل صنعت جاری است. داریو آمودی، مدیرعامل Anthropic، خواستار تعیین «حد سرعت» برای صنعت شده و پیشنهاد میکند که توسعه جانشینان توسط AI ممکن است زودتر از حد انتظار رخ دهد. آنتروپیک گزارش میدهد که انسانها اکنون تنها درصد تکرقمی از تصمیمات مربوط به جهت پژوهش را میگیرند. در همین حال، OpenAI از GPT-5.6 Sol در سراسر چرخه توسعه خود استفاده میکند و Google و DeepMind از Dream-RSI برای اجازه دادن به عاملها جهت کاوش در مسیرهای جستوجو بهره میبرند، هرچند آنها فقط استراتژی جستوجو را بهبود میبخشند، نه خودِ مدل را.
بیش از هزار کارمند در شرکتهای پیشرو AI اخیراً هشدار دادند که سازمانهایشان در آستانه خودکارسازی پژوهشهای AI هستند. این یافته با مطالعه جداگانهای از پرینستون و مؤسسه امنیت AI بریتانیا همسو است؛ آنها اشاره کردند که مدلهای پیشرو در مهندسی پژوهش عالی هستند، اما در تصمیمات قضاوتی که واقعاً اهمیت دارند، شکست میخورند.
برای یک مدیر کسبوکار، این یعنی ارزش یک کارمند انسانی از «کسی که میتواند کار را انجام دهد» به «کسی که میداند چه کاری ارزش انجام دادن دارد» تغییر میکند. باید منتظر ماند و دید صنعت چگونه با بحث خودبهبودی بازگشتی برخورد میکند، بهویژه اینکه آیا مدلها در نهایت میتوانند بدون هدایت انسان، مسیرهای پژوهشی خود را پیشنهاد و ارزیابی کنند یا خیر.
برای یک مدیر کسبوکار، این یعنی ارزش یک کارمند انسانی از «کسی که میتواند کار را انجام دهد» به «کسی که میداند چه کاری ارزش انجام دادن دارد» تغییر میکند. باید منتظر ماند و دید صنعت چگونه با بحث خودبهبودی بازگشتی برخورد میکند، بهویژه اینکه آیا مدلها در نهایت میتوانند بدون هدایت انسان، مسیرهای پژوهشی خود را پیشنهاد و ارزیابی کنند یا خیر.
گام بعدی شما
- اگر مدیر تیم فنی هستید، تمرکز ارزیابی خود را از «کیفیت کد» به «کیفیت تعریف هدف و نظارت» منتقل کنید.
- در گردشهای کاری خود، نقاطی را شناسایی کنید که ریسک «تأیید کورکورانه» خروجیهای AI در آنها بالاست و برایشان لایههای بازبینی انسانی سختگیرانه تعریف کنید.
- ابزارهای عاملمحور را برای کارهایی به کار بگیرید که پیشتر به دلیل پیچیدگی فنی یا زمانبر بودن رها شده بودند.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما درباره تراشههای Blackwell مراجعه کنید.




گفتگو