پرش به محتوای اصلی
پرش به محتوای مقاله

چرا وزن‌های مدل، گلوگاه واقعی عامل‌های هوش مصنوعی نیستند؟

·۸ خرداد ۱۴۰۵۳ دقیقه مطالعه
اشتراک‌گذاری

اگر تصور می‌کنید برای ساخت یک عامل (Agent) قابل‌اعتماد، تنها به یک مدل زبانی بزرگ (LLM) قدرتمندتر نیاز دارید، در واقع حیاتی‌ترین بخش پشته‌ی فناوری را نادیده گرفته‌اید. حقیقت این است که یک مدل بدون «هارنس» نرم‌افزاری، صرفاً یک سیستم بدون وضعیت (Stateless) است و هرگز نمی‌تواند به یک عامل تبدیل شود.

به نقل از مقاله‌ای که در ۲۹ مه ۲۰۲۶ توسط پژوهشگران دانشگاه ایلینوی اربانا-شمپین، متا و استنفورد منتشر شد، گلوگاه واقعی سیستم‌های خودکار، وزن‌های مدل نیست، بلکه لایه‌ی نرم‌افزاری است که مدل را در بر گرفته است. این تغییر دیدگاه درست زمانی رخ می‌دهد که صنعت از رابط‌های ساده‌ی چت به سمت گردش‌های کاری عامل‌محور (Agentic) حرکت می‌کند. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، لایه‌های حفاظتی و عملیاتی تعیین‌کننده‌ی خروجی نهایی هستند. در حالی که عموم مردم بر مهندسی پرامپت (Prompt Engineering) تمرکز کرده‌اند، بار اصلی عملیات در «هارنس» است؛ مجموعه‌ای از ابزارها، محیط‌های ایزوله (Sandbox) و حلقه‌های اجرایی که به مدل اجازه می‌دهد بدون گم کردن مسیر، وظایف بلندمدت را پیش ببرد.

Overview graphic of the code-as-agent-harness taxonomy showing three levels - harness interface, harness mechanisms, and scaling - along with five application domains: code assistants, GUI/OS agents, scientific discovery, personalization, and embodied agents.

بر اساس مستندات این پژوهش، این معماری به سه سطح متمایز تقسیم می‌شود:

  • لایه‌ی رابط: استفاده از روش‌هایی مانند «برنامه‌-در-تفکر» (Program-of-Thoughts) برای انتقال محاسبات از زبان طبیعی به برنامه‌های اجرایی.
  • لایه‌ی قابلیت اطمینان: ایجاد یک چرخه‌ی تکرارشونده از «برنامه‌ریزی، اجرا و تایید» که جایگزین عیب‌یابی‌های تک‌مرحله‌ای می‌شود.
  • لایه‌ی هماهنگی: ایجاد محیط‌های کد مشترک برای همکاری عامل‌های تخصصی (مدیر، کدنویس، بازبین)، مشابه آنچه در ChatDev و MetaGPT می‌بینیم.

Overview of five application domains for code as agent harness with examples, including code assistants like Claude, Codex, and OpenClaw, as well as GUI/OS agents, scientific discovery, personalization, and embodied robot agents.

سیستم‌های تجاری هم‌اکنون این الگو را پذیرفته‌اند. Claude Code متعلق به Anthropic، ترمینال‌های محلی و مرورگرها را در یک گردش کار واحد ادغام کرده است. اهمیت این لایه زمانی آشکار شد که حدود ۵۰۰,۰۰۰ خط از کد منبع Claude Code لو رفت و وجود یک تابع «رؤیاپردازی» (Dreaming) برای تجمیع وظایف فاش شد. به همین ترتیب، Codex از OpenAI و مدل آتی Deepseek Code در حال تشکیل تیم‌های اختصاصی «هارنس» هستند تا هر آنچه فراتر از مدل هسته است را مدیریت کنند.

این معماری پیش‌فرض‌های بنیادین این حوزه را تغییر می‌دهد: پایداری در کدنویسی خودکار نه از طریق پرامپت‌های اصلاحی، بلکه از طریق گذارهای دقیق وضعیت (State Transitions) حاصل می‌شود. نویسندگان هشدار می‌دهند که نباید به «اطمینان کاذب» ناشی از تیک‌های سبز در مجموعه‌های تست اعتماد کرد؛ چرا که پاس شدن یک تست، لزوماً به معنای ایمن یا منطقی بودن کد نیست.

گام بعدی شما

  • بررسی نحوه پیاده‌سازی تیم «Harness» در Deepseek برای درک محیط‌های خودبهینه‌ساز.
  • جایگزینی رویکردهای مبتنی بر پرامپت با ساختارهای اجرایی برای کاهش نرخ خطا.
  • تحلیل توابع تجمیع وظایف در ابزارهای کدنویسی پیشرفته جهت مدیریت حافظه‌ی بلندمدت.

اما تأثیر این لایه‌ی نرم‌افزاری بر هزینه‌های استنتاج (Inference) حتی پیچیده‌تر است — به بررسی ما درباره‌ی بهینه‌سازی‌های سخت‌افزاری در تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این یافته با تکیه بر اعتبار پژوهشی استنفورد و متا، مسیر توسعه‌ی سیستم‌های خودکار را از بهبود مدل به سمت بهینه‌سازی زیرساخت‌های اجرایی تغییر می‌دهد. این رویکرد باعث می‌شود قابلیت اطمینان از یک ویژگی تصادفی به یک خروجی مهندسی‌شده تبدیل شود.

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.