پرش به محتوای اصلی
پرش به محتوای مقاله

«کالایی‌شدن ارکستراسیون»؛ استراتژی جدید OpenAI و DeepSeek در مدیریت عامل‌ها

·۳۰ مرداد ۱۴۰۵۷ دقیقه مطالعه۲ بازدید
پس از متن‌باز شدن چارچوب: اسکلت عامل دیگر خندق دفاعی نیست، مدل قابل تعویض است
پس از متن‌باز شدن چارچوب: اسکلت عامل دیگر خندق دفاعی نیست، مدل قابل تعویض است
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کالایی شدن (Commoditization) لایه‌ی ارکستراسیون عامل‌ها؛ برای نخستین بار ابزارهای مدیریت وضعیت و اجرای ابزار توسط دو رقیب اصلی متن‌باز شدند تا رقابت صرفاً بر سر قدرت مدل‌های زیربنایی باشد.

اگر تصور می‌کنید ضعف عملکرد عامل‌های هوش مصنوعی همیشه تقصیر مدل است، احتمالاً در اشتباهید. داده‌های جدید نشان می‌دهد که گلوگاه واقعی در لایه‌ی ارکستراسیون است، نه لزوماً در هوشِ مدل. در واقع، خندق رقابتی برای عامل‌های هوش مصنوعی از حلقه‌ی ارکستراسیون به خودِ مدل منتقل شده است.

در ۱۹ اوت ۲۰۲۶، شرکت OpenAI هارنس Codex را تحت لایسنس Apache-2.0 منتشر کرد و بدین ترتیب لایه‌ی پیچیده‌ی حلقه‌های عامل، اجرای ابزارها و مدیریت وضعیت را به یک زیرساخت عمومی تبدیل کرد. این اقدام تنها شش روز پس از آن رخ داد که DeepSeek هارنس خود یعنی DeepSeek Harness v0.1 را تحت لایسنس MIT و بر پایه‌ی سیستم پلاگین Cordis عرضه کرد. طبق گزارش‌های منتشر شده، نسخه‌ی DeepSeek در همان ساعات نخست انتشار، ۲۳ هزار ستاره در گیت‌هاب دریافت کرد. برای توسعه‌دهندگان، این یعنی «اسکلت» یک سیستم عامل اکنون به یک کالای عمومی (Commodity) تبدیل شده و مدل تنها به یک قطعه‌ی قابل تعویض تقلیل یافته است.

برای درک اثر واقعی این معماری، می‌توان به مطالعه‌ای در ماه مه اشاره کرد که گرگ بروکمن مجدداً آن را بازنشر کرد. شرکت Thrive Holdings و شبکه‌ی حسابداری Crete Professionals Alliance (که در ژوئن به Current تغییر نام داد)، یک سیستم آماده‌سازی مالیاتی را بر پایه‌ی Codex ساختند. بر اساس مستندات این پروژه، این سیستم ۷ هزار اظهارنامه را پردازش کرد و زمان آماده‌سازی حسابداران را تقریباً یک‌سوم کاهش داد. ارزش ایجاد شده در اینجا نه از یک مدل جدید، بلکه از «هارنس» (Harness) حاصل شد؛ همان لایه‌ای که مدل را در بر می‌گیرد و وظایف جمع‌آوری زمینه، محیط ایزوله (Sandboxing) و جریان‌های تأیید را مدیریت می‌کند.

همان‌طور که در تحلیل قبلی ما درباره‌ی هزینه‌های پنهان مهاجرت به مدل‌های ارزان اشاره کردیم، این چرخش یک تنش جدید را آشکار می‌کند: در حالی که لایه‌ی ارکستراسیون اکنون رایگان است، هزینه‌های استنتاج (Inference) همچنان نوسانی و انحصاری باقی مانده‌اند. صنعت به سمتی می‌رود که «چگونگی» اجرای عامل استاندارد شود، اما «چه کسی» (مدل) همچنان یک سرویس پولی باشد.

قدرت لایه‌ی هارنس

بسیاری از توسعه‌دهندگان تصور می‌کنند عملکرد ضعیف عامل‌ها ناشی از شکست مدل است. با این حال، OpenAI ثابت کرد که لایه‌ی ارکستراسیون یا همان هارنس، اغلب گلوگاه اصلی است. به نقل از یک پست فنی اخیر این شرکت، تغییر تنها دو تنظیم در هارنس — یعنی «استدلال حفظ‌شده» (Preserved Reasoning) و «فشرده‌سازی زمینه» (Context Compaction) — امتیازات ARC-AGI-3 را برای مدل GPT-5.6 Sol سه برابر کرد.

به‌طور مشخص، امتیاز این مدل بدون هیچ‌گونه آموزش مجدد یا تغییر در خود مدل، از ۱۳.۳٪ به ۳۸.۳٪ جهش کرد. هم‌زمان، تعداد توکن‌های خروجی به حدود یک‌ششم مقدار اولیه کاهش یافت. این موضوع ثابت می‌کند بخش بزرگی از هزینه‌های هوش مصنوعی و افت عملکرد، از طریق معماری قابل بازیابی است، نه لزوماً ارتقا به مدل‌های گران‌تر. این یافته نشان می‌دهد ما عادت کرده‌ایم نتایج بد را به گردن مدل بیندازیم، در حالی که راه حل در ارکستراسیون بیرونی نهفته بود. این اهمیت مدیریت لایه‌ی ارکستراسیون را بیشتر می‌کند، چرا که عدم کنترل بر رفتار عامل‌ها می‌تواند منجر به حوادث امنیتی شود؛ مشابه آنچه در نبرد OpenAI با عامل‌های هکری خودجوش مشاهده شد.

معماری فنی: اپ-سرور (App-Server)

انتشار اخیر OpenAI صرفاً یک فریم‌ورک نیست، بلکه سه سطح ادغام مجزا را معرفی می‌کند: لایه‌ی اجرا، SDK و اپ-سرور. انتخاب سطح اشتباه می‌تواند منجر به مهندسی بیهوده و هزینه‌بر شود.

پس از متن‌باز شدن چارچوب: اسکلت عامل دیگر خندق دفاعی نیست، مدل قابل تعویض است

اپ-سرور حیاتی‌ترین بخش است و هم به‌عنوان یک پروتکل و هم به‌عنوان یک فرآیند طولانی‌مدت عمل می‌کند. ترکیب داخلی آن شامل موارد زیر است:

  • یک خواننده‌ی stdio
  • یک پردازشگر پیام
  • یک مدیر رشته (Thread Manager)
  • رشته‌های هسته (جایی که مدیر برای هر رشته، یک نشست هسته ایجاد می‌کند)

این پروتکل دوطرفه است؛ به این معنا که سرور می‌تواند درخواست‌هایی را آغاز کند — مثلاً درخواست تأیید انسانی — و نوبت را تا پاسخ کلاینت متوقف کند.

OpenAI اعتراف کرد که در ابتدا در تلاش برای استفاده از پروتکل زمینه مدل (MCP) به‌عنوان سرور اصلی اشتباه کرده است. آن‌ها دریافتند که معناشناسی MCP برای تعاملات غنی مورد نیاز IDEها، مانند به‌روزرسانی‌های diff، کاوش در فضای کاری و استدلال‌های جریانی (Streamed Reasoning) ناکافی است. در نتیجه، آن‌ها یک پروتکل سفارشی JSON-RPC را برای ستون فقرات محصول توسعه دادند. این یک درس مهم است: MCP برای تبدیل یک عامل به یک ابزار قابل فراخوانی مناسب است، اما برای تبدیل عامل به ستون فقرات یک محصول، گزینه ضعیفی است. این ضعف در کنترل دقیق دسترسی‌ها می‌تواند ریسک‌های جدی ایجاد کند، همان‌طور که پیش‌تر دیدیم چگونه مدل‌های OpenAI با بهره‌برداری از Zero-Dayها به زیرساخت Hugging Face نفوذ کردند.

برای نمایش این قابلیت، OpenAI داشبورد عملیات لجستیکی Relay را عرضه کرد. در Relay، عامل داده‌های زنده را از طریق ابزارهای MCP خودِ اپلیکیشن می‌کشد، اما کاربر به‌جای یک پرامپت خالی، از طریق اقدامات پیشنهادی (مثلاً «مقایسه گزینه‌های بازیابی») تعامل می‌کند. هر اقدام حساس در سطح نوشتن، مانند رزرو مجدد یک محموله، پیش از اجرا از یک جریان تأیید انسانی اجباری عبور می‌کند. این الگو در حال حاضر توسط GitHub و JetBrains در جریان‌های کاری‌شان و توسط Cisco در App Builder پذیرفته شده است.

چشم‌انداز اقتصادی جدید

با کالایی شدن لایه‌ی اسکلت، فشار هزینه به‌طور کامل به لایه‌ی مدل منتقل شده است. چشم‌انداز فعلی به دو سطح تقسیم می‌شود:

  • لایه‌ی اسکلت: هزینه صفر، متن‌باز و به‌راحتی قابل جایگزینی. نمونه‌ها شامل Codex harness، DeepSeek Harness و Claude Agent SDK است.
  • لایه‌ی مدل: بسته، محاسبه‌شده بر اساس توکن و دارای قیمت نوسانی.

این نوسانات در اوت ۲۰۲۶ به‌وضوح دیده شد. در ۱۶ اوت، خانواده V4 شرکت DeepSeek قیمت‌گذاری «ساعات اوج و غیر اوج» (شروع از ۱۶:۰۰ UTC) را معرفی کرد که در آن قیمت خروجی در ساعات اوج از ۰.۸۷ به ۳.۹۶ دلار به‌ازای هر میلیون توکن افزایش یافت و قیمت ورودی‌های دارای کش (Cache-hit) حتی شدیدتر افزایش یافت. هم‌زمان، GLM-5.3 در ۱۸ اوت با قیمت ۱.۴۰/۴.۴۰ دلار عرضه شد و Grok 4.6 در ۱۹ اوت روی Amazon Bedrock با قیمت ۲/۶ دلار، پنجره زمینه ۵۰۰ هزار توکنی و چهار تنظیم سطح تلاش برای استدلال (Reasoning-effort) وارد بازار شد.

مهندسی برای قابلیت تعویض

از آنجا که هارنس اکنون یک کالای عمومی است، چالش اصلی مهندسی، حفظ یک بک‌اند قابل تعویض است. چون هارنس‌های Codex و DeepSeek دسترسی به مدل را از طریق پیکربندی (Configuration) و نه کدنویسی سخت (Hardcoding) تزریق می‌کنند، توسعه‌دهندگان می‌توانند از یک لایه‌ی مسیریابی (Routing Layer) برای مدیریت ارکستراسیون چندمدلی استفاده کنند.

با استفاده از ابزاری مانند wrouter.ai، توسعه‌دهندگان می‌توانند هارنس خود را به یک URL پایه متصل کنند. این اجازه می‌دهد وظایف بر اساس دشواری تقسیم شوند:

۱. سطح ارزان: گام‌های کوچک و پرتکرار (مانند خواندن یک فایل، اجرای grep یا فرمت کردن یک diff) به deepseek-v4-flash مسیریابی می‌شوند.
۲. سطح پرچم‌دار: استدلال‌های بلندمدت (مانند بازسازی یک ماژول و پیشنهاد طرح مهاجرت) به claude-opus-5 ارسال می‌شوند.

برای کسانی که از مسیر اپ-سرور Codex استفاده می‌کنند، این مورد در فایل config.toml مدیریت می‌شود. با تعریف یک ارائه‌دهنده مدل مانند wrouter با base_url و env_key اختصاصی، منطق داخلی رشته‌ها، تأییدها و محیط ایزوله‌ی هارنس دست‌نخورده باقی می‌ماند در حالی که مدل عوض می‌شود.

این رویکرد سه مشکل بحرانی در محیط عملیاتی را حل می‌کند:

  • پایداری: حالت‌های شکست عامل با چت متفاوت است. در چت، خطای ۴۲۹ فقط نیاز به تلاش مجدد دارد. در یک عامل، یک Timeout می‌تواند یک وظیفه چندمرحله‌ای چهل دقیقه‌ای را نابود کرده و کل مسیر (Trajectory) را آلوده کند. لایه‌ی مسیریابی یک سطح ثابت فراهم می‌کند در حالی که مدل‌های بالادستی نوسان دارند.
  • پوشش: تنها در این هفته سه نقطه اتصال جدید (GLM-5.3، Grok 4.6 و DeepSeek V4 Pro 0813) ایجاد شد. یک کاتالوگ یکپارچه باعث می‌شود تست A/B به‌جای ایجاد حساب‌های جدید و فرآیندهای تأیید، تنها با تغییر یک رشته متنی مدل انجام شود.
  • صورت‌حساب یکپارچه: یک وظیفه واحد عامل می‌تواند ده‌ها فراخوانی در سطوح مختلف ایجاد کند. وقتی هزینه‌ها در پنج فاکتور مختلف پخش شوند، محاسبه هزینه یک ویژگی خاص غیرممکن است. یک فاکتور واحد به توسعه‌دهندگان اجازه می‌دهد هر سطح مصرف را در یک جدول ببینند و تصمیم بگیرند کدام گام‌ها را به مدل‌های ارزان‌تر منتقل کنند.

چرخش در تمایز رقابتی

با متن‌باز کردن هارنس، OpenAI روی این شرط‌بندی کرده است که دور بعدی رقابت در لایه‌ی ارکستراسیون رخ خواهد داد. Anthropic نیز شرط مشابهی را با Claude Agent SDK و MCP زده است. اما برای توسعه‌دهنده، این یعنی هر تمایز منحصربه‌فردی که در «اسکلت» سیستم ساخته شود، به‌سرعت توسط جامعه‌ی متن‌باز هم‌سطح می‌شود.

قابلیت اطمینان و هزینه اکنون کاملاً به رابط مدل وابسته است — اینکه چقدر پایدار متصل می‌شود، چقدر میدان را پوشش می‌دهد و چقدر شفاف مصرف را گزارش می‌کند. مرکز ثقل مهندسی از «چگونه یک حلقه بنویسیم» به «چگونه خروجی مدل را مدیریت کنیم» منتقل شده است.

اگر امروز در حال ادغام این هارنس‌ها هستید، فوری‌ترین گام این است که پیش از نوشتن حتی یک خط منطق عامل، لایه‌ی خروجی مدل (Model Exit) خود را پاک‌سازی کنید. با متصل کردن base_url خود به wrouter.ai و اجرای کل کاتالوگ از طریق یک کلید و یک فاکتور، می‌توانید هارنس خود را بدون قفل شدن در آپ‌تایم یا جهش‌های قیمتی یک فروشنده واحد، بهینه کنید.

گام بعدی شما

  • پیش از نوشتن حتی یک خط منطق عامل، لایه‌ی خروجی مدل (Model Exit) خود را پاک‌سازی و استاندارد کنید.
  • base_url خود را به یک مسیریاب مانند wrouter.ai متصل کنید تا بدون وابستگی به آپ‌تایم یا جهش قیمت یک فروشنده، هارنس خود را بهینه کنید.
  • وظایف سیستم خود را به دو دسته‌ی «گام‌های سریع» و «استدلال‌های عمیق» تقسیم کرده و برای هر کدام مدل متفاوتی تعریف کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این حرکت با تکیه بر اعتبار فنی OpenAI و DeepSeek، استانداردهای ساخت عامل‌ها را یکسان می‌کند و مانع از انحصار در لایه‌ی مدیریت ابزار می‌شود. در نتیجه، توسعه‌دهندگان دیگر مجبور به انتخاب بین یک اکوسیستم خاص نیستند و می‌توانند بر اساس هزینه و کیفیت، مدل خود را در لحظه عوض کنند.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، توسعه‌دهندگان ایرانی می‌توانند با استفاده از هارنس‌های متن‌باز و لایه‌های مسیریابی، بدون وابستگی به یک اکوسیستم خاص، عامل‌های خود را روی مدل‌های مختلف (از جمله مدل‌های ارزان‌تر) پیاده‌سازی کنند.

·نگاه ما
تحریریه دات‌هوش

تمرکز رقابت در دنیای عامل‌ها از «ساخت ابزار» به «مدیریت مصرف» تغییر کرده است. وقتی لایه‌ی ارکستراسیون به یک کالای عمومی تبدیل شود، برنده کسی نیست که بهترین حلقه را نوشته، بلکه کسی است که بتواند با کمترین هزینه، پایدارترین اتصال را به مدل‌های مختلف برقرار کند. این یعنی مهندسی عامل‌ها از یک هنر معماری به یک مسئله‌ی بهینه‌سازی هزینه و پایداری تبدیل شده است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.