پرش به محتوای اصلی
پرش به محتوای مقاله

«حفظ کیفیت در عین ارزان‌سازی»؛ هدف از معرفی World Model Optimizer

·۵ مرداد ۱۴۰۵۳ دقیقه مطالعه
ساخت مدل‌های بهبودیافته مداوم بر روی ردپای عامل با تقطیر مدل‌های باز پیشرو در گیت‌هاب
ساخت مدل‌های بهبودیافته مداوم بر روی ردپای عامل با تقطیر مدل‌های باز پیشرو در گیت‌هاب
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی یک چرخه بسته‌بندی‌شده (Compiler-like) که داده‌های رفتاری عامل را به‌طور خودکار به مدل‌های کوچک‌تر و ارزان‌تر تبدیل می‌کند، به‌جای تکیه بر تنظیم دستی پرامپت.

اگر امروز برای اجرای عامل‌های هوشمند خود هزینه‌های گزاف API می‌پردازید، باید بدانید که یک استاندارد جدید برای کاهش ۴۰ درصدی این مخارج عملیاتی تعریف شده است. در ۲۶ ژوئیه ۲۰۲۶، شرکت Experiential Labs ابزاری به نام World Model Optimizer (WMO) را عرضه کرد؛ چارچوبی که ردپاهای خام (raw traces) جمع‌آوری شده توسط عامل‌ها را به یک چرخه بهبود مستمر تبدیل می‌کند.

بسیاری از توسعه‌دهندگان هنگام بهینه‌سازی عامل‌ها با چالشی جدی روبرو هستند: تست در دنیای واقعی کند، گران و ریسکی است. WMO این مشکل را با استفاده از مدل‌های جهانی (World Models) برای شبیه‌سازی محیط‌های عامل حل می‌کند. این سیستم به توسعه‌دهندگان اجازه می‌دهد هزاران تکرار (iteration) را بدون به خطر انداختن پایداری محیط عملیاتی یا سوزاندن اعتبارات API تست کنند. تصور کنید یک شبیه‌ساز پرواز برای عامل‌های هوش مصنوعی داشته باشید که در آن هر شکست، به یک نقطه داده آموزشی تبدیل شود.

زمینه پیاده‌سازی

سیستم WMO برای چرخه‌های توسعه بسیار سریع (tight development cycle) طراحی شده است. مدیریت این پروژه با ابزار uv انجام می‌شود، برای بررسی خطاهای کدنویسی (linting) و قالب‌بندی از ruff استفاده می‌کند و جهت بررسی صحت انواع داده‌ها (type checking) از ty بهره می‌برد. تمامی این پروتکل‌ها و کنوانسیون‌های توسعه در فایل AGENTS.md پروژه مستند شده‌اند.

جزئیات فنی

به نقل از مستندات رسمی گیت‌هاب، گردش‌کار WMO در سه گام اصلی اجرا می‌شود:

  • تنظیم مسیر (Route Tuning): کاربران ابتدا ارائه‌دهندگان مدل را ثبت کرده و یک مسیریاب (router) را بر اساس ردپاهای OTel تنظیم می‌کنند. این کار با دستورات wmo build و wmo optimize route sweep انجام می‌شود تا مدل‌ها در وظایف کنار گذاشته شده (held-out tasks) امتیاز بگیرند. کاربران می‌توانند موفقیت این فرآیند را با دستور wmo optimize route report در مقایسه با یک خط أساس (baseline) نظیر gpt-5.5 تأیید کنند.
  • برازش سیاست (Policy Fitting): این ابزار اندازه‌گیری‌های به‌دست‌آمده را به یک سیاست مسیریابی تبدیل می‌کند. برای این کار از رویکرد «k-نزدیک‌ترین همسایه» (knn) از طریق دستور wmo optimize route fit استفاده می‌شود تا در نهایت یک فایل policy.json تولید گردد.
  • تقطیر مدل (Model Distillation): توسعه‌دهندگان می‌توانند از دستور wmo optimize model برای تقطیر یک مدل کوچک‌تر و تخصصی در مجموعه مدل‌های خود استفاده کنند. همچنین امکان استفاده از wmo optimize route pin برای ارائه یک مدل واحد، بدون نیاز به مسیریابی، وجود دارد.

برای محیط‌های پیچیده، WMO با سندباکس‌های E2B ادغام شده است. با نصب افزونه world-model-optimizer[e2b] و ارائه کلید E2B_API_KEY است، توسعه‌دهندگان می‌توانند کارگران Pi واقعی (real pi workers) را در سندباکس‌های ایزوله اجرا کنند. این قابلیت به بهینه‌ساز اجازه می‌دهد تا پرامپت‌ها، ابزارها، سیاست‌ها، مهارت‌ها و کدهای زمان اجرا (runtime code) را تغییر دهد. تنها تغییراتی که از گیت‌های ارزیابی (evaluation gates) خاص عبور کنند، به عنوان «حarness قهرمان» (champion harness) جدید پذیرفته می‌شوند تا تضمین شود که به‌روزرسانی‌ها هرگز باعث کاهش عملکرد نمی‌شوند.

ادغام مدل جهانی

علاوه بر رابط خط فرمان (CLI)، این پلتفرم مدل‌های جهانی یکپارچه‌ای — مانند یک مدل تخصصی برای «خطوط هوایی» — فراهم می‌کند که از طریق API برای شبیه‌سازی نشست‌های (sessions) وظایف خاص در دسترس هستند. این مدل‌ها را می‌توان از طریق کد پایتون (با استفاده از WorldModelStore و load_world_model) یا از طریق پروتکل HTTP و نقاط پایانی مانند POST /world_models/{name}/sessions فراخوانی کرد.

پس از اینکه کاربران دستور wmo login را اجرا کنند، پلتفرم مدیریت اعتبارنامه‌های مدل و سندباکس را بر عهده می‌گیرد. این امر اجازه می‌دهد دستور wmo run مدل‌های جهانی میزبانی‌شده یا harnessهای قهرمان را در E2B، بدون نیاز به کلیدهای API محلی، اجرا کند. کاربران می‌توانند با سوئیچ -u برای همگام‌سازی زنده (live-syncing)، فضای کاری خود را آپلود کنند و با دستورات --detach ،--send و --attach عامل‌های طولانی‌مدت را مدیریت نمایند.

برای حفظ حریم خصوصی، WMO از تله‌متری ناشناس استفاده‌های کاربرد برای جمع‌آوری متادیتا می‌کند. این سیستم به هیچ عنوان پرامپت‌ها، ردپاها، مسیرهای فایل یا اعتبارنامه‌های ارائه‌دهندگان را جمع‌آوری نمی‌کند. کاربران می‌توانند با دستور uv run wmo config telemetry disable (که تنظیمات را در .wmo/settings.toml می‌نویسد) یا با تنظیم متغیر محیطی WMO_TELEMETRY=0 از این قابلیت خارج شوند.

این تغییر رویکرد، پارادایم توسعه را از مهندسی پرامپت (Prompt Engineering) — که شبیه هنر پرسیدن سوال درست از یک مشاور است — به سمت یک «کامپایلر داده‌محور» برای عامل‌ها می‌برد. با تقطیر هوش مدل‌های پیشرو در مدل‌های کوچک‌تر و مسیریابی‌شده، شرکت‌ها می‌توانند بدون آنکه صورت‌حساب‌های ابری آن‌ها به‌صورت خطی با تعداد کاربران رشد کند، گردش کارهای عامل‌محور خود را مقیاس‌پذیر کنند.

برای شروع بهینه‌سازی، توسعه‌دهندگان می‌توانند ابزار را از طریق pip نصب کرده و در پورتال platform.experientiallabs.ai برای مدیریت شناسه‌های عامل و اعتبارنامه‌های سندباکس خود احراز هویت کنند.

گام بعدی شما

  • نصب ابزار WMO از طریق pip و احراز هویت در پورتال platform.experientiallabs.ai
  • تحلیل ردپاهای (traces) فعلی عامل‌های خود برای شناسایی نقاط شکست در محیط‌های شبیه‌سازی‌شده
  • پیاده‌سازی استراتژی تقطیر مدل برای جایگزینی مدل‌های گران‌قیمت در وظایف تکراری

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این ابزار بر اساس تجربه عملی در کاهش هزینه‌های استنتاج، امکان مقیاس‌پذیری تجاری عامل‌های AI را فراهم می‌کند. اعتبار این روش از توانایی آن در تبدیل داده‌های واقعی به مدل‌های تخصصی (Distilled Models) بدون افت کیفیت نشأت می‌گیرد.

تأثیر برای ایران

توسعه‌دهندگان ایرانی که با محدودیت بودجه ارزی برای APIهای گران‌قیمت روبرو هستند، می‌توانند با این متد هزینه استنتاج را کاهش دهند، به شرطی که دسترسی به سندباکس‌های E2B را فراهم کنند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی مهندسی دستی پرامپت با رویکرد کامپایلری، نقطه پایان عصر «حدس و خطا» در طراحی عامل‌هاست. WMO با تبدیل تجربه (Experience) به وزن‌های مدل از طریق تقطیر، در واقعই یک لایه بهینه‌سازی سخت‌افزاری-نرم‌افزاری ایجاد می‌کند که در آن تخصص مدل‌های غول‌پیکر در قالب مدل‌های کوچک و ارزان تثبیت می‌شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.