تصور کنید یک دستیار دیجیتال بتواند برای ثبت یک سفارش، همزمان روی دکمههای یک نرمافزار قدیمی کلیک کند، یک اسکریپت پایتون بنویسد و دادهها را از طریق API به سیستم حسابداری بفرستد. این همان قابلیتی است که اکنون در مدلهای Holo4 محقق شده است. در حالی که اکثر عاملهای هوش مصنوعی فعلی یا به پیمایش رابط گرافیکی (GUI) محدود شدهاند یا تنها قادر به فراخوانی API هستند، Holo4 هر دو قابلیت را در یک مدل واحد ادغام کرده است.
طبق اعلام شرکت H Company در ۲۸ سپتامبر ۲۰۲۶، این معماری جامع اجازه میدهد یک عامل (Agent) — شبیه به کارمندی که هم با نرمافزارهای گرافیکی راحت است و هم زبان برنامهنویسان را میفهمد — بدون نیاز به تعویض مدل، جریانهای کاری حرفهای را در هر رابط کاربری مدیریت کند. این مدل میتواند روی یک دکمه در صفحه کلیک کند، یک اسکریپت پایتون بنویسد و یک API تجاری را فراخوانی کند، بدون اینکه برای مدیریت نرمافزارهای تخصصی نیاز به جابجایی بین مدلهای مختلف داشته باشد.
بیشتر مدلهای عاملمحور فعلی در سیلوهای جداگانه عمل میکنند؛ مدلهای متمرکز بر GUI بدون صفحه نمایش کور هستند و مدلهای فراخوانی ابزار، در صورت نبود API کاربردی ندارند. واقعیت این است که کارهای تجاری واقعی بهندرت تا این حد ساده و تفکیک شده هستند. همانطور که در تحلیلهای قبلی ما دربارهی امنیت مدلهای بازمتن اشاره کردیم، یکپارچگی در دسترسی به ابزارها، کلید رسیدن به اتوماسیون واقعی است. Holo4 با تبدیل رابطهای گرافیکی، کد، پروتکل زمینهٔ مدل (MCP) و API به ابزارهایی قابل تعویض برای انجام یک وظیفه واحد، این گسست را از بین برده است. این رویکرد در حالی مطرح میشود که رقبایی مانند OpenAI نیز با معرفی Agents API سعی در سادهسازی مدیریت زیرساخت عاملهای هوشمند کردهاند.

بر اساس گزارش hcompany.ai، این سری در دو اندازه اصلی عرضه شده است: یک مدل متراکم ۲۷ میلیارد پارامتری (27B dense) و یک مدل ترکیب خبرهها (MoE) با ۳۵ میلیارد پارامتر که ۳ میلیارد پارامتر فعال دارد (35B-A3B). هر دو مدل از طریق API مدلهای H در دسترس هستند. همچنین شرکت مدل Holotron4 Nano را منتشر کرد؛ یک متخصص عاملمحور کوچکتر که بر پایه مدل بنیادی Nemotron 3 Nano Omni ساخته شده است.
تطبیقپذیری با رابطهای مختلف
مدل Holo4 بهعنوان یک اپراتور جهانی طراحی شده است. این مدل میتواند روی صفحات کلیک کند، تایپ کند، کد بنویسد و اجرا کند و ابزارهای MCP یا API را فراخوانی نماید. در واقع مدل بر اساس نیاز هر لحظه، بهینهترین رابط را برای انجام وظیفه خاص انتخاب میکند.
این انعطافپذیری اجازه میدهد Holo4 در محیطهای متنوعی اجرا شود:
- محیطهای دسکتاپ
- مرورگرهای وب
- دستگاههای اندرویدی
- سندباکسهای کدنویسی
- APIهای تجاری
از آنجا که در تمام این پلتفرمها از یک مدل واحد استفاده میشود و نحوه فراخوانی آن یکسان است، کاربر دیگر نیازی ندارد برای هر پلتفرم، مدل متفاوتی را انتخاب کند.
کارایی و بهینگی هزینه
مدل Holo4 سختترین محکهای آکادمیک کنترل دسکتاپ و API را هدف قرار داده است. در محک OSWorld 2.0، مدل ۲۷ میلیارد پارامتری به امتیاز ۶۱.۷٪ رسید. اگرچه این عدد از امتیاز ۸۱.۸٪ مدل Opus 5.5 کمتر است، اما با پارامترهای بهمراتب کمتر و هزینه عملیاتی پایینتر به دست آمده است. مدل ۳۵ میلیارد پارامتری (MoE) نیز در همین محک به امتیاز ۳۰.۹٪ رسید.


در محک AutomationBench برای استفاده از API، مدل Holo4 مستقیماً با مدلهای پیشرو رقابت میکند. نمودارهای هزینه-عملکرد شرکت نشان میدهد که Holo4 جایگاهی غیرقابلجایگزین (non-dominated) را حفظ کرده است و در مقایسه با جایگزینهای بسته، نسبت امتیاز به هزینه بسیار بالاتری را ارائه میدهد.

جزئیات بنچمارکها
برای تضمین شفافیت، شرکت H Company تمام مسیرهای اجرای (Trajectories) مربوط به امتیازات خود را بهصورت بازمتن منتشر کرده است. این دادهها در trajectories.hcompany.ai قابل بازپخش هستند یا میتوان آنها را از Hugging Face دانلود کرد.
جزئیات مربوط به دادههای هزینه-عملکرد به شرح زیر است:
- OSWorld 2.0: هزینهها بر اساس توکنهای ورودی و خروجی در هر اجرای عامل تخمین زده شدهاند. قیمتگذاری Holo4 بر اساس نرخهای API مدلهای H است. هزینههای Qwen3.8 27B بر اساس قیمتهای لیست Alibaba Cloud محاسبه شده و هزینههای Qwen3.6 35B-A3B شامل نرخهای Cache Hit (۲۰٪ قیمت ورودی) است.
- AutomationBench: مدلهای Holo4، Qwen3.8 27B و Qwen3.6 35B-A3B با استفاده از نسخه v1.0.6 در یک محیط داخلی اندازهگیری شدهاند. سایر مدلها از امتیازات مجموعههای عمومی در README و هزینههای رسمی لیدربورد از مجموعه خصوصی استفاده کردهاند.
- مدلهای مرجع: امتیازات Opus 5 (۷۰.۲٪) و GPT-5.6 Sol (۶۶.۲٪) با استفاده از پاداشهای جزئی حداکثری (max-effort partial rewards) در مجموعه آفلاین v2026.08.08 از نمودار عرضه OpenAI استخراج شده است.
کارخانه تولید وظایف عاملمحور
برای رسیدن به این سطح از تطبیقپذیری، شرکت از یک «کارخانه تولید وظایف» (Agentic Task Factory) داخلی استفاده کرد. این خط لوله، محیطهای تعاملی و وظایف قابل تأیید را تنها با استفاده از مستندات و اسکرینشاتهای وبسایتهای واقعی یا نرمافزارهای بازمتن تولید میکند.

این سیستم حدود ۱۰,۰۰۰ وظیفه در محیطهای وب، سرورهای MCP و دسکتاپ ایجاد کرد. برخی از این محیطها ترکیبی هستند؛ یعنی مدل باید وضعیت یک برنامه را بهطور همزمان از طریق GUI و سرور MCP مدیریت کند. این تمرکز بر بهینهسازی جریان دادهها یادآور توسعه HFlow است که پیشتر برای حذف گلوگاههای پردازش دادههای چندوجهی در رباتیک معرفی شد.
آموزش و زیرساخت
فرآیند آموزش شامل تنظیم نظارتشده (SFT) روی ۱۲۷ میلیارد توکن و استفاده از دو متخصص یادگیری تقویتی (RL) برای ایجاد مدل نهایی ادغامشده بود.

علاوه بر وزنهای مدل، تیم توسعهدهنده محیط اجرای (Harness) خود را بازسازی کرد. این حلقه، پنجره زمینه (Context Window) — شبیه به میز کاری که مدل برای پردازش اطلاعات در لحظه در اختیار دارد — را در صدها گام مدیریت میکند. ارتقاهای کلیدی شامل حافظه بلندمدت قابلاعتماد و دسترسی مستقیم به شل (Shell) دسکتاپ برای افزایش پایداری است.

نمونههای کاربردی در دنیای واقعی
مدل Holo4 27B در وظایف پیچیده نرمافزاری پیشرفتهای چشمگیری نسبت به مدل پایه (Qwen3.8 27B) نشان داده است:
- مدلسازی سهبعدی (برج ایفل): در نرمافزار FreeCAD، این مدل یک مدل مقیاسشده (۱ میلیمتر به ۱ متر) را در مرکز مختصات ساخت. مدل محدودیتهای هندسی سختگیرانهای را دنبال کرد: پلانهای مربعی در هر ارتفاع، عرضهای نیمه مشخص (۶۲.۵ میلیمتر در زمین، ۳۲.۵ در ارتفاع ۵۷، ۱۷.۵ در ارتفاع ۱۱۵ و ۹.۳۵ در ارتفاع ۲۷۶) و یک دکل از ارتفاع ۲۷۶ تا ۳۲۴. این عملیات در ۸۴ فراخوانی (۱.۳ میلیون توکن) انجام شد، در حالی که Qwen3.8 27B در ۶۰ فراخوانی (۱.۰ میلیون توکن) این کار را انجام داد اما فاقد دقت مشابه بود.
- طراحی لوگو: مدل توانست لوگوی شرکت H را در FreeCAD طراحی کند؛ یک دیسک توپر در کنار یک حرف H بزرگ با فونت sans-serif بلوکی که هر دو با ضخامت یکسان اکسترود شده و به رنگ سیاه درآمده بودند. Holo4 27B از ۹۴ فراخوانی (۱.۵ میلیون توکن) استفاده کرد و از مدل پایه که به ۱۱۸ فراخوانی (۱.۹ میلیون توکن) نیاز داشت، پیشی گرفت.
- توسعه بازی (Pac-Man): در موتور Godot، یک بازی کامل Pac-Man با هوش مصنوعی برای بازیکن و ارواح ساخته شد. بازی شامل یک مارپیچ مستطیلی، پلتها، سه روح تعقیبکننده و یک بازیکن مبتنی بر اکتشاف (heuristic) بود که به سمت پلتها حرکت میکرد مگر اینکه روحی نزدیک باشد. این کار در ۶۸ فراخوانی (۲.۴ میلیون توکن) و ۲۶۸ خط کد انجام شد، در حالی که Qwen3.8 27B به ۱۹۷ فراخوانی (۱۱.۴ میلیون توکن) و ۳۲۷ خط کد نیاز داشت.
نسخه Nano و آینده اپراتورهای جهانی
بهعنوان بخشی از ائتلاف NVIDIA Nemotron، شرکت H Company پشته پسآموزش خود را روی مدل Nemotron 3 Nano Omni اعمال کرد. نتیجه، مدل Holotron4 Nano است که در جریانهای کاری GUI و محیطهای MCP پیشرفتهای قابلتوجهی (به صورت درصد مطلق) نسبت به مدل پایه دارد.

این موضوع ثابت میکند که «دستور پخت» مدلهای عاملمحور وابسته به اندازه مدل نیست. یک مدل کوچک را میتوان با همان استراتژی آموزشی مدلهای بزرگ، به یک متخصص عاملمحور تبدیل کرد.
این چرخش نشان میدهد آینده عاملهای هوش مصنوعی در مدلهای بزرگتر نیست، بلکه در آموزشهای مستقل از رابط کاربری (interface-agnostic) است. با حذف نیاز به انتخاب مدلهای مختلف برای اندروید، وب یا دسکتاپ، ما به سمت مدل «اپراتور جهانی» حرکت میکنیم.
برای کاربر نهایی، این یعنی تأخیر کمتر و هزینه پایینتر برای اتوماسیونهای پیچیده. دیگر نیازی به یک لایه ارکستراسیون پیچیده نیست تا تصمیم بگیرد وظیفهای نیاز به API دارد یا کلیک روی صفحه؛ خودِ مدل در لحظه تصمیم میگیرد.
توسعهدهندگان اکنون میتوانند وزنهای مدل را در فرمتهای BF16، FP8، NVFP4 و GGUF ۴-بیتی از Hugging Face دریافت کنند. انتظار میرود نقاط بازرسی بهینهشده DSpark برای افزایش سرعت استنتاج (Inference) — همان لحظه تولید جواب توسط مدل — بهزودی منتشر شوند.
منتظر ارزیابی مجموعه خصوصی (private set) مدل Holo4 در AutomationBench باشید تا ببینیم آیا این پیشرفتهای مدلهای بازمتن در برابر دادههای غیرعمومی نیز پابرجا میمانند یا خیر.




گفتگو