پرش به محتوای اصلی
پرش به محتوای مقاله

شکاف خروجی در عامل‌های هوش مصنوعی؛ چرا مدل‌ها نمی‌توانند فایل تولید کنند؟

·۱۹ مرداد ۱۴۰۵۶ دقیقه مطالعه۱ بازدید
نصب دسته‌ای مهارت‌های عامل هوشمند، اما هنوز نتوانست فایلی را به من بدهد.
نصب دسته‌ای مهارت‌های عامل هوشمند، اما هنوز نتوانست فایلی را به من بدهد.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی یک CLI یکپارچه (bl) برای تبدیل عامل‌های متنی به تولیدکنندگان فایل‌های چندوجهی؛ این اولین گام عملی برای عبور از محدودیت خروجی متنی در اکوسیستم عامل‌هاست.

تصور کنید یک معمار تراز اول دارید که می‌تواند هر جزئیاتی از ساختمان را با دقت وصف کند، اما حتی یک نقشه ساده روی کاغذ به شما نمی‌دهد. این دقیقاً وضعیت فعلی بسیاری از توسعه‌دهندگانی است که از موج جدید مهارت‌های عامل‌ها استفاده می‌کنند؛ جایی که اکوسیستم به‌شدت به نفع قابلیت‌های ورودی پیش رفته و مسیرهای خروجی واقعی را فراموش کرده است. در واقع، عاملی که کل کدبیس شما را می‌فهمد اما نمی‌تواند حتی یک فایل PNG ساده تحویل دهد، ابزاری است که با یک سقف محدود متولد شده است.

به نقل از گزارش‌های اخیر، مشکل عامل‌ها از زوال شناختی به فقدان «عاملیت فیزیکی» تغییر کرده است. همان‌طور که در تحلیل قبلی ما درباره‌ی شکست عامل‌ها در مقیاس واقعی اشاره کردیم، اکثر مهارت‌های محبوب امروز صرفاً مانند فیلتر یا مترجم عمل می‌کنند. آن‌ها به عامل (Agent) — شبیه دستیاری که فقط می‌تواند یادداشت بردارد و ترجمه کند — کمک می‌کنند تا بهتر بخواند یا موجزتر صحبت کند، اما در مرز متن متوقف می‌شوند. این یعنی ما با ابزارهایی روبرو هستیم که در تحلیل عالی‌اند اما در اجرا ناتوان.

حبابِ سمتِ ورودی

بر اساس بررسی مخازن گیت‌هاب در هفته‌ی آخر ژوئیه ۲۰۲۶، این عدم توازن کاملاً مشهود است. سه مورد از ۲۰ مخزن با سریع‌ترین رشد، مهارت‌هایی بودند که فقط برای ورودی و ساختار طراحی شده‌اند:

  • graphify (با ۴۹۰۰ ستاره): این ابزار کدبیس‌ها، مستندات و فایل‌های PDF را به گراف دانش (Knowledge Graph) تبدیل می‌کند تا مدل بتواند آن‌ها را جست‌وجو کند. این کار از طریق local tree-sitter AST انجام می‌شود و چون به‌صورت محلی اجرا می‌گردد، هیچ داده‌ای از دستگاه خارج نمی‌شود.
  • hallmark (با ۴۸۰۰ ستاره): این مهارت صرفاً برای حذف زوائد متنی تولیدشده توسط AI (یا همان AI-slop) از بخش‌های طراحی و کپی‌رایت طراحی شده است تا استایل بصری و متنی را مدیریت کند.
  • i-have-adhd (با ۳۲۷۰ ستاره): این ابزار مانع از این می‌شود که عامل پاسخ اصلی را زیر سه پاراگراف مقدمه و توضیحات اضافی دفن کند و مستقیماً به سراغ اصل مطلب برود.

این ابزارها در کنار find-skills (با بیش از ۶۰ هزار مشترک)، درک عمیقی از قصد کاربر ایجاد می‌کنند. در واقع، نیمی از آموزش‌های مربوط به find-skills اکنون با این توصیه شروع می‌شوند که «ابتدا این یکی را نصب کنید».

اما مشکل اینجاست که این ابزارها فقط متن یا تحلیل داده تولید می‌کنند. وقتی کاربر یک تصویر کاور یا یک فایل صوتی (Voiceover) می‌خواهد، عامل معمولاً ابزارهای خارجی را پیشنهاد می‌دهد، چون راهی برای تحویل مستقیم فایل ندارد. در اینجا عامل «شانه خالی» نمی‌کند، بلکه صرفاً هیچ مسیری برای تحویل فیزیکی فایل در اختیار ندارد.

نصب انبوهی از مهارت‌های عامل هوشمند، اما هنوز نتوانست یک فایل را به من بدهد.

پر کردن شکاف خروجی با Model Studio

برای حل این مشکل، تیم Model Studio در شرکت علی‌بابا مخزنی از مهارت‌ها را تحت لایسنس Apache-2.0 منتشر کرده است (modelstudioai/skills) که به‌طور خاص روی خروجی تمرکز دارد. این مجموعه شامل قابلیت‌های تصویر، گفتار، ویدیو و بینایی است که همگی از طریق یک رابط خط فرمان (CLI) واحد به نام bl در دسترس هستند.

توسعه‌دهندگان می‌توانند این قابلیت‌ها را با دستورات npx skills add modelstudioai/skills و npx skills add modelstudioai/cli --all -g نصب کنند. این setup به Node.js نسخه ۱۸ به بالا و یک کلید API نیاز دارد. پس از نصب، عامل دیگر ابزار پیشنهاد نمی‌کند، بلکه مستقیماً فراخوانی‌های لازم برای تولید فایل را سازماندهی می‌کند.

برای مثال، تولید یک تصویر فنی اکنون با فراخوانی مستقیم bl image generate و استفاده از مدل‌هایی مثل qwen-image-2.0-pro انجام می‌شود. یک پرامپت برای «کاور مقاله فنی، پس‌زمینه تیره، متن عنوان در مرکز» اکنون منجر به ترکیبی می‌شود که در آن هم عنوان و هم زیرعنوان بدون نیاز به یک مرحله ویرایشی مجدد برای قرار دادن متن روی تصویر، دقیقاً در جای درست قرار دارند.

نکات فنی CLI ابزار bl

پیاده‌سازی این مهارت‌ها نیازمند دقت در رفتارهای خاص CLI است تا از شکست‌های خاموش (Silent Failures) جلوگیری شود:

  • سایز تصویر: پرچم --size نسبت‌ها (مثل ۱۶:۹) یا پیکسل‌ها را که با علامت ستاره به هم متصل شده‌اند (۱۲۸۰*۷۲۰) می‌پذیرد. استفاده از 'x' استاندارد (۱۲۸۰x۷۲۰) ممکن است در محیط محلی کار کند، اما اجرای دستور با --dry-run --output json نشان می‌دهد که مقدار "1280x720" عیناً در بدنه درخواست ارسال می‌شود که ممکن است باعث خطا شود. اگر در حال اسکریپت‌نویسی هستید، باید این مقدار را در ورودی نرمال‌سازی کنید.
  • واترمارک: پرچم --watermark به‌صورت پیش‌فرض روی true است؛ برای دریافت خروجی‌های حرفه‌ای و بدون علامت، باید صراحتاً آن را روی false تنظیم کنید.
  • سنتز گفتار: کاربران باید ابتدا دستور --list-voices را اجرا کنند تا شناسه‌های معتبر (مانند longxiaochun_v3 ، longcheng_v3 یا longtian_v3) را دریافت کنند. این صداها دوزبانه (انگلیسی/चीनी) هستند. همچنین این ابزار از پرچم --rate (در بازه ۰.۵ تا ۲.۰) به‌جای پرچم رایج --speed استفاده می‌کند.
  • وظایف بینایی: ساختار دستورات سلسله‌مراتبی است؛ مثلاً bl vision describe برای تبدیل پیام‌های خطا یا استک‌فریم‌های موجود در اسکرین‌شات‌ها به متن استفاده می‌شود. مسیرهای محلی فایل‌ها مستقیماً کار می‌کنند و آپلود در داخل خود دستور انجام می‌شود.
  • ویدیوهای ناهمگام: تولید ویدیو به‌صورت Async است و یک جریان سه‌مرحله‌ای را می‌طلبد: ابتدا bl video generate و سپس دریافت وضعیت با bl video task get و در نهایت دانلود فایل با bl video download با استفاده از یک Task ID خاص. توجه داشته باشید که مقدار پیش‌فرض --poll-interval متفاوت است: ۵ ثانیه برای تولید، اما ۱۵ ثانیه برای ویرایش و ارجاع.

مشکل مسیریابی مانیفست

طبق مستندات Claude Code در ژوئیه ۲۰۲۶، بسیاری از کاربران متوجه می‌شوند مهارت‌های نصب‌شده هرگز اجرا نمی‌شوند. این اتفاق به دلیل نحوه ساخت مانیفست توصیفات در ابتدای هر جلسه است.

دو عامل کلیدی در این رفتار نقش دارند:
۱. توصیف به‌عنوان کلید مسیریابی: فیلد Description صرفاً یک راهنمای متنی (Docstring) نیست؛ عامل فایل‌های مهارت را نمی‌خواند تا قصد کاربر را استنباط کند، بلکه آن‌ها را با توصیفات تطبیق می‌دهد. مهارت‌هایی که سناریوهای فعال‌سازی و کلمات کلیدی را صریحاً ذکر کرده‌اند، با دقت و قابلیت اطمینان بسیار بیشتری انتخاب می‌شوند.
۲. مانیفست شروع جلسه: مانیفست فقط در ابتدای جلسه ساخته می‌شود. هر مهارتی که در میان گفتگو نصب شود، برای عامل نامرئی می‌ماند. بنابراین ری‌استارت کردن جلسه یک ضرورت فنی است، نه یک باور قدیمی.

لازم به ذکر است که مهارت‌های Claude Code از استاندارد باز Agent Skills پیروی می‌کنند، به این معنی که مدل ذهنی آن‌ها هنگام جابه‌جایی بین پلتفرم‌های مختلف AI (Harnesses) حفظ می‌شود.

هزینهٔ عاملیت

انتقال از مهارت‌های متنی به فراخوانی‌های خروجی، ریسک مالی جدیدی ایجاد می‌کند: این عامل است که تصمیم می‌گیرد چند فراخوانی هزینه‌بر انجام دهد. برای مثال، درخواست سه گزینه برای تصویر کاور، منجر به سه هزینه مجزا در صورت‌حساب شما می‌شود.

برای مدیریت این موضوع، ابزار bl حفاظ‌هایی را فراهم کرده است:

  • bl usage freetier --all: توقف خودکار عملیات هنگام اتمام سهمیه رایگان.
  • bl usage free --expiring 30: بررسی تاریخ انقضای سهمیه (که نیازمند اجرای bl auth login --console در ابتدا است).
  • bl usage stats --days 30: ردیابی میزان مصرف در ۳۰ روز اخیر.

کاربران باید دو نکته را بدانند: اول اینکه سهمیه رایگان دائمی نیست و بسته به منطقه جغرافیایی و تخصیص مدل تغییر می‌کند. دوم اینکه سهمیه‌ها به یکدیگر منتقل نمی‌شوند؛ اگر سهمیه یک مدل تمام شود، سیستم به‌طور خودکار به مدل دیگر که بودجه دارد سوئیچ نمی‌کند و کاربر باید پارامتر مدل را دستی تغییر دهد.

تحلیل: سقفِ ابزارها

این تغییر یک حقیقت بنیادی درباره هوش مصنوعی عامل‌محور را فاش می‌کند: سقف توانایی یک عامل، توسط ابزارهایی که در دست دارد تعریف می‌شود. در حالی که مدل‌های استدلالی پیشرفت کرده‌اند، کاربرد یک عامل با توانایی تعامل او با دنیای دیجیتال محدود است. graphify به آن چشم می‌دهد تا ساختار کد را ببیند، hallmark به آن سلیقه می‌دهد و ابزارهای خروجی اجازه می‌دهند محصول نهایی را تحویل دهد.

برای یک توسعه‌دهنده، ارزش یک استک AI دیگر فقط به هوش مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب می‌دهد — نیست، بلکه به گستردگی «مسیرهای خروجی» آن بستگی دارد. افزودن مهارت‌های چندوجهی، عامل را از یک مشاور به یک تولیدکننده تبدیل می‌کند. در این مسیر، مدیریت دسترسی‌های عامل برای جلوگیری از تغییرات ناخواسته در کدبیس حیاتی است؛ موضوعی که در بررسی ۵ حفاظ فنی برای جلوگیری از تخریب مخازن کد به‌طور مفصل به آن پرداختیم.

با این حال، این راهکار برای همه مناسب نیست. اگر کنترل دقیق روی ترکیب‌بندی یا استایل‌های دسته‌ای (Batch-consistent) نیاز دارید، یک گراف Node در ComfyUI محلی، علی‌رغم هزینه GPU و نگهداری، همچنان برتر است. همچنین اگر کار شما صرفاً کد و متن است، این مهارت‌ها فقط فضای پنجره متنی (Manifest Context) را اشغال می‌کنند بدون اینکه ارزشی بیافزایند.

یک کاربرد نهایی: مخزن Model Studio فهرستی از مهارت‌های تاییدشده از Anthropic, Vercel و Google Labs را نیز نگهداری می‌کند. این مهارت‌ها در دسته‌های مدیریت مهارت، کد، طراحی، مستندات، ویدیو و تست گروه‌بندی شده‌اند و بر اساس تایید تیم Model Studio علامت‌گذاری شده‌اند. برای کسانی که در مرحله جست‌وجوی ابزار هستند، این فهرست زمان‌بر بودن فرآیند را به‌شدت کاهش می‌دهد.

پر کردن شکاف میان درک و تولید به این معناست که عامل دیگر فهرستی از ابزارها را پیشنهاد نمی‌کند، بلکه خودِ فایل را تحویل می‌دهد.

گام بعدی شما

  • اگر از Claude Code استفاده می‌کنید، مهارت‌های modelstudioai/skills را نصب کنید تا خروجی‌های بصری را مستقیماً در ترمینال دریافت کنید.
  • توصیفات (Descriptions) مهارت‌های خود را بازنویسی کنید و کلمات کلیدی صریح را برای بهبود نرخ فراخوانی توسط عامل اضافه کنید.
  • برای کنترل هزینه‌ها، دستور bl usage stats را در اسکریپت‌های اتوماسیون خود بگنجانید تا از اتمام ناگهانی سهمیه جلوگیری کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این تحول با تکیه بر اعتبار ابزارهای Model Studio، مرز بین «فکر کردن» و «ساختن» را در هوش مصنوعی از بین می‌برد. توسعه‌دهندگان اکنون می‌توانند عامل‌هایی بسازند که به‌جای راهنمایی کاربر، مستقیماً مصنوعات نهایی را تحویل دهند.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی به Model Studio برای توسعه‌دهندگان ایرانی نیازمند ابزارهای تغییر IP است، اما استفاده از لایسنس Apache-2.0 امکان میزبانی شخصی برخی مهارت‌ها را فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

ارزش یک عامل AI دیگر با نمرات بنچمارک استدلال سنجیده نمی‌شود، بلکه با تعداد «دست‌هایی» که برای تغییر دنیای دیجیتال دارد تعریف می‌شود. تبدیل شدن عامل از یک مشاور متنی به یک تولیدکننده فایل، نقطه شروع اتوماسیون واقعی است که در آن خروجی، یک سند قابل مصرف است نه یک دستورالعمل برای انجام کار. در این مسیر، استانداردسازی مهارت‌ها (مانند Agent Skills) حیاتی‌تر از افزایش پارامترهای مدل خواهد بود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.