تصور کنید یک معمار تراز اول دارید که میتواند هر جزئیاتی از ساختمان را با دقت وصف کند، اما حتی یک نقشه ساده روی کاغذ به شما نمیدهد. این دقیقاً وضعیت فعلی بسیاری از توسعهدهندگانی است که از موج جدید مهارتهای عاملها استفاده میکنند؛ جایی که اکوسیستم بهشدت به نفع قابلیتهای ورودی پیش رفته و مسیرهای خروجی واقعی را فراموش کرده است. در واقع، عاملی که کل کدبیس شما را میفهمد اما نمیتواند حتی یک فایل PNG ساده تحویل دهد، ابزاری است که با یک سقف محدود متولد شده است.
به نقل از گزارشهای اخیر، مشکل عاملها از زوال شناختی به فقدان «عاملیت فیزیکی» تغییر کرده است. همانطور که در تحلیل قبلی ما دربارهی شکست عاملها در مقیاس واقعی اشاره کردیم، اکثر مهارتهای محبوب امروز صرفاً مانند فیلتر یا مترجم عمل میکنند. آنها به عامل (Agent) — شبیه دستیاری که فقط میتواند یادداشت بردارد و ترجمه کند — کمک میکنند تا بهتر بخواند یا موجزتر صحبت کند، اما در مرز متن متوقف میشوند. این یعنی ما با ابزارهایی روبرو هستیم که در تحلیل عالیاند اما در اجرا ناتوان.
حبابِ سمتِ ورودی
بر اساس بررسی مخازن گیتهاب در هفتهی آخر ژوئیه ۲۰۲۶، این عدم توازن کاملاً مشهود است. سه مورد از ۲۰ مخزن با سریعترین رشد، مهارتهایی بودند که فقط برای ورودی و ساختار طراحی شدهاند:
- graphify (با ۴۹۰۰ ستاره): این ابزار کدبیسها، مستندات و فایلهای PDF را به گراف دانش (Knowledge Graph) تبدیل میکند تا مدل بتواند آنها را جستوجو کند. این کار از طریق local tree-sitter AST انجام میشود و چون بهصورت محلی اجرا میگردد، هیچ دادهای از دستگاه خارج نمیشود.
- hallmark (با ۴۸۰۰ ستاره): این مهارت صرفاً برای حذف زوائد متنی تولیدشده توسط AI (یا همان AI-slop) از بخشهای طراحی و کپیرایت طراحی شده است تا استایل بصری و متنی را مدیریت کند.
- i-have-adhd (با ۳۲۷۰ ستاره): این ابزار مانع از این میشود که عامل پاسخ اصلی را زیر سه پاراگراف مقدمه و توضیحات اضافی دفن کند و مستقیماً به سراغ اصل مطلب برود.
این ابزارها در کنار find-skills (با بیش از ۶۰ هزار مشترک)، درک عمیقی از قصد کاربر ایجاد میکنند. در واقع، نیمی از آموزشهای مربوط به find-skills اکنون با این توصیه شروع میشوند که «ابتدا این یکی را نصب کنید».
اما مشکل اینجاست که این ابزارها فقط متن یا تحلیل داده تولید میکنند. وقتی کاربر یک تصویر کاور یا یک فایل صوتی (Voiceover) میخواهد، عامل معمولاً ابزارهای خارجی را پیشنهاد میدهد، چون راهی برای تحویل مستقیم فایل ندارد. در اینجا عامل «شانه خالی» نمیکند، بلکه صرفاً هیچ مسیری برای تحویل فیزیکی فایل در اختیار ندارد.

پر کردن شکاف خروجی با Model Studio
برای حل این مشکل، تیم Model Studio در شرکت علیبابا مخزنی از مهارتها را تحت لایسنس Apache-2.0 منتشر کرده است (modelstudioai/skills) که بهطور خاص روی خروجی تمرکز دارد. این مجموعه شامل قابلیتهای تصویر، گفتار، ویدیو و بینایی است که همگی از طریق یک رابط خط فرمان (CLI) واحد به نام bl در دسترس هستند.
توسعهدهندگان میتوانند این قابلیتها را با دستورات npx skills add modelstudioai/skills و npx skills add modelstudioai/cli --all -g نصب کنند. این setup به Node.js نسخه ۱۸ به بالا و یک کلید API نیاز دارد. پس از نصب، عامل دیگر ابزار پیشنهاد نمیکند، بلکه مستقیماً فراخوانیهای لازم برای تولید فایل را سازماندهی میکند.
برای مثال، تولید یک تصویر فنی اکنون با فراخوانی مستقیم bl image generate و استفاده از مدلهایی مثل qwen-image-2.0-pro انجام میشود. یک پرامپت برای «کاور مقاله فنی، پسزمینه تیره، متن عنوان در مرکز» اکنون منجر به ترکیبی میشود که در آن هم عنوان و هم زیرعنوان بدون نیاز به یک مرحله ویرایشی مجدد برای قرار دادن متن روی تصویر، دقیقاً در جای درست قرار دارند.
نکات فنی CLI ابزار bl
پیادهسازی این مهارتها نیازمند دقت در رفتارهای خاص CLI است تا از شکستهای خاموش (Silent Failures) جلوگیری شود:
- سایز تصویر: پرچم
--sizeنسبتها (مثل ۱۶:۹) یا پیکسلها را که با علامت ستاره به هم متصل شدهاند (۱۲۸۰*۷۲۰) میپذیرد. استفاده از 'x' استاندارد (۱۲۸۰x۷۲۰) ممکن است در محیط محلی کار کند، اما اجرای دستور با--dry-run --output jsonنشان میدهد که مقدار "1280x720" عیناً در بدنه درخواست ارسال میشود که ممکن است باعث خطا شود. اگر در حال اسکریپتنویسی هستید، باید این مقدار را در ورودی نرمالسازی کنید. - واترمارک: پرچم
--watermarkبهصورت پیشفرض روی true است؛ برای دریافت خروجیهای حرفهای و بدون علامت، باید صراحتاً آن را روی false تنظیم کنید. - سنتز گفتار: کاربران باید ابتدا دستور
--list-voicesرا اجرا کنند تا شناسههای معتبر (مانندlongxiaochun_v3،longcheng_v3یاlongtian_v3) را دریافت کنند. این صداها دوزبانه (انگلیسی/चीनी) هستند. همچنین این ابزار از پرچم--rate(در بازه ۰.۵ تا ۲.۰) بهجای پرچم رایج--speedاستفاده میکند. - وظایف بینایی: ساختار دستورات سلسلهمراتبی است؛ مثلاً
bl vision describeبرای تبدیل پیامهای خطا یا استکفریمهای موجود در اسکرینشاتها به متن استفاده میشود. مسیرهای محلی فایلها مستقیماً کار میکنند و آپلود در داخل خود دستور انجام میشود. - ویدیوهای ناهمگام: تولید ویدیو بهصورت Async است و یک جریان سهمرحلهای را میطلبد: ابتدا
bl video generateو سپس دریافت وضعیت باbl video task getو در نهایت دانلود فایل باbl video downloadبا استفاده از یک Task ID خاص. توجه داشته باشید که مقدار پیشفرض--poll-intervalمتفاوت است: ۵ ثانیه برای تولید، اما ۱۵ ثانیه برای ویرایش و ارجاع.
مشکل مسیریابی مانیفست
طبق مستندات Claude Code در ژوئیه ۲۰۲۶، بسیاری از کاربران متوجه میشوند مهارتهای نصبشده هرگز اجرا نمیشوند. این اتفاق به دلیل نحوه ساخت مانیفست توصیفات در ابتدای هر جلسه است.
دو عامل کلیدی در این رفتار نقش دارند:
۱. توصیف بهعنوان کلید مسیریابی: فیلد Description صرفاً یک راهنمای متنی (Docstring) نیست؛ عامل فایلهای مهارت را نمیخواند تا قصد کاربر را استنباط کند، بلکه آنها را با توصیفات تطبیق میدهد. مهارتهایی که سناریوهای فعالسازی و کلمات کلیدی را صریحاً ذکر کردهاند، با دقت و قابلیت اطمینان بسیار بیشتری انتخاب میشوند.
۲. مانیفست شروع جلسه: مانیفست فقط در ابتدای جلسه ساخته میشود. هر مهارتی که در میان گفتگو نصب شود، برای عامل نامرئی میماند. بنابراین ریاستارت کردن جلسه یک ضرورت فنی است، نه یک باور قدیمی.
لازم به ذکر است که مهارتهای Claude Code از استاندارد باز Agent Skills پیروی میکنند، به این معنی که مدل ذهنی آنها هنگام جابهجایی بین پلتفرمهای مختلف AI (Harnesses) حفظ میشود.
هزینهٔ عاملیت
انتقال از مهارتهای متنی به فراخوانیهای خروجی، ریسک مالی جدیدی ایجاد میکند: این عامل است که تصمیم میگیرد چند فراخوانی هزینهبر انجام دهد. برای مثال، درخواست سه گزینه برای تصویر کاور، منجر به سه هزینه مجزا در صورتحساب شما میشود.
برای مدیریت این موضوع، ابزار bl حفاظهایی را فراهم کرده است:
bl usage freetier --all: توقف خودکار عملیات هنگام اتمام سهمیه رایگان.bl usage free --expiring 30: بررسی تاریخ انقضای سهمیه (که نیازمند اجرایbl auth login --consoleدر ابتدا است).bl usage stats --days 30: ردیابی میزان مصرف در ۳۰ روز اخیر.
کاربران باید دو نکته را بدانند: اول اینکه سهمیه رایگان دائمی نیست و بسته به منطقه جغرافیایی و تخصیص مدل تغییر میکند. دوم اینکه سهمیهها به یکدیگر منتقل نمیشوند؛ اگر سهمیه یک مدل تمام شود، سیستم بهطور خودکار به مدل دیگر که بودجه دارد سوئیچ نمیکند و کاربر باید پارامتر مدل را دستی تغییر دهد.
تحلیل: سقفِ ابزارها
این تغییر یک حقیقت بنیادی درباره هوش مصنوعی عاملمحور را فاش میکند: سقف توانایی یک عامل، توسط ابزارهایی که در دست دارد تعریف میشود. در حالی که مدلهای استدلالی پیشرفت کردهاند، کاربرد یک عامل با توانایی تعامل او با دنیای دیجیتال محدود است. graphify به آن چشم میدهد تا ساختار کد را ببیند، hallmark به آن سلیقه میدهد و ابزارهای خروجی اجازه میدهند محصول نهایی را تحویل دهد.
برای یک توسعهدهنده، ارزش یک استک AI دیگر فقط به هوش مدل زبانی بزرگ (LLM) — مثل کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب میدهد — نیست، بلکه به گستردگی «مسیرهای خروجی» آن بستگی دارد. افزودن مهارتهای چندوجهی، عامل را از یک مشاور به یک تولیدکننده تبدیل میکند. در این مسیر، مدیریت دسترسیهای عامل برای جلوگیری از تغییرات ناخواسته در کدبیس حیاتی است؛ موضوعی که در بررسی ۵ حفاظ فنی برای جلوگیری از تخریب مخازن کد بهطور مفصل به آن پرداختیم.
با این حال، این راهکار برای همه مناسب نیست. اگر کنترل دقیق روی ترکیببندی یا استایلهای دستهای (Batch-consistent) نیاز دارید، یک گراف Node در ComfyUI محلی، علیرغم هزینه GPU و نگهداری، همچنان برتر است. همچنین اگر کار شما صرفاً کد و متن است، این مهارتها فقط فضای پنجره متنی (Manifest Context) را اشغال میکنند بدون اینکه ارزشی بیافزایند.
یک کاربرد نهایی: مخزن Model Studio فهرستی از مهارتهای تاییدشده از Anthropic, Vercel و Google Labs را نیز نگهداری میکند. این مهارتها در دستههای مدیریت مهارت، کد، طراحی، مستندات، ویدیو و تست گروهبندی شدهاند و بر اساس تایید تیم Model Studio علامتگذاری شدهاند. برای کسانی که در مرحله جستوجوی ابزار هستند، این فهرست زمانبر بودن فرآیند را بهشدت کاهش میدهد.
پر کردن شکاف میان درک و تولید به این معناست که عامل دیگر فهرستی از ابزارها را پیشنهاد نمیکند، بلکه خودِ فایل را تحویل میدهد.
گام بعدی شما
- اگر از Claude Code استفاده میکنید، مهارتهای
modelstudioai/skillsرا نصب کنید تا خروجیهای بصری را مستقیماً در ترمینال دریافت کنید. - توصیفات (Descriptions) مهارتهای خود را بازنویسی کنید و کلمات کلیدی صریح را برای بهبود نرخ فراخوانی توسط عامل اضافه کنید.
- برای کنترل هزینهها، دستور
bl usage statsرا در اسکریپتهای اتوماسیون خود بگنجانید تا از اتمام ناگهانی سهمیه جلوگیری کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو