اگر امروز برای اجرای عاملهای هوش مصنوعی هزینه میپردازید، احتمالاً بخش زیادی از بودجه شما صرف توکنهای بیهوده میشود، نه نتایج واقعی. اجرای یک عامل هوش مصنوعی از طریق یک حلقه سفارشی (Custom Loop) اغلب بسیار گرانتر از استفاده از ابزارهای بومی مانند Claude Code است، حتی زمانی که مدل زیربنایی هر دو دقیقاً یکسان باشد. AWS با معرفی Strands Harness قصد دارد این شکاف بهرهوری را پر کند؛ چارچوبی متنباز و همهمنظوره که طبق گزارشهای اولیه، هزینه توکنها را در ۶ محک (Benchmark) اصلی تا ۲۸٪ کاهش میدهد.
این ابزار در زمانی عرضه شده که توسعهدهندگان با پدیدهای به نام «مالیات چارچوب» (Harness Tax) دستوپنجه نرم میکنند. این وضعیت زمانی رخ میدهد که سیستمهای پیرامونی مدل — یعنی حافظه، ابزارها و حلقههای تکرار — هزینهها را بالا میبرند بدون اینکه نرخ موفقیت را افزایش دهند. برای درک بهتر، مطالعهای روی «مالیات چارچوب» به مقایسه Claude Code، Codex CLI و Pi در هفت مدل مختلف پرداخت. یافتهها نشان داد که انتخاب چارچوب (Harness) تقریباً هیچ تأثیری روی نرخ موفقیت نداشت، اما یک مدل واحد میتوانست به نتایج مشابه، با هزینهای تا ۵ برابر بیشتر دست یابد. در واقع، مدل زبانی بزرگ (LLM) — مثل کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن کتابها جواب میدهد — در یک چارچوب بد، توکنهای زیادی را برای کارهای تکراری مصرف میکند. همانطور که در تحلیل قبلی ما دربارهی دستورالعملهای پیشآموزش بهینه مانند Magic اشاره کردیم، تمرکز صنعت اکنون از «چگونه مدلها آموزش ببینند» به «چگونه در محیط عملیاتی مدیریت شوند» تغییر کرده است.
به نقل از گزارش Marktechpost، تیم Strands این چارچوب را روی Amazon EC2 و با استفاده از سیستم ارزیابی Harbor آزمایش کرده است که توسط تیم Terminal-Bench ایجاد شده است. عدد ۲۸٪ میانگینی از محکهای ALFWorld، ContextBench، GAIA، WebShop، τ²-bench و Terminal-Bench 2.1 است. جالب اینجاست که اگرچه DeepSeek Harness از نظر هزینه توکنها در مجموع بهینهترین بود و حدود ۱۴٪ ارزانتر از Strands عمل میکرد، اما در تمام محکهای ذکر شده نمرات کمتری کسب کرد و همین موضوع باعث شد میانگین Strands در جایگاه بهتری قرار بگیرد.
رویارویی عملکردی
در یک مقایسه مستقیم با مدل Claude Fable 5 در محک Terminal-Bench 2.1 (با ۸۹ تکرار برای هر چارچوب)، نتایج تکاندهنده بود:
- Strands Harness: هزینه ۵۶.۲۹ دلار | صحت ۶۹.۷٪
- Oh-my-pi: هزینه ۸۶.۸۳ دلار | صحت ۶۹.۷٪
- OpenCode: هزینه ۷۳.۴۲ دلار | صحت ۶۶.۳٪
- Claude Code: هزینه ۲۴۸.۰۵ دلار | صحت ۶۱.۸٪
- DeepSeek Harness: هزینه ۴۰.۳۰ دلار | صحت ۵۹.۵٪
در برابر Claude Code، چارچوب Strands حدود ۷۷٪ ارزانتر بود و ۷.۹ امتیاز بیشتر کسب کرد. این تفاوت عملکردی در حالی رخ میدهد که برخی از سازوکارهای توسعه در Claude Code با نقاط شکست مشخصی روبرو هستند که میتواند هزینهها را بدون افزایش دقت بالا ببرد. در حالی که Oh-my-pi توانست به صحت ۶۹.۷٪ برسد، اما این کار را با هزینهای ۵۴٪ بیشتر از Strands انجام داد. بالاترین امتیاز ثبت شده در نمودار کلی مربوط به مدل Claude Opus 5 روی چارچوب Strands بود که به نزدیکی ۸۵٪ رسید. این سیستم اکنون برای پایتون و تایپاسکریپت تحت لایسنس Apache 2.0 در دسترس است و با Amazon Bedrock، Anthropic، OpenAI، Google، Ollama و LiteLLM یکپارچه میشود. این یکپارچگی با Amazon Bedrock در حالی صورت میگیرد که مدلهای پیشرفتهای نظیر GPT-6 Astra با امتیازات خیرهکننده در محکهای AGI وارد این پلتفرم شدهاند تا قدرت پردازشی بیشتری در اختیار توسعهدهندگان قرار گیرد.
مکانیزم افزایش بهرهوری
این کاهش هزینه حاصل سه قانون سختگیرانه در مدیریت پنجره زمینه (Context Window) — که مثل میز کاری است که فقط جای چند ورق دارد، نه کل کتابخانه — است. تیم توسعهدهنده اشاره میکند که مدیریت زمینه، عامل اصلی هر دو موردِ «بهرهوری توکن» و «دقت» بوده است:
- برش (Truncation): نتایج ابزارهایی که بیش از ۱۵۰۰ توکن باشند، بهطور خودکار کوتاه میشوند.
- فشردهسازی (Compaction): وقتی مصرف زمینه به ۸۵٪ میرسد، عملیات خلاصهسازی فعال میشود.
- بازیابی (Recovery): اگر پنجره متنی سرریز شود، عملیات بازیابی زمینه درون حلقه اجرا میشود.
علاوه بر این، Strands بهجای نیاز به ابزارهای اختصاصی برای هر وظیفه، ابزارهای داخلی برای شل (Shell)، فایل (خواندن، نوشتن، ویرایش) و وب ارائه میدهد. این سیستم نتایج حجیم را به فایلها منتقل کرده و بخشهای تکراری درخواستها را کش (Cache) میکند تا از مصرف توکنهای تکراری جلوگیری شود. همچنین از طریق Session IDها از حافظه بلندمدت پشتیبانی کرده و زیر-وظایف باز (Open-ended) را به یک عامل کمکی داخلی میسپارد که پیشرفت کارهای چندمرحلهای را با یک چکلیست دنبال میکند.
استقرار و شخصیسازی
Strands Harness صرفاً یک ابزار کدنویسی نیست، بلکه یک عامل همهمنظوره است. با این حال، یک فایل مهارتهای bundled دارد که به عاملهای کدنویسی کمک میکند پیکربندیهای استقرار برای AWS، GCP، Azure، Cloudflare و Modal تولید کنند.
برای توسعهدهندگان، مسیر تبدیل نمونه اولیه به محصول نهایی ساده شده است. Strands CLI (که با دستور npm install @strands-agents/strands-cli نصب میشود) اجازه میدهد عاملها را با زبان انگلیسی ساده طراحی کنید. برای مثال، در یک دمو، از یک عامل خواسته شد تا سرور Playwright MCP را اضافه کرده و تأخیر بارگذاری ویدیو در یک پست وبلاگ را اندازهگیری کند؛ سپس با اجرای دستور /export کد نهایی چارچوب به صورت یک فایل zip پایتون یا تایپاسکریپت تحویل داده شد. گوتام سیردشموخ، مهندس Strands، حتی از این CLI برای ساخت یک اپلیکیشن دسکتاپ جهت اجرای راه دور Strands استفاده کرد.
شخصیسازی در این سیستم بسیار عمیق است. کاربران میتوانند هر پیشفرض را تغییر دهند، مدلها را جایگزین کنند یا حتی اجزا را تا سطح Strands Harness SDK تعویض کنند. چون این چارچوب یک وابستگی کتابخانهای (Library Dependency) است، عاملی که روی لپتاپ اجرا میشود دقیقاً همان عاملی است که در ابر مستقر میگردد.
این تغییر رویکرد نشان میدهد که بازگشت سرمایه (ROI) در عصر عاملها، دیگر فقط به مدلهای بهتر وابسته نیست، بلکه به «لولهکشی» هوشمندتر مربوط است. AWS ثابت کرد که لایه ارکستراسیون میتواند بهجای اینکه یک سربار مالی باشد، منصری برای بهرهوری باشد.
توسعهدهندگان میتوانند با دستور pip install strands-harness یا npm install @strands-agents/harness کار را شروع کنند. یک فراخوانی ساده مانند create_harness(model="...") عامل را مقداردهی اولیه میکند. تیم سازنده اعلام کرده است که مقاله کامل و مفصل درباره این محکها بهزودی منتشر خواهد شد.
گام بعدی شما
- اگر از عاملهای سفارشی استفاده میکنید، هزینه توکنهای خود را با مدلهای Native مقایسه کنید تا میزان «مالیات چارچوب» را بسنجید.
- کتابخانه Strands را روی یک پروژه کوچک تست کنید تا اثر قوانین Truncation و Compaction را روی هزینه استنتاج ببینید.
- از Strands CLI برای تبدیل سریع ایدههای متنی به کد عملیاتی پایتون استفاده کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو