پرش به محتوای اصلی
پرش به محتوای مقاله

Strands Harness هزینه توکن‌های عامل‌های هوش مصنوعی را ۲۸٪ کاهش داد

·۳۱ شهریور ۱۴۰۵۴ دقیقه مطالعه
تصویر: معرفی Strands Harness، ابزار متن‌باز AWS با کاهش ۲۸٪ هزینه توکن و دقت مشابه
تصویر: معرفی Strands Harness، ابزار متن‌باز AWS با کاهش ۲۸٪ هزینه توکن و دقت مشابه
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی یک مکانیزم مدیریت زمینه (شامل برش و فشرده‌سازی خودکار) که هزینه توکن‌ها را در عامل‌های هوش مصنوعی تا ۲۸٪ کاهش می‌دهد بدون اینکه دقت مدل افت کند.

اگر امروز برای اجرای عامل‌های هوش مصنوعی هزینه می‌پردازید، احتمالاً بخش زیادی از بودجه شما صرف توکن‌های بیهوده می‌شود، نه نتایج واقعی. اجرای یک عامل هوش مصنوعی از طریق یک حلقه سفارشی (Custom Loop) اغلب بسیار گران‌تر از استفاده از ابزارهای بومی مانند Claude Code است، حتی زمانی که مدل زیربنایی هر دو دقیقاً یکسان باشد. AWS با معرفی Strands Harness قصد دارد این شکاف بهره‌وری را پر کند؛ چارچوبی متن‌باز و همه‌منظوره که طبق گزارش‌های اولیه، هزینه توکن‌ها را در ۶ محک (Benchmark) اصلی تا ۲۸٪ کاهش می‌دهد.

این ابزار در زمانی عرضه شده که توسعه‌دهندگان با پدیده‌ای به نام «مالیات چارچوب» (Harness Tax) دست‌وپنجه نرم می‌کنند. این وضعیت زمانی رخ می‌دهد که سیستم‌های پیرامونی مدل — یعنی حافظه، ابزارها و حلقه‌های تکرار — هزینه‌ها را بالا می‌برند بدون اینکه نرخ موفقیت را افزایش دهند. برای درک بهتر، مطالعه‌ای روی «مالیات چارچوب» به مقایسه Claude Code، Codex CLI و Pi در هفت مدل مختلف پرداخت. یافته‌ها نشان داد که انتخاب چارچوب (Harness) تقریباً هیچ تأثیری روی نرخ موفقیت نداشت، اما یک مدل واحد می‌توانست به نتایج مشابه، با هزینه‌ای تا ۵ برابر بیشتر دست یابد. در واقع، مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — در یک چارچوب بد، توکن‌های زیادی را برای کارهای تکراری مصرف می‌کند. همان‌طور که در تحلیل قبلی ما درباره‌ی دستورالعمل‌های پیش‌آموزش بهینه مانند Magic اشاره کردیم، تمرکز صنعت اکنون از «چگونه مدل‌ها آموزش ببینند» به «چگونه در محیط عملیاتی مدیریت شوند» تغییر کرده است.

به نقل از گزارش Marktechpost، تیم Strands این چارچوب را روی Amazon EC2 و با استفاده از سیستم ارزیابی Harbor آزمایش کرده است که توسط تیم Terminal-Bench ایجاد شده است. عدد ۲۸٪ میانگینی از محک‌های ALFWorld، ContextBench، GAIA، WebShop، τ²-bench و Terminal-Bench 2.1 است. جالب اینجاست که اگرچه DeepSeek Harness از نظر هزینه توکن‌ها در مجموع بهینه‌ترین بود و حدود ۱۴٪ ارزان‌تر از Strands عمل می‌کرد، اما در تمام محک‌های ذکر شده نمرات کمتری کسب کرد و همین موضوع باعث شد میانگین Strands در جایگاه بهتری قرار بگیرد.

رویارویی عملکردی

در یک مقایسه مستقیم با مدل Claude Fable 5 در محک Terminal-Bench 2.1 (با ۸۹ تکرار برای هر چارچوب)، نتایج تکان‌دهنده بود:

  • Strands Harness: هزینه ۵۶.۲۹ دلار | صحت ۶۹.۷٪
  • Oh-my-pi: هزینه ۸۶.۸۳ دلار | صحت ۶۹.۷٪
  • OpenCode: هزینه ۷۳.۴۲ دلار | صحت ۶۶.۳٪
  • Claude Code: هزینه ۲۴۸.۰۵ دلار | صحت ۶۱.۸٪
  • DeepSeek Harness: هزینه ۴۰.۳۰ دلار | صحت ۵۹.۵٪

در برابر Claude Code، چارچوب Strands حدود ۷۷٪ ارزان‌تر بود و ۷.۹ امتیاز بیشتر کسب کرد. این تفاوت عملکردی در حالی رخ می‌دهد که برخی از سازوکارهای توسعه در Claude Code با نقاط شکست مشخصی روبرو هستند که می‌تواند هزینه‌ها را بدون افزایش دقت بالا ببرد. در حالی که Oh-my-pi توانست به صحت ۶۹.۷٪ برسد، اما این کار را با هزینه‌ای ۵۴٪ بیشتر از Strands انجام داد. بالاترین امتیاز ثبت شده در نمودار کلی مربوط به مدل Claude Opus 5 روی چارچوب Strands بود که به نزدیکی ۸۵٪ رسید. این سیستم اکنون برای پایتون و تایپ‌اسکریپت تحت لایسنس Apache 2.0 در دسترس است و با Amazon Bedrock، Anthropic، OpenAI، Google، Ollama و LiteLLM یکپارچه می‌شود. این یکپارچگی با Amazon Bedrock در حالی صورت می‌گیرد که مدل‌های پیشرفته‌ای نظیر GPT-6 Astra با امتیازات خیره‌کننده در محک‌های AGI وارد این پلتفرم شده‌اند تا قدرت پردازشی بیشتری در اختیار توسعه‌دهندگان قرار گیرد.

مکانیزم افزایش بهره‌وری

این کاهش هزینه حاصل سه قانون سخت‌گیرانه در مدیریت پنجره زمینه (Context Window) — که مثل میز کاری است که فقط جای چند ورق دارد، نه کل کتابخانه — است. تیم توسعه‌دهنده اشاره می‌کند که مدیریت زمینه، عامل اصلی هر دو موردِ «بهره‌وری توکن» و «دقت» بوده است:

  • برش (Truncation): نتایج ابزارهایی که بیش از ۱۵۰۰ توکن باشند، به‌طور خودکار کوتاه می‌شوند.
  • فشرده‌سازی (Compaction): وقتی مصرف زمینه به ۸۵٪ می‌رسد، عملیات خلاصه‌سازی فعال می‌شود.
  • بازیابی (Recovery): اگر پنجره متنی سرریز شود، عملیات بازیابی زمینه درون حلقه اجرا می‌شود.

علاوه بر این، Strands به‌جای نیاز به ابزارهای اختصاصی برای هر وظیفه، ابزارهای داخلی برای شل (Shell)، فایل (خواندن، نوشتن، ویرایش) و وب ارائه می‌دهد. این سیستم نتایج حجیم را به فایل‌ها منتقل کرده و بخش‌های تکراری درخواست‌ها را کش (Cache) می‌کند تا از مصرف توکن‌های تکراری جلوگیری شود. همچنین از طریق Session IDها از حافظه بلندمدت پشتیبانی کرده و زیر-وظایف باز (Open-ended) را به یک عامل کمکی داخلی می‌سپارد که پیشرفت کارهای چندمرحله‌ای را با یک چک‌لیست دنبال می‌کند.

استقرار و شخصی‌سازی

Strands Harness صرفاً یک ابزار کدنویسی نیست، بلکه یک عامل همه‌منظوره است. با این حال، یک فایل مهارت‌های bundled دارد که به عامل‌های کدنویسی کمک می‌کند پیکربندی‌های استقرار برای AWS، GCP، Azure، Cloudflare و Modal تولید کنند.

برای توسعه‌دهندگان، مسیر تبدیل نمونه اولیه به محصول نهایی ساده شده است. Strands CLI (که با دستور npm install @strands-agents/strands-cli نصب می‌شود) اجازه می‌دهد عامل‌ها را با زبان انگلیسی ساده طراحی کنید. برای مثال، در یک دمو، از یک عامل خواسته شد تا سرور Playwright MCP را اضافه کرده و تأخیر بارگذاری ویدیو در یک پست وبلاگ را اندازه‌گیری کند؛ سپس با اجرای دستور /export کد نهایی چارچوب به صورت یک فایل zip پایتون یا تایپ‌اسکریپت تحویل داده شد. گوتام سیردشموخ، مهندس Strands، حتی از این CLI برای ساخت یک اپلیکیشن دسکتاپ جهت اجرای راه دور Strands استفاده کرد.

شخصی‌سازی در این سیستم بسیار عمیق است. کاربران می‌توانند هر پیش‌فرض را تغییر دهند، مدل‌ها را جایگزین کنند یا حتی اجزا را تا سطح Strands Harness SDK تعویض کنند. چون این چارچوب یک وابستگی کتابخانه‌ای (Library Dependency) است، عاملی که روی لپ‌تاپ اجرا می‌شود دقیقاً همان عاملی است که در ابر مستقر می‌گردد.

این تغییر رویکرد نشان می‌دهد که بازگشت سرمایه (ROI) در عصر عامل‌ها، دیگر فقط به مدل‌های بهتر وابسته نیست، بلکه به «لوله‌کشی» هوشمندتر مربوط است. AWS ثابت کرد که لایه ارکستراسیون می‌تواند به‌جای اینکه یک سربار مالی باشد، منصری برای بهره‌وری باشد.

توسعه‌دهندگان می‌توانند با دستور pip install strands-harness یا npm install @strands-agents/harness کار را شروع کنند. یک فراخوانی ساده مانند create_harness(model="...") عامل را مقداردهی اولیه می‌کند. تیم سازنده اعلام کرده است که مقاله کامل و مفصل درباره این محک‌ها به‌زودی منتشر خواهد شد.

گام بعدی شما

  • اگر از عامل‌های سفارشی استفاده می‌کنید، هزینه توکن‌های خود را با مدل‌های Native مقایسه کنید تا میزان «مالیات چارچوب» را بسنجید.
  • کتابخانه Strands را روی یک پروژه کوچک تست کنید تا اثر قوانین Truncation و Compaction را روی هزینه استنتاج ببینید.
  • از Strands CLI برای تبدیل سریع ایده‌های متنی به کد عملیاتی پایتون استفاده کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این ابزار با کاهش هزینه‌های عملیاتی، استقرار عامل‌های هوش مصنوعی را برای کسب‌وکارهای کوچک اقتصادی‌تر می‌کند. اعتبار این یافته‌ها از طریق تست روی ۶ محک معتبر و استفاده از زیرساخت Amazon EC2 تأیید شده است.

تأثیر برای ایران

توسعه‌دهندگان ایرانی که با محدودیت بودجه برای APIهای گران‌قیمت مواجه‌اند، می‌توانند با استفاده از این چارچوب متن‌باز، هزینه استنتاج عامل‌های خود را به‌شدت کاهش دهند.

·نگاه ما
تحریریه دات‌هوش

بهره‌وری در لایه ارکستراسیون اکنون به اندازه بهینه‌سازی وزن‌های مدل اهمیت یافته است. Strands ثابت می‌کند که می‌توان با مدیریت سخت‌گیرانه پنجره زمینه، بدون قربانی کردن صحت، هزینه‌ها را به‌شدت کاهش داد. این یعنی رقابت بعدی در دنیای عامل‌ها، نه بر سر هوش مدل، بلکه بر سر مهندسی جریان داده‌ها در حافظه است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.