اگر برای هر تصمیم ساده در اپلیکیشن خود به یک مدل غولپیکر هزینه میدهید، احتمالاً بودجهتان را هدر میدهید. آمازون وب سرویسز (AWS) در ۱ اکتبر ۲۰۲۶ ابزار تخصصی Strands Decider 2B را عرضه کرد تا استدلالهای گرانقیمت را با دستهبندیهای سریع جایگزین کند. این ابزار راهکاری کمهزینه برای عاملهای هوش مصنوعی فراهم میکند تا بتوانند بین گزینههای از پیش تعیینشده، با یک امتیاز اطمینان مشخص، انتخاب کنند.
بسیاری از عاملهای (Agent) — شبیه دستیاران دیجیتالی که میتوانند بهجای ما کار انجام دهند — امروزه به مدلهای زبانی بزرگ (LLM) — مثل کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب میدهد — متکی هستند. اما تولید جملات کامل برای یک تصمیم ساده «بله/خیر» یا تعیین «گام بعدی»، اغلب فراتر از نیاز است و اتلاف منابع محسوب میشود. تصور کنید یک دستیار دیجیتال برای اینکه تصمیم بگیرد آیا باید تقویم شما را چک کند یا ایمیلی بفرستد، نیازی به نوشتن یک پاراگراف متن ندارد؛ او فقط به یک ماشه (Trigger) سریع و کالیبره شده نیاز دارد. همانطور که در تحلیلهای قبلی ما دربارهی بهینهسازی هزینههای استنتاج اشاره کردیم، صنعت اکنون به سمت «مدلهای تصمیمگیر» میرود تا گلوگاههای تأخیر و هزینه در جریانهای کاری خودکار را حل کند.
این پروژه حاصل تلاشهای Strands Labs است؛ سازمانی که بر توسعه ابزارها و پروتکلهای جدید برای استقرار عاملهای هوش مصنوعی تمرکز دارد. نیاز به چنین ابزاری از طریق گفتگو با مشتریان AWS آشکار شد. بسیاری از آنها دریافتند که جریانهای کاری عاملمحور آنها برای هر یک از گامهای اجرایی، لزوماً به هزینه بالا یا قابلیتهای عظیم یک مدل زبانی کامل نیاز ندارند. این رویکرد در راستای گسترش کاربردهای عملیاتی است، مشابه آنچه در اتوماسیون فرآیندهای استخدام توسط Amazon Connect Talent مشاهده کردیم که در آن عاملهای هوشمند وظایف پیچیده را مدیریت میکنند.
طبق گزارش TechCrunch، این مدل توسط مارک بروکر، مهندس برجسته آمازون، توسعه یافته است. مدل Strands Decider 2B بر پایه «بدنه» (Torso) مدل Qen3.5-2B ساخته شده است. جالب است بدانید که پیش از این، یک نسخه خانگی (Homebrew) از این مدل برای مدت کوتاهی در رتبههای بالای محک Jevbench در دسته مدلهای هماندازه خود قرار گرفته بود.
جزئیات فنی و سازوکارهای این مدل عبارتند از:
- معماری: بر پایه Qen3.5-2B اما تغییریافته برای ارائه انتخابهای کالیبره بهجای تولید متن.
- استقرار: کاملاً متنباز و به اندازه کافی کوچک برای اجرا بهصورت محلی روی سختافزارهای استاندارد.
- عملکرد: تولید احتمالات برای مجموعهای بسته از پاسخها جهت تضمین قابلیت اطمینان.
- کاربرد اصلی: ایفای نقش «تصمیمگیرنده» برای تعیین گام بعدی در یک گردشکار بر اساس وضعیت فعلی.
به نقل از مارک بروکر، این رویکرد بهدلیل محدود کردن پاسخها به یک دامنه بسته و ارائه امتیازهای اطمینان، گامی در گردشکار ایجاد میکند که بسیار قابلاعتمادتر است و در عین حال تأخیر را کم کرده و هزینهها را بهطور بالقوه کاهش میدهد. این عرضه در حالی رخ میدهد که موج مدلهای «کلون جِو» (Jev clones) در حال گسترش است که نام خود را از اقتصاددان، ویلیام استنلی جِوونز گرفتهاند. شرکت TypeSafe AI با مدل Jev این مسیر را آغاز کرد و از نظریه جِوونز بهره برد؛ نظریهای که میگوید کاهش هزینه یک چیز — مانند هوش کامپیوتری — در واقع میتواند تقاضا برای آن را افزایش دهد. OpenAI نیز در همان هفته، محصولی مشابه را معرفی کرد.
برای یک توسعهدهنده یا صاحب کسبوکار، این یعنی «مالیات هوش» برای جریانهای کاری در حال کاهش است. دیگر نیازی نیست برای منطق مسیریابی (Routing) اپلیکیشن خود به مدلهای حجیم پول بدهید. با سپردن این ریز-تصمیمها به یک مدل ۲ میلیارد پارامتری، هزینه استنتاج (Inference) — لحظهای که مدل واقعاً جواب تولید میکند، مثل خودِ آشپزی و نه دورهی آموزش آشپز — کاهش مییابد و احتمال توهم (Hallucination) — وقتی مدل با اطمینان چیزی میگوید که وجود ندارد، شبیه دوستی که خاطرهای را اشتباه تعریف میکند — که اغلب باعث شکست اسکریپتهای اتوماسیون میشود، حذف میگردد. این بهینهسازیها به طور مستقیم بر بهرهوری ابزارهای تجاری اثر میگذارد، همانطور که استراتژیهای مدیریت مقیاسپذیر برای فروشندگان آمازون بر اهمیت استفاده از ابزارهای هوشمند برای افزایش بازدهی تأکید داشتند.
با این حال، نظر متخصصان متفاوت است و صنعت بر سر اینکه این یک پیشرفت بزرگ است یا صرفاً یک ترند، دوپاره شده است. دیوگو آلمیدا، مدیرعامل و بنیانگذار TypeSafe، معتقد است بسیاری از این کلونهای فعلی صرفاً تلاش متخصصان یادگیری ماشین برای پیادهسازی یک «معماری جذاب» هستند، نه تلاشی از سوی تیمی که عمیقاً متعهد به کاربردی کردن هوش باشد. او هشدار میدهد که مردم ممکن است دشواریِ ساخت مدلهایی که واقعاً هوشمند باشند را دستکم بگیرند.
بروکر اما معتقد است چالش اصلی در ایجاد یک «تعادل بسیار دقیق» است؛ توسعهدهندگان باید عملکرد را در زمینه دقت و کالیبراسیون بالا ببرند، بدون اینکه درک مدل از زبانهای مختلف یا دانش عمومیاش که آن را مفید میکند، تخریب شود. با این حال، او انتظار ندارد که آزمایشگاههای پیشرو (Frontier Labs) بر این فضا مسلط شوند و اشاره میکند که برای بازارهای کوچکتر، هزینه ساخت چیزی جالب تنها در حد صدها یا هزاران دلار است.
در آینده شاهد پشتههای ترکیبی (Hybrid Stacks) خواهیم بود؛ جایی که یک مدل پیشرو برنامهریزی پیچیده را انجام میدهد و ارتشی از مدلهای محلی تصمیمگیر مثل Strands Decider گامهای اجرایی را مدیریت میکنند.
گام بعدی شما
- اگر از مدلهای GPT-4 یا Claude برای مسیریابی (Routing) در عاملهای خود استفاده میکنید، مدل Strands Decider را برای کاهش هزینه تست کنید.
- معماری مدلهای تصمیمگیر (Decision Models) را در مقابل مدلهای مولد (Generative Models) در پروژههای خود مقایسه کنید.
- بررسی کنید آیا جریان کاری شما میتواند به «دامنه بسته از پاسخها» تبدیل شود تا نرخ خطا به صفر برسد.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو