پرش به محتوای اصلی
پرش به محتوای مقاله

«کنترل ربات با زبان طبیعی»؛ هدف جدید چارچوب Strands Labs

·۳ تیر ۱۴۰۵۸ دقیقه مطالعه۱ بازدید
چارچوب عامل هوشمند که همه چیز را درباره کنترل سخت‌افزار زیر و رو کرد (بخش ۱)
چارچوب عامل هوشمند که همه چیز را درباره کنترل سخت‌افزار زیر و رو کرد (بخش ۱)
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی کامل توابع پاداش (Reward Functions) با دستورات متنی در کنترل سخت‌افزار؛ یعنی انتقال از یادگیری تقویتی سنتی به معماری دوگانه VLA-LLM برای رباتیک.

تصور کنید برنامه‌نویسی که حالا می‌تواند تنها با یک خط کد پایتون به بازوی رباتیک دستور دهد: «سیب را در سبد بگذار». این اتفاق با معرفی Strands Labs ممکن شده است؛ بازویی آزمایشی از اکوسیستم عامل‌محور AWS که در ۲۳ فوریه ۲۰۲۶ برای حذف فاصله میان قصد انسان و اجرای ماشین عرضه شد.

این تغییر، نیاز توسعه‌دهندگان به تسلط بر تئوری‌های یادگیری تقویتی (Reinforcement Learning) یا تنظیم دستی توابع پاداش را از بین می‌برد. سال‌ها بود که کنترل سخت‌افزار به معنای تعریف ریاضی اهداف بود و اغلب به چرخه‌های خسته‌کننده‌ای از آموزش و استقرار منجر می‌شد. در این روند قدیمی، هر تغییری در رفتار ربات نیازمند بازنویسی معادلات بود. همان‌طور که در تحلیل قبلی ما درباره‌ی Strands Labs AI Functions اشاره کردیم، تمرکز جدید این پروژه بر رباتیک، عامل‌های هوش مصنوعی را از نمایشگرهای دیجیتال به دنیای فیزیکی منتقل می‌کند و اجازه می‌دهد هوش مصنوعی مستقیماً بر ماده اثر کند.

زمینه: مسیر رسیدن به رباتیک مبتنی بر زبان طبیعی

تکامل این فناوری را می‌توان در تجربه توسعه‌دهندگانی دید که از ابزارهایی مانند AWS DeepRacer به سمت Strands حرکت می‌کنند. DeepRacer یک خودروی خودمختار کوچک است که به برنامه‌نویسان اجازه می‌دهد به‌جای محیط‌های کدنویسی خشک یا استفاده از نوت‌بوک‌های Jupyter و APIهای REST، از طریق یک شیء فیزیکی با یادگیری ماشین تعامل کنند.

با این حال، DeepRacer نماینده‌ی پارادایم قدیمی تعامل با ربات است. در آن جریان کاری، حلقه بازخورد شامل آموزش مدل، استقرار روی ماشین و مشاهده نتیجه است. طبق گزارش‌های فنی، این فرآیند اغلب شامل چسباندن نوار چسب و قرار دادن جعبه‌های مقوایی در اتاق پذیرایی برای ساخت پیست‌های موقت بود. اگر ماشین به قفسه کتاب برخورد می‌کرد، برنامه‌نویس باید مدل را دوباره آموزش می‌داد و حتی برخورد آرام‌تر به قفسه، در این چرخه تکرارشونده، یک «پیشرفت» تلقی می‌شد.

در آن حالت، «دستور» به ماشین کاملاً در یک تابع پاداش کدگذاری می‌شد. برای اینکه ماشین «در مرکز خط بماند»، توسعه‌دهنده نمی‌توانست صرفاً از کلمات استفاده کند، بلکه باید این رفتار را از طریق هایپرپارامترها و هندسه ریاضی تعریف می‌کرد. این موضوع شکاف عمیقی میان آنچه انسان می‌خواهد و نحوه اجرای آن توسط ماشین ایجاد می‌کرد.

Strands Labs این پارادایم را کاملاً دگرگون می‌کند. به‌جای صرف ساعت‌ها زمان برای تنظیم توابع پاداش جهت توصیف یک جمله ساده از قصد کاربر، حالا دستورالعمل یک جمله‌ی ساده به زبان انگلیسی است. این امر نشان‌دهنده یک فروپاشی دراماتیک در فاصله میان قصد انسان و اقدام ماشین است.

زیربنا: SDK عامل‌های Strands

این آزمایشگاه بر پایه Strands Agents SDK بنا شده است که AWS آن را در مه ۲۰۲۵ به‌صورت متن‌باز منتشر کرد. از زمان انتشار، این SDK تاکنون بیش از ۱۴ میلیون بار دانلود شده است. این ابزار که در هر دو زبان پایتون و تایپ‌اسکریپت در دسترس است، از یک رویکرد «مدل‌محور» برای ساخت عامل‌های هوش مصنوعی استفاده می‌کند. در این معماری، خودِ مدل است که حلقه اجرای عامل را پیش می‌برد و برنامه‌نویس دیگر نیازی به نوشتن منطق‌های پیچیده برای ارکستراسیون (Orchestration) ندارد. این رویکرد در ساخت محیط‌های برنامه‌نویسی پیشرفته نیز کاربرد دارد؛ برای example، معماری Dhi تلاش می‌کند تا با استفاده از ابزارهایی مانند LangGraph، محیطی را برای توسعه‌ی جامع IDEهای هوش مصنوعی متن‌باز فراهم کند که با فلسفه‌ی ساده‌سازی ارکستراسیون در SDKهای مدرن همسو است. این SDK به‌گونه‌ای طراحی شده است که از پروتوتایپ‌های سریع تا بارهای کاری تولیدی در سطح سازمانی مقیاس‌پذیر باشد.

Strands Labs در واقع بازوی تحقیق و توسعه (R&D) این اکوسیستم است. این بخش به‌عنوان یک سازمان مجزا در گیت‌هاب فعالیت می‌کند تا تیم‌های توسعه AWS و آمازون بتوانند آزمایش‌های پیشرو را همراه با کدهای عملی و تست‌های لازم، بدون محدودیت‌های سختگیرانه چرخه انتشار نسخه‌های تجاری SDK اصلی، عرضه کنند. در زمان عرضه، این آزمایشگاه سه پروژه را معرفی کرد: دو پروژه متمرکز بر رباتیک و یکی در زمینه توابع هوش مصنوعی (AI Functions).

معماری سیستمی دوگانه

این چارچوب از معماری «سیستم ۱ و سیستم ۲» بر اساس تئوری شناختی دانیال کانمن استفاده می‌کند. این تفکیک به ربات اجازه می‌دهد تا همزمان واکنش‌های لحظه‌ای (رفلکسی) و برنامه‌ریزی‌های پیچیده را مدیریت کند.

  • سیستم ۱ (واکنش‌های سریع): این لایه از NVIDIA GR00T استفاده می‌کند که یک مدل بینایی-زبانی-عملیاتی (VLA) است. GR00T تصاویر دوربین، موقعیت مفاصل ربات و دستورات زبانی را به عنوان ورودی دریافت کرده و مستقیماً موقعیت هدف مفاصل را خروجی می‌دهد. این سیستم با تأخیر استنتاج ۴۰ تا ۱۶۰ میلی‌ثانیه روی سخت‌افزارهای لبه NVIDIA Jetson اجرا می‌شود تا تضمین شود کنترل فیزیکی در سطح میلی‌ثانیه در لبه (Edge) اتفاق می‌افتد و نه در فضای ابری.
  • سیستم ۲ (استدلال کند): وقتی ربات با سناریویی مواجه می‌شود که نیاز به استدلال عمیق‌تر دارد — مانند برنامه‌ریزی چندمرحله‌ای یا تطبیق الگوهای تاریخی — موضوع را به مدل‌های زبانی بزرگ (LLM) مبتنی بر ابر در سرویس Amazon Bedrock می‌سپارد. برای مثال، اگر یک مکعب پشت یک لیوان مخفی باشد، سیستم ۲ به این نتیجه می‌رسد که ابتدا باید لیوان را جابه‌جا کرد تا بتوان مکعب را برداشت.

پیاده‌سازی و سخت‌افزار Strands Robots

Strands Robots امکان کنترل سطح بالای بازوهای فیزیکی را فراهم می‌کند. یک توسعه‌دهنده می‌تواند یک بازو را با یک اسکریپت ساده پایتون کنترل کند. پیاده‌سازی شامل مقداردهی یک شیء Robot با پارامترهای زیر است:

  • نام ابزار (Tool Name): برای مثال my_arm
  • مدل ربات (Robot Model): مانند so101_follower
  • دوربین‌ها (Cameras): پیکربندی‌شده برای نماهای جلو و مچ دست با استفاده از OpenCV، با تعیین مسیرهایی مانند /dev/video0 و /dev/video2 در نرخ ۳۰ فریم بر ثانیه
  • پورت (Port): برای مثال /dev/ttyACM0
  • پیکربندی داده‌ها (Data Config): مانند so100_dualcam

سپس یک عامل (Agent) با استفاده از این ابزار رباتیک ایجاد شده و دستوری به زبان طبیعی مانند «سیب را در سبد بگذار» دریافت می‌کند. این روند نیاز به نوشتن کدهای کنترل موتور یا مدیریت دستی موقعیت سرووها را کاملاً از بین می‌برد.

Strands Robots برای انتزاع سخت‌افزاری با LeRobot شرکت Hugging Face ادغام شده است تا اطمینان حاصل شود توسعه‌دهندگان به یک سازنده‌ی خاص محدود نمی‌شوند. این چارچوب در حال حاضر از پروفایل‌های سخت‌افزاری متعددی پشتیبانی می‌کند:

  • بازوهای رومیزی SO-100 و SO-101
  • بازوهای انسان‌نمای Fourier GR-1
  • Panda دو‌بازویی (Bimanual)
  • Unitree G1

برای شروع، توسعه‌دهندگان به پایتون ۳.۱۲ یا بالاتر، یک دستگاه NVIDIA Jetson برای استنتاج در لبه و یک حساب AWS با دسترسی به Bedrock نیاز دارند. نصب این پکیج از طریق دستور pip install strands-robots انجام می‌شود.

چارچوب عامل هوشمند که همه چیز را درباره کنترل سخت‌افزار زیر سؤال برد (بخش ۱)

تکرار ایمن با Strands Robots Sim

از آنجا که سخت‌افزارهای فیزیکی در برابر خطاها بی‌رحم هستند و به‌سرعت آسیب می‌بینند، AWS محیط Strands Robots Sim را عرضه کرد. این محیط سه‌بعدی مجهز به فیزیک واقعی به توسعه‌دهندگان اجازه می‌دهد «سریع شکست بخورند» بدون اینکه تجهیزات گران‌قیمت را تخریب کنند. این قابلیت دقیقاً پاسخ به دشواری‌های تجربه DeepRacer است، جایی که هر خطا نیازمند بازنشانی فیزیکی خودرو روی پیست بود.

Strands Robots Sim قابلیت‌های زیر را ارائه می‌دهد:

  • محیط‌های بنچمارک Libero: شامل بیش از ۹۰ وظیفه که استدلال مکانی، جابه‌جایی اشیا و تکالیف شرطی‌شده با هدف را پوشش می‌دهد.
  • ادغام سیاست‌های GR00T: که از طریق ZMQ اجرا می‌شوند.
  • ضبط MP4: قابلیت ضبط اپیزودها برای تحلیل‌های بعدی.

حالت‌های اجرای شبیه‌سازی

شبیه‌ساز دو حالت اجرای متمایز را برای نیازهای مختلف توسعه ارائه می‌دهد:

  • حالت SimEnv: یک رویکرد «بفرست و فراموش کن» (fire and forget) است. عامل یک وظیفه را دریافت می‌کند، آن را تا پایان اجرا می‌کند و توسعه‌دهنده نتیجه نهایی را دریافت می‌کند. این حالت برای بنچمارک‌ها و وظایف با تعریف دقیق ایده‌آل است.
  • حالت SteppedSimEnv: برای پژوهش و برنامه‌ریزی سلسله‌مراتبی طراحی شده است. در این حالت، عامل هر N گام (مثلاً هر ۱۰ گام)، شبیه‌سازی را مشاهده کرده، فیدهای دوربین را می‌بیند و دستورات خود را بر اساس زمینه‌های بصری (Visual Grounding) تطبیق می‌دهد. این امر امکان بازیابی خطا را فراهم می‌کند؛ اگر عامل ببیند که یک حرکت شکست خورده است، می‌تواند آن را اصلاح کند.

برای کسانی که از SteppedSimEnv استفاده می‌کنند، عامل می‌تواند با یک مدل خاص، مانند us.anthropic.claude-sonnet-4-5-20250929-v1:0 و ابزار gr00t_inference برای مدیریت حلقه شبیه‌سازی جفت شود. این ساختار، سطحی از پیچیدگی را فراهم می‌کند که پیش از این پیاده‌سازی آن نیازمند یک پایان‌نامه دکترا بود.

عملکرد و قابلیت گسترش

تیم AWS درباره سربارهایی (Overhead) که این حلقه‌های عامل‌محور ایجاد می‌کنند شفاف بوده است:

  • سربار SimEnv: حدود ۵ تا ۸ ثانیه زمان اضافه می‌کند که عمدتاً به تأخیر فراخوانی LLM مربوط است.
  • سربار SteppedSimEnv: با تعداد تکرارها مقیاس می‌پذیرد و معمولاً ۳ تا ۵ ثانیه به ازای هر فراخوانی LLM اضافه می‌کند.

اگرچه GR00T در حال حاضر سیاست (Policy) اصلی است، اما معماری به‌گونه‌ای طراحی شده که از طریق یک کلاس پایه انتزاعی Policy قابل گسترش باشد. این یعنی چارچوب صراحتاً برای پشتیبانی از سایر ارائه‌دهندگان VLA طراحی شده است، از جمله:

  • ACT
  • SmolVLA
  • ارائه‌دهندگان سفارشی VLA

برای شروع شبیه‌سازی، کاربران به پایتون ۳.۱۲ و Docker برای کانتینر Isaac-GR00T نیاز دارند. نصب از طریق pip install strands-robots[sim] انجام می‌شود. به توسعه‌دهندگان توصیه شده است که پیش از رفتن به سراغ GR00T، با اجرای python examples/libero_example.py از «سیاست نمایشی» (mock policy) شروع کنند که نیازی به Docker یا وابستگی‌های سخت‌افزاری ندارد.

تحلیل: تغییر در برنامه‌نویسی رباتیک

این چارچوب نشان‌دهنده یک چرخش بنیادی از «برنامه‌ریزی» ربات‌ها به «دستور دادن» به آن‌ها است. با واگذاری کنترل موتورهای سطح پایین به یک مدل VLA و منطق سطح بالا به یک LLM، AWS در واقع دشوارترین بخش رباتیک — یعنی ترجمه زبان به حرکت محورهای مفصل — را کالامحور (Commoditize) کرده است.

برای یک توسعه‌دهنده کاربردی، این بدان معناست که مانع ورود به دنیای رباتیک از درک سطح دکترا در سینماتیک به مهارت پایه در پایتون و مهندسی پرامپت کاهش یافته است. اثر ثانویه این تحول احتمالاً موجی از اتوماسیون صنعتی در «سطح آماتوری» خواهد بود، جایی که سلول‌های رباتیک کوچک می‌توانند در عرض چند ساعت به‌جای چند ماه، مستقر و تکرار شوند.

تمامی مخازن تحت لایسنس Apache-2.0 منتشر شده‌اند تا مشارکت‌های جامعه، از جمله ارسال Issueها و PRها به سازمان Strands Labs در گیت‌هاب تشویق شود. اگر سخت‌افزار ندارید، سریع‌ترین راه شروع، کلون کردن مخزن robots-sim و اجرای اسکریپت libero_example.py است. کسانی که بازوی رباتیک دارند می‌توانند مستقیماً به راهنمای سریع strands-robots مراجعه کنند.

چرا این موضوع مهم است؟

این ابزار با تکیه بر اعتبار NVIDIA و AWS، سد ورود به دنیای رباتیک را برای میلیون‌ها توسعه‌دهنده می‌شکند. انتقال کنترل از توابع پاداش ریاضی به زبان طبیعی، سرعت نوآوری در سخت‌افزارهای فیزیکی را به سرعت نوآوری در نرم‌افزارها می‌رساند.

تأثیر برای ایران

به‌دلیل محدودیت‌های دسترسی به APIهای Amazon Bedrock و سخت‌افزارهای NVIDIA Jetson، بهره‌برداری گسترده از این ابزار برای توسعه‌دهندگان ایرانی دشوار است؛ با این حال، متن‌باز بودن SDK فرصتی برای مطالعه معماری VLAها فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

جابه جایی نقطه ثقل رباتیک از «برنامه‌نویسی ریاضی» به «دستوردهی زبانی»، در واقع کالاانگاری (Commoditization) سخت‌ترین بخش رباتیک است. این یعنی مهارت‌های تخصصی سینماتیک در حال تبدیل شدن به یک لایه زیرساختی هستند و ارزش افزوده اکنون در مهندسی پرامپت و طراحی جریان‌های کاری (Workflow) نهفته است. احتمالاً به زودی شاهد ظهور اتوماسیون‌های صنعتی در مقیاس خرد خواهیم بود که توسط افراد غیرمتخصص اما مسلط به پایتون مدیریت می‌شوند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.