پرش به محتوای اصلی
پرش به محتوای مقاله

LingBot-Vision در برابر DINOv3؛ برتری در تحلیل مرزهای مکانی

·۱۷ تیر ۱۴۰۵۷ دقیقه مطالعه
ربات بینایی لینگ‌بات: مدل ۱ میلیارد پارامتری متن‌باز برای درک فضایی دقیق بر پایه مرزها
ربات بینایی لینگ‌بات: مدل ۱ میلیارد پارامتری متن‌باز برای درک فضایی دقیق بر پایه مرزها
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی رویکرد semantic-first با boundary-first در پیش‌آموزش مدل‌های بینایی؛ این کار باعث شد مدلی با ۱.۱ میلیارد پارامتر در کارهای مکانی با مدل ۷ میلیارد پارامتری رقابت کند.

تصور کنید یک ربات باید تخم‌مرغی را از روی میز بردارد؛ اگر تنها بداند «تخم‌مرغ» در تصویر است اما لبه‌های دقیق آن را تشخیص ندهد، احتمالاً آن را می‌شکند. این دقیقاً همان نقطه‌ای است که مدل‌های بصری فعلی شکست می‌خورند و LingBot-Vision برای حل همین بحران طراحی شده است.

به گزارش تیم Robbyant (بخش هوش مصنوعی تجسم‌یافته در Ant Group)، مدل‌های بنیادین (Foundation Model) فعلی بیشتر بر «معنا» متمرکز هستند؛ یعنی تشخیص می‌دهند «چه چیزی» در عکس است، اما ساختارهای ظریف مکانی مثل لبه‌ها و نقاط تغییر عمق را نادیده می‌گیرند. این رویکرد برای دسته‌بندی تصاویر عالی است، اما برای ربات‌هایی که باید با دنیای فیزیکی تعامل کنند، یک نقص جدی است. در واقع، اکثر مدل‌های موجود برای «ناوردایی معنایی» (Semantic Invariance) آموزش دیده‌اند؛ به این معنا که آن‌ها طراحی شده‌اند تا ماهیت یک شیء را شناسایی کنند (مثلاً تشخیص یک گربه یا صندلی) در حالی که عمداً ساختارهای مکانی دقیق، مانند مرزهای شیء، کانتورها و گسست‌های عمقی را حذف می‌کنند. برای یک ربات که قصد دارد شیئی را بگیرد یا در یک محیط پیچیده مسیریابی کند، آگاهی مکانی دقیق و درک اینکه یک شیء کجا پایان می‌یابد و شیء دیگر کجا آغاز می‌شود، حیاتی است. LingBot-Vision اولویت‌های سنتی را معکوس کرده و «مرزها» را به جای یک خروجی ثانویه در مراحل پایین‌دستی، به عنوان یک سیگنال بومی در مرحله پیش‌آموزش (Pretraining) در نظر می‌گیرد.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی امنیت و استقرار مدل‌های بازمتن اشاره کردیم، دسترسی به وزن‌های مدل‌ها برای جامعه پژوهشی حیاتی است. حالا این مدل با مجوز Apache-2.0 در Hugging Face منتشر شده است. این بسته شامل گزارش فنی جامع، کدهای استنتاج (Inference) و وزن‌های چهار مدل با اندازه‌های مختلف است: ViT-giant، ViT-large، ViT-base و ViT-small. این خانواده از مدل‌های ترنسفورمر بصری (ViT) به‌صورت خود-نظارتی (Self-supervised) مهندسی شده‌اند تا ادراک مکانی متراکم (Dense Spatial Perception) را به حداکثر برسانند.

طبق مستندات فنی، نتیجه این تغییر معماری، ایجاد یک ستون فقرات (Backbone) با ۱ میلیارد پارامتر است که در وظایف مکانی متراکم، با مدل‌هایی که تا هفت برابر بزرگتر از آن هستند برابری کرده یا حتی از آن‌ها پیشی می‌گیرد. به‌طور خاص، مدل پرچم‌دار این خانواده (ViT-g/16) با حدود ۱.۱ میلیارد پارامتر، رقیبی جدی و کارآمد برای مدل ۷ میلیارد پارامتری DINOv3 است. LingBot-Vision به عنوان یک انکودر پیش‌آموزش‌دیده خود-نظارتی عمل می‌کند که به‌طور خاص برای وظایف پایین‌دستی با ساختار مکانی طراحی شده است. برای آموزش این مدل از مجموعه‌ای منتخب شامل ۱۶۱ میلیون تصویر استفاده شده است که از یک استخر عظیم ۲ میلیارد تصویری وب جدا شده بودند. نکته کلیدی و تحسین‌برانگیز اینجاست که این فرآیند آموزشی بدون هیچ‌گونه برچسب‌گذاری انسانی، بدون نیاز به آشکارسازهای لبه خارجی و بدون استفاده از ستون‌های فقرات پیش‌آموزش‌دیده برای شروع یادگیری (Bootstrap) صورت گرفته است.

بهره‌وری داده‌ای در LingBot-Vision خیره‌کننده است. مجموعه داده‌های منتخب مورد استفاده برای آموزش، یک مرتبه کوچکتر (Order of Magnitude) از دیتاست LVD-1689M است که در DINOv3 به کار رفته بود. علاوه بر این، این مدل کمتر از یک‌سوم نمونه‌های آموزشی مورد نیاز DINOv3 را مصرف کرده است. این موضوع ثابت می‌کند که یک هدف متمرکز و «مرز-محور» (Boundary-centric) می‌تواند در دستیابی به ادراک مکانی، بسیار بهینه‌تر و کارآمدتر از آموزش‌های معنایی کلی باشد. انکودر این مدل ویژگی‌های توکن-پچ متراکم (Dense patch-token features) تولید می‌کند که برای خوانش‌های منجمد (Frozen readouts) طراحی شده‌اند؛ این یعنی تحلیل‌های مکانی با کارایی بالا بدون نیاز به تنظیم دقیق و گسترده‌ی ستون فقرات مدل امکان‌پذیر است.

برای توسعه‌دهندگانی که با محدودیت‌های بودجه محاسباتی یا سخت‌افزاری رو‌به‌رو هستند، Robbyant نسخه‌های تقطیرشده (Distillated) مدل پرچم‌دار را فراهم کرده است. مدل ViT-g به سه مدل شاگرد تبدیل شده است: ViT-L با ۳۰۰ میلیون پارامتر، ViT-B با ۸۶ میلیون پارامتر و ViT-S. این مدل‌های کوچک‌تر طراحی شده‌اند تا در کلاس اندازه خود، پیشرو در عملکرد پیش‌بینی‌های متراکم باشند. این استراتژی تضمین می‌کند که مزایای ادراک مرز-محور برای استقرارهای لبه (Edge Deployment) و کاربردهای رباتیک بی‌درنگ (Real-time) که در آن‌ها تأخیر (Latency) و حافظه محدودیت‌های حیاتی هستند، در دسترس باشد. این تلاش برای بهینه‌سازی اندازه مدلات در راستای دستیابی به کارایی بالا، یادآور رویکرد مدل CT-VAM است که توانست عملکرد VLAهای غول‌پیکر را با پارامترهای بسیار کمتر بازسازی کند.

از نظر فنی، هسته مرکزی LingBot-Vision در رویکرد «مدل‌سازی مرزهای ماسک‌شده» (Masked Boundary Modeling یا MBM) نهفته است. این روش بر پایه پارادایم‌های خود-تقطیری تثبیت‌شده‌ی DINO و iBOT بنا شده است. در این چارچوب، یک مدل معلم (Teacher) — که در واقع یک کپی از میانگین متحرک نمایی (EMA) مدل شاگرد است — اهدافی آنلاین تولید می‌کند. مدل شاگرد سپس باید این اهداف را از نماهایی از تصویر که بخش‌هایی از آن‌ها ماسک (پوشانده) شده است، بازیابی کند. در حالی که مدل‌سازی تصویر ماسک‌شده‌ی استاندارد (MIM) معمولاً پچ‌ها را به‌صورت تصادفی می‌پوشاند و محتوای ساختاری تصویر را نادیده می‌گیرد، روش MBM به‌طور مشخص مرزها را هدف قرار می‌دهد. با مجبور کردن مدل به بازسازی گذارهای مکانی و لبه‌های اشیاء، شبکه یاد می‌گیرد که ساختار هندسی صحنه را بر الگوهای ساده‌ی رنگ یا بافت اولویت دهد.

این تمرکز شدید بر مرزها باعث می‌شود LingBot-Vision در وظایفی مانند قطعه‌بندی معنایی (Semantic Segmentation)، تخمین عمق (Depth Estimation) و تشخیص لبه‌ها به‌طور ذاتی توانا و برتر باشد. در مدل‌های سنتی، این‌ها مسائل «پایین‌دستی» بودند که در آن یک مدل معنایی پیش‌آموزش‌دیده، روی داده‌های برچسب‌دار تنظیم دقیق می‌شد. اما LingBot-Vision این ویژگی‌ها را در همان فاز اولیه پیش‌آموزش خود-نظارتی می‌آموزد. این بدان معناست که مدل دارای درکی ذاتی از چیدمان مکانی است و هنگام انتقال به محیط‌های جدید یا مواجهه با اشیاء ناشناخته در یک محیط رباتیک، بسیار مقاوم‌تر و دقیق‌تر عمل می‌کند. این ارتقای درک ساختاری، مشابه تحولی است که AlloSpatial با تغییر رویکرد از دوربین به نقشه برای بهبود استدلال مکانی ایجاد کرد.

از دیدگاه هوش مصنوعی تجسم‌یافته (Embodied AI)، این یک پیشرفت حیاتی است. ربات‌هایی که در دنیای واقعی فعالیت می‌کنند، فقط نیاز ندارند بدانند که یک «میز» وجود دارد؛ آن‌ها باید دقیقاً بدانند لبه میز کجاست تا از تصادفات جلوگیری کنند یا شیئی را با دقت میلی‌متری قرار دهند. Robbyant با باز کردن وزن‌های این مدل، ابزاری را در اختیار جامعه فراهم کرده است که شکاف بین شناسایی بصری سطح بالا (High-level recognition) و کنترل مکانی سطح پایین (Low-level spatial control) را پر می‌کند. در دسترس بودن اندازه‌های مختلف مدل تضمین می‌کند که این فناوری بتواند از شبیه‌سازهای عظیم مبتنی بر ابر تا پردازنده‌های کوچک داخلی در ربات‌های متحرک مقیاس‌پذیر باشد. این دقت در کنترل مکانی، مکمل توسعه‌های جدیدی است که در آن رابط‌های کد-محور برای افزایش دقت فضایی در مدل‌های بینایی-زبانی به کار گرفته شده‌اند.

به طور خلاصه، LingBot-Vision نشان‌دهنده‌ی یک چرخش استراتژیک در طراحی مدل‌های بینایی است. با فاصله گرفتن از رویکرد «اول-معنا» و پذیرش فلسفه «اول-مرز»، Robbyant مدلی ساخته است که نه‌تنها آموزش آن بهینه‌تر است، بلکه در دامنه‌های خاص مورد نیاز برای تعاملات فیزیکی، توانمندتر عمل می‌کند. ترکیب مدل پرچم‌دار ۱.۱ میلیارد پارامتری و شاگردان تقطیرشده‌ی آن، ابزاری versatile برای نسل بعدی هوش مصنوعی تجسم‌یافته فراهم می‌کند و نویددهنده‌ی سیستم‌های رباتیک دقیق‌تر، قابل‌اعتمادت‌تر و آگاه‌تر از نظر مکانی است.

گام بعدی شما

  • اگر روی رباتیک یا سیستم‌های بینایی کار می‌کنید، مدل‌های کوچک‌تر (ViT-S) را برای تست تأخیر در سخت‌افزارهای لبه ارزیابی کنید.
  • بررسی کنید که آیا جایگزینی انکودرهای فعلی خود با LingBot-Vision می‌تواند دقت قطعه‌بندی تصاویر شما را بدون نیاز به داده‌های برچسب‌دار بالا ببرد.
  • مستندات Masked Boundary Modeling را بخوانید تا متوجه شوید چگونه هدف‌گذاری داده‌ها می‌تواند نیاز به حجم عظیم دیتاست‌ها را کاهش دهد.

اما این تنها بخشی از معادله است؛ تأثیر این مدل بر کاهش هزینه‌های سخت‌افزاری در استقرار ربات‌ها را در تحلیل‌های آتی بررسی خواهیم کرد.

چرا این موضوع مهم است؟

این مدل شکاف میان بینایی ماشین و کنترل فیزیکی را می‌پرد و به ربات‌ها اجازه می‌دهد با دقت میلی‌متری محیط را درک کنند. اعتبار این دستاورد از طریق بازنشر وزن‌های باز و گزارش فنی شفاف تأیید شده است.

تأثیر برای ایران

به‌دلیل بازمتن بودن (Open Weights) و انتشار در Hugging Face، پژوهشگران رباتیک و بینایی ماشین در ایران بدون نیاز به APIهای محدود، می‌توانند از این مدل در پروژه‌های خود استفاده کنند.

·نگاه ما
تحریریه دات‌هوش

تغییر پارادایم از «معنا‌محوری» به «مرز‌محوری» نشان می‌دهد که برای رسیدن به تعامل فیزیکی، مدل‌های بزرگ‌تر لزوماً بهتر نیستند، بلکه هدف‌گذاری (Objective) آموزش تعیین‌کننده است. این رویکرد احتمالاً باعث می‌شود در آینده شاهد مدل‌های بینایی کوچک‌تر و تخصصی‌تری باشیم که در محیط‌های صنعتی، دقتی را ارائه می‌دهند که مدل‌های عمومی milliard-parameter هرگز به آن نمی‌رسند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.