پرش به محتوای اصلی
پرش به محتوای مقاله

LuxurAI با موتور vLLM دوگانه دقتِ درک صفحه را در عامل‌های دسکتاپ ارتقا داد

·۳۱ مرداد ۱۴۰۵۱ دقیقه مطالعه۱ بازدید
دو GPU با vLLM برای درک صفحه نمایش و تعیین مختصات در عامل‌های دسکتاپ (Neo نسخه ۰.۱)
دو GPU با vLLM برای درک صفحه نمایش و تعیین مختصات در عامل‌های دسکتاپ (Neo نسخه ۰.۱)
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی مکانیزم کامپایل بلوکی برای حذف خطاهای زنجیره‌ای در UI و استفاده از موتور بینایی دوگانه برای افزایش دقت مبنی‌سازی مختصات در محیط دسکتاپ.

اگر از ابزارهای کدنویسی هوش مصنوعی برای طراحی رابط کاربری استفاده می‌کنید، احتمالاً با کابوسِ یک تگِ باز که کل چیدمان صفحه را به‌هم می‌ریزد آشنا هستید. شرکت LuxurAI در ۲۲ اوت ۲۰۲۶ با معرفی Neo v0.1 ادعا می‌کند که این مشکل را به‌طور ساختاری حل کرده است.

این سیستم از یک موتور بینایی دوگانه بهره می‌برد تا عامل‌های هوش مصنوعی (AI Agents) — شبیه دستیارهای دیجیتالی که می‌توانند به‌جای شما روی دسکتاپ کلیک کنند و کارها را پیش ببرند — بتوانند صفحه نمایش را با دقت بالاتری درک کرده و مختصات را مبنی‌سازی (Grounding) کنند.

همان‌طور که در تحلیل قبلی ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، مدیریت پیچیدگی در سیستم‌های خودکار همواره یک چالش بوده است. در ابزارهای فعلی، تولید فایل‌های حجیم و یکپارچه باعث می‌شود کوچک‌ترین خطا در یک بخش، کل پروژه را مختل کند. به همین دلیل، تیم LuxurAI رویکرد خود را از خروجی‌های تک‌فایلی به ساختاری ماژولار تغییر داد. این تلاش برای افزایش دقت خروجی، یادآور رویکرد WaveMaker AI در حذف توهمات مدل‌های زبانی از طریق کامپایل دو مرحله‌ای است که پیش‌تر بررسی کردیم.

به نقل از گزارش dev.to، معماری Neo v0.1 بر چهار رکن اصلی استوار است:

  • کامپایل بلوکی ماژولار: سنتز رابط کاربری به بلوک‌های مجزا تقسیم شده و توسط درخت‌های نحو انتزاعی (AST) اعتبارسنجی می‌شوند.
  • موتور مدل دوگانه: ترکیب یک مدل بینایی داخلی که روی دو واحد پردازش گرافیکی (GPU) اجرا می‌شود با APIهای استدلالی خارجی.
  • مشخصات طراحی: حفظ هارمونی بصری از طریق یک پرامپت جامع DESIGN.md بر اساس تئوری نسبت طلایی.
  • احراز هویت بدون ذخیره‌سازی: استفاده از توکن‌های یک‌بارمصرف ۳۸۴ بیتی برای حذف نیاز به پایگاه‌داده‌های رمز عبور.

طبق اعلام این شرکت، این تغییر برای کاربر به معنای کاهش چیدمان‌های خراب و پیش‌بینی‌پذیرتر شدن فرآیند طراحی است. با جداسازی اجزای رابط کاربری، یک خطای نحوی کوچک در یک بخش دیگر به کل پروژه سرایت نمی‌کند. این رویکرد، این فرض قدیمی را که عامل‌های UI باید کل وضعیت صفحه را به‌عنوان یک موجودیت یکپارچه پردازش کنند، به چالش می‌کشد.

در حال حاضر LuxurAI نسخه‌های آزمایشی خود را با مدل پرداخت به‌ازای مصرف (Pay-as-you-go) و قیمت ۰.۲۵ روپیه به‌ازای هر اعتبار ارائه می‌دهد تا توسعه‌دهندگان بتوانند سیستم مبنی‌سازی مختصات آن را تست کنند.

گام بعدی شما

  • اگر توسعه‌دهنده Front-end هستید، معماری کامپایل بلوکی Neo را برای کاهش نرخ خطای سنتز UI بررسی کنید.
  • مدل قیمت‌گذاری اعتباری LuxurAI را با هزینه‌های استنتاج فعلی خود مقایسه کنید.
  • مستندات DESIGN.md این سیستم را برای یادگیری نحوه اعمال نسبت طلایی در پرامپت‌ها مطالعه کنید.

اما تأثیر این معماری بر کاهش مصرف VRAM در سیستم‌های محلی حتی جذاب‌تر است — به تحلیل ما درباره‌ی بهینه‌سازی‌های vLLM مراجعه کنید.

چرا این موضوع مهم است؟

این رویکرد با تکیه بر تخصص در حوزه vLLM، دقتِ تعامل هوش مصنوعی با محیط‌های گرافیکی را افزایش می‌دهد. در نتیجه، اعتماد سازمان‌ها برای سپردن تسک‌های حساس دسکتاپ به عامل‌های خودکار بیشتر می‌شود.

تأثیر برای ایران

به‌دلیل مدل پرداخت روپیه‌ای و محدودیت‌های احتمالی API، دسترسی توسعه‌دهندگان ایرانی به نسخه‌های آزمایشی Neo v0.1 دشوار است.

·نگاه ما
تحریریه دات‌هوش

جایگزینی خروجی‌های یکپارچه با کامپایل بلوکی، نقطه عطفی در گذار از «تولید متن» به «تولید ساختار» است. این رویکرد نشان می‌دهد که برای رسیدن به پایداری در عامل‌های دسکتاپ، باید محدودیت‌های نحوی را از لایه مدل به لایه کامپایلر منتقل کرد تا نرخ خطای آبشاری حذف شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.