پرش به محتوای اصلی
پرش به محتوای مقاله

مدل OUI-1: دقت ۷۱.۷ درصدی در تولید رابط‌های کاربری قابل‌اجرا

·۱۷ شهریور ۱۴۰۵۸ دقیقه مطالعه۲ بازدید
استاندارد باز برای رابط کاربری تولیدشده با هوش مصنوعی
استاندارد باز برای رابط کاربری تولیدشده با هوش مصنوعی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

ترکیب معماری DiffusionGemma با یک چرخه تقطیر خودکار بر اساس پاداش ساختاری؛ این اولین بار است که یک مدل ۴ میلیاردی در تولید UI محلی، مدل‌های ۳۰ میلیاردی را شکست می‌دهد.

تصور کنید یک طراح محصول یا برنامه‌نویس باشد که بتواند تنها با یک دستور متنی، رابط کاربری کاملاً عملی و بدون خطای ساختاری را در کمتر از یک ثانیه روی لپ‌تاپ خود ببیند. این دیگر یک رویای آینده‌نگرانه نیست، بلکه دستاورد مدل جدید OUI-1 است که مرز بین ایده‌پردازی و کدنویسی رابط کاربری را از بین می‌برد.

به گزارش تیم OpenUI، مدل OUI-1 که در ۸ سپتامبر ۲۰۲۶ منتشر شد، توانست در محک Generative UI به امتیاز ۷۱.۷٪ دست یابد؛ یعنی بهبود ۵.۵ برابری نسبت به مدل پایه. این مدل که نسخه‌ای تنظیم‌شده از DiffusionGemma است، به یک مدل با ۴ میلیارد پارامتر فعال اجازه می‌دهد تا رابط‌های کاربری آماده‌ی تولید را به‌صورت محلی و روی یک GPU مصرف‌کننده ایجاد کند.

تولید رابط‌های کاربری در لحظه، همیشه با یک تضاد میان سرعت و صحت همراه بوده است. اکثر رابط‌های کاربری عامل‌محور برای حفظ پاسخ‌دهی، به مدل‌های عظیم ابری یا سخت‌افزارهای تخصصی وابسته‌اند. ساختمان این فناوری بر پایه این ایده است که سرعت نباید به قیمت دقت فدا شود. همان‌طور که در تحلیل قبلی ما درباره‌ی ابزارهایی مثل ngx-json-render و استریم کردن UI در انگولار اشاره کردیم، صنعت همواره به دنبال راهی بوده تا این رابط‌ها را به سرعت نرم‌افزارهای سنتی برساند تا کاربر احساس کند با یک نرم‌افزار نصب‌شده در حال تعامل است، نه یک مدل زبانی کند.

تیم OUI-1 برای حل این مشکل روی سه محدودیت تمرکز کرد: تولید باید زیر یک ثانیه باشد، خروجی باید از نظر ساختاری قابل‌اعتماد باشد و مدل باید روی سخت‌افزارهایی مثل RTX 5090 اجرا شود. آن‌ها برای رسیدن به این هدف، ساختار وابسته به ابر در Gemma 4 را که در پروژه AppLess استفاده شده بود، کنار گذاشتند تا مدلی بسازند که کیفیت را با محاسبات بسیار کمتر حفظ کند. هدف نهایی، ایجاد رابط‌های کاربری قابل‌اعتماد و عامل‌محور است که به‌صورت محلی و با سرعت نرم‌افزارهای سنتی تولید شوند و نیاز به ارتباط مداوم با سرورهای دوردست را از بین ببرند.

معماری سرعت

مدل OUI-1 از OpenUI Lang استفاده می‌کند؛ پروتکلی که تا ۶۷٪ توکن‌های کمتری نسبت به JSON مصرف می‌کند. این زبان — شبیه به یک کد اختصاری که فقط کلمات کلیدی مهم را نگه می‌دارد تا سرعت انتقال پیام بالا برود — باعث می‌شود رابط کاربری حتی پیش از پایان تولید کل بلوک متنی، روی صفحه ظاهر شود. این استریمینگ بهینه باعث می‌شود کاربر بلافاصله شروع به دیدن اجزای رابط کاربری کند.

تیم توسعه‌دهنده، DiffusionGemma را به عنوان زیربنا انتخاب کرد زیرا مدل‌های خودبازگشتی (Autoregressive) — مدل‌هایی که کلمه به کلمه و شبیه به تایپ کردن انسان جواب می‌دهند — معمولاً با گلوگاه پهنای‌باند حافظه مواجه می‌شوند. برخلاف آن مدل‌ها، DiffusionGemma بلوک‌های ۲۵۶ توکنی را به‌صورت یک‌جا می‌نویسد؛ این مدل از نویز شروع کرده و توکن‌ها را زمانی که به قطعیت می‌رسند، تثبیت می‌کند. بر اساس گزارش openui.com، این معماری منجر به تولید بیش از ۷۰۰ توکن در ثانیه روی RTX 5090 و بیش از ۱۰۰۰ توکن در ثانیه روی یک H100 می‌شود.

رفع شکاف قابلیت اطمینان

سرعت به تنهایی نرم‌افزار نمی‌سازد؛ کد باید واقعاً کار کند. مدل پایه DiffusionGemma در ابتدا تنها ۱۳٪ در محک Generative UI امتیاز گرفت. تیم سازنده دو حالت شکست اصلی را شناسایی کرد که پارسر OpenUI Lang تجسم آن‌ها را آسان می‌کرد:

  • خطاهای طرح‌واره (Schema Errors): زمانی رخ می‌دهد که مدل از یک المان اشتباه استفاده کند، یک ویژگی ضروری را فراموش کند یا یک کامپوننت را اختراع کند. برای مثال، استفاده از تگ h9 به عنوان سطح عنوان (در حالی که استانداردها تا h6 هستند) یا تعیین مقدار "wavy" برای نوع منحنی در یک AreaChart در حالی که این گزینه‌ها در طرح‌واره تعریف شده وجود ندارند.
  • خطاهای سیم‌کشی (Wiring Errors): مربوط به منطق ساختاری است. یک خطای سیم‌کشی زمانی رخ می‌دهد که نامی استفاده شود اما هرگز تعریف نشده باشد، یا بخشی تعریف شود اما هرگز به ریشه (root) متصل نشود. برای مثال، تعریف footer = TextContent("Updated today") اما فراموش کردن گنجاندن footer در تعریف root = Card([...])؛ در این حالت فوتر وجود دارد اما در صفحه نمایش داده نمی‌شود.

فرآیند آموزش دو مرحله‌ای

مرحله اول شامل تنظیم نظارت‌شده (SFT) — شبیه به وقتی که یک استاد هر پاسخ مدل را تصحیح می‌کند تا یاد بگیرد — با حدود ۷۰۰ نمونه از OpenUI Lang بود که توسط مدل‌های بزرگ‌تر نوشته شده و در هفت کتابخانه کامپوننت توزیع شده بودند. این مرحله به صورت یک تنظیم LoRA روی یک کارت A100 اجرا شد. اگرچه امتیاز برای کتابخانه محک به ۲۸.۸٪ رسید، اما اثر «الاک-الاک» ایجاد شد: کاهش خطاهای سیم‌کشی باعث افزایش خطاهای طرح‌واره می‌شد و برعکس.

به طور مشخص، یک اجرای آموزشی ممکن بود بخش‌های یتیم (orphaned) را کاهش دهد اما خطاهای طرح‌واره را افزایش دهد؛ اجرای بعدی دقیقاً عکس این اتفاق را رقم می‌زد. تیم گمان کرد که به حد ظرفیت LoRA رسیده‌اند، زیرا مدل تنها می‌توانست در هر لحظه یک انضباط را یاد بگیرد. علاوه بر این، زمان تولید از ۱.۶ ثانیه به ۴.۳ ثانیه در ۲۰ دستور کوتاه افزایش یافت. دلیل این اتفاق تغییر خروجی‌های کوتاه و کلی (به طور متوسط ۲۲ توکن در هر عبارت) به نام‌ها و مقادیر واقعی (به طور متوسط ۳۲ توکن در هر عبارت) بود که نیاز به دو برابر مراحل حذف نویز (denoising) برای تثبیت هر توکن داشت.

مرحله دوم، تقطیر (Distillation) — فرآیندی که در آن یک مدل کوچک‌تر، دانش یک مدل بزرگ‌تر یا یک سیستم ارزیابی را جذب می‌کند — را معرفی کرد. از آنجا که OpenUI Lang دارای یک پاداش قابل‌تأیید است (پارسِر می‌تواند فوراً بفهمد کد از نظر ساختاری درست است یا نه و خطای دقیق را شناسایی کند)، مدل تبدیل به معلم خودش شد. این چرخه شامل چهار گام بود:

۱. تولید: مدل چند صد برنامه OpenUI Lang می‌نویسد.
۲. تأیید: پارسر برنامه‌های سالم را نگه می‌دارد و یک داور آن‌ها را با دستور اولیه تطبیق می‌دهد.
۳. ترمیم: موارد نزدیک به درست توسط یک LLM اصلاح می‌شوند. مرحله ترمیم فقط نقص‌های گزارش شده توسط پارسر را رفع می‌کند؛ هر ویرایشی که باعث بازنویسی یا اختراع شود رد می‌شود. میانه تغییرات ترمیم تنها یک عبارت است و کل ساختار را به هم نمی‌ریزد.
۴. بازآموزی: بازماندگان به مجموعه آموزش دور بعد تبدیل می‌شوند (۵۰۰ گام که ۱ تا ۲ ساعت روی یک A100 زمان می‌برد).

این روش تقطیر، سرعت را بازگرداند و زمان تولید را به ۱.۹ ثانیه رساند، حتی با وجود اینکه خروجی‌ها ۲۸٪ توکن‌های بیشتری نسبت به DiffusionGemma پایه داشتند. مهم‌تر از همه، اثر الاک-الاک شکسته شد و امتیاز محک برای یک کتابخانه به ۵۷.۱٪ رسید. خطاهای طرح‌واره از ۲۹۲ به ۷۶ و خطاهای سیم‌کشی از ۹۷۱ به ۴۸۴ کاهش یافت.

تعمیم‌پذیری و بنچمارک‌ها

برای اطمینان از اینکه مدل فقط داده‌ها را حفظ نکرده است، این فرآیند روی ۲۷ کتابخانه مختلف کامپوننت تکرار شد و در نهایت مدل OUI-1 به امتیاز ۷۱.۷٪ در Generative UI Benchmark دست یافت.

این عملکرد در برابر مدل‌های وزن‌باز دیگر با پارامترهای فعال تا ۳۱ میلیارد بسیار قابل توجه است:

  • OUI-1: ۷۱.۷٪ (۴ میلیارد پارامتر فعال)
  • Qwen3.8 27B: ۷۸.۸٪ (مدل متراکم، ۲۷ میلیارد پارامتر به ازای هر توکن)
  • Qwen3.6 27B: ۶۸.۵٪
  • Qwen3.6 35B-A3B: ۶۱.۴٪
  • Gemma 4 31B: ۴۶.۷٪
  • Phi-4 14B: ۴۴٪
  • Gemma 4 26B-A4B: ۲۹.۹٪
  • Ministral 8B: ۲۷.۲٪
  • Granite 4.1 8B: ۱۴.۷٪
  • LFM 2.5 2.6B: ۳.۳٪

تست روی کتابخانه AppLess با ۶۰ پرامپت که مدل هرگز در طول آموزش ندیده بود، این پیشرفت را تأیید کرد. OUI-1 توانست ۵۵ خروجی معتبر تولید کند (معتبر به معنای پارس شدن بدون خطای طرح‌واره، تعریف شدن تمام نام‌ها و داشتن حداقل سه عبارت)، در حالی که مدل پایه DiffusionGemma تنها ۲۳ مورد را درست اجرا کرد.

مشخصات فنی

  • اندازه مدل: ۲۶ میلیارد پارامتر کل / ۴ میلیارد پارامتر فعال.
  • دقت: FP8.
  • سخت‌افزار هدف: GPUهای مصرف‌کننده (مانند RTX 5090).
  • دسترسی: وزن‌ها در Hugging Face تحت شرایط استفاده Gemma در دسترس هستند.
  • عملکرد: بهبود ۵.۵ برابری نسبت به DiffusionGemma در Generative UI Benchmark.

این تغییر به این معناست که تجربه‌ای که پیش‌تر به سخت‌افزارهای ابری Cerebras نیاز داشت، اکنون توسط یک مدل محلی و وزن‌باز تأمین می‌شود.

تحلیل: تغییر به سمت Generative UI محلی

مدل OUI-1 این فرض را تغییر می‌دهد که رابط‌های کاربری مولد با کیفیت بالا نیازمند مدل‌های متراکم و عظیم هستند. تیم توسعه با ترکیب یک زبان تخصصی (OpenUI Lang)، یک معماری غیر خودبازگشتی (DiffusionGemma) و یک حلقه پاداش قابل‌تأیید، ثابت کرد که قابلیت اطمینان را می‌توان در تعداد پارامترهای فعال کم «تقطیر» کرد.

فرضیه تیم این است که آموزش روی متن‌های تولید شده توسط خود مدل، مقدار Loss را تقریباً در همه جا پایین نگه می‌دارد و گرادینت را روی عبارات ترمیم‌شده و انتخاب‌های نمونه‌برداری شده متمرکز می‌کند. این امر مدل را چنان تیز می‌کند که حد انتروپی می‌تواند توکن‌ها را زودتر تثبیت کند، در حالی که داده‌های نوشته شده توسط معلم، گرادینت را در سبک نوشتاری متفاوتی پخش می‌کنند و باعث پراکندگی تمرکز مدل می‌شوند.

برای توسعه‌دهندگان، این به معنای فروپاشی سد تأخیر (Latency) برای رابط‌های عامل‌محور است. وقتی یک رابط کاربری بتواند به‌صورت محلی در کمتر از یک ثانیه تولید و رندر شود، UI به جای اینکه یک پاسخ کند و دیر باشد، به امتدادی سیال از فرآیند تفکر عامل تبدیل می‌شود. این مسیر را برای نرم‌افزارهایی هموار می‌کند که کل چیدمان خود را در لحظه و بر اساس قصد کاربر، بدون نیاز به رفت و برگشت به سرور، تطبیق می‌دهند.

گام‌های بعدی

سه جهت اصلی آینده این فناوری را تعریف می‌کنند:

  • دستگاه‌های شخصی: اجرای مدل‌هایی مانند OUI-1 نزدیک‌تر به کاربر برای نگه داشتن بافت (Context) بیشتر روی دستگاه و افزایش حریم خصوصی.
  • OpenUI Lang 0.5: تولید رابط‌های کاربری با وضعیت (State)، کوئری‌ها و تغییرات (Mutations) مخصوص به خود، تا مدیریت تعامل از مدل به زمان اجرا (Runtime) منتقل شود و رابط‌ها هوشمندتر شوند.
  • کاهش بیشتر تأخیر: ادامه تلاش برای رسیدن به رابط‌های محلی قابل‌اعتمادی که در کمتر از یک ثانیه ظاهر شوند و تجربه کاربری را به سطح نرم‌افزارهای Native برسانند.

شما می‌توانید وزن‌های OUI-1 را از Hugging Face دانلود کنید تا تولید UI محلی را روی سخت‌افزار خود آزمایش کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر تخصص تیم OpenUI در معماری مدل‌های انتشار، سد تأخیر در رابط‌های کاربری عامل‌محور را می‌شکند. اکنون توسعه‌دهندگان می‌توانند UIهایی بسازند که در لحظه و بدون نیاز به سرور، با قصد کاربر تغییر شکل می‌دهند.

تأثیر برای ایران

به‌دلیل وزن‌باز بودن مدل و قابلیت اجرا روی GPUهای مصرف‌کننده، توسعه‌دهندگان ایرانی می‌توانند بدون نیاز به APIهای گران‌قیمت و تحریم‌شده، ابزارهای تولید UI محلی را پیاده‌سازی کنند.

·نگاه ما
تحریریه دات‌هوش

استفاده از مدل‌های غیرخودبازگشتی (Non-autoregressive) در کنار یک زبان تخصصی، ثابت کرد که برای کارهای ساختاریافته‌ای مثل تولید UI، لزوماً به مدل‌های متراکم و عظیم نیاز نیست. در واقع، تقطیر دانش از طریق یک سیستم پاداش قابل‌تأیید (Verifiable Reward)، دقت را به جای افزایش اندازه مدل، از طریق بهینه‌سازی توزیع احتمالات توکن‌ها بالا برده است. این رویکرد احتمالاً الگوی آینده برای مدل‌های تخصصی لبه (Edge AI) خواهد بود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.