پرش به محتوای اصلی
پرش به محتوای مقاله

Ollaya تأخیر استنتاج مدل‌های تصمیم‌گیر را به ۸.۹ میلی‌ثانیه رساند

·۳ مهر ۱۴۰۵۲ دقیقه مطالعه۲ بازدید
اجرا مدل‌های تصمیم‌گیری به صورت محلی
اجرا مدل‌های تصمیم‌گیری به صورت محلی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی کامل تولید توکن‌به‌توکن با مدل‌های تصمیم‌گیر محلی برای رسیدن به تأخیر زیر ۱۰ میلی‌ثانیه؛ در حالی که اکثر ابزارهای محلی فعلی همچنان از متدهای تولید متنی کند استفاده می‌کنند.

تصور کنید یک برنامه‌نویس بخواهد هزاران ایمیل حساس را در هر ثانیه دسته‌بندی کند، بدون اینکه داده‌ها از سرور شرکت خارج شوند یا منتظر پاسخ‌های کندِ ابری بماند. این دقیقاً همان نقطه‌ای است که Ollaya وارد میدان می‌شود تا استنتاج را از حالت «تولید متن» به «تصمیم‌گیری آنی» تغییر دهد.

طبق اعلام این پروژه در ۲۵ سپتامبر ۲۰۲۶، یک پاس پیشرو (Forward Pass) روی کارت گرافیک NVIDIA RTX 4090 می‌تواند پرسش‌های پیچیده را تنها در ۸.۹ میلی‌ثانیه حل کند. این سرعت خیره‌کننده به‌دلیل استفاده از مدل‌های تصمیم‌گیر است که تأخیرهای معمول در استنتاج (Inference) — که شبیه لحظه آشپزی واقعی است، نه دوره‌ی آموزش آشپز — را حذف کرده‌اند.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی رایانش لبه اشاره کردیم، انتقال پردازش از ابر به سخت‌افزار محلی، کلید حل بحران حریم خصوصی است. امروزه اکثر برنامه‌ها به APIهای ابری متکی هستند که علاوه بر تأخیر شبکه، ریسک‌های امنیتی دارند؛ به‌ویژه برای کسب‌وکارهایی که با تیکت‌های حساس سر و کار دارند و ارسال داده به ابر برایشان غیرممکن است.

بر اساس مستندات ollaya.dev، این پلتفرم با SDK پایتون TypeSafe نسخه ۰.۷.۱ سازگار است و از مدل‌های وزن‌های باز (Open Weights) — یعنی مدل‌هایی که دستور پختشان علناً منتشر شده و فقط غذای آماده نیستند — از شرکت Convai Innovations پشتیبانی می‌کند:

  • Laya: نسخه‌های انگلیسی و چندزبانه (تأخیر میانگین ۸.۱ تا ۹.۶ میلی‌ثانیه).
  • GLICLASS: مدل تصمیم‌گیر تخصصی (۱۴.۷ میلی‌ثانیه).
  • NLI: مدل استنتاج زبان طبیعی (۲۰.۴ میلی‌ثانیه).
  • Decider: در اندازه‌های ۰.۸ و ۲ میلیارد پارامتر (۱۵۵ تا ۱۹۰ میلی‌ثانیه).

به گزارش بنچمارک‌های شخص ثالث، APIهای ابری مانند Jev تأخیری بین ۲۳۶ تا ۲۷۶ میلی‌ثانیه دارند، اما اجرای محلی Ollaya روی RTX 4090 این عدد را یک مرتبه بزرگی کاهش می‌دهد. این سامانه به‌صورت یک فایل باینری واحد روی macOS، ویندوز و لینوکس اجرا می‌شود و از داکر برای استقرار در سرورها پشتیبانی می‌کند.

این تغییر نشان‌دهنده روی آوردن معماری هوش مصنوعی به سمت «ریز-تصمیم‌ها» است. به‌جای استفاده از یک مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه خوانده و حالا با همان لحن جواب می‌دهد — برای تشخیص قصد کاربر، توسعه‌دهندگان می‌توانند یک مدل کوچک و کالیبره شده را به‌عنوان یک مسیریاب سریع مستقر کنند. این کار هزینه‌های محاسباتی را می‌کشد و غیرقابل‌پیش‌بینی بودن خروجی‌های زاینده را حذف می‌کند.

گام بعدی شما

  • با اجرای دستور ollaya run laya در ترمینال، سرعت پاسخ‌دهی محلی را تست کنید.
  • برای پیاده‌سازی مسیریاب‌های سریع در اپلیکیشن خود، مستندات TypeSafe SDK را بررسی کنید.
  • مخزن گیت‌هاب پروژه را برای دریافت وزن‌های جدید مدل‌ها دنبال کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این فناوری با تکیه بر تخصص در بهینه‌سازی استنتاج محلی، وابستگی سازمان‌ها به زیرساخت‌های ابری گران‌قیمت و ناامن را می‌شکند. کاهش تأخیر به زیر ۱۰ میلی‌ثانیه، امکان ایجاد عامل‌های هوش مصنوعی با واکنش آنی را فراهم می‌کند.

تأثیر برای ایران

به‌دلیل متن‌باز بودن و اجرای محلی، توسعه‌دهندگان ایرانی می‌توانند بدون نیاز به VPN یا پرداخت ارزی برای APIها، مدل‌های تصمیم‌گیر سریع را در زیرساخت‌های داخلی مستقر کنند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی مدل‌های زاینده با مدل‌های تصمیم‌گیر در لایه‌های ابتدایی معماری، پایان عصر «همه-کار بودن» مدل‌های بزرگ برای کارهای ساده است. این رویکرد باعث می‌شود LLMها از نقش «منشی ورودی» خارج شده و فقط برای استدلال‌های عمیق به کار روند، در حالی که مدل‌های ریز-تصمیم‌گیر، ترافیک ورودی را با سرعت میلی‌ثانیه‌ای مدیریت می‌کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.