تصور کنید یک برنامهنویس بخواهد هزاران ایمیل حساس را در هر ثانیه دستهبندی کند، بدون اینکه دادهها از سرور شرکت خارج شوند یا منتظر پاسخهای کندِ ابری بماند. این دقیقاً همان نقطهای است که Ollaya وارد میدان میشود تا استنتاج را از حالت «تولید متن» به «تصمیمگیری آنی» تغییر دهد.
طبق اعلام این پروژه در ۲۵ سپتامبر ۲۰۲۶، یک پاس پیشرو (Forward Pass) روی کارت گرافیک NVIDIA RTX 4090 میتواند پرسشهای پیچیده را تنها در ۸.۹ میلیثانیه حل کند. این سرعت خیرهکننده بهدلیل استفاده از مدلهای تصمیمگیر است که تأخیرهای معمول در استنتاج (Inference) — که شبیه لحظه آشپزی واقعی است، نه دورهی آموزش آشپز — را حذف کردهاند.
همانطور که در تحلیلهای قبلی ما دربارهی رایانش لبه اشاره کردیم، انتقال پردازش از ابر به سختافزار محلی، کلید حل بحران حریم خصوصی است. امروزه اکثر برنامهها به APIهای ابری متکی هستند که علاوه بر تأخیر شبکه، ریسکهای امنیتی دارند؛ بهویژه برای کسبوکارهایی که با تیکتهای حساس سر و کار دارند و ارسال داده به ابر برایشان غیرممکن است.
بر اساس مستندات ollaya.dev، این پلتفرم با SDK پایتون TypeSafe نسخه ۰.۷.۱ سازگار است و از مدلهای وزنهای باز (Open Weights) — یعنی مدلهایی که دستور پختشان علناً منتشر شده و فقط غذای آماده نیستند — از شرکت Convai Innovations پشتیبانی میکند:
- Laya: نسخههای انگلیسی و چندزبانه (تأخیر میانگین ۸.۱ تا ۹.۶ میلیثانیه).
- GLICLASS: مدل تصمیمگیر تخصصی (۱۴.۷ میلیثانیه).
- NLI: مدل استنتاج زبان طبیعی (۲۰.۴ میلیثانیه).
- Decider: در اندازههای ۰.۸ و ۲ میلیارد پارامتر (۱۵۵ تا ۱۹۰ میلیثانیه).
به گزارش بنچمارکهای شخص ثالث، APIهای ابری مانند Jev تأخیری بین ۲۳۶ تا ۲۷۶ میلیثانیه دارند، اما اجرای محلی Ollaya روی RTX 4090 این عدد را یک مرتبه بزرگی کاهش میدهد. این سامانه بهصورت یک فایل باینری واحد روی macOS، ویندوز و لینوکس اجرا میشود و از داکر برای استقرار در سرورها پشتیبانی میکند.
این تغییر نشاندهنده روی آوردن معماری هوش مصنوعی به سمت «ریز-تصمیمها» است. بهجای استفاده از یک مدل زبانی بزرگ (LLM) — مثل کتابخانهداری که میلیاردها صفحه خوانده و حالا با همان لحن جواب میدهد — برای تشخیص قصد کاربر، توسعهدهندگان میتوانند یک مدل کوچک و کالیبره شده را بهعنوان یک مسیریاب سریع مستقر کنند. این کار هزینههای محاسباتی را میکشد و غیرقابلپیشبینی بودن خروجیهای زاینده را حذف میکند.
گام بعدی شما
- با اجرای دستور
ollaya run layaدر ترمینال، سرعت پاسخدهی محلی را تست کنید. - برای پیادهسازی مسیریابهای سریع در اپلیکیشن خود، مستندات TypeSafe SDK را بررسی کنید.
- مخزن گیتهاب پروژه را برای دریافت وزنهای جدید مدلها دنبال کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو