پرش به محتوای اصلی
پرش به محتوای مقاله

Laya در برابر Jev؛ جایگزین متن‌باز برای APIهای بسته و گران‌قیمت

·۵ مهر ۱۴۰۵۱۰ دقیقه مطالعه۳ بازدید
مقایسه لایا و جِو: دو مدل تصمیم‌گیری متن‌باز سیستم ۱ رودررو
مقایسه لایا و جِو: دو مدل تصمیم‌گیری متن‌باز سیستم ۱ رودررو
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی یک مدل تصمیم‌گیرنده با وزن‌های باز که به‌جای تولید توکن، پاسخ ساختاریافته صادر می‌کند و تأخیر را به ۳۲.۸ میلی‌ثانیه می‌رساند؛ این اولین بار است که یک مدل سیستم ۱ با این سرعت و لایسنس Apache 2.0 در دسترس قرار می‌گیرد.

تصور کنید سیستمی دارید که به‌جای تولید کلمه به کلمه، پاسخ نهایی را در یک چشم‌بهم‌زدن صادر می‌کند. مدل Laya با ۴۲۱ میلیون پارامتر، اکنون می‌تواند تصمیمات تایپ‌شده را در ۳۲.۸ میلی‌ثانیه روی یک GPU مدل T4 پردازش کند و عملاً گلوگاه تولید توکن را در طبقه‌بندی‌های حجیم از بین ببرد. این معماری غیرخودبازگشتی (Non-autoregressive) اجازه می‌دهد مدل به‌جای تولید جریانی از متن، تنها یک پاسخ ساختاریافته صادر کند، که باعث می‌شود نقض طرح‌واره (Schema violation) به‌صورت ساختاری غیرممکن شود. زیرا هیچ چیزی توکن به توکن تولید نمی‌شود، مدل صرفاً یک انتخاب، یک امتیاز یا یک احتمال را خروجی می‌دهد و تمام پاسخ همان است.

این چرخش به سمت موتورهای «سیستم ۱» در حالی رخ می‌دهد که توسعه‌دهندگان با تأخیر و هزینه بالای مدل‌های زبانی بزرگ (LLM) دست‌وپنجه نرم می‌کنند. نام این رویکرد از چارچوب دانیل کانمن وام گرفته شده است: تفکر سیستم ۱ سریع و غریزی است (مانند واکنش‌های لحظه‌ای یا تصمیمات شهودی)، در حالی که سیستم ۲ کند و تحلیلی است. همان‌طور که در تحلیل قبلی ما درباره‌ی شکست عامل‌های هوش مصنوعی در وظایف پیچیده وب اشاره کردیم، صنعت اکنون در حال دوشاخگی است: استفاده از مدل‌های کند و تحلیلی «سیستم ۲» برای برنامه‌ریزی و مدل‌های برق‌آسای «سیستم ۱» برای فیلترهای سریع و گیت‌های بازرسی.

Laya و Jev (محصول شرکت TypeSafe AI) هر دو در سپتامبر ۲۰۲۶ و با فاصله شش روز از هم منتشر شدند و از حلقه آموزشی یادگیری تقویتی برای تصمیمات کالیبره شده (RLCD) بهره می‌برند. تفاوت اصلی در لایسنس و نحوه ارائه است: Laya با لایسنس Apache 2.0 و به‌صورت وزن‌های باز (Checkpoints) منتشر شده تا روی سخت‌افزار شخصی اجرا شود، اما Jev یک API مدیریت‌شده است که توسط دیوگو آلمیدا، یکی از مخترعان ChatGPT، تأسیس شده است. این دو مدل، یک کلاس جدید از مدل‌ها را از دو سوی خط لایسنس تعریف می‌کنند. این رقابت میان مدل‌های باز و بسته، یادآور ارزیابی‌های فنی ماست که نشان داد مدل‌های کوچک تنظیم‌شده می‌توانند تا ۲۰ برابر سریع‌تر از APIهای تجاری عمل کنند.

زمینه و خاستگاه مدل‌ها

به نقل از مستندات پروژه، Laya و Jev بیش از آنکه رقیب باشند، خواهرزاده‌های یک خانواده آموزشی هستند. با این حال، فلسفه محصول آن‌ها متفاوت است. Jev به‌عنوان یک سرویس مدیریت‌شده برای سازمان‌هایی جایگاه‌سازی شده است که ترجیح می‌دهند به‌جای مدیریت زیرساخت، از توافق‌نامه‌های سطح خدمات (SLA) و خدمات پذیرش اختصاصی (Concierge onboarding) استفاده کنند. در مقابل، Laya برای جامعه متن‌باز طراحی شده و با ارائه وزن‌های کامل، امکان استقرار در محیط‌های ایزوله (Air-gapped) را فراهم می‌کند.

تأیید عملکرد این مدل‌ها از طریق تطبیق مخزن گیت‌هاب Laya با تحلیل‌های AI Model Report در مورد محک مشترک تصمیمات تایپ‌شده صورت گرفته است. داده‌ها تأیید می‌کنند که تأخیر p50 روی GPU T4 برابر با ۳۲.۸ میلی‌ثانیه و صحت تنظیم‌شده (Fine-tuned accuracy) آن ۰.۷۶۶ است. استقبال جامعه فنی فوری بود و مخزن Laya در عرض یک هفته پس از عمومی شدن، ۲۴.۵ هزار ستاره دریافت کرد.

فلسفه سیستم ۱

یک موتور تصمیم‌گیرنده سیستم ۱ به‌طور خاص آموزش دیده تا برای یک پرسش تایپ‌شده، تنها یک پاسخ ساختاریافته و کالیبره شده صادر کند. برخلاف مدل‌های زبانی استاندارد، این مدل جریانی از توکن‌ها را تولید نمی‌کند. همین تفاوت مکانیکی است که سرعت را ممکن می‌کند؛ مدل کل ورودی را می‌خواند و خروجی را در یک گذر (Single pass) می‌نویسد.

پست معرفی TypeSafe بر این کارایی تأکید دارد و ادعا می‌کند که تأخیر انتهای-به-انتهای Jev بین ۷۰ تا ۵۰۰ میلی‌ثانیه است. Laya چهار روز بعد با استفاده از همان دستورالعمل RLCD اما با رویکرد وزن‌های باز و یک مسیریاب برای تشخیص زبان معرفی شد. برخی تحلیلگران، از جمله تحلیلگران KDnuggets، استدلال می‌کنند که مسائلی که این مدل‌ها حل می‌کنند آشنا هستند و نوآوری واقعی نه در خود وظایف، بلکه در معماری، کالیبراسیون و تجربه توسعه‌دهنده نهفته است.

معماری فنی و مؤلفه‌ها

مدل Laya بر پایه رمزگذار ModernBERT-large ساخته شده است. این مدل دو نقطه بازرسی (Checkpoint) اصلی ارائه می‌دهد: نسخه‌ای با ۴۲۱ میلیون پارامتر برای زبان انگلیسی و نسخه‌ای با ۳۲۲ میلیون پارامتر بر پایه mmBERT-base برای بیش از ۱۰۰ زبان. یک مسیریاب داخلی به‌طور خودکار اسکریپت ورودی را تشخیص داده تا درخواست‌ها را به‌درستی هدایت کند.

پیکربندی و جزئیات فنی

  • پنجره زمینه (Context Window): پیش‌فرض ۵۱۲ توکن برای انگلیسی و ۱,۰۲۴ برای ورودی‌های چندزبانه است. این مقدار با استفاده از تنظیم max_len تا ۸,۱۹۲ توکن قابل گسترش است. در مقابل، Jev تا ۶۴,۰۰۰ توکن را پشتیبانی می‌کند.
  • پشتیبانی چندزبانه: ۴۵ زبان از ۵۱ زبان محک‌زده شده، از سد کاربردی (3x-random usability bar) عبور کرده‌اند. در مقابل، Jev هیچ محک منتشرشده‌ای برای زبان‌های غیرانگلیسی ندارد.
  • هدف آموزش: Laya از هدف RLCD استفاده می‌کند؛ به این معنا که مدل برای این پاداش داده می‌شود که وقتی در ۷۰٪ موارد درست می‌گوید، اعلام کند «۷۰٪ مطمئنم»، که منجر به ایجاد احتمالات کالیبره شده می‌شود.
  • گزینه‌های استقرار: پروژه دارای بیلد‌های Docker برای ARM64 و DGX Spark است و یک نوت‌بوک Kaggle برای تنظیم دقیق (Fine-tuning) طراحی شده برای سیستم‌های 2xT4 ارائه داده است.
  • سرعت توسعه: این مخزن شاهد تکرار سریع بوده و در هفته اول انتشار، ۴۱۳ کامیت و ۲۳ تگ ثبت کرده است.

ابزارهای تصمیم‌گیری اصلی

این مدل از سه ابزار (Primitive) اصلی برای تصمیم‌گیری در محیط تولید استفاده می‌کند:

  • Choice (انتخاب): یک برچسب را از مجموعه‌ای ارائه شده انتخاب می‌کند و طبقه‌بندی و تشخیص قصد را در یک فراخوانی ترکیب می‌کند.
  • Score (امتیاز): یک جایگاه را در یک معیار رتبه‌ای (Ordinal rubric) تعیین می‌کند، مانند سطوح شدت از ۱ تا ۵.
  • Noul: یک مقدار بولی (Boolean) با احتمال کالیبره شده برمی‌گرداند که به‌عنوان یک فیلتر سریع برای تصمیمات بله/خیر در حجم بالا عمل می‌کند.

محک‌های عملکرد

بر اساس داده‌های مخزن گیت‌هاب Laya و AI Model Report، تأخیر p50 مدل روی GPU T4 برابر با ۳۲.۸ میلی‌ثانیه است. هنگام دسته‌ای کردن (Batching) ۱۰ پرسش، میانگین تأخیر به ۷.۲ میلی‌ثانیه برای هر پرسش کاهش می‌یابد و کل دسته در ۷۲.۳ میلی‌ثانیه تکمیل می‌شود. پذیرش سریع مخزن با رسیدن به ۲۴.۵ هزار ستاره در هفته اول مشهود است.

در رویارویی مستقیم در یک محک مشترک با ۲,۰۰۰ تصمیم، Laya تنظیم‌شده به صحت ۰.۷۶۶ رسید، در حالی که Jev امتیاز ۰.۷۲۷ را کسب کرد. با این حال، AI Model Report اشاره کرد که Laya روی بخش آموزشِ همان محک تنظیم شده بود، در حالی که امتیاز Jev یک عدد Out-of-the-box (بدون تنظیم) بود. این عدم تقارن، جزئیاتی حیاتی برای توسعه‌دهندگانی است که این دو را مقایسه می‌کنند.

نقاط قوت Jev

با وجود سرعت Laya، مدل Jev در وظایف با تاکسونومی گسترده و استدلال‌های با زمینه طولانی برتر است. در محک Banking77 که دارای ۷۷ برچسب قصد مختلف است، Jev امتیاز ۰.۸۷۰ را کسب کرد، در حالی که Laya با ۰.۴۲۵ به شدت متزلزل بود. Laya در انتخاب‌های محدود می‌درخشد، اما Jev در تاکسونومی‌های وسیع برنده است.

اندازه پنجره زمینه تفاوت بزرگ دیگر است. Jev تا ۶۴,۰۰۰ توکن را پشتیبانی می‌کند، به این معنی که تصمیم‌گیری روی اسناد کامل بدون تکه‌بندی (Chunking) از دسترس Laya خارج است. همچنین، عملکرد Zero-shot مدل Laya به‌طور قابل‌توجهی پایین‌تر است و برای رسیدن به نتایج مشابه Jev نیاز به تنظیم محلی دارد.

جدول مقایسه‌ای رویارویی

معیار Laya Jev 1.13.0
لایسنس Apache 2.0، میزبانی شخصی API بسته، دسترسی با لیست انتظار
پارامترها ۴۲۱ میلیون (انگلیسی) / ۳۲۲ میلیون (چندزبانه) اعلام نشده
تأخیر (۱ پرسش) ۳۲.۸ میلی‌ثانیه p50 روی T4 ۲۳۶ تا ۲۷۶ میلی‌ثانیه (شخص ثالث) / ۷۰-۵۰۰ میلی‌ثانیه (سازنده)
زمینه ۵۱۲ تا ۱,۰۲۴ (تا ۸,۱۹۲) تا ۶۴,۰۰۰ توکن
تصمیمات تایپ‌شده ۰.۷۶۶ (تنظیم‌شده) / ۰.۳۶۲ (Zero-shot) ۰.۷۲۷
Banking77 ۰.۴۲۵ ۰.۸۷۰
زبان‌ها ۴۵ زبان کاربردی فقط انگلیسی
هزینه رایگان (فقط هزینه سخت‌افزار) ۰.۰۴۲ دلار به ازای هر میلیون توکن ورودی، خروجی رایگان

محدودیت‌های تولیدی Laya

تست‌های مستقل توسط Flowtivity AI نشان می‌دهد که Laya یک موتور Zero-shot نیست. صحت Zero-shot آن در محک تصمیمات تایپ‌شده تنها ۰.۳۶۲ است، به این معنی که استقرار در محیط تولید مستلزم یک مرحله تنظیم دقیق (Fine-tuning) محلی است. کارت مدل صراحتاً Laya را «پایه‌ای سریع برای تخصصی‌سازی» می‌نامد، نه یک موتور تصمیم‌گیرنده Zero-shot.

الزامات سخت‌افزاری نیز سخت‌گیرانه است. در حالی که میزبانی Laya رایگان است، استنتاج روی CPU برای کارهای تعاملی عملاً غیرقابل استفاده است؛ تست روی یک VPS با ۴ هسته CPU، زمان پیش‌بینی گرم را ۴۹.۴ ثانیه نشان داد، در حالی که روی سخت‌افزار GPU سالم این زمان بین ۱۹۳ تا ۴۶۴ میلی‌ثانیه است. بنابراین، داشتن GPU برای محیط تولید یک الزام سخت است.

علاوه بر این، مدل در حالت پیش‌فرض بیش از حد مطمئن (Overconfident) است و با خطای کالیبراسیون مورد انتظار ۰.۴۶۶ عرضه می‌شود که تنها پس از تنظیم دما (Temperature refit) به ۰.۰۸۱ کاهش می‌یابد. مسائل دیگر شامل ابزار noul است که گاهی به‌جای وضعیت زیربنایی، از برچسب‌های گزینه‌ها پیروی می‌کند (Issue #156 در گیت‌هاب) و امتیازدهی رتبه‌ای که با ۰.۳۷۲ در SST-5 ضعیف‌ترین ابزار است.

پیاده‌سازی در دنیای واقعی

برای تیم‌های مهندسی، انتخاب به «شکل» وظیفه بستگی دارد. Laya برای موارد زیر ایده‌آل است:

  • فیلترهای ایمیل: دستیابی به صحت ۰.۹۹۳ در اسپم‌های Enron و ۰.۹۸۰ در تشخیص فیشینگ.
  • حفاظ‌های عامل (Guardrails): تشخیص جیل‌بریک‌ها (Jailbreaks) و تزریق پرامپت (با امتیاز ۰.۷۵۵ تا ۰.۷۶۲) پیش از رسیدن ورودی به مدل‌های بنیادی بزرگ.
  • مسیریابی مدل: عمل به‌عنوان اولین گیت ارزان برای ارسال پرسش‌های ساده به مدل ۴۲۱ میلیونی و پرسش‌های سخت به LLMهای بزرگ‌تر.
  • تریاژ پشتیبانی: مدیریت مجموعه‌های محدود از قصدها مانند استرداد وجه، قطعی سرویس و دسترسی به حساب.

در مقابل، Jev برای تصمیمات روی اسناد کامل یا تاکسونومی‌های گسترده که هزینه یک تصمیم غلط بیشتر از هزینه یک ساعت GPU است، انتخاب امن‌تری است. Jev همچنین عملیات در سطح سازمانی ارائه می‌دهد: بدون نیاز به مدیریت GPU، همراه با SLA، محیط Sandbox و پذیرش اختصاصی.

چرخش اقتصادی و عملیاتی

این تفکیک معماری، مفروضات حوزه استنتاج را تغییر می‌دهد. با فاصله گرفتن از تولید خودبازگشتی برای تصمیمات ساده، توسعه‌دهندگان می‌توانند هزینه‌ها را به‌شدت کاهش دهند. برای مثال، یک میلیارد توکن ورودی در Jev حدود ۴۲ دلار هزینه دارد، در حالی که هزینه Laya تنها به استهلاک سخت‌افزار محدود می‌شود.

شواهد عملی در حال جمع‌آوری است. TechCrunch گزارش داد که مهندسان Vercel، مدل Jev را ۵ تا ۱۸ برابر سریع‌تر از GPT-5.6 Terra برای طبقه‌بندی ایمنی دستورات اندازه‌گیری کرده‌اند. همچنین مدیر فنی Bryo AI اشاره کرد که Gemini برای طبقه‌بندی ایمیل در همان سطح کیفی، ۱۰ تا ۲۰ برابر گران‌تر است.

در حالی که جامعه در حال بررسی اجرای محلی است، یک دمو با استفاده از ONNX Runtime Web نشان می‌دهد Laya در تب‌های مرورگر روی CPUهای دسکتاپ با سرعت ۰.۸ تا ۱.۳ ثانیه در هر فراخوانی اجرا می‌شود و دقت PyTorch را در ۱۴ پرسش تست حفظ می‌کند. برای کسانی که حریم خصوصی داده‌ها را اولویت می‌دانند، مسیر میزبانی شخصی امکان استقرار در محیط‌های ایزوله و حذف داده‌های حساس (Secret redaction) را فراهم می‌کند و ترافیک را از سرورهای خارجی دور نگه می‌دارد.

شکاف هوش و محک‌های سطح سخت

در حالی که Laya در سرعت و هزینه پیروز است، شکاف هوشی در سناریوهای پیچیده آشکار می‌شود. یک پست وبلاگی در Hugging Face با استفاده از JevBench، «سطح سخت» تصمیمات را بررسی کرد. در این دسته، Jev امتیاز ۷۴.۱٪ را در برابر ۳۴.۱٪ Laya به دست آورد. امتیاز کلی هوش نیز به‌شدت به نفع Jev بود (۸۵.۷ در برابر ۴۵.۸).

این شکاف دقیقاً جایی است که طول زمینه و تعداد گزینه‌ها تعیین‌کننده می‌شوند. وقتی وظیفه‌ای نیاز به تحلیل یک سند عظیم یا انتخاب از یک لیست طولانی از برچسب‌ها دارد، Laya با ۴۲۱ میلیون پارامتر دچار مشکل می‌شود. معماری بسته Jev برای این محیط‌های با پیچیدگی و زمینه بالا بهینه شده است.

نتیجه‌گیری

انتخاب نهایی به شکل وظیفه برمی‌گردد: کارهای محدود، با حجم بالا، ایزوله و چندزبانه به Laya می‌روند، در حالی که کارهای با زمینه طولانی، تاکسونومی گسترده و بدون نیاز به عملیات (Zero-ops) در Jev می‌مانند. همان‌طور که یک تحلیل بیان می‌کند: «Laya ارزان‌ترین گیت اول در یک پشته تصمیم‌گیری است و Jev انتخابی امن‌تر است وقتی هزینه یک تصمیم غلط بیشتر از یک ساعت GPU باشد. اکثر تیم‌ها در نهایت هر دو را اجرا می‌کنند: Laya برای ۹۰٪ حجم ترافیک ساده و Jev برای ۱۰٪ موارد پیچیده.»

چه API مدیریت‌شده Jev را انتخاب کنید و چه وزن‌های باز Laya را، هدف یکی است: ماشین‌هایی که سریع پاسخ دهند و متوقف شوند. منتظر محک‌های جامعه در سطح سخت JevBench باشید — جایی که Jev فعلاً با ۷۴.۱٪ در برابر ۳۴.۱٪ Laya پیشتاز است — تا ببینیم آیا تنظیم دقیق Laya می‌تواند شکاف استدلال در زمینه‌های طولانی را پر کند یا خیر.

چرا این موضوع مهم است؟

این تحول با تکیه بر تخصص در معماری‌های غیرخودبازگشتی، هزینه استنتاج را برای طبقه‌بندی‌های حجیم به نزدیک صفر می‌رساند. این موضوع برای شرکت‌هایی که با میلیون‌ها درخواست در ثانیه سروکار دارند، تغییر دهنده بازی در مدیریت زیرساخت است.

تأثیر برای ایران

به‌دلیل وزن‌های باز و لایسنس Apache 2.0، توسعه‌دهندگان ایرانی می‌توانند Laya را بدون نیاز به APIهای تحریمی و به‌صورت کاملاً محلی روی سخت‌افزارهای موجود مستقر کنند.

·نگاه ما
تحریریه دات‌هوش

جدا کردن «تفکر سریع» از «تفکر تحلیلی» در معماری مدل‌ها، پایان عصر مدل‌های همه‌کاره برای هر نوع وظیفه است. Laya ثابت می‌کند که برای بسیاری از کاربردهای صنعتی، ما به «هوش» نیاز نداریم، بلکه به «دقت کالیبره شده» و «سرعت» نیاز داریم. این رویکرد احتمالاً منجر به ظهور سیستم‌های ترکیبی می‌شود که در آن مدل‌های کوچک، نقش سیستم عصبی محیطی را ایفا می‌کنند و مدل‌های بزرگ، نقش قشر پیش‌پیشانی مغز را بر عهده می‌گیرند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.