پرش به محتوای اصلی
پرش به محتوای مقاله

چگونه مدل Jev هزینه‌های عملیاتی عامل‌های AI را ۲۲ برابر کاهش می‌دهد؟

·۶ مهر ۱۴۰۵۵ دقیقه مطالعه۱ بازدید
لوگوی Jev از TypeSafe AI و نمادهایی از ۲۰ کاربرد عامل‌محور هوش مصنوعی
لوگوی Jev از TypeSafe AI و نمادهایی از ۲۰ کاربرد عامل‌محور هوش مصنوعی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی مدل Jev که به‌جای تولید توکن‌های متنی، خروجی‌های تایپ‌شده با احتمال کالیبره‌شده ارائه می‌دهد و هزینه تصمیم‌گیری را تا ۲۲ برابر کاهش می‌دهد.

هر تصمیم در یک حلقهٔ عملیاتی عامل هوش مصنوعی، اکنون تنها ۰.۱۱ دلار هزینه دارد؛ رقمی که در مقایسه با ۲.۴۲ دلار مورد نیاز هنگام استفاده از یک مدل زبانی پیشرو (Frontier LLM)، سقوطی چشمگیر است. این بهینه‌سازی مدیون مدل Jev است؛ یک مدل تخصصی «سیستم یک» که هفته‌ی گذشته توسط شرکت TypeSafe AI منتشر شد تا متن‌های گران‌قیمت مولد را با احتمالات کالیبره‌شده و تصمیمات تایپ‌شده جایگزین کند.

بیشتر عامل‌های هوش مصنوعی فعلی برای مدیریت هر قضاوت کوچک — از مسیریابی یک درخواست تا بررسی اینکه آیا یک وظیفه به پایان رسیده است یا خیر — به مدل‌های زبانی بزرگ (LLMs) متکی هستند. این رویکرد به‌دلیل اینکه مدل‌های LLM توکن‌ها را یکی‌یکی تولید می‌کنند، کند و هزینه‌بر است. Jev این بازی را تغییر می‌دهد و این قضاوت‌ها را به‌جای وظایف نوشتاری، به عنوان مسائل «طبقه‌بندی» (Classification) می‌بیند. این رویکرد در واقع تکامل همان ایده‌ای است که مدل Jev با تبدیل تصمیمات هوش مصنوعی از متن به داده‌های ساختاریافته برای اولین بار معرفی کرد تا جایگزینی برای خروجی‌های مولد باشد.

شرکت TypeSafe AI توسط دیوگو آلمیدا، پژوهشگر سابق OpenAI که روی تحقیقات مربوط به دستورپذیری (Instruction-following) در پشت‌صحنه ChatGPT کار کرده بود، تأسیس شد. او Jev را برای مدیریت «قضاوت‌های کوچک» درون یک حلقهٔ عامل طراحی کرد. برخلاف ChatGPT، مدل Jev نمی‌تواند گپ بزند، کد بنویسد یا متن را خلاصه کند. این مدل وضعیت‌های بدون ساختار (Unstructured State) را می‌گیرد و یکی از سه خروجی اصلی (Primitives) را برمی‌گرداند: انتخاب (Choice - انتخاب از یک لیست)، امتیاز (Score - رتبه‌بندی بر اساس یک معیار) یا نول (Noul - احتمال حقیقت بین ۰ تا ۱).

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی بهینه‌سازی هزینه‌های استنتاج اشاره کردیم، حذف لایه‌های غیرضروری تولید متن، کلید مقیاس‌پذیری عامل‌هاست.

معماری فنی و عملکرد

طبق مستندات TypeSafe AI، هر فراخوانی به Jev شامل یک وضعیت (که به صورت متن یا JSON ارائه می‌شود) و یک دیکشنری از پرسش‌های تایپ‌شده است. تمام پرسش‌ها به‌صورت موازی در یک درخواست واحد علیه همان وضعیت ارزیابی می‌شوند. سه خروجی اصلی به این شرح تعریف شده‌اند:

  • انتخاب (Choice): یک گزینه را از یک لیست برمی‌گزیند و برای هر گزینه یک احتمال به‌همراه میزان اطمینان (Confidence) برمی‌گرداند. این قابلیت از حداکثر ۲۵۵ گزینه پشتیبانی می‌کند.
  • امتیاز (Score): وضعیت را بر اساس سطوح مرتب‌شده‌ی یک معیار (Rubric) رتبه‌بندی کرده و احتمالات را به‌همراه میزان اطمینان برمی‌گرداند.
  • نول (Noul): احتمال (بین ۰ تا ۱) درست بودن یک گزاره یا statement خاص را محاسبه می‌کند.

این شرکت برای آموزش Jev از روش «یادگیری تقویتی برای تصمیمات کالیبره‌شده» (RLCD) استفاده کرده است. این تکنیک تضمین می‌کند وقتی مدل اطمینان بالایی را گزارش می‌کند، این عدد واقعاً با دقت بالاتر در دنیای واقعی همبستگی داشته باشد.

به نقل از ارزیابی‌های داخلی TypeSafe، مدل Jev در مقایسه با پاسخ‌های مرجع از مدل‌های GPT-6 Astra و Fable 5.1، حدود ۱۹۳.۶ برابر سریع‌تر و ۴۴۴.۶ برابر ارزان‌تر است. در یک آزمون رودررو در بنچمارک Banking77 از طریق OpenRouter، Jev به صحت ۸۱.۰٪ رسید، در حالی که Claude Opus 5 صحت ۸۴.۴٪ داشت. با وجود این اختلاف اندک در دقت، Jev در میانهٔ زمان پاسخگویی ۱۳ برابر سریع‌تر و تقریباً ۱/۲۲ هزینهٔ مدل کلود بود.

۲۰ مورد کاربردی برای عامل‌ها

شرکت TypeSafe حوزه‌هایی را شناسایی کرده که در آن‌ها Jev جایگزین مدل‌های مولد می‌شود. این موارد بر اساس مکانیسم خاص حلقهٔ عامل دسته‌بندی شده‌اند:

مسیریابی و ارکستراسیون:

  • مسیریابی مدل: Jev دشواری درخواست را می‌سنجد تا آن را به یک مدل سریع یا یک مدل قدرتمند بفرستد. LangChain این قابلیت را به عنوان ModelRouterMiddleware عرضه کرده است، در حالی که jev-router این کار را در هر نوبت برای Codex و Claude Code انجام می‌دهد.
  • انتخاب مهارت: در کتابچه راهنمای پیشنهاد مهارت TypeSafe، این مدل می‌تواند از بین ۱۸۲ مهارت در کاتالوگ Hermes متعلق به Nous Research، حداکثر یک مهارت را تنها با دو درخواست انتخاب کند.
  • فراخوانی تابع تایپ‌شده: یک کتابچه راهنمای اختصاصی، درخواست‌های معاملاتی به زبان طبیعی را به نام توابع و آرگومان‌های مجموعه-بسته (Closed-set) نگاشت می‌کند که توسط سطح اطمینان کنترل می‌شود.
  • تریاژ تیکت‌ها: یک فراخوانی می‌تواند هم‌زمان بخش مربوطه، سطح عصبانیت کاربر و فوریت درخواست را برگرداند. سپس الگوی مسیریابی قصد (Intent Routing)، درخواست را به یک انسان، یک LLM متخصص یا منطق قطعی (Deterministic) می‌فرستد.

ایمنی و حفاظ‌ها (Guardrails):

  • کنترل ریسک ابزارها: ابزار pi-warden بررسی می‌کند آیا یک دستور bash، نوشتن یا ویرایش در انتظار، خارج از وظیفه یا غیرقابل بازگشت است یا خیر. برای مثال، این ابزار دستور db:reset را پس از عبارت «پایگاه داده را ریست کن» اجازه می‌دهد اما پس از عبارت «یک ستون اضافه کن» آن را مسدود می‌کند. AutoModeMiddleware در LangChain برای این فراخوانی‌های پرریسک خطا برمی‌گرداند.
  • تأیید خودکار خواندنی: هوک jev-auto-approve برای Claude Code تنها زمانی دستورات را تأیید می‌کند که احتمال صحت (p) برابر یا بیشتر از ۰.۹۵ باشد. در کالیبراسیون‌های منتشر شده، این ابزار ۰ مورد از ۸ دستور تغییر وضعیت (State-changing) را تأیید کرد.
  • جلوگیری از نشت اسرار: ابزار jev-secret-guard رشته‌های ماسک‌شده را به Jev می‌فرستد. در مرحله کالیبراسیون، این ابزار ۶ مورد از ۶ راز را مسدود کرد و ۰ مورد از ۶ رشته بی‌خطر را مسدود نکرد.
  • غربالگری تزریق پرامپت: در یک کتابچه راهنمای مربوط به قطعات RAG، شباهت کسینوسی (Cosine Similarity) یک تزریق planted را در رتبه اول با امتیاز ۰.۵۸۴ قرار داد. اما Jev به آن امتیاز ۰.۹۹ داد و آن را حذف کرد.
  • حفاظ‌های ورودی/خروجی: کتابچه راهنمای guardrails آستانه‌های احتمال خطر را تعیین می‌کند تا هر پیام را برای عبور، بررسی، مسدود کردن یا مسیریابی ارزیابی کند.

بازیابی و مبنی‌سازی (Grounding):

  • بازرتبه‌بندی (Reranking): در ۴۰ پرس‌وجوی حقوقی CLERC، کتابچه راهنمای بازرتبه‌بندی، دقت رتبه اول را از ۵٪ به ۱۸٪ و دقت رتبه دهم را از ۳۸٪ به ۶۲٪ افزایش داد.
  • تأیید استنادها: کتابچه راهنمای بررسی استنادها از یک خروجی Choice استفاده می‌کند تا تصمیم بگیرد آیا یک بخش از منبع، ادعایی را تأیید می‌کند، رد می‌کند یا هیچ چیزی درباره آن نمی‌گوید.

کنترل مرورگر و سیستم در لحظه:

  • عامل‌های مرورگر: ابزار Jev Ultrafast در Browser Use، عملیات و المان DOM را در یک درخواست انتخاب می‌کند و جست‌وجوی Google Flights را در حدود ۷.۱ ثانیه به پایان می‌رساند.
  • استفاده از دسکتاپ: ابزار typesafe-computer-use صفحه macOS را OCR کرده و اجازه می‌دهد Jev اقدام بعدی را با هزینه تقریبی ۰.۰۰۰۲ دلار به‌ازای هر گام طبقه‌بندی کند.
  • عامل‌های موبایل: Mobile Jev برای هر ضربه (Tap) در اندروید تصمیم می‌گیرد و در حدود ۲۱ ثانیه از طریق ۹ اقدام به صفحه پرداخت Uber می‌رسد.
  • گیمینگ در لحظه: یک دموی بازی Doom حدود ۱۰ پرس‌وجو در ثانیه روی وضعیت ساختاریافته بازی اجرا می‌کند که هزینه آن تقریباً ۷ دلار در ساعت است.

کیفیت و حافظه عامل:

  • جلوگیری از رکود حلقه: ابزار ProgressGate مسیر حرکت (Trajectory) را قضاوت کرده و یکی از دستورات CONTINUE، WARN، REPLAN یا HALT را برمی‌گرداند.
  • تأیید اتمام کار: ابزار jev-belay پیش از پذیرش ادعای «اتمام کار» توسط یک عامل Claude Code، متن گفتگو را برای یافتن شواهد بررسی می‌کند.
  • فشرده‌سازی زمینه: ابزار fast-jev-compaction به‌جای خلاصه‌سازی زمینه، فراخوانی‌های ابزار را امتیازدهی کرده و موارد قدیمی (Stale) را حذف می‌کند.
  • استخراج ردپا: ابزار Beacon توسط Asymptote Labs از Jev استفاده می‌کند تا اجراهایی را در Cursor، OpenCode، Codex و Claude Code بیابد که ارزش تبدیل شدن به مهارت‌های قابل استفاده مجدد را دارند.
  • لینتینگ معنایی: ابزار jev-lint تخلف از قوانین تیمی را در زمان ویرایش برای Codex و Claude Code علامت‌گذاری می‌کند.

استقرار و رقابت

مدل Jev از طریق APIهای میزبانی‌شده TypeSafe، Vercel AI Gateway و OpenRouter با قیمت ۰.۰۴۲ دلار به‌ازای هر میلیون توکن ورودی در دسترس است و توکن‌های خروجی به‌صورت رایگان ارائه می‌شوند. تأخیر (Latency) این مدل بین ۷۰ تا ۵۰۰ میلی‌ثانیه است که میانه آن در OpenRouter حدود ۱۷۵ میلی‌ثانیه است.

این مدل با جایگزین‌های وزن‌باز (Open Weights) مانند Laya (یک مدل انکودر بر پایه ModernBERT-large با ۴۲۱ و ۳۲۲ میلیون پارامتر) و kev (یک LoRA + readout head روی Qwen2.5-0.5B) رقابت می‌کند. در حالی که Laya و kev قابلیت میزبانی شخصی از طریق pip یا GPU محلی دارند، آموزش RLCD در Jev تمرکز ویژه‌ای بر «اطمینان کالیبره‌شده» دارد که مدل‌های مولد معمولاً فاقد آن هستند. برای مقایسه، میانه تأخیر Claude Opus 5 در OpenRouter حدود ۲۲۶۶ میلی‌ثانیه است.

چرخش به سمت مدل‌های «سیستم یک» نشان می‌دهد آینده هوش مصنوعی عامل‌محور، یک مدل غول‌پیکر نیست، بلکه یک پشته ترکیبی است. در این معماری، یک LLM «سیستم دو» برنامه‌ریزی و نوشتار پیچیده را بر عهده می‌گیرد و مدلی مثل Jev، وظایف پرتکرار، کم‌تأخیر و نظارتی (Gating and Verification) را مدیریت می‌کند.

برای توسعه‌دهندگان، این یعنی گلوگاه قابلیت اطمینان عامل‌ها از «مهندسی پرامپت» (Prompt Engineering) — هنر سؤال درست پرسیدن برای گرفتن بهترین جواب — به «کالیبراسیون آستانه» تغییر می‌کند. شما دیگر از مدل نمی‌خواهید «مراقب باشد»، بلکه یک آستانه احتمال سخت (مثلاً p ≥ ۰.۹۵) را پیش از اجرای یک دستور تعیین می‌کنید.

گام بعدی شما

  • لاگ‌های عامل‌های خود را بررسی کنید تا تصمیمات تکراری و دوگانه (بله/خیر) که توکن‌های LLM را می‌بلعند، شناسایی کنید.
  • این گره‌های تصمیم‌گیر را با یک مدل تخصصی تصمیم‌گیری تست کنید تا هزینه‌های عملیاتی را به‌شدت کاهش دهید.
  • برای دستورات حساس (مانند حذف داده)، یک آستانه احتمال سخت (مثلاً ۹۸٪) تعریف کنید تا نرخ خطای عامل کاهش یابد.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با کاهش شدید هزینه و تأخیر، مانع اصلی استقرار عامل‌های هوش مصنوعی در مقیاس تجاری را برمی‌دارد. تخصص TypeSafe در کالیبراسیون احتمالات، اجازه می‌دهد تا سیستم‌های خودکار بدون نیاز به نظارت انسانی دائمی و با ریسک پایین‌تر اجرا شوند.

تأثیر برای ایران

توسعه‌دهندگان ایرانی که با محدودیت بودجه برای APIهای گران‌قیمت مواجه‌اند، می‌توانند با جایگزینی گره‌های تصمیم‌گیر با مدل‌های مشابه یا Jev، هزینه‌های عملیاتی عامل‌های خود را به‌شدت کاهش دهند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی تولید متن با احتمالات کالیبره‌شده، پایان عصر «امید به دقت» در عامل‌هاست و آغاز عصر «سنجش ریاضی دقت» است. این رویکرد نشان می‌دهد که برای رسیدن به قابلیت اطمینان صنعتی، باید از مدل‌های General-purpose فاصله گرفت و به سمت معماری‌های Hybrid رفت که در آن مدل‌های کوچک، نقش نگهبان (Gatekeeper) را ایفا می‌کنند. در واقع، Jev ثابت می‌کند که برای بسیاری از وظایف عامل‌ها، ما به «زبان» نیاز نداریم، بلکه به «تصمیم» نیاز داریم.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.