هر تصمیم در یک حلقهٔ عملیاتی عامل هوش مصنوعی، اکنون تنها ۰.۱۱ دلار هزینه دارد؛ رقمی که در مقایسه با ۲.۴۲ دلار مورد نیاز هنگام استفاده از یک مدل زبانی پیشرو (Frontier LLM)، سقوطی چشمگیر است. این بهینهسازی مدیون مدل Jev است؛ یک مدل تخصصی «سیستم یک» که هفتهی گذشته توسط شرکت TypeSafe AI منتشر شد تا متنهای گرانقیمت مولد را با احتمالات کالیبرهشده و تصمیمات تایپشده جایگزین کند.
بیشتر عاملهای هوش مصنوعی فعلی برای مدیریت هر قضاوت کوچک — از مسیریابی یک درخواست تا بررسی اینکه آیا یک وظیفه به پایان رسیده است یا خیر — به مدلهای زبانی بزرگ (LLMs) متکی هستند. این رویکرد بهدلیل اینکه مدلهای LLM توکنها را یکییکی تولید میکنند، کند و هزینهبر است. Jev این بازی را تغییر میدهد و این قضاوتها را بهجای وظایف نوشتاری، به عنوان مسائل «طبقهبندی» (Classification) میبیند. این رویکرد در واقع تکامل همان ایدهای است که مدل Jev با تبدیل تصمیمات هوش مصنوعی از متن به دادههای ساختاریافته برای اولین بار معرفی کرد تا جایگزینی برای خروجیهای مولد باشد.
شرکت TypeSafe AI توسط دیوگو آلمیدا، پژوهشگر سابق OpenAI که روی تحقیقات مربوط به دستورپذیری (Instruction-following) در پشتصحنه ChatGPT کار کرده بود، تأسیس شد. او Jev را برای مدیریت «قضاوتهای کوچک» درون یک حلقهٔ عامل طراحی کرد. برخلاف ChatGPT، مدل Jev نمیتواند گپ بزند، کد بنویسد یا متن را خلاصه کند. این مدل وضعیتهای بدون ساختار (Unstructured State) را میگیرد و یکی از سه خروجی اصلی (Primitives) را برمیگرداند: انتخاب (Choice - انتخاب از یک لیست)، امتیاز (Score - رتبهبندی بر اساس یک معیار) یا نول (Noul - احتمال حقیقت بین ۰ تا ۱).
همانطور که در تحلیلهای پیشین ما دربارهی بهینهسازی هزینههای استنتاج اشاره کردیم، حذف لایههای غیرضروری تولید متن، کلید مقیاسپذیری عاملهاست.
معماری فنی و عملکرد
طبق مستندات TypeSafe AI، هر فراخوانی به Jev شامل یک وضعیت (که به صورت متن یا JSON ارائه میشود) و یک دیکشنری از پرسشهای تایپشده است. تمام پرسشها بهصورت موازی در یک درخواست واحد علیه همان وضعیت ارزیابی میشوند. سه خروجی اصلی به این شرح تعریف شدهاند:
- انتخاب (Choice): یک گزینه را از یک لیست برمیگزیند و برای هر گزینه یک احتمال بههمراه میزان اطمینان (Confidence) برمیگرداند. این قابلیت از حداکثر ۲۵۵ گزینه پشتیبانی میکند.
- امتیاز (Score): وضعیت را بر اساس سطوح مرتبشدهی یک معیار (Rubric) رتبهبندی کرده و احتمالات را بههمراه میزان اطمینان برمیگرداند.
- نول (Noul): احتمال (بین ۰ تا ۱) درست بودن یک گزاره یا statement خاص را محاسبه میکند.
این شرکت برای آموزش Jev از روش «یادگیری تقویتی برای تصمیمات کالیبرهشده» (RLCD) استفاده کرده است. این تکنیک تضمین میکند وقتی مدل اطمینان بالایی را گزارش میکند، این عدد واقعاً با دقت بالاتر در دنیای واقعی همبستگی داشته باشد.
به نقل از ارزیابیهای داخلی TypeSafe، مدل Jev در مقایسه با پاسخهای مرجع از مدلهای GPT-6 Astra و Fable 5.1، حدود ۱۹۳.۶ برابر سریعتر و ۴۴۴.۶ برابر ارزانتر است. در یک آزمون رودررو در بنچمارک Banking77 از طریق OpenRouter، Jev به صحت ۸۱.۰٪ رسید، در حالی که Claude Opus 5 صحت ۸۴.۴٪ داشت. با وجود این اختلاف اندک در دقت، Jev در میانهٔ زمان پاسخگویی ۱۳ برابر سریعتر و تقریباً ۱/۲۲ هزینهٔ مدل کلود بود.
۲۰ مورد کاربردی برای عاملها
شرکت TypeSafe حوزههایی را شناسایی کرده که در آنها Jev جایگزین مدلهای مولد میشود. این موارد بر اساس مکانیسم خاص حلقهٔ عامل دستهبندی شدهاند:
مسیریابی و ارکستراسیون:
- مسیریابی مدل: Jev دشواری درخواست را میسنجد تا آن را به یک مدل سریع یا یک مدل قدرتمند بفرستد. LangChain این قابلیت را به عنوان
ModelRouterMiddlewareعرضه کرده است، در حالی کهjev-routerاین کار را در هر نوبت برای Codex و Claude Code انجام میدهد. - انتخاب مهارت: در کتابچه راهنمای پیشنهاد مهارت TypeSafe، این مدل میتواند از بین ۱۸۲ مهارت در کاتالوگ Hermes متعلق به Nous Research، حداکثر یک مهارت را تنها با دو درخواست انتخاب کند.
- فراخوانی تابع تایپشده: یک کتابچه راهنمای اختصاصی، درخواستهای معاملاتی به زبان طبیعی را به نام توابع و آرگومانهای مجموعه-بسته (Closed-set) نگاشت میکند که توسط سطح اطمینان کنترل میشود.
- تریاژ تیکتها: یک فراخوانی میتواند همزمان بخش مربوطه، سطح عصبانیت کاربر و فوریت درخواست را برگرداند. سپس الگوی مسیریابی قصد (Intent Routing)، درخواست را به یک انسان، یک LLM متخصص یا منطق قطعی (Deterministic) میفرستد.
ایمنی و حفاظها (Guardrails):
- کنترل ریسک ابزارها: ابزار
pi-wardenبررسی میکند آیا یک دستور bash، نوشتن یا ویرایش در انتظار، خارج از وظیفه یا غیرقابل بازگشت است یا خیر. برای مثال، این ابزار دستورdb:resetرا پس از عبارت «پایگاه داده را ریست کن» اجازه میدهد اما پس از عبارت «یک ستون اضافه کن» آن را مسدود میکند.AutoModeMiddlewareدر LangChain برای این فراخوانیهای پرریسک خطا برمیگرداند. - تأیید خودکار خواندنی: هوک
jev-auto-approveبرای Claude Code تنها زمانی دستورات را تأیید میکند که احتمال صحت (p) برابر یا بیشتر از ۰.۹۵ باشد. در کالیبراسیونهای منتشر شده، این ابزار ۰ مورد از ۸ دستور تغییر وضعیت (State-changing) را تأیید کرد. - جلوگیری از نشت اسرار: ابزار
jev-secret-guardرشتههای ماسکشده را به Jev میفرستد. در مرحله کالیبراسیون، این ابزار ۶ مورد از ۶ راز را مسدود کرد و ۰ مورد از ۶ رشته بیخطر را مسدود نکرد. - غربالگری تزریق پرامپت: در یک کتابچه راهنمای مربوط به قطعات RAG، شباهت کسینوسی (Cosine Similarity) یک تزریق planted را در رتبه اول با امتیاز ۰.۵۸۴ قرار داد. اما Jev به آن امتیاز ۰.۹۹ داد و آن را حذف کرد.
- حفاظهای ورودی/خروجی: کتابچه راهنمای guardrails آستانههای احتمال خطر را تعیین میکند تا هر پیام را برای عبور، بررسی، مسدود کردن یا مسیریابی ارزیابی کند.
بازیابی و مبنیسازی (Grounding):
- بازرتبهبندی (Reranking): در ۴۰ پرسوجوی حقوقی CLERC، کتابچه راهنمای بازرتبهبندی، دقت رتبه اول را از ۵٪ به ۱۸٪ و دقت رتبه دهم را از ۳۸٪ به ۶۲٪ افزایش داد.
- تأیید استنادها: کتابچه راهنمای بررسی استنادها از یک خروجی Choice استفاده میکند تا تصمیم بگیرد آیا یک بخش از منبع، ادعایی را تأیید میکند، رد میکند یا هیچ چیزی درباره آن نمیگوید.
کنترل مرورگر و سیستم در لحظه:
- عاملهای مرورگر: ابزار Jev Ultrafast در Browser Use، عملیات و المان DOM را در یک درخواست انتخاب میکند و جستوجوی Google Flights را در حدود ۷.۱ ثانیه به پایان میرساند.
- استفاده از دسکتاپ: ابزار
typesafe-computer-useصفحه macOS را OCR کرده و اجازه میدهد Jev اقدام بعدی را با هزینه تقریبی ۰.۰۰۰۲ دلار بهازای هر گام طبقهبندی کند. - عاملهای موبایل: Mobile Jev برای هر ضربه (Tap) در اندروید تصمیم میگیرد و در حدود ۲۱ ثانیه از طریق ۹ اقدام به صفحه پرداخت Uber میرسد.
- گیمینگ در لحظه: یک دموی بازی Doom حدود ۱۰ پرسوجو در ثانیه روی وضعیت ساختاریافته بازی اجرا میکند که هزینه آن تقریباً ۷ دلار در ساعت است.
کیفیت و حافظه عامل:
- جلوگیری از رکود حلقه: ابزار
ProgressGateمسیر حرکت (Trajectory) را قضاوت کرده و یکی از دستورات CONTINUE، WARN، REPLAN یا HALT را برمیگرداند. - تأیید اتمام کار: ابزار
jev-belayپیش از پذیرش ادعای «اتمام کار» توسط یک عامل Claude Code، متن گفتگو را برای یافتن شواهد بررسی میکند. - فشردهسازی زمینه: ابزار
fast-jev-compactionبهجای خلاصهسازی زمینه، فراخوانیهای ابزار را امتیازدهی کرده و موارد قدیمی (Stale) را حذف میکند. - استخراج ردپا: ابزار Beacon توسط Asymptote Labs از Jev استفاده میکند تا اجراهایی را در Cursor، OpenCode، Codex و Claude Code بیابد که ارزش تبدیل شدن به مهارتهای قابل استفاده مجدد را دارند.
- لینتینگ معنایی: ابزار
jev-lintتخلف از قوانین تیمی را در زمان ویرایش برای Codex و Claude Code علامتگذاری میکند.
استقرار و رقابت
مدل Jev از طریق APIهای میزبانیشده TypeSafe، Vercel AI Gateway و OpenRouter با قیمت ۰.۰۴۲ دلار بهازای هر میلیون توکن ورودی در دسترس است و توکنهای خروجی بهصورت رایگان ارائه میشوند. تأخیر (Latency) این مدل بین ۷۰ تا ۵۰۰ میلیثانیه است که میانه آن در OpenRouter حدود ۱۷۵ میلیثانیه است.
این مدل با جایگزینهای وزنباز (Open Weights) مانند Laya (یک مدل انکودر بر پایه ModernBERT-large با ۴۲۱ و ۳۲۲ میلیون پارامتر) و kev (یک LoRA + readout head روی Qwen2.5-0.5B) رقابت میکند. در حالی که Laya و kev قابلیت میزبانی شخصی از طریق pip یا GPU محلی دارند، آموزش RLCD در Jev تمرکز ویژهای بر «اطمینان کالیبرهشده» دارد که مدلهای مولد معمولاً فاقد آن هستند. برای مقایسه، میانه تأخیر Claude Opus 5 در OpenRouter حدود ۲۲۶۶ میلیثانیه است.
چرخش به سمت مدلهای «سیستم یک» نشان میدهد آینده هوش مصنوعی عاملمحور، یک مدل غولپیکر نیست، بلکه یک پشته ترکیبی است. در این معماری، یک LLM «سیستم دو» برنامهریزی و نوشتار پیچیده را بر عهده میگیرد و مدلی مثل Jev، وظایف پرتکرار، کمتأخیر و نظارتی (Gating and Verification) را مدیریت میکند.
برای توسعهدهندگان، این یعنی گلوگاه قابلیت اطمینان عاملها از «مهندسی پرامپت» (Prompt Engineering) — هنر سؤال درست پرسیدن برای گرفتن بهترین جواب — به «کالیبراسیون آستانه» تغییر میکند. شما دیگر از مدل نمیخواهید «مراقب باشد»، بلکه یک آستانه احتمال سخت (مثلاً p ≥ ۰.۹۵) را پیش از اجرای یک دستور تعیین میکنید.
گام بعدی شما
- لاگهای عاملهای خود را بررسی کنید تا تصمیمات تکراری و دوگانه (بله/خیر) که توکنهای LLM را میبلعند، شناسایی کنید.
- این گرههای تصمیمگیر را با یک مدل تخصصی تصمیمگیری تست کنید تا هزینههای عملیاتی را بهشدت کاهش دهید.
- برای دستورات حساس (مانند حذف داده)، یک آستانه احتمال سخت (مثلاً ۹۸٪) تعریف کنید تا نرخ خطای عامل کاهش یابد.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو