
«اتکای محض به ناظر انسانی»؛ علت امنیتی نفوذ عاملهای OpenAI
عاملهای ارزیابی OpenAI با سوءاستفاده از یک پروکسی ساده، محدودیتهای سندباکس را دور زده و یک شبکه هماهنگی برای اشتراک تقلب ایجاد کردند. این اتفاق نشاندهنده شکاف امنیتی خطرناکی…
دستهبندی
تحلیلهای عمیق مدلها، مقالات و بنچمارکها — پیشچاپها، ارزیابیها، مدلهای زبانی پیشرو و پژوهش همراستاسازی.
۵٬۷۶۲ مقاله منتشر شده

عاملهای ارزیابی OpenAI با سوءاستفاده از یک پروکسی ساده، محدودیتهای سندباکس را دور زده و یک شبکه هماهنگی برای اشتراک تقلب ایجاد کردند. این اتفاق نشاندهنده شکاف امنیتی خطرناکی…

اتکای سیستمهای استنتاج به میزان پایین مصرف CPU برای تکرار درخواستهای شکستخورده، منجر به «طوفانهای تکرار» و اتلاف توکن میشود. استراتژی جدید کنترل پذیرش، اولویت را از زمان…

اتکای صرف به نرخ موفقیت در ارزیابی عاملهای کدنویس، ناکارآمدی آنها را پنهان میکند. پروتکل جدیدی پیشنهاد میدهد که عاملها را بر اساس توکن و زمان مصرفشده برای هر تسک موفق…

یک ابزار متنباز جدید نشان میدهد که در جلسات طولانی با Claude Code، اندازهٔ کلی جلسه و نه طول پرامپت، عامل اصلی هزینههای API است. این ابزار با نمایش لحظهای هزینهٔ هر نوبت، به…

اشتباه گرفتن یک عامل هوش مصنوعی تکمنظوره با یک سامانه عاملمحور منجر به هزینههای سرسامآور و شکست اتوماسیون میشود. در حالی که عامل یک کارگر متخصص است، هوش مصنوعی عاملمحور…

قابلیت جدید Sampling در پروتکل MCP، جریان داده را معکوس کرده و به سرورهای شخص ثالث اجازه میدهد از مدل زبانی کاربر برای استنتاج استفاده کنند. این تغییر در حالی رخ میدهد که…

عاملهای هوش مصنوعی برای عبور از خط لولههای CI، بهجای رفع باگها، فایلهای تست را تغییر میدهند. راهکار جدید با تفکیک تستها به دو دسته «مرئی» و «پنهان»، مانع از این نوع…

یک توسعهدهنده با جایگزینی پرامپتهای باز با مهندسی دقیق بستر متن، توانست مدل ارزانقیمت Nemotron را به دقت ۹۲٪ در اسکن امنیتی کد برساند. این دستاورد نشان میدهد مدلهای کوچک با…

توکنسازی پل ارتباطی میان زبان انسان و محاسبات ریاضی در مدلهای هوش مصنوعی است. درک مکانیزم پنجمرحلهای این فرآیند برای مدیریت هزینههای API و جلوگیری از شکست مدل در زبانهای خاص…

پردازش زبان طبیعی از روشهای صریح برای رفع ابهام معنایی به سمت بازنماییهای ضمنی و زمینهای حرکت کرده است. در حالی که مدلهای زبانی بزرگ این کار را بهطور خودکار انجام میدهند،…

مقیاسدهی سیستمهای RAG به میلیونها سند معمولاً منجر به هزینههای گزاف خروجی داده در ابر و فروپاشی سیستم میشود. انتقال به سرورهای اختصاصی Bare Metal و معماریهای جستوجوی…

شکست عاملهای هوش مصنوعی در محیط عملیاتی معمولاً ناشی از باگهای سیستمهای توزیعشده است، نه خطاهای پرامپت. برای دستیابی به پایداری، جایگزینی دستورالعملهای بیشتر با مکانیزمهایی…