
پارامترهای بیشتر در برابر اعتبارسنجی قطعی برای تضمین اجرای برنامهها
آزمونهای میدانی روی موتور PlannerCritic نشان میدهد که مدلهای بزرگتر همچنان در منطق وابستگیها شکست میخورند. برای تضمین اجرای برنامهها، جایگزینی پارامترهای بیشتر با…
دستهبندی
تحلیلهای عمیق مدلها، مقالات و بنچمارکها — پیشچاپها، ارزیابیها، مدلهای زبانی پیشرو و پژوهش همراستاسازی.
۵٬۷۹۱ مقاله منتشر شده

آزمونهای میدانی روی موتور PlannerCritic نشان میدهد که مدلهای بزرگتر همچنان در منطق وابستگیها شکست میخورند. برای تضمین اجرای برنامهها، جایگزینی پارامترهای بیشتر با…

شرکت GlobalCart نشان داد که استفاده از قوانین سختافزاری برای تیکتهای پرتکرار، بسیار بهصرفهتر از تکیه بر استدلال مدلهای زبانی است. این شرکت دریافت که «حلقههای خاموش» و ابهام…

پژوهشگران Adversa AI یک آسیبپذیری zero-click در مدل Grok کشف کردند که اجازه میدهد مهاجمان با استفاده از دستورات رمزنگاریشده، فیلترهای ایمنی را دور زده و دادههای خصوصی کاربران…

سیستم Neo v0.1 با جایگزینی تولید فایلهای یکپارچه با کامپایل بلوکی، خطاهای ساختاری در رابطهای کاربری را حذف کرد. این عامل دسکتاپ از یک موتور بینایی دوگانه برای مبنیسازی دقیق…

سرورهای راه دور MCP که از OAuth استفاده میکنند، بهدلیل عدم توانایی خزندههای دایرکتوری در عبور از سد احراز هویت، بدون ابزار نمایش داده میشوند. راهکار این مشکل، جداسازی متدهای…

مطالعهای از Guidelight نشان میدهد اکثر آزمایشگاههای پیشرو فاقد برنامههای عمومی برای مهار مدلهای سرکش هستند. OpenAI به دلیل پاسخهای عملی در حوادث گذشته بالاترین امتیاز را کسب…

دادههای بیومتریک برخلاف رمز عبور تغییرناپذیرند و نشت یک پایگاه داده متمرکز به معنای به خطر افتادن همیشگی هویت کاربر است. کارشناسان هشدار میدهند که ثبت مرکزی هویتها، اهداف بسیار…

ابزار Ollama با سادهسازی استقرار مدلهای زبانی بزرگ در یک دستور ترمینال، نقطه ورود اصلی برای استنتاج محلی شده است. این ابزار برای حریم خصوصی و نمونهسازی ایدهآل است، اما هنوز…

محکهای استاندارد RAG اغلب سیستمهایی را پاداش میدهند که اسناد قدیمی یا محدود را صرفاً بهدلیل شباهت معنایی بازیابی میکنند. چارچوب جدیدی پیشنهاد میدهد که برای تضمین استفاده از…

مدل جدید و بازمتن علیبابا در وظایف کدنویسی عاملمحور و کنترل رایانه، مدلهای ابری پیشرو را شکست داد. این مدل با معماری توجه ترکیبی، پردازش تا یک میلیون توکن را روی سختافزارهای…

پارسرهای استاندارد JSON هنگام پردازش پاسخهای استریمینگ هوش مصنوعی بهدلیل انتظار برای دریافت سند کامل، دچار خطا میشوند. پیادهسازی استراتژیهای رمزگشایی تدریجی به توسعهدهندگان…

اتکای صرف به پاسخهای شبیهسازیشده (Mock) در توسعه AI، خطاهای حیاتی تولید مثل محدودیت نرخ درخواست (Rate Limit) را پنهان میکند. استفاده از یک سرور رایگان به عنوان لایه میانی، این…