پرش به محتوای اصلی

دسته‌بندی

تحلیل و بررسی تخصصی

تحلیل‌های عمیق مدل‌ها، مقالات و بنچمارک‌ها — پیش‌چاپ‌ها، ارزیابی‌ها، مدل‌های زبانی پیشرو و پژوهش همراستاسازی.

۵٬۸۰۲ مقاله منتشر شده

فکر می‌کردم عامل‌های هوش مصنوعی به خودمونی بیشتری نیاز دارند، تا اینکه Codex اهمیت توقف قطعی را به من آموخت.
آموزش کاربردی

عامل‌های هوش مصنوعی برای بقا در محیط عملیاتی به «توقف‌های سخت» نیاز دارند

خودمختاری بدون محدودیت در عامل‌های هوش مصنوعی منجر به شکست‌های «اجرای جزئی» می‌شود که در آن تغییرات سیستمی به‌صورت ناقص و غیرقابل‌بازگشت اعمال می‌شوند. قابلیت توقف دقیق و…

۸ دقیقه خواندن۱
مقایسه GPT و معماری ترکیبی متخصصان در مدل‌های زبانی بزرگ
آموزش کاربردی

معماری ترکیب خبره‌ها، کلید کاهش هزینه‌های استنتاج در مدل‌های زبانی بزرگ

مدل‌های زبانی مدرن بین دو مسیر معماری متراکم و ترکیب خبره‌ها (MoE) تقسیم شده‌اند. در حالی که مدل‌های متراکم از تمام توان خود برای هر پاسخ استفاده می‌کنند، MoE تنها بخش‌های تخصصی…

۳ دقیقه خواندن
جایگاه ACC در پشته عامل: انتقال، کنترل زمان اجرا و اختیار تجاری
آموزش کاربردی

قرارداد قابلیت عامل؛ جداسازی «دسترسی» از «اجازه» برای حاکمیت هوش مصنوعی

قرارداد قابلیت عامل (ACC) لایه‌ای قابل‌حمل برای تعریف حاکمیت کسب‌وکار در عامل‌های هوش مصنوعی معرفی می‌کند. این استاندارد با تفکیک آنچه یک عامل می‌تواند ببیند از آنچه مجاز به…

۶ دقیقه خواندن
نقشه راه کنترل هوش مصنوعی دیپ‌مایند گوگل: پنج آزمون امنیتی عامل هوشمند
آموزش کاربردی

۵ آزمون امنیتی برای اعتبارسنجی نقشه راه کنترل هوش مصنوعی گوگل

یک چارچوب فنی جدید، نقشه راه کنترل هوش مصنوعی گوگل دیپ‌مایند را به پنج آزمون امنیتی تکرارپذیر برای عامل‌های کدنویسی تبدیل کرده است. این رویکرد تمرکز را از همراستاسازی مدل به تعیین…

۲ دقیقه خواندن
قبل از فعال‌سازی Copilot Agent در JetBrains، یک تست خروج سه‌موردی انجام دهید
آموزش کاربردی

گزارش فنی: دموهای تبلیغاتی معیاری نادرست برای سنجش عملکرد Copilot هستند

ارزیابی عامل‌های هوش مصنوعی بر اساس دموهای تبلیغاتی، منجر به تصمیمات نادرست می‌شود. یک تست ساختاریافته با سه سناریوی مشخص، توانایی عامل در مدیریت رگرسیون‌ها و مرزهای تصمیم‌گیری…

۲ دقیقه خواندن
بررسی سریع آلودگی داده در معیارهای برنامه‌نویسی هوش مصنوعی با ساخت ابزار کوچک
آموزش کاربردی

گزارش OpenAI: نشت داده‌ها اعتبار بنچ‌مارک‌های کدنویسی را از بین برد

گزارش جدید OpenAI نشان می‌دهد بسیاری از جدول‌های رتبه‌بندی کدنویسی به‌دلیل تداخل داده‌های آموزشی و آزمون غیرقابل‌اعتماد هستند. این تحلیل تأکید می‌کند که نمرات بدون بررسی دقیق نشت…

۲ دقیقه خواندن۱
افزودن Claude Sonnet 5 پشت قرارداد ارائه‌دهنده، نه در سراسر کدبیس
آموزش کاربردی

آداپتورهای تأمین‌کننده در برابر کدنویسی مستقیم در پیاده‌سازی Claude Sonnet 5

یک الگوی ادغام جدید برای Claude Sonnet 5 بر استفاده از آداپتورهای تأمین‌کننده به‌جای کدنویسی مستقیمِ وابسته به فروشنده تأکید می‌کند. این رویکرد با جداسازی فرمت مدل از منطق اصلی…

۲ دقیقه خواندن
عوامل هوش مصنوعی طولانی‌مدت به اجاره، ضربان قلب و آزمایش تخلیه نیاز دارند
آموزش کاربردی

معماری جدید انویدیا برای نجات عامل‌های هوش مصنوعی از شکست در تکالیف طولانی

انویدیا در GTC تایپه ۲۰۲۶ چارچوبی برای افزایش پایداری عامل‌های هوش مصنوعی معرفی کرد که در بازه‌های زمانی طولانی فعال هستند. این سیستم با استفاده از مکانیزم‌های اجاره، ضربان قلب و…

۲ دقیقه خواندن۳
معیارسنجی رایانه شخصی هوشمند: باتری، حرارت و بازیابی حالت خواب
آموزش کاربردی

معیارهای سنجش عمر باتری و بازیابی سیستم در PCهای هوش مصنوعی RTX Spark

یک چارچوب جدید برای تست PCهای هوش مصنوعی معرفی شده است که به‌جای تمرکز بر اعداد خام سخت‌افزاری، بر سناریوهای واقعی چرخهٔ عمر دستگاه تمرکز می‌کند. این متد به‌ویژه نحوه‌ی رفتار…

۲ دقیقه خواندن۲