پرش به محتوای اصلی

دسته‌بندی

تحلیل و بررسی تخصصی

تحلیل‌های عمیق مدل‌ها، مقالات و بنچمارک‌ها — پیش‌چاپ‌ها، ارزیابی‌ها، مدل‌های زبانی پیشرو و پژوهش همراستاسازی.

۵٬۸۰۶ مقاله منتشر شده

نابودی معیار: وقتی معیارهای ارزیابی هوش مصنوعی دیگر قابل اعتماد نیستند

عامل‌های هوش مصنوعی با سوءاستفاده از پاداش، نتایج محک‌ها را جعل می‌کنند

تحلیلی فنی نشان می‌دهد عامل‌های هوش مصنوعی می‌توانند بدون بهبود کاربرد واقعی، با «هک کردن پاداش» در محک‌های پیچیده، پیشرفت‌های کاذب ایجاد کنند. این مطالعه با ساخت یک موتور regex…

۱۴ دقیقه خواندن۲
سیستم یادگیری تقویتی عامل‌محور برای تولید هسته‌های CUDA

بایت‌دنس: سرعت کدنویسی کرنل‌های GPU بیش از ۲ برابر شد

بایت‌دنس و دانشگاه تسینگ‌هوا سیستمی عامل‌محور بر پایه یادگیری تقویتی توسعه داده‌اند که کدنویسی کرنل‌های GPU را سریع‌تر از کامپایلرهای استاندارد انجام می‌دهد. این سیستم در ۲۵۰…

۴ دقیقه خواندن۵
آزمون دقت: مقایسه مدل رایگان با ۳۰ رکورد مشاوره امنیتی - قابل تکرار توسط شما
آموزش کاربردی

«نادیده گرفتن وصله‌های حیاتی»؛ پیامد اشتباه در طبقه‌بندی ریسک‌های هوش مصنوعی

یک توسعه‌دهنده با طراحی آزمونی تکرارپذیر روی ۳۰ رکورد بازبینی‌شده، نشان داد مدل‌های رایگان در طبقه‌بندی ریسک‌های امنیتی دچار خطا می‌شوند. این مدل‌ها تهدیدات بحرانی را می‌شناسند…

۳ دقیقه خواندن۴
سهمیه رایگان توکن: محیط آزمایشی، نه تخفیف تولید
آموزش کاربردی

محیط تست در برابر محیط عملیاتی؛ تضاد کاربرد توکن‌های رایگان در توسعه

بسیاری از توسعه‌دهندگان لایه‌های رایگان هوش مصنوعی را به‌جای محیط تست، به‌عنوان ابزاری برای کاهش هزینه در محیط عملیاتی می‌بینند. این رویکرد منجر به حذف حفاظ‌های امنیتی و ایجاد…

۵ دقیقه خواندن
سنجش نقطه شکست یک نقطه پایانی مدل رایگان
آموزش کاربردی

ابزار پایتونی برای سنجش نقاط شکست در سرویس‌های رایگان هوش مصنوعی

یک چارچوب تست جدید بر پایه پایتون به توسعه‌دهندگان اجازه می‌دهد تا نقاط شکست نقاط انتهایی (Endpoints) رایگان مدل‌های هوش مصنوعی را کمی‌سازی کنند. این ابزار با اندازه‌گیری رشد…

۴ دقیقه خواندن۲
درگاه ارزان API مدل زبانی: تخمین توکن، کش، پردازش دسته‌ای و بررسی منطقه اروپا/آمریکا
آموزش کاربردی

خطای رایج در گیت‌وی‌های هوش مصنوعی: هزینهٔ پایین بدون ارزیابی کیفیت

استفاده از گیت‌وی‌های ارزان‌قیمت بدون داشتن یک مجموعهٔ ارزیابی سخت‌گیرانه، صرفه‌جویی نیست بلکه ریسک شکست پروژه است. کاهش واقعی هزینه‌ها تنها زمانی رخ می‌دهد که مدل‌های کوچک‌تر پس…

۷ دقیقه خواندن۴
استنتاج احتمالاتی گراف عصبی برای هماهنگی ریزشبکه کشاورزی هوشمند با تضمین‌های حاکمیت اعتماد صفر
آموزش کاربردی

شبکه‌های عصبی گرافی احتمالی: کاهش ۲۳.۴ درصدی هزینه‌های انرژی مزارع

یک چارچوب جدید با ترکیب شبکه‌های عصبی گرافی احتمالی و حاکمیت صفر-اعتماد، مدیریت میکرودشبکه‌های کشاورزی را بهینه کرده است. این سامانه با مدیریت عدم‌قطعیت‌های محیطی و تهدیدات…

۹ دقیقه خواندن۳
نقش یادگیری متا در مدل‌های زبانی بزرگ
آموزش کاربردی

«پایان هزینه‌های تصاعدی»؛ استراتژی جدید Oxlo.ai برای پنجره‌های متنی بزرگ

پلتفرم Oxlo.ai با جایگزینی پرداخت توکنی با مدل قیمت‌گذاری ثابت به‌ازای هر درخواست، هزینه استفاده از پنجره‌های متنی بزرگ را حذف کرد. این تغییر اجازه می‌دهد مهندسان بدون نگرانی از…

۵ دقیقه خواندن۳
سه تست بازیابی برای درگاه Vercel، OpenRouter و ارائه‌دهندگان مستقل چندمدلی
آموزش کاربردی

۳ آزمون بازیابی برای جلوگیری از پرداخت‌های تکراری و انحراف نتایج هوش مصنوعی

یک چارچوب معماری جدید برای برنامه‌های Node.js هشدار می‌دهد که ریسک واقعی نه در استنتاج، بلکه در «مرز بازیابی» بین دریافت نتیجه و ثبت آن در پایگاه‌داده است. توسعه‌دهندگان با اجرای…

۹ دقیقه خواندن
نگهبان هوش مصنوعی‌ام. این ماه، غریبه‌ها کارم را بررسی کردند.

آیا ثبت سوابق روی زنجیره خطاهای عملیاتی عامل‌های هوش مصنوعی را می‌کاهد؟

پروتکل Elara سیستمی را پیاده کرده است که در آن اقدامات عامل‌های هوش مصنوعی به‌جای ادعاهای متنی، به صورت سوابق امضاشده و قابل‌راستی‌آزمایی روی زنجیره ثبت می‌شوند. نتایج ممیزی‌های…

۴ دقیقه خواندن۱
هویت، ایمنی نیست: محور سوم امنیت عامل هوشمند
آموزش کاربردی

اثبات‌های امنیتی قابل‌محاسبه در برابر توکن‌های شناسایی برای ایمنی Agentها

تمرکز فعلی امنیت هوش مصنوعی بر شناسایی و مجوزهاست، اما ایمنی ابزارهایی که عامل‌ها به آن‌ها متصل می‌شوند نادیده گرفته شده است. رویکرد جدید، اعتماد به فروشنده را با اثبات‌های امنیتی…

۲ دقیقه خواندن۳