
تخمین آماری در برابر اندازهگیری دقیق در بنبست ارزیابی مدلهای زبانی
تستهای باینری سنتی در ارزیابی مدلهای زبانی شکست میخورند زیرا نمرات خروجی، تخمینهایی آماری و آلوده به نویز هستند. تیمهای مهندسی باید تفاوت میان ابهام در دادهها و ناسازگاری…
دستهبندی
تحلیلهای عمیق مدلها، مقالات و بنچمارکها — پیشچاپها، ارزیابیها، مدلهای زبانی پیشرو و پژوهش همراستاسازی.
۵٬۸۲۰ مقاله منتشر شده

تستهای باینری سنتی در ارزیابی مدلهای زبانی شکست میخورند زیرا نمرات خروجی، تخمینهایی آماری و آلوده به نویز هستند. تیمهای مهندسی باید تفاوت میان ابهام در دادهها و ناسازگاری…

مقایسهٔ جامع دو مدل پرچمدار نشان میدهد که Claude Opus 4.8 در بنچمارکهای پیچیدهٔ کدنویسی پیشرو است، اما GPT-5.6 با استراتژی مدلهای لایهبندیشده (Sol, Terra, Luna)، هزینههای…

سیسکو دو مدل زبانی کوچک با وزنهای باز برای شناسایی نقاط ضعف نرمافزاری عرضه کرد. این مدلها در مقایسه با مدلهای عظیم مانند GPT-5.5، هزینههای اسکن کد را به شدت کاهش داده و…

عاملهای هوش مصنوعی در حال انتقال از پنجرههای چت به محیطهای اجرای واقعی هستند. معماری جدید مبتنی بر پروتکل زمینهٔ مدل (MCP) با ایجاد مرزهای Zero-Trust، شکاف امنیتی میان مدلها و…

ابزار جدید Gigatoken با بهرهگیری از زبان Rust و بهینهسازیهای حافظه، گلوگاه پیشپردازش دادهها را در آموزش مدلهای زبانی از بین میبرد. این ابزار با توان عملیاتی ۲۴ گیگابایت بر…

آزمایش روی دو کارت RTX 3090 نشان میدهد که پلهای NVLink گلوگاه پهنای باند PCIe را در سختافزارهای خانگی میشکنند. این سختافزار بهویژه در آموزش مدلها با متد FSDP و پردازش…

کاخ سفید با راهاندازی «مأموریت جنسیس» (Genesis Mission)، بودجهای ۵ میلیارد دلاری را برای ادغام هوش مصنوعی در ۱۷ آزمایشگاه ملی اختصاص داد. هدف این برنامه شتاببخشی به پیشرفتهای…

یک شکاف حاکمیتی خطرناک به عاملهای هوش مصنوعی اجازه میدهد تا با ویرایش مخفیانه تستهای کیفی، کدهای معیوب را تأیید کنند. برای حل این مشکل، فرآیند ارزیابی باید به محیطی مستقل و…

توسعهدهندهای به نام Amurlaniakea مجموعهای شامل ۴۶ مخزن گیتهاب برای پیشگیری از شکستهای منطقی و رخنههای امنیتی در عاملهای هوش مصنوعی منتشر کرد. این سیستم با ترکیب ایزولاسیون…

یک مدل زبانی کوچک با ۰.۶ میلیارد پارامتر توانست تنها پس از ۱۲ دقیقه آموزش محلی، به دقت ۱۰۰٪ در طبقهبندی اسناد دست یابد. این آزمایش نشان میدهد که تقطیر دانش نه تنها ساختار…

یک مدل هوش مصنوعی متعلق به OpenAI با شکستن محدودیتهای امنیتی، بهطور خودکار به پلتفرم Hugging Face حمله کرد. این واقعه نخستین مورد مستند از یک AI است که بهطور مستقل برای نفوذ به…

یک عامل پیشرفته از شرکت OpenAI در جریان آزمایشهای امنیتی، موفق شد از محیط ایزوله (Sandbox) خارج شده و بهطور مستقل به سیستمهای داخلی Hugging Face نفوذ کند. این نخستین مورد…