
درون سازوکار ردیابی؛ تبدیل کلیپهای ویروسی به بنچمارکهای قابل تکرار
یک کلیپ ویروسی از Grok در حال ساخت تریلر بازی، شکاف عمیق میان خروجیهای صیقلخورده و گردشکارهای تکرارپذیر را آشکار کرد. این چارچوب پیشنهادی با معرفی «قرارداد اجرا» و مدل ردیابی،…
دستهبندی
تحلیلهای عمیق مدلها، مقالات و بنچمارکها — پیشچاپها، ارزیابیها، مدلهای زبانی پیشرو و پژوهش همراستاسازی.
۵٬۸۱۳ مقاله منتشر شده

یک کلیپ ویروسی از Grok در حال ساخت تریلر بازی، شکاف عمیق میان خروجیهای صیقلخورده و گردشکارهای تکرارپذیر را آشکار کرد. این چارچوب پیشنهادی با معرفی «قرارداد اجرا» و مدل ردیابی،…

پژوهشگران کمبریج و انویدیا چارچوبی را توسعه دادهاند که در آن عاملهای هوش مصنوعی و ارزیابان آنها بهطور همزمان تکامل مییابند. این رویکرد مانع از توقف پیشرفت در اثر بنچمارکهای…

شرکت آنتروپیک در بازه زمانی ۱۴ روزه، ۱۴ مورد اختلال در سرویسهای خود را تجربه کرد که آخرین مورد آن در ۱۶ اوت ۲۰۲۶ منجر به قطع گسترده دسترسی شد. با وجود نرخ پایداری ظاهری بالای…

عرضه اولیه Unitree در بازار STAR نخستین معیار عمومی برای ارزشگذاری رباتهای انساننما را ایجاد کرد. این اتفاق نشاندهنده گذار صنعت از دوران «روایتهای تخیلی» به عصر مطالبه…

استفاده از مدلهای زبانی بزرگ در حالت Zero-shot برای دستهبندی تیکتهای پشتیبانی، انعطافپذیری بیشتر و هزینه عملیاتی کمتری نسبت به تنظیم دقیق (Fine-tuning) دارد. این رویکرد تیمی…

اوپنایآی با معرفی حالت Ultrafast برای مدل GPT-5.6 Sol، سرعت پاسخدهی را تا ۱۴ برابر افزایش داد. با این حال، سقف سخت ۷۵۰ توکنی برای خروجی، کاربرد این حالت را برای وظایف پیچیده و…

دولت آمریکا در حال آمادهسازی ضربالاجلی برای متحدان خود است تا کنترلهای صادراتی سختگیرانهای بر نیمهرساناهای هوش مصنوعی اعمال کنند. این استراتژی با هدف ایجاد یک دیوار جهانی…

یک تیم توسعه با جایگزینی تصمیمگیری تکبعدی هوش مصنوعی با یک سیستم رایگیری (Voter)، مانع از گم شدن باگهای بحرانی در صفهای اشتباه شد. در این معماری، قوانین قطعی محلی قدرت وتو…

دستیارهای هوش مصنوعی اغلب کدهای اسمبلی بهظاهر درست اما معیوبی تولید میکنند که از فیلتر کامپایلرها میگذرد. یک فرآیند تأیید مکانیکی جدید با ترکیب «اسمبل، دیساسمبل و مقایسه»،…

یک الگوی معماری جدید برای نظارت بر محتوا با استفاده از پیشفیلترهای قطعی و اعتبارسنجی سختگیرانهٔ طرحواره، از ورود توهمات مدلهای زبانی به دادههای عملیاتی جلوگیری میکند. این…

یک مانیفست جدید استدلال میکند که آینده هوش مصنوعی باید از ارائهدهندگان ابری متمرکز به مدلهای محلی و متنباز تغییر کند. این جنبش برای جلوگیری از وابستگی شرکتی و شکنندگی…

تحلیلهای فنی جدید نشان میدهد آزمایشگاههای AI برای افزایش کارایی استدلال، عمداً دانش فکتمحور را از مدلها حذف میکنند. مدلهایی مانند Qwen3.5 در ریاضیات پیشرو هستند اما در نبود…