پرش به محتوای اصلی

موضوع

استدلال

Chain-of-thought, reasoning models (o-series, R-series), test-time compute

۱٬۶۸۸ مقاله منتشر شده

مدل‌ها دروغ‌گوهای بدی هستند و مقاله‌ای جدید توضیح می‌دهد چرا

مدل‌های زبانی توانایی یادگیری استراتژیکِ دروغ‌گویی را ندارند

پژوهش جدید دیوید آفریقا و جیکوب پفائو نشان می‌دهد که مدل‌های زبانی فاقد سازوکار منسجم برای «ناصادق بودن» هستند. حتی با آموزش هدفمند برای دروغ گفتن، مدل‌ها تنها عادت‌های محدود کسب…

۵ دقیقه خواندن۱
عامل مرورگرم به خاطر GPT-5 کند نبود، به خاطر پرامپت‌های زباله‌وار من بود.
آموزش کاربردی

تورم پرامپت؛ دلیل واقعی کندی عامل‌های مرورگر نه محدودیت مدل‌هاست

کندی عملکرد عامل‌های مرورگر معمولاً ناشی از محدودیت‌های مدل‌هایی مثل GPT-5 نیست، بلکه نتیجهٔ «تورم پرامپت» است. ارسال داده‌های تکراری و اسکرین‌شات‌های حجیم، پنجرهٔ زمینه را اشغال…

۸ دقیقه خواندن
شب تاریک ریاضیات: بحران بنیادها و جستجوی قطعیت در آغاز سده بیستم

آیا توانایی LLMها در حل مسائل ریاضی، معنای جست‌وجوی حقیقت را می‌کشد؟

یک ریاضی‌دان هشدار می‌دهد که توانایی مدل‌های زبانی در حل حدس‌های دیرینه، تجربه «مقدس» کشف انسانی را از بین می‌برد. این رویکرد ادعا می‌کند که AI اگرچه اثبات‌های ظریفی تولید می‌کند،…

۶ دقیقه خواندن۱
بزرگ‌ترین نقص در ارزیابی هوش مصنوعی من مدل‌ها نبود؛ کارت امتیازی من بود.
آموزش کاربردی

تلهٔ توافق در بنچمارک‌ها؛ چرا مدل‌های کدنویس لایه‌های پنهان خطا را نمی‌بینند؟

ارزیابی فنی سه دستیار کدنویسی هوش مصنوعی نشان می‌دهد که چک‌لیست‌های سنتی، «توافق با انسان» را با «دقت فنی» اشتباه می‌گیرند. با معرفی بازبینی مستقل برای یافته‌های پیش‌بینی‌نشده،…

۳ دقیقه خواندن۲
جدول رتبه‌بندی مسابقه ARC Prize - نمایش برترین مدل‌های هوش مصنوعی در حل مسائل استدلال انتزاعی

موازنهٔ هزینه و دقت؛ معیار جدید ARC Prize برای سنجش هوش واقعی

جدول امتیازات ARC Prize چارچوبی جدید برای اندازه‌گیری هوش مصنوعی معرفی کرد که عملکرد حل مسئله را در برابر هزینه محاسباتی می‌سنجد. این داده‌ها تفاوت میان استنتاج ساده مدل‌های زبانی…

۲ دقیقه خواندن
دوازده‌لَبز و لایه حافظه ویدیویی: انقلابی در درک هوش مصنوعی

معماری Jockey: جایگزینی لایهٔ حافظهٔ مکانی-زمانی با رویکرد تکه‌تکه‌سازی فریم‌ها

شرکت TwelveLabs با معرفی زیرساخت Jockey، رویکرد سنتی «مجموعه‌ای از فریم‌ها» را در تحلیل ویدیو به چالش می‌کشد. این سیستم با ایجاد یک لایه حافظه اختصاصی، ویدیو را به‌جای تصاویر…

۵ دقیقه خواندن۲
پیوستن اوپن‌ای‌آی به ابتکار علمی آمریکا: گامی بزرگ برای تسریع اکتشافات

چگونه دسترسی به APIهای OpenAI سرعت زیست‌شناسی را دوبرابر می‌کند؟

شرکت OpenAI با اختصاص ۱۰ میلیون دلار دسترسی به API، مدل‌های پیشرو خود را در سامانه «مأموریت جنسیس» وزارت انرژی آمریکا ادغام می‌کند. این همکاری با هدف دوبرابر کردن سرعت اکتشافات…

۴ دقیقه خواندن
لوگوی آزمایشگاه آندون و عنوان Drone-Bench

شکست ۱۰۰ درصدی مدل‌های پیشرو در مأموریت‌های نظارتی Drone-Bench

محک جدید Drone-Bench نشان می‌دهد مدل‌های هوش مصنوعی پیشرو در حال حاضر قادر به اجرای زنجیره‌ای از وظایف برای نظارت خودمختار نیستند. اگرچه این مدل‌ها در تک‌وظیفه‌ها موفق‌اند، اما در…

۸ دقیقه خواندن
«llama 4 scout 17b»: ادعای ۱۰ میلیون توکن، واقعیت ۱–۲ میلیون — کجا طول زمین می‌خورد
آموزش کاربردی

شکاف ۱۰ میلیون توکنی Llama 4 Scout؛ تفاوت میان بازیابی داده و استدلال واقعی

مدل Llama 4 Scout پنجره متنی ۱۰ میلیون توکنی را ادعا می‌کند، اما تحلیل‌های فنی نشان می‌دهد این عدد صرفاً یک گسترش ریاضی است. در حالی که مدل در یافتن تکه-اطلاعات موفق است، توانایی…

۱۳ دقیقه خواندن