پرش به محتوای اصلی

موضوع

استدلال

Chain-of-thought, reasoning models (o-series, R-series), test-time compute

۱٬۶۷۶ مقاله منتشر شده

AI

کاهش ۳۰ برابری مصرف توکن با جایگزینی حافظه مدل با «منطق عامل‌محور»

IBM استدلال می‌کند که مقیاس‌پذیری هوش مصنوعی سازمانی نیازمند «منطق عامل‌محور» (Agent Logic) است تا مدل‌های زبانی بزرگ را هدایت کند. این رویکرد با استفاده از گراف‌های دانش، توهمات…

۲ دقیقه خواندن
AI

مطالعه استنفورد: هوش مصنوعی در ۷۵٪ تست‌های استدلال حقوقی از اساتید برتر بود

پژوهشی از دانشکده حقوق استنفورد نشان می‌دهد مدل‌های زبانی در تحلیل متون پیچیده قراردادها، ۷۵٪ بیشتر از اساتید حقوق مورد پذیرش قرار گرفتند. این یافته‌ها فرضیه محدودیت هوش مصنوعی در…

۲ دقیقه خواندن
AI

MiniMax M3: شکستن انحصار حافظه یک میلیون توکنی در مدل‌های بازمتن

مدل M3 از شرکت MiniMax، نخستین مدل بازمتنی است که حافظه یک میلیون توکنی را با قابلیت‌های چندوجهی ترکیب می‌کند. این مدل در بنچمارک‌های کدنویسی و جستجوی وب، رقبای قدرتمندی چون…

۳ دقیقه خواندن
AI

حلقه ارزیابی: قطعه گم‌شده‌ای در معماری AI که مانع از کشف علم می‌شود

ریچارد ساتون، برنده جایزه تورینگ، معتقد است مدل‌های زبانی فعلی به دلیل نبود «حلقه ارزیابی» قادر به اکتشاف علمی نیستند. این مدل‌ها در تقلید عالی‌اند، اما برای کشف حقیقت به سیستمی…

۲ دقیقه خواندن
AI
آموزش کاربردی

RubricMiddleware لنگ‌چین: عبور از پرامپت‌نویسی به سمت تضمین کیفیت خودکار

لنگ‌چین ابزار RubricMiddleware را معرفی کرد تا عامل‌های هوش مصنوعی بتوانند خروجی‌های خود را بر اساس معیارهای مشخص اصلاح کنند. در این سیستم، یک عامل ارزیاب با استفاده از ابزارهای…

۲ دقیقه خواندن
AI

بنچمارک CVE-Bench: نرخ موفقیت GPT-5.5 در رفع آسیب‌پذیری‌های امنیتی ۵۰٪ است

مدل‌های پیشرو همچنان در رفع نیمی از آسیب‌پذیری‌های امنیتی واقعی ناتوان‌اند. بنچمارک CVE-Bench نشان می‌دهد که «استدلال امنیتی» در این مدل‌ها بیشتر شبیه به تطبیق الگو است تا تحلیل…

۲ دقیقه خواندن
AI
آموزش کاربردی

داده‌های متا: ۹۲.۷٪ از قضایای ریاضی در ATLAS با موفقیت اثبات شدند

متا کتابخانه ATLAS را منتشر کرد؛ مجموعه‌ای عظیم از متون ریاضی که توسط هوش مصنوعی به کد Lean 4 تبدیل شده‌اند. این پایگاه داده با بیش از ۴۶ هزار قضیه اثبات‌شده، زیربنایی مقیاس‌پذیر…

۲ دقیقه خواندن
AI

چگونه «هارنس» یا محیط ارزیابی، توانایی واقعی مدل‌های پیشرو را بازتعریف می‌کند؟

شرکت OpenAI در یک دستورالعمل فنی استدلال می‌کند که توانایی مدل‌های پیشرو یک مقدار ثابت نیست، بلکه متغیری وابسته به «هارنس» (Harness) یا همان محیط، ابزارها و بودجه محاسباتی است.…

۳ دقیقه خواندن