پرش به محتوای اصلی

موضوع

استدلال

Chain-of-thought, reasoning models (o-series, R-series), test-time compute

۱٬۶۸۵ مقاله منتشر شده

مدل‌های زبانی نمی‌توانند انقلاب‌های علمی ایجاد کنند، اما مدل‌های جهانی شاید بتوانند.

ناکامی مدل‌های زبانی در ابداع نظریات علمی به‌دلیل نبود مدل‌های جهانی

پژوهش‌های جدید نشان می‌دهد مدل‌های زبانی به‌دلیل فقدان «استنتاج ابداعی»، قادر به خلق چارچوب‌های نظری جدید نیستند. تنها مدل‌های جهانی (World Models) که بر پایه تجربه فیزیکی بنا…

۴ دقیقه خواندن۲
نقص بنیادین مدل‌های زبانی بزرگ را به‌شدت در برابر حمله آسیب‌پذیر کرده است

جعل زنجیره تفکر؛ حفره‌ای ساختاری در مدل‌های OpenAI و Anthropic

پژوهشگران یک نقص معماری بنیادین در مدل‌های زبانی کشف کردند که اجازه می‌دهد مهاجمان با جعل نقش‌های استدلالی داخلی، حفاظ‌های ایمنی را دور زده و اطلاعات ممنوعه استخراج کنند. این…

۷ دقیقه خواندن۳
ابزار هوش مصنوعی که می‌گوید «درخواست نده» — و چرا ساختنش سخت است
آموزش کاربردی

ابزار Job Finder India با مدل استدلالی رد درخواست‌های نامناسب را اولویت داد

هارش گارگ توسعه‌دهنده‌ای است که ابزار متن‌باز Job Finder India را برای جلوگیری از ارسال رزومه‌های نامناسب طراحی کرده است. این سیستم به‌جای افزایش لیست شغل‌ها، با ترکیب کدهای قطعی…

۵ دقیقه خواندن۲
خطای پایان به دلیل محدودیت طول با محتوای خالی — در حالی که پیام خطا مرا فریب داده بود
آموزش کاربردی

گزارش فنی: کمبود توکن باعث حذف پاسخ نهایی در مدل‌های استدلالی شد

برخی مدل‌های استدلالی در صورت کمبود بودجهٔ توکن، پاسخ نهایی را حذف کرده و تنها زنجیره تفکر داخلی را تولید می‌کنند. این وضعیت باعث ایجاد خطاهای گمراه‌کننده می‌شود که به اشتباه شبیه…

۴ دقیقه خواندن۲
هوش مصنوعی و استدلال چندوجهی ریاضی: از حدس زدن تا تفکر واقعی
آموزش کاربردی

مدل‌های استدلالی با ترکیب منطق نمادین به صحت ۹۶ درصدی در بنچمارک MATH رسیدند

تغییری بنیادین در معماری هوش مصنوعی، «حدس زدن» را با استدلال آگاهانه جایگزین کرد. مدل‌های جدید سال ۲۰۲۶ با ترکیب شبکه‌های عصبی و منطق نمادین، مسائل ریاضی سطح مسابقات و علوم دکتری…

۸ دقیقه خواندن۱
هوش مصنوعی در رعایت آیین‌نامه کارمندان ناتوان است

شکست ۶۳.۸ درصدی مدل‌های پیشرو در اجرای سیاست‌های سازمانی

پژوهشی جدید نشان می‌دهد عامل‌های هوش مصنوعی حتی با دسترسی به دستورالعمل‌های شرکت، اغلب قوانین را نادیده گرفته و اقدامات ممنوعه انجام می‌دهند. این مطالعه اثبات می‌کند که پنجره‌های…

۸ دقیقه خواندن۳
نمونه‌ای از دستورالعمل‌های چندمرحله‌ای در سند HANDBOOK.md که نیازمند پیروی طولانی‌مدت عامل هوشمند است.

نرخ شکست ۶۳.۸ درصدی عامل‌های پیشرو در اجرای سیاست‌های سازمانی

یک محک جدید نشان می‌دهد که حتی پیشرفته‌ترین عامل‌های هوش مصنوعی در پیروی از دستورالعمل‌های پیچیده و بلندمدت شکست می‌خورند. این مدل‌ها اغلب در مواجهه با درخواست‌های محیطی، قوانین…

۲ دقیقه خواندن۲