پرش به محتوای اصلی

موضوع

استدلال

Chain-of-thought, reasoning models (o-series, R-series), test-time compute

۱٬۱۰۴ مقاله منتشر شده

هوش مصنوعی واسطه‌گری با رویکرد گاتمن، EFT و NVC — Verdict Buddy از Inithouse، امتیاز ۴.۹ از ۵ (۲۹۰ ارزیابی)
آموزش کاربردی

کاربران Verdict Buddy: دقت فنی بر همدلی در میانجی‌گری هوش مصنوعی پیشتاست

شرکت Inithouse با جایگزینی پرامپت‌های عمومی با زنجیره‌ای از چهار چارچوب تخصصی روان‌شناسی، ابزار Verdict Buddy را توسعه داد. این مدل با اولویت دادن به دقت فنی به‌جای جملات همدلانه،…

۴ دقیقه خواندن۲
پنج اشتباه رایج معلمان در استفاده از ChatGPT
آموزش کاربردی

۵ تلهٔ رایج معلمان در استفاده از ChatGPT که کیفیت آموزش را پایین می‌آورد

مربیان باسابقه هشدار می‌دهند که استفاده از ChatGPT به عنوان منبع اصلی دانش یا میان‌بری برای خلاقیت، منجر به خروجی‌های متوسط می‌شود. این راهنما نشان می‌دهد چگونه مهندسی پرامپت ضعیف…

۴ دقیقه خواندن
قوانین جدید مهندسی زمینه برای مدل‌های نسل ۵ کلود
آموزش کاربردی

راهنمایی‌های پویا در برابر قوانین سخت‌گیرانه در استراتژی جدید Claude 5

آنتروپیک با معرفی دستورالعمل‌های جدید برای Claude 5، مهندسی پرامپت را از قوانین سخت‌گیرانه به سمت راهنمایی‌های مبتنی بر قضاوت تغییر داد. این چارچوب جدید بر افشای تدریجی داده‌ها و…

۵ دقیقه خواندن
مدل‌ها دروغ‌گوهای بدی هستند و مقاله‌ای جدید توضیح می‌دهد چرا

مدل‌های زبانی توانایی یادگیری استراتژیکِ دروغ‌گویی را ندارند

پژوهش جدید دیوید آفریقا و جیکوب پفائو نشان می‌دهد که مدل‌های زبانی فاقد سازوکار منسجم برای «ناصادق بودن» هستند. حتی با آموزش هدفمند برای دروغ گفتن، مدل‌ها تنها عادت‌های محدود کسب…

۵ دقیقه خواندن۱
عامل مرورگرم به خاطر GPT-5 کند نبود، به خاطر پرامپت‌های زباله‌وار من بود.
آموزش کاربردی

تورم پرامپت؛ دلیل واقعی کندی عامل‌های مرورگر نه محدودیت مدل‌هاست

کندی عملکرد عامل‌های مرورگر معمولاً ناشی از محدودیت‌های مدل‌هایی مثل GPT-5 نیست، بلکه نتیجهٔ «تورم پرامپت» است. ارسال داده‌های تکراری و اسکرین‌شات‌های حجیم، پنجرهٔ زمینه را اشغال…

۸ دقیقه خواندن
شب تاریک ریاضیات: بحران بنیادها و جستجوی قطعیت در آغاز سده بیستم

آیا توانایی LLMها در حل مسائل ریاضی، معنای جست‌وجوی حقیقت را می‌کشد؟

یک ریاضی‌دان هشدار می‌دهد که توانایی مدل‌های زبانی در حل حدس‌های دیرینه، تجربه «مقدس» کشف انسانی را از بین می‌برد. این رویکرد ادعا می‌کند که AI اگرچه اثبات‌های ظریفی تولید می‌کند،…

۶ دقیقه خواندن۱
بزرگ‌ترین نقص در ارزیابی هوش مصنوعی من مدل‌ها نبود؛ کارت امتیازی من بود.
آموزش کاربردی

تلهٔ توافق در بنچمارک‌ها؛ چرا مدل‌های کدنویس لایه‌های پنهان خطا را نمی‌بینند؟

ارزیابی فنی سه دستیار کدنویسی هوش مصنوعی نشان می‌دهد که چک‌لیست‌های سنتی، «توافق با انسان» را با «دقت فنی» اشتباه می‌گیرند. با معرفی بازبینی مستقل برای یافته‌های پیش‌بینی‌نشده،…

۳ دقیقه خواندن
جدول رتبه‌بندی مسابقه ARC Prize - نمایش برترین مدل‌های هوش مصنوعی در حل مسائل استدلال انتزاعی

موازنهٔ هزینه و دقت؛ معیار جدید ARC Prize برای سنجش هوش واقعی

جدول امتیازات ARC Prize چارچوبی جدید برای اندازه‌گیری هوش مصنوعی معرفی کرد که عملکرد حل مسئله را در برابر هزینه محاسباتی می‌سنجد. این داده‌ها تفاوت میان استنتاج ساده مدل‌های زبانی…

۲ دقیقه خواندن
دوازده‌لَبز و لایه حافظه ویدیویی: انقلابی در درک هوش مصنوعی

معماری Jockey: جایگزینی لایهٔ حافظهٔ مکانی-زمانی با رویکرد تکه‌تکه‌سازی فریم‌ها

شرکت TwelveLabs با معرفی زیرساخت Jockey، رویکرد سنتی «مجموعه‌ای از فریم‌ها» را در تحلیل ویدیو به چالش می‌کشد. این سیستم با ایجاد یک لایه حافظه اختصاصی، ویدیو را به‌جای تصاویر…

۵ دقیقه خواندن۱