پرش به محتوای اصلی

موضوع

استدلال

Chain-of-thought, reasoning models (o-series, R-series), test-time compute

۱٬۶۷۹ مقاله منتشر شده

حذف دو سوم پرامپت، ۱۸۳ مورد از ۱۴۴۰۰ را مثل راه‌حل دقیق حل می‌کند: ۷۴/۵ در برابر ۲۲۹/۷ توکن
آموزش کاربردی

حذف دو-سوم دستورات پرامپت بازدهی مدل‌های زبانی را افزایش داد

بررسی ۱۴٬۴۰۰ مورد نشان می‌دهد حذف قوانین متضاد، بهینه‌ترین راه برای کاهش خطای پرامپت است. این استراتژی ساده، دقتی مشابه با اصلاحات پیچیده دارد اما هزینه‌ی توکن‌ها را به‌شدت کاهش…

۳ دقیقه خواندن۱
قرارداد سختگیرانه ابزار: ۱۸ خطا در هزار، قرارداد سهل‌گیر: ۲۴۰ خطا
آموزش کاربردی

قراردادهای سخت‌گیرانه در ابزارها نرخ خطای عامل‌های هوش مصنوعی را ۱۳ برابر کاهش

تحلیلی جدید نشان می‌دهد اجبار عامل‌های هوش مصنوعی به مواجهه با خطاهای صریح در فراخوانی ابزارها، شکست‌های «ساکت» را به‌شدت کاهش می‌دهد. این رویکرد به توسعه‌دهندگان اجازه می‌دهد…

۳ دقیقه خواندن
از «دستور دادن مستقیم به هوش مصنوعی» تا «طراحی حلقه»؛ چرا حلقه یک‌روزه به گراف تبدیل شد
آموزش کاربردی

مهندسی حلقه در برابر دستورات تک‌مرحله‌ای در مدیریت پروژه‌های AI

توسعه هوش مصنوعی از دستورات دستی به سمت «مهندسی حلقه» و «مهندسی گراف» حرکت می‌کند تا عامل‌ها بتوانند اهداف پیچیده را در چرخه‌های خودکار اجرا کنند. این تغییر اجازه می‌دهد مدل‌ها…

۴ دقیقه خواندن۱
تصویری از یک هوش مصنوعی که در حال سردرگمی حل یک مسئله ریاضی ساده است.
آموزش کاربردی

شکاف توکن‌سازی؛ دلیل شکست مدل‌های زبانی در محاسبات ریاضی

مدل‌های زبانی بزرگ به‌جای اجرای محاسبات قطعی، به دنبال تکمیل الگوهای متنی هستند. این نقص ساختاری در کنار توکن‌سازی که ارزش مکانی اعداد را از بین می‌برد، باعث تولید پاسخ‌های…

۱۱ دقیقه خواندن۵
لوگوی Inherent، استارتاپ هوش مصنوعی بنیان‌گذاری‌شده توسط فارغ‌التحصیلان دیپ‌مایند.

درون معماری Faraday؛ جایگزینی یادگیری تقویتی با حجم انبوه داده‌ها

استارتاپ لندنی Inherent با معرفی عامل هوش مصنوعی Faraday، ثابت کرد که مدل‌های کوچک‌تر می‌توانند در بازتولید یافته‌های علمی از مدل‌های غول‌پیکر پیشی بگیرند. این موفقیت به‌جای تکیه…

۴ دقیقه خواندن
برنامه‌ریز هر بار ۳ اشتباه یکسان را تکرار کرد. مدل بزرگ‌تر مشکل را حل نکرد.
آموزش کاربردی

پارامترهای بیشتر در برابر اعتبارسنجی قطعی برای تضمین اجرای برنامه‌ها

آزمون‌های میدانی روی موتور PlannerCritic نشان می‌دهد که مدل‌های بزرگ‌تر همچنان در منطق وابستگی‌ها شکست می‌خورند. برای تضمین اجرای برنامه‌ها، جایگزینی پارامترهای بیشتر با…

۵ دقیقه خواندن۴
عامل هوش مصنوعی در حال کار روی کامپیوتر با نماد خطا و ابزار تعمیر
آموزش کاربردی

مهندسی شاسی؛ جایگزینی زیرساخت‌های سخت‌گیرانه با مهندسی پرامپت در عامل‌های هوش

شکست بسیاری از عامل‌های هوش مصنوعی نه به دلیل ضعف مدل، بلکه به دلیل نبود زیرساخت‌های حمایتی است. رویکرد «مهندسی شاسی» با تمرکز بر پایداری وضعیت و تأیید سخت‌گیرانه، تولیدکننده‌های…

۲ دقیقه خواندن۲
تست یک هفته‌ای Grok در برابر ChatGPT — تفاوت محسوس بود
زندگی با AI

شکاف کاربردی ChatGPT و Grok؛ برتری در سازمان‌دهی در برابر تحلیل لحظه‌ای

آزمون‌های مقایسه‌ای نشان می‌دهد ChatGPT همچنان ابزاری برتر برای کارهای ساختاریافته و یکپارچگی فایل‌هاست، در حالی که Grok در تحلیل داده‌های لحظه‌ای شبکه‌های اجتماعی و استدلال‌های…

۳ دقیقه خواندن۱
جعبه پاندورای مسیریابی هوش مصنوعی: تخصیص کارآمد وقتی تخمین ارزش هزینه‌بر است

«تخمین ارزش»؛ راهکار جدید دیپ‌مایند برای بهینه‌سازی بودجهٔ استنتاج

گوگل دیپ‌مایند با مدل‌سازی ریاضی مسیریابی مدل‌ها به عنوان مسئله «جعبه پانجورا»، هزینه‌های محاسباتی انتخاب مدل بهینه را به شدت کاهش داده است. این چارچوب به‌صورت پویا تصمیم می‌گیرد…

۷ دقیقه خواندن۲