پرش به محتوای اصلی

موضوع

استدلال

Chain-of-thought, reasoning models (o-series, R-series), test-time compute

۱٬۰۹۸ مقاله منتشر شده

رمزگشایی از Hybrid-DPO: ضربه‌ای مهلک به توهمات منطقی مدل‌های زبانی

رمزگشایی از Hybrid-DPO: ضربه‌ای مهلک به توهمات منطقی مدل‌های زبانی

چارچوب RLearner-LLM با معرفی Hybrid-DPO، «سوگیری پرحرفی» را هدف قرار داده تا مدل‌ها به جای فصاحت، بر درستی منطقی تمرکز کنند. این روش باعث بهبود ۶ برابری در مبنی‌سازی منطقی مدل‌ها…

۲ دقیقه خواندن
چرا برای ارزیابی کیفیت صدا دیگر نیازی به آموزش مدل‌های تخصصی نیست؟

چرا برای ارزیابی کیفیت صدا دیگر نیازی به آموزش مدل‌های تخصصی نیست؟

چارچوب جدید JASTIN به مدل‌های زبانی اجازه می‌دهد تا کیفیت صدا، گفتار و موسیقی را بدون نیاز به آموزش‌های خاص و در حالت صفر-شات ارزیابی کنند. این سیستم با دستیابی به دقت در سطح…

۲ دقیقه خواندن
افشای شکاف استدلالی؛ مدل‌های متن‌باز در برابر آزمون DiffCap-Bench شکست خوردند

افشای شکاف استدلالی؛ مدل‌های متن‌باز در برابر آزمون DiffCap-Bench شکست خوردند

معرفی بنچ‌مارک DiffCap-Bench نشان داد که مدل‌های تجاری در درک تفاوت‌های بصری، فرسنگ‌ها از مدل‌های متن‌باز جلوترند. این یافته ثابت می‌کند که صرفاً بزرگ‌تر کردن مدل‌ها، مشکل استدلال…

۲ دقیقه خواندن
توقف بهینه‌سازی برای مرتبط بودن؛ وقتی «مفید بودن» بازی RAG را عوض می‌کند

توقف بهینه‌سازی برای مرتبط بودن؛ وقتی «مفید بودن» بازی RAG را عوض می‌کند

پژوهشگران چارچوب CAR را معرفی کردند؛ سیستمی که به جای شباهت معنایی، بر اساس توانایی سند در افزایش «اطمینان» مدل، رتبه‌بندی را تغییر می‌دهد. این رویکرد نویز را در خط لوله‌های تولید…

۳ دقیقه خواندن
پنجره‌ای کوتاه که سرنوشت استدلال مدل شما را تعیین می‌کند

پنجره‌ای کوتاه که سرنوشت استدلال مدل شما را تعیین می‌کند

پژوهشگران پنجره‌ای حیاتی در آموزش مدل‌های ترنسفورمر کشف کرده‌اند که تعیین می‌کند مدل واقعاً استدلال کند یا صرفاً داده‌ها را حفظ کند. نکته‌ی غافلگیرکننده این است که زمان‌بندی…

۲ دقیقه خواندن
چرا پنجره‌های بافت بزرگ‌تر راه نجات عامل‌های هوش مصنوعی نیستند؟

چرا پنجره‌های بافت بزرگ‌تر راه نجات عامل‌های هوش مصنوعی نیستند؟

پژوهشگران با معرفی LongSeeker، پارادایم جدیدی برای مدیریت حافظه در عامل‌های جستجو ایجاد کرده‌اند. این مدل با حذف داده‌های زائد، دقت جستجوهای پیچیده را به ۶۲.۵٪ رسانده و رقبای…

۲ دقیقه خواندن
گزارش arxiv: مدل‌های دنیای قابل‌اجرا ۷ بازی پیچیده ARC-AGI-3 را حل کردند

گزارش arxiv: مدل‌های دنیای قابل‌اجرا ۷ بازی پیچیده ARC-AGI-3 را حل کردند

یک سیستم جدید عامل‌محور توانسته است با ساخت و بازنویسی مدل‌های دنیای پایتونی، پازل‌های پیچیده ARC-AGI-3 را حل کند. این دستاورد، معیار جدیدی برای استدلال عمومی در هوش مصنوعی تعریف…

۲ دقیقه خواندن