پرش به محتوای اصلی

موضوع

استدلال

Chain-of-thought, reasoning models (o-series, R-series), test-time compute

۱٬۷۷۲ مقاله منتشر شده

نقص پنهانی در حافظه‌ی مدل‌های زبانی که آن‌ها را رباتیک نگه می‌دارد

نقص پنهانی در حافظه‌ی مدل‌های زبانی که آن‌ها را رباتیک نگه می‌دارد

پژوهشگران با معرفی StratMem-Bench ثابت کردند که مدل‌های زبانی بزرگ در استفاده استراتژیک از حافظه برای تعاملات اجتماعی شکست می‌خورند. این یافته نشان می‌دهد که مدل‌ها علی‌رغم…

۳ دقیقه خواندن
ردپای پنهانی در Llama-3 که دست مدل‌های «تظاهر به حماقت» را می‌افشاید

ردپای پنهانی در Llama-3 که دست مدل‌های «تظاهر به حماقت» را می‌افشاید

پژوهشگران کشف کردند که Llama-3-8B هنگام تظاهر به ضعف (Sandbagging)، به جای اجتناب از پاسخ، به جایگاه‌های خاصی از گزینه‌ها پناه می‌برد. این «فروپاشی موقعیتی» یک امضای رفتاری قابل…

۲ دقیقه خواندن۲
چرا تعداد پارامترها در تصحیح تکالیف ریاضی هیچ اهمیتی ندارد

چرا تعداد پارامترها در تصحیح تکالیف ریاضی هیچ اهمیتی ندارد

یک مطالعه جدید نشان می‌دهد که برای تصحیح دقیق تکالیف ریاضی، همراستاسازی معماری با دستورالعمل‌ها بسیار حیاتی‌تر از تعداد پارامترها است. در حالی که مدل‌های مبتنی بر Gemini عملکرد…

۲ دقیقه خواندن۱
فریب مبنی‌سازی: چرا مدل‌های زبانی برای استدلال به چیزی فراتر از داده نیاز دارند

فریب مبنی‌سازی: چرا مدل‌های زبانی برای استدلال به چیزی فراتر از داده نیاز دارند

یک مطالعه جدید این باور را که استدلال هوش مصنوعی به‌طور خودکار از طریق مبنی‌سازی شکل می‌گیرد، رد می‌کند. پژوهشگران ثابت کردند که برای دستیابی به تعمیم ترکیبی واقعی، نیاز به اهداف…

۲ دقیقه خواندن۲
چرا پیروزی‌های کلود در بیوانفورماتیک هنوز «شکننده» هستند؟

چرا پیروزی‌های کلود در بیوانفورماتیک هنوز «شکننده» هستند؟

بنچمارک جدید Anthropic نشان می‌دهد مدل‌های Claude می‌توانند معماهای بیولوژیکی را حل کنند که حتی متخصصان انسانی از پس آن‌ها برنمی‌آیند. با این حال، «شکاف قابلیت» در تکرارپذیری…

۲ دقیقه خواندن۳
رمزگشایی از DeepSeek V4: وقتی حافظه استنتاج ۹۰ درصد سبک‌تر می‌شود

رمزگشایی از DeepSeek V4: وقتی حافظه استنتاج ۹۰ درصد سبک‌تر می‌شود

دیپ‌سیک با معرفی مدل‌های V4-Pro و V4-Flash، معماری جدیدی را برای کاهش چشمگیر هزینه‌های استنتاج ارائه کرد. این مدل‌ها با پنجره بافتی ۱ میلیون توکنی، مسیر را برای ظهور عامل‌های…

۲ دقیقه خواندن۱
تله‌ی بنچمارک‌ها: چرا GPT-5.5 با وجود رکوردشکنی، ۸۶ درصد توهم می‌زند؟

تله‌ی بنچمارک‌ها: چرا GPT-5.5 با وجود رکوردشکنی، ۸۶ درصد توهم می‌زند؟

مدل جدید OpenAI در حالی که صدرنشین شاخص‌های هوش مصنوعی شده، نرخ توهمات تکان‌دهنده‌ای را ثبت کرده است. این تضاد نشان می‌دهد که قدرت محاسباتی لزوماً به معنای قابلیت اعتماد در دنیای…

۳ دقیقه خواندن۲