
۸۸٪ عاملهای هوش مصنوعی در مقیاس تولید شکست میخورند
بیشتر عاملهای خودمختار به دلیل ریاضیات شکستهای متوالی و هزینههای توکنی درجهدوم در محیط عملیاتی متوقف میشوند. استقرار موفق نیازمند حفاظهای سختگیرانه مانند هرس کردن زمینه و…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۷۷۳ مقاله منتشر شده

بیشتر عاملهای خودمختار به دلیل ریاضیات شکستهای متوالی و هزینههای توکنی درجهدوم در محیط عملیاتی متوقف میشوند. استقرار موفق نیازمند حفاظهای سختگیرانه مانند هرس کردن زمینه و…

شرکت Rulestack دریافت که عاملهای هوش مصنوعی آن بهجای استناد به متن گزارشها، اعداد بهینهشده در تیترها را به عنوان حقیقت پذیرفته و توهم میسازند. تیم فنی با طراحی یک فیلتر…

روهان بانسال با استفاده از یک مدل ۴ میلیارد پارامتری Qwen و ترکیب تنظیم دقیق نظارتشده با یادگیری تقویتی، توانست برنامههای اجرای پرسوجو در PostgreSQL را بهینه کند. این مدل با…

شرکت آنتروپیک ثابت کرد که مدلهای زبانی بزرگ میتوانند کل چرخه طراحی پروتئین، از پژوهش تا رتبهبندی، را بدون دخالت انسان مدیریت کنند. این دستاورد نشان میدهد ارکستراسیون پیچیده…

یک پژوهشگر با ترکیب تنظیم نظارتشده (SFT) و یادگیری تقویتی عاملمحور، مدلی کوچک را آموزش داد که در بهینهسازی پرسوجوهای سنگین از بهینهساز پیشفرض Postgres پیشی میگیرد. این…

شرکت xAI قابلیت حافظه میانجلسهای را به Grok Build اضافه کرد تا عامل کدنویسی آن بتواند قراردادها و تصمیمات پروژه را در فایلهای متنی ذخیره و بازیابی کند. این تغییر مانع از تکرار…

تیم ZGCM مدل ۷ میلیارد پارامتری ZGCM-1 را منتشر کرد که در استدلال ریاضی و جستوجوی عاملمحور از مدلهای غولپیکر پیشی میگیرد. این مدل با استفاده از رویکرد «تحقیق و توسعه هوش…

مدل DeepSeek V4.1 Flash در یک محک سختگیرانه، با نمره کامل ۱۱ از ۱۱ تمام اهداف آسیبپذیر را مورد نفوذ قرار داد. این مدل با بهرهگیری از حافظه پنهان ورودی، کل این عملیات پیچیده را…

به جای استفاده از هوش مصنوعی صرفاً برای تولید سریعتر خروجی، میتوان از آن به عنوان ابزاری برای مشاهده و بصریسازی الگوهای ذهنی استفاده کرد. تحلیل مسیر رسیدن به پاسخ، به جای خودِ…

پلتفرم AlgoVault با معرفی یک پروتکل زمینه مدل (MCP)، امکان تحلیل لحظهای دادههای فنی بیتکوین را برای عاملهای هوش مصنوعی فراهم کرد. این ابزار به جای اجرای خودکار معاملات،…

شرکت Prior Labs مدل TabPFN-3.5 را معرفی کرد؛ یک مدل بنیادی برای دادههای جدولی که بدون نیاز به آموزش روی هر مجموعه داده، نتایجی فراتر از برنده مسابقه مشهور Otto Group در سال ۲۰۱۵…

یک ارزیابی عملی روی گراف دانش نشان میدهد که معیارهای سنتی بازیابی مانند نرخ بازخوانی و تأخیر، کیفیت واقعی خروجی را نمیسنجند. با امتیازدهی تصمیمات در برابر یک خطمبنای پیشنویس،…