
مدل Instella-MoE شرکت AMD رکوردهای عملکردی وزنهای باز را جابهجا کرد
شرکت AMD مدل Instella-MoE-16B-A3B را معرفی کرد؛ مدل زبانی مبتنی بر ترکیب خبرهها که کاملاً روی سختافزارهای Instinct آموزش دیده است. این مدل در بنچمارکهای استدلالی و پایه، اکثر…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۷۸۸ مقاله منتشر شده

شرکت AMD مدل Instella-MoE-16B-A3B را معرفی کرد؛ مدل زبانی مبتنی بر ترکیب خبرهها که کاملاً روی سختافزارهای Instinct آموزش دیده است. این مدل در بنچمارکهای استدلالی و پایه، اکثر…

یک حفره امنیتی در هسته Lean باعث شد اثباتی نادرست برای حدس کولاتز پذیرفته شود. این اتفاق نتیجه همزمانی دو باگ مجزا در هسته رسمی و یک بررسیکننده مستقل بود.

کلاود کد (Claude Code) با جایگزینی پرامپتهای آزاد با یک سیستم ساختاریافته از چهار لایه ابزاری، خروجیهای غیرقابلپیشبینی مدلهای زبانی را به اقدامات قابلاعتماد تبدیل میکند.…

تغییر معماری از عاملهای تکصحنهای به کانتینر خط لوله پنجمرحلهای، مشکل ناپایداری در تولید گزارشهای پیچیده را حل کرد. با سپردن پردازش داده به اسکریپتهای قطعی و استفاده از مدل…

ابزار متنباز agentrace با تحلیل تاریخچهٔ اجرای Claude Code، خطاهای خاموشی را که در حجم بالای دادهها گم میشوند، شناسایی میکند. این ابزار به جای تولید محتوا، بر اعتبارسنجی…

توسعهدهندگان اکنون میتوانند بررسیهای دستی خروجیهای مدل را با یک سیستم ارزیابی مبتنی بر پایتون جایگزین کنند. این ابزار با استفاده از قیمتگذاری تخت Oxlo.ai، امکان امتیازدهی…

مدلهای جدید OpenAI با نام Astra توانستند ۱۰ مسئله پیچیده ریاضی و علوم کامپیوتر را که بیش از یک دهه حلنشده مانده بودند، گرهگشایی کنند. این دستاورد نشاندهنده تغییر استراتژی…

یک راهنمای عملی جدید نشان میدهد که مدلهای زبانی بزرگ، زیرمجموعهای تخصصی از یادگیری عمیق هستند و نه جایگزینی برای آن. توسعهدهندگان میتوانند با جداسازی مدلهای بردارساز و مولد،…

مقایسهای میان AGE Plan و PwF نشان میدهد که در حالی که دومی بر حفظ حافظه تمرکز دارد، اولی با معرفی «دروازههای بستار» مانع از ادعاهای دروغین عاملها درباره تکمیل وظایف میشود.…

خط لولههای RAG با ترکیب بازیابی دادههای خارجی و تولید متن، پاسخهای مدلهای زبانی را به واقعیتهای قابل راستیآزمایی گره میزنند. این سازوکار ریسک توهم مدل را کاهش داده و دسترسی…

تحلیل ۱۷ خطای عاملمحور نشان میدهد قواعد داخلی برای اندازهگیری مفیدند اما هرگز نمیتوانند داور نهایی باشند. برای دستیابی به قابلیت اطمینان، توسعهدهندگان باید بهجای تکیه بر…

محک جدید ORCA-bench نشان میدهد که پیشرفتهترین عاملهای کدنویسی در تحلیل ریشهای حوادث تولید (Production) ناتواناند. این یافتهها شکاف عمیقی را میان قدرت کدنویسی مدلها و…