
۲۵ مدل هوش مصنوعی در یک هفته: عصر تخصص و وزنهای باز
موج گسترده انتشار مدلها در ژوئن ۲۰۲۶، از Claude Fable 5 تا MiniMax M3، نشاندهنده چرخش صنعت به سمت تخصص و تسلط مدلهای وزنباز است. این روند با افشای جزئیات مدل عاملمحور Spud از…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۷۷۷ مقاله منتشر شده

موج گسترده انتشار مدلها در ژوئن ۲۰۲۶، از Claude Fable 5 تا MiniMax M3، نشاندهنده چرخش صنعت به سمت تخصص و تسلط مدلهای وزنباز است. این روند با افشای جزئیات مدل عاملمحور Spud از…

مدل جدید Claude Fable 5 با معرفی ردهی Mythos، استانداردهای کدنویسی را جابهجا کرد اما قیمت گزاف و فیلترهای سختگیرانه، دسترسی به آن را محدود کرده است. این مدل در بنچمارکهای تخصصی…

گوگل NotebookLM را با رایانههای ابری اختصاصی و قابلیت اجرای کد بهروزرسانی کرد. این ابزار اکنون از تحقیقات عاملمحور پشتیبانی کرده و خروجیهای مستقیم به اکسل و پاورپوینت میدهد.

مدلهای زبانی اغلب با منطقی غلط به پاسخی درست میرسند. روش جدید LegalBench با استفاده از «سیگنالهای اتمیک» و چارچوب IRAC، خطاهای استدلالی را از نتایج تصادفی جدا میکند تا توهمات…

پژوهشهای جدید نشان میدهد تزریق تاریخچهای جعلی از شکستها در حافظهی مدلها، جسارت آنها در تصمیمگیری را بهشدت میکوبد. این پدیده بدون تخریب منطق مدل یا فعال کردن سیستمهای…

سیستمهای چند-عاملی میتوانند یک درخواست سادهی کاربر را به صدها فراخوانی داخلی API تبدیل کنند و زیرساختها را به سرعت ساقط کنند. پیادهسازی محدودیتهای نرخ درخواست داخلی، راهکاری…

پژوهشگران چارچوب جدیدی به نام Target-SFT معرفی کردهاند که تنظیم دقیق نظارتشده (SFT) را به جای بهینهسازی توابع زیان، به عنوان یک مسئله طراحی توزیع هدف میبیند. این متد با عبور…

چارچوب SECDA-DSE با ادغام مدلهای زبانی بزرگ، فرآیند پیچیده جستوجوی فضای طراحی (DSE) در شتابدهندههای FPGA را خودکار میکند. این سیستم با ترکیب RAG و زنجیره تفکر، نیاز به تخصص…

یک بنچمارک گسترده نشان میدهد مدلهای زبانی پیشرو در تشخیص مفاهیم ناموجود ناتوان هستند و نرخ توهم آنها در پاسخ به پرسشهای القایی به ۸۶.۷٪ میرسد. این یافته لزوم تغییر تمرکز از…

پژوهشهای جدید روی مدلهای زبانی چندوجهی نشان میدهد که القای شخصیت در حالی که کیفیت توصیف تصاویر را بالا میبرد، باعث افت عملکرد در وظایف استدلالی دقیق میشود. این مطالعه همچنین…

چارچوب جدیدی به نام Diffusion Forcing Planner (DFP) با جداسازی نویز تاریخچه و آینده، مشکل لرزش مسیر در خودروهای خودران را حل کرده است. این روش به جای کپیبرداری ساده از الگوهای…

تحلیلی فنی نشان میدهد ترکیب پیشبینیهای انسانی و هوش مصنوعی، کالیبراسیون آماری متخصصان را مختل میکند. در حالی که روشهای «تفویض» این مشکل را حل میکنند، وابستگی شدیدی به…