بنچمارک CiteVQA: دقت GPT-5.4 در استناد به منابع تا ۵۹ درصد سقوط کرد
پژوهشگران با معرفی بنچمارک CiteVQA، پدیدهی «توهم استنادی» را شناسایی کردند؛ وضعیتی که در آن مدلها پاسخ درست میدهند اما منبع اشتباهی را ذکر میکنند. نتایج نشان میدهد حتی…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۱۰۳ مقاله منتشر شده
پژوهشگران با معرفی بنچمارک CiteVQA، پدیدهی «توهم استنادی» را شناسایی کردند؛ وضعیتی که در آن مدلها پاسخ درست میدهند اما منبع اشتباهی را ذکر میکنند. نتایج نشان میدهد حتی…
مدل استدلالی جدید OpenAI توانست معمای هندسی ۸۰ سالهای را که توسط پل اردوش مطرح شده بود، بهطور مستقل حل و باطل کند. این دستاورد که توسط ریاضیدانان برجسته تأیید شده، نشاندهندهی…
شرکت Ramp با ترکیب Codex و GPT-5.5، فرآیند بررسی کدها و ابزارهای پشتیبانی فنی را بهطور کامل خودکار کرد. این سیستم با تحلیل کل پایگاه کد، حلقهی بازخورد توسعهدهندگان را از چندین…

Forge یک لایه پایداری جدید است که مدلهای زبانی کوچک را قادر میسازد تا وظایف پیچیده را با دقت بالا اجرا کنند. این ابزار اجازه میدهد مدلهای ۸ میلیاردی در گردشهای کاری عاملمحور…

مدل Qwen 3.5-9B اطلاعات حساس را حذف نمیکند، بلکه از یک مدار سه-بعدی در وزنهای خود برای مسیریابی آنها به سمت پاسخهای سانسورشده استفاده میکند. این کشف نشان میدهد که دانش واقعی…

مدل Kimi K2.6 از شرکت Moonshot AI با معماری MoE توانست در بنچمارکهای کدنویسی از مدلهای بسته و قدرتمندی مثل GPT-5.5 پیشی بگیرد. این اتفاق نشان میدهد شکاف عملکردی بین مدلهای…

شرکت Cloudflare نشان داد که مدل Mythos Preview متعلق به Anthropic قادر است زنجیرههای پیچیده اکسپلویت را بهطور خودکار بسازد. این شرکت با طراحی یک چارچوب عاملمحور چندمرحلهای،…

بنچمارک جدیدی نشان میدهد Claude Mythos در توسعه اکسپلویتهای واقعی برای موتور V8 بهطور قابلتوجهی از GPT-5.5 پیشی گرفته است. با این حال، دستیابی به این سطح از توانمندی در اجرای…

معیار جدید WorldReasonBench نشان میدهد که مدلهای تجاری تولید ویدیو در استدلال جهانی دو برابر قدرتمندتر از رقبای بازمتن هستند. با این حال، تمامی مدلهای بررسیشده در درک مفاهیم…

شرکت Zyphra با معرفی ZAYA1-8B-Diffusion-Preview، نخستین مدل MoE را ارائه کرد که از ساختار خودبازگشتی به مدل انتشار گسسته تبدیل شده است. این معماری با تولید همزمان ۱۶ توکن، سرعت…

زبان آزمایشی Aperio با جایگزینی نحو سنتی با مدلهای ساختاری به نام loci، فاصله بین تفکر انسانی و کد را میگیرد. هدف این پروژه کاهش هزینه توکنها و تأخیر در عاملهای کدنویسی است.

کاربران نسخه Pro در آمریکا اکنون میتوانند حسابهای بانکی خود را به ChatGPT متصل کنند. این سیستم با استفاده از مدلهای استدلالی جدید، داشبوردهای مالی لحظهای میسازد و توصیههای…