دادههای متا: ۹۲.۷٪ از قضایای ریاضی در ATLAS با موفقیت اثبات شدند
متا کتابخانه ATLAS را منتشر کرد؛ مجموعهای عظیم از متون ریاضی که توسط هوش مصنوعی به کد Lean 4 تبدیل شدهاند. این پایگاه داده با بیش از ۴۶ هزار قضیه اثباتشده، زیربنایی مقیاسپذیر…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۷۷۴ مقاله منتشر شده
متا کتابخانه ATLAS را منتشر کرد؛ مجموعهای عظیم از متون ریاضی که توسط هوش مصنوعی به کد Lean 4 تبدیل شدهاند. این پایگاه داده با بیش از ۴۶ هزار قضیه اثباتشده، زیربنایی مقیاسپذیر…
شرکت OpenAI در یک دستورالعمل فنی استدلال میکند که توانایی مدلهای پیشرو یک مقدار ثابت نیست، بلکه متغیری وابسته به «هارنس» (Harness) یا همان محیط، ابزارها و بودجه محاسباتی است.…
پژوهشی جدید با معرفی «تست تورینگ فرآیندی» نشان میدهد که مدلهای پیشرو با وجود ارائه پاسخهای صحیح، مسیری کاملاً متفاوت از انسان برای رسیدن به جواب طی میکنند. این مطالعه فاش…
پژوهشگران استنفورد و متا استدلال میکنند که عاملهای هوش مصنوعی تنها یک مدل زبانی نیستند، بلکه ترکیبی از مدل و یک «هارنس» نرمافزاریاند. این لایهی کد اجرایی است که تداوم وضعیت،…
شرکت Liquid AI مدل LFM2.5-8B-A1B را معرفی کرد؛ یک مدل MoE برای اجرا روی دستگاه که تنها ۱.۵ میلیارد پارامتر فعال دارد. این مدل با کاهش شدید توهمات و بهبود استدلال، امکان اجرای هوش…
شرکت Anthropic مدل Claude Opus 4.8 را با تمرکز بر کاهش توهمات و افزایش صداقت در کدنویسی منتشر کرد. این بهروزرسانی قابلیت کنترل میزان تلاش مدل و پیشنمایشی از گردشهای کاری پویا…
Claude Code با استفاده از جریانهای کاری پویا، توانست پروژه Bun را در ۱۱ روز از Zig به Rust منتقل کند. این دستاورد با دقت ۹۹.۸ درصد در تستها به دست آمد و نشاندهنده گذار از…
آزمایشگاههای هوش مصنوعی از هدف مبهم AGI به سمت RSI یا «خود-بهبودبخشی بازگشتی» حرکت کردهاند. هدف، ساخت سیستمهایی است که بتوانند بدون دخالت انسان، کد و معماری خود را ارتقا دهند.
هوش مصنوعی گوگل در کارهای سادهای مثل شمارش حروف و املا شکست میخورد. دلیل این اتفاق، پردازش متن به صورت توکنهای عددی به جای حروف مجزا است.
شرکت Cursor معماری Composer 2 را معرفی کرد؛ مدلی تخصصی برای مهندسی نرمافزار که بر پایه Kimi 2.5 ساخته شده است. این سیستم با استفاده از تکنیکهای Delta Sync و Router Replay،…
شرکت Warp با معرفی پلتفرم Oz و بهرهگیری از GPT-5.5، ۹۰٪ از Pull Requestهای خود را خودکار کرده است. این رویکرد «توسعهی عاملمحور»، باعث رشد ۳۵ برابری درآمد سالانهی این شرکت شده…
یک بنچمارک جدید از IBM و Artificial Analysis نشان میدهد که پیشرفتهترین مدلهای هوش مصنوعی در عیبیابی زیرساختهای سازمانی شکست میخورند. یافتهها حاکی از یک رابطه معکوس…