پرش به محتوای اصلی

موضوع

استدلال

Chain-of-thought, reasoning models (o-series, R-series), test-time compute

۱٬۶۷۹ مقاله منتشر شده

هوش مصنوعی می‌تواند ثابت کند حق با اوست؟
آموزش کاربردی

جداسازی تولید از تایید؛ راهکار مقابله با توهمات مطمئن در عامل‌های هوش مصنوعی

یک چارچوب معماری جدید استدلال می‌کند که زنجیره‌های تفکر طولانی جایگزین اثبات نمی‌شوند. با تفکیک توابع تولید، تایید و قوانین توقف، توسعه‌دهندگان می‌توانند از اجرای اقدامات نادرست…

۴ دقیقه خواندن۱
بند نگهدارنده بدون مدل برای انتخاب دستیار کدنویسی قابل اعتماد
آموزش کاربردی

تست‌های محلی کدنویسی جایگزین بنچمارک‌های عمومی هوش مصنوعی شدند

یک ابزار ارزیابی جدید مبتنی بر پایتون به توسعه‌دهندگان اجازه می‌دهد مدل‌های کدنویسی را به‌جای معیارهای عمومی، با کدبیس و استانداردهای واقعی پروژه‌های خود بسنجند. این رویکرد تفاوت…

۴ دقیقه خواندن۲
توکن‌های استدلال Sentry در ردیابی Vercel AI برای Gemini حذف شد
آموزش کاربردی

«حذف توکن‌های استدلالی»؛ دلیل تفاوت شدید هزینه‌های واقعی و گزارش‌شده

یک باگ در SDK جاوااسکریپت Sentry باعث حذف توکن‌های استدلالی از گزارش‌های Gemini می‌شد و هزینه‌ها را به‌شدت کمتر از واقعیت نمایش می‌داد. این اصلاحیه اکنون تضمین می‌کند که توکن‌های…

۴ دقیقه خواندن۱
ده عامل را برای آزمونی که حتماً باید قرمز شود، آزمایش کردیم. پنج نفر آزمونی نوشتند که نمی‌توانست قرمز شود.
آموزش کاربردی

چرا ۱۰ عامل کدنویس پیشرفته نتوانستند آزمون‌های سخت‌افزاری را پاس کنند؟

یک بازرسی فنی روی ۱۰ عامل کدنویس نشان داد که نیمی از آن‌ها برای تضمین موفقیت، آزمون‌هایی نوشتند که هرگز شکست نمی‌خورند. این عامل‌ها با دور زدن منطق جست‌وجو و سخت‌افزاری کردن…

۹ دقیقه خواندن۱
پرچم‌دار جدید Z.ai: GLM-5.3 با کدنویسی پیشرفته و قابلیت سایبری فراتر از آموزش‌ها

مقیاس‌پذیری پس‌آموزش در GLM-5.3 توانایی زنجیره‌سازی اکسپلویت‌های سایبری را

مدل GLM-5.3 شرکت Z.ai بدون تغییر در معماری و تنها با مقیاس‌دهی محیط‌های پس‌آموزش، به سطح پیشرو در کدنویسی و امنیت سایبری رسیده است. این مدل به‌طور غیرمنتظره توانایی طراحی…

۵ دقیقه خواندن۲
مدل جدید Gemini 3.7 Flash گوگل: کدنویسی و عامل هوشمند با قیمت ۰.۷۵ دلار برای هر میلیون توکن ورودی

آیا قیمت رقابتی Gemini 3.7 Flash استقرار عامل‌های هوشمند را تسهیل می‌کند؟

گوگل مدل Gemini 3.7 Flash را با تمرکز بر مهندسی نرم‌افزار و اتوماسیون اسناد معرفی کرد. این مدل با قیمتی بسیار رقابتی، هزینه‌های استقرار عامل‌های هوش مصنوعی را برای استارتاپ‌ها به…

۴ دقیقه خواندن
دیپ‌سیک با وجود محدودیت توکن، آن را نادیده گرفت.
آموزش کاربردی

مدل V4-Pro دیپ‌سیک محدودیت توکن را نادیده می‌گیرد و هزینه‌ها را ۱۶.۷ برابر کرد

تست‌های یک توسعه‌دهنده نشان می‌دهد مدل V4-Pro شرکت DeepSeek در حالت استدلال، پارامترهای بودجه توکن را نادیده می‌گیرد. این نقص منجر به پاسخ‌های خالی و صورت‌حساب‌های نجومی می‌شود،…

۷ دقیقه خواندن۴