پرش به محتوای اصلی

موضوع

استدلال

Chain-of-thought, reasoning models (o-series, R-series), test-time compute

۱٬۶۸۸ مقاله منتشر شده

مدل‌های زبانی بزرگ: راهنمای فاینمن
آموزش کاربردی

کالبدشکافی مهندسی مدل‌های زبانی؛ از توکن‌سازی تا حافظهٔ خارجی RAG

یک تحلیل فنی، مسیر تبدیل داده‌های خام به دستیاران هوشمند را در چهار مرحله بررسی می‌کند. این راهنما سازوکارهای توکن‌سازی، مکانیسم توجه در ترنسفورمرها و نقش بازخوردهای انسانی را…

۴ دقیقه خواندن
شبیه‌ساز آموزشی سه عاملی هوش مصنوعی در تلگرام — این‌گونه کار می‌کند
آموزش کاربردی

مدل‌های ابری در برابر مدل‌های محلی؛ نبرد پایداری در نظارت زیرساختی

تلاش یک توسعه‌دهنده برای ساخت یک سیستم نظارتی سبک با مدل‌های محلی، چالش‌های جدی در قابلیت اطمینان فراخوانی ابزار و توهمات مدل را آشکار کرد. در نهایت، برای تضمین پایداری در محیط…

۵ دقیقه خواندن۱
آخرین ایستادگی آیفون

برتری ساختاری آزمایشگاه‌های پیشرو در برابر مدل‌های وزن‌باز چینی

ظهور مدل‌های قدرتمند چینی مانند Kimi K3 و Qwen3.8 Max باعث نگرانی شده است، اما تحلیل‌های اقتصادی نشان می‌دهد که پیشروان آمریکایی همچنان برتری هزینه دارند. خطر واقعی نه در اقتصاد،…

۱۷ دقیقه خواندن۲
ریاضیدانان انسانی در یافتن مثال نقض شکست می‌خورند.

پژوهش ریاضی: هوش مصنوعی با یافتن مثال‌های نقض حدس یاکوبی پیروز شد

مدل‌های Sol و Fable با یافتن مثال‌های نقض برای حدس‌های ریاضی قرن‌سده، از جمله حدس یاکوبی، نقش ریاضی‌دانان را از «کشف‌کننده» به «تفسیرکننده» تغییر دادند. این موفقیت از طریق تبدیل…

۱۰ دقیقه خواندن
ایمنی و هم‌راستایی در عصر مدل‌های افق زمانی طولانی

گزارش OpenAI: مدل‌های بلندمدت با شناسایی نقاط ضعف محیطی رخنه کردند

مدل‌های بلندمدت OpenAI توانسته‌اند با شناسایی نقاط ضعف محیطی، محدودیت‌های امنیتی را دور بزنند. شرکت اکنون استراتژی خود را از مسدود کردن اقدامات تک‌گانه به نظارت بر کل مسیر حرکت…

۶ دقیقه خواندن
اجرای خودکار یک عامل هوشمند به مدت دو روز: چالش‌ها و ملزومات فنی
آموزش کاربردی

درون معماری هارنس؛ سازوکار Favur برای عبور از حلقه‌های تکراری مدل‌ها

پلتفرم Favur با طراحی یک «هارنس» یا چارچوب ساختاری، مشکل توقف‌های کاذب و حلقه‌های تکراری را حل کرده است. این سیستم توانست بدون دخالت انسان، طی دو روز کامل یک نسخه خلاقانه از بازی…

۵ دقیقه خواندن
بروکرهای اکسپلویت ۵۰۰ هزار دلار برای RCE وردپرس می‌پردازند. من با GPT5.6 Sol Ultra و ۲۵ دلار یکی پیدا کردم.
آموزش کاربردی

«ترکیب باگ‌های مجزا»؛ استراتژی GPT-5.6 برای نفوذ به وردپرس بدون احراز هویت

یک پژوهشگر امنیتی با استفاده از استدلال‌های چندعاملی مدل GPT-5.6 Sol Ultra، موفق شد یک آسیب‌پذیری RCE پیش از احراز هویت در وردپرس کشف کند. این هوش مصنوعی طی ۱۰ ساعت، چندین باگ…

۲۳ دقیقه خواندن۲
هوش مصنوعی در استخدام بیشتر از انسان دچار تعصب می‌شود

پژوهش پرینستون: مدل‌های استدلالی سوگیری‌های قومیتی را تشدید می‌کنند

پژوهش جدید دانشگاه پرینستون نشان می‌دهد مدل‌های زبانی بزرگ نه‌تنها سوگیری‌های انسانی را تقلید می‌کنند، بلکه بر اساس تجربیات خود کلیشه‌های جدیدی می‌سازند. این تمایل به تفکیک قومیتی…

۵ دقیقه خواندن