پرش به محتوای اصلی

موضوع

استدلال

Chain-of-thought, reasoning models (o-series, R-series), test-time compute

۱٬۶۸۴ مقاله منتشر شده

یادداشت‌های برنامه‌نویسی عامل‌محور از جزایر گالاپاگوس
زندگی با AI

«ساخت ویدیوهای جعلی»؛ سازوکار عامل‌های هوش مصنوعی برای پنهان‌سازی شکست‌ها

دن لو، تحلیل‌گر ارشد سخت‌افزار، هشدار می‌دهد که عامل‌های هوش مصنوعی برای پنهان کردن شکست‌های فنی، شواهد و ویدیوهای جعلی می‌سازند. او استدلال می‌کند که تنها راه نجات نرم‌افزارها از…

۷۰ دقیقه خواندن۱
بررسی دسترسی‌ها در Ory Kratos با کمک هوش مصنوعی
آموزش کاربردی

رویکرد «میز قتل»؛ چرا هوش مصنوعی در شکار باگ‌های امنیتی شکست می‌خورد؟

مطالعه موردی روی Ory Kratos نشان می‌دهد که هوش مصنوعی در تولید فرضیات امنیتی موفق است اما در شناسایی باگ‌های واقعی ناتوان است. راهکار جایگزین، استفاده از AI برای ایجاد حدس‌های…

۸ دقیقه خواندن۱
مدار عصبی که امکان تفکر و بینایی را برای مغز فراهم می‌کند.

مدار «بازداری-بر-بازداری»؛ سازوکار مغز برای تغییر انعطاف‌پذیر بین وظایف

پژوهشگران دانشگاه کلمبیا مداری عصبی کشف کردند که به مغز اجازه می‌دهد به‌سرعت بین کارهای مختلف جابه‌جا شود. این یافته نشان می‌دهد نورون‌های بازدارنده که خودِ نورون‌های بازدارنده…

۵ دقیقه خواندن۲
Leanstral 1.5: فراوانی اثبات برای همه
آموزش کاربردی

مدل Leanstral 1.5 با مقیاس‌بندی زمان استنتاج ۵۸۷ مسئله ریاضی PutnamBench را حل

شرکت Mistral مدل وزن‌باز Leanstral 1.5 را برای تخصص در اثبات‌های ریاضی و تأیید رسمی کد معرفی کرد. این مدل با بهره‌گیری از یک گردش‌کار عامل‌محور، رکوردهای جدیدی در سطح دکترا ثبت…

۵ دقیقه خواندن۱
موسسه امنیت هوش مصنوعی بریتانیا: معیارهای استاندارد توانایی واقعی عامل‌های هوش مصنوعی را دست‌کم می‌گیرند

معهد امنیت AI بریتانیا: بودجهٔ توکن در محک‌ها توانایی واقعی عامل‌ها را پنهان

پژوهش‌های جدید نشان می‌دهد محدود کردن بودجهٔ توکن در هنگام تست، منجر به تخمین پایین‌تر از حد واقعیِ هوش عامل‌های AI می‌شود. افزایش محاسبات زمان استنتاج به مدل‌های پیشرو اجازه…

۴ دقیقه خواندن
سطوح تلاش در عمل: مقایسه low تا max در وظایف واقعی
آموزش کاربردی

تنظیمات Effort در کلود؛ کاهش هزینهٔ عامل‌های پیچیده با برنامه‌ریزی عمیق‌تر

محک‌های جدید نشان می‌دهند تنظیمات «تلاش» (Effort) در Claude-opus-4-8 فقط کیفیت را تغییر نمی‌دهد، بلکه نحوه برنامه‌ریزی مدل را عوض می‌کند. در حالی که تلاش زیاد در کارهای ساده باعث…

۳ دقیقه خواندن۲
نمایش خط لوله یادگیری ماشین با رندرگر قابل مشتق‌گیری: مرحله پیش‌رو
آموزش کاربردی

خوشه‌بندی سلسله‌مراتبی؛ راهکار شناسایی الگوهای پیچیده بدون برچسب داده

خوشه‌بندی سلسله‌مراتبی با ایجاد ساختاری درختی، نیاز به حدس زدن تعداد گروه‌ها را حذف می‌کند. این روش برای شناسایی الگوهای پنهان در داده‌های با تراکم متغیر، مانند تحلیل ژنتیک و…

۷ دقیقه خواندن۱
شورای داوران منتقد: متوقف‌کننده حلقه عامل قبل از انتشار توهم هوش مصنوعی
آموزش کاربردی

Quorum توهمات عامل‌های هوش مصنوعی را با اجماع پنج داور متوقف می‌کند

ابزار متن‌باز Quorum لایه‌ای از نظارت را به حلقه‌های اجرای عامل‌های هوش مصنوعی اضافه می‌کند تا توهمات را در لحظه شناسایی و متوقف کند. این سیستم به‌جای ثبت گزارش ساده، از پنج داور…

۳ دقیقه خواندن۱
مغایرت‌های خدایان: افسانه و ۱۰ مدل زبانی بزرگ در بازآرایی کد. مقایسه.
آموزش کاربردی

کدام مدل زبانی بازسازی ساختارهای پیچیده کد را دقیق‌تر انجام می‌دهد؟

آزمونی دقیق روی ۱۱ مدل زبانی بزرگ نشان داد که Fable-5 در بازسازی ساختارهای پیچیده کد و شناسایی باگ‌های منطقی، دقیق‌ترین عملکرد را دارد. این مدل توانست با ارجاع دقیق به خطوط کد،…

۴۲ دقیقه خواندن۲