پرش به محتوای اصلی

موضوع

استدلال

Chain-of-thought, reasoning models (o-series, R-series), test-time compute

۱٬۱۱۳ مقاله منتشر شده

هیچ مدل هوش مصنوعی آزمون کار تیمی واقعی را نمی‌گذراند: نتایج معیار GPTNT

چرا مدل‌های زبانی در مواجهه با سناریوهای حساس به زمان شکست می‌خورند؟

محک جدید GPTNT نشان داد که هیچ مدل زبانی بزرگی، اعم از متن‌باز یا تجاری، قادر به مدیریت همکاری‌های آنی تحت فشار نیست. این آزمایش شکافی بحرانی در توانایی مدل‌ها برای مدیریت عدم…

۱ دقیقه خواندن
عوامل بله/خیر در تولید از عوامل بازپاسخ‌گو بهتر عمل می‌کنند: داده‌های حفظ و قابلیت اطمینان از Watching Agents Inithouse
آموزش کاربردی

محدودیت‌های باینری نرخ بازگشت کاربران به عامل‌های هوش مصنوعی را افزایش داد

یافته‌های جدید Inithouse نشان می‌دهد عامل‌هایی که به‌جای متن‌های طولانی، خروجی‌های عددی و احتمالی می‌دهند، نرخ تعامل بالاتری دارند. این رویکرد با ایجاد نقاط مقایسه‌ی دقیق، قابلیت…

۵ دقیقه خواندن
ماتریس متعامدسازی حافظه در مدل‌های بازگشتی را بهبود می‌بخشد

تعامد ماتریس حافظه، بازیابی اطلاعات در مدل‌های mLSTM را ۴۵٪ بهبود داد

پژوهشی جدید نشان می‌دهد تعامد (Orthogonalization) ماتریس حافظه در مدل‌های mLSTM، توانایی بازیابی اطلاعات در محیط‌های نویزی را به‌شدت افزایش می‌دهد. این تکنیک مانع از حذف خاطرات…

۴ دقیقه خواندن۱
دو مدل کلود سونت ۵ و دیفیوژن جمینا که هوش مصنوعی را متحول می‌کنند

«سرعت، معیار جدید»؛ رویکرد مشترک گوگل و آنتروپیک در مدل‌های جدید

آنتروپیک و گوگل دیپ‌مایند با معرفی مدل‌های فوق‌سریع، رقابت را از «هوش» به «سرعت» تغییر دادند. مدل Sonnet 5 بر استدلال آنی تمرکز دارد و DiffusionGemma تولید تصویر با وزن‌های باز را…

۲ دقیقه خواندن
از چت‌بات ساده تا هوش مصنوعی که جای ما کار می‌کند — چه چیزهایی اضافه کردیم؟
آموزش کاربردی

۷ لایه معماری که یک چت‌بات ساده را به عامل هوش مصنوعی تبدیل می‌کند

تبدیل مدل‌های زبانی از حالت پاسخ‌دهنده به عامل‌های خودکار، نیازمند افزودن لایه‌های ساختاری برای حافظه، استدلال و دسترسی به ابزارها است. این معماری به توسعه‌دهندگان اجازه می‌دهد…

۴ دقیقه خواندن۱
لوگوی ScarfBench: معیارسنجی عامل‌های هوش مصنوعی برای مهاجرت چارچوب جاوای سازمانی

شکست ۹۰ درصدی عامل‌های پیشرو در مهاجرت چارچوب‌های جاوا

محک جدید ScarfBench نشان می‌دهد عامل‌های هوش مصنوعی در مهاجرت اپلیکیشن‌های سازمانی جاوا با شکست مواجه‌اند. با وجود تولید کدهای قابل کامپایل، این مدل‌ها در حفظ رفتار عملیاتی سیستم…

۴ دقیقه خواندن
چگونه از Claude برای یافتن مشکلات کد استفاده می‌کنم
آموزش کاربردیتأییدنشده · منبع منفرد

استفاده از Claude برای شناسایی باگ‌های پنهان در بازبینی کد

یک توسعه‌دهنده با طراحی گردش‌کاری سیستماتیک در Claude، خطاهای لبه‌ای و نشت حافظه را شناسایی می‌کند که معمولاً از چشم بازبین‌های انسانی دور می‌مانند. این متد بر پرسش‌های هدفمند…

۳ دقیقه خواندن
تولید زبان در انسان‌ها نتیجه آگاهی است، اما در مدل‌های زبانی، این رابطه معکوس عمل می‌کند.
زندگی با AI

تفاوت بنیادین معماری هوش مصنوعی و آگاهی انسانی در پردازش معنا

تحلیلی مفهومی نشان می‌دهد که برخلاف انسان‌ها که کلمات را از ایده‌های درونی می‌سازند، مدل‌های زبانی ایده‌ها را به عنوان محصول جانبی پیش‌بینی کلمات تولید می‌کنند. این تفاوت ساختاری،…

۵ دقیقه خواندن۱