پرش به محتوای اصلی

موضوع

استدلال

Chain-of-thought, reasoning models (o-series, R-series), test-time compute

۱٬۶۷۹ مقاله منتشر شده

عامل شما ابزار درست را انتخاب کرد، اما باز هم سیستم را خراب کرد.

محک PeakBench: عدم ارتباط دقت برنامه‌ریزی با مدیریت منابع سخت‌افزاری

محک جدید PeakBench نشان می‌دهد عامل‌های هوش مصنوعی می‌توانند وابستگی‌های یک گردش‌کار را به‌درستی تشخیص دهند اما همچنان با اشباع حافظه و پردازنده، سرور را کرش کنند. این مطالعه…

۶ دقیقه خواندن
حلقه یادگیری توالی - شماره ۹۲۱: آشنایی با مدل جدید DeepSeek، مقاله Env Harness و Etched شگفت‌انگیز

هم‌سویی مدل و سخت‌افزار؛ استراتژی جدید DeepSeek و Etched برای کاهش هزینه استنتاج

توسعه‌های جدید در لایه‌های مدل، محیط و زیرساخت نشان می‌دهد پیشرفت هوش مصنوعی از مقیاس‌بندی ساده به سمت چرخه بسته از ادراک و سخت‌افزار تخصصی می‌رود. این تغییرات هدفشان افزایش…

۱ دقیقه خواندن
خروجی‌های ساختاریافته LLM: ۴ API از ۱۲ JSON معتبر اما اشتباه برمی‌گردانند
آموزش کاربردی

تضاد اعتبار و صحت: ۴ مدل هوش مصنوعی خروجی JSON معتبر اما غلط تولید می‌کنند

یک محک جامع روی ۱۲ مدل پیشرو نشان می‌دهد که فعال کردن حالت «تفکر» در مدل‌های استدلالی، باعث تخریب مقادیر داده‌ای در خروجی‌های ساختاریافته می‌شود. این مطالعه همچنین تفاوت‌های شدید…

۱۲ دقیقه خواندن۱
لوگوی Gemini در کنار متن «برنده بهترین هوش مصنوعی برای مقالات دانشگاهی ۲۰۲۶»
آموزش کاربردی

جمینای با نرخ انتخاب ۳۹.۶٪ برندهٔ آزمون کورِ مقاله‌نویسی دانشجویی شد

یک مطالعه کور روی ۶۸۰۰ دانشجو نشان می‌دهد جمینای محبوب‌ترین هوش مصنوعی برای نوشتن مقالات دانشگاهی است و از کلود و ChatGPT پیشی گرفته است. داده‌ها حاکی از آن است که در حالی که…

۶ دقیقه خواندن
پرسش از کاربران HN: چه کار ساده‌ای است که مدل‌های زبانی بزرگ در آن به طرز شگفت‌انگیزی ضعیف‌اند؟
زندگی با AIتأییدنشده · منبع منفرد

۷ نقطه کور مدل‌های زبانی بزرگ؛ از نقشه‌های ASCII تا جست‌وجوی کلیدواژه

کاربران پیشرفته در Hacker News مجموعه‌ای از وظایف ساده اما دشوار برای هوش مصنوعی را شناسایی کردند. این شکست‌ها شکاف عمیق میان تسلط زبانی و دقت منطقی در مدل‌های فعلی را افشا می‌کند.

۳ دقیقه خواندن
موتور تکاملی VIDRAFT: چگونه مدل ۳۶ میلیارد پارامتری، غول‌های ۳۹۷ میلیاردی را به چالش کشید
آموزش کاربردی

Darwin-36B در برابر مدل‌های غول‌پیکر؛ پیروزی بازترکیب تکاملی بر حجم داده

مدل جدید Darwin-36B-Opus توانست در یکی از سخت‌ترین محک‌های استدلال، با مدلی ۱۱ برابر بزرگ‌تر برابری کند. این دستاورد به‌جای آموزش سنگین با GPU، از طریق یک فرآیند تکاملی برای ترکیب…

۴ دقیقه خواندن۱
مغز شما در برابر هوش مصنوعی

مطالعهٔ MIT: اتکای به چت‌بات‌ها دقت تشخیص اخبار جعلی را ۱۵٪ کاهش داد

وابستگی بیش از حد به هوش مصنوعی برای راستی‌آزمایی اخبار، منجر به ایجاد «پارادوکس وابستگی» شده است. این پدیده در حالی که در ابتدا دقت کاربر را بالا می‌برد، در بلندمدت توانایی تفکر…

۲ دقیقه خواندن
چرا سیستم‌های RAG توهم می‌زنند حتی وقتی بازیابی درست کار می‌کند
آموزش کاربردی

معماری سیستم در برابر نقص مدل؛ ریشهٔ خطاهای سامانه‌های RAG

بسیاری از شکست‌های سامانه‌های RAG ناشی از معماری سیستم است، نه نقص مدل‌های زبانی. با تبدیل بازیابی به مرحلهٔ «تولید کاندید» و افزودن لایه‌های بازرتبه‌بندی و اعتبارسنجی، می‌توان از…

۸ دقیقه خواندن۱
ساختار مدل‌های زبانی بزرگ Granite 4.2: معماری و روش آموزش
آموزش کاربردی

مدل‌های Granite 4.2 آی‌بی‌ام با یادگیری تقویتی مرحله‌بندی‌شده استدلال می‌کنند

آی‌بی‌ام خانواده مدل‌های استدلالی Granite 4.2 را با وزن‌های باز منتشر کرد که بر اساس ۱۵ تریلیون توکن آموزش دیده‌اند. این مدل‌ها با استفاده از یک خط لوله یادگیری تقویتی…

۲۵ دقیقه خواندن۲