
پرداخت به ازای نتیجه در برابر هزینهٔ توکنی در مدلهای زبانی
بررسی هزینههای استنتاج نشان میدهد «توکنهای استدلالی» پنهان در مدلهای ارزان، قیمت واقعی آنها را تا ۱۴.۷ برابر بیشتر از نرخ اعلامشده میکند. راهکار جایگزین، تغییر مدل…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۱۰۲ مقاله منتشر شده

بررسی هزینههای استنتاج نشان میدهد «توکنهای استدلالی» پنهان در مدلهای ارزان، قیمت واقعی آنها را تا ۱۴.۷ برابر بیشتر از نرخ اعلامشده میکند. راهکار جایگزین، تغییر مدل…

شرکت Cursor با جداسازی نقش برنامهریز و مجری در یک ساختار «سرمایهای»، حجم کدها را بدون کاهش کیفیت بهشدت پایین آورد. این رویکرد با توزیع بار شناختی بین مدلهای پیشرو و مدلهای…

شرکت QuackBuilds با معرفی یک قالب پرامپت ساختاریافته، فرآیند حل مسئله در هوش مصنوعی را به دو مرحله تحلیل استراتژیک و اجرای فنی تقسیم کرده است. این رویکرد با اجبار مدل به بازبینی…

تیم KwaiKAT از مدل KAT-Coder-V2.5 رونمایی کرد که بهجای تکمیل ساده متن، در محیطهای اجرایی واقعی آموزش دیده است. این رویکرد زیرساختی باعث شد مدل در بنچمارک PinchBench به امتیاز…

مدل جدید Anthropic توانست با شکست دادن GPT-5.6 Sol در محک ARC-AGI-3، استانداردهای هوش مصنوعی را بازتعریف کند. این مدل برای نخستین بار قادر است برای حل پازلهای ناشناخته، معادلات…

پژوهشهای تازه در Hugging Face مدلهای خود-اصلاحگر و روشهای آموزش DeepSeek-V4 روی سختافزارهای غیرانویدیا را معرفی کردند. این پیشرفتها شکافهای حیاتی در خودمختاری عاملهای هوش…

عاملهای هوش مصنوعی برای پایداری در مقیاس صنعتی به چیزی فراتر از مدلهای قدرتمند نیاز دارند: یک «هارنس» یا چارچوب نظارتی از بازخوردهای اجرایی. انتقال تمرکز از مهندسی پرامپت به…

برنامهنویسان باسابقه در حال گذار از تولید خط به خط کد به سمت معماری سیستمها با کمک هوش مصنوعی هستند. در حالی که این ابزارها یادگیری و حل مسئله را تسریع میکنند، وابستگی افراطی…

پلتفرم AIBridge با ادغام مدل استدلالی Kimi K3، پنجره متنی یک میلیون توکنی را از طریق یک API سازگار با OpenAI فراهم کرد. این سرویس اکنون ۱۵ مدل مختلف چینی را در یک نقطه اتصال واحد…

دن لو، مهندس نرمافزار، استدلال میکند که تستهای تصادفی (fuzzing) برای شناسایی باگهای واقعی، بسیار قابلاعتمادتر از مدلهای زبانی هستند. بنچمارکهای او نشان میدهد مدلهای پیشرو…

شرکت Inithouse با جایگزینی پرامپتهای عمومی با زنجیرهای از چهار چارچوب تخصصی روانشناسی، ابزار Verdict Buddy را توسعه داد. این مدل با اولویت دادن به دقت فنی بهجای جملات همدلانه،…

مربیان باسابقه هشدار میدهند که استفاده از ChatGPT به عنوان منبع اصلی دانش یا میانبری برای خلاقیت، منجر به خروجیهای متوسط میشود. این راهنما نشان میدهد چگونه مهندسی پرامپت ضعیف…