
شاخص هوشمندی: مدل GLM-5.3-Flash امتیاز ۵۷ را کسب کرد
شرکت Z AI مدل استدلالی جدید GLM-5.3-Flash را معرفی کرد که با قیمتی بسیار پایین، عملکردی به مراتب بالاتر از میانگین مدلهای همرده دارد. این مدل ترکیبی از پنجره متنی گسترده و…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۶۷۹ مقاله منتشر شده

شرکت Z AI مدل استدلالی جدید GLM-5.3-Flash را معرفی کرد که با قیمتی بسیار پایین، عملکردی به مراتب بالاتر از میانگین مدلهای همرده دارد. این مدل ترکیبی از پنجره متنی گسترده و…

محک جدید PeakBench نشان میدهد عاملهای هوش مصنوعی میتوانند وابستگیهای یک گردشکار را بهدرستی تشخیص دهند اما همچنان با اشباع حافظه و پردازنده، سرور را کرش کنند. این مطالعه…

توسعههای جدید در لایههای مدل، محیط و زیرساخت نشان میدهد پیشرفت هوش مصنوعی از مقیاسبندی ساده به سمت چرخه بسته از ادراک و سختافزار تخصصی میرود. این تغییرات هدفشان افزایش…

یک محک جامع روی ۱۲ مدل پیشرو نشان میدهد که فعال کردن حالت «تفکر» در مدلهای استدلالی، باعث تخریب مقادیر دادهای در خروجیهای ساختاریافته میشود. این مطالعه همچنین تفاوتهای شدید…

تحلیل ششماهه عملکرد مدلهای پیشرو نشان میدهد که دیگر «بهترین مدل واحد» وجود ندارد. در حالی که GPT-5 Turbo در بنچمارکهای خام و سرعت برنده است، Claude 4 Opus در دیباگینگ پیچیده و…

یک مطالعه کور روی ۶۸۰۰ دانشجو نشان میدهد جمینای محبوبترین هوش مصنوعی برای نوشتن مقالات دانشگاهی است و از کلود و ChatGPT پیشی گرفته است. دادهها حاکی از آن است که در حالی که…

کاربران پیشرفته در Hacker News مجموعهای از وظایف ساده اما دشوار برای هوش مصنوعی را شناسایی کردند. این شکستها شکاف عمیق میان تسلط زبانی و دقت منطقی در مدلهای فعلی را افشا میکند.

مدل DeepSeek V4 اکنون از طریق یک درگاه API یکپارچه و سازگار با SDK شرکت OpenAI در دسترس است. این بهروزرسانی شامل یک لایه Flash برای کاهش تأخیر در کارهای سبک و حذف نیاز به کدنویسی…

مدل جدید Darwin-36B-Opus توانست در یکی از سختترین محکهای استدلال، با مدلی ۱۱ برابر بزرگتر برابری کند. این دستاورد بهجای آموزش سنگین با GPU، از طریق یک فرآیند تکاملی برای ترکیب…

وابستگی بیش از حد به هوش مصنوعی برای راستیآزمایی اخبار، منجر به ایجاد «پارادوکس وابستگی» شده است. این پدیده در حالی که در ابتدا دقت کاربر را بالا میبرد، در بلندمدت توانایی تفکر…

بسیاری از شکستهای سامانههای RAG ناشی از معماری سیستم است، نه نقص مدلهای زبانی. با تبدیل بازیابی به مرحلهٔ «تولید کاندید» و افزودن لایههای بازرتبهبندی و اعتبارسنجی، میتوان از…

آیبیام خانواده مدلهای استدلالی Granite 4.2 را با وزنهای باز منتشر کرد که بر اساس ۱۵ تریلیون توکن آموزش دیدهاند. این مدلها با استفاده از یک خط لوله یادگیری تقویتی…