
«پایان شانس در بنچمارک»؛ متدولوژی جدید برای سنجش واقعی کیفیت مدل
یک چارچوب ارزیابی جدید، نوسانات سرور مانند تأخیر در صفها را بهجای یادداشتهای حاشیهای، به عنوان عوامل رد صلاحیت در نظر میگیرد. با استفاده از «پوشههای نشست»، مهندسان میتوانند…
دستهبندی
تحلیلهای عمیق مدلها، مقالات و بنچمارکها — پیشچاپها، ارزیابیها، مدلهای زبانی پیشرو و پژوهش همراستاسازی.
۵٬۶۷۶ مقاله منتشر شده

یک چارچوب ارزیابی جدید، نوسانات سرور مانند تأخیر در صفها را بهجای یادداشتهای حاشیهای، به عنوان عوامل رد صلاحیت در نظر میگیرد. با استفاده از «پوشههای نشست»، مهندسان میتوانند…

تحلیل احساسات در بازارهای مالی از شمارش ساده کلمات فراتر رفته تا تردید و عدم قطعیت مدیران را شناسایی کند. تیمهای سرمایهگذاری اکنون با مدلهای ترنسفورمر تخصصی، گزارشهای شفاهی را…

شرکت PicoJool با جذب سرمایه سری A، روی تجاریسازی لیزرهای نوری پرسرعت برای انتقال بهینه داده بین شتابدهندهها تمرکز میکند. این بودجه، مسیر شرکت را از بنچمارکهای آزمایشگاهی به…

شرکت آنتروپیک در قراردادی هفتساله، ۱۱.۶ میلیارد دلار برای تأمین ظرفیت ابری اختصاصی از اکامای هزینه میکند. این توافق که پتانسیل رشد تا ۲۰ میلیارد دلار را دارد، نشاندهنده تغییر…

مدلهای پیشرو مانند GPT-6 و Opus 5.5 اکنون قادرند معماهای تاریخی «حلپذیر» از جمله رمزهای جنگ جهانی دوم را رمزگشایی کنند. کارشناسان معتقدند سرمایهگذاری روی آرشیوهای دیجیتال…

مطالعهای از مؤسسه FRI نشان میدهد که حتی برترین متخصصان و پیشبینان جهان، سرعت دستیابی هوش مصنوعی به نقاط عطف در ریاضیات، ویروسشناسی و درآمدزایی را بهشدت دستکم گرفتهاند. در…

بسیاری از توسعهدهندگان یک پاسخ صحیح از مدل را به اشتباه بهعنوان تأیید نهایی گردشکار میپذیرند. یک آزمون معتبر نیازمند ثبت هش پرامپت، لاگ دستورات و مستندسازی متغیرهای سختافزاری…

بسیاری از ابزارهای کدنویسی هوش مصنوعی بهجای سقف هزینهی سخت، تنها هشدار بودجه میدهند که باعث میشود عاملهای خودمختار پیش از واکنش انسان، میلیونها دلار هزینه کنند. حاکمیت واقعی…

بسیاری از نمونههای اولیه عاملهای هوش مصنوعی بهدلیل نبود مالکیت، گزارشدهی و زمینه مشترک در محیط عملیاتی شکست میخورند. برای مقیاسپذیری، انتخاب پلتفرمهای مدیریت پروژه بر…

شرکت BottleCap AI نسخهای بهینهشده از مدل Qwen3.8-27B را منتشر کرد که توکنهای تکراری در زنجیره تفکر را حذف میکند. این مدل با کاهش ۳۷.۲ درصدی در حجم محاسبات استدلال، تنها ۰.۸۶…

شرکت Parcha Labs ابزار AgentRun را معرفی کرد تا رفتار پیشبینیناپذیر عاملهای هوش مصنوعی را به منطق ساختاریافته تبدیل کند. این زبان تخصصی (DSL) اجازه میدهد توسعهدهندگان گامهای…

یک آسیبپذیری Zero-Day در دستیار هوش مصنوعی Muse متعلق به متا، امکان دسترسی برنامههای محلی به توکنهای کاربر و دور زدن امنیت macOS را فراهم میکند. این نقص امنیتی منجر به مسدود…