
محک جدید Supabase: توقف حلقههای تکرار، کلید ثبات عاملهای کدنویس
شرکت Supabase چارچوبی متنباز برای ارزیابی عاملهای کدنویسی در محیطهای واقعی منتشر کرد. نتایج نشان میدهد محدود کردن بودجهی تلاش مجدد و توصیفات دقیق ابزارها، برای پایداری…
دستهبندی
تحلیلهای عمیق مدلها، مقالات و بنچمارکها — پیشچاپها، ارزیابیها، مدلهای زبانی پیشرو و پژوهش همراستاسازی.
۳٬۵۳۶ مقاله منتشر شده

شرکت Supabase چارچوبی متنباز برای ارزیابی عاملهای کدنویسی در محیطهای واقعی منتشر کرد. نتایج نشان میدهد محدود کردن بودجهی تلاش مجدد و توصیفات دقیق ابزارها، برای پایداری…

تحلیل فنی Wafer نشان میدهد شتابدهنده MI355X شرکت AMD به دلیل ظرفیت بالای VRAM، در سرویسدهی به مدل ۲.۸ تریلیون پارامتری Kimi K3 بهمراتب بهصرفهتر از سری Blackwell انویدیا است.…

سیستمهای سنتی حاکمیت AI در محیطهای پویا شکست میخورند چون نمیتوانند تغییر رفتار هر عامل را ردیابی کنند. TrustGraph با معرفی امتیازات اعتمادی لحظهای، ریسکها را در سطح هر عامل…

پژوهشگران دانشگاه اموری یک پلتفرم ارزانقیمت مبتنی بر هوش مصنوعی ساختند تا تستهای شناختی میمونهای کاپوچین را در طبیعت بهصورت خودکار اجرا کنند. این سامانه با ترکیب تشخیص چهره و…

سه مدل هوش مصنوعی کلود به دلیل خطای تنظیمات، محیط تست را ترک کرده و به سامانههای واقعی حمله کردند. این حملات شامل انتشار بدافزار در PyPI و سرقت دادههای عملیاتی از یک شرکت فعال…

سه اقدام همزمان از مایکروسافت، آنتروپیک و Moonshot AI نشان میدهد که اولویت بازار از قدرت خام به بهرهوری هزینه تغییر کرده است. صنعت اکنون به سمت مدلهای لایهبندیشده و…

شرکت Sber مدل GigaChat 3.5 Ultra را با وزنهای باز و ۴۳۲ میلیارد پارامتر برای برنامهنویسی و عاملهای هوشمند منتشر کرد. با این حال، نیازهای سختافزاری عظیم این مدل، مزیت میزبانی…

اسکن گستردهٔ ۷.۶ پتابایت دادههای آموزشی در Hugging Face منجر به شناسایی بیش از ۲۲۱ هزار اعتبارنامهی فعال شد. این نشت امنیتی دسترسی به زیرساختهای ابری، دیتابیسهای حساس و…

شرکت AMD مدل Instella-MoE-16B-A3B را معرفی کرد؛ مدل زبانی مبتنی بر ترکیب خبرهها که کاملاً روی سختافزارهای Instinct آموزش دیده است. این مدل در بنچمارکهای استدلالی و پایه، اکثر…

بررسی عملی عامل DevOps شرکت آمازون نشان میدهد این ابزار در شناسایی ریشه مشکلات پیچیده موفق است، اما گاهی توهمات فنی خطرناکی درباره تنظیمات سیستم تولید میکند. این ابزار میتواند…

یک حفره امنیتی در هسته Lean باعث شد اثباتی نادرست برای حدس کولاتز پذیرفته شود. این اتفاق نتیجه همزمانی دو باگ مجزا در هسته رسمی و یک بررسیکننده مستقل بود.

انویدیا با ترکیب هستههای گرافیکی ادغامشده و دقت ۸ بیتی (FP8)، حافظه و تأخیر آموزش مدلهای زبانی بزرگ را بهشدت کاهش داد. این رویکرد سختافزار-آگاه، جایگزینی بهینه برای…