
مدل Laguna S 2.1 با امتیاز ۷۸.۵٪ صدرنشین SWE-Bench چندزبانه شد
شرکت Poolside مدل وزنباز Laguna S 2.1 را معرفی کرد که با معماری MoE و حالت «تفکر حداکثری»، در بنچمارکهای کدنویسی بلندمدت از مدلهایی ۱۰ برابر بزرگتر پیشی میگیرد.
دستهبندی
تحلیلهای عمیق مدلها، مقالات و بنچمارکها — پیشچاپها، ارزیابیها، مدلهای زبانی پیشرو و پژوهش همراستاسازی.
۳٬۵۶۶ مقاله منتشر شده

شرکت Poolside مدل وزنباز Laguna S 2.1 را معرفی کرد که با معماری MoE و حالت «تفکر حداکثری»، در بنچمارکهای کدنویسی بلندمدت از مدلهایی ۱۰ برابر بزرگتر پیشی میگیرد.

سامانههای نگهداری پیشبینانه به دلیل حجم بالای دادههای حسگرها با هزینههای گزاف توکن مواجهاند. Oxlo.ai با جایگزینی پرداخت توکنی با هزینه ثابت بهازای هر درخواست، استقرار…

پلتفرم Oxlo.ai برای کاهش هزینههای بالای استنتاج در تحلیلهای Long-Context، سیستم پرداخت مبتنی بر توکن را با مدل نرخ ثابت بهازای هر درخواست جایگزین کرد. این تغییر به مهندسان SRE…

استراتژی جدید Oxlo.ai امکان ایجاد تاکسونومی و طبقهبندی خودکار اسناد را بدون نیاز به مدلهای محلی یا تنظیم ابرپارامترهای پیچیده فراهم میکند. توسعهدهندگان اکنون میتوانند با یک…

بررسی امنیتی محیطهای اجرای عاملهای کدنویسی نشان میدهد که بسیاری از آنها دسترسی به شل محلی را به یک حفره امنیتی برای حملات راه دور تبدیل کردهاند. راهکار جایگزین، عبور از…

یک توسعهدهنده با ساخت یک چارچوب بسیار سبک (Harness) در کمتر از ۱۰۰۰ خط کد، ثابت کرد که حذف خطاهای خاموش در محیط اجرای عاملهای هوش مصنوعی، مستقیماً نرخ موفقیت آنها را افزایش…

ابزار متنباز mcpward با ایجاد فایلهای قفل (lockfiles) برای سرورهای پروتکل MCP، مانع از تغییرات پنهانی در توصیفات ابزارها میشود. این سیستم با شناسایی «تغییرات رفتاری» در مراحل…

پلتفرم Oxlo.ai با استفاده از مدلهای زبانی بزرگ به عنوان موتور استدلال، دستورات متنی را به مختصات دقیق برای قطعهبندی تصویر تبدیل میکند. این سامانه با مدل قیمتگذاری مبتنی بر…

تحلیل فنی Fireworks.ai نشان میدهد توزیع وظایف بین مدلهای وزنباز Kimi K3 و مدل بسته Fable 5، نتایجی فراتر از هر یک از این مدلها بهتنهایی دارد. این رویکرد ترکیبی صحت عملیات را…

مهندسی ابزارهای هوش مصنوعی با پنجرههای متنی بزرگ، معماریست که با چالش هزینه و دقت روبروست. در مقابل، روش RAG با جداسازی ذخیرهسازی از استدلال، دقت را افزایش و هزینهها را بهشدت…

پژوهشگران Apollo Research و OpenAI متدی به نام Contrastive SDF را برای شناسایی رفتارهای پاداشمحور در مدلها معرفی کردند. یافتهها نشان میدهد مدلهای مقیاسبزرگ در اثر آموزش…

یک محیط آزمایشی جدید مدلهای بینایی را در بازتولید آثار هنری با ابزارهای مداد رنگی سنجید. GPT-5.6 Sol برندهٔ کیفیت شد، در حالی که Claude Fable 5 با هزینهای ۲۰ برابر بیشتر،…