چرا مدلهای زبانی برای استدلال عمیقتر، به «خواب» نیاز دارند؟
پژوهشی جدید مکانیسمی شبیه به «خواب» را برای مدلهای زبانی پیشنهاد میدهد که با تبدیل بافت متنی به وزنهای دائمی، مشکل مقیاسپذیری حافظه را حل میکند. این روش باعث کاهش تأخیر در…
دستهبندی
تحلیلهای عمیق مدلها، مقالات و بنچمارکها — پیشچاپها، ارزیابیها، مدلهای زبانی پیشرو و پژوهش همراستاسازی.
۳٬۵۳۸ مقاله منتشر شده
پژوهشی جدید مکانیسمی شبیه به «خواب» را برای مدلهای زبانی پیشنهاد میدهد که با تبدیل بافت متنی به وزنهای دائمی، مشکل مقیاسپذیری حافظه را حل میکند. این روش باعث کاهش تأخیر در…
یک اسکریپت C# با استفاده از SDK ابزار Cadenza.Agent، امکان اتصال Codex CLI به مدلهایی مثل Claude 3.5 و Llama را فراهم میکند. این روش با ایجاد یک پروکسی برای APIهای OpenAI،…
چین برای جلوگیری از خروج استعدادها و نشت دادهها، سفر خارجی متخصصان هوش مصنوعی در شرکتهایی مثل علیبابا و دیپسیک را محدود کرد. این اقدام نشاندهنده تغییر رویکرد پکن از «توصیه»…
پژوهشگران پایتورچ با توسعه یک کرنل تخصصی در Triton، سرعت گذر بازگشتی در توجه بلوکی-قطری را برای پردازندههای B200 تا ۲.۵ برابر افزایش دادند. این بهینهسازی با حذف ذخیرهسازی…
بررسی ۲.۵ میلیون مقاله زیستپزشکی نشان میدهد که ارجاعات جعلی در متون علمی به شدت افزایش یافته است. این روند بهویژه در مقالات مروری که پایه درمان بیماران هستند، بحرانی شده و…
EAGLE 3.1 با رفع مشکل «لغزش توجه»، سرعت استنتاج مدلهای زبانی را بهویژه در متون طولانی بهشدت افزایش میدهد. این بهروزرسانی در مدل Kimi K2.6 توانست نرخ خروجی را تا ۲ برابر بهبود…
نسخه Cursor Composer 2.5 با معرفی یادگیری تقویتشده مبتنی بر بازخورد متنی هدفمند، مشکل «تخصیص اعتبار» در جلسات طولانی را حل کرده است. این روش با جایگزینی پاداشهای کلی با…
یک خط لوله (Pipeline) جدید برای آموزش مدلهای بینایی-زبانی معرفی شده است که به جای تکیه بر حدسهای هوش مصنوعی، از اثباتهای ریاضی برای پاداشدهی استفاده میکند. این روش با ترکیب…
چارچوب جدید SkillOpt مایکروسافت مهارتهای عاملهای هوش مصنوعی را بهجای تغییر وزنهای مدل، از طریق توصیفات متنی بهینه میکند. این روش در ۵۲ محیط مختلف، نتایجی برابر یا بهتر از…
اپل برای ارتقای سیری از یک مدل سفارشی ۱.۲ تریلیون پارامتری گوگل استفاده میکند. این سیستم وظایف را بین پردازش محلی برای کارهای ساده و استنتاج ابری برای درخواستهای پیچیده تقسیم…
نرمافزار Brethof Voice Pro 2.0 با استفاده از مدلهای Qwen3-ASR و Hunyuan-MT2، امکان تبدیل و ترجمه صوت را بهصورت کاملاً محلی فراهم کرد. این سیستم در بنچمارکها از Whisper…
کتابخانه turbovec با معرفی روشی جدید برای کوانتایز کردن بردارها، مصرف حافظه در سیستمهای RAG را ۸ برابر کاهش میدهد. این فناوری برخلاف روشهای سنتی، نیازی به دادههای آموزشی ندارد…