
اولاما با حافظهٔ متاداده تأخیر استنتاج محلی را کاهش داد
نسخه پیشانتشار ۰.۳۲.۱۵ اولاما با معرفی حافظهٔ متاداده، سربار هر درخواست را حذف میکند. این بهروزرسانی نشان میدهد که سرعت نهایی تجربه کاربر، فراتر از نرخ تولید توکن و وابسته به…
موضوع
Open-source models, open weights, local hosting, licensing
۱٬۹۴۶ مقاله منتشر شده

نسخه پیشانتشار ۰.۳۲.۱۵ اولاما با معرفی حافظهٔ متاداده، سربار هر درخواست را حذف میکند. این بهروزرسانی نشان میدهد که سرعت نهایی تجربه کاربر، فراتر از نرخ تولید توکن و وابسته به…

توسعهدهندگان عاملهای هوش مصنوعی در سال ۲۰۲۶ با شکافی عمیق میان چارچوبهای استدلالی و زیرساختهای مرورگر مواجهاند. در حالی که ابزارهایی مثل Browser Use بر «چه چیزی کلیک شود»…

پژوهش جدید دانشگاه استنفورد نشان میدهد مدلهای زبانی کوچک (SLM) که روی سختافزار محلی اجرا میشوند، بهسرعت در حال پر کردن شکاف عملکرد با مدلهای ابری هستند. این تغییر میتواند…

برخورد با خطای HTTP 429 در GitHub Copilot میتواند کل خط لوله تولید را متوقف کند. توسعهدهندگان با ترکیب استراتژی عقبنشینی نمایی (Exponential Back-off) و استقرار مدلهای زبانی…

اتکای صرف به امتیازات کلی بنچمارکها برای انتخاب مدل زبانی اشتباه است. معماریهای «آگاه از وظیفه» با ایجاد یک لایه مسیریابی، هر درخواست را به مدلی میسپارند که بهترین توازن میان…

یک گردشکار فنی جدید نشان میدهد چگونه میتوان با استفاده از بهینهسازی مستقیم ترجیح (DPO)، مدل Qwen2.5-0.5B-Instruct را همراستا کرد. این متد با تمرکز بر شناسایی «سوگیری طول»،…

آزمون مقایسهای پنج مدل بردار معنایی نشان داد که اندازه مدل و تاریخ انتشار، پیشبینیکنندهٔ دقت بازیابی نیستند. مدل کوچک و اقتصادی distiluse-base-multilingual-cased-v2 در…

اجرای مدلهای زبانی بزرگ بهصورت محلی نیازمند حافظهای بیش از حجم وزنهای مدل است. حافظهٔ KV Cache در پنجرههای متنی بلند میتواند تا ۱۴ گیگابایت فضای اضافی اشغال کند و باعث کندی…

NSA، FBI و CISA هشدار دادند که مهاجمان از هوش مصنوعی برای ساخت سریع اسکریپتهای نفوذ به سیستمهای کنترل صنعتی استفاده میکنند. این تغییر، سد فنی برای حمله به زیرساختهای حیاتی…

شرکت Inco AI با معرفی DFlash 2، مکانیزم رمزگشایی گمانهزنانه را بهینهتر کرد تا توکنها بهجای توالی، بهصورت موازی پیشبینی شوند. این بهروزرسانی سرعت استنتاج را در مدلهای خاص…

آزمایشگاههای پیشرو در هوش مصنوعی تمام متون دیجیتال موجود در وب را برای آموزش مدلهای آینده میبلعند. این فرآیند نوعی «جاودانگی آماری» ایجاد میکند که در آن خروجیهای انسانی…

پلتفرم Unsloth با معرفی نسخه ۳.۰ کوانتش برای مدل Qwen3.8-27B، دقت مدلهای فشرده را ۱۰٪ بهبود بخشید. این بهروزرسانی با استفاده از مجموعهدادههای کالیبراسیون دقیقتر، امکان اجرای…