
Magnitude سرعت استنتاج مدلهای باز را ۲ برابر llama.cpp کرد
موتور استنتاج Magnitude با کامپایل مستقیم کرنلها روی سختافزار کاربر، سرعت اجرای مدلهای وزنباز را تا ۲ برابر افزایش داد. این رویکرد برخلاف ابزارهای رایج، نرمافزار را با مشخصات…
موضوع
SLMs, on-device inference, mobile AI, AI PCs
۱٬۷۶۰ مقاله منتشر شده

موتور استنتاج Magnitude با کامپایل مستقیم کرنلها روی سختافزار کاربر، سرعت اجرای مدلهای وزنباز را تا ۲ برابر افزایش داد. این رویکرد برخلاف ابزارهای رایج، نرمافزار را با مشخصات…

یک محیط ارزیابی جدید مبتنی بر سندباکس QEMU نشان میدهد که مدل کوانتیده Gemma 4B قادر است خرابیهای واقعی سرورهای لینوکس را تشخیص داده و رفع کند. این مدل در استدلالهای چندمرحلهای…

یک پیادهسازی جدید با استفاده از مدل EmbeddingGemma گوگل، جستوجوی مبتنی بر معنا را بهصورت کاملاً محلی برای ستارههای گیتهاب فراهم میکند. این سیستم با ترکیب ONNX Runtime و…

استارتاپ Meshy با تبدیل متن و تصویر به مدلهای سهبعدی، درآمد سالانه خود را به ۱۰۰ میلیون دلار رساند. این شرکت اکنون از ابزارهای حرفهای به سمت بازیهای مصرفکننده و خلق محتوای…

ابزار Whisper Notes با بهرهگیری از NPU تراشههای Snapdragon X Elite، تبدیل گفتار به متن را بهصورت کاملاً آفلاین و با تأخیر ناچیز انجام میدهد. این رویکرد با حذف پردازش ابری،…

یک توسعهدهنده ۱۲ ساله در هند با بازنویسی منطق بکاند، دستیار هوش مصنوعی خود (KODA) را پس از حذف مدل Groq احیا کرد. او با پیادهسازی زنجیره جایگزین مدلها و جستوجوی زنده وب،…

یک توسعهدهنده نوجوان با نام KODA، سیستمی برای منتورینگ کدنویسی طراحی کرده که روی یک گوشی اندرویدی ارزانقیمت اجرا میشود. این سیستم در ۹ آزمون استرس صنعتی امتیاز کامل ۵۴ از ۵۴ را…

نرمافزار EchoTranscribe با استفاده از مدلهای Whisper، امکان تبدیل فایلهای صوتی به متن را بهصورت کاملاً محلی فراهم میکند. این ابزار با حذف نیاز به ارسال دادهها به سرورهای…

آزمایشگاه MicroLLM ثابت کرد مدلهای کوانتیده بین ۲۵ تا ۳۶۰ میلیون پارامتر میتوانند بهطور کامل روی GPU کاربر و از طریق WebGPU اجرا شوند. این رویکرد هزینههای ابری و ریسکهای حریم…

یک راهنمای فنی توضیح میدهد که چگونه میتوان با استفاده از مدلهای زبانی کوچک یا برونسپاری استنتاج، یک گروه ۳۴ نفره از عاملهای هوش مصنوعی را روی موبایل مدیریت کرد. این متد به…

استارتاپ Efficient Computer با جذب ۹۷ میلیون دلار سرمایه، پردازنده Electron E1 را برای حل بحران انرژی در محاسبات عمومی و هوش مصنوعی عرضه کرد. این شرکت ادعا میکند معماری جدیدش…

سامانه Jevstiller با استفاده از یک مسیریاب مدل محلی، پاسخهای مدلهای بزرگ را با تضمین ریاضی بازتولید میکند. این روش تأخیر استنتاج را از ۳۰۰ میلیثانیه به ۱۵ میلیثانیه کاهش…