پرش به محتوای اصلی

موضوع

هوش لبه

SLMs, on-device inference, mobile AI, AI PCs

۱٬۶۷۵ مقاله منتشر شده

کارگزار MQTT در ارتباط عامل‌های هوشمند: قوت‌ها و محدودیت‌ها
آموزش کاربردی

معماری MQTT در برابر P2P؛ چرا واسطه‌های مرکزی ارتباط عامل‌های هوش مصنوعی را

پروتکل MQTT برای پخش رویدادها ایده‌آل است، اما متمرکز بودن آن در ارتباطات یک‌به‌یک میان عامل‌های هوش مصنوعی، نقاط شکست خطرناکی ایجاد می‌کند. رویکرد شبکه‌های همتا‌به‌همتا (P2P) با…

۵ دقیقه خواندن۲
تصویر: صفحه اصلی پروژه tawc در گیت‌هاب - یک کامپوزیتور Wayland اندرویدی توسط Tess
آموزش کاربردی

پروژه tawc برنامه‌های گرافیکی لینوکس را بدون روت روی اندروید اجرا می‌کند

پروژه tawc با استفاده از یک کامپوزیتور Wayland سفارشی، امکان اجرای برنامه‌های گرافیکی لینوکس را روی اندروید ۱۰ به بالا و بدون نیاز به دسترسی روت فراهم کرده است. نکته متمایز این…

۳ دقیقه خواندن
دانه‌بندی کوانتیزاسیون: مقیاس‌های تنسوری، کانالی و گروهی
آموزش کاربردی

تحلیلِ Granularity: تاثیر مستقیمِ تعدادِ ضرایبِ مقیاس بر سربارِ متاداده

دانه-بندی یا Granularity در کوانتش تعیین می‌کند چه تعداد از وزن‌ها از یک ضریب مقیاس مشترک استفاده کنند. این سازوکار مستقیماً بر توازن میان سربار حافظه و دقت مدل اثر می‌گذارد و…

۶ دقیقه خواندن۴
نقش مجموعه داده کالیبراسیون در فرآیند کوانتیزاسیون مدل‌های یادگیری ماشین
آموزش کاربردی

تحلیل کوانتش: عدم تطابق داده‌های کالیبراسیون عامل فروپاشی فرمت خروجی است

داده‌های کالیبراسیون دانش جدیدی به مدل نمی‌دهند، بلکه تعیین می‌کنند کدام خطاهای گرد کردن برای ورودی‌های خاص قابل‌تحمل هستند. عدم تطابق این داده‌ها با محیط عملیاتی منجر به افت شدید…

۵ دقیقه خواندن
ویژگی‌های پرت و چرا کوانتیزاسیون LLM بدون مدیریت آن‌ها از کار می‌افتد
آموزش کاربردی

«مدیریت مقادیر حدی»؛ کلید جلوگیری از فروپاشی مدل‌های زبانی فشرده

مدل‌های زبانی بزرگ در مقیاس‌های بالا «ویژگی‌های پرت» ایجاد می‌کنند که دقت کوانتش ۸ بیتی را به‌طور کامل تخریب می‌کند. مدیریت این مقادیر حدی، مرز میان یک مدل فشرده‌ی کاربردی و مدلی…

۵ دقیقه خواندن۱
خطای کمبود حافظه در مرحله کوانتیزاسیون، نه استنتاج
آموزش کاربردی

درون فرآیند کوانتش؛ تضاد میان وزن‌های دقت‌بالا و بهینه‌سازی حافظه

فرآیند کوانتش مدل‌ها به‌دلیل نیاز به وزن‌های دقت‌بالا و محاسبات آماری، حافظه بسیار بیشتری نسبت به استنتاج مصرف می‌کند. شناخت تفاوت‌های حافظه‌ای در متدهای GPTQ، AWQ و GGUF برای…

۵ دقیقه خواندن۲
کوانتایز کردن مدل تعبیه: چه کیفیتی واقعاً از دست می‌دهید
آموزش کاربردی

آیا می‌توان حافظهٔ ایندکس‌های برداری را بدون افت کیفیت کاهش داد؟

استفاده از کوانتش باینری می‌تواند فضای ذخیره‌سازی ایندکس‌های برداری را تا ۳۲ برابر کاهش دهد و ۹۶٪ از کیفیت بازیابی را حفظ کند. موفقیت این روش به شدت به پیاده‌سازی صحیح…

۵ دقیقه خواندن۱