
چگونه تفکیک استدلال از حافظه، نقاط ضعف عاملهای هوشمند را میپوشاند؟
بسیاری از عاملهای هوش مصنوعی در محیط عملیاتی بهدلیل نبود حافظه پایدار و حلقههای شکننده API شکست میخورند. معماری جدید با تفکیک استدلال از حافظه محلی و استفاده از مدلهای…
موضوع
SLMs, on-device inference, mobile AI, AI PCs
۱٬۶۶۸ مقاله منتشر شده

بسیاری از عاملهای هوش مصنوعی در محیط عملیاتی بهدلیل نبود حافظه پایدار و حلقههای شکننده API شکست میخورند. معماری جدید با تفکیک استدلال از حافظه محلی و استفاده از مدلهای…

یک گردشکار فنی جدید امکان اجرای مدل بسیار فشرده Bonsai-27B را روی سختافزارهای معمولی فراهم کرد. کاربران با استفاده از نسخه اختصاصی PrismML از llama.cpp میتوانند این مدل ۱-بیتی…

پلتفرم BizNode Pro امکان میزبانی ۵ بات تلگرام مستقل را روی سختافزار کاربر فراهم میکند. این سیستم با حذف وابستگی به سرویسهای ابری و توکنهای پولی، مدیریت هوش مصنوعی را به محیط…

شرکت Fermion Research مدل Neutrino-1 8B را معرفی کرد که با استفاده از یک فرمت وزنی ترنری، اثر حافظهای مدل را تا ۸۷.۵٪ کاهش میدهد. این مدل امکان استنتاج سریع روی سختافزارهای…

اپلیکیشن Yap یک ابزار دیکتهٔ صوتی متنباز برای macOS 26 است که تماماً روی دستگاه اجرا میشود. این ابزار با استفاده از چارچوبهای جدید اپل، سرعت و دقت بالاتری نسبت به مدل Whisper…

استقرار محلی مدل FLUX 2 Klein 9B گلوگاه اصلی را نه در هزینه هر تصویر، بلکه در صف انتظار ایجاد میکند. انتخاب بین حالتهای Distilled و Base تعیین میکند که آیا سختافزار شما یا…

یک چارچوب مرجع جدید برای سال ۲۰۲۶، پنج الگوی متمایز برای استقرار AI در بخش حقوق تعریف کرده است. این مدلها تعادلی میان قدرت پردازشی و مخاطرات حریم خصوصی، از سرورهای داخلی تا حریم…

رایانش لبه با انتقال پردازش از ابر به سختافزار دستگاه، تأخیر را کاهش و حریم خصوصی را افزایش میدهد. توسعهدهندگان اکنون بر بهینهسازی مدلها برای مدیریت منابع محدود موبایل تمرکز…

مایکروسافت مدل فشرده و کد-محور MAI-Cyber-1-Flash را برای مدیریت ۹۰٪ وظایف امنیتی عرضه کرد. این استراتژی هزینه عملیات را نصف کرده و دقت سیستم در شناسایی تهدیدات را افزایش داده است.

توزیع جدید Shadowfetch بر پایه دبیان ساخته شده تا نصب مدلهای زبانی بزرگ و عاملهای هوش مصنوعی را بهصورت آفلاین ساده کند. این سیستم فعلاً در مراحل اولیه توسعه است و باگهای نصب…

پروژه متنباز Transdom نشان داد که میزبانی شخصی موتورهای ترجمه میتواند هزینههای API و نشت دادهها را حذف کند. این سامانه با استفاده از کوانتش int8 و حافظه پنهان معنایی، سرعت…

دستیابی به دقت ۹۹٪ در مدلهای بینایی ماشین تضمینکنندهٔ موفقیت محصول نیست. چالش اصلی در مهندسی «حلقهٔ حس-تصمیم-عمل» و مدیریت بودجهٔ تأخیر (Latency) در محیطهای سختافزاری واقعی…