
فشردهسازی مسیر در برابر تقلید پاسخ در دیستیل کردن مدلها
دیستیل کردن مدلهای انتشار برخلاف مدلهای متنی، به جای تقلید از یک پاسخ نهایی، بر فشردهسازی کل مسیر تبدیل نویز به تصویر تمرکز دارد. این تغییر رویکرد، آموزش هوش مصنوعی را از تقلید…
موضوع
Models that natively process text+image+audio+video
۱٬۳۵۶ مقاله منتشر شده

دیستیل کردن مدلهای انتشار برخلاف مدلهای متنی، به جای تقلید از یک پاسخ نهایی، بر فشردهسازی کل مسیر تبدیل نویز به تصویر تمرکز دارد. این تغییر رویکرد، آموزش هوش مصنوعی را از تقلید…

اپلیکیشن دسکتاپ SoundScript با استفاده از حافظهٔ محلی و اتوماسیون Gemini، هزینههای تولید صدای هوش مصنوعی را بهشدت کاهش میدهد. این ابزار با حذف تولیدات تکراری، از اتلاف اعتبار…

یک زیرساخت جدید با تبدیل ComfyUI به یک بکاند بدون رابط گرافیکی، تولید ویدیو و صدای همگام را از طریق APIهای پایتون ممکن کرده است. این سامانه با تطبیق هوشمند دقت مدل با حافظه VRAM،…

موتور استنتاج بومی h3.c با بهینهسازی حافظه و کوانتش int8، اجرای محلی مدل MiniMax-H3 را روی تراشههای اپل ممکن کرد. این ابزار زمان حذف نویز (Denoising) برای کلیپهای کوتاه را از…

پلتفرم Backboard با ارائه داشبوردهای no-code، مدیریت حافظه بلندمدت و جابهجایی بین مدلهای مختلف هوش مصنوعی را تسهیل کرده است. این ابزار با ادغام در اپلیکیشن Nash، قابلیتهای…

یک سیستم بدون سرور (Serverless) در AWS با ترکیب سه مدل هوش مصنوعی، فرآیند طبقهبندی، برش و استخراج متن از عکس کارتهای کلکسیونی را خودکار کرده است. این معماری با حفظ نظارت انسانی،…

پروژه FineBooks نشان داد مدلهای کوچک با وزنهای باز میتوانند دادههای متنی کتابهای قدیمی را با هزینهای اندک و دقتی بسیار بالا پاکسازی کنند. این دستاورد بازدهی آموزش مدلهای…

شرکت Dyna Robotics با معرفی مدل DYNA-2، یادگیری مهارتهای فیزیکی رباتها را از دادههای گرانقیمت رباتیک به ویدیوهای انسانی منتقل کرد. این مدل با تماشای میلیونها ساعت رفتار…

متا مدل Muse Glimmer را با وزنهای باز منتشر کرد تا اجرای عاملهای هوش مصنوعی بهصورت محلی و خصوصی روی سختافزارهای مصرفکننده ممکن شود. این اقدام گامی عملی در مسیر تحقق چشمانداز…

انویدیا مدل Magpie TTS را با وزنهای باز و پشتیبانی از ۱۲ زبان منتشر کرد. این مدل با کاهش شدید تأخیر در استنتاج، امکان ساخت عاملهای صوتی با پاسخدهی آنی و استقرار محلی را فراهم…

بررسی سامانه GRAIL متعلق به شرکت RAND نشان میدهد که در دهه ۶۰ میلادی، بدون استفاده از شبکههای عصبی، به دقت ۹۰ درصدی در تشخیص دستخط دست یافتهاند. این سیستم با تکیه بر هندسه و…

پروژه MyZubster با معرفی یک ماژول دوربین هوشمند و بازاستفاده، رباتهای خود را از مدل «دستور-عملکرد» به معماری «ادراک-تصمیم-عمل» منتقل کرد. این سیستم امکان تشخیص لحظهای اشیا و…