پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۸۷۶ مقاله منتشر شده

تقطیر دانش بین‌مدالی برای احیای زبان میراثی با تأیید شبیه‌سازی معکوس
آموزش کاربردی

شبیه‌سازی معکوس؛ راهکاری برای نجات زبان‌های در حال فراموشی با هوش مصنوعی

یک چارچوب جدید با ترکیب تقطیر دانش چندوجهی و شبیه‌سازی معکوس، برای حفظ زبان‌های در معرض خطر طراحی شده است. این سیستم با بازسازی خروجی‌های مدل معلم از طریق بردارهای معنایی مدل…

۷ دقیقه خواندن
نسخه‌های بتا عمومی iOS 27، macOS 27 و سایر پلتفرم‌های اپل منتشر شد

هوش مصنوعی زاینده چگونه عملکرد سیری را در iOS 27 تغییر می‌دهد؟

اپل نسخه‌های بتای عمومی iOS 27 و macOS 27 را با تمرکز بر تبدیل سیری به یک دستیار هوش مصنوعی زاینده عرضه کرد. این به‌روزرسانی علاوه بر قابلیت‌های هوشمند، جهش‌های چشم‌گیری در سرعت…

۴ دقیقه خواندن
ابزار خط فرمان برای تبدیل ویدیوی آموزش گیتار یوتیوب به تبلچر PDF
آموزش کاربردی

تبدیل ویدئوهای آموزشی گیتار به PDF با ترکیب Claude Vision و ابزارهای CLI

یک ابزار متن‌باز جدید با بهره‌گیری از قابلیت‌های بینایی مدل Claude، درس‌های گیتار یوتیوب را به نت‌های PDF تبدیل می‌کند. این ابزار با شناسایی دقیق میزان‌های موسیقی و حذف فریم‌های…

۳ دقیقه خواندن
ساخت سیستم چندعاملی ویرایش ویدیو: تحلیل هدف، برنامه‌ریزی گرافی و مسیریابی ابزار
آموزش کاربردی

«ترمیم خودکار خطاها»؛ قابلیت کلیدی VideoAgent در مدیریت گراف‌های تدوین

سامانه VideoAgent با استفاده از یک بهینه‌ساز منحصر‌به‌فرد، دستورات متنی را به گراف‌های اجرایی برای ابزارهای تدوین تبدیل می‌کند. این سیستم می‌تواند خطاهای ساختاری در زنجیره تولید…

۲۳ دقیقه خواندن
بیلی باس: دستیار صوتی هوشمند با Raspberry Pi 5 و Amazon Nova 2 Sonic
آموزش کاربردی

«لب‌خوانی واقع‌گرایانه»؛ دستاورد جدید ترکیب هوش مصنوعی و سخت‌افزار رزبری‌پای

یک پروژه متن‌باز با استفاده از مدل Amazon Nova 2 Sonic و رزبری‌پای ۵، اسباب‌بازی ماهی Billy Bass را به یک دستیار صوتی با تأخیر بسیار کم تبدیل کرده است. این سامانه با تحلیل لحظه‌ای…

۲۳ دقیقه خواندن
ویز با قابلیت‌های جدید هوش مصنوعی به‌روز می‌شود

۳ قابلیت جدید Waze بر پایه هوش مصنوعی برای رانندگان و موتورسواران

گوگل با آوردن هوش مصنوعی Gemini به Waze، امکان گزارش حوادث جاده‌ای و جست‌وجوی مقاصد را از طریق دستورات صوتی طبیعی فراهم کرد. این به‌روزرسانی شامل حالت اختصاصی برای موتورسیکلت‌ها و…

۲ دقیقه خواندن۱
لایه هوش سلامت عمومی از داده‌های نویزی سنسورهای پوشیدنی با SensorFM گوگل

مدل بنیادی SensorFM در برابر مدل‌های نظارت‌شده در پیش‌بینی فیزیولوژیک

گوگل پژوهشی مدل بنیادی SensorFM را معرفی کرد که داده‌های پراکنده حسگرهای پوشیدنی را به لایه هوشمند سلامت تبدیل می‌کند. این مدل با آموزش روی داده‌های ۵ میلیون کاربر، در تقریباً…

۵ دقیقه خواندن
نمودار فرآیند استخراج متن از فایل PDF، از دریافت فایل تا خروجی ساختاریافته
آموزش کاربردی

استخراج متنی در برابر بینایی-زبانی؛ راهکار رفع توهمات RAG در PDF

بسیاری از ابزارهای استخراج متن از PDF، داده‌های مختصاتی را حذف می‌کنند و باعث می‌شوند مدل‌های زبانی در ارجاع به صفحات دچار توهم شوند. برای حل این مشکل، رویکردی ترکیبی از استخراج…

۸ دقیقه خواندن
هنگامی که یک ایده بصری خام به نسخه متحرک اولیه نیاز دارد، Hailuo AI کاربردی است.
آموزش کاربردی

Hailuo AI ایده‌های بصری را به پیش‌نویس‌های ویدئویی سریع تبدیل می‌کند

ابزار Hailuo AI امکان تبدیل پرامپت‌های ساده یا تصاویر به آزمایش‌های بصری کوتاه را فراهم می‌کند. این سرویس به عنوان یک دفترچه طراحی دیجیتال برای تست اتمسفر و قلاب‌های ویدئویی پیش…

۲ دقیقه خواندن