پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۴۲۵ مقاله منتشر شده

ساخت سیستم چندعاملی ویرایش ویدیو: تحلیل هدف، برنامه‌ریزی گرافی و مسیریابی ابزار
آموزش کاربردی

«ترمیم خودکار خطاها»؛ قابلیت کلیدی VideoAgent در مدیریت گراف‌های تدوین

سامانه VideoAgent با استفاده از یک بهینه‌ساز منحصر‌به‌فرد، دستورات متنی را به گراف‌های اجرایی برای ابزارهای تدوین تبدیل می‌کند. این سیستم می‌تواند خطاهای ساختاری در زنجیره تولید…

۲۳ دقیقه خواندن
بیلی باس: دستیار صوتی هوشمند با Raspberry Pi 5 و Amazon Nova 2 Sonic
آموزش کاربردی

«لب‌خوانی واقع‌گرایانه»؛ دستاورد جدید ترکیب هوش مصنوعی و سخت‌افزار رزبری‌پای

یک پروژه متن‌باز با استفاده از مدل Amazon Nova 2 Sonic و رزبری‌پای ۵، اسباب‌بازی ماهی Billy Bass را به یک دستیار صوتی با تأخیر بسیار کم تبدیل کرده است. این سامانه با تحلیل لحظه‌ای…

۲۳ دقیقه خواندن۱
ویز با قابلیت‌های جدید هوش مصنوعی به‌روز می‌شود

۳ قابلیت جدید Waze بر پایه هوش مصنوعی برای رانندگان و موتورسواران

گوگل با آوردن هوش مصنوعی Gemini به Waze، امکان گزارش حوادث جاده‌ای و جست‌وجوی مقاصد را از طریق دستورات صوتی طبیعی فراهم کرد. این به‌روزرسانی شامل حالت اختصاصی برای موتورسیکلت‌ها و…

۲ دقیقه خواندن۱
لایه هوش سلامت عمومی از داده‌های نویزی سنسورهای پوشیدنی با SensorFM گوگل

مدل بنیادی SensorFM در برابر مدل‌های نظارت‌شده در پیش‌بینی فیزیولوژیک

گوگل پژوهشی مدل بنیادی SensorFM را معرفی کرد که داده‌های پراکنده حسگرهای پوشیدنی را به لایه هوشمند سلامت تبدیل می‌کند. این مدل با آموزش روی داده‌های ۵ میلیون کاربر، در تقریباً…

۵ دقیقه خواندن
نمودار فرآیند استخراج متن از فایل PDF، از دریافت فایل تا خروجی ساختاریافته
آموزش کاربردی

استخراج متنی در برابر بینایی-زبانی؛ راهکار رفع توهمات RAG در PDF

بسیاری از ابزارهای استخراج متن از PDF، داده‌های مختصاتی را حذف می‌کنند و باعث می‌شوند مدل‌های زبانی در ارجاع به صفحات دچار توهم شوند. برای حل این مشکل، رویکردی ترکیبی از استخراج…

۸ دقیقه خواندن
هنگامی که یک ایده بصری خام به نسخه متحرک اولیه نیاز دارد، Hailuo AI کاربردی است.
آموزش کاربردی

Hailuo AI ایده‌های بصری را به پیش‌نویس‌های ویدئویی سریع تبدیل می‌کند

ابزار Hailuo AI امکان تبدیل پرامپت‌های ساده یا تصاویر به آزمایش‌های بصری کوتاه را فراهم می‌کند. این سرویس به عنوان یک دفترچه طراحی دیجیتال برای تست اتمسفر و قلاب‌های ویدئویی پیش…

۲ دقیقه خواندن
آموزش و استفاده از LoRA سفارشی بدون نیاز به GPU محلی
آموزش کاربردی

«تولید تصویر و ویدیو»؛ یکپارچه‌سازی زنجیره آموزش در پلتفرم LoRA AI

پلتفرم LoRA AI فرآیند آموزش مدل‌های انطباق کم‌رتبه را به‌طور کامل به مرورگر منتقل کرد. این ابزار نیاز به نصب CUDA یا داشتن GPUهای قدرتمند محلی را حذف کرده و زنجیره تولید تصویر و…

۱۱ دقیقه خواندن۴
شبیه‌ساز مصاحبه صوتی دوطرفه با هوش مصنوعی برای توسعه‌دهندگان
آموزش کاربردی

مکالمات صوتی در برابر متون استاتیک در شبیه‌ساز مصاحبهٔ DevPrep

ابزار جدید DevPrep با جایگزینی متون استاتیک با مکالمات صوتی دوطرفه، محیط واقعی مصاحبه‌های شغلی را شبیه‌سازی می‌کند. این پلتفرم بر کاهش فاصله میان دانش تئوری و توانایی بیان شفاهی…

۱ دقیقه خواندن