پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۳۴۷ مقاله منتشر شده

کامپایلر پرامپت مبتنی بر اسلات پایتون: پایان دادن به نوشتن جملات برای تصاویر
آموزش کاربردی

معماری «اسلات» جایگزین پرامپت‌های متنی برای تولید مجموعه‌های تصویری سازگار شد

نوشتن توصیفات متنی بلند باعث نتایج پیش‌بینی‌ناپذیر می‌شود چون مدل‌ها توکن‌ها را به دستور زبان ترجیح می‌دهند. استفاده از یک کامپایلر پایتونی برای تبدیل پرامپت‌ها به داده‌های…

۷ دقیقه خواندن۱
استارتاپ تولید ویدیوی PixVerse ۴۳۹ میلیون دلار جذب سرمایه کرد؛ ارزش‌گذاری از ۲ میلیارد دلار گذشت | تک‌کرانچ

جذب سرمایه ۴۳۹ میلیون دلاری PixVerse؛ ارزش این استارتاپ ویدیو به ۲ میلیارد دلار

شرکت PixVerse با جذب ۴۳۹ میلیون دلار در مرحلهی تکمیلی سری C، ارزش بازار خود را به ۲ میلیارد دلار رساند. این استارتاپ سنگاپوری اکنون در رقابت مستقیم با غول‌هایی چون OpenAI و…

۳ دقیقه خواندن
تقطیر دانش بین‌مدالی برای احیای زبان میراثی با تأیید شبیه‌سازی معکوس
آموزش کاربردی

شبیه‌سازی معکوس؛ راهکاری برای نجات زبان‌های در حال فراموشی با هوش مصنوعی

یک چارچوب جدید با ترکیب تقطیر دانش چندوجهی و شبیه‌سازی معکوس، برای حفظ زبان‌های در معرض خطر طراحی شده است. این سیستم با بازسازی خروجی‌های مدل معلم از طریق بردارهای معنایی مدل…

۷ دقیقه خواندن
نسخه‌های بتا عمومی iOS 27، macOS 27 و سایر پلتفرم‌های اپل منتشر شد

هوش مصنوعی زاینده چگونه عملکرد سیری را در iOS 27 تغییر می‌دهد؟

اپل نسخه‌های بتای عمومی iOS 27 و macOS 27 را با تمرکز بر تبدیل سیری به یک دستیار هوش مصنوعی زاینده عرضه کرد. این به‌روزرسانی علاوه بر قابلیت‌های هوشمند، جهش‌های چشم‌گیری در سرعت…

۴ دقیقه خواندن
ابزار خط فرمان برای تبدیل ویدیوی آموزش گیتار یوتیوب به تبلچر PDF
آموزش کاربردی

تبدیل ویدئوهای آموزشی گیتار به PDF با ترکیب Claude Vision و ابزارهای CLI

یک ابزار متن‌باز جدید با بهره‌گیری از قابلیت‌های بینایی مدل Claude، درس‌های گیتار یوتیوب را به نت‌های PDF تبدیل می‌کند. این ابزار با شناسایی دقیق میزان‌های موسیقی و حذف فریم‌های…

۳ دقیقه خواندن
ساخت سیستم چندعاملی ویرایش ویدیو: تحلیل هدف، برنامه‌ریزی گرافی و مسیریابی ابزار
آموزش کاربردی

«ترمیم خودکار خطاها»؛ قابلیت کلیدی VideoAgent در مدیریت گراف‌های تدوین

سامانه VideoAgent با استفاده از یک بهینه‌ساز منحصر‌به‌فرد، دستورات متنی را به گراف‌های اجرایی برای ابزارهای تدوین تبدیل می‌کند. این سیستم می‌تواند خطاهای ساختاری در زنجیره تولید…

۲۳ دقیقه خواندن
بیلی باس: دستیار صوتی هوشمند با Raspberry Pi 5 و Amazon Nova 2 Sonic
آموزش کاربردی

«لب‌خوانی واقع‌گرایانه»؛ دستاورد جدید ترکیب هوش مصنوعی و سخت‌افزار رزبری‌پای

یک پروژه متن‌باز با استفاده از مدل Amazon Nova 2 Sonic و رزبری‌پای ۵، اسباب‌بازی ماهی Billy Bass را به یک دستیار صوتی با تأخیر بسیار کم تبدیل کرده است. این سامانه با تحلیل لحظه‌ای…

۲۳ دقیقه خواندن۱
ویز با قابلیت‌های جدید هوش مصنوعی به‌روز می‌شود

۳ قابلیت جدید Waze بر پایه هوش مصنوعی برای رانندگان و موتورسواران

گوگل با آوردن هوش مصنوعی Gemini به Waze، امکان گزارش حوادث جاده‌ای و جست‌وجوی مقاصد را از طریق دستورات صوتی طبیعی فراهم کرد. این به‌روزرسانی شامل حالت اختصاصی برای موتورسیکلت‌ها و…

۲ دقیقه خواندن۱
لایه هوش سلامت عمومی از داده‌های نویزی سنسورهای پوشیدنی با SensorFM گوگل

مدل بنیادی SensorFM در برابر مدل‌های نظارت‌شده در پیش‌بینی فیزیولوژیک

گوگل پژوهشی مدل بنیادی SensorFM را معرفی کرد که داده‌های پراکنده حسگرهای پوشیدنی را به لایه هوشمند سلامت تبدیل می‌کند. این مدل با آموزش روی داده‌های ۵ میلیون کاربر، در تقریباً…

۵ دقیقه خواندن
نمودار فرآیند استخراج متن از فایل PDF، از دریافت فایل تا خروجی ساختاریافته
آموزش کاربردی

استخراج متنی در برابر بینایی-زبانی؛ راهکار رفع توهمات RAG در PDF

بسیاری از ابزارهای استخراج متن از PDF، داده‌های مختصاتی را حذف می‌کنند و باعث می‌شوند مدل‌های زبانی در ارجاع به صفحات دچار توهم شوند. برای حل این مشکل، رویکردی ترکیبی از استخراج…

۸ دقیقه خواندن