پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۴۲۵ مقاله منتشر شده

سیستم OCR نامحدود بaidu صفحات متعدد را با الگوبرداری از فراموشی انسانی پردازش می‌کند.

Baidu با مکانیزم پنجرهٔ لغزان مصرف حافظه در OCR را به مقدار ثابت رساند

سامانه Unlimited OCR با شبیه‌سازی فرآیند فراموشی انسانی، محدودیت حافظه در پردازش اسناد طولانی را از بین برد. این مدل با ثابت نگه داشتن حجم KV Cache، تأخیری یکسان و توان عملیاتی…

۵ دقیقه خواندن۲
هالیوود خواستار ممنوعیت سیدنس است و گزارش شده همچنان می‌خواهد از آن استفاده کند

«بهترین ابزار بازار»؛ نفوذ Seedance به استودیوهای هالیوود علی‌رغم ممنوعیت

بایت‌دنس ابزار تولید ویدیو Seedance را علی‌رغم مخالفت رسمی استودیوها به قلب صنعت سینما وارد کرده است. در حالی که MPA خواستار ممنوعیت این ابزار است، سازندگان فیلم به‌طور مخفیانه از…

۱ دقیقه خواندن۱
فقط این مدل‌های آیفون امسال پاییز سیری هوشمند جدید را دریافت می‌کنند

محدودیت سخت‌افزاری اپل؛ سیری جدید تنها برای مدل‌های منتخب آیفون

اپل با معرفی iOS 27، دستیار سیری را به یک مدل زبانی بزرگ تبدیل می‌کند، اما دسترسی به این قابلیت‌ها را به دستگاه‌های دارای Apple Intelligence محدود کرده است. کاربران آیفون ۱۵ پرو و…

۳ دقیقه خواندن
شماره ۴۸ خبرنامه هوش مصنوعی فیزیکی فیوچرایکس — ۱۶ اردیبهشت ۱۴۰۴

«گسترش به میامی»؛ گام جدید تسلا در تجاری‌سازی تاکسی‌های بدون راننده

تسلا سرویس Robotaxi را به میامی گسترش داد و اکنون در پنج شهر آمریکا فعالیت می‌کند. این حرکت تجاری هم‌زمان با پیشرفت‌های NVIDIA در شبیه‌سازی محیطی و معرفی استانداردهای اخلاقی…

۱۳ دقیقه خواندن۲
چارچوب خودبهبود رباتیک ASPIRE انویدیا: ۳۱٪ دقت بدون آموزش در وظایف پیچیده LIBERO-Pro

موفقیت ۳۱ درصدی ASPIRE در اجرای تکالیف پیچیده روباتیک

انویدیا با معرفی چارچوب ASPIRE، امکان نوشتن، عیب‌یابی و ذخیره‌سازی برنامه‌های کنترلی را برای روبات‌ها فراهم کرد. این سیستم با تبدیل شکست‌ها به مهارت‌های قابل بازگشت، نرخ موفقیت در…

۵ دقیقه خواندن
شناسایی حشرات با هوش مصنوعی از روی یک عکس
آموزش کاربردی

یک عکس کافی است؛ ابزار شناسایی حشرات با هوش مصنوعی منتشر شد

یک توسعه‌دهنده ابزاری مبتنی بر هوش مصنوعی برای شناسایی سریع حشرات و عنکبوت‌ها تنها از طریق یک عکس طراحی کرده است. این پروژه نشان می‌دهد که موفقیت یک محصول AI در گرو تعادل میان دقت…

۲ دقیقه خواندن
داشبورد اولین برداشت هوش مصنوعی با ChatGPT
آموزش کاربردی

گزارش فنی: استخراج داده‌های بصری از سلفی‌ها در قالب داشبوردهای تحلیلی

یک تکنیک جدید در مهندسی پرامپت به ChatGPT اجازه می‌دهد تا با تحلیل سلفی‌ها، گزارش‌های بصری دقیقی از «برداشت اول» افراد تولید کند. این فرآیند عکس‌های ساده را به داشبوردهای تحلیلی…

۲ دقیقه خواندن
کاهش مصرف توکن Fable 5 با رندر کردن متن به‌صورت تصویر
آموزش کاربردی

«جایگزینی متن با تصویر»؛ راهبرد pxpipe برای بهینه‌سازی توکن‌ها

پراکسی محلی جدیدی به نام pxpipe با تبدیل متون حجیم به تصاویر، هزینه‌های ورودی مدل‌های Claude را به‌شدت کاهش می‌دهد. این روش از هزینه ثابت توکن‌های تصویری برای انتقال حجم زیادی از…

۱۰ دقیقه خواندن۲
تصویر: اسکن سونوگرافی کامل بدن تولیدشده توسط هوش مصنوعی Midjourney Medical

پشت‌پرده‌ اسکنر پزشکی Midjourney: سخت‌افزارهای دست‌ساز و فقدان اثبات علمی

شرکت Midjourney از پیش‌نمونه اسکنر سونوگرافی خود رونمایی کرد که از قطعات دست‌ساز و سخت‌افزارهای مصرفی ساخته شده است. با وجود نمایش‌های تبلیغاتی، این شرکت هنوز هیچ مدرک علمی برای…

۲ دقیقه خواندن