پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۳۴۷ مقاله منتشر شده

چارچوب خودبهبود رباتیک ASPIRE انویدیا: ۳۱٪ دقت بدون آموزش در وظایف پیچیده LIBERO-Pro

موفقیت ۳۱ درصدی ASPIRE در اجرای تکالیف پیچیده روباتیک

انویدیا با معرفی چارچوب ASPIRE، امکان نوشتن، عیب‌یابی و ذخیره‌سازی برنامه‌های کنترلی را برای روبات‌ها فراهم کرد. این سیستم با تبدیل شکست‌ها به مهارت‌های قابل بازگشت، نرخ موفقیت در…

۵ دقیقه خواندن
شناسایی حشرات با هوش مصنوعی از روی یک عکس
آموزش کاربردی

یک عکس کافی است؛ ابزار شناسایی حشرات با هوش مصنوعی منتشر شد

یک توسعه‌دهنده ابزاری مبتنی بر هوش مصنوعی برای شناسایی سریع حشرات و عنکبوت‌ها تنها از طریق یک عکس طراحی کرده است. این پروژه نشان می‌دهد که موفقیت یک محصول AI در گرو تعادل میان دقت…

۲ دقیقه خواندن
داشبورد اولین برداشت هوش مصنوعی با ChatGPT
آموزش کاربردی

گزارش فنی: استخراج داده‌های بصری از سلفی‌ها در قالب داشبوردهای تحلیلی

یک تکنیک جدید در مهندسی پرامپت به ChatGPT اجازه می‌دهد تا با تحلیل سلفی‌ها، گزارش‌های بصری دقیقی از «برداشت اول» افراد تولید کند. این فرآیند عکس‌های ساده را به داشبوردهای تحلیلی…

۲ دقیقه خواندن
کاهش مصرف توکن Fable 5 با رندر کردن متن به‌صورت تصویر
آموزش کاربردی

«جایگزینی متن با تصویر»؛ راهبرد pxpipe برای بهینه‌سازی توکن‌ها

پراکسی محلی جدیدی به نام pxpipe با تبدیل متون حجیم به تصاویر، هزینه‌های ورودی مدل‌های Claude را به‌شدت کاهش می‌دهد. این روش از هزینه ثابت توکن‌های تصویری برای انتقال حجم زیادی از…

۱۰ دقیقه خواندن۲
تصویر: اسکن سونوگرافی کامل بدن تولیدشده توسط هوش مصنوعی Midjourney Medical

پشت‌پرده‌ اسکنر پزشکی Midjourney: سخت‌افزارهای دست‌ساز و فقدان اثبات علمی

شرکت Midjourney از پیش‌نمونه اسکنر سونوگرافی خود رونمایی کرد که از قطعات دست‌ساز و سخت‌افزارهای مصرفی ساخته شده است. با وجود نمایش‌های تبلیغاتی، این شرکت هنوز هیچ مدرک علمی برای…

۲ دقیقه خواندن
مرکز داده هوش مصنوعی انویدیا با دمای بالاتر، مصرف انرژی کمتر

طراحی جدید روبین انویدیا مصرف آب مراکز داده را کاهش می‌دهد

انویدیا با معرفی معماری روبین، استراتژی خنک‌سازی مراکز داده را تغییر داد تا با افزایش دمای عملیاتی، مصرف آب را به‌شدت کاهش دهد. این اقدام پاسخ مستقیم شرکت به فشارهای محیط‌زیستی و…

۵ دقیقه خواندن
سازنده ویدیوی هوش مصنوعی چینی کلینگ ۲ میلیارد دلار جذب سرمایه کرد

Kling: جذب ۲ میلیارد دلار پیش از ورود به بازار سرمایه هنگ‌کنگ

بخش هوش مصنوعی ویدئویی شرکت کوایشو (Kuaishou) با جذب سرمایه‌ای کلان، اکنون آماده عرضه اولیه در بورس هنگ‌کنگ است. این حرکت نشان می‌دهد چین از مرحله توسعه مدل‌ها به سمت تجاری‌سازی…

۱ دقیقه خواندن
چرا اشتراک ۵ ابزار هوش مصنوعی را لغو کردم و از یک ابزار استفاده می‌کنم
زندگی با AI

جایگزینی اشتراکات ماهانه با مدل اعتباری؛ کاهش هزینه‌های AI از ۱۲۰ دلار به

یک تولیدکننده محتوا با تجمیع پنج اشتراک مختلف در یک فضای کاری اعتباری، هزینه‌های ماهانه خود را از ۱۲۰ دلار به مدل پرداخت به‌ازای مصرف تغییر داد. این تغییر علاوه بر حذف هزینه‌های…

۲ دقیقه خواندن۲
گیت‌هاب - ابزار محلی برای تحلیل ویدیو با کلود: استخراج فریم‌های کلیدی و رونوشت، از URL یا فایل محلی، مجوز MIT.
آموزش کاربردی

حذف فریم‌های تکراری؛ راهکار claude-real-video برای تماشای ویدیو توسط مدل‌های

ابزار متن‌باز جدیدی عرضه شده است که به مدل‌های زبانی اجازه می‌دهد به‌جای نمونه‌برداری خشک از فریم‌ها، تنها تغییرات معنا‌دار صحنه را «ببینند». این سیستم با اجرای محلی و حذف…

۴ دقیقه خواندن
اپلیکیشن بازی‌سازی «پاکت» با قابلیت کدنویسی هوشمند، بدون خبررسانی رسمی راه‌اندازی شد | تک‌کرانچ

Gizmo: زیرساختی برای تبدیل پرامپت به بازی‌های تعاملی در اپلیکیشن Pocket

متا اپلیکیشن Pocket را برای ساخت بازی‌های تعاملی و برنامه‌های کوچک با استفاده از هوش مصنوعی زاینده عرضه کرد. این ابزار که بر پایه فناوری Gizmo ساخته شده، فاصله بین ایده و اجرای یک…

۲ دقیقه خواندن