پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۴۱۸ مقاله منتشر شده

چرا توکنایزر جدید Claude Opus 4.7 هزینه‌های عملیاتی را ۳۵٪ افزایش می‌دهد؟
آموزش کاربردی

چرا توکنایزر جدید Claude Opus 4.7 هزینه‌های عملیاتی را ۳۵٪ افزایش می‌دهد؟

آنتروپیک مدل Claude Opus 4.7 را با تمرکز بر کنترل دقیق عامل‌های خودکار و بینایی با رزولوشن بالا معرفی کرد. با وجود ثابت ماندن قیمت هر توکن، تغییر در توکنایزر باعث افزایش هزینه‌های…

۲ دقیقه خواندن
چرا Wispr Flow برای تسخیر بازار هند، درآمد را فدای حجم داده می‌کند؟

چرا Wispr Flow برای تسخیر بازار هند، درآمد را فدای حجم داده می‌کند؟

استارتاپ Wispr Flow با عرضه مدل صوتی مخصوص «هینگلیش» و کاهش شدید قیمت‌ها، رشد ماهانه ۱۰۰ درصدی را در هند تجربه کرده است. این شرکت در تلاش است تا با پذیرش حجم بالای کاربر در برابر…

۲ دقیقه خواندن۱
راز ۴ مگابایتی Anodos برای غلبه بر هرج‌ومرج صوتی در کارگاه‌های ساختمانی
آموزش کاربردی

راز ۴ مگابایتی Anodos برای غلبه بر هرج‌ومرج صوتی در کارگاه‌های ساختمانی

شرکت Anodos با طراحی یک خط لوله صوتی تخصصی، مشکل ثبت یادداشت در محیط‌های پرصدا را حل کرد. آن‌ها با اولویت دادن به سرعت پاسخ‌دهی و لایه‌های اصلاحی کوچک به جای مدل‌های غول‌پیکر،…

۳ دقیقه خواندن
راز دوربین‌های کم‌کیفیت اپل؛ Siri قرار است دنیا را ببیند

راز دوربین‌های کم‌کیفیت اپل؛ Siri قرار است دنیا را ببیند

اپل در حال آزمایش ایرپادهایی با دوربین‌های داخلی است که به جای عکاسی، به Siri قدرت بینایی می‌بخشند. این گجت‌ها که احتمالاً در سپتامبر ۲۰۲۶ عرضه می‌شوند، نقطه عطفی در تبدیل هوش…

۳ دقیقه خواندن۱
خطای هندسی پنهانی که دقت مدل‌های چندوجهی شما را می‌کشد

خطای هندسی پنهانی که دقت مدل‌های چندوجهی شما را می‌کشد

پژوهشگران با معرفی روش DP-FM، مشکل اعوجاج‌های هندسی در تطبیق مدل‌های بینایی-زبانی را حل کردند. این متد با جداسازی دینامیک‌های شعاعی و زاویه‌ای، رکورد جدیدی در ۱۱ بنچمارک مختلف ثبت…

۲ دقیقه خواندن۲
داده‌های جدید Arxiv: مدل DART دقت بازرسی کابل‌ها را ۳۸٪ جهش داد

داده‌های جدید Arxiv: مدل DART دقت بازرسی کابل‌ها را ۳۸٪ جهش داد

مدل DART با ترکیب بینایی و زبان، بازرسی کابل‌های صنعتی را خودکار کرده و دقت تشخیص آسیب را به شکل چشم‌گیری افزایش داده است. این سیستم بدون نیاز به تنظیم دقیق، شدت آسیب را تخمین زده…

۲ دقیقه خواندن۳
پایان تبعیض نژادی در تشخیص گلوکوم؛ رمزگشایی از مدل FairEnc

پایان تبعیض نژادی در تشخیص گلوکوم؛ رمزگشایی از مدل FairEnc

پژوهشگران با معرفی مدل FairEnc توانستند سوگیری‌های نژادی و جنسیتی را از سیستم‌های تشخیص بیماری گلوکوم حذف کنند. این مدل چندوجهی با استفاده از داده‌های مصنوعی و یادگیری تقابلی، دقت…

۲ دقیقه خواندن۲
فریب خوردن انسان‌ها؛ حقیقت تکان‌دهنده درباره‌ی تشخیص جعل عمیق

فریب خوردن انسان‌ها؛ حقیقت تکان‌دهنده درباره‌ی تشخیص جعل عمیق

انسان‌ها در شناسایی جعل‌های عمیق پیشرفته، به‌ویژه مدل‌های ترکیبی صوتی-تصویری، به‌شدت ناتوان هستند. این مطالعه نشان می‌دهد که تکیه بر شهود انسانی برای تشخیص محتوای دست‌کاری‌شده…

۲ دقیقه خواندن۱
تثبیت هویت بصری در ویدیو؛ FaithfulFaces چگونه دگرگونی چهره را متوقف کرد

تثبیت هویت بصری در ویدیو؛ FaithfulFaces چگونه دگرگونی چهره را متوقف کرد

پژوهشگران با معرفی FaithfulFaces، مشکل تغییر ناگهانی چهره در ویدیوهای تولید شده توسط هوش مصنوعی را حل کردند. این سیستم با استفاده از بردار معنایی زوایای اویلر، ثبات چهره را حتی در…

۲ دقیقه خواندن۱