پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۳۳۶ مقاله منتشر شده

گزارش Palisade: سرعت تکثیر عامل‌های هوش مصنوعی از آمریکا تا هند در ۵۰ دقیقه

گزارش Palisade: سرعت تکثیر عامل‌های هوش مصنوعی از آمریکا تا هند در ۵۰ دقیقه

هوش مصنوعی از یک ابزار کمکی به عامل‌های خودکاری تبدیل شده که قادر به تکثیر سریع و حتی بازنویسی درایورهای سیستم هستند. این تحول، معماری مراکز داده را به سمتی می‌برد که در آن…

۳ دقیقه خواندن۱
Interfaze: پیروزی معماری ترکیبی در ۹ بنچمارک قطعی در برابر Gemini-3-Flash

Interfaze: پیروزی معماری ترکیبی در ۹ بنچمارک قطعی در برابر Gemini-3-Flash

Interfaze یک معماری ترکیبی جدید است که دقت شبکه‌های عصبی قدیمی را با انعطاف‌پذیری ترنسفورمرها ادغام کرده است. این مدل در وظایف قطعی مانند OCR و تبدیل گفتار به متن، مدل‌های Mini…

۲ دقیقه خواندن۱
چرا توکنایزر جدید Claude Opus 4.7 هزینه‌های عملیاتی را ۳۵٪ افزایش می‌دهد؟
آموزش کاربردی

چرا توکنایزر جدید Claude Opus 4.7 هزینه‌های عملیاتی را ۳۵٪ افزایش می‌دهد؟

آنتروپیک مدل Claude Opus 4.7 را با تمرکز بر کنترل دقیق عامل‌های خودکار و بینایی با رزولوشن بالا معرفی کرد. با وجود ثابت ماندن قیمت هر توکن، تغییر در توکنایزر باعث افزایش هزینه‌های…

۲ دقیقه خواندن
چرا Wispr Flow برای تسخیر بازار هند، درآمد را فدای حجم داده می‌کند؟

چرا Wispr Flow برای تسخیر بازار هند، درآمد را فدای حجم داده می‌کند؟

استارتاپ Wispr Flow با عرضه مدل صوتی مخصوص «هینگلیش» و کاهش شدید قیمت‌ها، رشد ماهانه ۱۰۰ درصدی را در هند تجربه کرده است. این شرکت در تلاش است تا با پذیرش حجم بالای کاربر در برابر…

۲ دقیقه خواندن
راز ۴ مگابایتی Anodos برای غلبه بر هرج‌ومرج صوتی در کارگاه‌های ساختمانی
آموزش کاربردی

راز ۴ مگابایتی Anodos برای غلبه بر هرج‌ومرج صوتی در کارگاه‌های ساختمانی

شرکت Anodos با طراحی یک خط لوله صوتی تخصصی، مشکل ثبت یادداشت در محیط‌های پرصدا را حل کرد. آن‌ها با اولویت دادن به سرعت پاسخ‌دهی و لایه‌های اصلاحی کوچک به جای مدل‌های غول‌پیکر،…

۳ دقیقه خواندن
راز دوربین‌های کم‌کیفیت اپل؛ Siri قرار است دنیا را ببیند

راز دوربین‌های کم‌کیفیت اپل؛ Siri قرار است دنیا را ببیند

اپل در حال آزمایش ایرپادهایی با دوربین‌های داخلی است که به جای عکاسی، به Siri قدرت بینایی می‌بخشند. این گجت‌ها که احتمالاً در سپتامبر ۲۰۲۶ عرضه می‌شوند، نقطه عطفی در تبدیل هوش…

۳ دقیقه خواندن۱
خطای هندسی پنهانی که دقت مدل‌های چندوجهی شما را می‌کشد

خطای هندسی پنهانی که دقت مدل‌های چندوجهی شما را می‌کشد

پژوهشگران با معرفی روش DP-FM، مشکل اعوجاج‌های هندسی در تطبیق مدل‌های بینایی-زبانی را حل کردند. این متد با جداسازی دینامیک‌های شعاعی و زاویه‌ای، رکورد جدیدی در ۱۱ بنچمارک مختلف ثبت…

۲ دقیقه خواندن۱
داده‌های جدید Arxiv: مدل DART دقت بازرسی کابل‌ها را ۳۸٪ جهش داد

داده‌های جدید Arxiv: مدل DART دقت بازرسی کابل‌ها را ۳۸٪ جهش داد

مدل DART با ترکیب بینایی و زبان، بازرسی کابل‌های صنعتی را خودکار کرده و دقت تشخیص آسیب را به شکل چشم‌گیری افزایش داده است. این سیستم بدون نیاز به تنظیم دقیق، شدت آسیب را تخمین زده…

۲ دقیقه خواندن
پایان تبعیض نژادی در تشخیص گلوکوم؛ رمزگشایی از مدل FairEnc

پایان تبعیض نژادی در تشخیص گلوکوم؛ رمزگشایی از مدل FairEnc

پژوهشگران با معرفی مدل FairEnc توانستند سوگیری‌های نژادی و جنسیتی را از سیستم‌های تشخیص بیماری گلوکوم حذف کنند. این مدل چندوجهی با استفاده از داده‌های مصنوعی و یادگیری تقابلی، دقت…

۲ دقیقه خواندن۱