پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۸۷۷ مقاله منتشر شده

کلید API اوپن‌ای‌ای رایگان است، اما استفاده از آن رایگان نیست.

هزینه‌ی پنهان پرگویی؛ چرا قیمت ارزان توکن‌های Kimi K3 گمراه‌کننده است؟

مدل Kimi K3 با ۲.۸ تریلیون پارامتر و پنجره زمینه یک میلیون توکنی معرفی شد، اما تمایل شدید به تولید پاسخ‌های طولانی (Verbosity) ممکن است هزینه‌ی نهایی هر تسک را دو برابر کند. در…

۸ دقیقه خواندن
گروهی از فعالان با تبلیغات جعلی عینک متا ایستگاه‌های اتوبوس لندن را تسخیر کردند

حریم خصوصی در برابر نظارت؛ تقابل فعالان لندن با سخت‌افزار پوشیدنی متا

گروهی از فعالان حریم خصوصی با استفاده از تبلیغات شهری در لندن، عینک‌های هوشمند متا را به ابزاری برای نظارت دیس‌توپیک تشبیه کردند. این کمپین بر ثبت مداوم صدا و تصویر بدون رضایت…

۲ دقیقه خواندن
درگاه صوتی: الگوی تولید برای هوش مصنوعی صدای بلادرنگ
آموزش کاربردی

درون الگوی Audio Gateway؛ تفکیک رسانه از کسب‌وکار برای روانی صدا

یک الگوی معماری جدید، هوش مصنوعی صوتی را به دو بخش «صفحه رسانه» برای پردازش آنی و «صفحه کسب‌وکار» برای استدلال تقسیم می‌کند. این جداسازی مانع از آن می‌شود که فراخوانی‌های کند…

۱۶ دقیقه خواندن
هزاران توکن هوش مصنوعی سوزاندم. بعد یک دوست رایگان انجامش داد.
زندگی با AI

خلاقیت نمادین در برابر مدل‌های زایشی: شکافی که با پردازش پر نمی‌شود

تلاش یک برنامه‌نویس برای طراحی لوگویی با محدودیت‌های معنایی دقیق، شکست تمام مدل‌های تراز اول هوش مصنوعی را به نمایش گذاشت. این تجربه نشان می‌دهد که طراحی نمادین همچنان نیازمند…

۵ دقیقه خواندن
بررسی خط زمانی: تاریخ‌گذاری خودکار عکس‌های اسکن‌شده خانوادگی
زندگی با AI

Timeline Scan تاریخ ثبت عکس‌های قدیمی را از روی محتوا بازسازی می‌کند

ابزار Timeline Scan با تحلیل سرنخ‌های بصری و متنی، تاریخ واقعی عکس‌های اسکن‌شده را جایگزین تاریخ روز اسکن می‌کند. این سیستم با اصلاح متادیتای فایل‌ها، سازمان‌دهی خودکار خاطرات در…

۳ دقیقه خواندن
تحلیل هوش، عملکرد و قیمت کیمی K3

Kimi K3: مدل استدلالی جدید با امتیاز ۵۷ در شاخص هوشمند Artificial Analysis

مدل K3 با ۲.۸ تریلیون پارامتر و پنجره متنی یک میلیون توکنی معرفی شد. این مدل در زمینه هوش استدلالی به‌طور قابل‌توجهی از میانگین مدل‌های هم‌رده پیشی گرفته، اما در سرعت تولید خروجی…

۲ دقیقه خواندن
هوش مصنوعی چندوجهی برای توسعه‌دهندگان: یکپارچه‌سازی متن، تصویر و صدا
آموزش کاربردی

تلفیق متن، تصویر و صدا در مدل‌های چندوجهی؛ تغییری در استراتژی توسعه‌دهندگان

هوش مصنوعی در حال گذار از پردازش تک‌بعدی به مدل‌های unified است که هم‌زمان متن، تصویر و صدا را تحلیل می‌کنند. این ادغام امکان درک عمیق‌تر بستر و استدلال‌های انسانی‌تر را در…

۲ دقیقه خواندن
رباتیکس قابلیت ساخت بازی با هوش مصنوعی را در اپلیکیشن موبایل خود راه‌اندازی کرد

«دنیای سه‌بعدی بدون کدنویسی»؛ قابلیت جدید پلتفرم Roblox برای سازندگان

شرکت Roblox ابزار جدیدی به نام Build معرفی کرد که محیط‌های سه‌بعدی و بازی‌های موبایلی را تنها با دستورات متنی می‌سازد. این پلتفرم برای جلوگیری از تولید انبوه محتوای بی‌کیفیت،…

۳ دقیقه خواندن