پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۸۶۶ مقاله منتشر شده

چرا در سال ۲۰۲۶، کارایی عامل‌ها مهم‌تر از هوش مدل‌های زبانی است؟
آموزش کاربردی

چرا در سال ۲۰۲۶، کارایی عامل‌ها مهم‌تر از هوش مدل‌های زبانی است؟

با رسیدن مدل‌های پیش‌رو به سطح یکسانی از هوش، انتخاب بین Claude 4.7 و GPT-5.5 اکنون به قابلیت‌های «عامل‌محور» آن‌ها بستگی دارد. Claude بازار برنامه‌نویسی سازمانی را تصاحب کرده، در…

۳ دقیقه خواندن
Zerox در برابر Tesseract: وقتی بینایی مدل‌های زبانی جایگزین تشخیص کاراکتر می‌شود
آموزش کاربردی

Zerox در برابر Tesseract: وقتی بینایی مدل‌های زبانی جایگزین تشخیص کاراکتر می‌شود

ابزار جدید Zerox با استفاده از مدل‌های بینایی مانند GPT-4o، جایگزین OCRهای سنتی شده است تا جداول پیچیده و دست‌خط‌ها را بدون خطا به مارک‌داون تبدیل کند. این ابزار به جای خواندن…

۲ دقیقه خواندن
چرا گوگل و سامسونگ برای موفقیت عینک‌های هوشمند به صنعت مد تکیه کردند؟

چرا گوگل و سامسونگ برای موفقیت عینک‌های هوشمند به صنعت مد تکیه کردند؟

گوگل و سامسونگ در ۲۰ مه ۲۰۲۶ از عینک‌های هوشمند مبتنی بر Android XR رونمایی کردند. این سخت‌افزارها که پاییز ۲۰۲۶ عرضه می‌شوند، هدفشان انتقال هوش مصنوعی از نمایشگرها به تجربه‌ای…

۲ دقیقه خواندن
AI

سازوکار REST3D برای تضمین پایداری فیزیکی در بازسازی سه‌بعدی از تک‌تصویر

پژوهشگران دانشگاه کارنگی ملون با معرفی REST3D، مشکل اشیاء شناور و تداخل فیزیکی در تبدیل تصاویر به محیط‌های سه‌بعدی را حل کردند. این چارچوب با استفاده از «درخت صحنه» و بهینه‌سازی…

۲ دقیقه خواندن
AI

سازوکار Gemma 4 برای اجرای مدل‌های چندوجهی روی لپ‌تاپ با ۱۶ گیگابایت رم

گوگل مدل Gemma 4 12B را منتشر کرد؛ مدل چندوجهی میان‌اندازه‌ای که بدون نیاز به انکودرهای مجزا، صدا و تصویر را پردازش می‌کند. این مدل با مجوز آپاچی ۲.۰، برای اجرا روی سخت‌افزارهای…

۳ دقیقه خواندن
AI

چرا آمازون تصاویر جعلی را به نتایج جست‌وجوی کاربران اضافه می‌کند؟

آمازون برای کمک به خریدارانی که نام دقیق استایل مورد نظر خود را نمی‌دانند، از تصاویر تولیدشده با هوش مصنوعی در جست‌وجوها استفاده می‌کند. این ابزار کاربر را به سمت محصولات واقعی…

۲ دقیقه خواندن
AI

سازوکار AethexAI برای حذف تأخیر صوتی با تکیه بر مدل‌های زبانی کوچک

استارت‌آپ AethexAI با جذب ۳ میلیون دلار سرمایه، مدل‌های صوتی تخصصی برای بازارهای آفریقا و خاورمیانه توسعه داد. این شرکت با جایگزینی مدل‌های غول‌پیکر با مدل‌های کوچک، تأخیر در…

۲ دقیقه خواندن
AI

از تک‌دارایی به خط تولید: سازوکار گوگل برای خودکارسازی بصری I/O 2026

گوگل فاش کرد که چگونه با ابزارهای آزمایشی Nano Banana و Gemini Omni، تمام هویت بصری و تجربیات تعاملی I/O 2026 را خودکار کرده است. این رویکرد، کارهای تکراری تولید را حذف می‌کند تا…

۳ دقیقه خواندن