پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۳۵۶ مقاله منتشر شده

جلسات حضوری را با Google Meet یادداشت‌برداری کنید

گوگل قابلیت یادداشت‌برداری Gemini را به جلسات حضوری آورد

گوگل قابلیت ثبت خودکار جلسات را از تماس‌های مجازی به محیط‌های فیزیکی گسترش داد. این ویژگی با استفاده از Gemini، خلاصه‌های ساختاریافته و متن کامل گفتگوها را مستقیماً در گوگل داکس…

۲ دقیقه خواندن۳
لوگوی کیوئن (Qwen) در کنار نام کاربری @Alibaba_Qwen در شبکه اجتماعی ایکس (X)

سری Qwen3.8: عرضه مدل‌های ۲۷ میلیاردی برای استقرار محلی هوش مصنوعی

علی‌بابا با انتشار سری Qwen3.8، مدل‌های چندوجهی بسیار کارآمد ۲۷ میلیاردی و یک نسخه غول‌پیکر ۲.۴ تریلیون پارامتری را در دسترس قرار داد. این مدل‌ها با مجوز Apache 2.0 منتشر شده‌اند…

۱ دقیقه خواندن۱
کنترل سطح شات، هزینه تولید ویدیو با هوش مصنوعی را کاهش می‌دهد
آموزش کاربردی

قراردادهای شات؛ راهکار SEELE TV برای کاهش هزینه‌های تولید ویدیو با AI

یک گردش‌کار جدید بر پایه «قراردادهای شات» با جایگزینی پرامپت‌های مبهم، اتلاف منابع در تولید ویدیوهای هوش مصنوعی را کاهش می‌دهد. این متد با ایزوله کردن خطاها در کوچک‌ترین واحد…

۴ دقیقه خواندن۱
شکایت ناشران بزرگ از گوگل بابت آموزش هوش مصنوعی

گوگل امکان حذف واترمارک‌های بصری از محتوای Gemini و Flow را فراهم کرد

گوگل به کاربران اجازه می‌دهد نشان‌های بصری (Watermarks) را از تصاویر، ویدیوها و آهنگ‌های تولیدشده توسط هوش مصنوعی حذف کنند. با این حال، شفافیت از طریق نشان‌های نامرئی SynthID و…

۲ دقیقه خواندن۱
جستجوی بصری با pgvector و Gemini: تشخیص، برش، جاسازی، رتبه‌بندی (و باگ میانگین‌گیری که تطابق دقیق را از کار انداخت)
آموزش کاربردی

جایگزینی میانگین‌گیری با بردارهای تک‌نما، دقت تطابق تصاویر را به ۹۷٪ رساند

یک مؤسس بازارچه مد متوجه شد که میانگین‌گیری از بردارهای معنایی تصاویر، دقت تطابق دقیق را از بین می‌برد. با تغییر استراتژی به استفاده از بردارهای هر نما (Per-view) و سیستم…

۱۰ دقیقه خواندن
مدل جدید Gemini 3.7 Flash گوگل: کدنویسی و عامل هوشمند با قیمت ۰.۷۵ دلار برای هر میلیون توکن ورودی

آیا قیمت رقابتی Gemini 3.7 Flash استقرار عامل‌های هوشمند را تسهیل می‌کند؟

گوگل مدل Gemini 3.7 Flash را با تمرکز بر مهندسی نرم‌افزار و اتوماسیون اسناد معرفی کرد. این مدل با قیمتی بسیار رقابتی، هزینه‌های استقرار عامل‌های هوش مصنوعی را برای استارتاپ‌ها به…

۴ دقیقه خواندن
مقایسه قیمت API تبدیل گفتار به متن استارتاپ‌های اروپایی: هزینه هر دقیقه
آموزش کاربردی

استارتاپ‌های اروپایی هزینه‌های تبدیل گفتار به متن را بدون افت کیفیت کاهش دادند

یک چارچوب فنی جدید برای استارتاپ‌های آموزشی، اولویت را از قیمت‌های ظاهری به دقت تبدیل متن و تأخیر کاهش داده است تا از خطاهای هزینه‌بر در مسیریابی تیکت‌ها جلوگیری شود. این رویکرد…

۸ دقیقه خواندن۱
طراحی گردش کار تصویر آماده تولید با API تصویر GPT-2
آموزش کاربردی

GPT Image 2: حذف وابستگی به شانس در پرامپت‌نویسی برای محیط‌های تولیدی

تولید تصاویر صنعتی نیازمند سیستمی ساختاریافته است، نه تکیه بر شانس در پرامپت‌نویسی. API جدید GPT Image 2 با ارائه چارچوبی برای تثبیت ترکیب‌بندی و رندر متن، امکان تبدیل خروجی‌های…

۲ دقیقه خواندن۲
یادگیری از ساخت انیماتور هوشمند عکس به ویدیو با ۱۰هزار+ تصویر متحرک

ترکیب رنگ‌آمیزی و متحرک‌سازی؛ راهکار Inithouse برای کاهش اصطکاک کاربران AI

استودیوی Inithouse با تحلیل ۱۰ هزار کاربر ابزار Živá Fotka دریافت که ادغام رنگ‌آمیزی تصاویر قدیمی با متحرک‌سازی، نرخ تکمیل عملیات را به‌شدت افزایش می‌دهد. این داده‌ها نشان می‌دهد…

۴ دقیقه خواندن