پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۳۵۶ مقاله منتشر شده

داستان‌سرایی تعاملی با هوش مصنوعی: تجربه‌ای با Gemini
آموزش کاربردی

ترکیب Gemini و سخت‌افزار Lunii؛ تبدیل اسباب‌بازی‌های صوتی به تئاترهای شخصی AI

یک توسعه‌دهنده با استفاده از مدل‌های تبدیل متن به گفتار و تصویر گوگل، یک سیستم تولید داستان شخصی‌سازی‌شده برای دستگاه Lunii ساخت. این پروژه محتوای تولیدی هوش مصنوعی را مستقیماً به…

۴ دقیقه خواندن۲
ابزار Read در Claude Code: خواندن فایل‌ها با کنترل دقیق محدوده خطوط و ساختار پروژه برای تحلیل هوشمند کد.
آموزش کاربردی

خوانش اجباری فایل‌ها چگونه خطاهای مدل‌های برنامه‌نویس را برطرف می‌کند؟

آنتروپیک با معرفی ابزار Read در Claude Code، یک کانال اجباری برای ادراک محیطی ایجاد کرده است که هرگونه ویرایش کد را مشروط به خواندن واقعی فایل می‌کند. این سازوکار با حذف…

۱۲ دقیقه خواندن۱
ویدیوی لو رفته از ایرپادهای مجهز به دوربین اپل
اخبار کوتاه روزانهگزارش تأییدنشده

ایرپادهای جدید اپل با دوربین داخلی و قابلیت هوش بصری

لو رفتن یک ویدیو در بتای macOS Tahoe نشان می‌دهد اپل در حال توسعه ایرپادهایی با دوربین داخلی است. این گجت‌ها با استفاده از «هوش بصری»، به سیری اجازه می‌دهند محیط اطراف کاربر را…

۲ دقیقه خواندن۱
بررسی Qwen 3.8 27B: مدل هوش مصنوعی متن‌باز با وزن در دسترس

«تعادل قدرت و هزینه»؛ ویژگی کلیدی مدل میان‌مقیاس علی‌بابا

مدل جدید و وزن‌باز Qwen 3.8 27B از علی‌بابا، با کسب بالاترین امتیاز هوشمندی در میان ۱۳۵ مدل هم‌اندازه، سقف جدیدی برای کارایی مدل‌های میان‌مقیاس تعریف کرد. این مدل با پنجره متنی…

۶ دقیقه خواندن
ویدیوی رئیستان که پول می‌خواهد دیگر گلیچ نمی‌شود

تأییدیه رمزنگاری در برابر تحلیل پیکسل برای شناسایی ویدیوهای جعلی

نسل جدید مدل‌های تولید ویدیو با حذف نقص‌های بصری، ابزارهای سنتی تشخیص جعل عمیق را ناکارآمد کرده‌اند. این تغییر، مهندسان امنیت را مجبور می‌کند تا از تحلیل پیکسل‌ها به سمت تأییدیه…

۳ دقیقه خواندن۲
فراخوانی ناهمگام توابع در API زنده جمینی برای عامل‌های صوتی بلادرنگ
آموزش کاربردی

قابلیت Non-Blocking در Gemini Live API سکوت‌های آزاردهندهٔ عامل‌های صوتی را حذف

گوگل با معرفی فراخوانی توابع به‌صورت ناهمگام در Gemini Live API، اجازه می‌دهد عامل‌های صوتی هنگام اجرای ابزارهای پس‌زمینه به صحبت ادامه دهند. این به‌روزرسانی تأخیرهای API را…

۷ دقیقه خواندن