
Claude Opus 5 در برابر GPT-5.6 در تولید بازیهای سهبعدی رویهای
مدل جدید آنتروپیک قادر است بازیهای سهبعدی و شبیهسازهای فیزیکی قابل اجرا را تنها با یک پرامپت و از طریق کدنویسی رویهای تولید کند. برخلاف مدلهای ویدئویی، این مدل خروجیهای قابل…
موضوع
Models that natively process text+image+audio+video
۸۷۹ مقاله منتشر شده

مدل جدید آنتروپیک قادر است بازیهای سهبعدی و شبیهسازهای فیزیکی قابل اجرا را تنها با یک پرامپت و از طریق کدنویسی رویهای تولید کند. برخلاف مدلهای ویدئویی، این مدل خروجیهای قابل…

پلتفرم Pixapi با معرفی پاسخهای Pre-flight، تخمین دقیق هزینه را پیش از اجرای عملیات تولید تصویر یا ویدیو ارائه میدهد. این قابلیت به توسعهدهندگان اجازه میدهد تا بودجه استنتاج را…

رابطهای جدید MCP و CLI امکان تولید ویدیو در Kling را برای عاملها فراهم کردهاند، اما نبود محدودیتهای سختگیرانه ریسک تخلیه سریع اعتبارها را دارد. پیادهسازی ایمن نیازمند تایید…

پژوهشگران دانشگاه اموری یک پلتفرم ارزانقیمت مبتنی بر هوش مصنوعی ساختند تا تستهای شناختی میمونهای کاپوچین را در طبیعت بهصورت خودکار اجرا کنند. این سامانه با ترکیب تشخیص چهره و…

یک توسعهدهنده با طراحی یک ماشین وضعیت برای مدیریت حافظه، موفق شد مجموعهای از ابزارهای هوش مصنوعی چندوجهی را روی یک GPU ارزانقیمت ۴ گیگابایتی اجرا کند. این سیستم بدون نیاز به…

سرویس TalkPix AI اکنون میتواند تنها با یک عکس پرتره و یک فایل صوتی، ویدیوهایی با همگامسازی دقیق لبها تولید کند. این سیستم نیاز به دادههای پیچیده ضبط حرکت را حذف کرده و حرکات…

دادگاه مونیخ حکم داد که ابزار تولید موسیقی Suno با «حفظ خاطرهای» (Memorization) از آهنگهای خاص در مرحله آموزش، حقوق کپیرایت را نقض کرده است. این دادگاه دفاع Suno مبنی بر…

بررسی دادههای ابزار Magical Song نشان میدهد بزرگترین چالش موسیقی مولد، کیفیت صدا نیست، بلکه تبدیل داستانهای پراکنده انسانی به ترانههای ساختارمند و احساسی است. یافتهها حاکی…

پلتفرم Oxlo.ai با جایگزینی سیستم پرداخت توکنی با هزینه ثابت بهازای هر درخواست، ریسک مالی پردازش دادههای حجیم را از بین برد. این مدل جدید بهویژه برای پردازش تصاویر باکیفیت و…

شرکت xAI قابلیت تولید ویدیو با کیفیت 1080p و استفاده از ۷ تصویر مرجع را به API مدل Grok Imagine Video 1.5 اضافه کرد. با این حال، تناقضات در مستندات فنی و افزایش چشمگیر هزینههای…

پژوهشهای Inithouse روی ۸۴۷ جلسه صوتی نشان میدهد تأخیر در ابزارهای صوتی ناشی از تبدیل صدا به متن نیست، بلکه پردازش مدل زبانی برای ساخت ساختار دادهها زمانبر است. در حالی که…

کمپانی NeuralSound با معرفی یک بنچمارک جدید، نشان داد که تکیه بر یک امتیاز کلی برای ارزیابی جداسازی صدا گمراهکننده است. این پژوهش بر ضرورت استفاده از سه معیار مجزا برای شناسایی…