
رویکرد Multi-Vector در برابر متدهای سنتی فشردهسازی RAG
بهروزرسانی نسخه ۶.۰ کتابخانه Sentence Transformers با معرفی MultiVectorEncoder، بازیابی مدلهای ColBERT را ممکن کرد. این رویکرد با حفظ جزئیات در سطح توکن، دقت بازیابی را در…
موضوع
Models that natively process text+image+audio+video
۱٬۴۲۵ مقاله منتشر شده

بهروزرسانی نسخه ۶.۰ کتابخانه Sentence Transformers با معرفی MultiVectorEncoder، بازیابی مدلهای ColBERT را ممکن کرد. این رویکرد با حفظ جزئیات در سطح توکن، دقت بازیابی را در…

قابلیت جدید Pet Memory در اکوسیستم گوگل تلاش میکند حیوانات خانگی را از طریق دوربینهای Nest شناسایی کند، اما آزمایشهای واقعی نشان میدهد مدل در تفکیک حیوانات از یک گونه شکست…

آنتروپیک با معرفی ابزار Read در Claude Code، یک کانال اجباری برای ادراک محیطی ایجاد کرده است که هرگونه ویرایش کد را مشروط به خواندن واقعی فایل میکند. این سازوکار با حذف…

شرکت Cartesia مدل Sonic-3.6 را معرفی کرد که با جایگزینی ترنسفورمرها با مدلهای فضای حالت (SSM)، تأخیر استنتاج را به زیر ۹۰ میلیثانیه رسانده است. این مدل در حال حاضر رتبه اول هر…

لو رفتن یک ویدیو در بتای macOS Tahoe نشان میدهد اپل در حال توسعه ایرپادهایی با دوربین داخلی است. این گجتها با استفاده از «هوش بصری»، به سیری اجازه میدهند محیط اطراف کاربر را…

مدل جدید و وزنباز Qwen 3.8 27B از علیبابا، با کسب بالاترین امتیاز هوشمندی در میان ۱۳۵ مدل هماندازه، سقف جدیدی برای کارایی مدلهای میانمقیاس تعریف کرد. این مدل با پنجره متنی…

نسل جدید مدلهای تولید ویدیو با حذف نقصهای بصری، ابزارهای سنتی تشخیص جعل عمیق را ناکارآمد کردهاند. این تغییر، مهندسان امنیت را مجبور میکند تا از تحلیل پیکسلها به سمت تأییدیه…

گوگل با معرفی فراخوانی توابع بهصورت ناهمگام در Gemini Live API، اجازه میدهد عاملهای صوتی هنگام اجرای ابزارهای پسزمینه به صحبت ادامه دهند. این بهروزرسانی تأخیرهای API را…

شرکت MiniMax مدل MiniMax-Music3 را منتشر کرد که قادر است آهنگهای کامل پنجدقیقهای با کیفیت بالا از روی متن و شرح ساختار تولید کند. این مدل با معماری Hybrid-LM، تعادلی میان…

راهنمای جامع استفاده از کتابخانه docTR برای درک جامع اسناد از طریق ترکیب OCR، تحلیل چیدمان و استخراج اطلاعات کلیدی. این ابزار مسیر تبدیل متنهای خام به دادههای ساختاریافته و…

به جای جستوجوی «بهترین» مدل هوش مصنوعی، وظایف را بر اساس نقاط قوت معماری هر مدل توزیع کنید. این راهنما زمان استفاده از ChatGPT برای منطق، Claude برای متن، Gemini برای دادههای…

پلتفرم Speko با معرفی یک مسیریاب هوشمند، هزینه سرویسهای STT را از طریق انتخاب پویا میان مدلهای مختلف کاهش داد. این سیستم با یک API واحد و سازگار با OpenAI، امکان جابهجایی میان…