پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۴۲۵ مقاله منتشر شده

ردار توالی - شماره ۹۱۹: هفته گذشته در هوش مصنوعی: استرایپ می‌خواد اقتصاد توکن رو تصاحب کنه

خرید OpenRouter چگونه توکن‌های هوش مصنوعی را به ابزار مالی تبدیل می‌کند؟

استرایپ با تصاحب OpenRouter، مسیری برای تبدیل توکن‌های هوش مصنوعی به منابع اقتصادی قابل معامله ایجاد می‌کند. این اقدام نشان می‌دهد انتخاب مدل AI دیگر صرفاً یک تصمیم فنی نیست، بلکه…

۶ دقیقه خواندن۲
نمودار خطی: خط لوله هوشمند اسناد با استفاده از deepDoctection از ورودی تا خروجی.
آموزش کاربردی

deepDoctection ساختار اسناد پیچیده را برای سیستم‌های RAG قابل‌فهم کرد

راهنمای فنی جدیدی نشان می‌دهد چگونه می‌توان تشخیص چیدمان، نویسه‌خوانی نوری و شناسایی جداول را در یک جریان کاری واحد ادغام کرد. این چارچوب به توسعه‌دهندگان اجازه می‌دهد داده‌های…

۷ دقیقه خواندن
پشت صحنه فیلم‌برداری: تیم سنتی در برابر تولید محتوای هوش مصنوعی
سرگرمی و خلاقیت

گزارش تولید محتوا: هزینه درام‌های کوتاه با AI ۸۵٪ کاهش یافت

استفاده از خط لوله‌های تولید بومیِ هوش مصنوعی، هزینه هر قسمت از درام‌های کوتاه را از ۹۵۰۰ دلار به ۱۳۰۰ دلار رسانده است. این تغییر اجازه می‌دهد تیم‌های کوچک، محتوا را ۱۲ برابر…

۳ دقیقه خواندن۴
بوت‌کمپ ۶۹۹ دلاری هاروارد با آواتارهای هوش مصنوعی اساتیدش

هاروارد برای بازخورد به کارآفرینان از آواتارهای هوش مصنوعی استفاده می‌کند

دانشکده کسب‌وکار هاروارد در یک دوره آموزشی ۶۹۹ دلاری، از آواتارهای دیجیتال برای ارائه بازخورد شخصی‌سازی‌شده به دانشجویان استفاده می‌کند. این سیستم با شبیه‌سازی نسخه‌های دیجیتال از…

۱ دقیقه خواندن۱
تیک سبز تأیید؟ برخی حساب‌ها فقط با یک حرف باز شدند.
آموزش کاربردی

زیست‌سنجی چهره در برابر تطبیق متنی برای بستن حفره‌های احراز هویت

استفاده از تطبیق‌های تقریبی در سیستم‌های احراز هویت، امکان ثبت‌نام با نام‌های مستعار و حروف تک را فراهم کرده است. کارشناسان معتقدند تنها جایگزین امن برای این حفره‌های سیستمی،…

۳ دقیقه خواندن۲
تبدیل هر ضبط صوتی به موسیقی پیانو با pianoify
سرگرمی و خلاقیت

«تجربه استین‌وی در مرورگر»؛ قابلیت جدید ابزار رایگان Pianoify

ابزار رایگان Pianoify فایل‌های صوتی و لینک‌های یوتیوب را به نت‌های پیانو و فایل MIDI تبدیل می‌کند. این سرویس با استفاده از یک رمزگشای بلادرنگ، صداها را مستقیماً در مرورگر به اجرای…

۱ دقیقه خواندن۱
دو GPU با vLLM برای درک صفحه نمایش و تعیین مختصات در عامل‌های دسکتاپ (Neo نسخه ۰.۱)
آموزش کاربردی

LuxurAI با موتور vLLM دوگانه دقتِ درک صفحه را در عامل‌های دسکتاپ ارتقا داد

سیستم Neo v0.1 با جایگزینی تولید فایل‌های یکپارچه با کامپایل بلوکی، خطاهای ساختاری در رابط‌های کاربری را حذف کرد. این عامل دسکتاپ از یک موتور بینایی دوگانه برای مبنی‌سازی دقیق…

۱ دقیقه خواندن۱
تست یک هفته‌ای Grok در برابر ChatGPT — تفاوت محسوس بود
زندگی با AI

شکاف کاربردی ChatGPT و Grok؛ برتری در سازمان‌دهی در برابر تحلیل لحظه‌ای

آزمون‌های مقایسه‌ای نشان می‌دهد ChatGPT همچنان ابزاری برتر برای کارهای ساختاریافته و یکپارچگی فایل‌هاست، در حالی که Grok در تحلیل داده‌های لحظه‌ای شبکه‌های اجتماعی و استدلال‌های…

۳ دقیقه خواندن۱
پسر نوجوان با نگرانی به گوشی موبایل نگاه می‌کند.
آموزش کاربردی

۳ ثانیه صوت برای جعل کامل هویت؛ سقوط سد امنیتی بیومتریک

مدل‌های جدید سنتز صوتی اکنون می‌توانند تنها با ۳ ثانیه داده، صدای هر انسانی را با دقت خیره‌کننده شبیه‌سازی کنند. این پیشرفت، سیستم‌های احراز هویت صوتی را ناکارآمد کرده و مهندسان…

۲ دقیقه خواندن۱