پرش به محتوای اصلی

دسته‌بندی

تحلیل و بررسی تخصصی

تحلیل‌های عمیق مدل‌ها، مقالات و بنچمارک‌ها — پیش‌چاپ‌ها، ارزیابی‌ها، مدل‌های زبانی پیشرو و پژوهش همراستاسازی.

۵٬۷۶۵ مقاله منتشر شده

جمنای ۳.۸ فلش: سومین مدل اقتصادی گوگل در شش هفته، در حالی که مدل‌های پیشرو همچنان غایب‌اند

جمینای ۳.۸ فلش با امتیاز ۷۳.۷٪ در DeepSWE رقیب مدل‌های پیشرو شد

گوگل مدل اقتصادی Gemini 3.8 Flash را با عملکردی در سطح مدل‌های گران‌قیمت در کدنویسی و امنیت سایبری معرفی کرد. با وجود قیمت رقابتی، مصرف بالای توکن در استدلال‌های پیچیده ممکن است…

۴ دقیقه خواندن۱
اداره ترامپ از اوپن‌ای‌ای در دعوای حق نشر با نیویورک‌تایمز حمایت می‌کند.

دولت ترامپ آموزش مدل‌های هوش مصنوعی را «استفاده منصفانه» دانست

دولت ایالات متحده با مداخله در پرونده کپی‌رایت نیویورک تایمز علیه OpenAI، استدلال کرد که آموزش مدل‌های زبانی بر اساس متون دارای کپی‌رایت قانونی است. این موضع می‌تواند پیش‌روی…

۲ دقیقه خواندن
نمودار: مراحل طراحی روبریک قابل‌اعتماد برای ارزیابی LLM-as-a-Judge
آموزش کاربردی

گوگل ارزیابی عامل‌های هوش مصنوعی را با روب‌ریک‌های بولی استاندارد کرد

تیم مهندسی گوگل چارچوبی را معرفی کرد که در آن مدل‌های زبانی به‌جای دستورات مبهم، از معیارهای سخت‌گیرانه و بله/خیر (Boolean) برای نمره‌دهی به سایر عامل‌ها استفاده می‌کنند. این روش…

۵ دقیقه خواندن
سرور MCP شما به یک «نه» قابل‌خوانش توسط ماشین نیاز دارد
آموزش کاربردی

۵ دسته‌بندی پاسخ منفی برای جلوگیری از بداهه‌پردازی عامل‌های هوش مصنوعی

عامل‌های هوش مصنوعی در محیط‌های عملیاتی به جای دستورات متنی، نیازمند یک سیستم قطعی برای درک محدودیت‌های خود هستند. چارچوب جدیدی پیشنهاد شده که با تعریف پنج دسته‌بندی از «پاسخ‌های…

۴ دقیقه خواندن
نمی‌توانی آنچه را نمی‌توانی بررسی کنی، تفویض کنی.
آموزش کاربردی

پروتکل Agateon: جایگزینی شواهد ماشینی با اعتماد در عامل‌های هوش مصنوعی

گلوگاه اصلی عامل‌های هوش مصنوعی هوش مدل نیست، بلکه نبود سازوکار تأیید خروجی است. پروتکل Agateon با تبدیل تأیید به یک زیرساخت سخت‌گیرانه، «مالیات اعتماد» و نیاز به نظارت انسانی…

۶ دقیقه خواندن۲
سیستم RAGی ساختم که منابع پاسخ را نشان دهد: معرفی Alchimista
آموزش کاربردی

آیا میزبانی محلی داده‌ها می‌تواند توهمات مدل‌های RAG را کاهش دهد؟

سامانه متن‌باز Alchimista برخلاف چت‌بات‌های معمولی، هر پاسخ هوش مصنوعی را به یک ردپای قابل حسابرسی تبدیل می‌کند. این ابزار با اولویت دادن به حاکمیت داده و حریم خصوصی، امکان…

۴ دقیقه خواندن۱
ارزیابی تطبیقی سیستم‌های عامل‌گرای مرزی: معیارها، چالش‌ها و راهبردهای بهینه‌سازی عملکرد

نرخ موفقیت در برابر هزینه؛ چالش استقرار عامل‌های مهندسی نرم‌افزار

تحلیل جدید FrontierHarness نشان می‌دهد هزینهٔ عملیاتی عامل‌های مهندسی نرم‌افزار با نرخ موفقیت آن‌ها فاصله گرفته است. در حالی که برخی مدل‌ها تسک‌های بیشتری را پاس می‌کنند، هزینهٔ…

۱ دقیقه خواندن
کارت مدل Gemini 3.8 Flash: مشخصات فنی، قابلیت‌ها و محدودیت‌های مدل زبانی Gemini 3.8 Flash

Gemini 3.8 Flash؛ بهینه‌سازی گوگل برای کاهش هزینه و تأخیر در عامل‌های سازمانی

گوگل دیپ‌مایند مدل Gemini 3.8 Flash را برای تسریع گردش‌کارهای عامل‌محور و مهندسی نرم‌افزار عرضه کرد. این مدل با حفظ پنجره متنی یک میلیون توکنی، تعادلی بهینه میان کیفیت، هزینه و…

۵ دقیقه خواندن۱
مجوز Boehringer Ingelheim برای K Pro AI Scientist و داده‌های بیمار Owkin

بوهرینگر اینگلهایم برای تسریع کشف دارو به عامل‌های هوش مصنوعی Owkin روی آورد

شرکت داروسازی بوهرینگر اینگلهایم با دریافت مجوز استفاده از پلتفرم K Pro و داده‌های چندوجهی Owkin، فرآیند کشف دارو در حوزه‌های سرطان و ایمنی را خودکار می‌کند. این همکاری بر پایه…

۴ دقیقه خواندن۳
شرکت World Labs مدل هوش مصنوعی Atlas را معرفی کرد که با چند عکس، جهان‌های سه‌بعدی می‌سازد، بازسازی و شبیه‌سازی می‌کند.

مدل Atlas با معماری زمینهٔ مکانی، دقت بازسازی سه‌بعدی را ارتقا داد

شرکت World Labs مدل Atlas را معرفی کرد؛ سیستمی که با درک مختصات سه‌بعدی، محیط‌های پیچیده را از چند عکس بازسازی و شبیه‌سازی می‌کند. این مدل برخلاف مدل‌های ویدیویی، داده‌ها را در…

۵ دقیقه خواندن۱