پرش به محتوای اصلی

دسته‌بندی

تحلیل و بررسی تخصصی

تحلیل‌های عمیق مدل‌ها، مقالات و بنچمارک‌ها — پیش‌چاپ‌ها، ارزیابی‌ها، مدل‌های زبانی پیشرو و پژوهش همراستاسازی.

۵٬۸۵۵ مقاله منتشر شده

مدیریت هزینه‌های کدنویسی هوش مصنوعی در مقیاس بزرگ
آموزش کاربردی

بهره‌وری در برابر هوش حداکثری؛ تغییر رویکرد دیتابریکس در Agentic Coding

دیتابریکس چارچوبی برای مدیریت هزینه‌های تصاعدی کدنویسی عامل‌محور معرفی کرد که اولویت را از «بیشترین هوش» به «مرز بهره‌وری» تغییر می‌دهد. این استراتژی با ترکیب مسیریابی پویا و…

۱۰ دقیقه خواندن۳
آنتروپیک محدودیت‌های زیست‌شناسی فیبل ۵ را کاهش داد، اما محدودیت‌های ویروس‌شناسی و سم‌شناسی حفظ شد.

آنتروپیک: کاهش ۸۵ درصدی مسدودسازی‌های اشتباه در حوزه زیست‌شناسی

آنتروپیک با به‌روزرسانی فیلترهای ایمنی Fable 5، نرخ خطای مثبت در پرس‌وجوهای زیست‌شناسی را به‌شدت کاهش داد تا دسترسی به داده‌های پزشکی و آموزشی تسهیل شود. با این حال، محدودیت‌های…

۱ دقیقه خواندن
مدل آینده آسترا ممکن است آستانه امنیت سایبری حیاتی را بگذراند

درون پروتکل‌های مهار OpenAI برای کنترل توانمندی‌های سایبری مدل Astra

شرکت OpenAI توسعه مدل Astra را به دلیل توانایی این مدل در شناسایی و ایجاد اکسپلویت‌های روز-صفر (Zero-day) بدون کمک انسان متوقف کرد. این شرکت اکنون پروتکل‌های مهار شدیدی را فعال…

۵ دقیقه خواندن۲
پنجره زمینه مدل زبانی شما دروغ می‌گوید: بودجه توکن‌ها واقعاً چگونه کار می‌کند
آموزش کاربردی

شکاف ظرفیت و کیفیت؛ چرا پنجره‌های متنی بزرگ مدل‌های زبانی در عمل شکست می‌خورند؟

ظرفیت اعلام‌شده برای پنجره‌های متنی تنها یک سقف سخت‌افزاری است، نه تضمینی برای کیفیت استخراج داده. توسعه‌دهندگان باید برای جلوگیری از خطاهای «گم‌شدن در میانه» و هزینه‌های تصاعدی،…

۵ دقیقه خواندن۲
مقایسه عملکرد GPT-4o، Claude و Mistral در وظایف واقعی تولیدی
آموزش کاربردی

تضاد بنچمارک‌های عمومی و عملکرد واقعی؛ چرا مدل‌های برتر در تولید شکست می‌خورند؟

رتبه‌بندی‌های عمومی مدل‌های زبانی اغلب برای توسعه‌دهندگان گمراه‌کننده است، زیرا نمرات آکادمیک محدودیت‌های دنیای واقعی را پوشش نمی‌دهند. رویکرد مسیریابی وظایف (Task-specific…

۳ دقیقه خواندن۱
لحظات تدریس: آیا معلمان هوش مصنوعی می‌دانند چه‌وقت کمک کنند و چه‌وقت دست نگه دارند؟
آموزش کاربردی

TutorMoments: مدل‌های زبانی با کمک بیش از حد، تفکر انتقادی دانش‌آموزان را

یک چارچوب ارزیابی جدید نشان می‌دهد که مدل‌های زبانی در نقش معلم، تمایل دارند بیش از حد به دانش‌آموز کمک کنند و فرصت «تلاش سازنده» را از آن‌ها بگیرند. با وجود بهبود در مهندسی…

۷ دقیقه خواندن۳
بهینه‌سازی استنتاج مدل زبانی بزرگ برای تأخیر کم در تعامل انسان-رایانه
آموزش کاربردی

Oxlo.ai: حذف مالیات تأخیر با جایگزینی هزینه ثابت به‌ازای هر درخواست

پلتفرم Oxlo.ai برای حذف «مالیات تأخیر» در سیستم‌های تعاملی، پرداخت بر اساس توکن را با هزینه ثابت به‌ازای هر درخواست جایگزین کرد. این رویکرد به توسعه‌دهندگان اجازه می‌دهد بدون…

۵ دقیقه خواندن۲
آزمایش ۷۲ باره به جای بحث: ابزار MCP چه باید برگرداند؟
آموزش کاربردی

داده‌های تفکیکی در برابر ردیف‌های خلاصه؛ نبرد برای دقت عامل‌ها

یک مطالعه بر روی ۷۲ آزمایش نشان می‌دهد که فشرده‌سازی خروجی‌های ابزار در پروتکل MCP باعث می‌شود عامل‌ها از انجام وظایفی که قادر به حل آن‌ها هستند، صرف‌نظر کنند. این پژوهش ثابت…

۵ دقیقه خواندن
پاسخ به مرز بعدی قابلیت‌های سایبری بحرانی

مدل Astra شرکت OpenAI به آستانهٔ خطرناکِ توسعهٔ اکسپلویت‌های صفرروزه رسید

مدل Astra توانایی شناسایی و توسعهٔ خودکار حفره‌های امنیتی (Zero-day) را پیدا کرده است. OpenAI برای جلوگیری از سوءاستفاده، دسترسی‌های داخلی را محدود و نظارت بر زنجیره تفکر مدل را…

۳ دقیقه خواندن۱
لمما ۲.۳ میلیون دلار برای رفع خطاهای خاموش عامل‌های هوش مصنوعی در محیط عملیاتی جذب کرد

استارتاپ Lemma با ۲.۳ میلیون دلار برای شکار خطاهای خاموش عامل‌های هوش مصنوعی

شرکت Lemma زیرساختی برای شناسایی «شکست‌های معنایی» ایجاد می‌کند؛ جایی که عامل‌های هوش مصنوعی به‌ظاهر موفق عمل می‌کنند اما نتایج غلط تولید می‌کنند. هدف این پلتفرم تبدیل خطاهای…

۵ دقیقه خواندن۳