پرش به محتوای اصلی

دسته‌بندی

تحلیل و بررسی تخصصی

تحلیل‌های عمیق مدل‌ها، مقالات و بنچمارک‌ها — پیش‌چاپ‌ها، ارزیابی‌ها، مدل‌های زبانی پیشرو و پژوهش همراستاسازی.

۵٬۷۶۰ مقاله منتشر شده

وقتی قانون گودهارت ارزیابی عامل هوشمندت را می‌بلعد: چرا داشبورد سبزت بی‌معنی می‌شود
آموزش کاربردی

درون چرخهٔ شکست ارزیابی‌های AI؛ چرا بهینه‌سازیِ تست‌ها گمراه‌کننده است؟

تیم‌های مهندسی اغلب در تلهٔ بهینه‌سازی برای عبور از تست‌ها به‌جای انجام واقعی کار می‌افتند. راهکار این مشکل، پیوند دادن هر امتیاز ارزیابی به یک ردپای اجرایی (Trace) دقیق است تا…

۵ دقیقه خواندن۱
عامل = مدل × زیرساخت: لایه ارزیابی بخشی از عامل است، نه ابزاری کنار آن
آموزش کاربردی

شکاف هارنس: دلیل اصلی شکست دموهای عامل‌های هوش مصنوعی در مقیاس واقعی

بسیاری از عامل‌های خودکار در محیط عملیاتی شکست می‌خورند زیرا لایه‌های ارزیابی و نظارت را ابزارهایی جانبی می‌بینند، نه بخشی از هسته سیستم. جایگزینی مدل‌های «حلقه-باز» با «هارنس‌های…

۷ دقیقه خواندن۱
آلیس، دختری ناآرام و بی‌قرار.
آموزش کاربردی

پارادوکس بازرسی: چرا میانگین زمان بازیابی، تجربه واقعی کاربر را می‌پوشاند

مارک بروکر از مهندسان AWS توضیح می‌دهد که چگونه معیارهای سنتی تأخیر، درد واقعی کاربران را نادیده می‌گیرند. این شکاف به دلیل «پارادوکس بازرسی» رخ می‌دهد؛ جایی که کاربران به طور…

۳ دقیقه خواندن
بررسی اولیه: Amazon SageMaker با داشبورد CloudWatch Insights بیش از ۱۰۰ معیار استنتاج دقیق ارائه می‌دهد

بهبود نظارت در برابر امنیت مدل؛ تضاد جدید در به‌روزرسانی AWS

آمازون بیش از ۱۰۰ متریک دقیق استنتاج را به SageMaker AI اضافه کرد. در حالی که این ابزارها نظارت را بهبود می‌بخشند، اما ریسک مهندسی معکوس معماری مدل‌ها و حملات DoS هدفمند را افزایش…

۱ دقیقه خواندن۱
حکمرانی فناوری هوش مصنوعی: چرا آمازون می‌گوید «انسان در حلقه» شکست خورده است

حفاظ‌های قطعی در برابر تأیید انسانی؛ تغییر استراتژی ایمنی آمازون

آمازون و سایر پیشروان فناوری استدلال می‌کنند که الزام به تأیید انسانی برای هر اقدام هوش مصنوعی، به دلیل خستگی کاربر منجر به «تأییدهای کورکورانه» می‌شود. این شرکت‌ها اکنون به سمت…

۲۰ دقیقه خواندن۱
آزمایش مریخ‌نورد ناسا با قابلیت سرعت بالا و بالا بردن چرخ‌ها برای عبور از موانع

«تعلیق فعال»؛ راهکار ناسا برای عبور سریع‌تر ارنست از زمین‌های صعب‌العبور

ناسا در حال آزمایش مدل جدیدی از کاوشگر به نام ارنست است که با سیستم تعلیق فعال، سرعت حرکت در زمین‌های سخت را به ۰.۶ مایل در ساعت رسانده است. این خودرو می‌تواند چرخ‌های خود را بلند…

۲ دقیقه خواندن
پایگاه داده قابل جستجوی آتلانتیک از موسیقی‌های استفاده‌شده برای آموزش هوش مصنوعی

درون استراتژی گوگل و Stability AI برای دور زدن قوانین پلتفرم‌ها

یک پایگاه‌داده عمومی فاش کرد که میلیون‌ها اثر موسیقی، از جمله آثار لیدی گاگا و رادیوهد، بدون مجوز برای آموزش مدل‌های هوش مصنوعی استفاده شده‌اند. این داده‌ها نشان می‌دهند شرکت‌هایی…

۲ دقیقه خواندن
حلقه نابودی هوش مصنوعی: چرا عامل کدنویسی خودکار اوضاع را بدتر می‌کند و راه‌حل آن
آموزش کاربردی

چارچوب Agent Rigor با سلسله‌مراتب دستوری جلوی توهمات کدنویسی AI را می‌گیرد

چارچوب متن‌باز Agent Rigor برای مقابله با «پوسیدگی زمینه» در عامل‌های کدنویس معرفی شده است. این سیستم با جایگزینی پرامپت‌های حجیم با یک ساختار لایه‌ای، از تخریب کدبیس و توهمات مدل…

۳ دقیقه خواندن۱
نگاه اولیه: AWS عامل‌ساز Bedrock AgentCore را برای عوامل تولیدی راه‌اندازی کرد

مدل‌های عامل AWS Bedrock اکنون با ۲ فراخوانی API مستقر می‌شوند

آمازون با عرضه AgentCore Harness، پیچیدگی‌های زیرساختی استقرار عامل‌های هوش مصنوعی را حذف کرد. این ابزار زمان راه‌اندازی عامل‌های تولیدی با دسترسی کامل به وب و سیستم را از هفته‌ها…

۱ دقیقه خواندن۱
اسکنر امنیتی برای کد تولیدشده با هوش مصنوعی ساختم — این یافته‌های آن بود
آموزش کاربردی

VibeGuard با شناسایی ۱۵ الگوی توهم‌گونه، حفره‌های امنیتی کدنویسی AI را می‌بندد

ابزار جدید VibeGuard برخلاف اسکنرهای سنتی، به‌طور خاص روی «کدهای توخالی» و الگوهای ناامن تولیدشده توسط مدل‌های زبانی متمرکز است. این اسکنر می‌تواند توابع جعلی و فقدان عملیات…

۳ دقیقه خواندن۲
مدیرعاملی شرکتم را ۶ ماه به هوش مصنوعی سپردم. این چیزی بود که خراب شد.
زندگی با AI

چرا مدیریت کامل یک شرکت توسط هوش مصنوعی با شکست مواجه شد؟

یک تجربه شش‌ماهه برای سپردن مدیریت کامل یک کسب‌وکار به هوش مصنوعی با شکست سیستمیک مواجه شد. نتایج نشان می‌دهد مدل‌های فعلی در مواجهه با پیچیدگی‌های انسانی و داده‌های ناقص، از توان…

۳ دقیقه خواندن۳