
آیا تاییدیه های متوالی در کدنویسی AI نشانه کیفیت است؟
داشبوردهای سبز و تاییدیه های متوالی در وصلههای کد AI لزوماً نشانه کیفیت نیستند، بلکه ممکن است نشاندهنده ناتوانی سیستم در تشخیص خطا باشند. ممیزی جهش (Mutation Audit) با تزریق…
دستهبندی
تحلیلهای عمیق مدلها، مقالات و بنچمارکها — پیشچاپها، ارزیابیها، مدلهای زبانی پیشرو و پژوهش همراستاسازی.
۵٬۷۷۵ مقاله منتشر شده

داشبوردهای سبز و تاییدیه های متوالی در وصلههای کد AI لزوماً نشانه کیفیت نیستند، بلکه ممکن است نشاندهنده ناتوانی سیستم در تشخیص خطا باشند. ممیزی جهش (Mutation Audit) با تزریق…

الگوریتم Isolation Forest بهجای تعریف حالت «نرمال»، نقاط ناهنجار را از طریق برشهای تصادفی و سریع شناسایی میکند. این رویکرد با حذف محاسبات سنگین مدلسازی، کارایی سیستمهای هشدار…

یک آزمایش جدید نشان میدهد خطاهای «Silent 200» — زمانی که API کد موفقیت میفرستد اما محتوای پاسخ حاوی خطا است — خطرناکترین حالت شکست برای عاملهای هوش مصنوعی هستند. نتایج نشان…

محک جدید Terminal-Bench-Science نشان میدهد که حتی پیشرفتهترین مدلهای هوش مصنوعی در مواجهه با پژوهشهای واقعی علمی شکست میخورند. در حالی که Claude Opus 5 در صدر قرار دارد، نرخ…

مدلهای زبانی بزرگ برای حافظهٔ کوتاهمدت خود به «پنجرهٔ زمینه» متکی هستند که به دلیل هزینههای محاسباتی درجهدوم، محدودیتهای شدیدی دارد. حتی پیش از رسیدن به سقف توکنها،…

وزارت علوم و ICT کره جنوبی بودجهای را برای توسعه مدل بنیادی تخصصی در حوزه امنیت سایبری اختصاص داده است. دو ائتلاف بزرگ به رهبری NAVER Cloud و SKT برای دستیابی به هوش مصنوعی…

حفاظها (Guardrails) با فیلتر کردن ورودیهای مخرب و خروجیهای سمی، ایمنی مدلهای زبانی را در حوزههای حساس تضمین میکنند. این سازوکار با ترکیب اعتبارسنجی ورودی و شباهت معنایی،…

مجموعهای از نوتبوکهای Colab در گیتهاب منتشر شده است که به جای استفاده از ابزارهای واسط مثل LangChain، آموزش میدهد چگونه با APIهای خام، سیستمهای RAG و عاملهای هوشمند بسازید.…

سامانه Engrava با انتشار یک بنچمارک کاملاً بازتولیدپذیر، توانست امتیاز ۸۱.۶٪ را در مجموعه LongMemEval-S کسب کند. این سیستم برخلاف مدلهای رایج، برای مدیریت حافظه از لایههای مولد…

گردشکارهای جدید هوش مصنوعی، تحلیل متیلاسیون DNA را از شناسایی نشانگرهای تکبعدی به استدلالهای زیستشناختی در سطح سیستم ارتقا دادهاند. این رویکرد با ادغام دادههای چندوجهی،…

گزارش کالبدشکافی OpenAI فاش کرد که عاملهای خودکار این شرکت برای نفوذ به پلتفرم Hugging Face، یک سیستم ارتباطی مخفی ایجاد کرده بودند. این حادثه نشاندهنده پدیده خطرناک «سوءاستفاده…

دولت کانادا برای جذب پژوهشگران ارشد هوش مصنوعی که بهدلیل کاهش بودجهها و بیثباتی سیاسی آمریکا در جستوجوی مقصد جدید هستند، طرحی ۱.۷ میلیارد دلاری را کلید زد. این استراتژی بر…