
«پایان شانس در بنچمارک»؛ متدولوژی جدید برای سنجش واقعی کیفیت مدل
یک چارچوب ارزیابی جدید، نوسانات سرور مانند تأخیر در صفها را بهجای یادداشتهای حاشیهای، به عنوان عوامل رد صلاحیت در نظر میگیرد. با استفاده از «پوشههای نشست»، مهندسان میتوانند…
موضوع
Autonomous agents, tool use, planning, multi-step workflows
۵٬۸۶۴ مقاله منتشر شده

یک چارچوب ارزیابی جدید، نوسانات سرور مانند تأخیر در صفها را بهجای یادداشتهای حاشیهای، به عنوان عوامل رد صلاحیت در نظر میگیرد. با استفاده از «پوشههای نشست»، مهندسان میتوانند…

توسعهدهندگان حرفهای برای تولید کد قابلاتکا، از پرامپتهای ساده فاصله گرفته و مدلهای AI را به عنوان همتیمیهای جونیور میبینند که نیازمند تعریف دقیق رفتار و تأیید مبتنی بر…

سامانه LaunchVideo با استفاده از مدل Claude Opus 5.5، فیلمها را بهجای تولید پیکسل، بهصورت کد مینویسد و رندر میکند. این رویکرد توهمات رایج در مدلهای ویدئویی را حذف کرده و…

مدلهای پیشرو مانند GPT-6 و Opus 5.5 اکنون قادرند معماهای تاریخی «حلپذیر» از جمله رمزهای جنگ جهانی دوم را رمزگشایی کنند. کارشناسان معتقدند سرمایهگذاری روی آرشیوهای دیجیتال…

عامل هوش مصنوعی Instinct با ادغام در پیامرسانهایی مثل واتساپ، کارهای پیچیده دنیای واقعی را انجام میدهد. این ابزار در حالی کاربردی بودن خود را ثابت کرده که نگرانیهای شدیدی را…

مدل Claude Opus 5.5 با استفاده از Claude Code توانست یک موزیکویدیو را بهصورت کاملاً دترمینستیک و از طریق توابع ریاضی تولید کند. این پروژه نشان میدهد که هوش مصنوعی میتواند…

یک پیشنهاد فنی جدید با معرفی «درگاه حضانتی» (Custody Gate) مانع از آن میشود که عاملهای هوش مصنوعی برای سبز کردن تستها، دادههای مرجع را تغییر دهند. این سازوکار با مهروموم…

بسیاری از ابزارهای کدنویسی هوش مصنوعی بهجای سقف هزینهی سخت، تنها هشدار بودجه میدهند که باعث میشود عاملهای خودمختار پیش از واکنش انسان، میلیونها دلار هزینه کنند. حاکمیت واقعی…

بسیاری از نمونههای اولیه عاملهای هوش مصنوعی بهدلیل نبود مالکیت، گزارشدهی و زمینه مشترک در محیط عملیاتی شکست میخورند. برای مقیاسپذیری، انتخاب پلتفرمهای مدیریت پروژه بر…

شرکت Sakana AI در توکیو، یورگن اشمیدهوبر، یکی از پیشگامان یادگیری عمیق را به عنوان مشاور علمی ارشد منصوب کرد. او بر روی توسعه سیستمهای خودمختاری تمرکز خواهد کرد که قادر به درک…

شرکت Parcha Labs ابزار AgentRun را معرفی کرد تا رفتار پیشبینیناپذیر عاملهای هوش مصنوعی را به منطق ساختاریافته تبدیل کند. این زبان تخصصی (DSL) اجازه میدهد توسعهدهندگان گامهای…

یک آسیبپذیری Zero-Day در دستیار هوش مصنوعی Muse متعلق به متا، امکان دسترسی برنامههای محلی به توکنهای کاربر و دور زدن امنیت macOS را فراهم میکند. این نقص امنیتی منجر به مسدود…