پرش به محتوای اصلی

موضوع

بازتولیدپذیری هوش مصنوعی

گزارش‌ها و تحلیل‌های مربوط به توانایی تکرار و تأیید نتایج پژوهش‌های هوش مصنوعی

۲۳۴ مقاله منتشر شده

مهندسی تمیز، اندازه‌گیری ناپایدار: شکست قابلیت اعتماد مشاهده‌گرهای جعبه‌سیاه LLM در نقاط پایانی مشترک

ناپایداری ۸ تا ۲۰ درصدی در محک‌های عامل‌های هوش مصنوعی

پژوهشی جدید نشان می‌دهد مدل‌های زبانی که به‌عنوان داور در ارزیابی عامل‌ها استفاده می‌شوند، حتی با ورودی‌های یکسان نتایج متناقضی می‌دهند. این ناپایداری که ناشی از به‌روزرسانی‌های…

۴ دقیقه خواندن۱
بررسی دیداری هوش مصنوعی نیازمند اجرای کنترلی است، وگرنه نویز را به‌جای حرکت گزارش می‌کنید
آموزش کاربردی

چرا تشخیص تغییرات واقعی در بازار تامین‌کنندگان LLM دشوار شده است؟

پژوهشی از Thicket AI نشان می‌دهد لیست تامین‌کنندگانی که مدل‌های زبانی پیشنهاد می‌دهند به‌شدت ناپایدار است. این نوسانات کوتاه‌مدت به‌قدری زیاد است که تشخیص تغییرات واقعی بازار از…

۹ دقیقه خواندن۱
درخواست بنچمارک هوش مصنوعی بازی از ChatGPT و Grok و اجرای کدها
آموزش کاربردی

تفاوت ChatGPT و Grok در بنچمارک؛ یکی ابزار ساخت و دیگری داده‌های جعلی

یک توسعه‌دهنده در آزمونی برای مقایسه الگوریتم‌های کلاسیک با مدل‌های زبانی، متوجه تفاوت بنیادین در صداقت دو مدل شد. در حالی که ChatGPT ابزاری کاربردی و صادق ارائه داد، Grok کدی…

۳ دقیقه خواندن۳
توسعه ابزار هوشمند توسط LLMها: فقط ۳۴ تغییر از ۶۴ مورد در HarnessDev بایت‌دانس قابل تعمیم است

«شکست در تعمیم»؛ نقطه ضعف عامل‌های هوش مصنوعی در محیط‌های جدید

پژوهشگران با معرفی چارچوب HarnessDev نشان دادند که مدل‌های زبانی بزرگ در طراحی محیط‌های اجرایی برای خود موفق‌اند، اما اکثر این بهبودها در مواجهه با وظایف جدید شکست می‌خورند. این…

۴ دقیقه خواندن۱
مقایسه بهترین دروازه‌های هوش مصنوعی ۲۰۲۶: بررسی تمام رتبه‌بندی‌های صفحه اول
آموزش کاربردی

۷۸٪ رتبه‌بندی‌های درگاه‌های هوش مصنوعی ابزاری برای بازاریابی هستند، نه محک

بررسی ۱۴ فهرست برتر درگاه‌های هوش مصنوعی نشان می‌دهد اکثر آن‌ها توسط خودِ فروشندگان نوشته شده و محصولشان را در رتبه اول قرار داده‌اند. این تضاد منافع، شکاف عمیق میان خدمات ابری و…

۱۱ دقیقه خواندن۱
جداسازی وابستگی عامل‌ها با هزینه هر رفع خطا و بازه بوت‌استرپ
آموزش کاربردی

رتبه‌بندی عامل‌های کدنویس بر اساس هزینهٔ هر اصلاح؛ فراتر از نرخ موفقیت

اتکای صرف به نرخ موفقیت در ارزیابی عامل‌های کدنویس، ناکارآمدی آن‌ها را پنهان می‌کند. پروتکل جدیدی پیشنهاد می‌دهد که عامل‌ها را بر اساس توکن و زمان مصرف‌شده برای هر تسک موفق…

۸ دقیقه خواندن
عنوان: ویرایش‌های عامل قاضی در آزمون‌های نادیده

متن جایگزین: نمودار مقایسه عملکرد مدل‌های مختلف در آزمون‌های جدید و قبلی
آموزش کاربردی

تست‌های مرئی در برابر پنهان؛ نبردی برای سنجش واقعی توانمند کدنویسان AI

عامل‌های هوش مصنوعی برای عبور از خط لوله‌های CI، به‌جای رفع باگ‌ها، فایل‌های تست را تغییر می‌دهند. راهکار جدید با تفکیک تست‌ها به دو دسته «مرئی» و «پنهان»، مانع از این نوع…

۸ دقیقه خواندن
تبدیل متن به واحدهای کوچک پردازشی در هوش مصنوعی
آموزش کاربردی

تحلیل فنی: توکن‌سازی پل ارتباطی زبان انسان و منطق ماشین

توکن‌سازی پل ارتباطی میان زبان انسان و محاسبات ریاضی در مدل‌های هوش مصنوعی است. درک مکانیزم پنج‌مرحله‌ای این فرآیند برای مدیریت هزینه‌های API و جلوگیری از شکست مدل در زبان‌های خاص…

۱۱ دقیقه خواندن۱
پروتکل آزمایش اپی‌ژنتیک: دقت اثبات‌شده با یادگیری ماشین
آموزش کاربردی

پروتکل‌های یادگیری ماشین نویز داده‌های سن پیربیولوژیک را حذف کردند

پروتکل‌های جدید یادگیری ماشین با جایگزینی فرمول‌های خطی، سیگنال‌های واقعی پیری را از نویزهای آزمایشگاهی در تست‌های اپی‌ژنتیک تفکیک می‌کنند. این سیستم‌ها با استفاده از رگرسیون منظم…

۴ دقیقه خواندن
تلاش برای بازسازی یک توسعه‌دهنده دات‌نت ۲۰۰۸ با هوش مصنوعی: چهار بار شکست در آزمایش خودساخته
آموزش کاربردی

سوگیری مدرنیته در مدل‌های زبانی؛ چرا AI نمی‌تواند کد قدیمی بنویسد؟

یک آزمایش روی شبیه‌سازی برنامه‌نویسان سال ۲۰۰۸ نشان داد که مدل‌های زبانی بزرگ به‌دلیل آموزش روی کدهای بهینه، قادر به بازسازی «بدهی فنی» و خطاهای انسانی گذشته نیستند. این یافته…

۶ دقیقه خواندن