پرش به محتوای اصلی

موضوع

استدلال

Chain-of-thought, reasoning models (o-series, R-series), test-time compute

۱٬۰۹۸ مقاله منتشر شده

محیط‌هایی برای هوشی که سازگار می‌شود
آموزش کاربردی

«جلوگیری از توقف رشد مدل‌ها» با شبیه‌سازی بازارهای مالی در E.env

شرکت E.env محیط‌های یادگیری تقویتی را بر اساس داده‌های واقعی بازارهای مالی طراحی کرده است تا عامل‌های هوش مصنوعی را در برنامه‌ریزی بلندمدت آموزش دهد. این سیستم برخلاف بنچمارک‌های…

۱ دقیقه خواندن
نمودار مقایسه دقت مدل‌های زبانی بزرگ در شناسایی پردازنده باینری بدون سیستم‌عامل
آموزش کاربردی

مدل‌های زبانی محلی در تشخیص پردازنده‌های سخت‌افزاری شکست خوردند

یک محک ارزیابی نشان می‌دهد مدل‌های زبانی محلی در مهندسی معکوس، نرخ خطای بالایی در شناسایی پردازنده‌های مستندنشده دارند. این مدل‌ها دستورالعمل‌های صحیح دستوری را با کد منطقی اشتباه…

۶ دقیقه خواندن
ابررایانه Alpamayo 2 انویدیا توسعه ربات‌تاکسی را برای استفاده تجاری ممکن ساخت
اخبار کوتاه روزانه

چگونه Alpamayo 2 Super کیفیت داده‌های آموزشی روبوتاکسی را ارتقا می‌دهد؟

انویدیا مدل استدلالی ۳۴ میلیارد پارامتری Alpamayo 2 Super را با مجوز تجاری منتشر کرد. این مدل به‌عنوان یک «معلم» برای تولید داده‌های آموزشی باکیفیت و زنجیره‌های استدلالی برای…

۵ دقیقه خواندن
ساخت یک ارزیابی هوش مصنوعی از دیتاست هاگینگ‌فیس بدون نوشتن کد پایتون
آموزش کاربردی

آیا می‌توان بدون اسکریپت‌های پایتونی دقت مدل‌های هوش مصنوعی را سنجید؟

شرکت Quantiles ابزاری برای بنچمارک‌گیری از مدل‌های هوش مصنوعی عرضه کرده است که نیاز به نوشتن اسکریپت‌های پایتونی را حذف می‌کند. توسعه‌دهندگان اکنون می‌توانند تنها با فایل‌های…

۷ دقیقه خواندن
عکسی از یک دستیار هوشمند که اطلاعات شخصی کاربر را نمایش می‌دهد.
آموزش کاربردی

موتور بازتاب: استخراج پروندهٔ رفتاری پنهان از حافظهٔ عامل‌های هوش مصنوعی

یک متد جدید به نام «موتور بازتاب» اجازه می‌دهد کاربران پروفایل رفتاری جامعی را که عامل‌های هوش مصنوعی به‌صورت پنهانی از داده‌های شخصی آن‌ها ساخته‌اند، استخراج کنند. این موضوع شکاف…

۷ دقیقه خواندن۱
نمودار مقایسه دقت پیش‌بینی مدل‌های زبانی بزرگ و روش‌های کلاسیک در داده‌های جدولی

مدل‌های کلاسیک در برابر LLMها؛ پایداری در ابعاد بالا

بررسی‌های فنی نشان می‌دهد ضعف مدل‌های زبانی بزرگ در تحلیل داده‌های جدولی به‌دلیل توکن‌سازی یا نویز نیست، بلکه با افزایش ابعاد داده، دقت آن‌ها به‌شدت افت می‌کند. در حالی که مدل‌های…

۲ دقیقه خواندن۱
آزمایش ۴ مدل محلی کوچک: شاید کوچک‌ترین مدل شما، بهترین انتخاب باشد
آموزش کاربردی

دقت مدل‌های کوچک در برابر مدل‌های حجیم؛ برتری در محاسبات و کدنویسی

یک بنچمارک محلی روی چهار مدل زبانی نشان داد که اندازه مدل تضمینی برای دقت نیست. کوچک‌ترین مدل مورد آزمایش در وظایفی چون محاسبات و کدنویسی، عملکرد بهتری نسبت به مدل‌های بزرگ‌تر…

۲ دقیقه خواندن۲
مدل‌های زبانی بزرگ، تخصص را پاداش می‌دهند: تصویر مقایسه عملکرد متخصصان و غیرمتخصصان در وظایف مختلف
آموزش کاربردی

چرا تخصص کاربر همچنان متغیر اصلی در کیفیت خروجی مدل‌های زبانی است؟

مدل‌های زبانی کاربران را به generalist تبدیل می‌کنند، اما دانش عمیق موضوعی تنها راه دستیابی به نتایج خبره است. بررسی تعامل ترنس تائو با ChatGPT نشان می‌دهد که هدایت مدل نیازمند…

۴ دقیقه خواندن۲
اجراش کن، نخوان: عامل‌های کدنویسی اسکریپت‌های چک را پیش‌بینی می‌کنند به‌جای اجرا
آموزش کاربردی

حذف دسترسی عامل‌های کدنویسی به سورس‌کد برای جلوگیری از توهم استنتاج

عامل‌های هوش مصنوعی به‌جای اجرای اسکریپت‌های تست، سعی می‌کنند با تحلیل کد آن‌ها نتیجه را پیش‌بینی کنند که منجر به اتلاف توکن و خطاهای costly می‌شود. راهکار پیشنهادی، تبدیل این…

۱۲ دقیقه خواندن۱
دوستم مرا به ساختن بازی «خوک‌ها را رد کن» در مهمانی شام دعوت کرد. دو مدل زبانی بزرگ طرحم را بررسی کردند.

حلقهٔ بررسی تخاصمی مدل‌ها ۱۶ باگ بحرانی یک اپلیکیشن را شناس کرد

یک توسعه‌دهنده با به‌کارگیری خط لوله‌ای شامل دو مدل متفاوت، موفق شد تنها در یک شب اپلیکیشنی بدون باگ بسازد. این سیستم با تقابل دو خانوادهٔ مدل، ۱۶ مشکل منحصربه‌فرد را یافت که یک…

۷ دقیقه خواندن۱