پرش به محتوای اصلی

موضوع

استدلال

Chain-of-thought, reasoning models (o-series, R-series), test-time compute

۱٬۶۸۴ مقاله منتشر شده

نمودار مقایسه دقت مدل‌های زبانی بزرگ در شناسایی پردازنده باینری بدون سیستم‌عامل
آموزش کاربردی

مدل‌های زبانی محلی در تشخیص پردازنده‌های سخت‌افزاری شکست خوردند

یک محک ارزیابی نشان می‌دهد مدل‌های زبانی محلی در مهندسی معکوس، نرخ خطای بالایی در شناسایی پردازنده‌های مستندنشده دارند. این مدل‌ها دستورالعمل‌های صحیح دستوری را با کد منطقی اشتباه…

۶ دقیقه خواندن
ابررایانه Alpamayo 2 انویدیا توسعه ربات‌تاکسی را برای استفاده تجاری ممکن ساخت

چگونه Alpamayo 2 Super کیفیت داده‌های آموزشی روبوتاکسی را ارتقا می‌دهد؟

انویدیا مدل استدلالی ۳۴ میلیارد پارامتری Alpamayo 2 Super را با مجوز تجاری منتشر کرد. این مدل به‌عنوان یک «معلم» برای تولید داده‌های آموزشی باکیفیت و زنجیره‌های استدلالی برای…

۵ دقیقه خواندن
ساخت یک ارزیابی هوش مصنوعی از دیتاست هاگینگ‌فیس بدون نوشتن کد پایتون
آموزش کاربردی

آیا می‌توان بدون اسکریپت‌های پایتونی دقت مدل‌های هوش مصنوعی را سنجید؟

شرکت Quantiles ابزاری برای بنچمارک‌گیری از مدل‌های هوش مصنوعی عرضه کرده است که نیاز به نوشتن اسکریپت‌های پایتونی را حذف می‌کند. توسعه‌دهندگان اکنون می‌توانند تنها با فایل‌های…

۷ دقیقه خواندن
عکسی از یک دستیار هوشمند که اطلاعات شخصی کاربر را نمایش می‌دهد.
آموزش کاربردی

موتور بازتاب: استخراج پروندهٔ رفتاری پنهان از حافظهٔ عامل‌های هوش مصنوعی

یک متد جدید به نام «موتور بازتاب» اجازه می‌دهد کاربران پروفایل رفتاری جامعی را که عامل‌های هوش مصنوعی به‌صورت پنهانی از داده‌های شخصی آن‌ها ساخته‌اند، استخراج کنند. این موضوع شکاف…

۷ دقیقه خواندن۱
نمودار مقایسه دقت پیش‌بینی مدل‌های زبانی بزرگ و روش‌های کلاسیک در داده‌های جدولی

مدل‌های کلاسیک در برابر LLMها؛ پایداری در ابعاد بالا

بررسی‌های فنی نشان می‌دهد ضعف مدل‌های زبانی بزرگ در تحلیل داده‌های جدولی به‌دلیل توکن‌سازی یا نویز نیست، بلکه با افزایش ابعاد داده، دقت آن‌ها به‌شدت افت می‌کند. در حالی که مدل‌های…

۲ دقیقه خواندن۱
آزمایش ۴ مدل محلی کوچک: شاید کوچک‌ترین مدل شما، بهترین انتخاب باشد
آموزش کاربردی

دقت مدل‌های کوچک در برابر مدل‌های حجیم؛ برتری در محاسبات و کدنویسی

یک بنچمارک محلی روی چهار مدل زبانی نشان داد که اندازه مدل تضمینی برای دقت نیست. کوچک‌ترین مدل مورد آزمایش در وظایفی چون محاسبات و کدنویسی، عملکرد بهتری نسبت به مدل‌های بزرگ‌تر…

۲ دقیقه خواندن۲
مدل‌های زبانی بزرگ، تخصص را پاداش می‌دهند: تصویر مقایسه عملکرد متخصصان و غیرمتخصصان در وظایف مختلف
آموزش کاربردی

چرا تخصص کاربر همچنان متغیر اصلی در کیفیت خروجی مدل‌های زبانی است؟

مدل‌های زبانی کاربران را به generalist تبدیل می‌کنند، اما دانش عمیق موضوعی تنها راه دستیابی به نتایج خبره است. بررسی تعامل ترنس تائو با ChatGPT نشان می‌دهد که هدایت مدل نیازمند…

۴ دقیقه خواندن۲
اجراش کن، نخوان: عامل‌های کدنویسی اسکریپت‌های چک را پیش‌بینی می‌کنند به‌جای اجرا
آموزش کاربردی

حذف دسترسی عامل‌های کدنویسی به سورس‌کد برای جلوگیری از توهم استنتاج

عامل‌های هوش مصنوعی به‌جای اجرای اسکریپت‌های تست، سعی می‌کنند با تحلیل کد آن‌ها نتیجه را پیش‌بینی کنند که منجر به اتلاف توکن و خطاهای costly می‌شود. راهکار پیشنهادی، تبدیل این…

۱۲ دقیقه خواندن۱
دوستم مرا به ساختن بازی «خوک‌ها را رد کن» در مهمانی شام دعوت کرد. دو مدل زبانی بزرگ طرحم را بررسی کردند.

حلقهٔ بررسی تخاصمی مدل‌ها ۱۶ باگ بحرانی یک اپلیکیشن را شناس کرد

یک توسعه‌دهنده با به‌کارگیری خط لوله‌ای شامل دو مدل متفاوت، موفق شد تنها در یک شب اپلیکیشنی بدون باگ بسازد. این سیستم با تقابل دو خانوادهٔ مدل، ۱۶ مشکل منحصربه‌فرد را یافت که یک…

۷ دقیقه خواندن۱
تصویر: انتخاب یک مدل هوش مصنوعی برای تمام کارها را متوقف کنید؛ وظایف را بر اساس ریسک، استدلال و بازبینی مسیریابی کنید.
آموزش کاربردی

مدل‌های تک‌رویکردی در برابر مسیریابی ریسک؛ راهکار Jeda برای مدیریت بارهای کاری

استفاده از یک مدل واحد برای تمام وظایف تجاری، ریسک‌های امنیتی و تأخیرهای عملیاتی ایجاد می‌کند. چارچوب جدید Jeda پیشنهاد می‌کند بارهای کاری بر اساس حساسیت، پیچیدگی و تازگی داده‌ها…

۱۱ دقیقه خواندن۲
هم‌بنیان‌گذار اوپن‌ای‌ای در جستجوی «ویب تست» بعدی هوش مصنوعی: از تک‌شاخ تا پلیکان و سرزمین میانه

کارپاتی: تبدیل توصیفات تولکین به محیط‌های سه‌بعدی توسط Claude Opus 5

اندریج کارپاتی با استفاده از مدل Claude Opus 5، توصیفات ادبی کتاب «ارباب حلقه‌ها» را به محیط‌های گرافیکی سه‌بعدی در مرورگر تبدیل کرد. این آزمایش نشان می‌دهد که هوش مصنوعی در حال…

۲ دقیقه خواندن