پرش به محتوای اصلی

موضوع

استدلال

Chain-of-thought, reasoning models (o-series, R-series), test-time compute

۱٬۷۸۸ مقاله منتشر شده

نمودار مقایسه دقت پیش‌بینی مدل‌های زبانی بزرگ و روش‌های کلاسیک در داده‌های جدولی

مدل‌های کلاسیک در برابر LLMها؛ پایداری در ابعاد بالا

بررسی‌های فنی نشان می‌دهد ضعف مدل‌های زبانی بزرگ در تحلیل داده‌های جدولی به‌دلیل توکن‌سازی یا نویز نیست، بلکه با افزایش ابعاد داده، دقت آن‌ها به‌شدت افت می‌کند. در حالی که مدل‌های…

۲ دقیقه خواندن۱
آزمایش ۴ مدل محلی کوچک: شاید کوچک‌ترین مدل شما، بهترین انتخاب باشد
آموزش کاربردی

دقت مدل‌های کوچک در برابر مدل‌های حجیم؛ برتری در محاسبات و کدنویسی

یک بنچمارک محلی روی چهار مدل زبانی نشان داد که اندازه مدل تضمینی برای دقت نیست. کوچک‌ترین مدل مورد آزمایش در وظایفی چون محاسبات و کدنویسی، عملکرد بهتری نسبت به مدل‌های بزرگ‌تر…

۲ دقیقه خواندن۲
مدل‌های زبانی بزرگ، تخصص را پاداش می‌دهند: تصویر مقایسه عملکرد متخصصان و غیرمتخصصان در وظایف مختلف
آموزش کاربردی

چرا تخصص کاربر همچنان متغیر اصلی در کیفیت خروجی مدل‌های زبانی است؟

مدل‌های زبانی کاربران را به generalist تبدیل می‌کنند، اما دانش عمیق موضوعی تنها راه دستیابی به نتایج خبره است. بررسی تعامل ترنس تائو با ChatGPT نشان می‌دهد که هدایت مدل نیازمند…

۴ دقیقه خواندن۲
اجراش کن، نخوان: عامل‌های کدنویسی اسکریپت‌های چک را پیش‌بینی می‌کنند به‌جای اجرا
آموزش کاربردی

حذف دسترسی عامل‌های کدنویسی به سورس‌کد برای جلوگیری از توهم استنتاج

عامل‌های هوش مصنوعی به‌جای اجرای اسکریپت‌های تست، سعی می‌کنند با تحلیل کد آن‌ها نتیجه را پیش‌بینی کنند که منجر به اتلاف توکن و خطاهای costly می‌شود. راهکار پیشنهادی، تبدیل این…

۱۲ دقیقه خواندن۲
دوستم مرا به ساختن بازی «خوک‌ها را رد کن» در مهمانی شام دعوت کرد. دو مدل زبانی بزرگ طرحم را بررسی کردند.

حلقهٔ بررسی تخاصمی مدل‌ها ۱۶ باگ بحرانی یک اپلیکیشن را شناس کرد

یک توسعه‌دهنده با به‌کارگیری خط لوله‌ای شامل دو مدل متفاوت، موفق شد تنها در یک شب اپلیکیشنی بدون باگ بسازد. این سیستم با تقابل دو خانوادهٔ مدل، ۱۶ مشکل منحصربه‌فرد را یافت که یک…

۷ دقیقه خواندن۱
تصویر: انتخاب یک مدل هوش مصنوعی برای تمام کارها را متوقف کنید؛ وظایف را بر اساس ریسک، استدلال و بازبینی مسیریابی کنید.
آموزش کاربردی

مدل‌های تک‌رویکردی در برابر مسیریابی ریسک؛ راهکار Jeda برای مدیریت بارهای کاری

استفاده از یک مدل واحد برای تمام وظایف تجاری، ریسک‌های امنیتی و تأخیرهای عملیاتی ایجاد می‌کند. چارچوب جدید Jeda پیشنهاد می‌کند بارهای کاری بر اساس حساسیت، پیچیدگی و تازگی داده‌ها…

۱۱ دقیقه خواندن۲
هم‌بنیان‌گذار اوپن‌ای‌ای در جستجوی «ویب تست» بعدی هوش مصنوعی: از تک‌شاخ تا پلیکان و سرزمین میانه

کارپاتی: تبدیل توصیفات تولکین به محیط‌های سه‌بعدی توسط Claude Opus 5

اندریج کارپاتی با استفاده از مدل Claude Opus 5، توصیفات ادبی کتاب «ارباب حلقه‌ها» را به محیط‌های گرافیکی سه‌بعدی در مرورگر تبدیل کرد. این آزمایش نشان می‌دهد که هوش مصنوعی در حال…

۲ دقیقه خواندن
دکمه خلاقیت نیست. اینجا ببینید واقعاً چه‌کار می‌کند.
آموزش کاربردی

«توزیع احتمالات نه خلاقیت»؛ تحلیل عملکرد پارامتر Temperature در LLM

بسیاری از توسعه‌دهندگان Temperature را به اشتباه یک «لغزنده خلاقیت» می‌بینند، در حالی که این پارامتر صرفاً توزیع احتمالی توکن‌ها را تغییر می‌دهد. تنظیمات بالا ایده‌های جدید خلق…

۴ دقیقه خواندن۱
تیم Cogent AI مدل VR-1 را منتشر کرد: مدل استدلال سایبری پیشرفته برای ترکیب و تأیید مسیرهای حمله سازمانی

مدل VR-1 شرکت Cogent AI مسیرهای حمله را ۲ برابر بیشتر از Claude Opus یافت

شرکت Cogent AI مدل استدلالی VR-1 را برای طراحی و تأیید زنجیره‌های پیچیده حمله در محیط‌های سازمانی عرضه کرد. این مدل برخلاف مدل‌های عمومی، به‌جای شناسایی تک‌باگ‌ها بر اجرای نفوذهای…

۴ دقیقه خواندن
مدل جستجوی نوروسمبولیک Ontology 1 با دقت ۲.۷ برابر موتورهای جستجوی برتر تجارت الکترونیک جهان

مدل Ontology 1 دقت جست‌وجوی محصولات را در برابر گوگل و آمازون بالا برد

شرکت Onton مدل هوش مصنوعی Neurosymbolic را معرفی کرد که با استفاده از گراف دانش، در پاسخ به پرس‌وجوهای پیچیده تجاری، گوگل شاپینگ و آمازون را شکست می‌دهد. این مدل به‌جای تکیه بر…

۴ دقیقه خواندن۲