پرش به محتوای اصلی

موضوع

استدلال

Chain-of-thought, reasoning models (o-series, R-series), test-time compute

۱٬۶۸۸ مقاله منتشر شده

مسیریابی مدل ساده است. تا وقتی که نیست.
آموزش کاربردی

الگوریتم‌های بهینه‌ساز در برابر روترهای ساده در مدیریت حافظهٔ مدل‌ها

رویکردهای ساده برای توزیع وظایف بین مدل‌های ارزان و گران به‌دلیل نادیده گرفتن زیرساخت و حافظه موقت، هزینه‌ها را افزایش می‌دهند. جایگزینی این روش با الگوریتم‌های بهینه‌ساز…

۵ دقیقه خواندن
مدل هدف‌مند عمومی ماینکرفت - پانتوگراف

آیا تماشای ویدیوهای اینترنتی می‌تواند جایگزین برچسب‌گذاری داده‌ها شود؟

شرکت Pantograph مدلی با ۴ میلیارد پارامتر به نام Pan توسعه داده که بدون نیاز به داده‌های برچسب‌گذاری‌شده، تنها از طریق تماشای ویدیوهای اینترنتی، رفتارهای هدفمند را یاد می‌گیرد.…

۱۵ دقیقه خواندن
همکاری Supply Co. و Work Louدر: کیبورد و ماوس ارگونومیک برای کار مدرن

OpenAI با Codex Micro کنترل عامل‌های هوش مصنوعی را به دنیای فیزیکی آورد

شرکت OpenAI با همکاری Work Louder سخت‌افزار Codex Micro را برای مدیریت مستقیم عامل‌های هوش مصنوعی معرفی کرد. این دستگاه با استفاده از کلیدهای مکانیکی و پیچ‌های چرخشی، امکان تنظیم…

۱ دقیقه خواندن۲
فضای J، مدل‌های متن‌باز — نسخه ۲

بردار‌های هدایت مفاهیم در مدل‌های مختلف هوش مصنوعی با چرخش خطی منتقل می‌شوند

پژوهش‌های جدید نشان می‌دهد بردار‌های هدایت (Steering Vectors) یک مدل زبانی را می‌توان با یک چرخش ریاضی ساده به مدل دیگری از خانواده‌ای متفاوت منتقل کرد. این یافته ثابت می‌کند…

۲۰ دقیقه خواندن
مدل زبانی بزرگ با تأخیر کم برای تولید متن طبیعی
آموزش کاربردی

آیا معماری MoE می‌تواند تأخیر بین‌توکنی را بدون کاهش دقت حذف کند؟

بهینه‌سازی تولید زبان طبیعی نیازمند موازنه بین زمان تا نخستین توکن و تأخیر بین‌توکنی است. استفاده از معماری ترکیب خبره‌ها اجازه می‌دهد عمق استدلال مدل حفظ شود و در عین حال توان…

۲ دقیقه خواندن
زبان‌های دامنه‌محور، استفاده مطمئن از مدل‌های زبانی بزرگ را ممکن می‌سازند
آموزش کاربردی

زبان‌های تخصصی (DSL) راهکار دستیابی به کدنویسی قابل‌اعتماد با هوش مصنوعی

استفاده از زبان‌های تخصصی (DSL) با محدود کردن فضای خروجی مدل‌ها، احتمال توهم را حذف و صحت سینتکسی را تضمین می‌کند. این رویکرد به توسعه‌دهندگان اجازه می‌دهد حلقه‌های خودکارسازی…

۱۵ دقیقه خواندن
مقایسه GPT و معماری ترکیبی متخصصان در مدل‌های زبانی بزرگ
آموزش کاربردی

معماری ترکیب خبره‌ها، کلید کاهش هزینه‌های استنتاج در مدل‌های زبانی بزرگ

مدل‌های زبانی مدرن بین دو مسیر معماری متراکم و ترکیب خبره‌ها (MoE) تقسیم شده‌اند. در حالی که مدل‌های متراکم از تمام توان خود برای هر پاسخ استفاده می‌کنند، MoE تنها بخش‌های تخصصی…

۳ دقیقه خواندن
بررسی سریع آلودگی داده در معیارهای برنامه‌نویسی هوش مصنوعی با ساخت ابزار کوچک
آموزش کاربردی

گزارش OpenAI: نشت داده‌ها اعتبار بنچ‌مارک‌های کدنویسی را از بین برد

گزارش جدید OpenAI نشان می‌دهد بسیاری از جدول‌های رتبه‌بندی کدنویسی به‌دلیل تداخل داده‌های آموزشی و آزمون غیرقابل‌اعتماد هستند. این تحلیل تأکید می‌کند که نمرات بدون بررسی دقیق نشت…

۲ دقیقه خواندن
طراحی یک هوش مصنوعی راهنما برای بازگرداندن کنترل به دانشجو
آموزش کاربردی

مکانیزم «بازگشت کنترل» در ATL Saathi؛ راهکار گوگل برای جلوگیری از اتکای مطلق

گوگل دیپ‌مایند یک مربی هوش مصنوعی برای آزمایشگاه‌های Atal Tinkering Labs معرفی کرد که به‌جای ارائه پاسخ‌های سریع، اولویت را به تفکر مستقل دانش‌آموز می‌دهد. این سامانه با استفاده…

۲ دقیقه خواندن