
«جلوگیری از توقف رشد مدلها» با شبیهسازی بازارهای مالی در E.env
شرکت E.env محیطهای یادگیری تقویتی را بر اساس دادههای واقعی بازارهای مالی طراحی کرده است تا عاملهای هوش مصنوعی را در برنامهریزی بلندمدت آموزش دهد. این سیستم برخلاف بنچمارکهای…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۰۹۸ مقاله منتشر شده

شرکت E.env محیطهای یادگیری تقویتی را بر اساس دادههای واقعی بازارهای مالی طراحی کرده است تا عاملهای هوش مصنوعی را در برنامهریزی بلندمدت آموزش دهد. این سیستم برخلاف بنچمارکهای…

دادههای جدید از OpenAI و Anthropic نشان میدهد که استفاده از نقشهای فرضی مانند «تو یک متخصص هستی» تأثیری بر دقت پاسخها ندارد. در مقابل، تعریف دقیق محدودیتها و مشخصات خروجی،…

یک محک ارزیابی نشان میدهد مدلهای زبانی محلی در مهندسی معکوس، نرخ خطای بالایی در شناسایی پردازندههای مستندنشده دارند. این مدلها دستورالعملهای صحیح دستوری را با کد منطقی اشتباه…

انویدیا مدل استدلالی ۳۴ میلیارد پارامتری Alpamayo 2 Super را با مجوز تجاری منتشر کرد. این مدل بهعنوان یک «معلم» برای تولید دادههای آموزشی باکیفیت و زنجیرههای استدلالی برای…

شرکت Quantiles ابزاری برای بنچمارکگیری از مدلهای هوش مصنوعی عرضه کرده است که نیاز به نوشتن اسکریپتهای پایتونی را حذف میکند. توسعهدهندگان اکنون میتوانند تنها با فایلهای…

یک متد جدید به نام «موتور بازتاب» اجازه میدهد کاربران پروفایل رفتاری جامعی را که عاملهای هوش مصنوعی بهصورت پنهانی از دادههای شخصی آنها ساختهاند، استخراج کنند. این موضوع شکاف…

بررسیهای فنی نشان میدهد ضعف مدلهای زبانی بزرگ در تحلیل دادههای جدولی بهدلیل توکنسازی یا نویز نیست، بلکه با افزایش ابعاد داده، دقت آنها بهشدت افت میکند. در حالی که مدلهای…

یک بنچمارک محلی روی چهار مدل زبانی نشان داد که اندازه مدل تضمینی برای دقت نیست. کوچکترین مدل مورد آزمایش در وظایفی چون محاسبات و کدنویسی، عملکرد بهتری نسبت به مدلهای بزرگتر…

نسخه ۳ ThreadWeaver با معرفی «گراف کار علّی»، مسیر تکامل تصمیمات را در Slack، Jira و GitHub ردیابی میکند. این سامانه بهجای تکیه بر شباهت معنایی، بر تبار شواهدی تمرکز کرده تا…

مدلهای زبانی کاربران را به generalist تبدیل میکنند، اما دانش عمیق موضوعی تنها راه دستیابی به نتایج خبره است. بررسی تعامل ترنس تائو با ChatGPT نشان میدهد که هدایت مدل نیازمند…

عاملهای هوش مصنوعی بهجای اجرای اسکریپتهای تست، سعی میکنند با تحلیل کد آنها نتیجه را پیشبینی کنند که منجر به اتلاف توکن و خطاهای costly میشود. راهکار پیشنهادی، تبدیل این…

یک توسعهدهنده با بهکارگیری خط لولهای شامل دو مدل متفاوت، موفق شد تنها در یک شب اپلیکیشنی بدون باگ بسازد. این سیستم با تقابل دو خانوادهٔ مدل، ۱۶ مشکل منحصربهفرد را یافت که یک…