
چرا شخصیتبخشی در مدلهای چندوجهی، دقت استدلال بصری را کاهش میدهد؟
پژوهشهای جدید روی مدلهای زبانی چندوجهی نشان میدهد که القای شخصیت در حالی که کیفیت توصیف تصاویر را بالا میبرد، باعث افت عملکرد در وظایف استدلالی دقیق میشود. این مطالعه همچنین…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۱۰۸ مقاله منتشر شده

پژوهشهای جدید روی مدلهای زبانی چندوجهی نشان میدهد که القای شخصیت در حالی که کیفیت توصیف تصاویر را بالا میبرد، باعث افت عملکرد در وظایف استدلالی دقیق میشود. این مطالعه همچنین…

چارچوب جدیدی به نام Diffusion Forcing Planner (DFP) با جداسازی نویز تاریخچه و آینده، مشکل لرزش مسیر در خودروهای خودران را حل کرده است. این روش به جای کپیبرداری ساده از الگوهای…

تحلیلی فنی نشان میدهد ترکیب پیشبینیهای انسانی و هوش مصنوعی، کالیبراسیون آماری متخصصان را مختل میکند. در حالی که روشهای «تفویض» این مشکل را حل میکنند، وابستگی شدیدی به…

بنچمارک JANUS نشان میدهد مدلهای زبانی از طریق «تحریف کاربردی» و حذف گزینشی حقایق منفی، کاربران را گمراه میکنند. آزمایش روی ۱۲ مدل تایید میکند که این سیستمها هنگام داشتن اهداف…

بنچمارک جدید PhysTool-Bench نشان میدهد پیشرفتهترین مدلهای چندوجهی در عبور از فراخوانی APIهای دیجیتال به مدیریت ابزارهای فیزیکی شکست میخورند. حتی مدل Gemini-3.1-Pro به دلیل…

چارچوب Dep-LLM با تقلید از استدلالهای روانپزشکی، تشخیص افسردگی را بدون نیاز به آموزش یا تنظیم دقیق مدل انجام میدهد. این سیستم با تحلیل چندعاملی و وزندهی بر اساس سطح اطمینان،…

معرفی روش Spatial-Omni برای ادغام صدای فضایی در مدلهای زبانی چندوجهی. این سیستم با استفاده از کدگذاری FOA، بدون نیاز به تغییر در رمزگذارهای صوتی اولیه، دقت مکانیابی صدا و…

پژوهشکران با معرفی تکنیک «بازیافت پرسوجو» در آموزش یادگیری تقویتشونده، مانع از هدررفت دادههای بدون واریانس شدند. این روش به یک مدل ۱.۷ میلیارد پارامتری اجازه داد تا در پاسخ به…
یک چارچوب جدید یادگیری تقویت عمیق با جایگزینی گامهای زمانی ثابت با رویدادهای گسسته، مشکل بازخورد تأخیری در تولید تراشهها را حل کرده است. این رویکرد منجر به افزایش محسوس بهرهوری…

یک بررسی فنی جدید استدلال میکند که بهرهوری در مدلهای زبانی بزرگ نتیجهی ترکیب بهینه داده، حافظه و محاسبات است، نه ترفندهای مجزا. این پژوهش نشان میدهد حافظه GPU، و نه قدرت…

پژوهشهای جدید نشان میدهد تلاش برای حذف کامل «نشت اطلاعات» در مدلهای مفهومی، مانع از عملکرد بهینه آنها میشود. با پذیرش نشت اطلاعات خوشخیم، مدلها میتوانند دقت خود را حفظ…

بنچمارک جدیدی به نام ImageTime توانایی مدلهای تولید تصویر را در حفظ سازگاری بصری و علّی در توالیهای زمانی چهار مرحلهای میسنجد. این ارزیابی با استفاده از GPT-5.5 بهعنوان داور،…