پرش به محتوای اصلی
پرش به محتوای مقاله

مدل‌های LLM-JEPA با شبیه‌سازی واقعیت نرخ توهم را در Llama3 و Gemma2 کاهش دادند

·۱۵ شهریور ۱۴۰۵۵ دقیقه مطالعه
شش پیشرفت کلیدی مدل جهان JEPA برای توقف توهمات مدل‌های زبانی بزرگ
شش پیشرفت کلیدی مدل جهان JEPA برای توقف توهمات مدل‌های زبانی بزرگ
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی پیش‌بینی توکن با پیش‌بینی نمایش‌های انتزاعی در فضای نهان؛ این اولین بار است که مدل‌های وزن‌باز مانند Llama3 با معماری JEPA برای کاهش توهمات ترکیب شده‌اند.

تصور کنید به جای اینکه یک مدل هوش مصنوعی فقط کلمات بعدی را حدس بزند، بتواند ساختار علت و معلولی دنیای فیزیکی را در ذهن خود شبیه‌سازی کند. این تغییر رویکرد، کلید خروج از تله‌ی «لفظ‌گرایی» است که منجر به توهمات مدل‌های فعلی می‌شود. این چالش ریشه‌ای است که در بررسی ۵ الگوی معماری برای مهار توهم در مدل‌های زبانی بزرگ به تفصیل مورد تحلیل قرار دادیم.

طبق مستندات منتشرشده در سپتامبر ۲۰۲۵، چارچوب LLM-JEPA ثابت می‌کند که پیوند دادن مدل‌های زبانی به مدل‌های دنیای نهان، توهمات را به‌شدت کاهش می‌دهد. این سیستم‌ها به جای پیش‌بینی توکن‌های خام، نمایش‌های انتزاعی را پیش‌بینی می‌کنند و از توصیف صرف دنیا به سمت مدل‌سازی ساختار علی آن حرکت می‌کنند.

بیشتر مدل‌های زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — از نظر درک واقعیت فیزیکی سطحی هستند؛ چون برای پیش‌بینی کلمه بعدی آموزش دیده‌اند، نه پیش‌بینی وضعیت بعدی یک سیستم فیزیکی. این شکاف اغلب منجر به شکست آن‌ها در استدلال‌های ساده‌ی علت و معلولی می‌شود. مدل‌های زبانی به‌طور قابل‌توجهی فصیح اما به‌طرز خجالت‌آوری لفظ‌گرا هستند؛ وقتی از آن‌ها خواسته می‌شود یک وظیفه فیزیکی را برنامه‌ریزی کنند، نقاط ضعف درک آن‌ها به‌سرعت آشکار می‌شود. همان‌طور که در تحلیل قبلی ما درباره‌ی مدیریت تأخیر در برنامه‌های بلادرنگ اشاره کردیم، صنعت اکنون به سمت حل مشکل عمیق‌ترِ «مبنی‌سازی شناختی» (Cognitive Grounding) حرکت می‌کند. این تغییر مسیر در قالب مجموعه‌ای از پژوهش‌های منتشرشده بین اواسط ۲۰۲۵ تا اواسط ۲۰۲۶ رخ داده است.

یان لکون (Yann LeCun)، دانشمند ارشد هوش مصنوعی متا و برنده جایزه تورینگ، مدت‌هاست استدلال می‌کند که پیش‌بینی توکن برای رسیدن به هوش عمومی کافی نیست. او سیستمی ترکیبی را پیشنهاد می‌دهد که در آن LLM زبان و استدلال انتزاعی را مدیریت کند و یک مدل دنیای JEPA (معماری پیش‌بین جاسازی مشترک)، شبیه‌سازی فیزیکی و برنامه‌ریزی عملیات را بر عهده بگیرد. تفاوت اصلی در این است که JEPA در یک فضای نهان (Latent Space) پیش‌بینی می‌کند و نویزهای سطحی و نیاز به پر کردن تک‌تک پیکسل‌ها یا کلمات گمشده را نادیده می‌گیرد تا روی ساختارهای علی سطح بالا تمرکز کند. لکون استدلال می‌کند که همین پیش‌بینی در فضای نهان است که تفاوتی میان مدلی که واقعاً یک موقعیت را درک می‌کند و مدلی که صرفاً می‌تواند آن را توصیف کند، ایجاد می‌کند.

پیش‌بینی نهان و محک‌های ارزیابی

چارچوب LLM-JEPA هر دو هدف آموزش را به‌طور هم‌زمان اجرا می‌کند. این سیستم یک هدف آموزشی استاندارد LLM را در کنار یک هدف JEPA اجرا می‌کند. این مدل از مجموعه‌داده‌هایی با نماهای مختلف از یک دانش (عمدتاً متن و کد) استفاده می‌کند تا نمایش‌هایی در فضای نهان یاد بگیرد. در این فرآیند، مدل سعی می‌کند نمایش یک نما را از روی نمای دیگر پیش‌بینی کند، به جای اینکه آن را توکن به توکن بازسازی نماید.

به گزارش وب‌سایت dev.to، این متد در چندین خانواده مدل از جمله Llama3، Gemma2، OpenELM و Olmo عملکرد بهتری نسبت به آموزش‌های استاندارد داشت. این پیشرفت‌ها در محک‌های متنوعی مشاهده شد و نشان داد که نتایج صرفاً حاصل بیش‌برازش (Overfitting) روی داده‌های تست نیستند:

  • GSM8K: بهبود در استدلال‌های ریاضی.
  • Spider: تولید بهتر پرس‌وجوهای ساختاریافته.
  • RottenTomatoes: طبقه‌بندی دقیق‌تر احساسات.

مبنی‌سازی از طریق شبیه‌سازی

پروژه‌ی «LLMs Meet World Models» از محیط شبیه‌ساز VirtualHome برای جمع‌آوری مسیرهای اکتشافی از طریق کاوش‌های تصادفی و برنامه‌ریزی هدفمند استفاده کرد. این محیط شبیه‌سازی خانگی اجازه می‌دهد تا مدل‌ها تعاملات فیزیکی را تجربه کنند.

این مسیرها به وظایفی نظیر شناسایی فعالیت، تولید برنامه، شمارش اشیاء و ردیابی مسیر تبدیل شدند. بر اساس گزارش پژوهشگران، این روش منجر به بهبود ۶۴.۲۸ درصدی در ۱۸ وظیفه مختلف شد؛ هرچند این عدد از ارزیابی خودِ محققان به دست آمده و بازتولید مستقل آن هنوز در جریان است.

برای جلوگیری از فراموشی فاجعه‌بار (Catastrophic Forgetting) و حفظ توانایی‌های زبانی عمومی، محققان از ترکیب لورا (LoRA) و روش تثبیت وزن‌های الاستیک (Elastic Weight Consolidation) استفاده کردند. این تکنیک مهندسی خاص، میزان تغییر وزن‌هایی را که برای وظایف قبلی حیاتی هستند، محدود می‌کند تا آموزش جدید باعث تخریب دانش پیشین نشود.

همچنین چارچوب GLIMO (مبنی‌سازی مدل زبانی بزرگ با مدل دنیای ناقص) برای حل مشکل کمبود داده‌های واقعی — که اغلب خصوصی، گران‌قیمت و فاقد موارد خاص (Edge Cases) هستند — از شبیه‌سازهای جایگزین استفاده می‌کند. GLIMO نیازی به شبیه‌سازی که واقعیت را دقیقاً بازتولید کند ندارد و تنها به محیطی کنترل‌شده و برنامه‌ریزی‌شده نیاز دارد که قادر به تولید مسیرهای ساختاری صحیح باشد.

مکانیزم‌های GLIMO

  • تولید عامل‌محور: استفاده از یک عامل LLM برای ساخت خودکار مجموعه‌داده‌های دستوری.
  • ماژول خود-اصلاح‌گر: فرآیندی تکرارشونده که خروجی‌ها را پیش از رسیدن به مدل، فیلتر و بهبود می‌بخشد.
  • سنتز مقیاس‌پذیر: رفع گلوگاه‌های داده در حوزه‌هایی مانند رباتیک و رانندگی خودکار که داده‌های واقعی برچسب‌دار در آن‌ها کمیاب است.

مدل‌های صنعتی و خود-ارجاعی

در اوت ۲۰۲۶، مطالعه‌ای روی تصفیه‌خانه‌های فاضلاب نشان داد که مبنی‌سازی زنده در حوزه‌هایی که خطاهای علی هزینه‌های عملیاتی واقعی دارند، بسیار مؤثر است. محققان سه حالت مبنی‌سازی را مقایسه کردند که موفق‌ترین آن‌ها از یک مدل منجمد (Frozen) Qwen2.5-32B-Instruct استفاده می‌کرد.

در این رویکرد، به جای گنجاندن دانش در وزن‌های مدل، سیستم در لحظه‌ی استنتاج (Inference) — همان لحظه‌ای که مدل واقعاً جواب تولید می‌کند، شبیه به آشپزی بعد از یادگیری دستور پخت — فراخوانی‌های ابزاری زنده به یک شبیه‌ساز فعال انجام داد. مدل پرس‌وجوهایی را به شبیه‌ساز ارسال کرد و پاسخ‌های علی را از روی نتایج عددی سنتز نمود. این امر نشان می‌دهد که نگه داشتن شبیه‌ساز به‌صورت خارجی و قابل پرس‌وجو، ممکن است از تنظیم دقیق پارامتریک (Parametric Fine-tuning) بهتر عمل کند. در این راستا، بهینه‌سازی سرعت استنتاج در لبه‌های سخت‌افزاری اهمیت می‌یابد، مشابه آنچه در تلاش‌های DSpark برای افزایش سرعت پاسخ‌دهی عامل‌های هوشمند مشاهده شد.

در رویکردی دیگر، از یک بازیاب کوچک (Retriever) استفاده شد؛ یک bi-encoder ترنسفورمر جمله‌ای با حدود ۱۱۰ میلیون پارامتر که روی جفت‌های «پرسش-پارامتر» تولید شده از طریق نمونه‌برداری مونت‌کارلو آموزش دیده بود. این بازیاب، زیرمجموعه‌های پارامترهای علی مرتبط را برای مدل انتخاب می‌کند تا مدل بر اساس آن‌ها شرطی شود.

در نهایت، چارچوب Simia از خودِ LLM به عنوان شبیه‌ساز استفاده می‌کند. Simia-SFT مدل را وادار می‌کند تا مسیرهای عامل — شامل تناوب بین پرس‌وجوهای کاربر، مراحل استدلال، فراخوانی ابزار و مشاهدات محیطی شبیه‌سازی‌شده — را بدون نیاز به محیط تست واقعی تولید کند. این مسیرهای سنتزی سپس به عنوان داده‌های تنظیم دقیق نظارت‌شده (SFT) به کار می‌روند.

Simia-RL این روند را به یادگیری تقویتی گسترش می‌دهد و از بازخوردهای تولیدشده توسط LLM به عنوان سیگنال آموزش استفاده می‌کند. با این حال، این پرسش باقی است که آیا این چرخه بسته، خطاهای موجود را تقویت می‌کند یا خیر، به‌ویژه در محیط‌های جدیدی که خارج از توزیع داده‌های اصلی مدل هستند.

این چرخش به سمت مدل‌های دنیا نشان می‌دهد که مرز بعدی هوش مصنوعی، نه مجموعه‌داده‌های بزرگ‌تر، بلکه مبنی‌سازی ساختاری بهتر است. برای متخصصان، این به معنای فاصله گرفتن از مهندسی پرامپت (Prompt Engineering) — هنر سؤال درست پرسیدن برای گرفتن بهترین جواب — و حرکت به سمت ادغام مدل‌ها با شبیه‌سازهای خارجی است تا قابلیت اطمینان واقعی تضمین شود.

منتظر بازتولیدهای مستقل نتایج VirtualHome باشید تا مشخص شود آیا بهبود ۶۴ درصدی در خارج از ارزیابی‌های اولیه محققان نیز برقرار است یا خیر.

گام بعدی شما

  • بررسی مستندات مدل‌های Llama3 و Gemma2 برای یافتن پیاده‌سازی‌های مبتنی بر فضای نهان.
  • جایگزینی متدهای سنتی پرامپت‌نویسی با اتصال مدل‌ها به شبیه‌سازهای محیطی در پروژه‌های حساس به دقت.
  • دنبال کردن نتایج بازتولید مستقل داده‌های VirtualHome برای تأیید نرخ بهبود ۶۴ درصدی.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این تحول با تکیه بر اعتبار علمی یان لکون، معماری LLMها را از پیش‌بینی آماری به سمت درک ساختاری می‌برد. نتیجه این تغییر، کاهش چشمگیر توهمات در کاربردهای صنعتی و رباتیک است که خطای آن‌ها هزینه‌های واقعی دارد.

تأثیر برای ایران

این پیشرفت برای پژوهشگران مدل‌های بنیادی در ایران که با محدودیت منابع محاسباتی روبرو هستند، فرصتی است تا به جای افزایش اندازه مدل، روی بهینه‌سازی معماری و مبنی‌سازی متمرکز شوند.

·نگاه ما
تحریریه دات‌هوش

تمرکز بر فضای نهان به جای توکن‌ها، در واقع پذیرش این واقعیت است که زبان تنها یک لایه از شناخت است و نه کل آن. این رویکرد احتمالاً باعث می‌شود مدل‌های آینده از «طوطی‌های احتمالی» به «معماران علی» تبدیل شوند که می‌توانند پیش از پاسخ، پیامدهای فیزیکی آن را شبیه‌سازی کنند. در عمل، این یعنی کاهش وابستگی به حجم داده و افزایش تکیه بر ساختار معماری.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.