پرش به محتوای اصلی
پرش به محتوای مقاله

JEPA-Anything: یک دستورالعمل یادگیری واحد برای ۷ حوزه علمی مختلف

·۱۴ مهر ۱۴۰۵۴ دقیقه مطالعه
مدل جهانی چندحوزه‌ای JEPA-Anything: یک رویکرد واحد برای هفت حوزه کاربردی
مدل جهانی چندحوزه‌ای JEPA-Anything: یک رویکرد واحد برای هفت حوزه کاربردی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی مکانیزم OPF برای حل مشکل تخصیص ظرفیت در مدل‌های JEPA؛ این اولین بار است که یک دستورالعمل یادگیری واحد، در ۷ دامنه کاملاً ناهمگون (از هواشناسی تا سرطان‌شناسی) با موفقیت عمل می‌کند.

یک دستورالعمل یادگیری واحد اکنون می‌تواند مدل‌های جهانی (World Models) را برای هفت دامنه علمی کاملاً متفاوت بسازد. در ۶ اکتبر ۲۰۲۶، پژوهشگران PhAI Labs و چندین دانشگاه برجسته از جمله CUHK، فودان، استنفورد، آکسفورد و پرینستون، چارچوب JEPA-Anything را معرفی کردند. این چارچوب هدف آن حذف نیاز به طراحی مدل‌های پیش‌بین اختصاصی برای هر حوزه پژوهشی جدید است.

بسیاری از مدل‌های جهانی فعلی از مشکلی به نام «تخصیص ظرفیت» رنج می‌برند. در معماری‌های پیش‌بین تعبیه مشترک (Joint-Embedding Predictive Architectures یا JEPA)، مانند I-JEPA یا V-JEPA 2، معمولاً از یک رمزگذار زمینه (Context Encoder)، یک رمزگذار هدف EMA و یک پیش‌بین (Predictor) استفاده می‌شود. طبق مستندات این پژوهش، یک تعبیه هدف یکپارچه و یکپارچه (Monolithic) باعث می‌شود ساختارهای با واریانس (Variance) بالا بر داده‌ها غالب شوند و حالت‌های ضعیف‌تر اما حیاتی را سرکوب کنند. این امر منجر به ایجاد گرادیان‌های متضاد شده و توانایی مدل برای یادگیری سیستم‌های پیچیده و چندوجهی را مختل می‌کند.

برای حل این مشکل، JEPA-Anything مکانیزم «تجزیه پیش‌بین متعامد» (Orthogonal Predictive Factorization یا OPF) را معرفی می‌کند. در این روش، به‌جای یک هدف واحد، هدف نهان با عرض d به K زیرفضای یادگرفته‌شده با عرض r تقسیم می‌شود (به طوری که d = K × r). در اکثر آزمایش‌ها، مقدار K=4 در نظر گرفته شده است. هر فاکتور پیش‌بین اختصاصی خود را دارد و در نهایت، نتایج با استفاده از شبه‌معکوس مور-پنروز (Moore-Penrose pseudoinverse) از ماتریس پروژکتور ترکیب می‌شوند تا یک حالت نهان کامل برای رمزگشایی، برنامه‌ریزی یا پیش‌بینی (Rollout) ایجاد شود. این رویکرد ترکیب نتایج از زیرفضاهای مختلف، یادآور استراتژی‌های پیشرفته‌تر در مدل‌های ترکیبی است که در آن مدل‌های ثانویه برای خنثی‌سازی خطاهای مدل‌های پایه در ساختارهای Stacking به کار می‌روند تا دقت نهایی افزایش یابد.

Meet Together Link: ابزار خط فرمان رایگان برای اجرای مدل‌های باز مانند Kimi K3 و GLM 5.3 در Claude Code، Codex و OpenCode

به نقل از گزارش تیم توسعه، برای اطمینان از متمایز بودن و مفید بودن این فاکتورها، سه منظم‌ساز (Regularizer) خاص به تابع زیان (Loss Function) اصلی هر دامنه اضافه شده است:

  • زیان متعامد (Orthogonality loss): ستون‌های هر پروژکتور را ارتونرمال نگه می‌دارد و تضمین می‌کند که پروژکتورهای مختلف زیرفضاهای غیرهم‌پوشان را اشغال کنند.
  • زیان فعالیت فاکتور (Factor-activity loss): یک لولای (Hinge) روی انحراف معیار هر مختصه است تا هیچ فاکتوری «مرده» یا غیرفعال نشود.
  • زیان واریانس رمزگذار (Encoder-variance loss): یک سیگنال ضد-فروپاشی (Anti-collapse) مستقیم به رمزگذار آنلاین ارسال می‌کند.

آداپتورهای دامنه، توکن‌بندی و رمزگذارها را مدیریت می‌کنند، در حالی که کتابخانه اصلی، هسته مشترک را تحت عنوان OrthogonalFactorProjection ارائه می‌دهد. این متعامد بودن برای سنتز پایدار حیاتی است. در محیط CITRIS Interventional Pong، یک مدل چندسره بدون محدودیت با ظرفیت مشابه، عدد شرط (Condition number) ۴۳۸.۵۲ داشت؛ در حالی که نسخه متعامد به ۱.۰۰۰۰۵ رسید و هم‌پوشانی بین فاکتورها تقریباً صفر بود.

این چارچوب در حوزه‌های بینایی، زیست‌شناسی، مسیرهای بالینی، کنترل، دینامیک مولکولی، میدان‌های فیزیکی و هواشناسی آزمایش شد. بر اساس گزارش Marktechpost، نتایج در محک‌های معتبری چون CausalWorld، DeepMind Control، PDEBench و WeatherBench2 بسیار چشمگیر بود.

گروه اول: بازخوانی نهایی (Terminal Readout)
در کاربردهای زیست‌شناسی، خوشه‌بندی Zero-shot در داده‌های PBMC (AvgBIO) به ۰.۷۷۵۲ رسید که از رکورد ۰.۷۱۹۴ مدل Cell-JEPA بیشتر است. همچنین مقدار پیرسون برای اختلالات نورمن (Norman perturbation) از ۰.۷۸۷ به ۰.۸۱۴ افزایش یافت. برای پیش‌بینی‌های بالینی روی بیش از ۱,۰۰۰ رویداد در داده‌های UK Biobank، میانگین PRAUC به ۰.۷۱۸ رسید، در حالی که برای مدل JEPA استاندارد مشابه، این مقدار ۰.۷۱۱ بود.

گروه دوم: دینامیک‌های جهانی نهان
در محیط Interventional Pong، میانگین مربعات خطا (MSE) در مداخلات تک‌گانه ۳۴.۸۳٪ کاهش یافت، مداخلات ترکیبی دیده‌نشده ۱۲.۹۰٪ بهبود یافت و پیش‌بینی ۶ مرحله‌ای (6-step free rollout) ۸.۵۸٪ ارتقا پیدا کرد. JEPA-Anything معیارهای تمام ۱۰ تکلیف دینامیک مشابه را بهبود بخشید. آزمایش‌های بیشتر روی APEBench Burgers نشان داد که خطای پیش‌بینی ۶ مرحله‌ای در تمام Seedها ۴۴.۷٪ کاهش یافته است. در دینامیک مولکولی، با استفاده از یک ستون فقرات به سبک TrajCast برای پیش‌بینی‌های ۱۰۰ مرحله‌ای، این مدل کمترین میزان MAE و RMSD را برای آب، کوارتز، پاراستامول و بنزن ثبت کرد.

گروه سوم: تحلیل‌های علمی
تحلیل فاکتوری، مسدود کردن IL-18 به همراه CD73 را به عنوان یک مداخله سرطان پیشنهاد کرد که بعدها در آزمایش‌های Wet-lab روی کشت‌های مشترک، ارگانوئیدهای مشتق شده از بیمار، قطعات تومور و موش‌ها تأیید شد. در فیزیک، حالت‌های مداری نهان توانستند قانون کپلر را با شیب برازش شده -۱.۴۹۹۱ بازیابی کنند که تقریباً با مقدار تئوریک -۱.۵ مطابقت دارد.

با این حال، بهبودهای مربوط به برنامه‌ریزی (Planning) به محیط وابسته بود. در حالی که با پارامترهای مشابه تا حد ۰.۳٪، JEPA-Anything بازده CEM را در محیط‌های Walker2d و HalfCheetah بهبود بخشید، اما مدل JEPA استاندارد در محیط Hopper عملکرد بهتری داشت.

این تغییر رویکرد نشان می‌دهد که آینده مدل‌های جهانی در «تجزیه ساختاری» است، نه صرفاً افزایش تعداد پارامترها. با اجبار مدل به تجزیه دنیا به فاکتورهای متعامد، پژوهشگران می‌توانند سیگنال‌های ظریفی را شکار کنند که پیش از این در میان الگوهای غالب داده‌ها گم می‌شدند.

برای جامعه فنی، این دستاورد معیار را از «تنظیم اختصاصی برای هر دامنه» به «دستورالعمل‌های معماری مشترک» تغییر می‌دهد و ثابت می‌کند که یک رویکرد ریاضی واحد برای فضای نهان می‌تواند در علوم سخت و رباتیک به‌طور یکسان تعمیم یابد.

کتابخانه اصلی این پروژه تحت مجوز Apache-2.0 منتشر شده و نقاط بازرسی (Checkpoints) پژوهشی در Hugging Face برای اعتبارسنجی بیشتر در دسترس است.

گام بعدی شما

  • بررسی مستندات OrthogonalFactorProjection در کتابخانه منتشر شده برای پیاده‌سازی در داده‌های تخصصی.
  • مقایسه نتایج مدل‌های متعامد با مدل‌های تک‌سره (Single-head) در محیط‌های شبیه‌ساز دینامیک.
  • دنبال کردن نتایج آزمایش‌های Wet-lab برای اعتبارسنجی پیش‌بینی‌های مدل در حوزه بیومدیکال.

اما تأثیر این معماری بر کاهش هزینه‌های استنتاج در مقیاس صنعتی موضوع دیگری است — به تحلیل ما درباره بهینه‌سازی حافظه در مدل‌های نهان مراجعه کنید.

چرا این موضوع مهم است؟

این پژوهش با تکیه بر اعتبار مؤسساتی چون استنفورد و آکسفورد، اثبات می‌کند که یک معماری ریاضی واحد می‌تواند جایگزین صدها مدل تخصصی در علوم مختلف شود. این یعنی کاهش شدید هزینه تحقیق و توسعه برای مدل‌سازی سیستم‌های پیچیده علمی.

تأثیر برای ایران

این خبر بیشتر برای پژوهشگران مدل‌های بنیادی و دانشجویان دکتری هوش مصنوعی در ایران اهمیت دارد تا بازار مصرف؛ چرا که مسیر جدیدی برای مدل‌سازی داده‌های علمی تخصصی بدون نیاز به منابع محاسباتی عظیم باز می‌کند.

·نگاه ما
تحریریه دات‌هوش

تمرکز بر تجزیه متعامد به‌جای افزایش مقیاس پارامترها، یک چرخش استراتژیک در طراحی مدل‌های جهانی است. این رویکرد ثابت می‌کند که «ساختار» می‌تواند جایگزین «حجم داده» شود تا سیگنال‌های ضعیف اما حیاتی استخراج شوند. در واقع، ما از عصر مدل‌های همه‌فن‌حریفِ یکپارچه به سمت مدل‌های تجزیه‌شده‌ای می‌رویم که هر بخش از فضای نهان، مسئولیت یک بعد از واقعیت است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.