پرش به محتوای اصلی
پرش به محتوای مقاله

پژوهش Physis-Lang: مدل Cosmos3 در بنچ‌مارک‌های فیزیکی رتبه ۱ شد

·۸ مهر ۱۴۰۵۴ دقیقه مطالعه
زبان فیزیکی خود-تکاملی فیسیس‌لنگ که کازموس ۳ را از وئو ۳.۱ در معیارهای فیزیکی پیشی می‌گیرد
زبان فیزیکی خود-تکاملی فیسیس‌لنگ که کازموس ۳ را از وئو ۳.۱ در معیارهای فیزیکی پیشی می‌گیرد
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی تقلید بصری با استدلال فیزیکی صریح در شرح‌نویسی‌ها و معرفی یک حلقه تکاملی خودکار برای اصلاح پرامپت‌ها که منجر به شکستن رکورد Google Veo شد.

تصور کنید ویدیویی تولید می‌کنید که در آن کره روی نان پخش می‌شود، اما به جای جاری شدن، مانند رنگ روی دیوار می‌لغزد. این «شکست فیزیکی» بزرگ‌ترین نقطه ضعف مدل‌های مولد ویدیو است که حالا انویدیا راه حلی برای آن یافته است.

به نقل از گزارش‌های فنی، همکاری انویدیا (NVIDIA)، MIT و دانشگاه آکسفورد منجر به خلق Physis-Lang شده است؛ چارچوبی که مدل‌های جهانِ ویدئویی را مجبور می‌کند قوانین فیزیک را بفهمند، نه اینکه صرفاً الگوهای بصری را تقلید کنند. با تبدیل زبان فیزیکی به یک نمایش بهینه‌شده، این تیم موفق شد مدل Cosmos3-Super را در ۲۹ سپتامبر ۲۰۲۶ با کسب امتیاز ۴۸.۲ ± ۱.۴ به صدر جدول Physics-IQ Verified برساند. نسخه کوچک‌تر یعنی Cosmos3-Nano نیز با امتیاز ۴۳.۳ ± ۱.۵ در رتبه دوم قرار گرفت.

بسیاری از تولیدکنندگان ویدیو در حال حاضر با مشکل «گسست فیزیکی» دست‌وپنجه نرم می‌کنند؛ جایی که اشیا از میان دیوارها رد می‌شوند یا مایعات رفتاری شبیه به جامدات دارند. برای مثال، در مدل‌های فعلی، کره اغلب مانند رنگ پخش می‌شود. دلیل این اتفاق ساده است: شرح‌نویسی‌های (Captions) فعلی می‌گویند «چه اتفاقی» می‌افتد، اما نمی‌گویند «چرا». برای مثال، جمله‌ای مثل «کره با افزایش دما ذوب می‌شود» هیچ اشاره‌ای به مکانیسم‌های واقعی انتقال حرارت یا گرانش ندارد.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی محدودیت‌های مدل‌های بصری اشاره کردیم، نبودِ درک ساختاری از جهان، منجر به توهمات بصری می‌شود. این چالش‌ها در واقع ریشه در سازوکار تبدیل نویز ریاضی به ویدیوهای واقع‌گرایانه دارند که در آن مدل‌ها بیش از آنکه فیزیک را بفهمند، به دنبال بازسازی الگوهای آماری هستند. Physis-Lang این مشکل را با افزودن یک میدان «استدلال فیزیکی» (physics_reasoning) به شرح‌نویسی‌ها حل می‌کند. در این میدان، موجودات، علت‌ها، تعاملات، اصول حاکم، تکامل زمانی و اثرات به‌طور صریح تعریف می‌شوند. این کار متن را به یک نمایش مشترک و بهینه‌شده تبدیل می‌کند که فرآیندهای سازماندهی داده‌ها، آموزش مدل و استنتاج (Inference) را هدایت می‌کند.

برای بهینه‌سازی این شرح‌ها، تیم پژوهشی یک حلقه تکاملی خودکار طراحی کرد. در این چرخه، یک مدل GPT-5.5 شرح‌ها را برای یک مجموعه توسعه ثابت شامل ۲۰ ویدیو که دارای ۲۷۳ ادعای تأییدشده توسط انسان است، تولید می‌کند. در حالی که مدل شرح‌نویس ثابت (Frozen) می‌ماند، سیستم تنها دستورالعمل‌های (Instructions) خود را تکامل می‌دهد. در این میان، Gemini-3.1-Pro در نقش یک منتقدِ آگاه به فیزیک، آن‌ها را در دو محور می‌سنجد:

  • دقت (Precision): شرح به ادعاهای اتمی تقسیم شده و هر یک با محتوای ویدیو تطبیق داده می‌شود.
  • فراخوانی (Recall): بررسی می‌شود که آیا هر ادعای فیزیکی که توسط انسان استخراج شده، به‌طور صریح در متن ذکر شده یا از آن استنباط می‌شود یا خیر.

یک عامل تکامل (Evolution Agent) این امتیازات و شکست‌های سطح ادعا را می‌خواند تا پرامپت را بازنویسی کند. این فرآیند روی محک PhysCapBench (شامل ۲۴۶ ویدیو و ۳۷۹۴ ادعای انسانی) اعتبارسنجی شد. امتیاز F1 شرح‌ها از ۷۸.۶۴ در تکرار اول به ۸۷.۸۲ در تکرار نهم رسید. این مسیر خطی نبود؛ در تکرار دوم، مدل بیش از حد محتاط شد و امتیاز F1 به ۷۶.۲۸ افت کرد. تا تکرار نهم، سیستم یاد گرفت که هر گام علیِ قابل مشاهده را ثبت کند و نرخ نمونه‌برداری فریم‌ها را از ۲ به ۴ فریم بر ثانیه افزایش دهد.

پیاده‌سازی فنی و سازماندهی داده‌ها

این خط لوله از چندین مکانیسم کلیدی برای تضمین صحت فیزیکی استفاده می‌کند:

  • پرامپت منفی (Negative Prompting): سیستم متونی را در قالب physics_negative_prompt تولید می‌کند که نتایج غیرممکن و نامحتمل (مثل شناور شدن سنگ روی آب) را توصیف می‌کنند. این متون در زمان استنتاج به عنوان شرط‌گذاری منفی عمل می‌کنند.
  • بازیابی هدفمند (Targeted Retrieval): یک عامل تشخیص‌دهنده بر پایه GPT-5.5، شکست‌های ویدئویی تولید شده را به دسته‌های فیزیکی مثل «حرکت اجسام صلب»، «برخورد» و «دینامیک سیالات» می‌برد. این پروفایل نقص با برچسب‌های فیزیکی در یک گالری بزرگ ویدئویی تطبیق داده می‌شود تا محتوای فیزیکی بازیابی شود، نه صرفاً ظاهر بصری.
  • مجموعه آموزشی: داده‌های نهایی شامل ۱۸۳ هزار ویدیو است که ۷۱ هزار مورد آن از WISA-80K فیلتر شده و ۱۱۲ هزار مورد از طریق بازیابی جمع‌آوری شده‌اند. تنها استفاده از بازیابی هدفمند، به‌طور متوسط ۳.۰۱ امتیاز به نتایج سه بنچمارک افزود. در آزمون VideoPhy-2، دقت در فرآیندهای شیمیایی و حرارتی هر کدام ۸ امتیاز رشد کرد.

عملکرد و مقایسه با رقبا

به گزارش Marktechpost، نتایج نشان‌دهنده برتری چشمگیر انویدیاست. برای تنظیم دقیق (Fine-tuning)، از روش LoRA روی تصویرهای توجه (Attention Projections) استفاده شده و هیچ تغییری در معماری یا هدف مدل ایجاد نشده است. مدل Cosmos3-Nano مجهز به Physis-Lang در آزمون PhyGenBench امتیاز ۷۱.۰۴ را کسب کرد، در حالی که Veo 3.1 گوگل امتیاز ۶۵.۶۳ را به دست آورد. این شکاف در Physics-IQ Verified عمیق‌تر بود: ۴۳.۴۱ برای انویدیا در برابر ۳۴.۹۹ برای گوگل.

سایر نتایج بنچمارک‌ها عبارتند از:

  • PhyGround: امتیاز ۶۹.۹۰ برای Physis-Lang در مقابل ۶۹.۲۴ برای Veo 3.1.
  • VideoPhy-2: امتیاز ۶۸.۰۲ در مجموعه کامل (در مقابل ۶۸.۸۷ برای Veo 3.1) و ۶۲.۳۶ در بخش سخت (Hard split) در مقابل ۵۸.۴۳ برای Veo 3.1.

این بهبودها در مدل‌های مختلف تکرار شده است: افزایش ۷.۰۵ امتیازی در Wan2.1-14B، افزایش ۳.۲۴ امتیازی در Cosmos3-Edge-4B، افزایش ۶.۲۲ امتیازی در Cosmos3-Nano-16B و افزایش ۵.۰۲ امتیازی در Cosmos3-Super-64B. کیفیت کلی در VBench-I2V ثابت ماند و Cosmos3-Nano از ۸۸.۳۲ به ۸۸.۶۹ رسید. حتی بدون آموزش مجدد، استفاده از استدلال فیزیکی و پرامپت‌های منفی توانست امتیاز یک مدل منجمد (Frozen) را در PhyGenBench از ۶۱.۶۷ به ۶۷.۲۹ برساند.

کارایی و استقرار محلی

پژوهشگران برای کاهش هزینه‌های بالای APIهای تجاری، این فرآیند را به دو مدل محلی بر پایه Qwen3-VL-4B-Instruct تقطیر (distillation) کردند: مدل PhysThinker-C برای شرح‌نویسی و PhysThinker-U برای ارتقای پرامپت‌ها.

این تغییر هزینه را به‌شدت کاهش داد. در حالی که خط لوله تجاری برای دستیابی به بهبود ۷.۰۵ امتیازی در Wan2.1-14B حدود ۲۴.۱۲ هزار دلار هزینه API داشت، راهکار محلی PhysThinker-C همین نتیجه را با هزینه تنها ۱۲۰ دلار فراهم کرد. استقرار کاملاً محلی نیز بهبود ۴.۷۶ امتیازی را با هزینه صفر ارمغان آورد.

در مقایسه با سایر چارچوب‌ها، Physis-Lang از PhiZero (با امتیاز ۴۰.۹۱ در Physics-IQ Verified) و Self-Refinement (با امتیاز ۲۷.۲۰) پیشی می‌گیرد. برخلاف PhyGDP که بدون آموزش است و از DPO گروهی استفاده می‌کند، Physis-Lang از LoRA SFT برای ادغام فیزیک در سازماندهی داده‌ها، آموزش و استنتاج بهره می‌برد.

برای جامعه فنی، این یک چرخش از یادگیری صرفاً در «فضای نهان» (Latent Space) به سمت اعمال محدودیت‌های فیزیکی صریح و زبان‌محور است. در حال حاضر مقاله منتشر شده اما وزن‌ها و کدها خصوصی هستند و باید مخزن گیت‌هاب پروژه رصد شود.

گام بعدی شما

  • اگر از مدل‌های متن-به-ویدیو استفاده می‌کنید، از پرامپت‌های منفی برای توصیف رفتارهای غیرفیزیکی (مثلاً: «سنگ نباید در هوا معلق باشد») استفاده کنید تا توهمات بصری کاهش یابد.
  • توسعه‌دهندگان را khuyến می‌کنم مدل‌های Qwen-VL را برای ساخت سیستم‌های شرح‌نویسی محلی و ارزان‌قیمت بررسی کنند.
  • منتظر انتشار وزن‌های باز Cosmos3 باشید تا تأثیر Physis-Lang را روی داده‌های شخصی خود آزمایش کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر اعتبار پژوهشی MIT و آکسفورد، استاندارد جدیدی برای ارزیابی مدل‌های ویدئویی تعریف می‌کند که دیگر تنها بر زیبایی بصری، بلکه بر صحت فیزیکی متمرکز است. این تغییر، مسیر تولید محتوای سینمایی و شبیه‌سازی‌های صنعتی با هوش مصنوعی را هموار می‌کند.

تأثیر برای ایران

به‌دلیل محدودیت‌های دسترسی به APIهای انویدیا و گوگل، این پیشرفت فعلاً برای پژوهشگران ایرانی در سطح تئوریک اهمیت دارد؛ اما استفاده از مدل‌های محلی Qwen برای پیاده‌سازی مشابه، مسیری ارزان و در دسترس برای توسعه‌دهندگان داخلی است.

·نگاه ما
تحریریه دات‌هوش

انتقال از یادگیری آماریِ پیکسل‌ها به یادگیری صریحِ قوانین فیزیک، نشان می‌دهد که مقیاس‌بندی (Scaling) به تنهایی برای رسیدن به واقع‌گرایی کافی نیست. Physis-Lang در واقع یک لایه «دانش پیشین» را به مدل تزریق می‌کند تا از خطاهای احمقانه جلوگیری کند. به نظر ما، آینده مدل‌های مولد در ترکیبِ قدرت آماری ترنسفورمرها با محدودیت‌های سختِ قوانین جهان فیزیکی است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.