تصور کنید ویدیویی تولید میکنید که در آن کره روی نان پخش میشود، اما به جای جاری شدن، مانند رنگ روی دیوار میلغزد. این «شکست فیزیکی» بزرگترین نقطه ضعف مدلهای مولد ویدیو است که حالا انویدیا راه حلی برای آن یافته است.
به نقل از گزارشهای فنی، همکاری انویدیا (NVIDIA)، MIT و دانشگاه آکسفورد منجر به خلق Physis-Lang شده است؛ چارچوبی که مدلهای جهانِ ویدئویی را مجبور میکند قوانین فیزیک را بفهمند، نه اینکه صرفاً الگوهای بصری را تقلید کنند. با تبدیل زبان فیزیکی به یک نمایش بهینهشده، این تیم موفق شد مدل Cosmos3-Super را در ۲۹ سپتامبر ۲۰۲۶ با کسب امتیاز ۴۸.۲ ± ۱.۴ به صدر جدول Physics-IQ Verified برساند. نسخه کوچکتر یعنی Cosmos3-Nano نیز با امتیاز ۴۳.۳ ± ۱.۵ در رتبه دوم قرار گرفت.
بسیاری از تولیدکنندگان ویدیو در حال حاضر با مشکل «گسست فیزیکی» دستوپنجه نرم میکنند؛ جایی که اشیا از میان دیوارها رد میشوند یا مایعات رفتاری شبیه به جامدات دارند. برای مثال، در مدلهای فعلی، کره اغلب مانند رنگ پخش میشود. دلیل این اتفاق ساده است: شرحنویسیهای (Captions) فعلی میگویند «چه اتفاقی» میافتد، اما نمیگویند «چرا». برای مثال، جملهای مثل «کره با افزایش دما ذوب میشود» هیچ اشارهای به مکانیسمهای واقعی انتقال حرارت یا گرانش ندارد.
همانطور که در تحلیلهای پیشین ما دربارهی محدودیتهای مدلهای بصری اشاره کردیم، نبودِ درک ساختاری از جهان، منجر به توهمات بصری میشود. این چالشها در واقع ریشه در سازوکار تبدیل نویز ریاضی به ویدیوهای واقعگرایانه دارند که در آن مدلها بیش از آنکه فیزیک را بفهمند، به دنبال بازسازی الگوهای آماری هستند. Physis-Lang این مشکل را با افزودن یک میدان «استدلال فیزیکی» (physics_reasoning) به شرحنویسیها حل میکند. در این میدان، موجودات، علتها، تعاملات، اصول حاکم، تکامل زمانی و اثرات بهطور صریح تعریف میشوند. این کار متن را به یک نمایش مشترک و بهینهشده تبدیل میکند که فرآیندهای سازماندهی دادهها، آموزش مدل و استنتاج (Inference) را هدایت میکند.
برای بهینهسازی این شرحها، تیم پژوهشی یک حلقه تکاملی خودکار طراحی کرد. در این چرخه، یک مدل GPT-5.5 شرحها را برای یک مجموعه توسعه ثابت شامل ۲۰ ویدیو که دارای ۲۷۳ ادعای تأییدشده توسط انسان است، تولید میکند. در حالی که مدل شرحنویس ثابت (Frozen) میماند، سیستم تنها دستورالعملهای (Instructions) خود را تکامل میدهد. در این میان، Gemini-3.1-Pro در نقش یک منتقدِ آگاه به فیزیک، آنها را در دو محور میسنجد:
- دقت (Precision): شرح به ادعاهای اتمی تقسیم شده و هر یک با محتوای ویدیو تطبیق داده میشود.
- فراخوانی (Recall): بررسی میشود که آیا هر ادعای فیزیکی که توسط انسان استخراج شده، بهطور صریح در متن ذکر شده یا از آن استنباط میشود یا خیر.
یک عامل تکامل (Evolution Agent) این امتیازات و شکستهای سطح ادعا را میخواند تا پرامپت را بازنویسی کند. این فرآیند روی محک PhysCapBench (شامل ۲۴۶ ویدیو و ۳۷۹۴ ادعای انسانی) اعتبارسنجی شد. امتیاز F1 شرحها از ۷۸.۶۴ در تکرار اول به ۸۷.۸۲ در تکرار نهم رسید. این مسیر خطی نبود؛ در تکرار دوم، مدل بیش از حد محتاط شد و امتیاز F1 به ۷۶.۲۸ افت کرد. تا تکرار نهم، سیستم یاد گرفت که هر گام علیِ قابل مشاهده را ثبت کند و نرخ نمونهبرداری فریمها را از ۲ به ۴ فریم بر ثانیه افزایش دهد.
پیادهسازی فنی و سازماندهی دادهها
این خط لوله از چندین مکانیسم کلیدی برای تضمین صحت فیزیکی استفاده میکند:
- پرامپت منفی (Negative Prompting): سیستم متونی را در قالب
physics_negative_promptتولید میکند که نتایج غیرممکن و نامحتمل (مثل شناور شدن سنگ روی آب) را توصیف میکنند. این متون در زمان استنتاج به عنوان شرطگذاری منفی عمل میکنند. - بازیابی هدفمند (Targeted Retrieval): یک عامل تشخیصدهنده بر پایه GPT-5.5، شکستهای ویدئویی تولید شده را به دستههای فیزیکی مثل «حرکت اجسام صلب»، «برخورد» و «دینامیک سیالات» میبرد. این پروفایل نقص با برچسبهای فیزیکی در یک گالری بزرگ ویدئویی تطبیق داده میشود تا محتوای فیزیکی بازیابی شود، نه صرفاً ظاهر بصری.
- مجموعه آموزشی: دادههای نهایی شامل ۱۸۳ هزار ویدیو است که ۷۱ هزار مورد آن از WISA-80K فیلتر شده و ۱۱۲ هزار مورد از طریق بازیابی جمعآوری شدهاند. تنها استفاده از بازیابی هدفمند، بهطور متوسط ۳.۰۱ امتیاز به نتایج سه بنچمارک افزود. در آزمون VideoPhy-2، دقت در فرآیندهای شیمیایی و حرارتی هر کدام ۸ امتیاز رشد کرد.
عملکرد و مقایسه با رقبا
به گزارش Marktechpost، نتایج نشاندهنده برتری چشمگیر انویدیاست. برای تنظیم دقیق (Fine-tuning)، از روش LoRA روی تصویرهای توجه (Attention Projections) استفاده شده و هیچ تغییری در معماری یا هدف مدل ایجاد نشده است. مدل Cosmos3-Nano مجهز به Physis-Lang در آزمون PhyGenBench امتیاز ۷۱.۰۴ را کسب کرد، در حالی که Veo 3.1 گوگل امتیاز ۶۵.۶۳ را به دست آورد. این شکاف در Physics-IQ Verified عمیقتر بود: ۴۳.۴۱ برای انویدیا در برابر ۳۴.۹۹ برای گوگل.
سایر نتایج بنچمارکها عبارتند از:
- PhyGround: امتیاز ۶۹.۹۰ برای Physis-Lang در مقابل ۶۹.۲۴ برای Veo 3.1.
- VideoPhy-2: امتیاز ۶۸.۰۲ در مجموعه کامل (در مقابل ۶۸.۸۷ برای Veo 3.1) و ۶۲.۳۶ در بخش سخت (Hard split) در مقابل ۵۸.۴۳ برای Veo 3.1.
این بهبودها در مدلهای مختلف تکرار شده است: افزایش ۷.۰۵ امتیازی در Wan2.1-14B، افزایش ۳.۲۴ امتیازی در Cosmos3-Edge-4B، افزایش ۶.۲۲ امتیازی در Cosmos3-Nano-16B و افزایش ۵.۰۲ امتیازی در Cosmos3-Super-64B. کیفیت کلی در VBench-I2V ثابت ماند و Cosmos3-Nano از ۸۸.۳۲ به ۸۸.۶۹ رسید. حتی بدون آموزش مجدد، استفاده از استدلال فیزیکی و پرامپتهای منفی توانست امتیاز یک مدل منجمد (Frozen) را در PhyGenBench از ۶۱.۶۷ به ۶۷.۲۹ برساند.
کارایی و استقرار محلی
پژوهشگران برای کاهش هزینههای بالای APIهای تجاری، این فرآیند را به دو مدل محلی بر پایه Qwen3-VL-4B-Instruct تقطیر (distillation) کردند: مدل PhysThinker-C برای شرحنویسی و PhysThinker-U برای ارتقای پرامپتها.
این تغییر هزینه را بهشدت کاهش داد. در حالی که خط لوله تجاری برای دستیابی به بهبود ۷.۰۵ امتیازی در Wan2.1-14B حدود ۲۴.۱۲ هزار دلار هزینه API داشت، راهکار محلی PhysThinker-C همین نتیجه را با هزینه تنها ۱۲۰ دلار فراهم کرد. استقرار کاملاً محلی نیز بهبود ۴.۷۶ امتیازی را با هزینه صفر ارمغان آورد.
در مقایسه با سایر چارچوبها، Physis-Lang از PhiZero (با امتیاز ۴۰.۹۱ در Physics-IQ Verified) و Self-Refinement (با امتیاز ۲۷.۲۰) پیشی میگیرد. برخلاف PhyGDP که بدون آموزش است و از DPO گروهی استفاده میکند، Physis-Lang از LoRA SFT برای ادغام فیزیک در سازماندهی دادهها، آموزش و استنتاج بهره میبرد.
برای جامعه فنی، این یک چرخش از یادگیری صرفاً در «فضای نهان» (Latent Space) به سمت اعمال محدودیتهای فیزیکی صریح و زبانمحور است. در حال حاضر مقاله منتشر شده اما وزنها و کدها خصوصی هستند و باید مخزن گیتهاب پروژه رصد شود.
گام بعدی شما
- اگر از مدلهای متن-به-ویدیو استفاده میکنید، از پرامپتهای منفی برای توصیف رفتارهای غیرفیزیکی (مثلاً: «سنگ نباید در هوا معلق باشد») استفاده کنید تا توهمات بصری کاهش یابد.
- توسعهدهندگان را khuyến میکنم مدلهای Qwen-VL را برای ساخت سیستمهای شرحنویسی محلی و ارزانقیمت بررسی کنند.
- منتظر انتشار وزنهای باز Cosmos3 باشید تا تأثیر Physis-Lang را روی دادههای شخصی خود آزمایش کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو