پرش به محتوای اصلی
پرش به محتوای مقاله

WorldReasonBench: شکاف دوبرابری مدل‌های تجاری و بازمتن در درک فیزیک جهان

·۲۶ اردیبهشت ۱۴۰۵۳ دقیقه مطالعه
WorldReasonBench: شکاف دوبرابری مدل‌های تجاری و بازمتن در درک فیزیک جهان
اشتراک‌گذاری

اگر تصور می‌کنید کیفیت خیره‌کننده‌ی ویدیوهای تولیدشده به معنای درک مدل از قوانین فیزیک است، در اشتباهید. واقعیت این است که مدل‌های پیشرفته‌ی ویدیو هنوز نمی‌دانند جهان واقعی چگونه کار می‌کند.

طبق گزارشی که در ۱۶ مه ۲۰۲۶ از سوی دانشگاه تسینگ‌هوا (Tsinghua University) منتشر شد، مدل‌های تجاری مانند Seedance 2.0 و Sora 2 در زمینه‌ی استدلال جهانی (World Reasoning) تقریباً دو برابر بهتر از مدل‌های بازمتن عمل می‌کنند. این یافته‌ها نشان می‌دهد که در حالی که هوش مصنوعی زاینده (Generative AI) اکنون می‌تواند پیکسل‌های خیره‌کننده‌ای تولید کند، اما همچنان در درک بنیادین از عملکرد جهان فیزیکی ناتوان است.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی مدل‌های جهانی (World Models) اشاره کردیم، بحثی جدی در صنعت وجود دارد که آیا این سیستم‌ها واقعاً مدل‌های جهان هستند یا صرفاً تطبیق‌دهنده‌های پیچیده‌ی الگوها. در حالی که دِمیس هاسابیس، مدیرعامل گوگل دیپ‌مایند، مدل Veo را گامی به سوی مدل جهانی می‌داند، یان لکون از متا استدلال می‌کند که معماری‌های فعلی یک بن‌بست تکاملی هستند.

پژوهشگران برای کمی‌سازی این شکاف، معیار WorldReasonBench را معرفی کردند که مدل‌ها را در چهار بُعد ارزیابی می‌کند:

  • دانش جهانی
  • صحنه‌های انسان‌محور
  • استدلال منطقی
  • استدلال مبتنی بر اطلاعات

Vier farbig getrennte Quadranten zeigen die 22 Aufgabenkategorien von WorldReasonBench mit Beispielbildern und Prompts; die Dimensionen World Knowledge, Human Centric, Logic Reasoning und Information-Based gruppieren Aufgaben wie fallende Dominosteine, Autowäsche, Logikrätsel und Diagramminterpretation.

این ارزیابی شامل ۴۰۰ مورد تست و یک بنچمارک ترجیحی به نام WorldRewardBench است که ۶۰۰۰ مقایسه‌ی ویدئویی توسط ارزیابان انسانی رتبه‌بندی شده است.

Zweiteiliges Flussdiagramm; oben die WorldReasonBench-Pipeline aus Taxonomie, Datensammlung über Qwen-Image-Edit und Prompt-Design mit menschlicher Kontrolle, unten die WorldRewardBench-Pipeline mit 13 Videomodellen, je acht generierten Videos, 15 Annotator:innen und einer Re-Annotation bei hoher Uneinigkeit.

در این بررسی، پنج سیستم تجاری (Sora 2، Kling، Wan 2.6، Seedance 2.0 و Veo 3.1-Fast) در برابر شش مدل بازمتن از جمله LTX 2.3 و HunyuanVideo 1.5 قرار گرفتند. نتایج نشان داد که Seedance 2.0 متعلق به بایت‌دنس پیشروترین مدل کلی است و Veo 3.1-Fast در دانش جهانی برتری دارد. با این حال، حتی متقاعدکننده‌ترین ویدیوها در تست‌های ساده‌ی فیزیک، مانند سقوط دومینوها یا حرکت مدارات الکتریکی، شکست خوردند.

Drei Fallbeispiele untereinander; Veo-3.1 setzt eine doppelte Dominoreihe physikalisch unplausibel um, Seedance 2.0 animiert bei einem Greifautomaten den falschen Mechanismus und verfehlt bei einem Schaltbild die erwartete Drehbewegung des Kabels, rote Markierungen heben die jeweiligen Fehler hervor.

به نقل از این مطالعه، نمرات استدلال مدل‌های تجاری تقریباً دو برابر مدل‌های بازمتن بود و هیچ هم‌پوشانی آماری بین این دو گروه مشاهده نشد.

Tabelle mit den Hauptergebnissen über fünf Closed-Source- und sechs Open-Source-Videomodelle entlang von vier Reasoning-Dimensionen und einem Gesamtwert; Seedance2.0 führt mit 39,8 Score_PR insgesamt, Veo3.1-Fast erzielt mit 55,0 in World Knowledge den besten Einzelwert, während kein Open-Source-Modell über 17,9 Overall hinauskommt.

برای تضمین دقت، ۱۵ ارزیاب آموزش‌دیده، ویدیوهای بدون نام را از نظر دقت استدلال، ثبات زمانی و کیفیت بصری امتیازدهی کردند.

Web-Oberfläche zur Annotation eines Logikrätsels; oben Eingabebild und Prompt, darunter ein Raster aus acht generierten Videos, die einzeln auf Reasoning Accuracy, Temporal Consistency und Visual Quality auf einer Skala von 1 bis 5 bewertet werden.

برای جامعه‌ی فنی، این تغییر در روش بنچمارک ثابت می‌کند که افزایش رزولوشن و طول ویدیو، معیاری برای هوشمندی نیست. شکست همگانی در استدلال منطقی نشان می‌دهد که گذار از یک «تولیدکننده‌ی پیکسل» به یک «مدل جهانی قابل‌اعتماد»، نیازمند رویکردی جدید برای سازگاری علیتی است، نه صرفاً داده‌های آموزشی بیشتر.

گام بعدی شما

  • بررسی کدها و داده‌های منتشرشده در گیت‌هاب برای اعتبارسنجی مدل‌های داخلی.
  • تحلیل تفاوت عملکرد Seedance 2.0 در مقابل Sora 2 در سناریوهای فیزیکی پیچیده.
  • دنبال کردن مقالات جدید در زمینه‌ی «سازگاری علیتی» (Causal Consistency) در مدل‌های انتشار.

اما هزینه محاسباتی این سطح از استدلال، چالش اصلی است؛ برای درک این موضوع به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مطالعه با تکیه بر متدولوژی دقیق دانشگاه تسینگ‌هوا، برای نخستین بار شکاف بین «زیبایی بصری» و «درک منطقی» را کمی کرده است. این موضوع باعث می‌شود توسعه‌دهندگان از تمرکز بر کیفیت پیکسل‌ها به سمت حل چالش‌های استدلال علیتی حرکت کنند.

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.