"PhyWorldBench": A Comprehensive Evaluation of Physical Realism in Text-to-Video Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Gu, Jing, Liu, Xian, Zeng, Yu, Nagarajan, Ashwin, Zhu, Fangrui, Hong, Daniel, Fan, Yue, Yan, Qianqi, Zhou, Kaiwen, Liu, Ming-Yu, Wang, Xin Eric |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Muffin or Chihuahua? Challenging Multimodal Large Language Models with Multipanel VQA
di: Fan, Yue, et al.
Pubblicazione: (2024)
di: Fan, Yue, et al.
Pubblicazione: (2024)
PhyBench: A Physical Commonsense Benchmark for Evaluating Text-to-Image Models
di: Meng, Fanqing, et al.
Pubblicazione: (2024)
di: Meng, Fanqing, et al.
Pubblicazione: (2024)
VidText: Towards Comprehensive Evaluation for Video Text Understanding
di: Yang, Zhoufaran, et al.
Pubblicazione: (2025)
di: Yang, Zhoufaran, et al.
Pubblicazione: (2025)
T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation
di: Sun, Kaiyue, et al.
Pubblicazione: (2024)
di: Sun, Kaiyue, et al.
Pubblicazione: (2024)
PhyPrompt: RL-based Prompt Refinement for Physically Plausible Text-to-Video Generation
di: Wu, Shang, et al.
Pubblicazione: (2026)
di: Wu, Shang, et al.
Pubblicazione: (2026)
Physion-Eval: Evaluating Physical Realism in Generated Video via Human Reasoning
di: Zhang, Qin, et al.
Pubblicazione: (2026)
di: Zhang, Qin, et al.
Pubblicazione: (2026)
PhyWorld: Physics-Faithful World Model for Video Generation
di: Zhao, Pu, et al.
Pubblicazione: (2026)
di: Zhao, Pu, et al.
Pubblicazione: (2026)
VidCapBench: A Comprehensive Benchmark of Video Captioning for Controllable Text-to-Video Generation
di: Chen, Xinlong, et al.
Pubblicazione: (2025)
di: Chen, Xinlong, et al.
Pubblicazione: (2025)
Worse than Random? An Embarrassingly Simple Probing Evaluation of Large Multimodal Models in Medical VQA
di: Yan, Qianqi, et al.
Pubblicazione: (2024)
di: Yan, Qianqi, et al.
Pubblicazione: (2024)
WorldSimBench: Towards Video Generation Models as World Simulators
di: Qin, Yiran, et al.
Pubblicazione: (2024)
di: Qin, Yiran, et al.
Pubblicazione: (2024)
PhyVLLM: Physics-Guided Video Language Model with Motion-Appearance Disentanglement
di: Zhan, Yu-Wei, et al.
Pubblicazione: (2025)
di: Zhan, Yu-Wei, et al.
Pubblicazione: (2025)
Disentangling Foreground and Background Motion for Enhanced Realism in Human Video Generation
di: Liu, Jinlin, et al.
Pubblicazione: (2024)
di: Liu, Jinlin, et al.
Pubblicazione: (2024)
TAD-Bench: A Comprehensive Benchmark for Embedding-Based Text Anomaly Detection
di: Cao, Yang, et al.
Pubblicazione: (2025)
di: Cao, Yang, et al.
Pubblicazione: (2025)
FAVOR-Bench: A Comprehensive Benchmark for Fine-Grained Video Motion Understanding
di: Tu, Chongjun, et al.
Pubblicazione: (2025)
di: Tu, Chongjun, et al.
Pubblicazione: (2025)
PhyEduVideo: A Benchmark for Evaluating Text-to-Video Models for Physics Education
di: M, Megha Mariam K., et al.
Pubblicazione: (2026)
di: M, Megha Mariam K., et al.
Pubblicazione: (2026)
The Name-Free Gap: Policy-Aware Stylistic Control in Music Generation
di: Nagarajan, Ashwin, et al.
Pubblicazione: (2025)
di: Nagarajan, Ashwin, et al.
Pubblicazione: (2025)
PhyCritic: Multimodal Critic Models for Physical AI
di: Xiong, Tianyi, et al.
Pubblicazione: (2026)
di: Xiong, Tianyi, et al.
Pubblicazione: (2026)
VCR-Bench: A Comprehensive Evaluation Framework for Video Chain-of-Thought Reasoning
di: Qi, Yukun, et al.
Pubblicazione: (2025)
di: Qi, Yukun, et al.
Pubblicazione: (2025)
STEPWISE-CODEX-Bench: Evaluating Complex Multi-Function Comprehension and Fine-Grained Execution Reasoning
di: Yan, Kaiwen, et al.
Pubblicazione: (2025)
di: Yan, Kaiwen, et al.
Pubblicazione: (2025)
PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation
di: Xie, Tianxin, et al.
Pubblicazione: (2025)
di: Xie, Tianxin, et al.
Pubblicazione: (2025)
SafePro: Evaluating the Safety of Professional-Level AI Agents
di: Zhou, Kaiwen, et al.
Pubblicazione: (2026)
di: Zhou, Kaiwen, et al.
Pubblicazione: (2026)
From Long Videos to Engaging Clips: A Human-Inspired Video Editing Framework with Multimodal Narrative Understanding
di: Wang, Xiangfeng, et al.
Pubblicazione: (2025)
di: Wang, Xiangfeng, et al.
Pubblicazione: (2025)
TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models
di: Cai, Mu, et al.
Pubblicazione: (2024)
di: Cai, Mu, et al.
Pubblicazione: (2024)
VEU-Bench: Towards Comprehensive Understanding of Video Editing
di: Li, Bozheng, et al.
Pubblicazione: (2025)
di: Li, Bozheng, et al.
Pubblicazione: (2025)
Beyond Visual Realism: Toward Reliable Financial Time Series Generation
di: Zhang, Fan, et al.
Pubblicazione: (2026)
di: Zhang, Fan, et al.
Pubblicazione: (2026)
Phi-4 Technical Report
di: Abdin, Marah, et al.
Pubblicazione: (2024)
di: Abdin, Marah, et al.
Pubblicazione: (2024)
Scalable Policy Evaluation with Video World Models
di: Tseng, Wei-Cheng, et al.
Pubblicazione: (2025)
di: Tseng, Wei-Cheng, et al.
Pubblicazione: (2025)
T2I-ReasonBench: Benchmarking Reasoning-Informed Text-to-Image Generation
di: Sun, Kaiyue, et al.
Pubblicazione: (2025)
di: Sun, Kaiyue, et al.
Pubblicazione: (2025)
Plenoptic Video Generation
di: Fu, Xiao, et al.
Pubblicazione: (2026)
di: Fu, Xiao, et al.
Pubblicazione: (2026)
Omni-WorldBench: Towards a Comprehensive Interaction-Centric Evaluation for World Models
di: Wu, Meiqi, et al.
Pubblicazione: (2026)
di: Wu, Meiqi, et al.
Pubblicazione: (2026)
MambaVideo for Discrete Video Tokenization with Channel-Split Quantization
di: Argaw, Dawit Mureja, et al.
Pubblicazione: (2025)
di: Argaw, Dawit Mureja, et al.
Pubblicazione: (2025)
TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models
di: Wang, Hui, et al.
Pubblicazione: (2025)
di: Wang, Hui, et al.
Pubblicazione: (2025)
JARVIS: A Neuro-Symbolic Commonsense Reasoning Framework for Conversational Embodied Agents
di: Zheng, Kaizhi, et al.
Pubblicazione: (2022)
di: Zheng, Kaizhi, et al.
Pubblicazione: (2022)
Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection
di: Zhuang, Weijun, et al.
Pubblicazione: (2025)
di: Zhuang, Weijun, et al.
Pubblicazione: (2025)
ColorBench: Can VLMs See and Understand the Colorful World? A Comprehensive Benchmark for Color Perception, Reasoning, and Robustness
di: Liang, Yijun, et al.
Pubblicazione: (2025)
di: Liang, Yijun, et al.
Pubblicazione: (2025)
VisPhyWorld: Probing Physical Reasoning via Code-Driven Video Reconstruction
di: Liang, Jiarong, et al.
Pubblicazione: (2026)
di: Liang, Jiarong, et al.
Pubblicazione: (2026)
ProPhy: Progressive Physical Alignment for Dynamic World Simulation
di: Wang, Zijun, et al.
Pubblicazione: (2025)
di: Wang, Zijun, et al.
Pubblicazione: (2025)
TextOVSR: Text-Guided Real-World Opera Video Super-Resolution
di: Chang, Hua, et al.
Pubblicazione: (2026)
di: Chang, Hua, et al.
Pubblicazione: (2026)
PhyCustom: Towards Realistic Physical Customization in Text-to-Image Generation
di: Wu, Fan, et al.
Pubblicazione: (2025)
di: Wu, Fan, et al.
Pubblicazione: (2025)
TimeBench: A Comprehensive Evaluation of Temporal Reasoning Abilities in Large Language Models
di: Chu, Zheng, et al.
Pubblicazione: (2023)
di: Chu, Zheng, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Muffin or Chihuahua? Challenging Multimodal Large Language Models with Multipanel VQA
di: Fan, Yue, et al.
Pubblicazione: (2024) -
PhyBench: A Physical Commonsense Benchmark for Evaluating Text-to-Image Models
di: Meng, Fanqing, et al.
Pubblicazione: (2024) -
VidText: Towards Comprehensive Evaluation for Video Text Understanding
di: Yang, Zhoufaran, et al.
Pubblicazione: (2025) -
T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation
di: Sun, Kaiyue, et al.
Pubblicazione: (2024) -
PhyPrompt: RL-based Prompt Refinement for Physically Plausible Text-to-Video Generation
di: Wu, Shang, et al.
Pubblicazione: (2026)