T2VPhysBench: A First-Principles Benchmark for Physical Consistency in Text-to-Video Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Guo, Xuyang, Huo, Jiayan, Shi, Zhenmei, Song, Zhao, Zhang, Jiahao, Zhao, Jiale |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
T2VTextBench: A Human Evaluation Benchmark for Textual Control in Video Generation Models
por: Guo, Xuyang, et al.
Publicado: (2025)
por: Guo, Xuyang, et al.
Publicado: (2025)
T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation
por: Chen, Yubin, et al.
Publicado: (2025)
por: Chen, Yubin, et al.
Publicado: (2025)
Can You Count to Nine? A Human Evaluation Benchmark for Counting Limits in Modern Text-to-Video Models
por: Guo, Xuyang, et al.
Publicado: (2025)
por: Guo, Xuyang, et al.
Publicado: (2025)
Text-to-Image Diffusion Models Cannot Count, and Prompt Refinement Cannot Help
por: Guo, Xuyang, et al.
Publicado: (2025)
por: Guo, Xuyang, et al.
Publicado: (2025)
Your Vision-Language Model Can't Even Count to 20: Exposing the Failures of VLMs in Compositional Counting
por: Guo, Xuyang, et al.
Publicado: (2025)
por: Guo, Xuyang, et al.
Publicado: (2025)
RichSpace: Enriching Text-to-Video Prompt Space via Text Embedding Interpolation
por: Cao, Yuefan, et al.
Publicado: (2025)
por: Cao, Yuefan, et al.
Publicado: (2025)
ChronoMagic-Bench: A Benchmark for Metamorphic Evaluation of Text-to-Time-lapse Video Generation
por: Yuan, Shenghai, et al.
Publicado: (2024)
por: Yuan, Shenghai, et al.
Publicado: (2024)
TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation
por: Feng, Weixi, et al.
Publicado: (2024)
por: Feng, Weixi, et al.
Publicado: (2024)
VinaBench: Benchmark for Faithful and Consistent Visual Narratives
por: Gao, Silin, et al.
Publicado: (2025)
por: Gao, Silin, et al.
Publicado: (2025)
VPO: Aligning Text-to-Video Generation Models with Prompt Optimization
por: Cheng, Jiale, et al.
Publicado: (2025)
por: Cheng, Jiale, et al.
Publicado: (2025)
T$^3$Bench: Benchmarking Current Progress in Text-to-3D Generation
por: He, Yuze, et al.
Publicado: (2023)
por: He, Yuze, et al.
Publicado: (2023)
R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation
por: Chen, Kaijie, et al.
Publicado: (2025)
por: Chen, Kaijie, et al.
Publicado: (2025)
AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation
por: Zhou, Ziwei, et al.
Publicado: (2026)
por: Zhou, Ziwei, et al.
Publicado: (2026)
Video-SafetyBench: A Benchmark for Safety Evaluation of Video LVLMs
por: Liu, Xuannan, et al.
Publicado: (2025)
por: Liu, Xuannan, et al.
Publicado: (2025)
UAL-Bench: The First Comprehensive Unusual Activity Localization Benchmark
por: Abdullah, Hasnat Md, et al.
Publicado: (2024)
por: Abdullah, Hasnat Md, et al.
Publicado: (2024)
Universal Approximation of Visual Autoregressive Transformers
por: Chen, Yifang, et al.
Publicado: (2025)
por: Chen, Yifang, et al.
Publicado: (2025)
GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling
por: Li, Siqi, et al.
Publicado: (2025)
por: Li, Siqi, et al.
Publicado: (2025)
RoPE Attention Can Be Trained in Almost Linear Time
por: Cao, Yang, et al.
Publicado: (2024)
por: Cao, Yang, et al.
Publicado: (2024)
IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs
por: Ma, David, et al.
Publicado: (2025)
por: Ma, David, et al.
Publicado: (2025)
Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis
por: Fu, Chaoyou, et al.
Publicado: (2024)
por: Fu, Chaoyou, et al.
Publicado: (2024)
CML-Bench: A Framework for Evaluating and Enhancing LLM-Powered Movie Scripts Generation
por: Zheng, Mingzhe, et al.
Publicado: (2025)
por: Zheng, Mingzhe, et al.
Publicado: (2025)
VEFX-Bench: A Holistic Benchmark for Generic Video Editing and Visual Effects
por: Gao, Xiangbo, et al.
Publicado: (2026)
por: Gao, Xiangbo, et al.
Publicado: (2026)
TOC-Bench: A Temporal Object Consistency Benchmark for Video Large Language Models
por: Chen, Junzhe, et al.
Publicado: (2026)
por: Chen, Junzhe, et al.
Publicado: (2026)
MMLongBench: Benchmarking Long-Context Vision-Language Models Effectively and Thoroughly
por: Wang, Zhaowei, et al.
Publicado: (2025)
por: Wang, Zhaowei, et al.
Publicado: (2025)
VideoStudio: Generating Consistent-Content and Multi-Scene Videos
por: Long, Fuchen, et al.
Publicado: (2024)
por: Long, Fuchen, et al.
Publicado: (2024)
Cognitive-YOLO: LLM-Driven Architecture Synthesis from First Principles of Data for Object Detection
por: Zhao, Jiahao
Publicado: (2025)
por: Zhao, Jiahao
Publicado: (2025)
RefereeBench: Are Video MLLMs Ready to be Multi-Sport Referees
por: Xu, Yichen, et al.
Publicado: (2026)
por: Xu, Yichen, et al.
Publicado: (2026)
VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos
por: Song, Tingyu, et al.
Publicado: (2025)
por: Song, Tingyu, et al.
Publicado: (2025)
VCG-Bench: Towards A Unified Visual-Centric Benchmark for Structured Generation and Editing
por: Su, Xiaoyan, et al.
Publicado: (2026)
por: Su, Xiaoyan, et al.
Publicado: (2026)
VL-RewardBench: A Challenging Benchmark for Vision-Language Generative Reward Models
por: Li, Lei, et al.
Publicado: (2024)
por: Li, Lei, et al.
Publicado: (2024)
Bilingual Text-to-Motion Generation: A New Benchmark and Baselines
por: Weng, Wanjiang, et al.
Publicado: (2026)
por: Weng, Wanjiang, et al.
Publicado: (2026)
ColorConceptBench: A Benchmark for Probabilistic Color-Concept Understanding in Text-to-Image Models
por: Ruan, Chenxi, et al.
Publicado: (2026)
por: Ruan, Chenxi, et al.
Publicado: (2026)
Do Text Edits Generalize to Visual Generation? Benchmarking Cross-Modal Knowledge Editing in UMMs
por: Gao, Xin, et al.
Publicado: (2026)
por: Gao, Xin, et al.
Publicado: (2026)
OSCBench: Benchmarking Object State Change in Text-to-Video Generation
por: Han, Xianjing, et al.
Publicado: (2026)
por: Han, Xianjing, et al.
Publicado: (2026)
TextInVision: Text and Prompt Complexity Driven Visual Text Generation Benchmark
por: Fallah, Forouzan, et al.
Publicado: (2025)
por: Fallah, Forouzan, et al.
Publicado: (2025)
RoboTrustBench: Benchmarking the Trustworthiness of Video World Models for Robotic Manipulation
por: Li, Huiqiong, et al.
Publicado: (2026)
por: Li, Huiqiong, et al.
Publicado: (2026)
MER-Bench: A Comprehensive Benchmark for Multimodal Meme Reappraisal
por: Nie, Yiqi, et al.
Publicado: (2026)
por: Nie, Yiqi, et al.
Publicado: (2026)
VCR-Bench: A Comprehensive Evaluation Framework for Video Chain-of-Thought Reasoning
por: Qi, Yukun, et al.
Publicado: (2025)
por: Qi, Yukun, et al.
Publicado: (2025)
MulTaBench: Benchmarking Multimodal Tabular Learning with Text and Image
por: Arazi, Alan, et al.
Publicado: (2026)
por: Arazi, Alan, et al.
Publicado: (2026)
LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding
por: Wu, Haoning, et al.
Publicado: (2024)
por: Wu, Haoning, et al.
Publicado: (2024)
Ejemplares similares
-
T2VTextBench: A Human Evaluation Benchmark for Textual Control in Video Generation Models
por: Guo, Xuyang, et al.
Publicado: (2025) -
T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation
por: Chen, Yubin, et al.
Publicado: (2025) -
Can You Count to Nine? A Human Evaluation Benchmark for Counting Limits in Modern Text-to-Video Models
por: Guo, Xuyang, et al.
Publicado: (2025) -
Text-to-Image Diffusion Models Cannot Count, and Prompt Refinement Cannot Help
por: Guo, Xuyang, et al.
Publicado: (2025) -
Your Vision-Language Model Can't Even Count to 20: Exposing the Failures of VLMs in Compositional Counting
por: Guo, Xuyang, et al.
Publicado: (2025)