Can World Simulators Reason? Gen-ViRe: A Generative Visual Reasoning Benchmark
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Xinxin, Xu, Zhaopan, Li, Ming, Wang, Kai, Lee, Yong Jae, Shang, Yuzhang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
WorldGenBench: A World-Knowledge-Integrated Benchmark for Reasoning-Driven Text-to-Image Generation
par: Zhang, Daoan, et autres
Publié: (2025)
par: Zhang, Daoan, et autres
Publié: (2025)
Can MLLMs Reason Beyond Language? VisReason: A Comprehensive Benchmark for Vision-Centric Reasoning
par: Guo, Longteng, et autres
Publié: (2026)
par: Guo, Longteng, et autres
Publié: (2026)
MPBench: A Comprehensive Multimodal Reasoning Benchmark for Process Errors Identification
par: Xu, Zhaopan, et autres
Publié: (2025)
par: Xu, Zhaopan, et autres
Publié: (2025)
VisualTrans: A Benchmark for Real-World Visual Transformation Reasoning
par: Ji, Yuheng, et autres
Publié: (2025)
par: Ji, Yuheng, et autres
Publié: (2025)
TiViBench: Benchmarking Think-in-Video Reasoning for Video Generative Models
par: Chen, Harold Haodong, et autres
Publié: (2025)
par: Chen, Harold Haodong, et autres
Publié: (2025)
Learning from Noisy Preferences: A Semi-Supervised Learning Approach to Direct Preference Optimization
par: Liu, Xinxin, et autres
Publié: (2026)
par: Liu, Xinxin, et autres
Publié: (2026)
Visual Reasoning Tracer: Object-Level Grounded Reasoning Benchmark
par: Yuan, Haobo, et autres
Publié: (2025)
par: Yuan, Haobo, et autres
Publié: (2025)
Can MLLMs Reason About Visual Persuasion? Evaluating the Efficacy and Faithfulness of Reasoning
par: Lee, Naeun, et autres
Publié: (2026)
par: Lee, Naeun, et autres
Publié: (2026)
Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark
par: Hao, Yunzhuo, et autres
Publié: (2025)
par: Hao, Yunzhuo, et autres
Publié: (2025)
LLaVA-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models
par: Shang, Yuzhang, et autres
Publié: (2024)
par: Shang, Yuzhang, et autres
Publié: (2024)
Benchmarking and Analyzing Generative Data for Visual Recognition
par: Li, Bo, et autres
Publié: (2023)
par: Li, Bo, et autres
Publié: (2023)
KeyWorld: Key Frame Reasoning Enables Effective and Efficient World Models
par: Li, Sibo, et autres
Publié: (2025)
par: Li, Sibo, et autres
Publié: (2025)
ViRC: Enhancing Visual Interleaved Mathematical CoT with Reason Chunking
par: Wang, Lihong, et autres
Publié: (2025)
par: Wang, Lihong, et autres
Publié: (2025)
ViTCN: Vision Transformer Contrastive Network For Reasoning
par: Song, Bo, et autres
Publié: (2024)
par: Song, Bo, et autres
Publié: (2024)
How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding
par: Yu, Zhuoran, et autres
Publié: (2025)
par: Yu, Zhuoran, et autres
Publié: (2025)
VERIFY: A Benchmark of Visual Explanation and Reasoning for Investigating Multimodal Reasoning Fidelity
par: Bi, Jing, et autres
Publié: (2025)
par: Bi, Jing, et autres
Publié: (2025)
MotiMotion: Motion-Controlled Video Generation with Visual Reasoning
par: Hsin-Ying, Lee, et autres
Publié: (2026)
par: Hsin-Ying, Lee, et autres
Publié: (2026)
Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans
par: Qiu, Yansheng, et autres
Publié: (2025)
par: Qiu, Yansheng, et autres
Publié: (2025)
Benchmarking and Evolving Reason-Reflect-Rectify for Reflective Visual Generation
par: Wang, Junjie, et autres
Publié: (2026)
par: Wang, Junjie, et autres
Publié: (2026)
PackCache: A Training-Free Acceleration Method for Unified Autoregressive Video Generation via Compact KV-Cache
par: Li, Kunyang, et autres
Publié: (2026)
par: Li, Kunyang, et autres
Publié: (2026)
ChartBench: A Benchmark for Complex Visual Reasoning in Charts
par: Xu, Zhengzhuo, et autres
Publié: (2023)
par: Xu, Zhengzhuo, et autres
Publié: (2023)
EA-ViT: Efficient Adaptation for Elastic Vision Transformer
par: Zhu, Chen, et autres
Publié: (2025)
par: Zhu, Chen, et autres
Publié: (2025)
JRDB-Reasoning: A Difficulty-Graded Benchmark for Visual Reasoning in Robotics
par: Jahangard, Simindokht, et autres
Publié: (2025)
par: Jahangard, Simindokht, et autres
Publié: (2025)
T2I-ReasonBench: Benchmarking Reasoning-Informed Text-to-Image Generation
par: Sun, Kaiyue, et autres
Publié: (2025)
par: Sun, Kaiyue, et autres
Publié: (2025)
Latent Implicit Visual Reasoning
par: Li, Kelvin, et autres
Publié: (2025)
par: Li, Kelvin, et autres
Publié: (2025)
ViKey: Enhancing Temporal Understanding in Videos via Visual Prompting
par: Lee, Yeonkyung, et autres
Publié: (2026)
par: Lee, Yeonkyung, et autres
Publié: (2026)
What if? Emulative Simulation with World Models for Situated Reasoning
par: Liu, Ruiping, et autres
Publié: (2026)
par: Liu, Ruiping, et autres
Publié: (2026)
RVTBench: A Benchmark for Visual Reasoning Tasks
par: Shen, Yiqing, et autres
Publié: (2025)
par: Shen, Yiqing, et autres
Publié: (2025)
ViRectify: A Challenging Benchmark for Video Reasoning Correction with Multimodal Large Language Models
par: Hei, Xusen, et autres
Publié: (2025)
par: Hei, Xusen, et autres
Publié: (2025)
ViGoR-Bench: How Far Are Visual Generative Models From Zero-Shot Visual Reasoners?
par: Han, Haonan, et autres
Publié: (2026)
par: Han, Haonan, et autres
Publié: (2026)
GoViG: Goal-Conditioned Visual Navigation Instruction Generation via Multimodal Reasoning
par: Wu, Fengyi, et autres
Publié: (2025)
par: Wu, Fengyi, et autres
Publié: (2025)
LaViT: Aligning Latent Visual Thoughts for Multi-modal Reasoning
par: Wu, Linquan, et autres
Publié: (2026)
par: Wu, Linquan, et autres
Publié: (2026)
ViCor: Bridging Visual Understanding and Commonsense Reasoning with Large Language Models
par: Zhou, Kaiwen, et autres
Publié: (2023)
par: Zhou, Kaiwen, et autres
Publié: (2023)
Re$^2$MoGen: Open-Vocabulary Motion Generation via LLM Reasoning and Physics-Aware Refinement
par: Zheng, Jiakun, et autres
Publié: (2026)
par: Zheng, Jiakun, et autres
Publié: (2026)
VisualQuest: A Benchmark for Abstract Visual Reasoning in MLLMs
par: Xiao, Kelaiti, et autres
Publié: (2025)
par: Xiao, Kelaiti, et autres
Publié: (2025)
V-Retrver: Evidence-Driven Agentic Reasoning for Universal Multimodal Retrieval
par: Chen, Dongyang, et autres
Publié: (2026)
par: Chen, Dongyang, et autres
Publié: (2026)
ExoViP: Step-by-step Verification and Exploration with Exoskeleton Modules for Compositional Visual Reasoning
par: Wang, Yuxuan, et autres
Publié: (2024)
par: Wang, Yuxuan, et autres
Publié: (2024)
TableVista: Benchmarking Multimodal Table Reasoning under Visual and Structural Complexity
par: Yang, Zheyuan, et autres
Publié: (2026)
par: Yang, Zheyuan, et autres
Publié: (2026)
ChronoEdit: Towards Temporal Reasoning for Image Editing and World Simulation
par: Wu, Jay Zhangjie, et autres
Publié: (2025)
par: Wu, Jay Zhangjie, et autres
Publié: (2025)
FysicsWorld: A Unified Full-Modality Benchmark for Any-to-Any Understanding, Generation, and Reasoning
par: Jiang, Yue, et autres
Publié: (2025)
par: Jiang, Yue, et autres
Publié: (2025)
Documents similaires
-
WorldGenBench: A World-Knowledge-Integrated Benchmark for Reasoning-Driven Text-to-Image Generation
par: Zhang, Daoan, et autres
Publié: (2025) -
Can MLLMs Reason Beyond Language? VisReason: A Comprehensive Benchmark for Vision-Centric Reasoning
par: Guo, Longteng, et autres
Publié: (2026) -
MPBench: A Comprehensive Multimodal Reasoning Benchmark for Process Errors Identification
par: Xu, Zhaopan, et autres
Publié: (2025) -
VisualTrans: A Benchmark for Real-World Visual Transformation Reasoning
par: Ji, Yuheng, et autres
Publié: (2025) -
TiViBench: Benchmarking Think-in-Video Reasoning for Video Generative Models
par: Chen, Harold Haodong, et autres
Publié: (2025)