Demystifying Video Reasoning
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Ruisi, Cai, Zhongang, Pu, Fanyi, Xu, Junxiang, Yin, Wanqi, Wang, Maijunxian, Ji, Ran, Gu, Chenyang, Li, Bo, Huang, Ziqi, Deng, Hokin, Lin, Dahua, Liu, Ziwei, Yang, Lei |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
AGI as Second Being: The Structural-Generative Ontology of Intelligence
by: Wang, Maijunxian, et al.
Published: (2025)
by: Wang, Maijunxian, et al.
Published: (2025)
Scaling Spatial Intelligence with Multimodal Foundation Models
by: Cai, Zhongang, et al.
Published: (2025)
by: Cai, Zhongang, et al.
Published: (2025)
The Quest for Generalizable Motion Generation: Data, Model, and Evaluation
by: Lin, Jing, et al.
Published: (2025)
by: Lin, Jing, et al.
Published: (2025)
Video Models Start to Solve Chess, Maze, Sudoku, Mental Rotation, and Raven' Matrices
by: Deng, Hokin
Published: (2025)
by: Deng, Hokin
Published: (2025)
Egocentric Bias in Vision-Language Models
by: Wang, Maijunxian, et al.
Published: (2026)
by: Wang, Maijunxian, et al.
Published: (2026)
Bridging Semantic and Kinematic Conditions with Diffusion-based Discrete Motion Tokenizer
by: Gu, Chenyang, et al.
Published: (2026)
by: Gu, Chenyang, et al.
Published: (2026)
WHAC: World-grounded Humans and Cameras
by: Yin, Wanqi, et al.
Published: (2024)
by: Yin, Wanqi, et al.
Published: (2024)
Holistic Evaluation of Multimodal LLMs on Spatial Intelligence
by: Cai, Zhongang, et al.
Published: (2025)
by: Cai, Zhongang, et al.
Published: (2025)
Vision Language Models Cannot Reason About Physical Transformation
by: Luo, Dezhi, et al.
Published: (2026)
by: Luo, Dezhi, et al.
Published: (2026)
The Quantified Body: Identity, Empowerment, and Control in Smart Wearables
by: Wang, Maijunxian
Published: (2025)
by: Wang, Maijunxian
Published: (2025)
From Understanding the World to Intervening in It: A Unified Multi-Scale Framework for Embodied Cognition
by: Wang, Maijunxian
Published: (2025)
by: Wang, Maijunxian
Published: (2025)
WorldQA: Multimodal World Knowledge in Videos through Long-Chain Reasoning
by: Zhang, Yuanhan, et al.
Published: (2024)
by: Zhang, Yuanhan, et al.
Published: (2024)
Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos
by: Hu, Kairui, et al.
Published: (2025)
by: Hu, Kairui, et al.
Published: (2025)
A Very Big Video Reasoning Suite
by: Wang, Maijunxian, et al.
Published: (2026)
by: Wang, Maijunxian, et al.
Published: (2026)
ConsistCompose: Unified Multimodal Layout Control for Image Composition
by: Shi, Xuanke, et al.
Published: (2025)
by: Shi, Xuanke, et al.
Published: (2025)
SMPLest-X: Ultimate Scaling for Expressive Human Pose and Shape Estimation
by: Yin, Wanqi, et al.
Published: (2025)
by: Yin, Wanqi, et al.
Published: (2025)
ADHMR: Aligning Diffusion-based Human Mesh Recovery via Direct Preference Optimization
by: Shen, Wenhao, et al.
Published: (2025)
by: Shen, Wenhao, et al.
Published: (2025)
Increasing Computation Resolves Conflicts in Vision Language Models
by: Wang, Bingyang, et al.
Published: (2025)
by: Wang, Bingyang, et al.
Published: (2025)
VLM-Guided Group Preference Alignment for Diffusion-based Human Mesh Recovery
by: Shen, Wenhao, et al.
Published: (2026)
by: Shen, Wenhao, et al.
Published: (2026)
AiOS: All-in-One-Stage Expressive Human Pose and Shape Estimation
by: Sun, Qingping, et al.
Published: (2024)
by: Sun, Qingping, et al.
Published: (2024)
Use-dependent Biases as Optimal Action under Information Bottleneck
by: Deng, Hokin, et al.
Published: (2024)
by: Deng, Hokin, et al.
Published: (2024)
FreeInit: Bridging Initialization Gap in Video Diffusion Models
by: Wu, Tianxing, et al.
Published: (2023)
by: Wu, Tianxing, et al.
Published: (2023)
RepVideo: Rethinking Cross-Layer Representation for Video Generation
by: Si, Chenyang, et al.
Published: (2025)
by: Si, Chenyang, et al.
Published: (2025)
SMPLer-X: Scaling Up Expressive Human Pose and Shape Estimation
by: Cai, Zhongang, et al.
Published: (2023)
by: Cai, Zhongang, et al.
Published: (2023)
ANAH: Analytical Annotation of Hallucinations in Large Language Models
by: Ji, Ziwei, et al.
Published: (2024)
by: Ji, Ziwei, et al.
Published: (2024)
ANAH-v2: Scaling Analytical Hallucination Annotation of Large Language Models
by: Gu, Yuzhe, et al.
Published: (2024)
by: Gu, Yuzhe, et al.
Published: (2024)
Demystifying the Roles of LLM Layers in Retrieval, Knowledge, and Reasoning
by: Song, Xinyuan, et al.
Published: (2025)
by: Song, Xinyuan, et al.
Published: (2025)
Large Motion Model for Unified Multi-Modal Motion Generation
by: Zhang, Mingyuan, et al.
Published: (2024)
by: Zhang, Mingyuan, et al.
Published: (2024)
Rethinking the Simulation vs. Rendering Dichotomy: No Free Lunch in Spatial World Modelling
by: Luo, Dezhi, et al.
Published: (2025)
by: Luo, Dezhi, et al.
Published: (2025)
The Philosophical Foundations of Growing AI Like A Child
by: Luo, Dezhi, et al.
Published: (2025)
by: Luo, Dezhi, et al.
Published: (2025)
Deblur-Avatar: Animatable Avatars from Motion-Blurred Monocular Videos
by: Luo, Xianrui, et al.
Published: (2025)
by: Luo, Xianrui, et al.
Published: (2025)
Disco4D: Disentangled 4D Human Generation and Animation from a Single Image
by: Pang, Hui En, et al.
Published: (2024)
by: Pang, Hui En, et al.
Published: (2024)
The chemistry of cell membranes
by: Lowell E. Hokin
Published: (1960)
by: Lowell E. Hokin
Published: (1960)
Personal Moisture Management by Advanced Textiles and Intelligent Wearables
by: Dahua Shou, et al.
Published: (2025)
by: Dahua Shou, et al.
Published: (2025)
Otter: A Multi-Modal Model with In-Context Instruction Tuning
by: Li, Bo, et al.
Published: (2023)
by: Li, Bo, et al.
Published: (2023)
HumanVid: Demystifying Training Data for Camera-controllable Human Image Animation
by: Wang, Zhenzhi, et al.
Published: (2024)
by: Wang, Zhenzhi, et al.
Published: (2024)
Demystifying Progressive Web Application Permission Systems
by: Wang, Mengxiao, et al.
Published: (2025)
by: Wang, Mengxiao, et al.
Published: (2025)
Probing Mechanical Reasoning in Large Vision Language Models
by: Sun, Haoran, et al.
Published: (2024)
by: Sun, Haoran, et al.
Published: (2024)
$\nabla$-Reasoner: LLM Reasoning via Test-Time Gradient Descent in Latent Space
by: Wang, Peihao, et al.
Published: (2026)
by: Wang, Peihao, et al.
Published: (2026)
Neural Canonical Transformation for the Spectra of Fluxional Molecule CH5+
by: Wang, Ruisi, et al.
Published: (2025)
by: Wang, Ruisi, et al.
Published: (2025)
Similar Items
-
AGI as Second Being: The Structural-Generative Ontology of Intelligence
by: Wang, Maijunxian, et al.
Published: (2025) -
Scaling Spatial Intelligence with Multimodal Foundation Models
by: Cai, Zhongang, et al.
Published: (2025) -
The Quest for Generalizable Motion Generation: Data, Model, and Evaluation
by: Lin, Jing, et al.
Published: (2025) -
Video Models Start to Solve Chess, Maze, Sudoku, Mental Rotation, and Raven' Matrices
by: Deng, Hokin
Published: (2025) -
Egocentric Bias in Vision-Language Models
by: Wang, Maijunxian, et al.
Published: (2026)