Are Video Reasoning Models Ready to Go Outside?
Fuente:
arXiv
Guardado en:
| Autores principales: | He, Yangfan, Boo, Changgyu, Yoon, Jaehong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CREMA: Generalizable and Efficient Video-Language Reasoning via Multimodal Modular Fusion
por: Yu, Shoubin, et al.
Publicado: (2024)
por: Yu, Shoubin, et al.
Publicado: (2024)
Video-Skill-CoT: Skill-based Chain-of-Thoughts for Domain-Adaptive Video Reasoning
por: Lee, Daeun, et al.
Publicado: (2025)
por: Lee, Daeun, et al.
Publicado: (2025)
RACCooN: A Versatile Instructional Video Editing Framework with Auto-Generated Narratives
por: Yoon, Jaehong, et al.
Publicado: (2024)
por: Yoon, Jaehong, et al.
Publicado: (2024)
Video-RTS: Rethinking Reinforcement Learning and Test-Time Scaling for Efficient and Enhanced Video Reasoning
por: Wang, Ziyang, et al.
Publicado: (2025)
por: Wang, Ziyang, et al.
Publicado: (2025)
VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long Videos
por: Wang, Ziyang, et al.
Publicado: (2024)
por: Wang, Ziyang, et al.
Publicado: (2024)
Self-Correcting Text-to-Video Generation with Misalignment Detection and Localized Refinement
por: Lee, Daeun, et al.
Publicado: (2024)
por: Lee, Daeun, et al.
Publicado: (2024)
EPiC: Efficient Video Camera Control Learning with Precise Anchor-Video Guidance
por: Wang, Zun, et al.
Publicado: (2025)
por: Wang, Zun, et al.
Publicado: (2025)
EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video Understanding
por: Wang, Ziyang, et al.
Publicado: (2026)
por: Wang, Ziyang, et al.
Publicado: (2026)
AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
por: Wang, Zun, et al.
Publicado: (2026)
por: Wang, Zun, et al.
Publicado: (2026)
MEXA: Towards General Multimodal Reasoning with Dynamic Multi-Expert Aggregation
por: Yu, Shoubin, et al.
Publicado: (2025)
por: Yu, Shoubin, et al.
Publicado: (2025)
WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning
por: Yeo, Woongyeong, et al.
Publicado: (2025)
por: Yeo, Woongyeong, et al.
Publicado: (2025)
Frame Guidance: Training-Free Guidance for Frame-Level Control in Video Diffusion Models
por: Jang, Sangwon, et al.
Publicado: (2025)
por: Jang, Sangwon, et al.
Publicado: (2025)
DreamRunner: Fine-Grained Compositional Story-to-Video Generation with Retrieval-Augmented Motion Adaptation
por: Wang, Zun, et al.
Publicado: (2024)
por: Wang, Zun, et al.
Publicado: (2024)
SurGo-R1: Benchmarking and Modeling Contextual Reasoning for Operative Zone in Surgical Video
por: Qin, Guanyi, et al.
Publicado: (2026)
por: Qin, Guanyi, et al.
Publicado: (2026)
Continual Learning: Forget-free Winning Subnetworks for Video Representations
por: Kang, Haeyong, et al.
Publicado: (2023)
por: Kang, Haeyong, et al.
Publicado: (2023)
When and How Much to Imagine: Adaptive Test-Time Scaling with World Models for Visual Spatial Reasoning
por: Yu, Shoubin, et al.
Publicado: (2026)
por: Yu, Shoubin, et al.
Publicado: (2026)
SAFREE: Training-Free and Adaptive Guard for Safe Text-to-Image And Video Generation
por: Yoon, Jaehong, et al.
Publicado: (2024)
por: Yoon, Jaehong, et al.
Publicado: (2024)
Training-free Guidance in Text-to-Video Generation via Multimodal Planning and Structured Noise Initialization
por: Li, Jialu, et al.
Publicado: (2025)
por: Li, Jialu, et al.
Publicado: (2025)
Are Video Models Ready as Zero-Shot Reasoners? An Empirical Study with the MME-CoF Benchmark
por: Guo, Ziyu, et al.
Publicado: (2025)
por: Guo, Ziyu, et al.
Publicado: (2025)
ECoFLaP: Efficient Coarse-to-Fine Layer-Wise Pruning for Vision-Language Models
por: Sung, Yi-Lin, et al.
Publicado: (2023)
por: Sung, Yi-Lin, et al.
Publicado: (2023)
Progressive Fourier Neural Representation for Sequential Video Compilation
por: Kang, Haeyong, et al.
Publicado: (2023)
por: Kang, Haeyong, et al.
Publicado: (2023)
PhyMotion: Structured 3D Motion Reward for Physics-Grounded Human Video Generation
por: Huang, Yidong, et al.
Publicado: (2026)
por: Huang, Yidong, et al.
Publicado: (2026)
DDPM-MoCo: Advancing Industrial Surface Defect Generation and Detection with Generative and Contrastive Learning
por: He, Yangfan, et al.
Publicado: (2024)
por: He, Yangfan, et al.
Publicado: (2024)
Planning with Sketch-Guided Verification for Physics-Aware Video Generation
por: Huang, Yidong, et al.
Publicado: (2025)
por: Huang, Yidong, et al.
Publicado: (2025)
DART: Leveraging Multi-Agent Disagreement for Tool Recruitment in Multimodal Reasoning
por: Sivakumaran, Nithin, et al.
Publicado: (2025)
por: Sivakumaran, Nithin, et al.
Publicado: (2025)
Outside Knowledge Conversational Video (OKCV) Dataset -- Dialoguing over Videos
por: Reichman, Benjamin, et al.
Publicado: (2025)
por: Reichman, Benjamin, et al.
Publicado: (2025)
ViGoR-Bench: How Far Are Visual Generative Models From Zero-Shot Visual Reasoners?
por: Han, Haonan, et al.
Publicado: (2026)
por: Han, Haonan, et al.
Publicado: (2026)
Hierarchy-Aware Multimodal Unlearning for Medical AI
por: Wu, Fengli, et al.
Publicado: (2025)
por: Wu, Fengli, et al.
Publicado: (2025)
ReGraP-LLaVA: Reasoning enabled Graph-based Personalized Large Language and Vision Assistant
por: Xiang, Yifan, et al.
Publicado: (2025)
por: Xiang, Yifan, et al.
Publicado: (2025)
Flatten: Video Action Recognition is an Image Classification task
por: Chen, Junlin, et al.
Publicado: (2024)
por: Chen, Junlin, et al.
Publicado: (2024)
Free-Mask: A Novel Paradigm of Integration Between the Segmentation Diffusion Model and Image Editing
por: Gao, Bo, et al.
Publicado: (2024)
por: Gao, Bo, et al.
Publicado: (2024)
CoFi-Dec: Hallucination-Resistant Decoding via Coarse-to-Fine Generative Feedback in Large Vision-Language Models
por: Cao, Zongsheng, et al.
Publicado: (2025)
por: Cao, Zongsheng, et al.
Publicado: (2025)
Reasoning via Video: The First Evaluation of Video Models' Reasoning Abilities through Maze-Solving Tasks
por: Yang, Cheng, et al.
Publicado: (2025)
por: Yang, Cheng, et al.
Publicado: (2025)
Mementos: A Comprehensive Benchmark for Multimodal Large Language Model Reasoning over Image Sequences
por: Wang, Xiyao, et al.
Publicado: (2024)
por: Wang, Xiyao, et al.
Publicado: (2024)
SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
por: Deng, Andong, et al.
Publicado: (2025)
por: Deng, Andong, et al.
Publicado: (2025)
Demystifying Video Reasoning
por: Wang, Ruisi, et al.
Publicado: (2026)
por: Wang, Ruisi, et al.
Publicado: (2026)
GoViG: Goal-Conditioned Visual Navigation Instruction Generation via Multimodal Reasoning
por: Wu, Fengyi, et al.
Publicado: (2025)
por: Wu, Fengyi, et al.
Publicado: (2025)
ViSRA: A Video-based Spatial Reasoning Agent for Multi-modal Large Language Models
por: Mou, Tingshu, et al.
Publicado: (2026)
por: Mou, Tingshu, et al.
Publicado: (2026)
PhysicsMind: Sim and Real Mechanics Benchmarking for Physical Reasoning and Prediction in Foundational VLMs and World Models
por: Mak, Chak-Wing, et al.
Publicado: (2026)
por: Mak, Chak-Wing, et al.
Publicado: (2026)
Process-of-Thought Reasoning for Videos
por: Zhang, Jusheng, et al.
Publicado: (2026)
por: Zhang, Jusheng, et al.
Publicado: (2026)
Ejemplares similares
-
CREMA: Generalizable and Efficient Video-Language Reasoning via Multimodal Modular Fusion
por: Yu, Shoubin, et al.
Publicado: (2024) -
Video-Skill-CoT: Skill-based Chain-of-Thoughts for Domain-Adaptive Video Reasoning
por: Lee, Daeun, et al.
Publicado: (2025) -
RACCooN: A Versatile Instructional Video Editing Framework with Auto-Generated Narratives
por: Yoon, Jaehong, et al.
Publicado: (2024) -
Video-RTS: Rethinking Reinforcement Learning and Test-Time Scaling for Efficient and Enhanced Video Reasoning
por: Wang, Ziyang, et al.
Publicado: (2025) -
VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long Videos
por: Wang, Ziyang, et al.
Publicado: (2024)