Are Video Reasoning Models Ready to Go Outside?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | He, Yangfan, Boo, Changgyu, Yoon, Jaehong |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CREMA: Generalizable and Efficient Video-Language Reasoning via Multimodal Modular Fusion
par: Yu, Shoubin, et autres
Publié: (2024)
par: Yu, Shoubin, et autres
Publié: (2024)
Video-Skill-CoT: Skill-based Chain-of-Thoughts for Domain-Adaptive Video Reasoning
par: Lee, Daeun, et autres
Publié: (2025)
par: Lee, Daeun, et autres
Publié: (2025)
RACCooN: A Versatile Instructional Video Editing Framework with Auto-Generated Narratives
par: Yoon, Jaehong, et autres
Publié: (2024)
par: Yoon, Jaehong, et autres
Publié: (2024)
Video-RTS: Rethinking Reinforcement Learning and Test-Time Scaling for Efficient and Enhanced Video Reasoning
par: Wang, Ziyang, et autres
Publié: (2025)
par: Wang, Ziyang, et autres
Publié: (2025)
VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long Videos
par: Wang, Ziyang, et autres
Publié: (2024)
par: Wang, Ziyang, et autres
Publié: (2024)
Self-Correcting Text-to-Video Generation with Misalignment Detection and Localized Refinement
par: Lee, Daeun, et autres
Publié: (2024)
par: Lee, Daeun, et autres
Publié: (2024)
EPiC: Efficient Video Camera Control Learning with Precise Anchor-Video Guidance
par: Wang, Zun, et autres
Publié: (2025)
par: Wang, Zun, et autres
Publié: (2025)
EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video Understanding
par: Wang, Ziyang, et autres
Publié: (2026)
par: Wang, Ziyang, et autres
Publié: (2026)
AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
par: Wang, Zun, et autres
Publié: (2026)
par: Wang, Zun, et autres
Publié: (2026)
MEXA: Towards General Multimodal Reasoning with Dynamic Multi-Expert Aggregation
par: Yu, Shoubin, et autres
Publié: (2025)
par: Yu, Shoubin, et autres
Publié: (2025)
WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning
par: Yeo, Woongyeong, et autres
Publié: (2025)
par: Yeo, Woongyeong, et autres
Publié: (2025)
Frame Guidance: Training-Free Guidance for Frame-Level Control in Video Diffusion Models
par: Jang, Sangwon, et autres
Publié: (2025)
par: Jang, Sangwon, et autres
Publié: (2025)
DreamRunner: Fine-Grained Compositional Story-to-Video Generation with Retrieval-Augmented Motion Adaptation
par: Wang, Zun, et autres
Publié: (2024)
par: Wang, Zun, et autres
Publié: (2024)
SurGo-R1: Benchmarking and Modeling Contextual Reasoning for Operative Zone in Surgical Video
par: Qin, Guanyi, et autres
Publié: (2026)
par: Qin, Guanyi, et autres
Publié: (2026)
Continual Learning: Forget-free Winning Subnetworks for Video Representations
par: Kang, Haeyong, et autres
Publié: (2023)
par: Kang, Haeyong, et autres
Publié: (2023)
When and How Much to Imagine: Adaptive Test-Time Scaling with World Models for Visual Spatial Reasoning
par: Yu, Shoubin, et autres
Publié: (2026)
par: Yu, Shoubin, et autres
Publié: (2026)
SAFREE: Training-Free and Adaptive Guard for Safe Text-to-Image And Video Generation
par: Yoon, Jaehong, et autres
Publié: (2024)
par: Yoon, Jaehong, et autres
Publié: (2024)
Training-free Guidance in Text-to-Video Generation via Multimodal Planning and Structured Noise Initialization
par: Li, Jialu, et autres
Publié: (2025)
par: Li, Jialu, et autres
Publié: (2025)
Are Video Models Ready as Zero-Shot Reasoners? An Empirical Study with the MME-CoF Benchmark
par: Guo, Ziyu, et autres
Publié: (2025)
par: Guo, Ziyu, et autres
Publié: (2025)
ECoFLaP: Efficient Coarse-to-Fine Layer-Wise Pruning for Vision-Language Models
par: Sung, Yi-Lin, et autres
Publié: (2023)
par: Sung, Yi-Lin, et autres
Publié: (2023)
Progressive Fourier Neural Representation for Sequential Video Compilation
par: Kang, Haeyong, et autres
Publié: (2023)
par: Kang, Haeyong, et autres
Publié: (2023)
PhyMotion: Structured 3D Motion Reward for Physics-Grounded Human Video Generation
par: Huang, Yidong, et autres
Publié: (2026)
par: Huang, Yidong, et autres
Publié: (2026)
DDPM-MoCo: Advancing Industrial Surface Defect Generation and Detection with Generative and Contrastive Learning
par: He, Yangfan, et autres
Publié: (2024)
par: He, Yangfan, et autres
Publié: (2024)
Planning with Sketch-Guided Verification for Physics-Aware Video Generation
par: Huang, Yidong, et autres
Publié: (2025)
par: Huang, Yidong, et autres
Publié: (2025)
DART: Leveraging Multi-Agent Disagreement for Tool Recruitment in Multimodal Reasoning
par: Sivakumaran, Nithin, et autres
Publié: (2025)
par: Sivakumaran, Nithin, et autres
Publié: (2025)
Outside Knowledge Conversational Video (OKCV) Dataset -- Dialoguing over Videos
par: Reichman, Benjamin, et autres
Publié: (2025)
par: Reichman, Benjamin, et autres
Publié: (2025)
ViGoR-Bench: How Far Are Visual Generative Models From Zero-Shot Visual Reasoners?
par: Han, Haonan, et autres
Publié: (2026)
par: Han, Haonan, et autres
Publié: (2026)
Hierarchy-Aware Multimodal Unlearning for Medical AI
par: Wu, Fengli, et autres
Publié: (2025)
par: Wu, Fengli, et autres
Publié: (2025)
ReGraP-LLaVA: Reasoning enabled Graph-based Personalized Large Language and Vision Assistant
par: Xiang, Yifan, et autres
Publié: (2025)
par: Xiang, Yifan, et autres
Publié: (2025)
Flatten: Video Action Recognition is an Image Classification task
par: Chen, Junlin, et autres
Publié: (2024)
par: Chen, Junlin, et autres
Publié: (2024)
Free-Mask: A Novel Paradigm of Integration Between the Segmentation Diffusion Model and Image Editing
par: Gao, Bo, et autres
Publié: (2024)
par: Gao, Bo, et autres
Publié: (2024)
CoFi-Dec: Hallucination-Resistant Decoding via Coarse-to-Fine Generative Feedback in Large Vision-Language Models
par: Cao, Zongsheng, et autres
Publié: (2025)
par: Cao, Zongsheng, et autres
Publié: (2025)
Reasoning via Video: The First Evaluation of Video Models' Reasoning Abilities through Maze-Solving Tasks
par: Yang, Cheng, et autres
Publié: (2025)
par: Yang, Cheng, et autres
Publié: (2025)
Mementos: A Comprehensive Benchmark for Multimodal Large Language Model Reasoning over Image Sequences
par: Wang, Xiyao, et autres
Publié: (2024)
par: Wang, Xiyao, et autres
Publié: (2024)
SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
par: Deng, Andong, et autres
Publié: (2025)
par: Deng, Andong, et autres
Publié: (2025)
Demystifying Video Reasoning
par: Wang, Ruisi, et autres
Publié: (2026)
par: Wang, Ruisi, et autres
Publié: (2026)
GoViG: Goal-Conditioned Visual Navigation Instruction Generation via Multimodal Reasoning
par: Wu, Fengyi, et autres
Publié: (2025)
par: Wu, Fengyi, et autres
Publié: (2025)
ViSRA: A Video-based Spatial Reasoning Agent for Multi-modal Large Language Models
par: Mou, Tingshu, et autres
Publié: (2026)
par: Mou, Tingshu, et autres
Publié: (2026)
PhysicsMind: Sim and Real Mechanics Benchmarking for Physical Reasoning and Prediction in Foundational VLMs and World Models
par: Mak, Chak-Wing, et autres
Publié: (2026)
par: Mak, Chak-Wing, et autres
Publié: (2026)
Process-of-Thought Reasoning for Videos
par: Zhang, Jusheng, et autres
Publié: (2026)
par: Zhang, Jusheng, et autres
Publié: (2026)
Documents similaires
-
CREMA: Generalizable and Efficient Video-Language Reasoning via Multimodal Modular Fusion
par: Yu, Shoubin, et autres
Publié: (2024) -
Video-Skill-CoT: Skill-based Chain-of-Thoughts for Domain-Adaptive Video Reasoning
par: Lee, Daeun, et autres
Publié: (2025) -
RACCooN: A Versatile Instructional Video Editing Framework with Auto-Generated Narratives
par: Yoon, Jaehong, et autres
Publié: (2024) -
Video-RTS: Rethinking Reinforcement Learning and Test-Time Scaling for Efficient and Enhanced Video Reasoning
par: Wang, Ziyang, et autres
Publié: (2025) -
VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long Videos
par: Wang, Ziyang, et autres
Publié: (2024)