STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Liang, Yiming, Chen, Yixiao, Zhou, Yiyang, Wang, Yixuan, Yu, Shoubin, Deng, Andong, Liu, Fuxiao, Zhang, Qin, Chen, Chen, Bansal, Mohit, Yao, Huaxiu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
di: Deng, Andong, et al.
Pubblicazione: (2025)
di: Deng, Andong, et al.
Pubblicazione: (2025)
When and How Much to Imagine: Adaptive Test-Time Scaling with World Models for Visual Spatial Reasoning
di: Yu, Shoubin, et al.
Pubblicazione: (2026)
di: Yu, Shoubin, et al.
Pubblicazione: (2026)
CREMA: Generalizable and Efficient Video-Language Reasoning via Multimodal Modular Fusion
di: Yu, Shoubin, et al.
Pubblicazione: (2024)
di: Yu, Shoubin, et al.
Pubblicazione: (2024)
SAFREE: Training-Free and Adaptive Guard for Safe Text-to-Image And Video Generation
di: Yoon, Jaehong, et al.
Pubblicazione: (2024)
di: Yoon, Jaehong, et al.
Pubblicazione: (2024)
Motion-Grounded Video Reasoning: Understanding and Perceiving Motion at Pixel Level
di: Deng, Andong, et al.
Pubblicazione: (2024)
di: Deng, Andong, et al.
Pubblicazione: (2024)
Analyzing and Mitigating Object Hallucination in Large Vision-Language Models
di: Zhou, Yiyang, et al.
Pubblicazione: (2023)
di: Zhou, Yiyang, et al.
Pubblicazione: (2023)
RACCooN: A Versatile Instructional Video Editing Framework with Auto-Generated Narratives
di: Yoon, Jaehong, et al.
Pubblicazione: (2024)
di: Yoon, Jaehong, et al.
Pubblicazione: (2024)
VisionCoach: Reinforcing Grounded Video Reasoning via Visual-Perception Prompting
di: Lee, Daeun, et al.
Pubblicazione: (2026)
di: Lee, Daeun, et al.
Pubblicazione: (2026)
Knowing the Answer Isn't Enough: Fixing Reasoning Path Failures in LVLMs
di: Wang, Chaoyang, et al.
Pubblicazione: (2025)
di: Wang, Chaoyang, et al.
Pubblicazione: (2025)
Fine-Grained Verifiers: Preference Modeling as Next-token Prediction in Vision-Language Alignment
di: Cui, Chenhang, et al.
Pubblicazione: (2024)
di: Cui, Chenhang, et al.
Pubblicazione: (2024)
Video-RTS: Rethinking Reinforcement Learning and Test-Time Scaling for Efficient and Enhanced Video Reasoning
di: Wang, Ziyang, et al.
Pubblicazione: (2025)
di: Wang, Ziyang, et al.
Pubblicazione: (2025)
VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long Videos
di: Wang, Ziyang, et al.
Pubblicazione: (2024)
di: Wang, Ziyang, et al.
Pubblicazione: (2024)
ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding
di: Zhou, Yiyang, et al.
Pubblicazione: (2025)
di: Zhou, Yiyang, et al.
Pubblicazione: (2025)
VEGGIE: Instructional Editing and Reasoning Video Concepts with Grounded Generation
di: Yu, Shoubin, et al.
Pubblicazione: (2025)
di: Yu, Shoubin, et al.
Pubblicazione: (2025)
MEXA: Towards General Multimodal Reasoning with Dynamic Multi-Expert Aggregation
di: Yu, Shoubin, et al.
Pubblicazione: (2025)
di: Yu, Shoubin, et al.
Pubblicazione: (2025)
MAGDi: Structured Distillation of Multi-Agent Interaction Graphs Improves Reasoning in Smaller Language Models
di: Chen, Justin Chih-Yao, et al.
Pubblicazione: (2024)
di: Chen, Justin Chih-Yao, et al.
Pubblicazione: (2024)
Aligning Modalities in Vision Large Language Models via Preference Fine-tuning
di: Zhou, Yiyang, et al.
Pubblicazione: (2024)
di: Zhou, Yiyang, et al.
Pubblicazione: (2024)
CAPTURe: Evaluating Spatial Reasoning in Vision Language Models via Occluded Object Counting
di: Pothiraj, Atin, et al.
Pubblicazione: (2025)
di: Pothiraj, Atin, et al.
Pubblicazione: (2025)
CVD-STORM: Cross-View Video Diffusion with Spatial-Temporal Reconstruction Model for Autonomous Driving
di: Zhang, Tianrui, et al.
Pubblicazione: (2025)
di: Zhang, Tianrui, et al.
Pubblicazione: (2025)
Ego2Web: A Web Agent Benchmark Grounded in Egocentric Videos
di: Yu, Shoubin, et al.
Pubblicazione: (2026)
di: Yu, Shoubin, et al.
Pubblicazione: (2026)
Multimodal Representation Learning by Alternating Unimodal Adaptation
di: Zhang, Xiaohui, et al.
Pubblicazione: (2023)
di: Zhang, Xiaohui, et al.
Pubblicazione: (2023)
EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video Understanding
di: Wang, Ziyang, et al.
Pubblicazione: (2026)
di: Wang, Ziyang, et al.
Pubblicazione: (2026)
Training-free Guidance in Text-to-Video Generation via Multimodal Planning and Structured Noise Initialization
di: Li, Jialu, et al.
Pubblicazione: (2025)
di: Li, Jialu, et al.
Pubblicazione: (2025)
Mementos: A Comprehensive Benchmark for Multimodal Large Language Model Reasoning over Image Sequences
di: Wang, Xiyao, et al.
Pubblicazione: (2024)
di: Wang, Xiyao, et al.
Pubblicazione: (2024)
Rephrase, Augment, Reason: Visual Grounding of Questions for Vision-Language Models
di: Prasad, Archiki, et al.
Pubblicazione: (2023)
di: Prasad, Archiki, et al.
Pubblicazione: (2023)
CALM Before the STORM: Unlocking Native Reasoning for Optimization Modeling
di: Tang, Zhengyang, et al.
Pubblicazione: (2025)
di: Tang, Zhengyang, et al.
Pubblicazione: (2025)
From Perception to Reasoning: Deep Thinking Empowers Multimodal Large Language Models
di: Zhu, Wenxin, et al.
Pubblicazione: (2025)
di: Zhu, Wenxin, et al.
Pubblicazione: (2025)
Calibrated Self-Rewarding Vision Language Models
di: Zhou, Yiyang, et al.
Pubblicazione: (2024)
di: Zhou, Yiyang, et al.
Pubblicazione: (2024)
Verifiable Format Control for Large Language Model Generations
di: Wang, Zhaoyang, et al.
Pubblicazione: (2025)
di: Wang, Zhaoyang, et al.
Pubblicazione: (2025)
ReConcile: Round-Table Conference Improves Reasoning via Consensus among Diverse LLMs
di: Chen, Justin Chih-Yao, et al.
Pubblicazione: (2023)
di: Chen, Justin Chih-Yao, et al.
Pubblicazione: (2023)
Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement
di: Wang, Xiyao, et al.
Pubblicazione: (2024)
di: Wang, Xiyao, et al.
Pubblicazione: (2024)
STAR: A Benchmark for Situated Reasoning in Real-World Videos
di: Wu, Bo, et al.
Pubblicazione: (2024)
di: Wu, Bo, et al.
Pubblicazione: (2024)
Video-Skill-CoT: Skill-based Chain-of-Thoughts for Domain-Adaptive Video Reasoning
di: Lee, Daeun, et al.
Pubblicazione: (2025)
di: Lee, Daeun, et al.
Pubblicazione: (2025)
STORM: Spatio-Temporal Reconstruction Model for Large-Scale Outdoor Scenes
di: Yang, Jiawei, et al.
Pubblicazione: (2024)
di: Yang, Jiawei, et al.
Pubblicazione: (2024)
A.I.R.: Enabling Adaptive, Iterative, and Reasoning-based Frame Selection For Video Question Answering
di: Zou, Yuanhao, et al.
Pubblicazione: (2025)
di: Zou, Yuanhao, et al.
Pubblicazione: (2025)
Balancing Faithfulness and Performance in Reasoning via Multi-Listener Soft Execution
di: Sivakumaran, Nithin, et al.
Pubblicazione: (2026)
di: Sivakumaran, Nithin, et al.
Pubblicazione: (2026)
A Simple LLM Framework for Long-Range Video Question-Answering
di: Zhang, Ce, et al.
Pubblicazione: (2023)
di: Zhang, Ce, et al.
Pubblicazione: (2023)
CREAM: Consistency Regularized Self-Rewarding Language Models
di: Wang, Zhaoyang, et al.
Pubblicazione: (2024)
di: Wang, Zhaoyang, et al.
Pubblicazione: (2024)
VLN-Video: Utilizing Driving Videos for Outdoor Vision-and-Language Navigation
di: Li, Jialu, et al.
Pubblicazione: (2024)
di: Li, Jialu, et al.
Pubblicazione: (2024)
STORM: End-to-End Referring Multi-Object Tracking in Videos
di: Lu, Zijia, et al.
Pubblicazione: (2026)
di: Lu, Zijia, et al.
Pubblicazione: (2026)
Documenti analoghi
-
SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
di: Deng, Andong, et al.
Pubblicazione: (2025) -
When and How Much to Imagine: Adaptive Test-Time Scaling with World Models for Visual Spatial Reasoning
di: Yu, Shoubin, et al.
Pubblicazione: (2026) -
CREMA: Generalizable and Efficient Video-Language Reasoning via Multimodal Modular Fusion
di: Yu, Shoubin, et al.
Pubblicazione: (2024) -
SAFREE: Training-Free and Adaptive Guard for Safe Text-to-Image And Video Generation
di: Yoon, Jaehong, et al.
Pubblicazione: (2024) -
Motion-Grounded Video Reasoning: Understanding and Perceiving Motion at Pixel Level
di: Deng, Andong, et al.
Pubblicazione: (2024)