Video-STR: Reinforcing MLLMs in Video Spatio-Temporal Reasoning with Relation Graph
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Wentao, Zou, Heqing, Luo, Tianze, Huang, Rui, Zhao, Yutian, Wang, Zhuochen, Zhang, Hansheng, Qin, Chengwei, Wang, Yan, Zhao, Lin, Zhang, Huaijian |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning
por: Chen, Ruizhe, et al.
Publicado: (2025)
por: Chen, Ruizhe, et al.
Publicado: (2025)
Video-CoE: Reinforcing Video Event Prediction via Chain of Events
por: Su, Qile, et al.
Publicado: (2026)
por: Su, Qile, et al.
Publicado: (2026)
From Seconds to Hours: Reviewing MultiModal Large Language Models on Comprehensive Long Video Understanding
por: Zou, Heqing, et al.
Publicado: (2024)
por: Zou, Heqing, et al.
Publicado: (2024)
Learning Discriminative Spatio-temporal Representations for Semi-supervised Action Recognition
por: Wang, Yu, et al.
Publicado: (2024)
por: Wang, Yu, et al.
Publicado: (2024)
HLV-1K: A Large-scale Hour-Long Video Benchmark for Time-Specific Long Video Understanding
por: Zou, Heqing, et al.
Publicado: (2025)
por: Zou, Heqing, et al.
Publicado: (2025)
Semantic2Graph: Graph-based Multi-modal Feature Fusion for Action Segmentation in Videos
por: Zhang, Junbin, et al.
Publicado: (2022)
por: Zhang, Junbin, et al.
Publicado: (2022)
An Empirical Study for Representations of Videos in Video Question Answering via MLLMs
por: Li, Zhi, et al.
Publicado: (2025)
por: Li, Zhi, et al.
Publicado: (2025)
AVATAAR: Agentic Video Answering via Temporal Adaptive Alignment and Reasoning
por: Patel, Urjitkumar, et al.
Publicado: (2025)
por: Patel, Urjitkumar, et al.
Publicado: (2025)
Quantifying and Narrowing the Unknown: Interactive Text-to-Video Retrieval via Uncertainty Minimization
por: Zhang, Bingqing, et al.
Publicado: (2025)
por: Zhang, Bingqing, et al.
Publicado: (2025)
Deep Learning Approaches for Human Action Recognition in Video Data
por: Xie, Yufei
Publicado: (2024)
por: Xie, Yufei
Publicado: (2024)
Multi-scale Temporal Prediction via Incremental Generation and Multi-agent Collaboration
por: Zeng, Zhitao, et al.
Publicado: (2025)
por: Zeng, Zhitao, et al.
Publicado: (2025)
Order-Robust Class Incremental Learning: Graph-Driven Dynamic Similarity Grouping
por: Lai, Guannan, et al.
Publicado: (2025)
por: Lai, Guannan, et al.
Publicado: (2025)
FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models
por: Fu, Tianyu, et al.
Publicado: (2024)
por: Fu, Tianyu, et al.
Publicado: (2024)
MaP-AVR: A Meta-Action Planner for Agents Leveraging Vision Language Models and Retrieval-Augmented Generation
por: Guo, Zhenglong, et al.
Publicado: (2025)
por: Guo, Zhenglong, et al.
Publicado: (2025)
Extrapolating and Decoupling Image-to-Video Generation Models: Motion Modeling is Easier Than You Think
por: Tian, Jie, et al.
Publicado: (2025)
por: Tian, Jie, et al.
Publicado: (2025)
TRACES: Temporal Recall with Contextual Embeddings for Real-Time Video Anomaly Detection
por: Siddiqui, Yousuf Ahmed, et al.
Publicado: (2025)
por: Siddiqui, Yousuf Ahmed, et al.
Publicado: (2025)
Anonymization-Enhanced Privacy Protection for Mobile GUI Agents: Available but Invisible
por: Zhao, Lepeng, et al.
Publicado: (2026)
por: Zhao, Lepeng, et al.
Publicado: (2026)
Fre-Res: Frequency-Residual Video Token Compression for Efficient Video MLLMs
por: Feng, Yigui, et al.
Publicado: (2026)
por: Feng, Yigui, et al.
Publicado: (2026)
The MSR-Video to Text Dataset with Clean Annotations
por: Chen, Haoran, et al.
Publicado: (2021)
por: Chen, Haoran, et al.
Publicado: (2021)
Perception-Consistency Multimodal Large Language Models Reasoning via Caption-Regularized Policy Optimization
por: Tu, Songjun, et al.
Publicado: (2025)
por: Tu, Songjun, et al.
Publicado: (2025)
Sequence Matters: Harnessing Video Models in 3D Super-Resolution
por: Ko, Hyun-kyu, et al.
Publicado: (2024)
por: Ko, Hyun-kyu, et al.
Publicado: (2024)
UrbanAlign: Post-hoc Semantic Calibration for VLM-Human Preference Alignment
por: Zhang, Yecheng, et al.
Publicado: (2026)
por: Zhang, Yecheng, et al.
Publicado: (2026)
TableMoE: Neuro-Symbolic Routing for Structured Expert Reasoning in Multimodal Table Understanding
por: Zhang, Junwen, et al.
Publicado: (2025)
por: Zhang, Junwen, et al.
Publicado: (2025)
A Plug-and-Play Temporal Normalization Module for Robust Remote Photoplethysmography
por: Wang, Kegang, et al.
Publicado: (2024)
por: Wang, Kegang, et al.
Publicado: (2024)
VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding
por: Yang, Baoyao, et al.
Publicado: (2025)
por: Yang, Baoyao, et al.
Publicado: (2025)
ReasonPlan: Unified Scene Prediction and Decision Reasoning for Closed-loop Autonomous Driving
por: Liu, Xueyi, et al.
Publicado: (2025)
por: Liu, Xueyi, et al.
Publicado: (2025)
VDPP: Video Depth Post-Processing for Speed and Scalability
por: Yoon, Daewon, et al.
Publicado: (2026)
por: Yoon, Daewon, et al.
Publicado: (2026)
Robust Test-time Video-Text Retrieval: Benchmarking and Adapting for Query Shifts
por: Zhang, Bingqing, et al.
Publicado: (2026)
por: Zhang, Bingqing, et al.
Publicado: (2026)
Predicting Pedestrian Crossing Behavior in Germany and Japan: Insights into Model Transferability
por: Zhang, Chi, et al.
Publicado: (2024)
por: Zhang, Chi, et al.
Publicado: (2024)
Predicting and Analyzing Pedestrian Crossing Behavior at Unsignalized Crossings
por: Zhang, Chi, et al.
Publicado: (2024)
por: Zhang, Chi, et al.
Publicado: (2024)
Consistent Zero-shot 3D Texture Synthesis Using Geometry-aware Diffusion and Temporal Video Models
por: Kang, Donggoo, et al.
Publicado: (2025)
por: Kang, Donggoo, et al.
Publicado: (2025)
Force-Aware 3D Contact Modeling for Stable Grasp Generation
por: Chen, Zhuo, et al.
Publicado: (2025)
por: Chen, Zhuo, et al.
Publicado: (2025)
SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence
por: Zeng, Zhitao, et al.
Publicado: (2025)
por: Zeng, Zhitao, et al.
Publicado: (2025)
Rethinking Visual Intelligence: Insights from Video Pretraining
por: Acuaviva, Pablo, et al.
Publicado: (2025)
por: Acuaviva, Pablo, et al.
Publicado: (2025)
Interpreting Video Representations with Spatio-Temporal Sparse Autoencoders
por: Dokme, Atahan, et al.
Publicado: (2026)
por: Dokme, Atahan, et al.
Publicado: (2026)
Graph-PiT: Enhancing Structural Coherence in Part-Based Image Synthesis via Graph Priors
por: Zhang, Junbin, et al.
Publicado: (2026)
por: Zhang, Junbin, et al.
Publicado: (2026)
Addressing Issues with Working Memory in Video Object Segmentation
por: Bromley, Clayton, et al.
Publicado: (2024)
por: Bromley, Clayton, et al.
Publicado: (2024)
GIIM: Graph-based Learning of Inter- and Intra-view Dependencies for Multi-view Medical Image Diagnosis
por: Sam, Tran Bao, et al.
Publicado: (2026)
por: Sam, Tran Bao, et al.
Publicado: (2026)
Deterministic Event-Graph Substrates as World Models for Counterfactual Reasoning
por: Rovai, Fabio
Publicado: (2026)
por: Rovai, Fabio
Publicado: (2026)
DiffYOLO: Object Detection for Anti-Noise via YOLO and Diffusion Models
por: Liu, Yichen, et al.
Publicado: (2024)
por: Liu, Yichen, et al.
Publicado: (2024)
Ejemplares similares
-
Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning
por: Chen, Ruizhe, et al.
Publicado: (2025) -
Video-CoE: Reinforcing Video Event Prediction via Chain of Events
por: Su, Qile, et al.
Publicado: (2026) -
From Seconds to Hours: Reviewing MultiModal Large Language Models on Comprehensive Long Video Understanding
por: Zou, Heqing, et al.
Publicado: (2024) -
Learning Discriminative Spatio-temporal Representations for Semi-supervised Action Recognition
por: Wang, Yu, et al.
Publicado: (2024) -
HLV-1K: A Large-scale Hour-Long Video Benchmark for Time-Specific Long Video Understanding
por: Zou, Heqing, et al.
Publicado: (2025)