VideoITG: Multimodal Video Understanding with Instructed Temporal Grounding
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Shihao, Chen, Guo, Huang, De-an, Li, Zhiqi, Li, Minghan, Liu, Guilin, Alvarez, Jose M., Zhang, Lei, Yu, Zhiding |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
STORM: Token-Efficient Long Video Understanding for Multimodal LLMs
di: Jiang, Jindong, et al.
Pubblicazione: (2025)
di: Jiang, Jindong, et al.
Pubblicazione: (2025)
PhyCritic: Multimodal Critic Models for Physical AI
di: Xiong, Tianyi, et al.
Pubblicazione: (2026)
di: Xiong, Tianyi, et al.
Pubblicazione: (2026)
LITA: Language Instructed Temporal-Localization Assistant
di: Huang, De-An, et al.
Pubblicazione: (2024)
di: Huang, De-An, et al.
Pubblicazione: (2024)
Slow-Fast Architecture for Video Multi-Modal Large Language Models
di: Shi, Min, et al.
Pubblicazione: (2025)
di: Shi, Min, et al.
Pubblicazione: (2025)
FRAG: Frame Selection Augmented Generation for Long Video and Long Document Understanding
di: Huang, De-An, et al.
Pubblicazione: (2025)
di: Huang, De-An, et al.
Pubblicazione: (2025)
Towards Multimodal Lifelong Understanding: A Dataset and Agentic Baseline
di: Chen, Guo, et al.
Pubblicazione: (2026)
di: Chen, Guo, et al.
Pubblicazione: (2026)
StreamChat: Chatting with Streaming Video
di: Liu, Jihao, et al.
Pubblicazione: (2024)
di: Liu, Jihao, et al.
Pubblicazione: (2024)
Video Mamba Suite: State Space Model as a Versatile Alternative for Video Understanding
di: Chen, Guo, et al.
Pubblicazione: (2024)
di: Chen, Guo, et al.
Pubblicazione: (2024)
LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding
di: Wang, Shihao, et al.
Pubblicazione: (2026)
di: Wang, Shihao, et al.
Pubblicazione: (2026)
What is Point Supervision Worth in Video Instance Segmentation?
di: Huang, Shuaiyi, et al.
Pubblicazione: (2024)
di: Huang, Shuaiyi, et al.
Pubblicazione: (2024)
InternVideo2: Scaling Foundation Models for Multimodal Video Understanding
di: Wang, Yi, et al.
Pubblicazione: (2024)
di: Wang, Yi, et al.
Pubblicazione: (2024)
Hydra-MDP: End-to-end Multimodal Planning with Multi-target Hydra-Distillation
di: Li, Zhenxin, et al.
Pubblicazione: (2024)
di: Li, Zhenxin, et al.
Pubblicazione: (2024)
MUSEG: Reinforcing Video Temporal Understanding via Timestamp-Aware Multi-Segment Grounding
di: Luo, Fuwen, et al.
Pubblicazione: (2025)
di: Luo, Fuwen, et al.
Pubblicazione: (2025)
EtC: Temporal Boundary Expand then Clarify for Weakly Supervised Video Grounding with Multimodal Large Language Model
di: Li, Guozhang, et al.
Pubblicazione: (2023)
di: Li, Guozhang, et al.
Pubblicazione: (2023)
VideoTemp-o3: Harmonizing Temporal Grounding and Video Understanding in Agentic Thinking-with-Videos
di: Liu, Wenqi, et al.
Pubblicazione: (2026)
di: Liu, Wenqi, et al.
Pubblicazione: (2026)
VIRST: Video-Instructed Reasoning Assistant for SpatioTemporal Segmentation
di: Hong, Jihwan, et al.
Pubblicazione: (2026)
di: Hong, Jihwan, et al.
Pubblicazione: (2026)
Foresee-to-Ground: From Predictive Temporal Perception to Evidence-Driven Reasoning for Video Temporal Grounding
di: Zheng, Zelin, et al.
Pubblicazione: (2026)
di: Zheng, Zelin, et al.
Pubblicazione: (2026)
VTG-LLM: Integrating Timestamp Knowledge into Video LLMs for Enhanced Video Temporal Grounding
di: Guo, Yongxin, et al.
Pubblicazione: (2024)
di: Guo, Yongxin, et al.
Pubblicazione: (2024)
TRACE: Temporal Grounding Video LLM via Causal Event Modeling
di: Guo, Yongxin, et al.
Pubblicazione: (2024)
di: Guo, Yongxin, et al.
Pubblicazione: (2024)
A Survey on Video Temporal Grounding with Multimodal Large Language Model
di: Wu, Jianlong, et al.
Pubblicazione: (2025)
di: Wu, Jianlong, et al.
Pubblicazione: (2025)
Enrich and Detect: Video Temporal Grounding with Multimodal LLMs
di: Pramanick, Shraman, et al.
Pubblicazione: (2025)
di: Pramanick, Shraman, et al.
Pubblicazione: (2025)
Think with Grounding: Curriculum Reinforced Reasoning with Video Grounding for Long Video Understanding
di: Chen, Houlun, et al.
Pubblicazione: (2026)
di: Chen, Houlun, et al.
Pubblicazione: (2026)
Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought
di: Man, Yunze, et al.
Pubblicazione: (2025)
di: Man, Yunze, et al.
Pubblicazione: (2025)
When and What: Diffusion-Grounded VideoLLM with Entity Aware Segmentation for Long Video Understanding
di: Fang, Pengcheng, et al.
Pubblicazione: (2025)
di: Fang, Pengcheng, et al.
Pubblicazione: (2025)
UniVS: Unified and Universal Video Segmentation with Prompts as Queries
di: Li, Minghan, et al.
Pubblicazione: (2024)
di: Li, Minghan, et al.
Pubblicazione: (2024)
LEMON: How Well Do MLLMs Perform Temporal Multimodal Understanding on Instructional Videos?
di: Yu, Zhuang, et al.
Pubblicazione: (2026)
di: Yu, Zhuang, et al.
Pubblicazione: (2026)
VideoExpert: Augmented LLM for Temporal-Sensitive Video Understanding
di: Zhao, Henghao, et al.
Pubblicazione: (2025)
di: Zhao, Henghao, et al.
Pubblicazione: (2025)
EvoGround: Self-Evolving Video Agents for Video Temporal Grounding
di: Jung, Minjoon, et al.
Pubblicazione: (2026)
di: Jung, Minjoon, et al.
Pubblicazione: (2026)
T2SGrid: Temporal-to-Spatial Gridification for Video Temporal Grounding
di: Guo, Chaohong, et al.
Pubblicazione: (2026)
di: Guo, Chaohong, et al.
Pubblicazione: (2026)
Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation
di: Li, Jiaze, et al.
Pubblicazione: (2026)
di: Li, Jiaze, et al.
Pubblicazione: (2026)
VidHalluc: Evaluating Temporal Hallucinations in Multimodal Large Language Models for Video Understanding
di: Li, Chaoyu, et al.
Pubblicazione: (2024)
di: Li, Chaoyu, et al.
Pubblicazione: (2024)
TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding
di: Yang, Zuhao, et al.
Pubblicazione: (2025)
di: Yang, Zuhao, et al.
Pubblicazione: (2025)
Pixel-SAIL: Single Transformer For Pixel-Grounded Understanding
di: Zhang, Tao, et al.
Pubblicazione: (2025)
di: Zhang, Tao, et al.
Pubblicazione: (2025)
Context-Guided Spatio-Temporal Video Grounding
di: Gu, Xin, et al.
Pubblicazione: (2024)
di: Gu, Xin, et al.
Pubblicazione: (2024)
$R^2$-Tuning: Efficient Image-to-Video Transfer Learning for Video Temporal Grounding
di: Liu, Ye, et al.
Pubblicazione: (2024)
di: Liu, Ye, et al.
Pubblicazione: (2024)
SurgViVQA: Temporally-Grounded Video Question Answering for Surgical Scene Understanding
di: Drago, Mauro Orazio, et al.
Pubblicazione: (2025)
di: Drago, Mauro Orazio, et al.
Pubblicazione: (2025)
VideoAgent: A Memory-augmented Multimodal Agent for Video Understanding
di: Fan, Yue, et al.
Pubblicazione: (2024)
di: Fan, Yue, et al.
Pubblicazione: (2024)
Beyond Raw Videos: Understanding Edited Videos with Large Multimodal Model
di: Xu, Lu, et al.
Pubblicazione: (2024)
di: Xu, Lu, et al.
Pubblicazione: (2024)
Unified Static and Dynamic Network: Efficient Temporal Filtering for Video Grounding
di: Hu, Jingjing, et al.
Pubblicazione: (2024)
di: Hu, Jingjing, et al.
Pubblicazione: (2024)
Video-GroundingDINO: Towards Open-Vocabulary Spatio-Temporal Video Grounding
di: Wasim, Syed Talal, et al.
Pubblicazione: (2023)
di: Wasim, Syed Talal, et al.
Pubblicazione: (2023)
Documenti analoghi
-
STORM: Token-Efficient Long Video Understanding for Multimodal LLMs
di: Jiang, Jindong, et al.
Pubblicazione: (2025) -
PhyCritic: Multimodal Critic Models for Physical AI
di: Xiong, Tianyi, et al.
Pubblicazione: (2026) -
LITA: Language Instructed Temporal-Localization Assistant
di: Huang, De-An, et al.
Pubblicazione: (2024) -
Slow-Fast Architecture for Video Multi-Modal Large Language Models
di: Shi, Min, et al.
Pubblicazione: (2025) -
FRAG: Frame Selection Augmented Generation for Long Video and Long Document Understanding
di: Huang, De-An, et al.
Pubblicazione: (2025)