Guardado en:
| Autores principales: | Feng, Bo, Lai, Zhengfeng, Li, Shiyu, Wang, Zizhen, Wang, Simon, Huang, Ping, Cao, Meng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2505.14321 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Incentivizing Temporal-Awareness in Egocentric Video Understanding Models
por: Xu, Zhiyang, et al.
Publicado: (2026)
por: Xu, Zhiyang, et al.
Publicado: (2026)
StreamBridge: Turning Your Offline Video Large Language Model into a Proactive Streaming Assistant
por: Wang, Haibo, et al.
Publicado: (2025)
por: Wang, Haibo, et al.
Publicado: (2025)
SlowFast-LLaVA-1.5: A Family of Token-Efficient Video Large Language Models for Long-Form Video Understanding
por: Xu, Mingze, et al.
Publicado: (2025)
por: Xu, Mingze, et al.
Publicado: (2025)
ReTaKe: Reducing Temporal and Knowledge Redundancy for Long Video Understanding
por: Wang, Xiao, et al.
Publicado: (2024)
por: Wang, Xiao, et al.
Publicado: (2024)
VideoLoom: A Video Large Language Model for Joint Spatial-Temporal Understanding
por: Shi, Jiapeng, et al.
Publicado: (2026)
por: Shi, Jiapeng, et al.
Publicado: (2026)
Thinking with Drafts: Speculative Temporal Reasoning for Efficient Long Video Understanding
por: Hu, Pengfei, et al.
Publicado: (2025)
por: Hu, Pengfei, et al.
Publicado: (2025)
Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction
por: Guan, Kaisi, et al.
Publicado: (2025)
por: Guan, Kaisi, et al.
Publicado: (2025)
Dr.V: A Hierarchical Perception-Temporal-Cognition Framework to Diagnose Video Hallucination by Fine-grained Spatial-Temporal Grounding
por: Luo, Meng, et al.
Publicado: (2025)
por: Luo, Meng, et al.
Publicado: (2025)
ETVA: Evaluation of Text-to-Video Alignment via Fine-grained Question Generation and Answering
por: Guan, Kaisi, et al.
Publicado: (2025)
por: Guan, Kaisi, et al.
Publicado: (2025)
MotionBench: Benchmarking and Improving Fine-grained Video Motion Understanding for Vision Language Models
por: Hong, Wenyi, et al.
Publicado: (2025)
por: Hong, Wenyi, et al.
Publicado: (2025)
VideoRefer Suite: Advancing Spatial-Temporal Object Understanding with Video LLM
por: Yuan, Yuqian, et al.
Publicado: (2024)
por: Yuan, Yuqian, et al.
Publicado: (2024)
Seq2Time: Sequential Knowledge Transfer for Video LLM Temporal Grounding
por: Deng, Andong, et al.
Publicado: (2024)
por: Deng, Andong, et al.
Publicado: (2024)
EgoGraph: Temporal Knowledge Graph for Egocentric Video Understanding
por: Sun, Shitong, et al.
Publicado: (2026)
por: Sun, Shitong, et al.
Publicado: (2026)
LVBench: An Extreme Long Video Understanding Benchmark
por: Wang, Weihan, et al.
Publicado: (2024)
por: Wang, Weihan, et al.
Publicado: (2024)
PosMLP-Video: Spatial and Temporal Relative Position Encoding for Efficient Video Recognition
por: Hao, Yanbin, et al.
Publicado: (2024)
por: Hao, Yanbin, et al.
Publicado: (2024)
MVPBench: A Multi-Video Perception Evaluation Benchmark for Multi-Modal Video Understanding
por: Bai, Purui, et al.
Publicado: (2026)
por: Bai, Purui, et al.
Publicado: (2026)
VCBench: A Streaming Counting Benchmark for Spatial-Temporal State Maintenance in Long Videos
por: Liu, Pengyiang, et al.
Publicado: (2026)
por: Liu, Pengyiang, et al.
Publicado: (2026)
TUMTraffic-VideoQA: A Benchmark for Unified Spatio-Temporal Video Understanding in Traffic Scenes
por: Zhou, Xingcheng, et al.
Publicado: (2025)
por: Zhou, Xingcheng, et al.
Publicado: (2025)
VideoCompressa: Data-Efficient Video Understanding via Joint Temporal Compression and Spatial Reconstruction
por: Wang, Shaobo, et al.
Publicado: (2025)
por: Wang, Shaobo, et al.
Publicado: (2025)
VideoExpert: Augmented LLM for Temporal-Sensitive Video Understanding
por: Zhao, Henghao, et al.
Publicado: (2025)
por: Zhao, Henghao, et al.
Publicado: (2025)
V-CORE: Temporally Consistent Video Understanding for Video-LLM
por: Kang, Zhengjian, et al.
Publicado: (2026)
por: Kang, Zhengjian, et al.
Publicado: (2026)
SlowFocus: Enhancing Fine-grained Temporal Understanding in Video LLM
por: Nie, Ming, et al.
Publicado: (2026)
por: Nie, Ming, et al.
Publicado: (2026)
Benchmarking the Trustworthiness in Multimodal LLMs for Video Understanding
por: Wang, Youze, et al.
Publicado: (2025)
por: Wang, Youze, et al.
Publicado: (2025)
E-VAds: An E-commerce Short Videos Understanding Benchmark for MLLMs
por: Liu, Xianjie, et al.
Publicado: (2026)
por: Liu, Xianjie, et al.
Publicado: (2026)
VideoINSTA: Zero-shot Long Video Understanding via Informative Spatial-Temporal Reasoning with LLMs
por: Liao, Ruotong, et al.
Publicado: (2024)
por: Liao, Ruotong, et al.
Publicado: (2024)
MVBench: A Comprehensive Multi-modal Video Understanding Benchmark
por: Li, Kunchang, et al.
Publicado: (2023)
por: Li, Kunchang, et al.
Publicado: (2023)
STOP: Integrated Spatial-Temporal Dynamic Prompting for Video Understanding
por: Liu, Zichen, et al.
Publicado: (2025)
por: Liu, Zichen, et al.
Publicado: (2025)
TV-RAG: A Temporal-aware and Semantic Entropy-Weighted Framework for Long Video Retrieval and Understanding
por: Cao, Zongsheng, et al.
Publicado: (2025)
por: Cao, Zongsheng, et al.
Publicado: (2025)
Efficient Video Face Enhancement with Enhanced Spatial-Temporal Consistency
por: Wang, Yutong, et al.
Publicado: (2024)
por: Wang, Yutong, et al.
Publicado: (2024)
Identity-Preserving Text-to-Video Generation Guided by Simple yet Effective Spatial-Temporal Decoupled Representations
por: Wang, Yuji, et al.
Publicado: (2025)
por: Wang, Yuji, et al.
Publicado: (2025)
VTok: A Unified Video Tokenizer with Decoupled Spatial-Temporal Latents
por: Wang, Feng, et al.
Publicado: (2026)
por: Wang, Feng, et al.
Publicado: (2026)
VSAS-Bench: Real-Time Evaluation of Visual Streaming Assistant Models
por: Vasu, Pavan Kumar Anasosalu, et al.
Publicado: (2026)
por: Vasu, Pavan Kumar Anasosalu, et al.
Publicado: (2026)
EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization
por: Wang, Xiaoqi, et al.
Publicado: (2025)
por: Wang, Xiaoqi, et al.
Publicado: (2025)
RS3DBench: A Comprehensive Benchmark for 3D Spatial Perception in Remote Sensing
por: Wang, Jiayu, et al.
Publicado: (2025)
por: Wang, Jiayu, et al.
Publicado: (2025)
Active Perception Agent for Omnimodal Audio-Video Understanding
por: Tao, Keda, et al.
Publicado: (2025)
por: Tao, Keda, et al.
Publicado: (2025)
Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models
por: Wang, Haibo, et al.
Publicado: (2024)
por: Wang, Haibo, et al.
Publicado: (2024)
VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning
por: Li, Xinhao, et al.
Publicado: (2025)
por: Li, Xinhao, et al.
Publicado: (2025)
Benchmarking Video Frame Interpolation
por: Kiefhaber, Simon, et al.
Publicado: (2024)
por: Kiefhaber, Simon, et al.
Publicado: (2024)
Breaking Down Monocular Ambiguity: Exploiting Temporal Evolution for 3D Lane Detection
por: Zheng, Huan, et al.
Publicado: (2025)
por: Zheng, Huan, et al.
Publicado: (2025)
VERIFIED: A Video Corpus Moment Retrieval Benchmark for Fine-Grained Video Understanding
por: Chen, Houlun, et al.
Publicado: (2024)
por: Chen, Houlun, et al.
Publicado: (2024)
Ejemplares similares
-
Incentivizing Temporal-Awareness in Egocentric Video Understanding Models
por: Xu, Zhiyang, et al.
Publicado: (2026) -
StreamBridge: Turning Your Offline Video Large Language Model into a Proactive Streaming Assistant
por: Wang, Haibo, et al.
Publicado: (2025) -
SlowFast-LLaVA-1.5: A Family of Token-Efficient Video Large Language Models for Long-Form Video Understanding
por: Xu, Mingze, et al.
Publicado: (2025) -
ReTaKe: Reducing Temporal and Knowledge Redundancy for Long Video Understanding
por: Wang, Xiao, et al.
Publicado: (2024) -
VideoLoom: A Video Large Language Model for Joint Spatial-Temporal Understanding
por: Shi, Jiapeng, et al.
Publicado: (2026)