Incentivizing Temporal-Awareness in Egocentric Video Understanding Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Xu, Zhiyang, Qin, Tian, Jin, Bowen, Lai, Zhengfeng, Cao, Meng, Huang, Lifu, Zhang, Peng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Breaking Down Video LLM Benchmarks: Knowledge, Spatial Perception, or True Temporal Understanding?
por: Feng, Bo, et al.
Publicado: (2025)
por: Feng, Bo, et al.
Publicado: (2025)
SPARTUN3D: Situated Spatial Understanding of 3D World in Large Language Models
por: Zhang, Yue, et al.
Publicado: (2024)
por: Zhang, Yue, et al.
Publicado: (2024)
Do Egocentric Video-Language Models Truly Understand Hand-Object Interactions?
por: Xu, Boshen, et al.
Publicado: (2024)
por: Xu, Boshen, et al.
Publicado: (2024)
EgoGraph: Temporal Knowledge Graph for Egocentric Video Understanding
por: Sun, Shitong, et al.
Publicado: (2026)
por: Sun, Shitong, et al.
Publicado: (2026)
Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models
por: Wang, Haibo, et al.
Publicado: (2024)
por: Wang, Haibo, et al.
Publicado: (2024)
SlowFast-LLaVA-1.5: A Family of Token-Efficient Video Large Language Models for Long-Form Video Understanding
por: Xu, Mingze, et al.
Publicado: (2025)
por: Xu, Mingze, et al.
Publicado: (2025)
AR-RAG: Autoregressive Retrieval Augmentation for Image Generation
por: Qi, Jingyuan, et al.
Publicado: (2025)
por: Qi, Jingyuan, et al.
Publicado: (2025)
ETVA: Evaluation of Text-to-Video Alignment via Fine-grained Question Generation and Answering
por: Guan, Kaisi, et al.
Publicado: (2025)
por: Guan, Kaisi, et al.
Publicado: (2025)
EgoDTM: Towards 3D-Aware Egocentric Video-Language Pretraining
por: Xu, Boshen, et al.
Publicado: (2025)
por: Xu, Boshen, et al.
Publicado: (2025)
Think, Act, Build: An Agentic Framework with Vision Language Models for Zero-Shot 3D Visual Grounding
por: Wang, Haibo, et al.
Publicado: (2026)
por: Wang, Haibo, et al.
Publicado: (2026)
Exo2Ego: Exocentric Knowledge Guided MLLM for Egocentric Video Understanding
por: Zhang, Haoyu, et al.
Publicado: (2025)
por: Zhang, Haoyu, et al.
Publicado: (2025)
EgoLCD: Egocentric Video Generation with Long Context Diffusion
por: Zhang, Liuzhou, et al.
Publicado: (2025)
por: Zhang, Liuzhou, et al.
Publicado: (2025)
ANT: Adaptive Neural Temporal-Aware Text-to-Motion Model
por: Chen, Wenshuo, et al.
Publicado: (2025)
por: Chen, Wenshuo, et al.
Publicado: (2025)
TEMPLE: Incentivizing Temporal Understanding of Video Large Language Models via Progressive Pre-SFT Alignment
por: Li, Shicheng, et al.
Publicado: (2025)
por: Li, Shicheng, et al.
Publicado: (2025)
SuperFlow: Training Flow Matching Models with RL on the Fly
por: Chen, Kaijie, et al.
Publicado: (2025)
por: Chen, Kaijie, et al.
Publicado: (2025)
Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction
por: Guan, Kaisi, et al.
Publicado: (2025)
por: Guan, Kaisi, et al.
Publicado: (2025)
Omnia de EgoTempo: Benchmarking Temporal Understanding of Multi-Modal LLMs in Egocentric Videos
por: Plizzari, Chiara, et al.
Publicado: (2025)
por: Plizzari, Chiara, et al.
Publicado: (2025)
Retrieval-Augmented Egocentric Video Captioning
por: Xu, Jilan, et al.
Publicado: (2024)
por: Xu, Jilan, et al.
Publicado: (2024)
In the Eye of MLLM: Benchmarking Egocentric Video Intent Understanding with Gaze-Guided Prompting
por: Peng, Taiying, et al.
Publicado: (2025)
por: Peng, Taiying, et al.
Publicado: (2025)
MADiff: Motion-Aware Mamba Diffusion Models for Hand Trajectory Prediction on Egocentric Videos
por: Ma, Junyi, et al.
Publicado: (2024)
por: Ma, Junyi, et al.
Publicado: (2024)
EgoEsportsQA: An Egocentric Video Benchmark for Perception and Reasoning in Esports
por: Ma, Jianzhe, et al.
Publicado: (2026)
por: Ma, Jianzhe, et al.
Publicado: (2026)
X-LeBench: A Benchmark for Extremely Long Egocentric Video Understanding
por: Zhou, Wenqi, et al.
Publicado: (2025)
por: Zhou, Wenqi, et al.
Publicado: (2025)
EyeCue: Driver Cognitive Distraction Detection via Gaze-Empowered Egocentric Video Understanding
por: Zhang, Lang, et al.
Publicado: (2026)
por: Zhang, Lang, et al.
Publicado: (2026)
Egocentric Visibility-Aware Human Pose Estimation
por: Dai, Peng, et al.
Publicado: (2026)
por: Dai, Peng, et al.
Publicado: (2026)
EgoSound: Benchmarking Sound Understanding in Egocentric Videos
por: Zhu, Bingwen, et al.
Publicado: (2026)
por: Zhu, Bingwen, et al.
Publicado: (2026)
StreamBridge: Turning Your Offline Video Large Language Model into a Proactive Streaming Assistant
por: Wang, Haibo, et al.
Publicado: (2025)
por: Wang, Haibo, et al.
Publicado: (2025)
Multimodal Instruction Tuning with Conditional Mixture of LoRA
por: Shen, Ying, et al.
Publicado: (2024)
por: Shen, Ying, et al.
Publicado: (2024)
EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos
por: Ma, Junyi, et al.
Publicado: (2025)
por: Ma, Junyi, et al.
Publicado: (2025)
STOP: Integrated Spatial-Temporal Dynamic Prompting for Video Understanding
por: Liu, Zichen, et al.
Publicado: (2025)
por: Liu, Zichen, et al.
Publicado: (2025)
MUSEG: Reinforcing Video Temporal Understanding via Timestamp-Aware Multi-Segment Grounding
por: Luo, Fuwen, et al.
Publicado: (2025)
por: Luo, Fuwen, et al.
Publicado: (2025)
EgoVideo: Exploring Egocentric Foundation Model and Downstream Adaptation
por: Pei, Baoqi, et al.
Publicado: (2024)
por: Pei, Baoqi, et al.
Publicado: (2024)
Chat-UniVi: Unified Visual Representation Empowers Large Language Models with Image and Video Understanding
por: Jin, Peng, et al.
Publicado: (2023)
por: Jin, Peng, et al.
Publicado: (2023)
DIV-FF: Dynamic Image-Video Feature Fields For Environment Understanding in Egocentric Videos
por: Mur-Labadia, Lorenzo, et al.
Publicado: (2025)
por: Mur-Labadia, Lorenzo, et al.
Publicado: (2025)
Towards Stable Self-Supervised Object Representations in Unconstrained Egocentric Video
por: Tan, Yuting, et al.
Publicado: (2026)
por: Tan, Yuting, et al.
Publicado: (2026)
EGOILLUSION: Benchmarking Hallucinations in Egocentric Video Understanding
por: Seth, Ashish, et al.
Publicado: (2025)
por: Seth, Ashish, et al.
Publicado: (2025)
Exploring Audio Hallucination in Egocentric Video Understanding
por: Seth, Ashish, et al.
Publicado: (2026)
por: Seth, Ashish, et al.
Publicado: (2026)
EgoInteract: Synthetic Egocentric Videos Generation for Interaction Understanding and Anticipation
por: Leonardi, Rosario, et al.
Publicado: (2026)
por: Leonardi, Rosario, et al.
Publicado: (2026)
AdsQA: Towards Advertisement Video Understanding
por: Long, Xinwei, et al.
Publicado: (2025)
por: Long, Xinwei, et al.
Publicado: (2025)
Shot-Aware Frame Sampling for Video Understanding
por: Zhao, Mengyu, et al.
Publicado: (2026)
por: Zhao, Mengyu, et al.
Publicado: (2026)
EgoThinker: Unveiling Egocentric Reasoning with Spatio-Temporal CoT
por: Pei, Baoqi, et al.
Publicado: (2025)
por: Pei, Baoqi, et al.
Publicado: (2025)
Ejemplares similares
-
Breaking Down Video LLM Benchmarks: Knowledge, Spatial Perception, or True Temporal Understanding?
por: Feng, Bo, et al.
Publicado: (2025) -
SPARTUN3D: Situated Spatial Understanding of 3D World in Large Language Models
por: Zhang, Yue, et al.
Publicado: (2024) -
Do Egocentric Video-Language Models Truly Understand Hand-Object Interactions?
por: Xu, Boshen, et al.
Publicado: (2024) -
EgoGraph: Temporal Knowledge Graph for Egocentric Video Understanding
por: Sun, Shitong, et al.
Publicado: (2026) -
Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models
por: Wang, Haibo, et al.
Publicado: (2024)