Omnia de EgoTempo: Benchmarking Temporal Understanding of Multi-Modal LLMs in Egocentric Videos
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Plizzari, Chiara, Tonioni, Alessio, Xian, Yongqin, Kulshrestha, Achin, Tombari, Federico |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Text-Conditioned Resampler For Long Form Video Understanding
par: Korbar, Bruno, et autres
Publié: (2023)
par: Korbar, Bruno, et autres
Publié: (2023)
EgoSocial: Benchmarking Proactive Intervention Ability of Omnimodal LLMs via Egocentric Social Interaction Perception
par: Wang, Xijun, et autres
Publié: (2025)
par: Wang, Xijun, et autres
Publié: (2025)
UIP2P: Unsupervised Instruction-based Image Editing via Edit Reversibility Constraint
par: Simsar, Enis, et autres
Publié: (2024)
par: Simsar, Enis, et autres
Publié: (2024)
LIME: Localized Image Editing via Attention Regularization in Diffusion Models
par: Simsar, Enis, et autres
Publié: (2023)
par: Simsar, Enis, et autres
Publié: (2023)
BRAVE: Broadening the visual encoding of vision-language models
par: Kar, Oğuzhan Fatih, et autres
Publié: (2024)
par: Kar, Oğuzhan Fatih, et autres
Publié: (2024)
EgoSound: Benchmarking Sound Understanding in Egocentric Videos
par: Zhu, Bingwen, et autres
Publié: (2026)
par: Zhu, Bingwen, et autres
Publié: (2026)
EgoGraph: Temporal Knowledge Graph for Egocentric Video Understanding
par: Sun, Shitong, et autres
Publié: (2026)
par: Sun, Shitong, et autres
Publié: (2026)
Reading Between the Lines: Abstaining from VLM-Generated OCR Errors via Latent Representation Probes
par: Yao, Jihan, et autres
Publié: (2025)
par: Yao, Jihan, et autres
Publié: (2025)
Spatial Cognition from Egocentric Video: Out of Sight, Not Out of Mind
par: Plizzari, Chiara, et autres
Publié: (2024)
par: Plizzari, Chiara, et autres
Publié: (2024)
R-CoV: Region-Aware Chain-of-Verification for Alleviating Object Hallucinations in LVLMs
par: Xie, Jiahao, et autres
Publié: (2026)
par: Xie, Jiahao, et autres
Publié: (2026)
SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models
par: Xie, Jiahao, et autres
Publié: (2026)
par: Xie, Jiahao, et autres
Publié: (2026)
Test-Time Visual In-Context Tuning
par: Xie, Jiahao, et autres
Publié: (2025)
par: Xie, Jiahao, et autres
Publié: (2025)
Active Data Curation Effectively Distills Large-Scale Multimodal Models
par: Udandarao, Vishaal, et autres
Publié: (2024)
par: Udandarao, Vishaal, et autres
Publié: (2024)
EgoLM: Multi-Modal Language Model of Egocentric Motions
par: Hong, Fangzhou, et autres
Publié: (2024)
par: Hong, Fangzhou, et autres
Publié: (2024)
Ego4o: Egocentric Human Motion Capture and Understanding from Multi-Modal Input
par: Wang, Jian, et autres
Publié: (2025)
par: Wang, Jian, et autres
Publié: (2025)
MOBIUS: Big-to-Mobile Universal Instance Segmentation via Multi-modal Bottleneck Fusion and Calibrated Decoder Pruning
par: Segu, Mattia, et autres
Publié: (2025)
par: Segu, Mattia, et autres
Publié: (2025)
Minerva-Ego: Spatiotemporal Hints for Egocentric Video Understanding
par: Nagrani, Arsha, et autres
Publié: (2026)
par: Nagrani, Arsha, et autres
Publié: (2026)
EgoVLM: Policy Optimization for Egocentric Video Understanding
par: Vinod, Ashwin, et autres
Publié: (2025)
par: Vinod, Ashwin, et autres
Publié: (2025)
EgoInteract: Synthetic Egocentric Videos Generation for Interaction Understanding and Anticipation
par: Leonardi, Rosario, et autres
Publié: (2026)
par: Leonardi, Rosario, et autres
Publié: (2026)
EgoCVR: An Egocentric Benchmark for Fine-Grained Composed Video Retrieval
par: Hummel, Thomas, et autres
Publié: (2024)
par: Hummel, Thomas, et autres
Publié: (2024)
Domain Generalization using Action Sequences for Egocentric Action Recognition
par: Nasirimajd, Amirshayan, et autres
Publié: (2025)
par: Nasirimajd, Amirshayan, et autres
Publié: (2025)
EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos
par: Ma, Junyi, et autres
Publié: (2025)
par: Ma, Junyi, et autres
Publié: (2025)
EgoIntent: An Egocentric Step-level Benchmark for Understanding What, Why, and Next
par: Pan, Ye, et autres
Publié: (2026)
par: Pan, Ye, et autres
Publié: (2026)
Ego-VPA: Egocentric Video Understanding with Parameter-efficient Adaptation
par: Wu, Tz-Ying, et autres
Publié: (2024)
par: Wu, Tz-Ying, et autres
Publié: (2024)
An Outlook into the Future of Egocentric Vision
par: Plizzari, Chiara, et autres
Publié: (2023)
par: Plizzari, Chiara, et autres
Publié: (2023)
EgoAdapt: Enhancing Robustness in Egocentric Interactive Speaker Detection Under Missing Modalities
par: Qian, Xinyuan, et autres
Publié: (2026)
par: Qian, Xinyuan, et autres
Publié: (2026)
EgoAVU: Egocentric Audio-Visual Understanding
par: Seth, Ashish, et autres
Publié: (2026)
par: Seth, Ashish, et autres
Publié: (2026)
Hier-EgoPack: Hierarchical Egocentric Video Understanding with Diverse Task Perspectives
par: Peirone, Simone Alberto, et autres
Publié: (2025)
par: Peirone, Simone Alberto, et autres
Publié: (2025)
Exo2Ego: Exocentric Knowledge Guided MLLM for Egocentric Video Understanding
par: Zhang, Haoyu, et autres
Publié: (2025)
par: Zhang, Haoyu, et autres
Publié: (2025)
PARCEL: Pool-Anchored Resampling with Conditioned Elastic Queries for Efficient Vision-Language Understanding
par: Kuzucu, Selim, et autres
Publié: (2026)
par: Kuzucu, Selim, et autres
Publié: (2026)
EgoInstruct: An Egocentric Video Dataset of Face-to-face Instructional Interactions with Multi-modal LLM Benchmarking
par: Sakai, Yuki, et autres
Publié: (2025)
par: Sakai, Yuki, et autres
Publié: (2025)
EgoToM: Benchmarking Theory of Mind Reasoning from Egocentric Videos
par: Li, Yuxuan, et autres
Publié: (2025)
par: Li, Yuxuan, et autres
Publié: (2025)
TeleEgo: Benchmarking Egocentric AI Assistants in the Wild
par: Yan, Jiaqi, et autres
Publié: (2025)
par: Yan, Jiaqi, et autres
Publié: (2025)
EgoPoints: Advancing Point Tracking for Egocentric Videos
par: Darkhalil, Ahmad, et autres
Publié: (2024)
par: Darkhalil, Ahmad, et autres
Publié: (2024)
EgoThinker: Unveiling Egocentric Reasoning with Spatio-Temporal CoT
par: Pei, Baoqi, et autres
Publié: (2025)
par: Pei, Baoqi, et autres
Publié: (2025)
EgoNight: Towards Egocentric Vision Understanding at Night with a Challenging Benchmark
par: Zhang, Deheng, et autres
Publié: (2025)
par: Zhang, Deheng, et autres
Publié: (2025)
EgoEsportsQA: An Egocentric Video Benchmark for Perception and Reasoning in Esports
par: Ma, Jianzhe, et autres
Publié: (2026)
par: Ma, Jianzhe, et autres
Publié: (2026)
EgoGaussian: Dynamic Scene Understanding from Egocentric Video with 3D Gaussian Splatting
par: Zhang, Daiwei, et autres
Publié: (2024)
par: Zhang, Daiwei, et autres
Publié: (2024)
Incentivizing Temporal-Awareness in Egocentric Video Understanding Models
par: Xu, Zhiyang, et autres
Publié: (2026)
par: Xu, Zhiyang, et autres
Publié: (2026)
EgoPro-Bench: Benchmarking Personalized Proactive Interaction in Egocentric Video Streams
par: Ran, Dongchuan, et autres
Publié: (2026)
par: Ran, Dongchuan, et autres
Publié: (2026)
Documents similaires
-
Text-Conditioned Resampler For Long Form Video Understanding
par: Korbar, Bruno, et autres
Publié: (2023) -
EgoSocial: Benchmarking Proactive Intervention Ability of Omnimodal LLMs via Egocentric Social Interaction Perception
par: Wang, Xijun, et autres
Publié: (2025) -
UIP2P: Unsupervised Instruction-based Image Editing via Edit Reversibility Constraint
par: Simsar, Enis, et autres
Publié: (2024) -
LIME: Localized Image Editing via Attention Regularization in Diffusion Models
par: Simsar, Enis, et autres
Publié: (2023) -
BRAVE: Broadening the visual encoding of vision-language models
par: Kar, Oğuzhan Fatih, et autres
Publié: (2024)