Ego-Grounding for Personalized Question-Answering in Egocentric Videos
Fuente:
arXiv
Salvato in:
| Autori principali: | Xiao, Junbin, Zhang, Shenglang, Zhu, Pengxiang, Yao, Angela |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Question-Answering Dense Video Events
di: Qin, Hangyu, et al.
Pubblicazione: (2024)
di: Qin, Hangyu, et al.
Pubblicazione: (2024)
Can I Trust Your Answer? Visually Grounded Video Question Answering
di: Xiao, Junbin, et al.
Pubblicazione: (2023)
di: Xiao, Junbin, et al.
Pubblicazione: (2023)
Advancing Egocentric Video Question Answering with Multimodal Large Language Models
di: Patel, Alkesh, et al.
Pubblicazione: (2025)
di: Patel, Alkesh, et al.
Pubblicazione: (2025)
EgoBlind: Towards Egocentric Visual Assistance for the Blind
di: Xiao, Junbin, et al.
Pubblicazione: (2025)
di: Xiao, Junbin, et al.
Pubblicazione: (2025)
EgoExo-Con: Exploring View-Invariant Video Temporal Understanding
di: Jung, Minjoon, et al.
Pubblicazione: (2025)
di: Jung, Minjoon, et al.
Pubblicazione: (2025)
MA-EgoQA: Question Answering over Egocentric Videos from Multiple Embodied Agents
di: Kim, Kangsan, et al.
Pubblicazione: (2026)
di: Kim, Kangsan, et al.
Pubblicazione: (2026)
MuKV: Multi-Grained KV Cache Compression for Long Streaming Video Question-Answering
di: Xiao, Junbin, et al.
Pubblicazione: (2026)
di: Xiao, Junbin, et al.
Pubblicazione: (2026)
EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos
di: Yang, Ruihan, et al.
Pubblicazione: (2025)
di: Yang, Ruihan, et al.
Pubblicazione: (2025)
EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering
di: Zhou, Sheng, et al.
Pubblicazione: (2025)
di: Zhou, Sheng, et al.
Pubblicazione: (2025)
OpenEgo: A Large-Scale Multimodal Egocentric Dataset for Dexterous Manipulation
di: Jawaid, Ahad, et al.
Pubblicazione: (2025)
di: Jawaid, Ahad, et al.
Pubblicazione: (2025)
EgoCross: Benchmarking Multimodal Large Language Models for Cross-Domain Egocentric Video Question Answering
di: Li, Yanjun, et al.
Pubblicazione: (2025)
di: Li, Yanjun, et al.
Pubblicazione: (2025)
MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering
di: Dang, Jisheng, et al.
Pubblicazione: (2025)
di: Dang, Jisheng, et al.
Pubblicazione: (2025)
Zero-Shot Temporal Interaction Localization for Egocentric Videos
di: Zhang, Erhang, et al.
Pubblicazione: (2025)
di: Zhang, Erhang, et al.
Pubblicazione: (2025)
EgoSelf: From Memory to Personalized Egocentric Assistant
di: Wang, Yanshuo, et al.
Pubblicazione: (2026)
di: Wang, Yanshuo, et al.
Pubblicazione: (2026)
Ego2Web: A Web Agent Benchmark Grounded in Egocentric Videos
di: Yu, Shoubin, et al.
Pubblicazione: (2026)
di: Yu, Shoubin, et al.
Pubblicazione: (2026)
EgoPro-Bench: Benchmarking Personalized Proactive Interaction in Egocentric Video Streams
di: Ran, Dongchuan, et al.
Pubblicazione: (2026)
di: Ran, Dongchuan, et al.
Pubblicazione: (2026)
IndEgo: A Dataset of Industrial Scenarios and Collaborative Work for Egocentric Assistants
di: Chavan, Vivek, et al.
Pubblicazione: (2025)
di: Chavan, Vivek, et al.
Pubblicazione: (2025)
Ego2World: Compiling Egocentric Cooking Videos into Executable Worlds for Belief-State Planning
di: Cheng, Qinchuan, et al.
Pubblicazione: (2026)
di: Cheng, Qinchuan, et al.
Pubblicazione: (2026)
LingoQA: Visual Question Answering for Autonomous Driving
di: Marcu, Ana-Maria, et al.
Pubblicazione: (2023)
di: Marcu, Ana-Maria, et al.
Pubblicazione: (2023)
Prune-Then-Plan: Step-Level Calibration for Stable Frontier Exploration in Embodied Question Answering
di: Frahm, Noah, et al.
Pubblicazione: (2025)
di: Frahm, Noah, et al.
Pubblicazione: (2025)
EfficientEQA: An Efficient Approach to Open-Vocabulary Embodied Question Answering
di: Cheng, Kai, et al.
Pubblicazione: (2024)
di: Cheng, Kai, et al.
Pubblicazione: (2024)
ConEQsA: Concurrent and Asynchronous Embodied Questions Scheduling and Answering
di: Wang, Haisheng, et al.
Pubblicazione: (2025)
di: Wang, Haisheng, et al.
Pubblicazione: (2025)
HOT3D: Hand and Object Tracking in 3D from Egocentric Multi-View Videos
di: Banerjee, Prithviraj, et al.
Pubblicazione: (2024)
di: Banerjee, Prithviraj, et al.
Pubblicazione: (2024)
EgoVLM: Policy Optimization for Egocentric Video Understanding
di: Vinod, Ashwin, et al.
Pubblicazione: (2025)
di: Vinod, Ashwin, et al.
Pubblicazione: (2025)
EgoTraj-Bench: Towards Robust Trajectory Prediction Under Ego-view Noisy Observations
di: Liu, Jiayi, et al.
Pubblicazione: (2025)
di: Liu, Jiayi, et al.
Pubblicazione: (2025)
EgoMimic: Scaling Imitation Learning via Egocentric Video
di: Kareer, Simar, et al.
Pubblicazione: (2024)
di: Kareer, Simar, et al.
Pubblicazione: (2024)
World-Ego Modeling for Long-Horizon Evolution in Hybrid Embodied Tasks
di: Lin, Zuyao, et al.
Pubblicazione: (2026)
di: Lin, Zuyao, et al.
Pubblicazione: (2026)
Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning
di: Tian, Shulin, et al.
Pubblicazione: (2025)
di: Tian, Shulin, et al.
Pubblicazione: (2025)
SViTT-Ego: A Sparse Video-Text Transformer for Egocentric Video
di: Valdez, Hector A., et al.
Pubblicazione: (2024)
di: Valdez, Hector A., et al.
Pubblicazione: (2024)
Flowing from Reasoning to Motion: Learning 3D Hand Trajectory Prediction from Egocentric Human Interaction Videos
di: Chen, Mingfei, et al.
Pubblicazione: (2025)
di: Chen, Mingfei, et al.
Pubblicazione: (2025)
V$^2$-SfMLearner: Learning Monocular Depth and Ego-motion for Multimodal Wireless Capsule Endoscopy
di: Bai, Long, et al.
Pubblicazione: (2024)
di: Bai, Long, et al.
Pubblicazione: (2024)
EgoToM: Benchmarking Theory of Mind Reasoning from Egocentric Videos
di: Li, Yuxuan, et al.
Pubblicazione: (2025)
di: Li, Yuxuan, et al.
Pubblicazione: (2025)
Surgical-LVLM: Learning to Adapt Large Vision-Language Model for Grounded Visual Question Answering in Robotic Surgery
di: Wang, Guankun, et al.
Pubblicazione: (2024)
di: Wang, Guankun, et al.
Pubblicazione: (2024)
EgoGen: An Egocentric Synthetic Data Generator
di: Li, Gen, et al.
Pubblicazione: (2024)
di: Li, Gen, et al.
Pubblicazione: (2024)
In-N-On: Scaling Egocentric Manipulation with in-the-wild and on-task Data
di: Cai, Xiongyi, et al.
Pubblicazione: (2025)
di: Cai, Xiongyi, et al.
Pubblicazione: (2025)
Commonsense Video Question Answering through Video-Grounded Entailment Tree Reasoning
di: Liu, Huabin, et al.
Pubblicazione: (2025)
di: Liu, Huabin, et al.
Pubblicazione: (2025)
Abductive Ego-View Accident Video Understanding for Safe Driving Perception
di: Fang, Jianwu, et al.
Pubblicazione: (2024)
di: Fang, Jianwu, et al.
Pubblicazione: (2024)
Whole-Body Conditioned Egocentric Video Prediction
di: Bai, Yutong, et al.
Pubblicazione: (2025)
di: Bai, Yutong, et al.
Pubblicazione: (2025)
Gaze-Guided 3D Hand Motion Prediction for Detecting Intent in Egocentric Grasping Tasks
di: He, Yufei, et al.
Pubblicazione: (2025)
di: He, Yufei, et al.
Pubblicazione: (2025)
EgoDTM: Towards 3D-Aware Egocentric Video-Language Pretraining
di: Xu, Boshen, et al.
Pubblicazione: (2025)
di: Xu, Boshen, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Question-Answering Dense Video Events
di: Qin, Hangyu, et al.
Pubblicazione: (2024) -
Can I Trust Your Answer? Visually Grounded Video Question Answering
di: Xiao, Junbin, et al.
Pubblicazione: (2023) -
Advancing Egocentric Video Question Answering with Multimodal Large Language Models
di: Patel, Alkesh, et al.
Pubblicazione: (2025) -
EgoBlind: Towards Egocentric Visual Assistance for the Blind
di: Xiao, Junbin, et al.
Pubblicazione: (2025) -
EgoExo-Con: Exploring View-Invariant Video Temporal Understanding
di: Jung, Minjoon, et al.
Pubblicazione: (2025)