EgoInstruct: An Egocentric Video Dataset of Face-to-face Instructional Interactions with Multi-modal LLM Benchmarking
Fuente:
arXiv
Salvato in:
| Autori principali: | Sakai, Yuki, Furuta, Ryosuke, Yen, Juichun, Sato, Yoichi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Exo2EgoDVC: Dense Video Captioning of Egocentric Procedural Activities Using Web Instructional Videos
di: Ohkawa, Takehiko, et al.
Pubblicazione: (2023)
di: Ohkawa, Takehiko, et al.
Pubblicazione: (2023)
Seeking Flat Minima with Mean Teacher on Semi- and Weakly-Supervised Domain Generalization for Object Detection
di: Furuta, Ryosuke, et al.
Pubblicazione: (2023)
di: Furuta, Ryosuke, et al.
Pubblicazione: (2023)
Leadership Assessment in Pediatric Intensive Care Unit Team Training
di: Ouyang, Liangyang, et al.
Pubblicazione: (2025)
di: Ouyang, Liangyang, et al.
Pubblicazione: (2025)
Multi-speaker Attention Alignment for Multimodal Social Interaction
di: Ouyang, Liangyang, et al.
Pubblicazione: (2025)
di: Ouyang, Liangyang, et al.
Pubblicazione: (2025)
ActionVOS: Actions as Prompts for Video Object Segmentation
di: Ouyang, Liangyang, et al.
Pubblicazione: (2024)
di: Ouyang, Liangyang, et al.
Pubblicazione: (2024)
FineBio: A Fine-Grained Video Dataset of Biological Experiments with Hierarchical Annotation
di: Yagi, Takuma, et al.
Pubblicazione: (2024)
di: Yagi, Takuma, et al.
Pubblicazione: (2024)
Learning Multiple Object States from Actions via Large Language Models
di: Tateno, Masatoshi, et al.
Pubblicazione: (2024)
di: Tateno, Masatoshi, et al.
Pubblicazione: (2024)
EgoSound: Benchmarking Sound Understanding in Egocentric Videos
di: Zhu, Bingwen, et al.
Pubblicazione: (2026)
di: Zhu, Bingwen, et al.
Pubblicazione: (2026)
EgoInteract: Synthetic Egocentric Videos Generation for Interaction Understanding and Anticipation
di: Leonardi, Rosario, et al.
Pubblicazione: (2026)
di: Leonardi, Rosario, et al.
Pubblicazione: (2026)
EgoPro-Bench: Benchmarking Personalized Proactive Interaction in Egocentric Video Streams
di: Ran, Dongchuan, et al.
Pubblicazione: (2026)
di: Ran, Dongchuan, et al.
Pubblicazione: (2026)
MultiEgo: A Multi-View Egocentric Video Dataset for 4D Scene Reconstruction
di: Li, Bate, et al.
Pubblicazione: (2025)
di: Li, Bate, et al.
Pubblicazione: (2025)
EgoBrain: Synergizing Minds and Eyes For Human Action Understanding
di: Lin, Nie, et al.
Pubblicazione: (2025)
di: Lin, Nie, et al.
Pubblicazione: (2025)
AssemblyHands-X: Modeling 3D Hand-Body Coordination for Understanding Bimanual Human Activities
di: Banno, Tatsuro, et al.
Pubblicazione: (2025)
di: Banno, Tatsuro, et al.
Pubblicazione: (2025)
EgoEdit: Dataset, Real-Time Streaming Model, and Benchmark for Egocentric Video Editing
di: Li, Runjia, et al.
Pubblicazione: (2025)
di: Li, Runjia, et al.
Pubblicazione: (2025)
EgoCVR: An Egocentric Benchmark for Fine-Grained Composed Video Retrieval
di: Hummel, Thomas, et al.
Pubblicazione: (2024)
di: Hummel, Thomas, et al.
Pubblicazione: (2024)
Egocentric Gaze Estimation via Neck-Mounted Camera
di: Huang, Haoyu, et al.
Pubblicazione: (2026)
di: Huang, Haoyu, et al.
Pubblicazione: (2026)
Omnia de EgoTempo: Benchmarking Temporal Understanding of Multi-Modal LLMs in Egocentric Videos
di: Plizzari, Chiara, et al.
Pubblicazione: (2025)
di: Plizzari, Chiara, et al.
Pubblicazione: (2025)
EgoIntrospect: An Egocentric Dataset and Benchmark for User-Centric Internal State Reasoning
di: Wang, Zeyu, et al.
Pubblicazione: (2026)
di: Wang, Zeyu, et al.
Pubblicazione: (2026)
Masked Video and Body-worn IMU Autoencoder for Egocentric Action Recognition
di: Zhang, Mingfang, et al.
Pubblicazione: (2024)
di: Zhang, Mingfang, et al.
Pubblicazione: (2024)
The N-Body Problem: Parallel Execution from Single-Person Egocentric Video
di: Zhu, Zhifan, et al.
Pubblicazione: (2025)
di: Zhu, Zhifan, et al.
Pubblicazione: (2025)
Map-Mono-Ego: Map-Grounded Global Human Pose Estimation from Monocular Egocentric Video
di: Deguchi, Hiroyuki, et al.
Pubblicazione: (2026)
di: Deguchi, Hiroyuki, et al.
Pubblicazione: (2026)
EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos
di: Ma, Junyi, et al.
Pubblicazione: (2025)
di: Ma, Junyi, et al.
Pubblicazione: (2025)
Generating Dialogues from Egocentric Instructional Videos for Task Assistance: Dataset, Method and Benchmark
di: Aggarwal, Lavisha, et al.
Pubblicazione: (2025)
di: Aggarwal, Lavisha, et al.
Pubblicazione: (2025)
Ego-1K -- A Large-Scale Multiview Video Dataset for Egocentric Vision
di: Lee, Jae Yong, et al.
Pubblicazione: (2026)
di: Lee, Jae Yong, et al.
Pubblicazione: (2026)
EgoToM: Benchmarking Theory of Mind Reasoning from Egocentric Videos
di: Li, Yuxuan, et al.
Pubblicazione: (2025)
di: Li, Yuxuan, et al.
Pubblicazione: (2025)
Inference-time Trajectory Optimization for Manga Image Editing
di: Furuta, Ryosuke
Pubblicazione: (2026)
di: Furuta, Ryosuke
Pubblicazione: (2026)
TeleEgo: Benchmarking Egocentric AI Assistants in the Wild
di: Yan, Jiaqi, et al.
Pubblicazione: (2025)
di: Yan, Jiaqi, et al.
Pubblicazione: (2025)
Pre-Training for 3D Hand Pose Estimation with Contrastive Learning on Large-Scale Hand Images in the Wild
di: Lin, Nie, et al.
Pubblicazione: (2024)
di: Lin, Nie, et al.
Pubblicazione: (2024)
Affordance-Guided Diffusion Prior for 3D Hand Reconstruction
di: Suzuki, Naru, et al.
Pubblicazione: (2025)
di: Suzuki, Naru, et al.
Pubblicazione: (2025)
EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation
di: Wang, Xiaofeng, et al.
Pubblicazione: (2024)
di: Wang, Xiaofeng, et al.
Pubblicazione: (2024)
EgoPoints: Advancing Point Tracking for Egocentric Videos
di: Darkhalil, Ahmad, et al.
Pubblicazione: (2024)
di: Darkhalil, Ahmad, et al.
Pubblicazione: (2024)
EgoCampus: Egocentric Pedestrian Eye Gaze Model and Dataset
di: John, Ronan, et al.
Pubblicazione: (2025)
di: John, Ronan, et al.
Pubblicazione: (2025)
EgoEsportsQA: An Egocentric Video Benchmark for Perception and Reasoning in Esports
di: Ma, Jianzhe, et al.
Pubblicazione: (2026)
di: Ma, Jianzhe, et al.
Pubblicazione: (2026)
Gazing Into Missteps: Leveraging Eye-Gaze for Unsupervised Mistake Detection in Egocentric Videos of Skilled Human Activities
di: Mazzamuto, Michele, et al.
Pubblicazione: (2024)
di: Mazzamuto, Michele, et al.
Pubblicazione: (2024)
EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning
di: Kulkarni, Yogesh, et al.
Pubblicazione: (2025)
di: Kulkarni, Yogesh, et al.
Pubblicazione: (2025)
EgoVideo: Exploring Egocentric Foundation Model and Downstream Adaptation
di: Pei, Baoqi, et al.
Pubblicazione: (2024)
di: Pei, Baoqi, et al.
Pubblicazione: (2024)
EgoLCD: Egocentric Video Generation with Long Context Diffusion
di: Zhang, Liuzhou, et al.
Pubblicazione: (2025)
di: Zhang, Liuzhou, et al.
Pubblicazione: (2025)
EgoGraph: Temporal Knowledge Graph for Egocentric Video Understanding
di: Sun, Shitong, et al.
Pubblicazione: (2026)
di: Sun, Shitong, et al.
Pubblicazione: (2026)
Instruct-Imagen: Image Generation with Multi-modal Instruction
di: Hu, Hexiang, et al.
Pubblicazione: (2024)
di: Hu, Hexiang, et al.
Pubblicazione: (2024)
EgoSocial: Benchmarking Proactive Intervention Ability of Omnimodal LLMs via Egocentric Social Interaction Perception
di: Wang, Xijun, et al.
Pubblicazione: (2025)
di: Wang, Xijun, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Exo2EgoDVC: Dense Video Captioning of Egocentric Procedural Activities Using Web Instructional Videos
di: Ohkawa, Takehiko, et al.
Pubblicazione: (2023) -
Seeking Flat Minima with Mean Teacher on Semi- and Weakly-Supervised Domain Generalization for Object Detection
di: Furuta, Ryosuke, et al.
Pubblicazione: (2023) -
Leadership Assessment in Pediatric Intensive Care Unit Team Training
di: Ouyang, Liangyang, et al.
Pubblicazione: (2025) -
Multi-speaker Attention Alignment for Multimodal Social Interaction
di: Ouyang, Liangyang, et al.
Pubblicazione: (2025) -
ActionVOS: Actions as Prompts for Video Object Segmentation
di: Ouyang, Liangyang, et al.
Pubblicazione: (2024)