Exo2EgoDVC: Dense Video Captioning of Egocentric Procedural Activities Using Web Instructional Videos
Fuente:
arXiv
Salvato in:
| Autori principali: | Ohkawa, Takehiko, Yagi, Takuma, Nishimura, Taichi, Furuta, Ryosuke, Hashimoto, Atsushi, Ushiku, Yoshitaka, Sato, Yoichi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
EgoInstruct: An Egocentric Video Dataset of Face-to-face Instructional Interactions with Multi-modal LLM Benchmarking
di: Sakai, Yuki, et al.
Pubblicazione: (2025)
di: Sakai, Yuki, et al.
Pubblicazione: (2025)
Recipe Generation from Unsegmented Cooking Videos
di: Nishimura, Taichi, et al.
Pubblicazione: (2022)
di: Nishimura, Taichi, et al.
Pubblicazione: (2022)
Learning Multiple Object States from Actions via Large Language Models
di: Tateno, Masatoshi, et al.
Pubblicazione: (2024)
di: Tateno, Masatoshi, et al.
Pubblicazione: (2024)
AssemblyHands-X: Modeling 3D Hand-Body Coordination for Understanding Bimanual Human Activities
di: Banno, Tatsuro, et al.
Pubblicazione: (2025)
di: Banno, Tatsuro, et al.
Pubblicazione: (2025)
Single-to-Dual-View Adaptation for Egocentric 3D Hand Pose Estimation
di: Liu, Ruicong, et al.
Pubblicazione: (2024)
di: Liu, Ruicong, et al.
Pubblicazione: (2024)
FineBio: A Fine-Grained Video Dataset of Biological Experiments with Hierarchical Annotation
di: Yagi, Takuma, et al.
Pubblicazione: (2024)
di: Yagi, Takuma, et al.
Pubblicazione: (2024)
Pre-Training for 3D Hand Pose Estimation with Contrastive Learning on Large-Scale Hand Images in the Wild
di: Lin, Nie, et al.
Pubblicazione: (2024)
di: Lin, Nie, et al.
Pubblicazione: (2024)
Affordance-Guided Diffusion Prior for 3D Hand Reconstruction
di: Suzuki, Naru, et al.
Pubblicazione: (2025)
di: Suzuki, Naru, et al.
Pubblicazione: (2025)
CaptionSmiths: Flexibly Controlling Language Pattern in Image Captioning
di: Saito, Kuniaki, et al.
Pubblicazione: (2025)
di: Saito, Kuniaki, et al.
Pubblicazione: (2025)
Unsupervised Ego- and Exo-centric Dense Procedural Activity Captioning via Gaze Consensus Adaptation
di: Shi, Zhaofeng, et al.
Pubblicazione: (2025)
di: Shi, Zhaofeng, et al.
Pubblicazione: (2025)
EgoOops: A Dataset for Mistake Action Detection from Egocentric Videos referring to Procedural Texts
di: Haneji, Yuto, et al.
Pubblicazione: (2024)
di: Haneji, Yuto, et al.
Pubblicazione: (2024)
Seeking Flat Minima with Mean Teacher on Semi- and Weakly-Supervised Domain Generalization for Object Detection
di: Furuta, Ryosuke, et al.
Pubblicazione: (2023)
di: Furuta, Ryosuke, et al.
Pubblicazione: (2023)
EgoExo-Gen: Ego-centric Video Prediction by Watching Exo-centric Videos
di: Xu, Jilan, et al.
Pubblicazione: (2025)
di: Xu, Jilan, et al.
Pubblicazione: (2025)
Exo2Ego: Exocentric Knowledge Guided MLLM for Egocentric Video Understanding
di: Zhang, Haoyu, et al.
Pubblicazione: (2025)
di: Zhang, Haoyu, et al.
Pubblicazione: (2025)
EgoExo-WM: Unlocking Exo Video for Ego World Models
di: Tran, Danny, et al.
Pubblicazione: (2026)
di: Tran, Danny, et al.
Pubblicazione: (2026)
SiMHand: Mining Similar Hands for Large-Scale 3D Hand Pose Pre-training
di: Lin, Nie, et al.
Pubblicazione: (2025)
di: Lin, Nie, et al.
Pubblicazione: (2025)
Exo2EgoSyn: Unlocking Foundation Video Generation Models for Exocentric-to-Egocentric Video Synthesis
di: Mahdi, Mohammad, et al.
Pubblicazione: (2025)
di: Mahdi, Mohammad, et al.
Pubblicazione: (2025)
ActionVOS: Actions as Prompts for Video Object Segmentation
di: Ouyang, Liangyang, et al.
Pubblicazione: (2024)
di: Ouyang, Liangyang, et al.
Pubblicazione: (2024)
SciPostLayoutTree: A Dataset for Structural Analysis of Scientific Posters
di: Tanaka, Shohei, et al.
Pubblicazione: (2025)
di: Tanaka, Shohei, et al.
Pubblicazione: (2025)
EgoExoMem: Cross-View Memory Reasoning over Synchronized Egocentric and Exocentric Videos
di: Liu, Ruiping, et al.
Pubblicazione: (2026)
di: Liu, Ruiping, et al.
Pubblicazione: (2026)
HanDyVQA: A Video QA Benchmark for Fine-Grained Hand-Object Interaction Dynamics
di: Tateno, Masatoshi, et al.
Pubblicazione: (2025)
di: Tateno, Masatoshi, et al.
Pubblicazione: (2025)
Developing Vision-Language-Action Model from Egocentric Videos
di: Yoshida, Tomoya, et al.
Pubblicazione: (2025)
di: Yoshida, Tomoya, et al.
Pubblicazione: (2025)
Intention-driven Ego-to-Exo Video Generation
di: Luo, Hongchen, et al.
Pubblicazione: (2024)
di: Luo, Hongchen, et al.
Pubblicazione: (2024)
Ego2Web: A Web Agent Benchmark Grounded in Egocentric Videos
di: Yu, Shoubin, et al.
Pubblicazione: (2026)
di: Yu, Shoubin, et al.
Pubblicazione: (2026)
COM Kitchens: An Unedited Overhead-view Video Dataset as a Vision-Language Benchmark
di: Maeda, Koki, et al.
Pubblicazione: (2024)
di: Maeda, Koki, et al.
Pubblicazione: (2024)
EgoBrain: Synergizing Minds and Eyes For Human Action Understanding
di: Lin, Nie, et al.
Pubblicazione: (2025)
di: Lin, Nie, et al.
Pubblicazione: (2025)
Generative Modeling of Shape-Dependent Self-Contact Human Poses
di: Ohkawa, Takehiko, et al.
Pubblicazione: (2025)
di: Ohkawa, Takehiko, et al.
Pubblicazione: (2025)
EgoExoLearn: A Dataset for Bridging Asynchronous Ego- and Exo-centric View of Procedural Activities in Real World
di: Huang, Yifei, et al.
Pubblicazione: (2024)
di: Huang, Yifei, et al.
Pubblicazione: (2024)
Masked Video and Body-worn IMU Autoencoder for Egocentric Action Recognition
di: Zhang, Mingfang, et al.
Pubblicazione: (2024)
di: Zhang, Mingfang, et al.
Pubblicazione: (2024)
Retrieval-Augmented Egocentric Video Captioning
di: Xu, Jilan, et al.
Pubblicazione: (2024)
di: Xu, Jilan, et al.
Pubblicazione: (2024)
The N-Body Problem: Parallel Execution from Single-Person Egocentric Video
di: Zhu, Zhifan, et al.
Pubblicazione: (2025)
di: Zhu, Zhifan, et al.
Pubblicazione: (2025)
EgoExo-Fitness: Towards Egocentric and Exocentric Full-Body Action Understanding
di: Li, Yuan-Ming, et al.
Pubblicazione: (2024)
di: Li, Yuan-Ming, et al.
Pubblicazione: (2024)
EgoExo-Con: Exploring View-Invariant Video Temporal Understanding
di: Jung, Minjoon, et al.
Pubblicazione: (2025)
di: Jung, Minjoon, et al.
Pubblicazione: (2025)
Map-Mono-Ego: Map-Grounded Global Human Pose Estimation from Monocular Egocentric Video
di: Deguchi, Hiroyuki, et al.
Pubblicazione: (2026)
di: Deguchi, Hiroyuki, et al.
Pubblicazione: (2026)
EgoSound: Benchmarking Sound Understanding in Egocentric Videos
di: Zhu, Bingwen, et al.
Pubblicazione: (2026)
di: Zhu, Bingwen, et al.
Pubblicazione: (2026)
Minerva-Ego: Spatiotemporal Hints for Egocentric Video Understanding
di: Nagrani, Arsha, et al.
Pubblicazione: (2026)
di: Nagrani, Arsha, et al.
Pubblicazione: (2026)
EgoVLM: Policy Optimization for Egocentric Video Understanding
di: Vinod, Ashwin, et al.
Pubblicazione: (2025)
di: Vinod, Ashwin, et al.
Pubblicazione: (2025)
EgoPoints: Advancing Point Tracking for Egocentric Videos
di: Darkhalil, Ahmad, et al.
Pubblicazione: (2024)
di: Darkhalil, Ahmad, et al.
Pubblicazione: (2024)
Ego-Grounding for Personalized Question-Answering in Egocentric Videos
di: Xiao, Junbin, et al.
Pubblicazione: (2026)
di: Xiao, Junbin, et al.
Pubblicazione: (2026)
Streaming Dense Video Captioning
di: Zhou, Xingyi, et al.
Pubblicazione: (2024)
di: Zhou, Xingyi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
EgoInstruct: An Egocentric Video Dataset of Face-to-face Instructional Interactions with Multi-modal LLM Benchmarking
di: Sakai, Yuki, et al.
Pubblicazione: (2025) -
Recipe Generation from Unsegmented Cooking Videos
di: Nishimura, Taichi, et al.
Pubblicazione: (2022) -
Learning Multiple Object States from Actions via Large Language Models
di: Tateno, Masatoshi, et al.
Pubblicazione: (2024) -
AssemblyHands-X: Modeling 3D Hand-Body Coordination for Understanding Bimanual Human Activities
di: Banno, Tatsuro, et al.
Pubblicazione: (2025) -
Single-to-Dual-View Adaptation for Egocentric 3D Hand Pose Estimation
di: Liu, Ruicong, et al.
Pubblicazione: (2024)