Unlocking Exocentric Video-Language Data for Egocentric Video Representation Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Dou, Zi-Yi, Yang, Xitong, Nagarajan, Tushar, Wang, Huiyu, Huang, Jing, Peng, Nanyun, Kitani, Kris, Chu, Fu-Jen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Propose, Assess, Search: Harnessing LLMs for Goal-Oriented Planning in Instructional Videos
di: Islam, Md Mohaiminul, et al.
Pubblicazione: (2024)
di: Islam, Md Mohaiminul, et al.
Pubblicazione: (2024)
ExpertAF: Expert Actionable Feedback from Video
di: Ashutosh, Kumar, et al.
Pubblicazione: (2024)
di: Ashutosh, Kumar, et al.
Pubblicazione: (2024)
Exo2EgoSyn: Unlocking Foundation Video Generation Models for Exocentric-to-Egocentric Video Synthesis
di: Mahdi, Mohammad, et al.
Pubblicazione: (2025)
di: Mahdi, Mohammad, et al.
Pubblicazione: (2025)
WorldWander: Bridging Egocentric and Exocentric Worlds in Video Generation
di: Song, Quanjian, et al.
Pubblicazione: (2025)
di: Song, Quanjian, et al.
Pubblicazione: (2025)
Exo2Ego: Exocentric Knowledge Guided MLLM for Egocentric Video Understanding
di: Zhang, Haoyu, et al.
Pubblicazione: (2025)
di: Zhang, Haoyu, et al.
Pubblicazione: (2025)
EgoX: Egocentric Video Generation from a Single Exocentric Video
di: Kang, Taewoong, et al.
Pubblicazione: (2025)
di: Kang, Taewoong, et al.
Pubblicazione: (2025)
Video ReCap: Recursive Captioning of Hour-Long Videos
di: Islam, Md Mohaiminul, et al.
Pubblicazione: (2024)
di: Islam, Md Mohaiminul, et al.
Pubblicazione: (2024)
Put Myself in Your Shoes: Lifting the Egocentric Perspective from Exocentric Videos
di: Luo, Mi, et al.
Pubblicazione: (2024)
di: Luo, Mi, et al.
Pubblicazione: (2024)
EgoExoMem: Cross-View Memory Reasoning over Synchronized Egocentric and Exocentric Videos
di: Liu, Ruiping, et al.
Pubblicazione: (2026)
di: Liu, Ruiping, et al.
Pubblicazione: (2026)
Step Differences in Instructional Video
di: Nagarajan, Tushar, et al.
Pubblicazione: (2024)
di: Nagarajan, Tushar, et al.
Pubblicazione: (2024)
VALOR-EVAL: Holistic Coverage and Faithfulness Evaluation of Large Vision-Language Models
di: Qiu, Haoyi, et al.
Pubblicazione: (2024)
di: Qiu, Haoyi, et al.
Pubblicazione: (2024)
BIMBA: Selective-Scan Compression for Long-Range Video Question Answering
di: Islam, Md Mohaiminul, et al.
Pubblicazione: (2025)
di: Islam, Md Mohaiminul, et al.
Pubblicazione: (2025)
Egocentric and Exocentric Methods: A Short Survey
di: Thatipelli, Anirudh, et al.
Pubblicazione: (2024)
di: Thatipelli, Anirudh, et al.
Pubblicazione: (2024)
EgoWorld: Translating Exocentric View to Egocentric View using Rich Exocentric Observations
di: Park, Junho, et al.
Pubblicazione: (2025)
di: Park, Junho, et al.
Pubblicazione: (2025)
Multi-Object Tracking by Hierarchical Visual Representations
di: Cao, Jinkun, et al.
Pubblicazione: (2024)
di: Cao, Jinkun, et al.
Pubblicazione: (2024)
Synchronization is All You Need: Exocentric-to-Egocentric Transfer for Temporal Action Segmentation with Unlabeled Synchronized Video Pairs
di: Quattrocchi, Camillo, et al.
Pubblicazione: (2023)
di: Quattrocchi, Camillo, et al.
Pubblicazione: (2023)
EgoExo-Fitness: Towards Egocentric and Exocentric Full-Body Action Understanding
di: Li, Yuan-Ming, et al.
Pubblicazione: (2024)
di: Li, Yuan-Ming, et al.
Pubblicazione: (2024)
Re-ReST: Reflection-Reinforced Self-Training for Language Agents
di: Dou, Zi-Yi, et al.
Pubblicazione: (2024)
di: Dou, Zi-Yi, et al.
Pubblicazione: (2024)
VEDIT: Latent Prediction Architecture For Procedural Video Representation Learning
di: Lin, Han, et al.
Pubblicazione: (2024)
di: Lin, Han, et al.
Pubblicazione: (2024)
The Audio-Visual Conversational Graph: From an Egocentric-Exocentric Perspective
di: Jia, Wenqi, et al.
Pubblicazione: (2023)
di: Jia, Wenqi, et al.
Pubblicazione: (2023)
Detours for Navigating Instructional Videos
di: Ashutosh, Kumar, et al.
Pubblicazione: (2024)
di: Ashutosh, Kumar, et al.
Pubblicazione: (2024)
Medical Vision-Language Pre-Training for Brain Abnormalities
di: Monajatipoor, Masoud, et al.
Pubblicazione: (2024)
di: Monajatipoor, Masoud, et al.
Pubblicazione: (2024)
VITED: Video Temporal Evidence Distillation
di: Lu, Yujie, et al.
Pubblicazione: (2025)
di: Lu, Yujie, et al.
Pubblicazione: (2025)
O-MaMa: Learning Object Mask Matching between Egocentric and Exocentric Views
di: Mur-Labadia, Lorenzo, et al.
Pubblicazione: (2025)
di: Mur-Labadia, Lorenzo, et al.
Pubblicazione: (2025)
Fine-grained Spatiotemporal Grounding on Egocentric Videos
di: Liang, Shuo, et al.
Pubblicazione: (2025)
di: Liang, Shuo, et al.
Pubblicazione: (2025)
Cross-view Action Recognition Understanding From Exocentric to Egocentric Perspective
di: Truong, Thanh-Dat, et al.
Pubblicazione: (2023)
di: Truong, Thanh-Dat, et al.
Pubblicazione: (2023)
Harmony4D: A Video Dataset for In-The-Wild Close Human Interactions
di: Khirodkar, Rawal, et al.
Pubblicazione: (2024)
di: Khirodkar, Rawal, et al.
Pubblicazione: (2024)
Switch-a-View: View Selection Learned from Unlabeled In-the-wild Videos
di: Majumder, Sagnik, et al.
Pubblicazione: (2024)
di: Majumder, Sagnik, et al.
Pubblicazione: (2024)
Bridging Perspectives: A Survey on Cross-view Collaborative Intelligence with Egocentric-Exocentric Vision
di: He, Yuping, et al.
Pubblicazione: (2025)
di: He, Yuping, et al.
Pubblicazione: (2025)
ESVQA: Perceptual Quality Assessment of Egocentric Spatial Videos
di: Zhu, Xilei, et al.
Pubblicazione: (2024)
di: Zhu, Xilei, et al.
Pubblicazione: (2024)
NovaPlan: Zero-Shot Long-Horizon Manipulation via Closed-Loop Video Language Planning
di: Fu, Jiahui, et al.
Pubblicazione: (2026)
di: Fu, Jiahui, et al.
Pubblicazione: (2026)
VISTA: A Generative Egocentric Video Framework for Daily Assistance
di: Liu, Yu-Hsiang, et al.
Pubblicazione: (2026)
di: Liu, Yu-Hsiang, et al.
Pubblicazione: (2026)
Modeling Fine-Grained Hand-Object Dynamics for Egocentric Video Representation Learning
di: Pei, Baoqi, et al.
Pubblicazione: (2025)
di: Pei, Baoqi, et al.
Pubblicazione: (2025)
Matryoshka Query Transformer for Large Vision-Language Models
di: Hu, Wenbo, et al.
Pubblicazione: (2024)
di: Hu, Wenbo, et al.
Pubblicazione: (2024)
DETACH : Decomposed Spatio-Temporal Alignment for Exocentric Video and Ambient Sensors with Staged Learning
di: Yoon, Junho, et al.
Pubblicazione: (2025)
di: Yoon, Junho, et al.
Pubblicazione: (2025)
Look and Tell: A Dataset for Multimodal Grounding Across Egocentric and Exocentric Views
di: Deichler, Anna, et al.
Pubblicazione: (2025)
di: Deichler, Anna, et al.
Pubblicazione: (2025)
Universal Humanoid Motion Representations for Physics-Based Control
di: Luo, Zhengyi, et al.
Pubblicazione: (2023)
di: Luo, Zhengyi, et al.
Pubblicazione: (2023)
Which Viewpoint Shows it Best? Language for Weakly Supervising View Selection in Multi-view Instructional Videos
di: Majumder, Sagnik, et al.
Pubblicazione: (2024)
di: Majumder, Sagnik, et al.
Pubblicazione: (2024)
Don't Look Twice: Faster Video Transformers with Run-Length Tokenization
di: Choudhury, Rohan, et al.
Pubblicazione: (2024)
di: Choudhury, Rohan, et al.
Pubblicazione: (2024)
Joint Diffusion for Universal Hand-Object Grasp Generation
di: Cao, Jinkun, et al.
Pubblicazione: (2024)
di: Cao, Jinkun, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Propose, Assess, Search: Harnessing LLMs for Goal-Oriented Planning in Instructional Videos
di: Islam, Md Mohaiminul, et al.
Pubblicazione: (2024) -
ExpertAF: Expert Actionable Feedback from Video
di: Ashutosh, Kumar, et al.
Pubblicazione: (2024) -
Exo2EgoSyn: Unlocking Foundation Video Generation Models for Exocentric-to-Egocentric Video Synthesis
di: Mahdi, Mohammad, et al.
Pubblicazione: (2025) -
WorldWander: Bridging Egocentric and Exocentric Worlds in Video Generation
di: Song, Quanjian, et al.
Pubblicazione: (2025) -
Exo2Ego: Exocentric Knowledge Guided MLLM for Egocentric Video Understanding
di: Zhang, Haoyu, et al.
Pubblicazione: (2025)