AoE: Always-on Egocentric Human Video Collection for Embodied AI
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Yang, Bowen, Li, Zishuo, Sun, Yang, Miao, Changtao, Yang, Yifan, Luo, Man, Yan, Xiaotong, Jiang, Feng, Shi, Jinchuan, Fu, Yankai, Chen, Ning, Zhao, Junkai, Wang, Pengwei, Yao, Guocai, Zhang, Shanghang, Chen, Hao, Li, Zhe, Zhu, Kai |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
METIS: Multi-Source Egocentric Training for Integrated Dexterous Vision-Language-Action Model
von: Fu, Yankai, et al.
Veröffentlicht: (2025)
von: Fu, Yankai, et al.
Veröffentlicht: (2025)
Video-VoT-R1: An efficient video inference model integrating image packing and AoE architecture
von: Li, Cheng, et al.
Veröffentlicht: (2025)
von: Li, Cheng, et al.
Veröffentlicht: (2025)
VidEgoThink: Assessing Egocentric Video Understanding Capabilities for Embodied AI
von: Cheng, Sijie, et al.
Veröffentlicht: (2024)
von: Cheng, Sijie, et al.
Veröffentlicht: (2024)
Embodied VideoAgent: Persistent Memory from Egocentric Videos and Embodied Sensors Enables Dynamic Scene Understanding
von: Fan, Yue, et al.
Veröffentlicht: (2024)
von: Fan, Yue, et al.
Veröffentlicht: (2024)
MM-Ego: Towards Building Egocentric Multimodal LLMs for Video QA
von: Ye, Hanrong, et al.
Veröffentlicht: (2024)
von: Ye, Hanrong, et al.
Veröffentlicht: (2024)
Self-Supervised Monocular 4D Scene Reconstruction for Egocentric Videos
von: Yuan, Chengbo, et al.
Veröffentlicht: (2024)
von: Yuan, Chengbo, et al.
Veröffentlicht: (2024)
MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection
von: Hu, Mengxue, et al.
Veröffentlicht: (2025)
von: Hu, Mengxue, et al.
Veröffentlicht: (2025)
The Courtroom Trial of Pixels: Robust Image Manipulation Localization via Adversarial Evidence and Reinforcement Learning Judgment
von: Li, Songlin, et al.
Veröffentlicht: (2026)
von: Li, Songlin, et al.
Veröffentlicht: (2026)
MA-EgoQA: Question Answering over Egocentric Videos from Multiple Embodied Agents
von: Kim, Kangsan, et al.
Veröffentlicht: (2026)
von: Kim, Kangsan, et al.
Veröffentlicht: (2026)
VideoWeaver: Multimodal Multi-View Video-to-Video Transfer for Embodied Agents
von: Eskandar, George, et al.
Veröffentlicht: (2026)
von: Eskandar, George, et al.
Veröffentlicht: (2026)
Universal Visuo-Tactile Video Understanding for Embodied Interaction
von: Xie, Yifan, et al.
Veröffentlicht: (2025)
von: Xie, Yifan, et al.
Veröffentlicht: (2025)
AURA: Always-On Understanding and Real-Time Assistance via Video Streams
von: Lu, Xudong, et al.
Veröffentlicht: (2026)
von: Lu, Xudong, et al.
Veröffentlicht: (2026)
Look, Zoom, Understand: The Robotic Eyeball for Embodied Perception
von: Yang, Jiashu, et al.
Veröffentlicht: (2025)
von: Yang, Jiashu, et al.
Veröffentlicht: (2025)
Minimizing AoI in Mobile Edge Computing: Nested Index Policy with Preemptive and Non-preemptive Structure
von: Yang, Ning, et al.
Veröffentlicht: (2025)
von: Yang, Ning, et al.
Veröffentlicht: (2025)
PAWS: Perception of Articulation in the Wild at Scale from Egocentric Videos
von: Wang, Yihao, et al.
Veröffentlicht: (2026)
von: Wang, Yihao, et al.
Veröffentlicht: (2026)
GIFGuard: Proactive Forensics against Deepfakes in Facial GIFs via Spatiotemporal Watermarking
von: Che, Shupeng, et al.
Veröffentlicht: (2026)
von: Che, Shupeng, et al.
Veröffentlicht: (2026)
Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model
von: Huang, Yifei, et al.
Veröffentlicht: (2024)
von: Huang, Yifei, et al.
Veröffentlicht: (2024)
How Does CEO Career Horizon Affect ESG Engagement? The Contingent Role of Individual and Multiple Performance Feedback
von: Guocai Chen, et al.
Veröffentlicht: (2025)
von: Guocai Chen, et al.
Veröffentlicht: (2025)
MultiPLY: A Multisensory Object-Centric Embodied Large Language Model in 3D World
von: Hong, Yining, et al.
Veröffentlicht: (2024)
von: Hong, Yining, et al.
Veröffentlicht: (2024)
ENACT: Evaluating Embodied Cognition with World Modeling of Egocentric Interaction
von: Wang, Qineng, et al.
Veröffentlicht: (2025)
von: Wang, Qineng, et al.
Veröffentlicht: (2025)
Embodied Robot Manipulation in the Era of Foundation Models: Planning and Learning Perspectives
von: Bai, Shuanghao, et al.
Veröffentlicht: (2025)
von: Bai, Shuanghao, et al.
Veröffentlicht: (2025)
Existence and Exponential Growth of Global Classical Solutions to the Compressible Navier-Stokes Equations with Slip Boundary Conditions in 3D Bounded Domains
von: Cai, Guocai, et al.
Veröffentlicht: (2021)
von: Cai, Guocai, et al.
Veröffentlicht: (2021)
EVA: An Embodied World Model for Future Video Anticipation
von: Chi, Xiaowei, et al.
Veröffentlicht: (2024)
von: Chi, Xiaowei, et al.
Veröffentlicht: (2024)
FEM on nonuniform meshes for nonlocal Laplacian: Semi-analytic Implementation in One Dimension
von: Chen, Hongbin, et al.
Veröffentlicht: (2024)
von: Chen, Hongbin, et al.
Veröffentlicht: (2024)
AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
von: Suglia, Alessandro, et al.
Veröffentlicht: (2024)
von: Suglia, Alessandro, et al.
Veröffentlicht: (2024)
EgoKit: Towards Unified Low-Cost Egocentric Data Collection with Heterogeneous Devices
von: Yu, Liuchuan, et al.
Veröffentlicht: (2026)
von: Yu, Liuchuan, et al.
Veröffentlicht: (2026)
Does Doing Good Always Bring Good? Employees' Attribution Matters in Their Reactions to Proactive Corporate Social Responsibility
von: Qi Song, et al.
Veröffentlicht: (2025)
von: Qi Song, et al.
Veröffentlicht: (2025)
One-Shot Affordance Grounding of Deformable Objects in Egocentric Organizing Scenes
von: Jia, Wanjun, et al.
Veröffentlicht: (2025)
von: Jia, Wanjun, et al.
Veröffentlicht: (2025)
Deformations and Einstein metrics I
von: Yu, Changtao
Veröffentlicht: (2025)
von: Yu, Changtao
Veröffentlicht: (2025)
Advancing Egocentric Video Question Answering with Multimodal Large Language Models
von: Patel, Alkesh, et al.
Veröffentlicht: (2025)
von: Patel, Alkesh, et al.
Veröffentlicht: (2025)
Unifying Model Predictive Path Integral Control, Reinforcement Learning, and Diffusion Models for Optimal Control and Planning
von: Li, Yankai, et al.
Veröffentlicht: (2025)
von: Li, Yankai, et al.
Veröffentlicht: (2025)
HJRNO: Hamilton-Jacobi Reachability with Neural Operators
von: Li, Yankai, et al.
Veröffentlicht: (2025)
von: Li, Yankai, et al.
Veröffentlicht: (2025)
EgoPrune: Efficient Token Pruning for Egomotion Video Reasoning in Embodied Agent
von: Li, Jiaao, et al.
Veröffentlicht: (2025)
von: Li, Jiaao, et al.
Veröffentlicht: (2025)
Closer Is Not Always More Credible: The Effect of Social Distance on Misinformation Processing
von: Guangzhen Jia, et al.
Veröffentlicht: (2025)
von: Guangzhen Jia, et al.
Veröffentlicht: (2025)
Driving-Video Dehazing with Non-Aligned Regularization for Safety Assistance
von: Fan, Junkai, et al.
Veröffentlicht: (2024)
von: Fan, Junkai, et al.
Veröffentlicht: (2024)
Depth-Centric Dehazing and Depth-Estimation from Real-World Hazy Driving Video
von: Fan, Junkai, et al.
Veröffentlicht: (2024)
von: Fan, Junkai, et al.
Veröffentlicht: (2024)
Can Large Language Models Always Solve Easy Problems if They Can Solve Harder Ones?
von: Yang, Zhe, et al.
Veröffentlicht: (2024)
von: Yang, Zhe, et al.
Veröffentlicht: (2024)
Residual Dense Swin Transformer for Continuous Depth-Independent Ultrasound Imaging
von: Hu, Jintong, et al.
Veröffentlicht: (2024)
von: Hu, Jintong, et al.
Veröffentlicht: (2024)
Incentivizing Temporal-Awareness in Egocentric Video Understanding Models
von: Xu, Zhiyang, et al.
Veröffentlicht: (2026)
von: Xu, Zhiyang, et al.
Veröffentlicht: (2026)
Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought
von: Zhang, Shuyi, et al.
Veröffentlicht: (2025)
von: Zhang, Shuyi, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
METIS: Multi-Source Egocentric Training for Integrated Dexterous Vision-Language-Action Model
von: Fu, Yankai, et al.
Veröffentlicht: (2025) -
Video-VoT-R1: An efficient video inference model integrating image packing and AoE architecture
von: Li, Cheng, et al.
Veröffentlicht: (2025) -
VidEgoThink: Assessing Egocentric Video Understanding Capabilities for Embodied AI
von: Cheng, Sijie, et al.
Veröffentlicht: (2024) -
Embodied VideoAgent: Persistent Memory from Egocentric Videos and Embodied Sensors Enables Dynamic Scene Understanding
von: Fan, Yue, et al.
Veröffentlicht: (2024) -
MM-Ego: Towards Building Egocentric Multimodal LLMs for Video QA
von: Ye, Hanrong, et al.
Veröffentlicht: (2024)