LOME: Learning Human-Object Manipulation with Action-Conditioned Egocentric World Model
Fuente:
arXiv
Salvato in:
| Autori principali: | Gao, Quankai, Yang, Jiawei, Xu, Qiangeng, Chen, Le, Wang, Yue |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
GaussianFlow: Splatting Gaussian Dynamics for 4D Content Creation
di: Gao, Quankai, et al.
Pubblicazione: (2024)
di: Gao, Quankai, et al.
Pubblicazione: (2024)
Intention-Conditioned Long-Term Human Egocentric Action Forecasting
di: Mascaro, Esteve Valls, et al.
Pubblicazione: (2022)
di: Mascaro, Esteve Valls, et al.
Pubblicazione: (2022)
Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision
di: Yoshida, Tomoya, et al.
Pubblicazione: (2025)
di: Yoshida, Tomoya, et al.
Pubblicazione: (2025)
ALGO: Object-Grounded Visual Commonsense Reasoning for Open-World Egocentric Action Recognition
di: Kundu, Sanjoy, et al.
Pubblicazione: (2024)
di: Kundu, Sanjoy, et al.
Pubblicazione: (2024)
EgoPrompt: Prompt Learning for Egocentric Action Recognition
di: Lyu, Huaihai, et al.
Pubblicazione: (2025)
di: Lyu, Huaihai, et al.
Pubblicazione: (2025)
Modeling Fine-Grained Hand-Object Dynamics for Egocentric Video Representation Learning
di: Pei, Baoqi, et al.
Pubblicazione: (2025)
di: Pei, Baoqi, et al.
Pubblicazione: (2025)
EgoVerse: An Egocentric Human Dataset for Robot Learning from Around the World
di: Punamiya, Ryan, et al.
Pubblicazione: (2026)
di: Punamiya, Ryan, et al.
Pubblicazione: (2026)
Perceiving and Acting in First-Person: A Dataset and Benchmark for Egocentric Human-Object-Human Interactions
di: Xu, Liang, et al.
Pubblicazione: (2025)
di: Xu, Liang, et al.
Pubblicazione: (2025)
Discovering Novel Actions from Open World Egocentric Videos with Object-Grounded Visual Commonsense Reasoning
di: Kundu, Sanjoy, et al.
Pubblicazione: (2023)
di: Kundu, Sanjoy, et al.
Pubblicazione: (2023)
POV: Prompt-Oriented View-Agnostic Learning for Egocentric Hand-Object Interaction in the Multi-View World
di: Xu, Boshen, et al.
Pubblicazione: (2024)
di: Xu, Boshen, et al.
Pubblicazione: (2024)
Egocentric World Model for Photorealistic Hand-Object Interaction Synthesis
di: Li, Dayou, et al.
Pubblicazione: (2026)
di: Li, Dayou, et al.
Pubblicazione: (2026)
World Guidance: World Modeling in Condition Space for Action Generation
di: Su, Yue, et al.
Pubblicazione: (2026)
di: Su, Yue, et al.
Pubblicazione: (2026)
Object Aware Egocentric Online Action Detection
di: An, Joungbin, et al.
Pubblicazione: (2024)
di: An, Joungbin, et al.
Pubblicazione: (2024)
Learning Action-Conditional and Object-Centric Gaussian Splatting World Models for Rigid Objects
di: Kreber, Jens U., et al.
Pubblicazione: (2026)
di: Kreber, Jens U., et al.
Pubblicazione: (2026)
Do Egocentric Video-Language Models Truly Understand Hand-Object Interactions?
di: Xu, Boshen, et al.
Pubblicazione: (2024)
di: Xu, Boshen, et al.
Pubblicazione: (2024)
X-MIC: Cross-Modal Instance Conditioning for Egocentric Action Generalization
di: Kukleva, Anna, et al.
Pubblicazione: (2024)
di: Kukleva, Anna, et al.
Pubblicazione: (2024)
Egocentric Human-Object Interaction Detection: A New Benchmark and Method
di: Deng, Kunyuan, et al.
Pubblicazione: (2025)
di: Deng, Kunyuan, et al.
Pubblicazione: (2025)
EgoChoir: Capturing 3D Human-Object Interaction Regions from Egocentric Views
di: Yang, Yuhang, et al.
Pubblicazione: (2024)
di: Yang, Yuhang, et al.
Pubblicazione: (2024)
InstantSfM: Towards GPU-Native SfM for the Deep Learning Era
di: Zhong, Jiankun, et al.
Pubblicazione: (2025)
di: Zhong, Jiankun, et al.
Pubblicazione: (2025)
PlayerOne: Egocentric World Simulator
di: Tu, Yuanpeng, et al.
Pubblicazione: (2025)
di: Tu, Yuanpeng, et al.
Pubblicazione: (2025)
WHOLE: World-Grounded Hand-Object Lifted from Egocentric Videos
di: Ye, Yufei, et al.
Pubblicazione: (2026)
di: Ye, Yufei, et al.
Pubblicazione: (2026)
EOC-Bench: Can MLLMs Identify, Recall, and Forecast Objects in an Egocentric World?
di: Yuan, Yuqian, et al.
Pubblicazione: (2025)
di: Yuan, Yuqian, et al.
Pubblicazione: (2025)
WorldWander: Bridging Egocentric and Exocentric Worlds in Video Generation
di: Song, Quanjian, et al.
Pubblicazione: (2025)
di: Song, Quanjian, et al.
Pubblicazione: (2025)
WorldCraft: From Camera Navigation to Object Manipulation in Interactive Video World Models
di: Gu, Bohai, et al.
Pubblicazione: (2026)
di: Gu, Bohai, et al.
Pubblicazione: (2026)
Synergy between 3DMM and 3D Landmarks for Accurate 3D Facial Geometry
di: Wu, Cho-Ying, et al.
Pubblicazione: (2021)
di: Wu, Cho-Ying, et al.
Pubblicazione: (2021)
HOIMotion: Forecasting Human Motion During Human-Object Interactions Using Egocentric 3D Object Bounding Boxes
di: Hu, Zhiming, et al.
Pubblicazione: (2024)
di: Hu, Zhiming, et al.
Pubblicazione: (2024)
Diff-IP2D: Diffusion-Based Hand-Object Interaction Prediction on Egocentric Videos
di: Ma, Junyi, et al.
Pubblicazione: (2024)
di: Ma, Junyi, et al.
Pubblicazione: (2024)
DISN: Deep Implicit Surface Network for High-quality Single-view 3D Reconstruction
di: Xu, Qiangeng, et al.
Pubblicazione: (2019)
di: Xu, Qiangeng, et al.
Pubblicazione: (2019)
MAPLE: Encoding Dexterous Robotic Manipulation Priors Learned From Egocentric Videos
di: Gavryushin, Alexey, et al.
Pubblicazione: (2025)
di: Gavryushin, Alexey, et al.
Pubblicazione: (2025)
EMHI: A Multimodal Egocentric Human Motion Dataset with HMD and Body-Worn IMUs
di: Fan, Zhen, et al.
Pubblicazione: (2024)
di: Fan, Zhen, et al.
Pubblicazione: (2024)
Being-H0.7: A Latent World-Action Model from Egocentric Videos
di: Luo, Hao, et al.
Pubblicazione: (2026)
di: Luo, Hao, et al.
Pubblicazione: (2026)
CLAP: Contrastive Latent Action Pretraining for Learning Vision-Language-Action Models from Human Videos
di: Zhang, Chubin, et al.
Pubblicazione: (2026)
di: Zhang, Chubin, et al.
Pubblicazione: (2026)
MagicPose: Realistic Human Poses and Facial Expressions Retargeting with Identity-aware Diffusion
di: Chang, Di, et al.
Pubblicazione: (2023)
di: Chang, Di, et al.
Pubblicazione: (2023)
Domain Generalization using Action Sequences for Egocentric Action Recognition
di: Nasirimajd, Amirshayan, et al.
Pubblicazione: (2025)
di: Nasirimajd, Amirshayan, et al.
Pubblicazione: (2025)
EchoWorld: Learning Motion-Aware World Models for Echocardiography Probe Guidance
di: Yue, Yang, et al.
Pubblicazione: (2025)
di: Yue, Yang, et al.
Pubblicazione: (2025)
Spatial-Conditioned Reasoning in Long-Egocentric Videos
di: Tribble, James, et al.
Pubblicazione: (2026)
di: Tribble, James, et al.
Pubblicazione: (2026)
Multimodal Cross-Domain Few-Shot Learning for Egocentric Action Recognition
di: Hatano, Masashi, et al.
Pubblicazione: (2024)
di: Hatano, Masashi, et al.
Pubblicazione: (2024)
DynamicVLA: A Vision-Language-Action Model for Dynamic Object Manipulation
di: Xie, Haozhe, et al.
Pubblicazione: (2026)
di: Xie, Haozhe, et al.
Pubblicazione: (2026)
EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos
di: Yang, Ruihan, et al.
Pubblicazione: (2025)
di: Yang, Ruihan, et al.
Pubblicazione: (2025)
Learning Precise Affordances from Egocentric Videos for Robotic Manipulation
di: Li, Gen, et al.
Pubblicazione: (2024)
di: Li, Gen, et al.
Pubblicazione: (2024)
Documenti analoghi
-
GaussianFlow: Splatting Gaussian Dynamics for 4D Content Creation
di: Gao, Quankai, et al.
Pubblicazione: (2024) -
Intention-Conditioned Long-Term Human Egocentric Action Forecasting
di: Mascaro, Esteve Valls, et al.
Pubblicazione: (2022) -
Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision
di: Yoshida, Tomoya, et al.
Pubblicazione: (2025) -
ALGO: Object-Grounded Visual Commonsense Reasoning for Open-World Egocentric Action Recognition
di: Kundu, Sanjoy, et al.
Pubblicazione: (2024) -
EgoPrompt: Prompt Learning for Egocentric Action Recognition
di: Lyu, Huaihai, et al.
Pubblicazione: (2025)