Seeing Without Eyes: 4D Human-Scene Understanding from Wearable IMUs
Fuente:
arXiv
Guardado en:
| Autores principales: | Hsu, Hao-Yu, Cheng, Tianhang, Wen, Jing, Schwing, Alexander G., Wang, Shenlong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
NoPo-Avatar: Generalizable and Animatable Avatars from Sparse Inputs without Human Poses
por: Wen, Jing, et al.
Publicado: (2025)
por: Wen, Jing, et al.
Publicado: (2025)
LIFe-GoM: Generalizable Human Rendering with Learned Iterative Feedback Over Multi-Resolution Gaussians-on-Mesh
por: Wen, Jing, et al.
Publicado: (2025)
por: Wen, Jing, et al.
Publicado: (2025)
GoMAvatar: Efficient Animatable Human Modeling from Monocular Video Using Gaussians-on-Mesh
por: Wen, Jing, et al.
Publicado: (2024)
por: Wen, Jing, et al.
Publicado: (2024)
HiSC4D: Human-centered interaction and 4D Scene Capture in Large-scale Space Using Wearable IMUs and LiDAR
por: Dai, Yudi, et al.
Publicado: (2024)
por: Dai, Yudi, et al.
Publicado: (2024)
HoloScene: Simulation-Ready Interactive 3D Worlds from a Single Video
por: Xia, Hongchi, et al.
Publicado: (2025)
por: Xia, Hongchi, et al.
Publicado: (2025)
Structure from Duplicates: Neural Inverse Graphics from a Pile of Objects
por: Cheng, Tianhang, et al.
Publicado: (2024)
por: Cheng, Tianhang, et al.
Publicado: (2024)
What's on Your Plate? Inferring Chinese Cuisine Intake from Wearable IMUs
por: Yin, Jiaxi, et al.
Publicado: (2025)
por: Yin, Jiaxi, et al.
Publicado: (2025)
SimpliHuMoN: Simplifying Human Motion Prediction
por: Agrawal, Aadya, et al.
Publicado: (2026)
por: Agrawal, Aadya, et al.
Publicado: (2026)
Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark
por: Chen, Seng Nam, et al.
Publicado: (2026)
por: Chen, Seng Nam, et al.
Publicado: (2026)
AutoVFX: Physically Realistic Video Editing from Natural Language Instructions
por: Hsu, Hao-Yu, et al.
Publicado: (2024)
por: Hsu, Hao-Yu, et al.
Publicado: (2024)
An Affordable, Wearable Stereo-Eye-Tracking Platform
por: Zimmer, Alexander, et al.
Publicado: (2026)
por: Zimmer, Alexander, et al.
Publicado: (2026)
VGGT4D: Mining Motion Cues in Visual Geometry Transformers for 4D Scene Reconstruction
por: Hu, Yu, et al.
Publicado: (2025)
por: Hu, Yu, et al.
Publicado: (2025)
The Curse of Conditions: Analyzing and Improving Optimal Transport for Conditional Flow-Based Generation
por: Cheng, Ho Kei, et al.
Publicado: (2025)
por: Cheng, Ho Kei, et al.
Publicado: (2025)
Understanding Dynamic Scenes in Ego Centric 4D Point Clouds
por: Huang, Junsheng, et al.
Publicado: (2025)
por: Huang, Junsheng, et al.
Publicado: (2025)
NeRFDeformer: NeRF Transformation from a Single View via 3D Scene Flows
por: Tang, Zhenggang, et al.
Publicado: (2024)
por: Tang, Zhenggang, et al.
Publicado: (2024)
Split4D: Decomposed 4D Scene Reconstruction Without Video Segmentation
por: Hu, Yongzhen, et al.
Publicado: (2025)
por: Hu, Yongzhen, et al.
Publicado: (2025)
EMHI: A Multimodal Egocentric Human Motion Dataset with HMD and Body-Worn IMUs
por: Fan, Zhen, et al.
Publicado: (2024)
por: Fan, Zhen, et al.
Publicado: (2024)
LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences
por: Zhi, Hongyan, et al.
Publicado: (2024)
por: Zhi, Hongyan, et al.
Publicado: (2024)
Inferring Compositional 4D Scenes without Ever Seeing One
por: Gokmen, Ahmet Berke, et al.
Publicado: (2025)
por: Gokmen, Ahmet Berke, et al.
Publicado: (2025)
Variational Rectified Flow Matching
por: Guo, Pengsheng, et al.
Publicado: (2025)
por: Guo, Pengsheng, et al.
Publicado: (2025)
Hybrid 3D Human Pose Estimation with Monocular Video and Sparse IMUs
por: Bao, Yiming, et al.
Publicado: (2024)
por: Bao, Yiming, et al.
Publicado: (2024)
Seeing Eye to AI: Comparing Human Gaze and Model Attention in Video Memorability
por: Kumar, Prajneya, et al.
Publicado: (2023)
por: Kumar, Prajneya, et al.
Publicado: (2023)
TalkingEyes: Pluralistic Speech-Driven 3D Eye Gaze Animation
por: Zhuang, Yixiang, et al.
Publicado: (2025)
por: Zhuang, Yixiang, et al.
Publicado: (2025)
Seeing the World through Your Eyes
por: Alzayer, Hadi, et al.
Publicado: (2023)
por: Alzayer, Hadi, et al.
Publicado: (2023)
InvRGB+L: Inverse Rendering of Complex Scenes with Unified Color and LiDAR Reflectance Modeling
por: Chen, Xiaoxue, et al.
Publicado: (2025)
por: Chen, Xiaoxue, et al.
Publicado: (2025)
GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models
por: Qi, Zhangyang, et al.
Publicado: (2025)
por: Qi, Zhangyang, et al.
Publicado: (2025)
SeeU: Seeing the Unseen World via 4D Dynamics-aware Generation
por: Yuan, Yu, et al.
Publicado: (2025)
por: Yuan, Yu, et al.
Publicado: (2025)
OpenVoxel: Training-Free Grouping and Captioning Voxels for Open-Vocabulary 3D Scene Understanding
por: Huang, Sheng-Yu, et al.
Publicado: (2026)
por: Huang, Sheng-Yu, et al.
Publicado: (2026)
Studying Classifier(-Free) Guidance From a Classifier-Centric Perspective
por: Zhao, Xiaoming, et al.
Publicado: (2025)
por: Zhao, Xiaoming, et al.
Publicado: (2025)
Objects With Lighting: A Real-World Dataset for Evaluating Reconstruction and Rendering for Object Relighting
por: Ummenhofer, Benjamin, et al.
Publicado: (2024)
por: Ummenhofer, Benjamin, et al.
Publicado: (2024)
HIS-GPT: Towards 3D Human-In-Scene Multimodal Understanding
por: Zhao, Jiahe, et al.
Publicado: (2025)
por: Zhao, Jiahe, et al.
Publicado: (2025)
See, Rank, and Filter: Important Word-Aware Clip Filtering via Scene Understanding for Moment Retrieval and Highlight Detection
por: Lee, YuEun, et al.
Publicado: (2025)
por: Lee, YuEun, et al.
Publicado: (2025)
OmniScene: Attention-Augmented Multimodal 4D Scene Understanding for Autonomous Driving
por: Liu, Pei, et al.
Publicado: (2025)
por: Liu, Pei, et al.
Publicado: (2025)
OW-VISCapTor: Abstractors for Open-World Video Instance Segmentation and Captioning
por: Choudhuri, Anwesa, et al.
Publicado: (2024)
por: Choudhuri, Anwesa, et al.
Publicado: (2024)
FLOW: Fusing and Shuffling Global and Local Views for Cross-User Human Activity Recognition with IMUs
por: Qiu, Qi, et al.
Publicado: (2024)
por: Qiu, Qi, et al.
Publicado: (2024)
POMA-3D: The Point Map Way to 3D Scene Understanding
por: Mao, Ye, et al.
Publicado: (2025)
por: Mao, Ye, et al.
Publicado: (2025)
Eye-See-You: Reverse Pass-Through VR and Head Avatars
por: Dash, Ankan, et al.
Publicado: (2025)
por: Dash, Ankan, et al.
Publicado: (2025)
Generalizable Sparse-View 3D Reconstruction from Unconstrained Images
por: Gupta, Vinayak, et al.
Publicado: (2026)
por: Gupta, Vinayak, et al.
Publicado: (2026)
Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning
por: Liang, Dayong, et al.
Publicado: (2025)
por: Liang, Dayong, et al.
Publicado: (2025)
Uni4D: Unifying Visual Foundation Models for 4D Modeling from a Single Video
por: Yao, David Yifan, et al.
Publicado: (2025)
por: Yao, David Yifan, et al.
Publicado: (2025)
Ejemplares similares
-
NoPo-Avatar: Generalizable and Animatable Avatars from Sparse Inputs without Human Poses
por: Wen, Jing, et al.
Publicado: (2025) -
LIFe-GoM: Generalizable Human Rendering with Learned Iterative Feedback Over Multi-Resolution Gaussians-on-Mesh
por: Wen, Jing, et al.
Publicado: (2025) -
GoMAvatar: Efficient Animatable Human Modeling from Monocular Video Using Gaussians-on-Mesh
por: Wen, Jing, et al.
Publicado: (2024) -
HiSC4D: Human-centered interaction and 4D Scene Capture in Large-scale Space Using Wearable IMUs and LiDAR
por: Dai, Yudi, et al.
Publicado: (2024) -
HoloScene: Simulation-Ready Interactive 3D Worlds from a Single Video
por: Xia, Hongchi, et al.
Publicado: (2025)