From 3D Pose to Prose: Biomechanics-Grounded Vision--Language Coaching
Fuente:
arXiv
Salvato in:
| Autori principali: | Ji, Yuyang, Shen, Yixuan, Zhu, Shengjie, Kong, Yu, Liu, Feng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
BioGait-VLM: A Tri-Modal Vision-Language-Biomechanics Framework for Interpretable Clinical Gait Assessment
di: Chen, Erdong, et al.
Pubblicazione: (2026)
di: Chen, Erdong, et al.
Pubblicazione: (2026)
Non-Colliding Biometric Identities for Digital Entities: Geometry, Capacity, and Million-Scale Virtual Identity Provisioning
di: Ji, Yuyang, et al.
Pubblicazione: (2026)
di: Ji, Yuyang, et al.
Pubblicazione: (2026)
IDSelect: A RL-Based Cost-Aware Selection Agent for Video-based Multi-Modal Person Recognition
di: Ji, Yuyang, et al.
Pubblicazione: (2026)
di: Ji, Yuyang, et al.
Pubblicazione: (2026)
RePose: A Real-Time 3D Human Pose Estimation and Biomechanical Analysis Framework for Rehabilitation
di: Xue, Junxiao, et al.
Pubblicazione: (2026)
di: Xue, Junxiao, et al.
Pubblicazione: (2026)
Grounded 3D-Aware Spatial Vision-Language Modeling
di: Cheng, An-Chieh, et al.
Pubblicazione: (2026)
di: Cheng, An-Chieh, et al.
Pubblicazione: (2026)
Zero-Shot 3D Visual Grounding from Vision-Language Models
di: Li, Rong, et al.
Pubblicazione: (2025)
di: Li, Rong, et al.
Pubblicazione: (2025)
VisionCoach: Reinforcing Grounded Video Reasoning via Visual-Perception Prompting
di: Lee, Daeun, et al.
Pubblicazione: (2026)
di: Lee, Daeun, et al.
Pubblicazione: (2026)
From Panels to Prose: Generating Literary Narratives from Comics
di: Sachdeva, Ragav, et al.
Pubblicazione: (2025)
di: Sachdeva, Ragav, et al.
Pubblicazione: (2025)
AWT: Transferring Vision-Language Models via Augmentation, Weighting, and Transportation
di: Zhu, Yuhan, et al.
Pubblicazione: (2024)
di: Zhu, Yuhan, et al.
Pubblicazione: (2024)
From Pixels to Prose: Advancing Multi-Modal Language Models for Remote Sensing
di: Sun, Xintian, et al.
Pubblicazione: (2024)
di: Sun, Xintian, et al.
Pubblicazione: (2024)
GenCape: Structure-Inductive Generative Modeling for Category-Agnostic Pose Estimation
di: Rao, Jiyong, et al.
Pubblicazione: (2026)
di: Rao, Jiyong, et al.
Pubblicazione: (2026)
MS-MANO: Enabling Hand Pose Tracking with Biomechanical Constraints
di: Xie, Pengfei, et al.
Pubblicazione: (2024)
di: Xie, Pengfei, et al.
Pubblicazione: (2024)
ChatPose: Chatting about 3D Human Pose
di: Feng, Yao, et al.
Pubblicazione: (2023)
di: Feng, Yao, et al.
Pubblicazione: (2023)
BioPose: Biomechanically-accurate 3D Pose Estimation from Monocular Videos
di: Koleini, Farnoosh, et al.
Pubblicazione: (2025)
di: Koleini, Farnoosh, et al.
Pubblicazione: (2025)
N3D-VLM: Native 3D Grounding Enables Accurate Spatial Reasoning in Vision-Language Models
di: Wang, Yuxin, et al.
Pubblicazione: (2025)
di: Wang, Yuxin, et al.
Pubblicazione: (2025)
CLIPose: Category-Level Object Pose Estimation with Pre-trained Vision-Language Knowledge
di: Lin, Xiao, et al.
Pubblicazione: (2024)
di: Lin, Xiao, et al.
Pubblicazione: (2024)
R2G: Reasoning to Ground in 3D Scenes
di: Li, Yixuan, et al.
Pubblicazione: (2024)
di: Li, Yixuan, et al.
Pubblicazione: (2024)
AirZoo: A Unified Large-Scale Dataset for Grounding Aerial Geometric 3D Vision
di: Cheng, Xiaoya, et al.
Pubblicazione: (2026)
di: Cheng, Xiaoya, et al.
Pubblicazione: (2026)
Probablistic Restoration with Adaptive Noise Sampling for 3D Human Pose Estimation
di: Zeng, Xianzhou, et al.
Pubblicazione: (2024)
di: Zeng, Xianzhou, et al.
Pubblicazione: (2024)
DiffCLIP: Leveraging Stable Diffusion for Language Grounded 3D Classification
di: Shen, Sitian, et al.
Pubblicazione: (2023)
di: Shen, Sitian, et al.
Pubblicazione: (2023)
Rethinking Pose Refinement in 3D Gaussian Splatting under Pose Prior and Geometric Uncertainty
di: Kong, Mangyu, et al.
Pubblicazione: (2026)
di: Kong, Mangyu, et al.
Pubblicazione: (2026)
From 2D CAD Drawings to 3D Parametric Models: A Vision-Language Approach
di: Wang, Xilin, et al.
Pubblicazione: (2024)
di: Wang, Xilin, et al.
Pubblicazione: (2024)
SKEL-CF: Coarse-to-Fine Biomechanical Skeleton and Surface Mesh Recovery
di: Li, Da, et al.
Pubblicazione: (2025)
di: Li, Da, et al.
Pubblicazione: (2025)
From Words to Poses: Enhancing Novel Object Pose Estimation with Vision Language Models
di: Pulli, Tessa, et al.
Pubblicazione: (2024)
di: Pulli, Tessa, et al.
Pubblicazione: (2024)
OpenCapBench: A Benchmark to Bridge Pose Estimation and Biomechanics
di: Gozlan, Yoni, et al.
Pubblicazione: (2024)
di: Gozlan, Yoni, et al.
Pubblicazione: (2024)
HeRO: Hierarchical 3D Semantic Representation for Pose-aware Object Manipulation
di: Xu, Chongyang, et al.
Pubblicazione: (2026)
di: Xu, Chongyang, et al.
Pubblicazione: (2026)
From Skin to Skeleton: Towards Biomechanically Accurate 3D Digital Humans
di: Keller, Marilyn, et al.
Pubblicazione: (2025)
di: Keller, Marilyn, et al.
Pubblicazione: (2025)
PoseFix: Correcting 3D Human Poses with Natural Language
di: Delmas, Ginger, et al.
Pubblicazione: (2023)
di: Delmas, Ginger, et al.
Pubblicazione: (2023)
PoseScript: Linking 3D Human Poses and Natural Language
di: Delmas, Ginger, et al.
Pubblicazione: (2022)
di: Delmas, Ginger, et al.
Pubblicazione: (2022)
DenseGrounding: Improving Dense Language-Vision Semantics for Ego-Centric 3D Visual Grounding
di: Zheng, Henry, et al.
Pubblicazione: (2025)
di: Zheng, Henry, et al.
Pubblicazione: (2025)
Marginalized Bundle Adjustment: Multi-View Camera Pose from Monocular Depth Estimates
di: Zhu, Shengjie, et al.
Pubblicazione: (2026)
di: Zhu, Shengjie, et al.
Pubblicazione: (2026)
Grounding Foundational Vision Models with 3D Human Poses for Robust Action Recognition
di: Babey, Nicholas, et al.
Pubblicazione: (2025)
di: Babey, Nicholas, et al.
Pubblicazione: (2025)
HiSpatial: Taming Hierarchical 3D Spatial Understanding in Vision-Language Models
di: Liang, Huizhi, et al.
Pubblicazione: (2026)
di: Liang, Huizhi, et al.
Pubblicazione: (2026)
Pose-Specific 3D Fingerprint Unfolding
di: Guan, Xiongjun, et al.
Pubblicazione: (2024)
di: Guan, Xiongjun, et al.
Pubblicazione: (2024)
CLIP-GS: Unifying Vision-Language Representation with 3D Gaussian Splatting
di: Jiao, Siyu, et al.
Pubblicazione: (2024)
di: Jiao, Siyu, et al.
Pubblicazione: (2024)
Unsupervised Multi-Person 3D Human Pose Estimation From 2D Poses Alone
di: Hardy, Peter, et al.
Pubblicazione: (2023)
di: Hardy, Peter, et al.
Pubblicazione: (2023)
HPE-CogVLM: Advancing Vision Language Models with a Head Pose Grounding Task
di: Tian, Yu, et al.
Pubblicazione: (2024)
di: Tian, Yu, et al.
Pubblicazione: (2024)
Learning Consistent Temporal Grounding between Related Tasks in Sports Coaching
di: Rai, Arushi, et al.
Pubblicazione: (2026)
di: Rai, Arushi, et al.
Pubblicazione: (2026)
TechCoach: Towards Technical-Point-Aware Descriptive Action Coaching
di: Li, Yuan-Ming, et al.
Pubblicazione: (2024)
di: Li, Yuan-Ming, et al.
Pubblicazione: (2024)
LangPose: Language-Aligned Motion for Robust 3D Human Pose Estimation
di: Liao, Longyun, et al.
Pubblicazione: (2024)
di: Liao, Longyun, et al.
Pubblicazione: (2024)
Documenti analoghi
-
BioGait-VLM: A Tri-Modal Vision-Language-Biomechanics Framework for Interpretable Clinical Gait Assessment
di: Chen, Erdong, et al.
Pubblicazione: (2026) -
Non-Colliding Biometric Identities for Digital Entities: Geometry, Capacity, and Million-Scale Virtual Identity Provisioning
di: Ji, Yuyang, et al.
Pubblicazione: (2026) -
IDSelect: A RL-Based Cost-Aware Selection Agent for Video-based Multi-Modal Person Recognition
di: Ji, Yuyang, et al.
Pubblicazione: (2026) -
RePose: A Real-Time 3D Human Pose Estimation and Biomechanical Analysis Framework for Rehabilitation
di: Xue, Junxiao, et al.
Pubblicazione: (2026) -
Grounded 3D-Aware Spatial Vision-Language Modeling
di: Cheng, An-Chieh, et al.
Pubblicazione: (2026)