LocLLM: Exploiting Generalizable Human Keypoint Localization via Large Language Model
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Dongkai, Xuan, Shiyu, Zhang, Shiliang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Decoupled Contrastive Learning for Long-Tailed Recognition
di: Xuan, Shiyu, et al.
Pubblicazione: (2024)
di: Xuan, Shiyu, et al.
Pubblicazione: (2024)
Zero-shot HOI Detection with MLLM-based Detector-agnostic Interaction Recognition
di: Xuan, Shiyu, et al.
Pubblicazione: (2026)
di: Xuan, Shiyu, et al.
Pubblicazione: (2026)
EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos
di: Ma, Junyi, et al.
Pubblicazione: (2025)
di: Ma, Junyi, et al.
Pubblicazione: (2025)
KptLLM: Unveiling the Power of Large Language Model for Keypoint Comprehension
di: Yang, Jie, et al.
Pubblicazione: (2024)
di: Yang, Jie, et al.
Pubblicazione: (2024)
KptLLM++: Towards Generic Keypoint Comprehension with Large Language Model
di: Yang, Jie, et al.
Pubblicazione: (2025)
di: Yang, Jie, et al.
Pubblicazione: (2025)
VLM-Loc: Localization in Point Cloud Maps via Vision-Language Models
di: Kang, Shuhao, et al.
Pubblicazione: (2026)
di: Kang, Shuhao, et al.
Pubblicazione: (2026)
GSVisLoc: Generalizable Visual Localization for Gaussian Splatting Scene Representations
di: Khatib, Fadi, et al.
Pubblicazione: (2025)
di: Khatib, Fadi, et al.
Pubblicazione: (2025)
Video Emotion Open-vocabulary Recognition Based on Multimodal Large Language Model
di: Ge, Mengying, et al.
Pubblicazione: (2024)
di: Ge, Mengying, et al.
Pubblicazione: (2024)
HalLoc: Token-level Localization of Hallucinations for Vision Language Models
di: Park, Eunkyu, et al.
Pubblicazione: (2025)
di: Park, Eunkyu, et al.
Pubblicazione: (2025)
Pink: Unveiling the Power of Referential Comprehension for Multi-modal LLMs
di: Xuan, Shiyu, et al.
Pubblicazione: (2023)
di: Xuan, Shiyu, et al.
Pubblicazione: (2023)
MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization
di: Xiao, Zhendong, et al.
Pubblicazione: (2025)
di: Xiao, Zhendong, et al.
Pubblicazione: (2025)
CountLLM: Towards Generalizable Repetitive Action Counting via Large Language Model
di: Yao, Ziyu, et al.
Pubblicazione: (2025)
di: Yao, Ziyu, et al.
Pubblicazione: (2025)
UAV-VisLoc: A Large-scale Dataset for UAV Visual Localization
di: Xu, Wenjia, et al.
Pubblicazione: (2024)
di: Xu, Wenjia, et al.
Pubblicazione: (2024)
Learning Expressive And Generalizable Motion Features For Face Forgery Detection
di: Zhang, Jingyi, et al.
Pubblicazione: (2024)
di: Zhang, Jingyi, et al.
Pubblicazione: (2024)
GSplatLoc: Grounding Keypoint Descriptors into 3D Gaussian Splatting for Improved Visual Localization
di: Sidorov, Gennady, et al.
Pubblicazione: (2024)
di: Sidorov, Gennady, et al.
Pubblicazione: (2024)
KP-RED: Exploiting Semantic Keypoints for Joint 3D Shape Retrieval and Deformation
di: Zhang, Ruida, et al.
Pubblicazione: (2024)
di: Zhang, Ruida, et al.
Pubblicazione: (2024)
CILP-FGDI: Exploiting Vision-Language Model for Generalizable Person Re-Identification
di: Zhao, Huazhong, et al.
Pubblicazione: (2025)
di: Zhao, Huazhong, et al.
Pubblicazione: (2025)
DiaLoc: An Iterative Approach to Embodied Dialog Localization
di: Zhang, Chao, et al.
Pubblicazione: (2024)
di: Zhang, Chao, et al.
Pubblicazione: (2024)
TAIHRI: Task-Aware 3D Human Keypoints Localization for Close-Range Human-Robot Interaction
di: Li, Ao, et al.
Pubblicazione: (2026)
di: Li, Ao, et al.
Pubblicazione: (2026)
Dataset Distillation for Histopathology Image Classification
di: Cong, Cong, et al.
Pubblicazione: (2024)
di: Cong, Cong, et al.
Pubblicazione: (2024)
LSGS-Loc: Towards Robust 3DGS-Based Visual Localization for Large-Scale UAV Scenarios
di: Zhang, Xiang, et al.
Pubblicazione: (2026)
di: Zhang, Xiang, et al.
Pubblicazione: (2026)
LiM-Loc: Visual Localization with Dense and Accurate 3D Reference Maps Directly Corresponding 2D Keypoints to 3D LiDAR Point Clouds
di: Tsuji, Masahiko, et al.
Pubblicazione: (2025)
di: Tsuji, Masahiko, et al.
Pubblicazione: (2025)
Unlocking the Capabilities of Large Vision-Language Models for Generalizable and Explainable Deepfake Detection
di: Yu, Peipeng, et al.
Pubblicazione: (2025)
di: Yu, Peipeng, et al.
Pubblicazione: (2025)
ImLoc: Revisiting Visual Localization with Image-based Representation
di: Jiang, Xudong, et al.
Pubblicazione: (2026)
di: Jiang, Xudong, et al.
Pubblicazione: (2026)
Loc$^2$: Interpretable Cross-View Localization via Depth-Lifted Local Feature Matching
di: Xia, Zimin, et al.
Pubblicazione: (2025)
di: Xia, Zimin, et al.
Pubblicazione: (2025)
LatentKeypointGAN: Controlling Images via Latent Keypoints
di: He, Xingzhe, et al.
Pubblicazione: (2021)
di: He, Xingzhe, et al.
Pubblicazione: (2021)
KPLM-STA: Physically-Accurate Shadow Synthesis for Human Relighting via Keypoint-Based Light Modeling
di: Yin, Xinhui, et al.
Pubblicazione: (2025)
di: Yin, Xinhui, et al.
Pubblicazione: (2025)
F$^3$Loc: Fusion and Filtering for Floorplan Localization
di: Chen, Changan, et al.
Pubblicazione: (2024)
di: Chen, Changan, et al.
Pubblicazione: (2024)
AstroLoc: Robust Space to Ground Image Localizer
di: Berton, Gabriele, et al.
Pubblicazione: (2025)
di: Berton, Gabriele, et al.
Pubblicazione: (2025)
LunarLoc: Segment-Based Global Localization on the Moon
di: Thomas, Annika, et al.
Pubblicazione: (2025)
di: Thomas, Annika, et al.
Pubblicazione: (2025)
UnLoc: Leveraging Depth Uncertainties for Floorplan Localization
di: Wüest, Matthias, et al.
Pubblicazione: (2025)
di: Wüest, Matthias, et al.
Pubblicazione: (2025)
Text2Loc: 3D Point Cloud Localization from Natural Language
di: Xia, Yan, et al.
Pubblicazione: (2023)
di: Xia, Yan, et al.
Pubblicazione: (2023)
LocInv: Localization-aware Inversion for Text-Guided Image Editing
di: Tang, Chuanming, et al.
Pubblicazione: (2024)
di: Tang, Chuanming, et al.
Pubblicazione: (2024)
GroundLoc: Efficient Large-Scale Outdoor LiDAR-Only Localization
di: Steinke, Nicolai, et al.
Pubblicazione: (2025)
di: Steinke, Nicolai, et al.
Pubblicazione: (2025)
Exploiting Diffusion Prior for Generalizable Dense Prediction
di: Lee, Hsin-Ying, et al.
Pubblicazione: (2023)
di: Lee, Hsin-Ying, et al.
Pubblicazione: (2023)
GSplatLoc: Ultra-Precise Camera Localization via 3D Gaussian Splatting
di: Zeller, Atticus J., et al.
Pubblicazione: (2024)
di: Zeller, Atticus J., et al.
Pubblicazione: (2024)
FoldNet: Learning Generalizable Closed-Loop Policy for Garment Folding via Keypoint-Driven Asset and Demonstration Synthesis
di: Chen, Yuxing, et al.
Pubblicazione: (2025)
di: Chen, Yuxing, et al.
Pubblicazione: (2025)
Generalizable Entity Grounding via Assistance of Large Language Model
di: Qi, Lu, et al.
Pubblicazione: (2024)
di: Qi, Lu, et al.
Pubblicazione: (2024)
LightLoc: Learning Outdoor LiDAR Localization at Light Speed
di: Li, Wen, et al.
Pubblicazione: (2025)
di: Li, Wen, et al.
Pubblicazione: (2025)
Text2Loc++: Generalizing 3D Point Cloud Localization from Natural Language
di: Xia, Yan, et al.
Pubblicazione: (2025)
di: Xia, Yan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Decoupled Contrastive Learning for Long-Tailed Recognition
di: Xuan, Shiyu, et al.
Pubblicazione: (2024) -
Zero-shot HOI Detection with MLLM-based Detector-agnostic Interaction Recognition
di: Xuan, Shiyu, et al.
Pubblicazione: (2026) -
EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos
di: Ma, Junyi, et al.
Pubblicazione: (2025) -
KptLLM: Unveiling the Power of Large Language Model for Keypoint Comprehension
di: Yang, Jie, et al.
Pubblicazione: (2024) -
KptLLM++: Towards Generic Keypoint Comprehension with Large Language Model
di: Yang, Jie, et al.
Pubblicazione: (2025)