KptLLM: Unveiling the Power of Large Language Model for Keypoint Comprehension
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Jie, Zeng, Wang, Jin, Sheng, Xu, Lumin, Liu, Wentao, Qian, Chen, Zhang, Ruimao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
KptLLM++: Towards Generic Keypoint Comprehension with Large Language Model
por: Yang, Jie, et al.
Publicado: (2025)
por: Yang, Jie, et al.
Publicado: (2025)
X-Pose: Detecting Any Keypoints
por: Yang, Jie, et al.
Publicado: (2023)
por: Yang, Jie, et al.
Publicado: (2023)
F-LMM: Grounding Frozen Large Multimodal Models
por: Wu, Size, et al.
Publicado: (2024)
por: Wu, Size, et al.
Publicado: (2024)
Unlock the Power of Unlabeled Data in Language Driving Model
por: Wang, Chaoqun, et al.
Publicado: (2025)
por: Wang, Chaoqun, et al.
Publicado: (2025)
TCFormer: Visual Recognition via Token Clustering Transformer
por: Zeng, Wang, et al.
Publicado: (2024)
por: Zeng, Wang, et al.
Publicado: (2024)
GKGNet: Group K-Nearest Neighbor based Graph Convolutional Network for Multi-Label Image Recognition
por: Yao, Ruijie, et al.
Publicado: (2023)
por: Yao, Ruijie, et al.
Publicado: (2023)
UniFS: Universal Few-shot Instance Perception with Point Representations
por: Jin, Sheng, et al.
Publicado: (2024)
por: Jin, Sheng, et al.
Publicado: (2024)
SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension
por: Li, Bohao, et al.
Publicado: (2024)
por: Li, Bohao, et al.
Publicado: (2024)
CLIPSelf: Vision Transformer Distills Itself for Open-Vocabulary Dense Prediction
por: Wu, Size, et al.
Publicado: (2023)
por: Wu, Size, et al.
Publicado: (2023)
AutoMMLab: Automatically Generating Deployable Models from Language Instructions for Computer Vision Tasks
por: Yang, Zekang, et al.
Publicado: (2024)
por: Yang, Zekang, et al.
Publicado: (2024)
Open-Vocabulary Animal Keypoint Detection with Semantic-feature Matching
por: Zhang, Hao, et al.
Publicado: (2023)
por: Zhang, Hao, et al.
Publicado: (2023)
Ultra-High Resolution Segmentation via Boundary-Enhanced Patch-Merging Transformer
por: Sun, Haopeng, et al.
Publicado: (2024)
por: Sun, Haopeng, et al.
Publicado: (2024)
LocLLM: Exploiting Generalizable Human Keypoint Localization via Large Language Model
por: Wang, Dongkai, et al.
Publicado: (2024)
por: Wang, Dongkai, et al.
Publicado: (2024)
When Pedestrian Detection Meets Multi-Modal Learning: Generalist Model and Benchmark Dataset
por: Zhang, Yi, et al.
Publicado: (2024)
por: Zhang, Yi, et al.
Publicado: (2024)
NADER: Neural Architecture Design via Multi-Agent Collaboration
por: Yang, Zekang, et al.
Publicado: (2024)
por: Yang, Zekang, et al.
Publicado: (2024)
Harmonizing Visual Representations for Unified Multimodal Understanding and Generation
por: Wu, Size, et al.
Publicado: (2025)
por: Wu, Size, et al.
Publicado: (2025)
Open-World Human-Object Interaction Detection via Multi-modal Prompts
por: Yang, Jie, et al.
Publicado: (2024)
por: Yang, Jie, et al.
Publicado: (2024)
Generative Giants, Retrieval Weaklings: Why do Multimodal Large Language Models Fail at Multimodal Retrieval?
por: Feng, Hengyi, et al.
Publicado: (2025)
por: Feng, Hengyi, et al.
Publicado: (2025)
MotionLLM: Understanding Human Behaviors from Human Motions and Videos
por: Chen, Ling-Hao, et al.
Publicado: (2024)
por: Chen, Ling-Hao, et al.
Publicado: (2024)
3D Vision and Language Pretraining with Large-Scale Synthetic Data
por: Yang, Dejie, et al.
Publicado: (2024)
por: Yang, Dejie, et al.
Publicado: (2024)
Autoregressive Video Autoencoder with Decoupled Temporal and Spatial Context
por: Shen, Cuifeng, et al.
Publicado: (2025)
por: Shen, Cuifeng, et al.
Publicado: (2025)
Story3D-Agent: Exploring 3D Storytelling Visualization with Large Language Models
por: Huang, Yuzhou, et al.
Publicado: (2024)
por: Huang, Yuzhou, et al.
Publicado: (2024)
A Large Language Model Powered Integrated Circuit Footprint Geometry Understanding
por: Wang, Yida, et al.
Publicado: (2025)
por: Wang, Yida, et al.
Publicado: (2025)
A Comprehensive Study of Multimodal Large Language Models for Image Quality Assessment
por: Wu, Tianhe, et al.
Publicado: (2024)
por: Wu, Tianhe, et al.
Publicado: (2024)
F-HOI: Toward Fine-grained Semantic-Aligned 3D Human-Object Interactions
por: Yang, Jie, et al.
Publicado: (2024)
por: Yang, Jie, et al.
Publicado: (2024)
UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation
por: Guo, Qin, et al.
Publicado: (2025)
por: Guo, Qin, et al.
Publicado: (2025)
WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning
por: Yang, Jie, et al.
Publicado: (2025)
por: Yang, Jie, et al.
Publicado: (2025)
Unveiling Typographic Deceptions: Insights of the Typographic Vulnerability in Large Vision-Language Model
por: Cheng, Hao, et al.
Publicado: (2024)
por: Cheng, Hao, et al.
Publicado: (2024)
Evaluating Attribute Comprehension in Large Vision-Language Models
por: Zhang, Haiwen, et al.
Publicado: (2024)
por: Zhang, Haiwen, et al.
Publicado: (2024)
You Only Learn One Query: Learning Unified Human Query for Single-Stage Multi-Person Multi-Task Human-Centric Perception
por: Jin, Sheng, et al.
Publicado: (2023)
por: Jin, Sheng, et al.
Publicado: (2023)
Pink: Unveiling the Power of Referential Comprehension for Multi-modal LLMs
por: Xuan, Shiyu, et al.
Publicado: (2023)
por: Xuan, Shiyu, et al.
Publicado: (2023)
Independently Keypoint Learning for Small Object Semantic Correspondence
por: Jin, Hailong, et al.
Publicado: (2024)
por: Jin, Hailong, et al.
Publicado: (2024)
PCKRF: Point Cloud Completion and Keypoint Refinement With Fusion Data for 6D Pose Estimation
por: Han, Yiheng, et al.
Publicado: (2022)
por: Han, Yiheng, et al.
Publicado: (2022)
Motion-X: A Large-scale 3D Expressive Whole-body Human Motion Dataset
por: Lin, Jing, et al.
Publicado: (2023)
por: Lin, Jing, et al.
Publicado: (2023)
LatentKeypointGAN: Controlling Images via Latent Keypoints
por: He, Xingzhe, et al.
Publicado: (2021)
por: He, Xingzhe, et al.
Publicado: (2021)
Multi-Stream Keypoint Attention Network for Sign Language Recognition and Translation
por: Guan, Mo, et al.
Publicado: (2024)
por: Guan, Mo, et al.
Publicado: (2024)
ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models
por: Gong, Bingchen, et al.
Publicado: (2024)
por: Gong, Bingchen, et al.
Publicado: (2024)
REVAL: A Comprehension Evaluation on Reliability and Values of Large Vision-Language Models
por: Zhang, Jie, et al.
Publicado: (2025)
por: Zhang, Jie, et al.
Publicado: (2025)
A Detector-oblivious Multi-arm Network for Keypoint Matching
por: Shen, Xuelun, et al.
Publicado: (2021)
por: Shen, Xuelun, et al.
Publicado: (2021)
MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models
por: Fu, Chaoyou, et al.
Publicado: (2023)
por: Fu, Chaoyou, et al.
Publicado: (2023)
Ejemplares similares
-
KptLLM++: Towards Generic Keypoint Comprehension with Large Language Model
por: Yang, Jie, et al.
Publicado: (2025) -
X-Pose: Detecting Any Keypoints
por: Yang, Jie, et al.
Publicado: (2023) -
F-LMM: Grounding Frozen Large Multimodal Models
por: Wu, Size, et al.
Publicado: (2024) -
Unlock the Power of Unlabeled Data in Language Driving Model
por: Wang, Chaoqun, et al.
Publicado: (2025) -
TCFormer: Visual Recognition via Token Clustering Transformer
por: Zeng, Wang, et al.
Publicado: (2024)