CapeLLM: Support-Free Category-Agnostic Pose Estimation with Multimodal Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Kim, Junho, Chung, Hyungjin, Kim, Byung-Hoon |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Video Parallel Scaling: Aggregating Diverse Frame Subsets for VideoLLMs
by: Chung, Hyungjin, et al.
Published: (2025)
by: Chung, Hyungjin, et al.
Published: (2025)
ContextMRI: Enhancing Compressed Sensing MRI through Metadata Conditioning
by: Chung, Hyungjin, et al.
Published: (2025)
by: Chung, Hyungjin, et al.
Published: (2025)
CAPA: Contribution-Aware Pruning and FFN Approximation for Efficient Large Vision-Language Models
by: Jha, Samyak, et al.
Published: (2026)
by: Jha, Samyak, et al.
Published: (2026)
CapeNext: Rethinking and Refining Dynamic Support Information for Category-Agnostic Pose Estimation
by: Zhu, Yu, et al.
Published: (2025)
by: Zhu, Yu, et al.
Published: (2025)
Derivative-Free Diffusion Manifold-Constrained Gradient for Unified XAI
by: Kim, Won Jun, et al.
Published: (2024)
by: Kim, Won Jun, et al.
Published: (2024)
GenCape: Structure-Inductive Generative Modeling for Category-Agnostic Pose Estimation
by: Rao, Jiyong, et al.
Published: (2026)
by: Rao, Jiyong, et al.
Published: (2026)
VideoRFSplat: Direct Scene-Level Text-to-3D Gaussian Splatting Generation with Flexible Pose and Multi-View Joint Modeling
by: Go, Hyojun, et al.
Published: (2025)
by: Go, Hyojun, et al.
Published: (2025)
ACDC: Autoregressive Coherent Multimodal Generation using Diffusion Correction
by: Chung, Hyungjin, et al.
Published: (2024)
by: Chung, Hyungjin, et al.
Published: (2024)
SteerX: Creating Any Camera-Free 3D and 4D Scenes with Geometric Steering
by: Park, Byeongjun, et al.
Published: (2025)
by: Park, Byeongjun, et al.
Published: (2025)
CFG++: Manifold-constrained Classifier Free Guidance for Diffusion Models
by: Chung, Hyungjin, et al.
Published: (2024)
by: Chung, Hyungjin, et al.
Published: (2024)
Align Your Query: Representation Alignment for Multimodality Medical Object Detection
by: Seo, Ara, et al.
Published: (2025)
by: Seo, Ara, et al.
Published: (2025)
CapeX: Category-Agnostic Pose Estimation from Textual Point Explanation
by: Rusanovsky, Matan, et al.
Published: (2024)
by: Rusanovsky, Matan, et al.
Published: (2024)
TroL: Traversal of Layers for Large Language and Vision Models
by: Lee, Byung-Kwan, et al.
Published: (2024)
by: Lee, Byung-Kwan, et al.
Published: (2024)
ReDirector: Creating Any-Length Video Retakes with Rotary Camera Encoding
by: Park, Byeongjun, et al.
Published: (2025)
by: Park, Byeongjun, et al.
Published: (2025)
Deep Diffusion Image Prior for Efficient OOD Adaptation in 3D Inverse Problems
by: Chung, Hyungjin, et al.
Published: (2024)
by: Chung, Hyungjin, et al.
Published: (2024)
Causal Unsupervised Semantic Segmentation
by: Kim, Junho, et al.
Published: (2023)
by: Kim, Junho, et al.
Published: (2023)
Generating Human Motion Videos using a Cascaded Text-to-Video Framework
by: Nam, Hyelin, et al.
Published: (2025)
by: Nam, Hyelin, et al.
Published: (2025)
Category-Agnostic Pose Estimation for Point Clouds
by: Liu, Bowen, et al.
Published: (2024)
by: Liu, Bowen, et al.
Published: (2024)
Decomposed Diffusion Sampler for Accelerating Large-Scale Inverse Problems
by: Chung, Hyungjin, et al.
Published: (2023)
by: Chung, Hyungjin, et al.
Published: (2023)
Amortized Posterior Sampling with Diffusion Prior Distillation
by: Mammadov, Abbas, et al.
Published: (2024)
by: Mammadov, Abbas, et al.
Published: (2024)
SplatPose & Detect: Pose-Agnostic 3D Anomaly Detection
by: Kruse, Mathis, et al.
Published: (2024)
by: Kruse, Mathis, et al.
Published: (2024)
Regularization by Texts for Latent Diffusion Inverse Solvers
by: Kim, Jeongsol, et al.
Published: (2023)
by: Kim, Jeongsol, et al.
Published: (2023)
Edge Weight Prediction For Category-Agnostic Pose Estimation
by: Hirschorn, Or, et al.
Published: (2024)
by: Hirschorn, Or, et al.
Published: (2024)
Isometric Representation Learning for Disentangled Latent Space of Diffusion Models
by: Hahm, Jaehoon, et al.
Published: (2024)
by: Hahm, Jaehoon, et al.
Published: (2024)
Contrastive CFG: Improving CFG in Diffusion Models by Contrasting Positive and Negative Concepts
by: Chang, Jinho, et al.
Published: (2024)
by: Chang, Jinho, et al.
Published: (2024)
VG3T: Visual Geometry Grounded Gaussian Transformer
by: Kim, Junho, et al.
Published: (2025)
by: Kim, Junho, et al.
Published: (2025)
Meta-Point Learning and Refining for Category-Agnostic Pose Estimation
by: Chen, Junjie, et al.
Published: (2024)
by: Chen, Junjie, et al.
Published: (2024)
A Graph-Based Approach for Category-Agnostic Pose Estimation
by: Hirschorn, Or, et al.
Published: (2023)
by: Hirschorn, Or, et al.
Published: (2023)
SCAPE: A Simple and Strong Category-Agnostic Pose Estimator
by: Liang, Yujia, et al.
Published: (2024)
by: Liang, Yujia, et al.
Published: (2024)
Multimodal Generalized Category Discovery
by: Su, Yuchang, et al.
Published: (2024)
by: Su, Yuchang, et al.
Published: (2024)
Learning 3D Scene Analogies with Neural Contextual Scene Maps
by: Kim, Junho, et al.
Published: (2025)
by: Kim, Junho, et al.
Published: (2025)
Mathematical Foundation and Corrections for Full Range Head Pose Estimation
by: Hu, Huei-Chung, et al.
Published: (2024)
by: Hu, Huei-Chung, et al.
Published: (2024)
Octopus: History-Free Gradient Orthogonalization for Continual Learning in Multimodal Large Language Models
by: Liu, Yuehao, et al.
Published: (2026)
by: Liu, Yuehao, et al.
Published: (2026)
Diffusion Posterior Sampling for General Noisy Inverse Problems
by: Chung, Hyungjin, et al.
Published: (2022)
by: Chung, Hyungjin, et al.
Published: (2022)
Survey of Large Multimodal Model Datasets, Application Categories and Taxonomy
by: Pattnayak, Priyaranjan, et al.
Published: (2024)
by: Pattnayak, Priyaranjan, et al.
Published: (2024)
Steerable Conditional Diffusion for Out-of-Distribution Adaptation in Medical Image Reconstruction
by: Barbano, Riccardo, et al.
Published: (2023)
by: Barbano, Riccardo, et al.
Published: (2023)
Visual Prompting in Multimodal Large Language Models: A Survey
by: Wu, Junda, et al.
Published: (2024)
by: Wu, Junda, et al.
Published: (2024)
Accelerating Video Inverse Problem Solvers with Autoregressive Diffusion Models
by: Kwon, Taesung, et al.
Published: (2026)
by: Kwon, Taesung, et al.
Published: (2026)
Improving Diffusion Models for Inverse Problems using Manifold Constraints
by: Chung, Hyungjin, et al.
Published: (2022)
by: Chung, Hyungjin, et al.
Published: (2022)
ContactArt: Learning 3D Interaction Priors for Category-level Articulated Object and Hand Poses Estimation
by: Zhu, Zehao, et al.
Published: (2023)
by: Zhu, Zehao, et al.
Published: (2023)
Similar Items
-
Video Parallel Scaling: Aggregating Diverse Frame Subsets for VideoLLMs
by: Chung, Hyungjin, et al.
Published: (2025) -
ContextMRI: Enhancing Compressed Sensing MRI through Metadata Conditioning
by: Chung, Hyungjin, et al.
Published: (2025) -
CAPA: Contribution-Aware Pruning and FFN Approximation for Efficient Large Vision-Language Models
by: Jha, Samyak, et al.
Published: (2026) -
CapeNext: Rethinking and Refining Dynamic Support Information for Category-Agnostic Pose Estimation
by: Zhu, Yu, et al.
Published: (2025) -
Derivative-Free Diffusion Manifold-Constrained Gradient for Unified XAI
by: Kim, Won Jun, et al.
Published: (2024)