HPE-CogVLM: Advancing Vision Language Models with a Head Pose Grounding Task
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tian, Yu, Shao, Tianqi, Demizu, Tsukasa, Wu, Xuyang, Wu, Hsin-Tai |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CogVLM: Visual Expert for Pretrained Language Models
par: Wang, Weihan, et autres
Publié: (2023)
par: Wang, Weihan, et autres
Publié: (2023)
CogVLM2: Visual Language Models for Image and Video Understanding
par: Hong, Wenyi, et autres
Publié: (2024)
par: Hong, Wenyi, et autres
Publié: (2024)
Evaluating Fairness in Large Vision-Language Models Across Diverse Demographic Attributes and Prompts
par: Wu, Xuyang, et autres
Publié: (2024)
par: Wu, Xuyang, et autres
Publié: (2024)
Full-range Head Pose Geometric Data Augmentations
par: Hu, Huei-Chung, et autres
Publié: (2024)
par: Hu, Huei-Chung, et autres
Publié: (2024)
Mathematical Foundation and Corrections for Full Range Head Pose Estimation
par: Hu, Huei-Chung, et autres
Publié: (2024)
par: Hu, Huei-Chung, et autres
Publié: (2024)
VGGT-HPE: Reframing Head Pose Estimation as Relative Pose Prediction
par: Vasileiou, Vasiliki, et autres
Publié: (2026)
par: Vasileiou, Vasiliki, et autres
Publié: (2026)
CLERF: Contrastive LEaRning for Full Range Head Pose Estimation
par: Wei, Ting-Ruen, et autres
Publié: (2024)
par: Wei, Ting-Ruen, et autres
Publié: (2024)
G$^2$VLM: Geometry Grounded Vision Language Model with Unified 3D Reconstruction and Spatial Reasoning
par: Hu, Wenbo, et autres
Publié: (2025)
par: Hu, Wenbo, et autres
Publié: (2025)
Praxis-VLM: Vision-Grounded Decision Making via Text-Driven Reinforcement Learning
par: Hu, Zhe, et autres
Publié: (2025)
par: Hu, Zhe, et autres
Publié: (2025)
NLML-HPE: Head Pose Estimation with Limited Data via Manifold Learning
par: Ghafourian, Mahdi, et autres
Publié: (2025)
par: Ghafourian, Mahdi, et autres
Publié: (2025)
From Behavioral Performance to Internal Competence: Interpreting Vision-Language Models with VLM-Lens
par: Sheta, Hala, et autres
Publié: (2025)
par: Sheta, Hala, et autres
Publié: (2025)
From Heads to Neurons: Causal Attribution and Steering in Multi-Task Vision-Language Models
par: Wang, Qidong, et autres
Publié: (2026)
par: Wang, Qidong, et autres
Publié: (2026)
SleepVLM: Explainable and Rule-Grounded Sleep Staging via a Vision-Language Model
par: Deng, Guifeng, et autres
Publié: (2026)
par: Deng, Guifeng, et autres
Publié: (2026)
VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks
par: Jiang, Ziyan, et autres
Publié: (2024)
par: Jiang, Ziyan, et autres
Publié: (2024)
A Joint Study of Phrase Grounding and Task Performance in Vision and Language Models
par: Kojima, Noriyuki, et autres
Publié: (2023)
par: Kojima, Noriyuki, et autres
Publié: (2023)
OViP: Online Vision-Language Preference Learning for VLM Hallucination
par: Liu, Shujun, et autres
Publié: (2025)
par: Liu, Shujun, et autres
Publié: (2025)
Ground-level Viewpoint Vision-and-Language Navigation in Continuous Environments
par: Li, Zerui, et autres
Publié: (2025)
par: Li, Zerui, et autres
Publié: (2025)
CogCoM: A Visual Language Model with Chain-of-Manipulations Reasoning
par: Qi, Ji, et autres
Publié: (2024)
par: Qi, Ji, et autres
Publié: (2024)
Systematic Reward Gap Optimization for Mitigating VLM Hallucinations
par: He, Lehan, et autres
Publié: (2024)
par: He, Lehan, et autres
Publié: (2024)
SCoPE VLM: Selective Context Processing for Efficient Document Navigation in Vision-Language Models
par: Lim, Gyubeum, et autres
Publié: (2025)
par: Lim, Gyubeum, et autres
Publié: (2025)
VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction
par: Fan, Zhiwen, et autres
Publié: (2025)
par: Fan, Zhiwen, et autres
Publié: (2025)
Nüwa: Mending the Spatial Integrity Torn by VLM Token Pruning
par: Huang, Yihong, et autres
Publié: (2026)
par: Huang, Yihong, et autres
Publié: (2026)
PatientVLM Meets DocVLM: Pre-Consultation Dialogue Between Vision-Language Models for Efficient Diagnosis
par: Lokesh, K, et autres
Publié: (2026)
par: Lokesh, K, et autres
Publié: (2026)
Leveraging Open Knowledge for Advancing Task Expertise in Large Language Models
par: Yang, Yuncheng, et autres
Publié: (2024)
par: Yang, Yuncheng, et autres
Publié: (2024)
VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model
par: Shen, Haozhan, et autres
Publié: (2025)
par: Shen, Haozhan, et autres
Publié: (2025)
SynthVLM: Towards High-Quality and Efficient Synthesis of Image-Caption Datasets for Vision-Language Models
par: Liu, Zheng, et autres
Publié: (2024)
par: Liu, Zheng, et autres
Publié: (2024)
Vision-Language Models Mistake Head Orientation for Gaze Direction: Nonverbal Conversation Cues
par: Zhang, Zory, et autres
Publié: (2025)
par: Zhang, Zory, et autres
Publié: (2025)
GeoDANO: Geometric VLM with Domain Agnostic Vision Encoder
par: Cho, Seunghyuk, et autres
Publié: (2025)
par: Cho, Seunghyuk, et autres
Publié: (2025)
Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning
par: Zhang, Di, et autres
Publié: (2024)
par: Zhang, Di, et autres
Publié: (2024)
BinaryHPE: 3D Human Pose and Shape Estimation via Binarization
par: Li, Zhiteng, et autres
Publié: (2023)
par: Li, Zhiteng, et autres
Publié: (2023)
Leopard: A Vision Language Model For Text-Rich Multi-Image Tasks
par: Jia, Mengzhao, et autres
Publié: (2024)
par: Jia, Mengzhao, et autres
Publié: (2024)
Allegory of the Cave: Measurement-Grounded Vision-Language Learning
par: Xu, Kepeng, et autres
Publié: (2026)
par: Xu, Kepeng, et autres
Publié: (2026)
MHA2MLA-VLM: Enabling DeepSeek's Economical Multi-Head Latent Attention across Vision-Language Models
par: Fan, Xiaoran, et autres
Publié: (2026)
par: Fan, Xiaoran, et autres
Publié: (2026)
ReVision: A Dataset and Baseline VLM for Privacy-Preserving Task-Oriented Visual Instruction Rewriting
par: Mishra, Abhijit, et autres
Publié: (2025)
par: Mishra, Abhijit, et autres
Publié: (2025)
Enhancing Abnormality Grounding for Vision Language Models with Knowledge Descriptions
par: Li, Jun, et autres
Publié: (2025)
par: Li, Jun, et autres
Publié: (2025)
Show and Guide: Instructional-Plan Grounded Vision and Language Model
par: Glória-Silva, Diogo, et autres
Publié: (2024)
par: Glória-Silva, Diogo, et autres
Publié: (2024)
Evaluation and Enhancement of Semantic Grounding in Large Vision-Language Models
par: Lu, Jiaying, et autres
Publié: (2023)
par: Lu, Jiaying, et autres
Publié: (2023)
Vision-Flan: Scaling Human-Labeled Tasks in Visual Instruction Tuning
par: Xu, Zhiyang, et autres
Publié: (2024)
par: Xu, Zhiyang, et autres
Publié: (2024)
MIRL: Mutual Information-Guided Reinforcement Learning for Vision-Language Models
par: Zhang, Yin, et autres
Publié: (2026)
par: Zhang, Yin, et autres
Publié: (2026)
HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models
par: Guan, Tianrui, et autres
Publié: (2023)
par: Guan, Tianrui, et autres
Publié: (2023)
Documents similaires
-
CogVLM: Visual Expert for Pretrained Language Models
par: Wang, Weihan, et autres
Publié: (2023) -
CogVLM2: Visual Language Models for Image and Video Understanding
par: Hong, Wenyi, et autres
Publié: (2024) -
Evaluating Fairness in Large Vision-Language Models Across Diverse Demographic Attributes and Prompts
par: Wu, Xuyang, et autres
Publié: (2024) -
Full-range Head Pose Geometric Data Augmentations
par: Hu, Huei-Chung, et autres
Publié: (2024) -
Mathematical Foundation and Corrections for Full Range Head Pose Estimation
par: Hu, Huei-Chung, et autres
Publié: (2024)