Contrastive Language-Image Learning with Augmented Textual Prompts for 3D/4D FER Using Vision-Language Model
Fuente:
arXiv
Guardado en:
| Autores principales: | Behzad, Muzammil, Zhao, Guoying |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Unsupervised Multiview Contrastive Language-Image Joint Learning with Pseudo-Labeled Prompts Via Vision-Language Model for 3D/4D Facial Expression Recognition
por: Behzad, Muzammil
Publicado: (2025)
por: Behzad, Muzammil
Publicado: (2025)
Self-Supervised Multi-View Representation Learning using Vision-Language Model for 3D/4D Facial Expression Recognition
por: Behzad, Muzammil
Publicado: (2025)
por: Behzad, Muzammil
Publicado: (2025)
Facial Emotion Learning with Text-Guided Multiview Fusion via Vision-Language Model for 3D/4D Facial Expression Recognition
por: Behzad, Muzammil
Publicado: (2025)
por: Behzad, Muzammil
Publicado: (2025)
Underwater Diffusion Attention Network with Contrastive Language-Image Joint Learning for Underwater Image Enhancement
por: Shaahid, Afrah, et al.
Publicado: (2025)
por: Shaahid, Afrah, et al.
Publicado: (2025)
Deformable Attentive Visual Enhancement for Referring Segmentation Using Vision-Language Model
por: Dalaq, Alaa, et al.
Publicado: (2025)
por: Dalaq, Alaa, et al.
Publicado: (2025)
Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model
por: AlJunaid, Reem, et al.
Publicado: (2025)
por: AlJunaid, Reem, et al.
Publicado: (2025)
Scaling Down to Scale Up: Towards Operationally-Efficient and Deployable Clinical Models via Cross-Modal Low-Rank Adaptation for Medical Vision-Language Models
por: Alzubaidi, Thuraya, et al.
Publicado: (2025)
por: Alzubaidi, Thuraya, et al.
Publicado: (2025)
SwinTF3D: A Lightweight Multimodal Fusion Approach for Text-Guided 3D Medical Image Segmentation
por: Khan, Hasan Faraz, et al.
Publicado: (2025)
por: Khan, Hasan Faraz, et al.
Publicado: (2025)
Prompt-Guided Patch UNet-VAE with Adversarial Supervision for Adrenal Gland Segmentation in Computed Tomography Medical Images
por: Ghouse, Hania, et al.
Publicado: (2025)
por: Ghouse, Hania, et al.
Publicado: (2025)
AquaDiff: Diffusion-Based Underwater Image Enhancement for Addressing Color Distortion
por: Shaahid, Afrah, et al.
Publicado: (2025)
por: Shaahid, Afrah, et al.
Publicado: (2025)
XAI-CLIP: ROI-Guided Perturbation Framework for Explainable Medical Image Segmentation in Multimodal Vision-Language Models
por: Alzubaidi, Thuraya, et al.
Publicado: (2026)
por: Alzubaidi, Thuraya, et al.
Publicado: (2026)
Generative Adversarial Synthesis and Deep Feature Discrimination of Brain Tumor MRI Images
por: Ali, Md Sumon, et al.
Publicado: (2025)
por: Ali, Md Sumon, et al.
Publicado: (2025)
LaCoVL-FER: Landmark-Guided Contrastive Learning Network with Vision-Language Enhancement for Facial Expression Recognition
por: Wang, Jiaxin, et al.
Publicado: (2026)
por: Wang, Jiaxin, et al.
Publicado: (2026)
Spatio-Semantic Expert Routing Architecture with Mixture-of-Experts for Referring Image Segmentation
por: Dalaq, Alaa, et al.
Publicado: (2026)
por: Dalaq, Alaa, et al.
Publicado: (2026)
MOSAIC: A Multi-View 2.5D Organ Slice Selector with Cross-Attentional Reasoning for Anatomically-Aware CT Localization in Medical Organ Segmentation
por: Ghouse, Hania, et al.
Publicado: (2025)
por: Ghouse, Hania, et al.
Publicado: (2025)
3D Aware Region Prompted Vision Language Model
por: Cheng, An-Chieh, et al.
Publicado: (2025)
por: Cheng, An-Chieh, et al.
Publicado: (2025)
DrFER: Learning Disentangled Representations for 3D Facial Expression Recognition
por: Li, Hebeizi, et al.
Publicado: (2024)
por: Li, Hebeizi, et al.
Publicado: (2024)
Slide-Level Prompt Learning with Vision Language Models for Few-Shot Multiple Instance Learning in Histopathology
por: Tomar, Devavrat, et al.
Publicado: (2025)
por: Tomar, Devavrat, et al.
Publicado: (2025)
Know3D: Prompting 3D Generation with Knowledge from Vision-Language Models
por: Chen, Wenyue, et al.
Publicado: (2026)
por: Chen, Wenyue, et al.
Publicado: (2026)
Near OOD Detection for Vision-Language Prompt Learning with Contrastive Logit Score
por: Jung, Myong Chol, et al.
Publicado: (2024)
por: Jung, Myong Chol, et al.
Publicado: (2024)
Mixture of Prompt Learning for Vision Language Models
por: Du, Yu, et al.
Publicado: (2024)
por: Du, Yu, et al.
Publicado: (2024)
Effectively Enhancing Vision Language Large Models by Prompt Augmentation and Caption Utilization
por: Zhao, Minyi, et al.
Publicado: (2024)
por: Zhao, Minyi, et al.
Publicado: (2024)
TAIJI: Textual Anchoring for Immunizing Jailbreak Images in Vision Language Models
por: Yin, Xiangyu, et al.
Publicado: (2025)
por: Yin, Xiangyu, et al.
Publicado: (2025)
Towards Robust 3D Pose Transfer with Adversarial Learning
por: Chen, Haoyu, et al.
Publicado: (2024)
por: Chen, Haoyu, et al.
Publicado: (2024)
From Graphs to Gates: DNS-HyXNet, A Lightweight and Deployable Sequential Model for Real-Time DNS Tunnel Detection
por: Ali, Faraz, et al.
Publicado: (2025)
por: Ali, Faraz, et al.
Publicado: (2025)
Steering Vision-Language Pre-trained Models for Incremental Face Presentation Attack Detection
por: Li, Haoze, et al.
Publicado: (2025)
por: Li, Haoze, et al.
Publicado: (2025)
Sculpting Holistic 3D Representation in Contrastive Language-Image-3D Pre-training
por: Gao, Yipeng, et al.
Publicado: (2023)
por: Gao, Yipeng, et al.
Publicado: (2023)
Active Prompt Learning in Vision Language Models
por: Bang, Jihwan, et al.
Publicado: (2023)
por: Bang, Jihwan, et al.
Publicado: (2023)
In the Era of Prompt Learning with Vision-Language Models
por: Jha, Ankit
Publicado: (2024)
por: Jha, Ankit
Publicado: (2024)
Better Tokens for Better 3D: Advancing Vision-Language Modeling in 3D Medical Imaging
por: Hamamci, Ibrahim Ethem, et al.
Publicado: (2025)
por: Hamamci, Ibrahim Ethem, et al.
Publicado: (2025)
Cross-Image Contrastive Decoding: Precise, Lossless Suppression of Language Priors in Large Vision-Language Models
por: Zhao, Jianfei, et al.
Publicado: (2025)
por: Zhao, Jianfei, et al.
Publicado: (2025)
Accelerating Conditional Prompt Learning via Masked Image Modeling for Vision-Language Models
por: Bui, Phuoc-Nguyen, et al.
Publicado: (2025)
por: Bui, Phuoc-Nguyen, et al.
Publicado: (2025)
GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models
por: Qi, Zhangyang, et al.
Publicado: (2025)
por: Qi, Zhangyang, et al.
Publicado: (2025)
AntifakePrompt: Prompt-Tuned Vision-Language Models are Fake Image Detectors
por: Chang, You-Ming, et al.
Publicado: (2023)
por: Chang, You-Ming, et al.
Publicado: (2023)
BiPrompt: Bilateral Prompt Optimization for Visual and Textual Debiasing in Vision-Language Models
por: Gupta, Sunny, et al.
Publicado: (2026)
por: Gupta, Sunny, et al.
Publicado: (2026)
Hallucination Augmented Contrastive Learning for Multimodal Large Language Model
por: Jiang, Chaoya, et al.
Publicado: (2023)
por: Jiang, Chaoya, et al.
Publicado: (2023)
P3T: Prototypical Point-level Prompt Tuning with Enhanced Generalization for 3D Vision-Language Models
por: Jung, Geunyoung, et al.
Publicado: (2026)
por: Jung, Geunyoung, et al.
Publicado: (2026)
VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction
por: Fan, Zhiwen, et al.
Publicado: (2025)
por: Fan, Zhiwen, et al.
Publicado: (2025)
Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models
por: Zhou, Shengchao, et al.
Publicado: (2025)
por: Zhou, Shengchao, et al.
Publicado: (2025)
Integrated Structural Prompt Learning for Vision-Language Models
por: Wang, Jiahui, et al.
Publicado: (2025)
por: Wang, Jiahui, et al.
Publicado: (2025)
Ejemplares similares
-
Unsupervised Multiview Contrastive Language-Image Joint Learning with Pseudo-Labeled Prompts Via Vision-Language Model for 3D/4D Facial Expression Recognition
por: Behzad, Muzammil
Publicado: (2025) -
Self-Supervised Multi-View Representation Learning using Vision-Language Model for 3D/4D Facial Expression Recognition
por: Behzad, Muzammil
Publicado: (2025) -
Facial Emotion Learning with Text-Guided Multiview Fusion via Vision-Language Model for 3D/4D Facial Expression Recognition
por: Behzad, Muzammil
Publicado: (2025) -
Underwater Diffusion Attention Network with Contrastive Language-Image Joint Learning for Underwater Image Enhancement
por: Shaahid, Afrah, et al.
Publicado: (2025) -
Deformable Attentive Visual Enhancement for Referring Segmentation Using Vision-Language Model
por: Dalaq, Alaa, et al.
Publicado: (2025)