PromptSync: Bridging Domain Gaps in Vision-Language Models through Class-Aware Prototype Alignment and Discrimination
Fuente:
arXiv
Guardado en:
| Autor principal: | Khandelwal, Anant |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
RePoseDM: Recurrent Pose Alignment and Gradient Guidance for Pose Guided Image Synthesis
por: Khandelwal, Anant
Publicado: (2023)
por: Khandelwal, Anant
Publicado: (2023)
FloCoDe: Unbiased Dynamic Scene Graph Generation with Temporal Consistency and Correlation Debiasing
por: Khandelwal, Anant
Publicado: (2023)
por: Khandelwal, Anant
Publicado: (2023)
FlexiClip: Locality-Preserving Free-Form Character Animation
por: Khandelwal, Anant
Publicado: (2025)
por: Khandelwal, Anant
Publicado: (2025)
EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training
por: Du, Yiyang, et al.
Publicado: (2026)
por: Du, Yiyang, et al.
Publicado: (2026)
MSR-Align: Policy-Grounded Multimodal Alignment for Safety-Aware Reasoning in Vision-Language Models
por: Xia, Yinan, et al.
Publicado: (2025)
por: Xia, Yinan, et al.
Publicado: (2025)
Text Prompt Injection of Vision Language Models
por: Zhu, Ruizhe
Publicado: (2025)
por: Zhu, Ruizhe
Publicado: (2025)
Bridging the Missing-Modality Gap: Improving Text-Only Calibration of Vision Language Models
por: Kim, Mingyeong, et al.
Publicado: (2026)
por: Kim, Mingyeong, et al.
Publicado: (2026)
Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models
por: Stogiannidis, Ilias, et al.
Publicado: (2025)
por: Stogiannidis, Ilias, et al.
Publicado: (2025)
The Abstraction Gap in Vision-Language Causal Reasoning
por: Hoang, Chinh, et al.
Publicado: (2026)
por: Hoang, Chinh, et al.
Publicado: (2026)
ProGAL-VLA: Grounded Alignment through Prospective Reasoning in Vision-Language-Action Models
por: Darabi, Nastaran, et al.
Publicado: (2026)
por: Darabi, Nastaran, et al.
Publicado: (2026)
HalluShift++: Bridging Language and Vision through Internal Representation Shifts for Hierarchical Hallucinations in MLLMs
por: Nath, Sujoy, et al.
Publicado: (2025)
por: Nath, Sujoy, et al.
Publicado: (2025)
Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap
por: Xu, Yige, et al.
Publicado: (2026)
por: Xu, Yige, et al.
Publicado: (2026)
CAST: Cross-modal Alignment Similarity Test for Vision Language Models
por: Dagan, Gautier, et al.
Publicado: (2024)
por: Dagan, Gautier, et al.
Publicado: (2024)
TuneVLSeg: Prompt Tuning Benchmark for Vision-Language Segmentation Models
por: Adhikari, Rabin, et al.
Publicado: (2024)
por: Adhikari, Rabin, et al.
Publicado: (2024)
BiomedCoOp: Learning to Prompt for Biomedical Vision-Language Models
por: Koleilat, Taha, et al.
Publicado: (2024)
por: Koleilat, Taha, et al.
Publicado: (2024)
Layer-wise Alignment: Examining Safety Alignment Across Image Encoder Layers in Vision Language Models
por: Bachu, Saketh, et al.
Publicado: (2024)
por: Bachu, Saketh, et al.
Publicado: (2024)
ViSpec: Accelerating Vision-Language Models with Vision-Aware Speculative Decoding
por: Kang, Jialiang, et al.
Publicado: (2025)
por: Kang, Jialiang, et al.
Publicado: (2025)
Guiding Medical Vision-Language Models with Explicit Visual Prompts: Framework Design and Comprehensive Exploration of Prompt Variations
por: Zhu, Kangyu, et al.
Publicado: (2025)
por: Zhu, Kangyu, et al.
Publicado: (2025)
Class-Aware Prototype Learning with Negative Contrast for Test-Time Adaptation of Vision-Language Models
por: Qiao, Xiaozhen, et al.
Publicado: (2025)
por: Qiao, Xiaozhen, et al.
Publicado: (2025)
AlignMMBench: Evaluating Chinese Multimodal Alignment in Large Vision-Language Models
por: Wu, Yuhang, et al.
Publicado: (2024)
por: Wu, Yuhang, et al.
Publicado: (2024)
MAGIC: Multimodal Alignment & Grounding-aware Instruction Coreset for Vision-Language Models
por: Biswas, Shristi Das, et al.
Publicado: (2026)
por: Biswas, Shristi Das, et al.
Publicado: (2026)
HiMo-CLIP: Modeling Semantic Hierarchy and Monotonicity in Vision-Language Alignment
por: Wu, Ruijia, et al.
Publicado: (2025)
por: Wu, Ruijia, et al.
Publicado: (2025)
HEED: Density-Weighted Residual Alignment for Hybrid Vision-Language Model Distillation
por: Liang, Yihao, et al.
Publicado: (2026)
por: Liang, Yihao, et al.
Publicado: (2026)
Text-Printed Image: Bridging the Image-Text Modality Gap for Text-centric Training of Large Vision-Language Models
por: Yamabe, Shojiro, et al.
Publicado: (2025)
por: Yamabe, Shojiro, et al.
Publicado: (2025)
VLPose: Bridging the Domain Gap in Pose Estimation with Language-Vision Tuning
por: Li, Jingyao, et al.
Publicado: (2024)
por: Li, Jingyao, et al.
Publicado: (2024)
Fine-Grained Verifiers: Preference Modeling as Next-token Prediction in Vision-Language Alignment
por: Cui, Chenhang, et al.
Publicado: (2024)
por: Cui, Chenhang, et al.
Publicado: (2024)
Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate
por: Huang, Qidong, et al.
Publicado: (2024)
por: Huang, Qidong, et al.
Publicado: (2024)
Evaluating Fairness in Large Vision-Language Models Across Diverse Demographic Attributes and Prompts
por: Wu, Xuyang, et al.
Publicado: (2024)
por: Wu, Xuyang, et al.
Publicado: (2024)
From Reasoning to Pixels: Benchmarking the Alignment Gap in Unified Multimodal Models
por: Yang, Cheng, et al.
Publicado: (2026)
por: Yang, Cheng, et al.
Publicado: (2026)
Large Vision-Language Model Alignment and Misalignment: A Survey Through the Lens of Explainability
por: Shu, Dong, et al.
Publicado: (2025)
por: Shu, Dong, et al.
Publicado: (2025)
ESsEN: Training Compact Discriminative Vision-Language Transformers in a Low-Resource Setting
por: Fields, Clayton, et al.
Publicado: (2026)
por: Fields, Clayton, et al.
Publicado: (2026)
Fusion of Domain-Adapted Vision and Language Models for Medical Visual Question Answering
por: Ha, Cuong Nhat, et al.
Publicado: (2024)
por: Ha, Cuong Nhat, et al.
Publicado: (2024)
Patch-Prompt Aligned Bayesian Prompt Tuning for Vision-Language Models
por: Liu, Xinyang, et al.
Publicado: (2023)
por: Liu, Xinyang, et al.
Publicado: (2023)
Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization
por: Song, Yuhang, et al.
Publicado: (2024)
por: Song, Yuhang, et al.
Publicado: (2024)
VLFeedback: A Large-Scale AI Feedback Dataset for Large Vision-Language Models Alignment
por: Li, Lei, et al.
Publicado: (2024)
por: Li, Lei, et al.
Publicado: (2024)
Real-world Instance-specific Image Goal Navigation: Bridging Domain Gaps via Contrastive Learning
por: Sakaguchi, Taichi, et al.
Publicado: (2024)
por: Sakaguchi, Taichi, et al.
Publicado: (2024)
IPO: Interpretable Prompt Optimization for Vision-Language Models
por: Du, Yingjun, et al.
Publicado: (2024)
por: Du, Yingjun, et al.
Publicado: (2024)
SharpZO: Hybrid Sharpness-Aware Vision Language Model Prompt Tuning via Forward-Only Passes
por: Yang, Yifan, et al.
Publicado: (2025)
por: Yang, Yifan, et al.
Publicado: (2025)
Pseudo-Prompt Generating in Pre-trained Vision-Language Models for Multi-Label Medical Image Classification
por: Ye, Yaoqin, et al.
Publicado: (2024)
por: Ye, Yaoqin, et al.
Publicado: (2024)
Bridging the Domain Gap for Flight-Ready Spaceborne Vision
por: Park, Tae Ha, et al.
Publicado: (2024)
por: Park, Tae Ha, et al.
Publicado: (2024)
Ejemplares similares
-
RePoseDM: Recurrent Pose Alignment and Gradient Guidance for Pose Guided Image Synthesis
por: Khandelwal, Anant
Publicado: (2023) -
FloCoDe: Unbiased Dynamic Scene Graph Generation with Temporal Consistency and Correlation Debiasing
por: Khandelwal, Anant
Publicado: (2023) -
FlexiClip: Locality-Preserving Free-Form Character Animation
por: Khandelwal, Anant
Publicado: (2025) -
EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training
por: Du, Yiyang, et al.
Publicado: (2026) -
MSR-Align: Policy-Grounded Multimodal Alignment for Safety-Aware Reasoning in Vision-Language Models
por: Xia, Yinan, et al.
Publicado: (2025)