Differentiable Prompt Learning for Vision Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Huang, Zhenhan, Pedapati, Tejaswini, Chen, Pin-Yu, Gao, Jianxi |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Modular Prompt Learning Improves Vision-Language Models
von: Huang, Zhenhan, et al.
Veröffentlicht: (2025)
von: Huang, Zhenhan, et al.
Veröffentlicht: (2025)
Intermediate Representations are Strong AI-Generated Image Detectors
von: Huang, Zhenhan, et al.
Veröffentlicht: (2026)
von: Huang, Zhenhan, et al.
Veröffentlicht: (2026)
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
von: Yang, Senqiao, et al.
Veröffentlicht: (2025)
von: Yang, Senqiao, et al.
Veröffentlicht: (2025)
Nemesis: Normalizing the Soft-prompt Vectors of Vision-Language Models
von: Fu, Shuai, et al.
Veröffentlicht: (2024)
von: Fu, Shuai, et al.
Veröffentlicht: (2024)
VisionZip: Longer is Better but Not Necessary in Vision Language Models
von: Yang, Senqiao, et al.
Veröffentlicht: (2024)
von: Yang, Senqiao, et al.
Veröffentlicht: (2024)
Prompting Medical Large Vision-Language Models to Diagnose Pathologies by Visual Question Answering
von: Guo, Danfeng, et al.
Veröffentlicht: (2024)
von: Guo, Danfeng, et al.
Veröffentlicht: (2024)
Pre-trained Vision-Language Models Learn Discoverable Visual Concepts
von: Zang, Yuan, et al.
Veröffentlicht: (2024)
von: Zang, Yuan, et al.
Veröffentlicht: (2024)
Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models
von: Huang, Chengyue, et al.
Veröffentlicht: (2025)
von: Huang, Chengyue, et al.
Veröffentlicht: (2025)
VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning
von: Luo, Run, et al.
Veröffentlicht: (2025)
von: Luo, Run, et al.
Veröffentlicht: (2025)
Vision-Language Model Based Handwriting Verification
von: Chauhan, Mihir, et al.
Veröffentlicht: (2024)
von: Chauhan, Mihir, et al.
Veröffentlicht: (2024)
C-TPT: Calibrated Test-Time Prompt Tuning for Vision-Language Models via Text Feature Dispersion
von: Yoon, Hee Suk, et al.
Veröffentlicht: (2024)
von: Yoon, Hee Suk, et al.
Veröffentlicht: (2024)
When Prompts Override Vision: Prompt-Induced Hallucinations in LVLMs
von: Khayatan, Pegah, et al.
Veröffentlicht: (2026)
von: Khayatan, Pegah, et al.
Veröffentlicht: (2026)
VisPlay: Self-Evolving Vision-Language Models from Images
von: He, Yicheng, et al.
Veröffentlicht: (2025)
von: He, Yicheng, et al.
Veröffentlicht: (2025)
Vision-DeepResearch Benchmark: Rethinking Visual and Textual Search for Multimodal Large Language Models
von: Zeng, Yu, et al.
Veröffentlicht: (2026)
von: Zeng, Yu, et al.
Veröffentlicht: (2026)
Weighted Multi-Prompt Learning with Description-free Large Language Model Distillation
von: Lee, Sua, et al.
Veröffentlicht: (2025)
von: Lee, Sua, et al.
Veröffentlicht: (2025)
MouSi: Poly-Visual-Expert Vision-Language Models
von: Fan, Xiaoran, et al.
Veröffentlicht: (2024)
von: Fan, Xiaoran, et al.
Veröffentlicht: (2024)
RIV: Recursive Introspection Mask Diffusion Vision Language Model
von: Li, YuQian, et al.
Veröffentlicht: (2025)
von: Li, YuQian, et al.
Veröffentlicht: (2025)
Rethinking Visual Prompting for Multimodal Large Language Models with External Knowledge
von: Lin, Yuanze, et al.
Veröffentlicht: (2024)
von: Lin, Yuanze, et al.
Veröffentlicht: (2024)
Analyzing the Roles of Language and Vision in Learning from Limited Data
von: Chen, Allison, et al.
Veröffentlicht: (2024)
von: Chen, Allison, et al.
Veröffentlicht: (2024)
Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement
von: Wang, Xiyao, et al.
Veröffentlicht: (2024)
von: Wang, Xiyao, et al.
Veröffentlicht: (2024)
Transferring Textual Preferences to Vision-Language Understanding through Model Merging
von: Li, Chen-An, et al.
Veröffentlicht: (2025)
von: Li, Chen-An, et al.
Veröffentlicht: (2025)
Detecting and Mitigating Hallucination in Large Vision Language Models via Fine-Grained AI Feedback
von: Xiao, Wenyi, et al.
Veröffentlicht: (2024)
von: Xiao, Wenyi, et al.
Veröffentlicht: (2024)
Exploring Transfer Learning in Medical Image Segmentation using Vision-Language Models
von: Poudel, Kanchan, et al.
Veröffentlicht: (2023)
von: Poudel, Kanchan, et al.
Veröffentlicht: (2023)
SceneVerse: Scaling 3D Vision-Language Learning for Grounded Scene Understanding
von: Jia, Baoxiong, et al.
Veröffentlicht: (2024)
von: Jia, Baoxiong, et al.
Veröffentlicht: (2024)
A Novel Framework for Automated Explain Vision Model Using Vision-Language Models
von: Nguyen, Phu-Vinh, et al.
Veröffentlicht: (2025)
von: Nguyen, Phu-Vinh, et al.
Veröffentlicht: (2025)
Imperfect Vision Encoders: Efficient and Robust Tuning for Vision-Language Models
von: Panos, Aristeidis, et al.
Veröffentlicht: (2024)
von: Panos, Aristeidis, et al.
Veröffentlicht: (2024)
Unified Triplet-Level Hallucination Evaluation for Large Vision-Language Models
von: Wu, Junjie, et al.
Veröffentlicht: (2024)
von: Wu, Junjie, et al.
Veröffentlicht: (2024)
SpecPL: Disentangling Spectral Granularity for Prompt Learning
von: Zhou, Jingtao, et al.
Veröffentlicht: (2026)
von: Zhou, Jingtao, et al.
Veröffentlicht: (2026)
LLaVE: Large Language and Vision Embedding Models with Hardness-Weighted Contrastive Learning
von: Lan, Zhibin, et al.
Veröffentlicht: (2025)
von: Lan, Zhibin, et al.
Veröffentlicht: (2025)
Euclid's Gift: Enhancing Spatial Perception and Reasoning in Vision-Language Models via Geometric Surrogate Tasks
von: Lian, Shijie, et al.
Veröffentlicht: (2025)
von: Lian, Shijie, et al.
Veröffentlicht: (2025)
How Culturally Aware are Vision-Language Models?
von: Burda-Lassen, Olena, et al.
Veröffentlicht: (2024)
von: Burda-Lassen, Olena, et al.
Veröffentlicht: (2024)
Compositional Chain-of-Thought Prompting for Large Multimodal Models
von: Mitra, Chancharik, et al.
Veröffentlicht: (2023)
von: Mitra, Chancharik, et al.
Veröffentlicht: (2023)
AdaptVision: Efficient Vision-Language Models via Adaptive Visual Acquisition
von: Lin, Zichuan, et al.
Veröffentlicht: (2025)
von: Lin, Zichuan, et al.
Veröffentlicht: (2025)
Robust Prompt Optimization for Defending Language Models Against Jailbreaking Attacks
von: Zhou, Andy, et al.
Veröffentlicht: (2024)
von: Zhou, Andy, et al.
Veröffentlicht: (2024)
Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning
von: Zhai, Yuexiang, et al.
Veröffentlicht: (2024)
von: Zhai, Yuexiang, et al.
Veröffentlicht: (2024)
Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models
von: Huang, Wenxuan, et al.
Veröffentlicht: (2025)
von: Huang, Wenxuan, et al.
Veröffentlicht: (2025)
Mordal: Automated Pretrained Model Selection for Vision Language Models
von: He, Shiqi, et al.
Veröffentlicht: (2025)
von: He, Shiqi, et al.
Veröffentlicht: (2025)
Tree of Attributes Prompt Learning for Vision-Language Models
von: Ding, Tong, et al.
Veröffentlicht: (2024)
von: Ding, Tong, et al.
Veröffentlicht: (2024)
Internal Activation Revision: Safeguarding Vision Language Models Without Parameter Update
von: Li, Qing, et al.
Veröffentlicht: (2025)
von: Li, Qing, et al.
Veröffentlicht: (2025)
Modeling Caption Diversity in Contrastive Vision-Language Pretraining
von: Lavoie, Samuel, et al.
Veröffentlicht: (2024)
von: Lavoie, Samuel, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Modular Prompt Learning Improves Vision-Language Models
von: Huang, Zhenhan, et al.
Veröffentlicht: (2025) -
Intermediate Representations are Strong AI-Generated Image Detectors
von: Huang, Zhenhan, et al.
Veröffentlicht: (2026) -
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
von: Yang, Senqiao, et al.
Veröffentlicht: (2025) -
Nemesis: Normalizing the Soft-prompt Vectors of Vision-Language Models
von: Fu, Shuai, et al.
Veröffentlicht: (2024) -
VisionZip: Longer is Better but Not Necessary in Vision Language Models
von: Yang, Senqiao, et al.
Veröffentlicht: (2024)