Weighted Multi-Prompt Learning with Description-free Large Language Model Distillation
Fuente:
arXiv
Guardado en:
| Autores principales: | Lee, Sua, Shin, Kyubum, Park, Jung Ho |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Separated Inter/Intra-Modal Fusion Prompts for Compositional Zero-Shot Learning
por: Jung, Sua
Publicado: (2025)
por: Jung, Sua
Publicado: (2025)
MM-JudgeBias: A Benchmark for Evaluating Compositional Biases in MLLM-as-a-Judge
por: Lee, Sua, et al.
Publicado: (2026)
por: Lee, Sua, et al.
Publicado: (2026)
By My Eyes: Grounding Multimodal Large Language Models with Sensor Data via Visual Prompting
por: Yoon, Hyungjun, et al.
Publicado: (2024)
por: Yoon, Hyungjun, et al.
Publicado: (2024)
LLaVE: Large Language and Vision Embedding Models with Hardness-Weighted Contrastive Learning
por: Lan, Zhibin, et al.
Publicado: (2025)
por: Lan, Zhibin, et al.
Publicado: (2025)
Semantically-Prompted Language Models Improve Visual Descriptions
por: Ogezi, Michael, et al.
Publicado: (2023)
por: Ogezi, Michael, et al.
Publicado: (2023)
Differentiable Prompt Learning for Vision Language Models
por: Huang, Zhenhan, et al.
Publicado: (2024)
por: Huang, Zhenhan, et al.
Publicado: (2024)
Bayesian Principles Improve Prompt Learning In Vision-Language Models
por: Kim, Mingyu, et al.
Publicado: (2025)
por: Kim, Mingyu, et al.
Publicado: (2025)
ViP-LLaVA: Making Large Multimodal Models Understand Arbitrary Visual Prompts
por: Cai, Mu, et al.
Publicado: (2023)
por: Cai, Mu, et al.
Publicado: (2023)
Rethinking Visual Prompting for Multimodal Large Language Models with External Knowledge
por: Lin, Yuanze, et al.
Publicado: (2024)
por: Lin, Yuanze, et al.
Publicado: (2024)
MINR: Implicit Neural Representations with Masked Image Modelling
por: Lee, Sua, et al.
Publicado: (2025)
por: Lee, Sua, et al.
Publicado: (2025)
Prompting Medical Large Vision-Language Models to Diagnose Pathologies by Visual Question Answering
por: Guo, Danfeng, et al.
Publicado: (2024)
por: Guo, Danfeng, et al.
Publicado: (2024)
ERGO: Efficient High-Resolution Visual Understanding for Vision-Language Models
por: Lee, Jewon, et al.
Publicado: (2025)
por: Lee, Jewon, et al.
Publicado: (2025)
Large Language Models can Share Images, Too!
por: Lee, Young-Jun, et al.
Publicado: (2023)
por: Lee, Young-Jun, et al.
Publicado: (2023)
VLind-Bench: Measuring Language Priors in Large Vision-Language Models
por: Lee, Kang-il, et al.
Publicado: (2024)
por: Lee, Kang-il, et al.
Publicado: (2024)
Meta-Adaptive Prompt Distillation for Few-Shot Visual Question Answering
por: Gupta, Akash, et al.
Publicado: (2025)
por: Gupta, Akash, et al.
Publicado: (2025)
Mitigating Hallucinations in Large Vision-Language Models via Summary-Guided Decoding
por: Min, Kyungmin, et al.
Publicado: (2024)
por: Min, Kyungmin, et al.
Publicado: (2024)
Compositional Chain-of-Thought Prompting for Large Multimodal Models
por: Mitra, Chancharik, et al.
Publicado: (2023)
por: Mitra, Chancharik, et al.
Publicado: (2023)
Promptception: How Sensitive Are Large Multimodal Models to Prompts?
por: Ismithdeen, Mohamed Insaf, et al.
Publicado: (2025)
por: Ismithdeen, Mohamed Insaf, et al.
Publicado: (2025)
REMONI: An Autonomous System Integrating Wearables and Multimodal Large Language Models for Enhanced Remote Health Monitoring
por: Ho, Thanh Cong, et al.
Publicado: (2025)
por: Ho, Thanh Cong, et al.
Publicado: (2025)
Black-Box Visual Prompt Engineering for Mitigating Object Hallucination in Large Vision Language Models
por: Woo, Sangmin, et al.
Publicado: (2025)
por: Woo, Sangmin, et al.
Publicado: (2025)
FlashVID: Efficient Video Large Language Models via Training-free Tree-based Spatiotemporal Token Merging
por: Fan, Ziyang, et al.
Publicado: (2026)
por: Fan, Ziyang, et al.
Publicado: (2026)
Prompt4Trust: A Reinforcement Learning Prompt Augmentation Framework for Clinically-Aligned Confidence Calibration in Multimodal Large Language Models
por: Kriz, Anita, et al.
Publicado: (2025)
por: Kriz, Anita, et al.
Publicado: (2025)
Robust Prompt Optimization for Defending Language Models Against Jailbreaking Attacks
por: Zhou, Andy, et al.
Publicado: (2024)
por: Zhou, Andy, et al.
Publicado: (2024)
KOFFVQA: An Objectively Evaluated Free-form VQA Benchmark for Large Vision-Language Models in the Korean Language
por: Kim, Yoonshik, et al.
Publicado: (2025)
por: Kim, Yoonshik, et al.
Publicado: (2025)
MultiTrust: A Comprehensive Benchmark Towards Trustworthy Multimodal Large Language Models
por: Zhang, Yichi, et al.
Publicado: (2024)
por: Zhang, Yichi, et al.
Publicado: (2024)
Preserving Pre-trained Representation Space: On Effectiveness of Prefix-tuning for Large Multi-modal Models
por: Kim, Donghoon, et al.
Publicado: (2024)
por: Kim, Donghoon, et al.
Publicado: (2024)
Large Body Language Models
por: Punjwani, Saif, et al.
Publicado: (2024)
por: Punjwani, Saif, et al.
Publicado: (2024)
Grounding and Evaluation for Large Language Models: Practical Challenges and Lessons Learned (Survey)
por: Kenthapadi, Krishnaram, et al.
Publicado: (2024)
por: Kenthapadi, Krishnaram, et al.
Publicado: (2024)
Analyzing and Boosting the Power of Fine-Grained Visual Recognition for Multi-modal Large Language Models
por: He, Hulingxiao, et al.
Publicado: (2025)
por: He, Hulingxiao, et al.
Publicado: (2025)
SPHINX-X: Scaling Data and Parameters for a Family of Multi-modal Large Language Models
por: Liu, Dongyang, et al.
Publicado: (2024)
por: Liu, Dongyang, et al.
Publicado: (2024)
Leveraging Large Language Models for Scalable Vector Graphics-Driven Image Understanding
por: Cai, Mu, et al.
Publicado: (2023)
por: Cai, Mu, et al.
Publicado: (2023)
A Cognitive Evaluation Benchmark of Image Reasoning and Description for Large Vision-Language Models
por: Song, Xiujie, et al.
Publicado: (2024)
por: Song, Xiujie, et al.
Publicado: (2024)
M4CXR: Exploring Multi-task Potentials of Multi-modal Large Language Models for Chest X-ray Interpretation
por: Park, Jonggwon, et al.
Publicado: (2024)
por: Park, Jonggwon, et al.
Publicado: (2024)
Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models
por: Huang, Chengyue, et al.
Publicado: (2025)
por: Huang, Chengyue, et al.
Publicado: (2025)
Image-of-Thought Prompting for Visual Reasoning Refinement in Multimodal Large Language Models
por: Zhou, Qiji, et al.
Publicado: (2024)
por: Zhou, Qiji, et al.
Publicado: (2024)
Vision Language Models for Dynamic Human Activity Recognition in Healthcare Settings
por: Abid, Abderrazek, et al.
Publicado: (2025)
por: Abid, Abderrazek, et al.
Publicado: (2025)
Accurate Scene Text Recognition with Efficient Model Scaling and Cloze Self-Distillation
por: Maracani, Andrea, et al.
Publicado: (2025)
por: Maracani, Andrea, et al.
Publicado: (2025)
GFlowVLM: Enhancing Multi-step Reasoning in Vision-Language Models with Generative Flow Networks
por: Kang, Haoqiang, et al.
Publicado: (2025)
por: Kang, Haoqiang, et al.
Publicado: (2025)
mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models
por: Ye, Jiabo, et al.
Publicado: (2024)
por: Ye, Jiabo, et al.
Publicado: (2024)
Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning
por: Zhai, Yuexiang, et al.
Publicado: (2024)
por: Zhai, Yuexiang, et al.
Publicado: (2024)
Ejemplares similares
-
Separated Inter/Intra-Modal Fusion Prompts for Compositional Zero-Shot Learning
por: Jung, Sua
Publicado: (2025) -
MM-JudgeBias: A Benchmark for Evaluating Compositional Biases in MLLM-as-a-Judge
por: Lee, Sua, et al.
Publicado: (2026) -
By My Eyes: Grounding Multimodal Large Language Models with Sensor Data via Visual Prompting
por: Yoon, Hyungjun, et al.
Publicado: (2024) -
LLaVE: Large Language and Vision Embedding Models with Hardness-Weighted Contrastive Learning
por: Lan, Zhibin, et al.
Publicado: (2025) -
Semantically-Prompted Language Models Improve Visual Descriptions
por: Ogezi, Michael, et al.
Publicado: (2023)