Enregistré dans:
| Auteurs principaux: | Lee, Sua, Shin, Kyubum, Park, Jung Ho |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2507.07147 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Separated Inter/Intra-Modal Fusion Prompts for Compositional Zero-Shot Learning
par: Jung, Sua
Publié: (2025)
par: Jung, Sua
Publié: (2025)
MM-JudgeBias: A Benchmark for Evaluating Compositional Biases in MLLM-as-a-Judge
par: Lee, Sua, et autres
Publié: (2026)
par: Lee, Sua, et autres
Publié: (2026)
By My Eyes: Grounding Multimodal Large Language Models with Sensor Data via Visual Prompting
par: Yoon, Hyungjun, et autres
Publié: (2024)
par: Yoon, Hyungjun, et autres
Publié: (2024)
LLaVE: Large Language and Vision Embedding Models with Hardness-Weighted Contrastive Learning
par: Lan, Zhibin, et autres
Publié: (2025)
par: Lan, Zhibin, et autres
Publié: (2025)
ViP-LLaVA: Making Large Multimodal Models Understand Arbitrary Visual Prompts
par: Cai, Mu, et autres
Publié: (2023)
par: Cai, Mu, et autres
Publié: (2023)
Differentiable Prompt Learning for Vision Language Models
par: Huang, Zhenhan, et autres
Publié: (2024)
par: Huang, Zhenhan, et autres
Publié: (2024)
MINR: Implicit Neural Representations with Masked Image Modelling
par: Lee, Sua, et autres
Publié: (2025)
par: Lee, Sua, et autres
Publié: (2025)
Semantically-Prompted Language Models Improve Visual Descriptions
par: Ogezi, Michael, et autres
Publié: (2023)
par: Ogezi, Michael, et autres
Publié: (2023)
Rethinking Visual Prompting for Multimodal Large Language Models with External Knowledge
par: Lin, Yuanze, et autres
Publié: (2024)
par: Lin, Yuanze, et autres
Publié: (2024)
Bayesian Principles Improve Prompt Learning In Vision-Language Models
par: Kim, Mingyu, et autres
Publié: (2025)
par: Kim, Mingyu, et autres
Publié: (2025)
ERGO: Efficient High-Resolution Visual Understanding for Vision-Language Models
par: Lee, Jewon, et autres
Publié: (2025)
par: Lee, Jewon, et autres
Publié: (2025)
Prompting Medical Large Vision-Language Models to Diagnose Pathologies by Visual Question Answering
par: Guo, Danfeng, et autres
Publié: (2024)
par: Guo, Danfeng, et autres
Publié: (2024)
Meta-Adaptive Prompt Distillation for Few-Shot Visual Question Answering
par: Gupta, Akash, et autres
Publié: (2025)
par: Gupta, Akash, et autres
Publié: (2025)
Large Language Models can Share Images, Too!
par: Lee, Young-Jun, et autres
Publié: (2023)
par: Lee, Young-Jun, et autres
Publié: (2023)
Compositional Chain-of-Thought Prompting for Large Multimodal Models
par: Mitra, Chancharik, et autres
Publié: (2023)
par: Mitra, Chancharik, et autres
Publié: (2023)
Promptception: How Sensitive Are Large Multimodal Models to Prompts?
par: Ismithdeen, Mohamed Insaf, et autres
Publié: (2025)
par: Ismithdeen, Mohamed Insaf, et autres
Publié: (2025)
REMONI: An Autonomous System Integrating Wearables and Multimodal Large Language Models for Enhanced Remote Health Monitoring
par: Ho, Thanh Cong, et autres
Publié: (2025)
par: Ho, Thanh Cong, et autres
Publié: (2025)
VLind-Bench: Measuring Language Priors in Large Vision-Language Models
par: Lee, Kang-il, et autres
Publié: (2024)
par: Lee, Kang-il, et autres
Publié: (2024)
Mitigating Hallucinations in Large Vision-Language Models via Summary-Guided Decoding
par: Min, Kyungmin, et autres
Publié: (2024)
par: Min, Kyungmin, et autres
Publié: (2024)
FlashVID: Efficient Video Large Language Models via Training-free Tree-based Spatiotemporal Token Merging
par: Fan, Ziyang, et autres
Publié: (2026)
par: Fan, Ziyang, et autres
Publié: (2026)
Robust Prompt Optimization for Defending Language Models Against Jailbreaking Attacks
par: Zhou, Andy, et autres
Publié: (2024)
par: Zhou, Andy, et autres
Publié: (2024)
MultiTrust: A Comprehensive Benchmark Towards Trustworthy Multimodal Large Language Models
par: Zhang, Yichi, et autres
Publié: (2024)
par: Zhang, Yichi, et autres
Publié: (2024)
Preserving Pre-trained Representation Space: On Effectiveness of Prefix-tuning for Large Multi-modal Models
par: Kim, Donghoon, et autres
Publié: (2024)
par: Kim, Donghoon, et autres
Publié: (2024)
OLKAVS: An Open Large-Scale Korean Audio-Visual Speech Dataset
par: Park, Jeongkyun, et autres
Publié: (2023)
par: Park, Jeongkyun, et autres
Publié: (2023)
Black-Box Visual Prompt Engineering for Mitigating Object Hallucination in Large Vision Language Models
par: Woo, Sangmin, et autres
Publié: (2025)
par: Woo, Sangmin, et autres
Publié: (2025)
Vision Language Models for Dynamic Human Activity Recognition in Healthcare Settings
par: Abid, Abderrazek, et autres
Publié: (2025)
par: Abid, Abderrazek, et autres
Publié: (2025)
Leveraging Large Language Models for Scalable Vector Graphics-Driven Image Understanding
par: Cai, Mu, et autres
Publié: (2023)
par: Cai, Mu, et autres
Publié: (2023)
Large Body Language Models
par: Punjwani, Saif, et autres
Publié: (2024)
par: Punjwani, Saif, et autres
Publié: (2024)
Grounding and Evaluation for Large Language Models: Practical Challenges and Lessons Learned (Survey)
par: Kenthapadi, Krishnaram, et autres
Publié: (2024)
par: Kenthapadi, Krishnaram, et autres
Publié: (2024)
Analyzing and Boosting the Power of Fine-Grained Visual Recognition for Multi-modal Large Language Models
par: He, Hulingxiao, et autres
Publié: (2025)
par: He, Hulingxiao, et autres
Publié: (2025)
SPHINX-X: Scaling Data and Parameters for a Family of Multi-modal Large Language Models
par: Liu, Dongyang, et autres
Publié: (2024)
par: Liu, Dongyang, et autres
Publié: (2024)
Prompt4Trust: A Reinforcement Learning Prompt Augmentation Framework for Clinically-Aligned Confidence Calibration in Multimodal Large Language Models
par: Kriz, Anita, et autres
Publié: (2025)
par: Kriz, Anita, et autres
Publié: (2025)
KOFFVQA: An Objectively Evaluated Free-form VQA Benchmark for Large Vision-Language Models in the Korean Language
par: Kim, Yoonshik, et autres
Publié: (2025)
par: Kim, Yoonshik, et autres
Publié: (2025)
Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models
par: Huang, Chengyue, et autres
Publié: (2025)
par: Huang, Chengyue, et autres
Publié: (2025)
GFlowVLM: Enhancing Multi-step Reasoning in Vision-Language Models with Generative Flow Networks
par: Kang, Haoqiang, et autres
Publié: (2025)
par: Kang, Haoqiang, et autres
Publié: (2025)
Accurate Scene Text Recognition with Efficient Model Scaling and Cloze Self-Distillation
par: Maracani, Andrea, et autres
Publié: (2025)
par: Maracani, Andrea, et autres
Publié: (2025)
mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models
par: Ye, Jiabo, et autres
Publié: (2024)
par: Ye, Jiabo, et autres
Publié: (2024)
Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning
par: Zhai, Yuexiang, et autres
Publié: (2024)
par: Zhai, Yuexiang, et autres
Publié: (2024)
COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training
par: Kim, Sanghwan, et autres
Publié: (2024)
par: Kim, Sanghwan, et autres
Publié: (2024)
A Survey on Multimodal Large Language Models
par: Yin, Shukang, et autres
Publié: (2023)
par: Yin, Shukang, et autres
Publié: (2023)
Documents similaires
-
Separated Inter/Intra-Modal Fusion Prompts for Compositional Zero-Shot Learning
par: Jung, Sua
Publié: (2025) -
MM-JudgeBias: A Benchmark for Evaluating Compositional Biases in MLLM-as-a-Judge
par: Lee, Sua, et autres
Publié: (2026) -
By My Eyes: Grounding Multimodal Large Language Models with Sensor Data via Visual Prompting
par: Yoon, Hyungjun, et autres
Publié: (2024) -
LLaVE: Large Language and Vision Embedding Models with Hardness-Weighted Contrastive Learning
par: Lan, Zhibin, et autres
Publié: (2025) -
ViP-LLaVA: Making Large Multimodal Models Understand Arbitrary Visual Prompts
par: Cai, Mu, et autres
Publié: (2023)