VLLaVO: Mitigating Visual Gap through LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Shuhao, Zhang, Yulong, Jiang, Weisen, Lu, Jiangang, Zhang, Yu |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
BYOM: Building Your Own Multi-Task Model For Free
par: Jiang, Weisen, et autres
Publié: (2023)
par: Jiang, Weisen, et autres
Publié: (2023)
Enhancing Visual Question Answering through Ranking-Based Hybrid Training and Multimodal Fusion
par: Chen, Peiyuan, et autres
Publié: (2024)
par: Chen, Peiyuan, et autres
Publié: (2024)
Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?
par: Park, Simon, et autres
Publié: (2025)
par: Park, Simon, et autres
Publié: (2025)
LLMs as Visual Explainers: Advancing Image Classification with Evolving Visual Descriptions
par: Han, Songhao, et autres
Publié: (2023)
par: Han, Songhao, et autres
Publié: (2023)
InSight-o3: Empowering Multimodal Foundation Models with Generalized Visual Search
par: Li, Kaican, et autres
Publié: (2025)
par: Li, Kaican, et autres
Publié: (2025)
Bridging the Visual Gap: Fine-Tuning Multimodal Models with Knowledge-Adapted Captions
par: Yanuka, Moran, et autres
Publié: (2024)
par: Yanuka, Moran, et autres
Publié: (2024)
Mitigating the Modality Gap: Few-Shot Out-of-Distribution Detection with Multi-modal Prototypes and Image Bias Estimation
par: Wang, Yimu, et autres
Publié: (2025)
par: Wang, Yimu, et autres
Publié: (2025)
EMMA: Efficient Visual Alignment in Multi-Modal LLMs
par: Ghazanfari, Sara, et autres
Publié: (2024)
par: Ghazanfari, Sara, et autres
Publié: (2024)
Tables as Texts or Images: Evaluating the Table Reasoning Ability of LLMs and MLLMs
par: Deng, Naihao, et autres
Publié: (2024)
par: Deng, Naihao, et autres
Publié: (2024)
HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale
par: Chen, Junying, et autres
Publié: (2024)
par: Chen, Junying, et autres
Publié: (2024)
Mitigate the Gap: Investigating Approaches for Improving Cross-Modal Alignment in CLIP
par: Eslami, Sedigheh, et autres
Publié: (2024)
par: Eslami, Sedigheh, et autres
Publié: (2024)
MoD-DPO: Towards Mitigating Cross-modal Hallucinations in Omni LLMs using Modality Decoupled Preference Optimization
par: Chaubey, Ashutosh, et autres
Publié: (2026)
par: Chaubey, Ashutosh, et autres
Publié: (2026)
Composition-Grounded Data Synthesis for Visual Reasoning
par: Gu, Xinyi, et autres
Publié: (2025)
par: Gu, Xinyi, et autres
Publié: (2025)
Analyzing and Mitigating Object Hallucination in Large Vision-Language Models
par: Zhou, Yiyang, et autres
Publié: (2023)
par: Zhou, Yiyang, et autres
Publié: (2023)
CAPability: A Comprehensive Visual Caption Benchmark for Evaluating Both Correctness and Thoroughness
par: Liu, Zhihang, et autres
Publié: (2025)
par: Liu, Zhihang, et autres
Publié: (2025)
LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning
par: You, Zebin, et autres
Publié: (2025)
par: You, Zebin, et autres
Publié: (2025)
LLMs Can Evolve Continually on Modality for X-Modal Reasoning
par: Yu, Jiazuo, et autres
Publié: (2024)
par: Yu, Jiazuo, et autres
Publié: (2024)
VisMin: Visual Minimal-Change Understanding
par: Awal, Rabiul, et autres
Publié: (2024)
par: Awal, Rabiul, et autres
Publié: (2024)
VisualRWKV: Exploring Recurrent Neural Networks for Visual Language Models
par: Hou, Haowen, et autres
Publié: (2024)
par: Hou, Haowen, et autres
Publié: (2024)
Mitigating Object and Action Hallucinations in Multimodal LLMs via Self-Augmented Contrastive Alignment
par: Chang, Kai-Po, et autres
Publié: (2025)
par: Chang, Kai-Po, et autres
Publié: (2025)
ElectroVizQA: How well do Multi-modal LLMs perform in Electronics Visual Question Answering?
par: Meshram, Pragati Shuddhodhan, et autres
Publié: (2024)
par: Meshram, Pragati Shuddhodhan, et autres
Publié: (2024)
Find The Gap: Knowledge Base Reasoning For Visual Question Answering
par: Barezi, Elham J., et autres
Publié: (2024)
par: Barezi, Elham J., et autres
Publié: (2024)
VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web Tasks
par: Koh, Jing Yu, et autres
Publié: (2024)
par: Koh, Jing Yu, et autres
Publié: (2024)
MoPD: Mixture-of-Prompts Distillation for Vision-Language Models
par: Chen, Yang, et autres
Publié: (2024)
par: Chen, Yang, et autres
Publié: (2024)
Attribute Diversity Determines the Systematicity Gap in VQA
par: Berlot-Attwell, Ian, et autres
Publié: (2023)
par: Berlot-Attwell, Ian, et autres
Publié: (2023)
Rethinking Guidance Information to Utilize Unlabeled Samples:A Label Encoding Perspective
par: Zhang, Yulong, et autres
Publié: (2024)
par: Zhang, Yulong, et autres
Publié: (2024)
QeRL: Beyond Efficiency -- Quantization-enhanced Reinforcement Learning for LLMs
par: Huang, Wei, et autres
Publié: (2025)
par: Huang, Wei, et autres
Publié: (2025)
Systematic Reward Gap Optimization for Mitigating VLM Hallucinations
par: He, Lehan, et autres
Publié: (2024)
par: He, Lehan, et autres
Publié: (2024)
Imagine while Reasoning in Space: Multimodal Visualization-of-Thought
par: Li, Chengzu, et autres
Publié: (2025)
par: Li, Chengzu, et autres
Publié: (2025)
Breaking through the learning plateaus of in-context learning in Transformer
par: Fu, Jingwen, et autres
Publié: (2023)
par: Fu, Jingwen, et autres
Publié: (2023)
Reefknot: A Comprehensive Benchmark for Relation Hallucination Evaluation, Analysis and Mitigation in Multimodal Large Language Models
par: Zheng, Kening, et autres
Publié: (2024)
par: Zheng, Kening, et autres
Publié: (2024)
Lumos : Empowering Multimodal LLMs with Scene Text Recognition
par: Shenoy, Ashish, et autres
Publié: (2024)
par: Shenoy, Ashish, et autres
Publié: (2024)
Prophet: Prompting Large Language Models with Complementary Answer Heuristics for Knowledge-based Visual Question Answering
par: Yu, Zhou, et autres
Publié: (2023)
par: Yu, Zhou, et autres
Publié: (2023)
LDP: Generalizing to Multilingual Visual Information Extraction by Language Decoupled Pretraining
par: Shen, Huawen, et autres
Publié: (2024)
par: Shen, Huawen, et autres
Publié: (2024)
Gla-AI4BioMed at RRG24: Visual Instruction-tuned Adaptation for Radiology Report Generation
par: Zhang, Xi, et autres
Publié: (2024)
par: Zhang, Xi, et autres
Publié: (2024)
Evaluating the Correctness of Inference Patterns Used by LLMs for Judgment
par: Chen, Lu, et autres
Publié: (2024)
par: Chen, Lu, et autres
Publié: (2024)
VIST-GPT: Ushering in the Era of Visual Storytelling with LLMs?
par: Gado, Mohamed, et autres
Publié: (2025)
par: Gado, Mohamed, et autres
Publié: (2025)
MouSi: Poly-Visual-Expert Vision-Language Models
par: Fan, Xiaoran, et autres
Publié: (2024)
par: Fan, Xiaoran, et autres
Publié: (2024)
SceneAlign: Aligning Multimodal Reasoning to Scene Graphs in Complex Visual Scenes
par: Wang, Chuhan, et autres
Publié: (2026)
par: Wang, Chuhan, et autres
Publié: (2026)
The Cost of Context: Mitigating Textual Bias in Multimodal Retrieval-Augmented Generation
par: Jung, Hoin, et autres
Publié: (2026)
par: Jung, Hoin, et autres
Publié: (2026)
Documents similaires
-
BYOM: Building Your Own Multi-Task Model For Free
par: Jiang, Weisen, et autres
Publié: (2023) -
Enhancing Visual Question Answering through Ranking-Based Hybrid Training and Multimodal Fusion
par: Chen, Peiyuan, et autres
Publié: (2024) -
Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?
par: Park, Simon, et autres
Publié: (2025) -
LLMs as Visual Explainers: Advancing Image Classification with Evolving Visual Descriptions
par: Han, Songhao, et autres
Publié: (2023) -
InSight-o3: Empowering Multimodal Foundation Models with Generalized Visual Search
par: Li, Kaican, et autres
Publié: (2025)