Hallucination Augmented Contrastive Learning for Multimodal Large Language Model
Fuente:
arXiv
Salvato in:
| Autori principali: | Jiang, Chaoya, Xu, Haiyang, Dong, Mengfan, Chen, Jiaxing, Ye, Wei, Yan, Ming, Ye, Qinghao, Zhang, Ji, Huang, Fei, Zhang, Shikun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SymDPO: Boosting In-Context Learning of Large Multimodal Models with Symbol Demonstration Direct Preference Optimization
di: Jia, Hongrui, et al.
Pubblicazione: (2024)
di: Jia, Hongrui, et al.
Pubblicazione: (2024)
MaVEn: An Effective Multi-granularity Hybrid Visual Encoding Framework for Multimodal Large Language Model
di: Jiang, Chaoya, et al.
Pubblicazione: (2024)
di: Jiang, Chaoya, et al.
Pubblicazione: (2024)
TiMix: Text-aware Image Mixing for Effective Vision-Language Pre-training
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)
Hal-Eval: A Universal and Fine-grained Hallucination Evaluation Framework for Large Vision Language Models
di: Jiang, Chaoya, et al.
Pubblicazione: (2024)
di: Jiang, Chaoya, et al.
Pubblicazione: (2024)
BUS:Efficient and Effective Vision-language Pre-training with Bottom-Up Patch Summarization
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)
VLM-R$^3$: Region Recognition, Reasoning, and Refinement for Enhanced Multimodal Chain-of-Thought
di: Jiang, Chaoya, et al.
Pubblicazione: (2025)
di: Jiang, Chaoya, et al.
Pubblicazione: (2025)
Mitigating Visual Context Degradation in Large Multimodal Models: A Training-Free Decoupled Agentic Framework
di: Jia, Hongrui, et al.
Pubblicazione: (2025)
di: Jia, Hongrui, et al.
Pubblicazione: (2025)
Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
di: Ye, Wei, et al.
Pubblicazione: (2024)
di: Ye, Wei, et al.
Pubblicazione: (2024)
From Blind Spots to Gains: Diagnostic-Driven Iterative Training for Large Multimodal Models
di: Jia, Hongrui, et al.
Pubblicazione: (2026)
di: Jia, Hongrui, et al.
Pubblicazione: (2026)
COPA: Efficient Vision-Language Pre-training Through Collaborative Object- and Patch-Text Alignment
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)
TRIPS: Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)
MIBench: Evaluating Multimodal Large Language Models over Multiple Images
di: Liu, Haowei, et al.
Pubblicazione: (2024)
di: Liu, Haowei, et al.
Pubblicazione: (2024)
EVE: Verifiable Self-Evolution of MLLMs via Executable Visual Transformations
di: Heng, Yongrui, et al.
Pubblicazione: (2026)
di: Heng, Yongrui, et al.
Pubblicazione: (2026)
OSWorld-MCP: Benchmarking MCP Tool Invocation In Computer-Use Agents
di: Jia, Hongrui, et al.
Pubblicazione: (2025)
di: Jia, Hongrui, et al.
Pubblicazione: (2025)
Exploiting Pseudo Image Captions for Multimodal Summarization
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)
mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality
di: Ye, Qinghao, et al.
Pubblicazione: (2023)
di: Ye, Qinghao, et al.
Pubblicazione: (2023)
mPLUG-PaperOwl: Scientific Diagram Analysis with the Multimodal Large Language Model
di: Hu, Anwen, et al.
Pubblicazione: (2023)
di: Hu, Anwen, et al.
Pubblicazione: (2023)
Semantics-enhanced Cross-modal Masked Image Modeling for Vision-Language Pre-training
di: Liu, Haowei, et al.
Pubblicazione: (2024)
di: Liu, Haowei, et al.
Pubblicazione: (2024)
Enhancing In-Context Learning via Implicit Demonstration Augmentation
di: Zhou, Xiaoling, et al.
Pubblicazione: (2024)
di: Zhou, Xiaoling, et al.
Pubblicazione: (2024)
A Survey on Evaluation of Multimodal Large Language Models
di: Huang, Jiaxing, et al.
Pubblicazione: (2024)
di: Huang, Jiaxing, et al.
Pubblicazione: (2024)
Unifying Latent and Lexicon Representations for Effective Video-Text Retrieval
di: Liu, Haowei, et al.
Pubblicazione: (2024)
di: Liu, Haowei, et al.
Pubblicazione: (2024)
mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models
di: Ye, Jiabo, et al.
Pubblicazione: (2024)
di: Ye, Jiabo, et al.
Pubblicazione: (2024)
Learning to Decode Against Compositional Hallucination in Video Multimodal Large Language Models
di: Xing, Wenbin, et al.
Pubblicazione: (2026)
di: Xing, Wenbin, et al.
Pubblicazione: (2026)
Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception
di: Wang, Junyang, et al.
Pubblicazione: (2024)
di: Wang, Junyang, et al.
Pubblicazione: (2024)
mPLUG-DocOwl2: High-resolution Compressing for OCR-free Multi-page Document Understanding
di: Hu, Anwen, et al.
Pubblicazione: (2024)
di: Hu, Anwen, et al.
Pubblicazione: (2024)
TinyChart: Efficient Chart Understanding with Visual Token Merging and Program-of-Thoughts Learning
di: Zhang, Liang, et al.
Pubblicazione: (2024)
di: Zhang, Liang, et al.
Pubblicazione: (2024)
mPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understanding
di: Hu, Anwen, et al.
Pubblicazione: (2024)
di: Hu, Anwen, et al.
Pubblicazione: (2024)
Alleviating Hallucination in Large Vision-Language Models with Active Retrieval Augmentation
di: Qu, Xiaoye, et al.
Pubblicazione: (2024)
di: Qu, Xiaoye, et al.
Pubblicazione: (2024)
IBD: Alleviating Hallucinations in Large Vision-Language Models via Image-Biased Decoding
di: Zhu, Lanyun, et al.
Pubblicazione: (2024)
di: Zhu, Lanyun, et al.
Pubblicazione: (2024)
Boosting Model Resilience via Implicit Adversarial Data Augmentation
di: Zhou, Xiaoling, et al.
Pubblicazione: (2024)
di: Zhou, Xiaoling, et al.
Pubblicazione: (2024)
ConVis: Contrastive Decoding with Hallucination Visualization for Mitigating Hallucinations in Multimodal Large Language Models
di: Park, Yeji, et al.
Pubblicazione: (2024)
di: Park, Yeji, et al.
Pubblicazione: (2024)
MLLM-CL: Continual Learning for Multimodal Large Language Models
di: Zhao, Hongbo, et al.
Pubblicazione: (2025)
di: Zhao, Hongbo, et al.
Pubblicazione: (2025)
LLaVA-Critic: Learning to Evaluate Multimodal Models
di: Xiong, Tianyi, et al.
Pubblicazione: (2024)
di: Xiong, Tianyi, et al.
Pubblicazione: (2024)
Mitigating Object and Action Hallucinations in Multimodal LLMs via Self-Augmented Contrastive Alignment
di: Chang, Kai-Po, et al.
Pubblicazione: (2025)
di: Chang, Kai-Po, et al.
Pubblicazione: (2025)
AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization
di: Du, Yiyang, et al.
Pubblicazione: (2025)
di: Du, Yiyang, et al.
Pubblicazione: (2025)
LongHalQA: Long-Context Hallucination Evaluation for MultiModal Large Language Models
di: Qiu, Han, et al.
Pubblicazione: (2024)
di: Qiu, Han, et al.
Pubblicazione: (2024)
Mobile-Agent-V: A Video-Guided Approach for Effortless and Efficient Operational Knowledge Injection in Mobile Automation
di: Wang, Junyang, et al.
Pubblicazione: (2025)
di: Wang, Junyang, et al.
Pubblicazione: (2025)
Understanding and Mitigating Hallucinations in Multimodal Chain-of-Thought Models
di: Ma, Ji, et al.
Pubblicazione: (2026)
di: Ma, Ji, et al.
Pubblicazione: (2026)
Hallucination of Multimodal Large Language Models: A Survey
di: Bai, Zechen, et al.
Pubblicazione: (2024)
di: Bai, Zechen, et al.
Pubblicazione: (2024)
BadCLIP++: Stealthy and Persistent Backdoors in Multimodal Contrastive Learning
di: Liang, Siyuan, et al.
Pubblicazione: (2026)
di: Liang, Siyuan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
SymDPO: Boosting In-Context Learning of Large Multimodal Models with Symbol Demonstration Direct Preference Optimization
di: Jia, Hongrui, et al.
Pubblicazione: (2024) -
MaVEn: An Effective Multi-granularity Hybrid Visual Encoding Framework for Multimodal Large Language Model
di: Jiang, Chaoya, et al.
Pubblicazione: (2024) -
TiMix: Text-aware Image Mixing for Effective Vision-Language Pre-training
di: Jiang, Chaoya, et al.
Pubblicazione: (2023) -
Hal-Eval: A Universal and Fine-grained Hallucination Evaluation Framework for Large Vision Language Models
di: Jiang, Chaoya, et al.
Pubblicazione: (2024) -
BUS:Efficient and Effective Vision-language Pre-training with Bottom-Up Patch Summarization
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)