Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Fuxiao, Lin, Kevin, Li, Linjie, Wang, Jianfeng, Yacoob, Yaser, Wang, Lijuan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VMU-Diff: A Coarse-to-fine Multi-source Data Fusion Framework for Precipitation Nowcasting
di: Shi, Chunlei, et al.
Pubblicazione: (2026)
di: Shi, Chunlei, et al.
Pubblicazione: (2026)
Mitigating Hallucinations in Large Vision-Language Models with Instruction Contrastive Decoding
di: Wang, Xintong, et al.
Pubblicazione: (2024)
di: Wang, Xintong, et al.
Pubblicazione: (2024)
Mitigating Hallucination in Large Vision-Language Models via Adaptive Attention Calibration
di: Fazli, Mehrdad, et al.
Pubblicazione: (2025)
di: Fazli, Mehrdad, et al.
Pubblicazione: (2025)
FCMBench-Video: Benchmarking Document Video Intelligence
di: Cui, Runze, et al.
Pubblicazione: (2026)
di: Cui, Runze, et al.
Pubblicazione: (2026)
BatSort: Enhanced Battery Classification with Transfer Learning for Battery Sorting and Recycling
di: Zhao, Yunyi, et al.
Pubblicazione: (2024)
di: Zhao, Yunyi, et al.
Pubblicazione: (2024)
Mitigating Hallucination in Multimodal Large Language Model via Hallucination-targeted Direct Preference Optimization
di: Fu, Yuhan, et al.
Pubblicazione: (2024)
di: Fu, Yuhan, et al.
Pubblicazione: (2024)
MSMF: Multi-Scale Multi-Modal Fusion for Enhanced Stock Market Prediction
di: Qin, Jiahao
Pubblicazione: (2024)
di: Qin, Jiahao
Pubblicazione: (2024)
FCMBench: The First Large-scale Financial Credit Multimodal Benchmark for Real-world Applications
di: Yang, Yehui, et al.
Pubblicazione: (2026)
di: Yang, Yehui, et al.
Pubblicazione: (2026)
Magnifier Prompt: Tackling Multimodal Hallucination via Extremely Simple Instructions
di: Fu, Yuhan, et al.
Pubblicazione: (2024)
di: Fu, Yuhan, et al.
Pubblicazione: (2024)
Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization
di: Compagnoni, Alberto, et al.
Pubblicazione: (2025)
di: Compagnoni, Alberto, et al.
Pubblicazione: (2025)
Towards Robust Evaluation of STEM Education: Leveraging MLLMs in Project-Based Learning
di: Wu, Xinyi, et al.
Pubblicazione: (2025)
di: Wu, Xinyi, et al.
Pubblicazione: (2025)
Enhancing Multimodal Misinformation Detection by Replaying the Whole Story from Image Modality Perspective
di: Wang, Bing, et al.
Pubblicazione: (2025)
di: Wang, Bing, et al.
Pubblicazione: (2025)
Zero-Shot Audio-Visual Editing via Cross-Modal Delta Denoising
di: Lin, Yan-Bo, et al.
Pubblicazione: (2025)
di: Lin, Yan-Bo, et al.
Pubblicazione: (2025)
FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks
di: Cao, Yupeng, et al.
Pubblicazione: (2026)
di: Cao, Yupeng, et al.
Pubblicazione: (2026)
Multi-Modal Semantic Parsing for the Interpretation of Tombstone Inscriptions
di: Zhang, Xiao, et al.
Pubblicazione: (2025)
di: Zhang, Xiao, et al.
Pubblicazione: (2025)
Seeing is Believing: Mitigating Hallucination in Large Vision-Language Models via CLIP-Guided Decoding
di: Deng, Ailin, et al.
Pubblicazione: (2024)
di: Deng, Ailin, et al.
Pubblicazione: (2024)
HAIC: Improving Human Action Understanding and Generation with Better Captions for Multi-modal Large Language Models
di: Wang, Xiao, et al.
Pubblicazione: (2025)
di: Wang, Xiao, et al.
Pubblicazione: (2025)
MaskCD: Mitigating LVLM Hallucinations by Image Head Masked Contrastive Decoding
di: Deng, Jingyuan, et al.
Pubblicazione: (2025)
di: Deng, Jingyuan, et al.
Pubblicazione: (2025)
DetailVerifyBench: A Benchmark for Dense Hallucination Localization in Long Image Captions
di: Wang, Xinran, et al.
Pubblicazione: (2026)
di: Wang, Xinran, et al.
Pubblicazione: (2026)
Analyzing Images of Legal Documents: Toward Multi-Modal LLMs for Access to Justice
di: Westermann, Hannes, et al.
Pubblicazione: (2024)
di: Westermann, Hannes, et al.
Pubblicazione: (2024)
From Query to Explanation: Uni-RAG for Multi-Modal Retrieval-Augmented Learning in STEM
di: Wu, Xinyi, et al.
Pubblicazione: (2025)
di: Wu, Xinyi, et al.
Pubblicazione: (2025)
How Far Are We from Generating Missing Modalities with Foundation Models?
di: Ke, Guanzhou, et al.
Pubblicazione: (2025)
di: Ke, Guanzhou, et al.
Pubblicazione: (2025)
MLLM can see? Dynamic Correction Decoding for Hallucination Mitigation
di: Wang, Chenxi, et al.
Pubblicazione: (2024)
di: Wang, Chenxi, et al.
Pubblicazione: (2024)
Fit and Prune: Fast and Training-free Visual Token Pruning for Multi-modal Large Language Models
di: Ye, Weihao, et al.
Pubblicazione: (2024)
di: Ye, Weihao, et al.
Pubblicazione: (2024)
CounterVid: Counterfactual Video Generation for Mitigating Action and Temporal Hallucinations in Video-Language Models
di: Poppi, Tobia, et al.
Pubblicazione: (2026)
di: Poppi, Tobia, et al.
Pubblicazione: (2026)
M$^3$Face: A Unified Multi-Modal Multilingual Framework for Human Face Generation and Editing
di: Mofayezi, Mohammadreza, et al.
Pubblicazione: (2024)
di: Mofayezi, Mohammadreza, et al.
Pubblicazione: (2024)
CL2CM: Improving Cross-Lingual Cross-Modal Retrieval via Cross-Lingual Knowledge Transfer
di: Wang, Yabing, et al.
Pubblicazione: (2023)
di: Wang, Yabing, et al.
Pubblicazione: (2023)
HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models
di: Guan, Tianrui, et al.
Pubblicazione: (2023)
di: Guan, Tianrui, et al.
Pubblicazione: (2023)
Mitigating Image Captioning Hallucinations in Vision-Language Models
di: Zhao, Fei, et al.
Pubblicazione: (2025)
di: Zhao, Fei, et al.
Pubblicazione: (2025)
Mitigating Hallucinations in Diffusion Models through Adaptive Attention Modulation
di: Oorloff, Trevine, et al.
Pubblicazione: (2025)
di: Oorloff, Trevine, et al.
Pubblicazione: (2025)
Knowledge Acquisition Disentanglement for Knowledge-based Visual Question Answering with Large Language Models
di: An, Wenbin, et al.
Pubblicazione: (2024)
di: An, Wenbin, et al.
Pubblicazione: (2024)
New Job, New Gender? Measuring the Social Bias in Image Generation Models
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
di: Zhang, Zhenxing, et al.
Pubblicazione: (2024)
di: Zhang, Zhenxing, et al.
Pubblicazione: (2024)
Multimodal growth and development assessment model
di: Li, Ying, et al.
Pubblicazione: (2024)
di: Li, Ying, et al.
Pubblicazione: (2024)
3DMIT: 3D Multi-modal Instruction Tuning for Scene Understanding
di: Li, Zeju, et al.
Pubblicazione: (2024)
di: Li, Zeju, et al.
Pubblicazione: (2024)
LLaVA-MORE: A Comparative Study of LLMs and Visual Backbones for Enhanced Visual Instruction Tuning
di: Cocchi, Federico, et al.
Pubblicazione: (2025)
di: Cocchi, Federico, et al.
Pubblicazione: (2025)
FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs
di: Chen, Qian, et al.
Pubblicazione: (2026)
di: Chen, Qian, et al.
Pubblicazione: (2026)
MaVEn: An Effective Multi-granularity Hybrid Visual Encoding Framework for Multimodal Large Language Model
di: Jiang, Chaoya, et al.
Pubblicazione: (2024)
di: Jiang, Chaoya, et al.
Pubblicazione: (2024)
Towards Robust Multimodal Emotion Recognition under Missing Modalities and Distribution Shifts
di: Zhong, Guowei, et al.
Pubblicazione: (2025)
di: Zhong, Guowei, et al.
Pubblicazione: (2025)
Gradient-Guided Modality Decoupling for Missing-Modality Robustness
di: Wang, Hao, et al.
Pubblicazione: (2024)
di: Wang, Hao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
VMU-Diff: A Coarse-to-fine Multi-source Data Fusion Framework for Precipitation Nowcasting
di: Shi, Chunlei, et al.
Pubblicazione: (2026) -
Mitigating Hallucinations in Large Vision-Language Models with Instruction Contrastive Decoding
di: Wang, Xintong, et al.
Pubblicazione: (2024) -
Mitigating Hallucination in Large Vision-Language Models via Adaptive Attention Calibration
di: Fazli, Mehrdad, et al.
Pubblicazione: (2025) -
FCMBench-Video: Benchmarking Document Video Intelligence
di: Cui, Runze, et al.
Pubblicazione: (2026) -
BatSort: Enhanced Battery Classification with Transfer Learning for Battery Sorting and Recycling
di: Zhao, Yunyi, et al.
Pubblicazione: (2024)