Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Fuxiao, Lin, Kevin, Li, Linjie, Wang, Jianfeng, Yacoob, Yaser, Wang, Lijuan |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VMU-Diff: A Coarse-to-fine Multi-source Data Fusion Framework for Precipitation Nowcasting
par: Shi, Chunlei, et autres
Publié: (2026)
par: Shi, Chunlei, et autres
Publié: (2026)
Mitigating Hallucinations in Large Vision-Language Models with Instruction Contrastive Decoding
par: Wang, Xintong, et autres
Publié: (2024)
par: Wang, Xintong, et autres
Publié: (2024)
Mitigating Hallucination in Large Vision-Language Models via Adaptive Attention Calibration
par: Fazli, Mehrdad, et autres
Publié: (2025)
par: Fazli, Mehrdad, et autres
Publié: (2025)
FCMBench-Video: Benchmarking Document Video Intelligence
par: Cui, Runze, et autres
Publié: (2026)
par: Cui, Runze, et autres
Publié: (2026)
BatSort: Enhanced Battery Classification with Transfer Learning for Battery Sorting and Recycling
par: Zhao, Yunyi, et autres
Publié: (2024)
par: Zhao, Yunyi, et autres
Publié: (2024)
Mitigating Hallucination in Multimodal Large Language Model via Hallucination-targeted Direct Preference Optimization
par: Fu, Yuhan, et autres
Publié: (2024)
par: Fu, Yuhan, et autres
Publié: (2024)
MSMF: Multi-Scale Multi-Modal Fusion for Enhanced Stock Market Prediction
par: Qin, Jiahao
Publié: (2024)
par: Qin, Jiahao
Publié: (2024)
FCMBench: The First Large-scale Financial Credit Multimodal Benchmark for Real-world Applications
par: Yang, Yehui, et autres
Publié: (2026)
par: Yang, Yehui, et autres
Publié: (2026)
Magnifier Prompt: Tackling Multimodal Hallucination via Extremely Simple Instructions
par: Fu, Yuhan, et autres
Publié: (2024)
par: Fu, Yuhan, et autres
Publié: (2024)
Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization
par: Compagnoni, Alberto, et autres
Publié: (2025)
par: Compagnoni, Alberto, et autres
Publié: (2025)
Towards Robust Evaluation of STEM Education: Leveraging MLLMs in Project-Based Learning
par: Wu, Xinyi, et autres
Publié: (2025)
par: Wu, Xinyi, et autres
Publié: (2025)
Enhancing Multimodal Misinformation Detection by Replaying the Whole Story from Image Modality Perspective
par: Wang, Bing, et autres
Publié: (2025)
par: Wang, Bing, et autres
Publié: (2025)
Zero-Shot Audio-Visual Editing via Cross-Modal Delta Denoising
par: Lin, Yan-Bo, et autres
Publié: (2025)
par: Lin, Yan-Bo, et autres
Publié: (2025)
FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks
par: Cao, Yupeng, et autres
Publié: (2026)
par: Cao, Yupeng, et autres
Publié: (2026)
Multi-Modal Semantic Parsing for the Interpretation of Tombstone Inscriptions
par: Zhang, Xiao, et autres
Publié: (2025)
par: Zhang, Xiao, et autres
Publié: (2025)
Seeing is Believing: Mitigating Hallucination in Large Vision-Language Models via CLIP-Guided Decoding
par: Deng, Ailin, et autres
Publié: (2024)
par: Deng, Ailin, et autres
Publié: (2024)
HAIC: Improving Human Action Understanding and Generation with Better Captions for Multi-modal Large Language Models
par: Wang, Xiao, et autres
Publié: (2025)
par: Wang, Xiao, et autres
Publié: (2025)
MaskCD: Mitigating LVLM Hallucinations by Image Head Masked Contrastive Decoding
par: Deng, Jingyuan, et autres
Publié: (2025)
par: Deng, Jingyuan, et autres
Publié: (2025)
DetailVerifyBench: A Benchmark for Dense Hallucination Localization in Long Image Captions
par: Wang, Xinran, et autres
Publié: (2026)
par: Wang, Xinran, et autres
Publié: (2026)
Analyzing Images of Legal Documents: Toward Multi-Modal LLMs for Access to Justice
par: Westermann, Hannes, et autres
Publié: (2024)
par: Westermann, Hannes, et autres
Publié: (2024)
From Query to Explanation: Uni-RAG for Multi-Modal Retrieval-Augmented Learning in STEM
par: Wu, Xinyi, et autres
Publié: (2025)
par: Wu, Xinyi, et autres
Publié: (2025)
How Far Are We from Generating Missing Modalities with Foundation Models?
par: Ke, Guanzhou, et autres
Publié: (2025)
par: Ke, Guanzhou, et autres
Publié: (2025)
MLLM can see? Dynamic Correction Decoding for Hallucination Mitigation
par: Wang, Chenxi, et autres
Publié: (2024)
par: Wang, Chenxi, et autres
Publié: (2024)
Fit and Prune: Fast and Training-free Visual Token Pruning for Multi-modal Large Language Models
par: Ye, Weihao, et autres
Publié: (2024)
par: Ye, Weihao, et autres
Publié: (2024)
CounterVid: Counterfactual Video Generation for Mitigating Action and Temporal Hallucinations in Video-Language Models
par: Poppi, Tobia, et autres
Publié: (2026)
par: Poppi, Tobia, et autres
Publié: (2026)
M$^3$Face: A Unified Multi-Modal Multilingual Framework for Human Face Generation and Editing
par: Mofayezi, Mohammadreza, et autres
Publié: (2024)
par: Mofayezi, Mohammadreza, et autres
Publié: (2024)
CL2CM: Improving Cross-Lingual Cross-Modal Retrieval via Cross-Lingual Knowledge Transfer
par: Wang, Yabing, et autres
Publié: (2023)
par: Wang, Yabing, et autres
Publié: (2023)
HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models
par: Guan, Tianrui, et autres
Publié: (2023)
par: Guan, Tianrui, et autres
Publié: (2023)
Mitigating Image Captioning Hallucinations in Vision-Language Models
par: Zhao, Fei, et autres
Publié: (2025)
par: Zhao, Fei, et autres
Publié: (2025)
Mitigating Hallucinations in Diffusion Models through Adaptive Attention Modulation
par: Oorloff, Trevine, et autres
Publié: (2025)
par: Oorloff, Trevine, et autres
Publié: (2025)
Knowledge Acquisition Disentanglement for Knowledge-based Visual Question Answering with Large Language Models
par: An, Wenbin, et autres
Publié: (2024)
par: An, Wenbin, et autres
Publié: (2024)
New Job, New Gender? Measuring the Social Bias in Image Generation Models
par: Wang, Wenxuan, et autres
Publié: (2024)
par: Wang, Wenxuan, et autres
Publié: (2024)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
par: Zhang, Zhenxing, et autres
Publié: (2024)
par: Zhang, Zhenxing, et autres
Publié: (2024)
Multimodal growth and development assessment model
par: Li, Ying, et autres
Publié: (2024)
par: Li, Ying, et autres
Publié: (2024)
3DMIT: 3D Multi-modal Instruction Tuning for Scene Understanding
par: Li, Zeju, et autres
Publié: (2024)
par: Li, Zeju, et autres
Publié: (2024)
LLaVA-MORE: A Comparative Study of LLMs and Visual Backbones for Enhanced Visual Instruction Tuning
par: Cocchi, Federico, et autres
Publié: (2025)
par: Cocchi, Federico, et autres
Publié: (2025)
FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs
par: Chen, Qian, et autres
Publié: (2026)
par: Chen, Qian, et autres
Publié: (2026)
MaVEn: An Effective Multi-granularity Hybrid Visual Encoding Framework for Multimodal Large Language Model
par: Jiang, Chaoya, et autres
Publié: (2024)
par: Jiang, Chaoya, et autres
Publié: (2024)
Towards Robust Multimodal Emotion Recognition under Missing Modalities and Distribution Shifts
par: Zhong, Guowei, et autres
Publié: (2025)
par: Zhong, Guowei, et autres
Publié: (2025)
Gradient-Guided Modality Decoupling for Missing-Modality Robustness
par: Wang, Hao, et autres
Publié: (2024)
par: Wang, Hao, et autres
Publié: (2024)
Documents similaires
-
VMU-Diff: A Coarse-to-fine Multi-source Data Fusion Framework for Precipitation Nowcasting
par: Shi, Chunlei, et autres
Publié: (2026) -
Mitigating Hallucinations in Large Vision-Language Models with Instruction Contrastive Decoding
par: Wang, Xintong, et autres
Publié: (2024) -
Mitigating Hallucination in Large Vision-Language Models via Adaptive Attention Calibration
par: Fazli, Mehrdad, et autres
Publié: (2025) -
FCMBench-Video: Benchmarking Document Video Intelligence
par: Cui, Runze, et autres
Publié: (2026) -
BatSort: Enhanced Battery Classification with Transfer Learning for Battery Sorting and Recycling
par: Zhao, Yunyi, et autres
Publié: (2024)