Hallucination of Multimodal Large Language Models: A Survey
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Bai, Zechen, Wang, Pichao, Xiao, Tianjun, He, Tong, Han, Zongbo, Zhang, Zheng, Shou, Mike Zheng |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Bridging Information Asymmetry in Text-video Retrieval: A Data-centric Approach
von: Bai, Zechen, et al.
Veröffentlicht: (2024)
von: Bai, Zechen, et al.
Veröffentlicht: (2024)
Skip \n: A Simple Method to Reduce Hallucination in Large Vision-Language Models
von: Han, Zongbo, et al.
Veröffentlicht: (2024)
von: Han, Zongbo, et al.
Veröffentlicht: (2024)
Factorized Visual Tokenization and Generation
von: Bai, Zechen, et al.
Veröffentlicht: (2024)
von: Bai, Zechen, et al.
Veröffentlicht: (2024)
One Token to Seg Them All: Language Instructed Reasoning Segmentation in Videos
von: Bai, Zechen, et al.
Veröffentlicht: (2024)
von: Bai, Zechen, et al.
Veröffentlicht: (2024)
EVOLVE-VLA: Test-Time Training from Environment Feedback for Vision-Language-Action Models
von: Bai, Zechen, et al.
Veröffentlicht: (2025)
von: Bai, Zechen, et al.
Veröffentlicht: (2025)
Impossible Videos
von: Bai, Zechen, et al.
Veröffentlicht: (2025)
von: Bai, Zechen, et al.
Veröffentlicht: (2025)
Genixer: Empowering Multimodal Large Language Models as a Powerful Data Generator
von: Zhao, Henry Hengyuan, et al.
Veröffentlicht: (2023)
von: Zhao, Henry Hengyuan, et al.
Veröffentlicht: (2023)
Show-o2: Improved Native Unified Multimodal Models
von: Xie, Jinheng, et al.
Veröffentlicht: (2025)
von: Xie, Jinheng, et al.
Veröffentlicht: (2025)
Adaptive Slot Attention: Object Discovery with Dynamic Slot Number
von: Fan, Ke, et al.
Veröffentlicht: (2024)
von: Fan, Ke, et al.
Veröffentlicht: (2024)
Unsupervised Open-Vocabulary Object Localization in Videos
von: Fan, Ke, et al.
Veröffentlicht: (2023)
von: Fan, Ke, et al.
Veröffentlicht: (2023)
Ego-centric Predictive Model Conditioned on Hand Trajectories
von: Zhang, Binjie, et al.
Veröffentlicht: (2025)
von: Zhang, Binjie, et al.
Veröffentlicht: (2025)
DoraCycle: Domain-Oriented Adaptation of Unified Generative Model in Multimodal Cycles
von: Zhao, Rui, et al.
Veröffentlicht: (2025)
von: Zhao, Rui, et al.
Veröffentlicht: (2025)
VLog: Video-Language Models by Generative Retrieval of Narration Vocabulary
von: Lin, Kevin Qinghong, et al.
Veröffentlicht: (2025)
von: Lin, Kevin Qinghong, et al.
Veröffentlicht: (2025)
UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning
von: Mao, Weijia, et al.
Veröffentlicht: (2025)
von: Mao, Weijia, et al.
Veröffentlicht: (2025)
DOTA: Distributional Test-Time Adaptation of Vision-Language Models
von: Han, Zongbo, et al.
Veröffentlicht: (2024)
von: Han, Zongbo, et al.
Veröffentlicht: (2024)
SCT: A Simple Baseline for Parameter-Efficient Fine-Tuning via Salient Channels
von: Zhao, Henry Hengyuan, et al.
Veröffentlicht: (2023)
von: Zhao, Henry Hengyuan, et al.
Veröffentlicht: (2023)
LOVA3: Learning to Visual Question Answering, Asking and Assessment
von: Zhao, Henry Hengyuan, et al.
Veröffentlicht: (2024)
von: Zhao, Henry Hengyuan, et al.
Veröffentlicht: (2024)
Show-o: One Single Transformer to Unify Multimodal Understanding and Generation
von: Xie, Jinheng, et al.
Veröffentlicht: (2024)
von: Xie, Jinheng, et al.
Veröffentlicht: (2024)
TPDiff: Temporal Pyramid Video Diffusion Model
von: Ran, Lingmin, et al.
Veröffentlicht: (2025)
von: Ran, Lingmin, et al.
Veröffentlicht: (2025)
D-AR: Diffusion via Autoregressive Models
von: Gao, Ziteng, et al.
Veröffentlicht: (2025)
von: Gao, Ziteng, et al.
Veröffentlicht: (2025)
Kiwi-Edit: Versatile Video Editing via Instruction and Reference Guidance
von: Lin, Yiqi, et al.
Veröffentlicht: (2026)
von: Lin, Yiqi, et al.
Veröffentlicht: (2026)
UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths
von: Mao, Weijia, et al.
Veröffentlicht: (2025)
von: Mao, Weijia, et al.
Veröffentlicht: (2025)
Efficient Multimodal Large Language Models: A Survey
von: Jin, Yizhang, et al.
Veröffentlicht: (2024)
von: Jin, Yizhang, et al.
Veröffentlicht: (2024)
Reinforcement Learning for Large Model: A Survey
von: Wu, Weijia, et al.
Veröffentlicht: (2025)
von: Wu, Weijia, et al.
Veröffentlicht: (2025)
Seeing is Believing? Mitigating OCR Hallucinations in Multimodal Large Language Models
von: He, Zhentao, et al.
Veröffentlicht: (2025)
von: He, Zhentao, et al.
Veröffentlicht: (2025)
Bring Your Own Character: A Holistic Solution for Automatic Facial Animation Generation of Customized Characters
von: Bai, Zechen, et al.
Veröffentlicht: (2024)
von: Bai, Zechen, et al.
Veröffentlicht: (2024)
Reflective Instruction Tuning: Mitigating Hallucinations in Large Vision-Language Models
von: Zhang, Jinrui, et al.
Veröffentlicht: (2024)
von: Zhang, Jinrui, et al.
Veröffentlicht: (2024)
P-Flow: Prompting Visual Effects Generation
von: Zhao, Rui, et al.
Veröffentlicht: (2026)
von: Zhao, Rui, et al.
Veröffentlicht: (2026)
VL-Uncertainty: Detecting Hallucination in Large Vision-Language Model via Uncertainty Estimation
von: Zhang, Ruiyang, et al.
Veröffentlicht: (2024)
von: Zhang, Ruiyang, et al.
Veröffentlicht: (2024)
A Survey of Multimodal Hallucination Evaluation and Detection
von: Chen, Zhiyuan, et al.
Veröffentlicht: (2025)
von: Chen, Zhiyuan, et al.
Veröffentlicht: (2025)
Long-Context Autoregressive Video Modeling with Next-Frame Prediction
von: Gu, Yuchao, et al.
Veröffentlicht: (2025)
von: Gu, Yuchao, et al.
Veröffentlicht: (2025)
DiffSim: Taming Diffusion Models for Evaluating Visual Similarity
von: Song, Yiren, et al.
Veröffentlicht: (2024)
von: Song, Yiren, et al.
Veröffentlicht: (2024)
Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey
von: Qu, Bingzheng, et al.
Veröffentlicht: (2026)
von: Qu, Bingzheng, et al.
Veröffentlicht: (2026)
Hallucination Augmented Contrastive Learning for Multimodal Large Language Model
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)
Edit2Perceive: Image Editing Diffusion Models Are Strong Dense Perceivers
von: Shi, Yiqing, et al.
Veröffentlicht: (2025)
von: Shi, Yiqing, et al.
Veröffentlicht: (2025)
LLaVA-KD: A Framework of Distilling Multimodal Large Language Models
von: Cai, Yuxuan, et al.
Veröffentlicht: (2024)
von: Cai, Yuxuan, et al.
Veröffentlicht: (2024)
Detecting and Evaluating Medical Hallucinations in Large Vision Language Models
von: Chen, Jiawei, et al.
Veröffentlicht: (2024)
von: Chen, Jiawei, et al.
Veröffentlicht: (2024)
Rethinking The Training And Evaluation of Rich-Context Layout-to-Image Generation
von: Cheng, Jiaxin, et al.
Veröffentlicht: (2024)
von: Cheng, Jiaxin, et al.
Veröffentlicht: (2024)
Draw-In-Mind: Rebalancing Designer-Painter Roles in Unified Multimodal Models Benefits Image Editing
von: Zeng, Ziyun, et al.
Veröffentlicht: (2025)
von: Zeng, Ziyun, et al.
Veröffentlicht: (2025)
Visual Perception by Large Language Model's Weights
von: Ma, Feipeng, et al.
Veröffentlicht: (2024)
von: Ma, Feipeng, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Bridging Information Asymmetry in Text-video Retrieval: A Data-centric Approach
von: Bai, Zechen, et al.
Veröffentlicht: (2024) -
Skip \n: A Simple Method to Reduce Hallucination in Large Vision-Language Models
von: Han, Zongbo, et al.
Veröffentlicht: (2024) -
Factorized Visual Tokenization and Generation
von: Bai, Zechen, et al.
Veröffentlicht: (2024) -
One Token to Seg Them All: Language Instructed Reasoning Segmentation in Videos
von: Bai, Zechen, et al.
Veröffentlicht: (2024) -
EVOLVE-VLA: Test-Time Training from Environment Feedback for Vision-Language-Action Models
von: Bai, Zechen, et al.
Veröffentlicht: (2025)