NoiseBoost: Alleviating Hallucination with Noise Perturbation for Multimodal Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Kai, Jiang, Boyuan, Jiang, Zhengkai, He, Qingdong, Luo, Donghao, Wang, Shengzhi, Liu, Qingwen, Wang, Chengjie |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AdapNet: Adaptive Noise-Based Network for Low-Quality Image Retrieval
par: Zhang, Sihe, et autres
Publié: (2024)
par: Zhang, Sihe, et autres
Publié: (2024)
FitDiT: Advancing the Authentic Garment Details for High-fidelity Virtual Try-on
par: Jiang, Boyuan, et autres
Publié: (2024)
par: Jiang, Boyuan, et autres
Publié: (2024)
Unveil Inversion and Invariance in Flow Transformer for Versatile Image Editing
par: Xu, Pengcheng, et autres
Publié: (2024)
par: Xu, Pengcheng, et autres
Publié: (2024)
Efficient Multimodal Large Language Models: A Survey
par: Jin, Yizhang, et autres
Publié: (2024)
par: Jin, Yizhang, et autres
Publié: (2024)
UniM-OV3D: Uni-Modality Open-Vocabulary 3D Scene Understanding with Fine-Grained Feature Representation
par: He, Qingdong, et autres
Publié: (2024)
par: He, Qingdong, et autres
Publié: (2024)
DynamicControl: Adaptive Condition Selection for Improved Text-to-Image Generation
par: He, Qingdong, et autres
Publié: (2024)
par: He, Qingdong, et autres
Publié: (2024)
Boosting Reasoning in Large Multimodal Models via Activation Replay
par: Xing, Yun, et autres
Publié: (2025)
par: Xing, Yun, et autres
Publié: (2025)
PointSeg: A Training-Free Paradigm for 3D Scene Segmentation via Foundation Models
par: He, Qingdong, et autres
Publié: (2024)
par: He, Qingdong, et autres
Publié: (2024)
Human-MME: A Holistic Evaluation Benchmark for Human-Centric Multimodal Large Language Models
par: Liu, Yuansen, et autres
Publié: (2025)
par: Liu, Yuansen, et autres
Publié: (2025)
Leveraging Fine-Grained Information and Noise Decoupling for Remote Sensing Change Detection
par: Du, Qiangang, et autres
Publié: (2024)
par: Du, Qiangang, et autres
Publié: (2024)
VTON-HandFit: Virtual Try-on for Arbitrary Hand Pose Guided by Hand Priors Embedding
par: Liang, Yujie, et autres
Publié: (2024)
par: Liang, Yujie, et autres
Publié: (2024)
Visual-Noise Guided In-Context Distillation for Multimodal Large Language Model Unlearning
par: Chen, Junkai, et autres
Publié: (2026)
par: Chen, Junkai, et autres
Publié: (2026)
QNCD: Quantization Noise Correction for Diffusion Models
par: Chu, Huanpeng, et autres
Publié: (2024)
par: Chu, Huanpeng, et autres
Publié: (2024)
Hallucination of Multimodal Large Language Models: A Survey
par: Bai, Zechen, et autres
Publié: (2024)
par: Bai, Zechen, et autres
Publié: (2024)
CrossVTON: Mimicking the Logic Reasoning on Cross-category Virtual Try-on guided by Tri-zone Priors
par: Luo, Donghao, et autres
Publié: (2025)
par: Luo, Donghao, et autres
Publié: (2025)
Realistic Noise Synthesis with Diffusion Models
par: Wu, Qi, et autres
Publié: (2023)
par: Wu, Qi, et autres
Publié: (2023)
Alleviating Hallucinations in Large Vision-Language Models through Hallucination-Induced Optimization
par: Lyu, Xinyu, et autres
Publié: (2024)
par: Lyu, Xinyu, et autres
Publié: (2024)
Towards Generalized Multi-Image Editing for Unified Multimodal Models
par: Xu, Pengcheng, et autres
Publié: (2026)
par: Xu, Pengcheng, et autres
Publié: (2026)
Seeing is Believing? Mitigating OCR Hallucinations in Multimodal Large Language Models
par: He, Zhentao, et autres
Publié: (2025)
par: He, Zhentao, et autres
Publié: (2025)
DiffuMatting: Synthesizing Arbitrary Objects with Matting-level Annotation
par: Hu, Xiaobin, et autres
Publié: (2024)
par: Hu, Xiaobin, et autres
Publié: (2024)
Self-Introspective Decoding: Alleviating Hallucinations for Large Vision-Language Models
par: Huo, Fushuo, et autres
Publié: (2024)
par: Huo, Fushuo, et autres
Publié: (2024)
OPERA: Alleviating Hallucination in Multi-Modal Large Language Models via Over-Trust Penalty and Retrospection-Allocation
par: Huang, Qidong, et autres
Publié: (2023)
par: Huang, Qidong, et autres
Publié: (2023)
Hallucination Augmented Contrastive Learning for Multimodal Large Language Model
par: Jiang, Chaoya, et autres
Publié: (2023)
par: Jiang, Chaoya, et autres
Publié: (2023)
Is Noise Conditioning Necessary for Denoising Generative Models?
par: Sun, Qiao, et autres
Publié: (2025)
par: Sun, Qiao, et autres
Publié: (2025)
Safeguarding Vision-Language Models: Mitigating Vulnerabilities to Gaussian Noise in Perturbation-based Attacks
par: Wang, Jiawei, et autres
Publié: (2025)
par: Wang, Jiawei, et autres
Publié: (2025)
PointRWKV: Efficient RWKV-Like Model for Hierarchical Point Cloud Learning
par: He, Qingdong, et autres
Publié: (2024)
par: He, Qingdong, et autres
Publié: (2024)
IRPO: Boosting Image Restoration via Post-training GRPO
par: Xu, Haoxuan, et autres
Publié: (2025)
par: Xu, Haoxuan, et autres
Publié: (2025)
Poison as Cure: Visual Noise for Mitigating Object Hallucinations in LVMs
par: Zhang, Kejia, et autres
Publié: (2025)
par: Zhang, Kejia, et autres
Publié: (2025)
ArtWeaver: Advanced Dynamic Style Integration via Diffusion Model
par: Xu, Chengming, et autres
Publié: (2024)
par: Xu, Chengming, et autres
Publié: (2024)
Debiasing Multimodal Large Language Models via Noise-Aware Preference Optimization
par: Zhang, Zefeng, et autres
Publié: (2025)
par: Zhang, Zefeng, et autres
Publié: (2025)
Detecting and Evaluating Medical Hallucinations in Large Vision Language Models
par: Chen, Jiawei, et autres
Publié: (2024)
par: Chen, Jiawei, et autres
Publié: (2024)
KVSmooth: Mitigating Hallucination in Multi-modal Large Language Models through Key-Value Smoothing
par: Jiang, Siyu, et autres
Publié: (2026)
par: Jiang, Siyu, et autres
Publié: (2026)
IBD: Alleviating Hallucinations in Large Vision-Language Models via Image-Biased Decoding
par: Zhu, Lanyun, et autres
Publié: (2024)
par: Zhu, Lanyun, et autres
Publié: (2024)
Dynamic Multimodal Activation Steering for Hallucination Mitigation in Large Vision-Language Models
par: Yin, Jianghao, et autres
Publié: (2026)
par: Yin, Jianghao, et autres
Publié: (2026)
LLaVA-KD: A Framework of Distilling Multimodal Large Language Models
par: Cai, Yuxuan, et autres
Publié: (2024)
par: Cai, Yuxuan, et autres
Publié: (2024)
Survey of Adversarial Robustness in Multimodal Large Language Models
par: Jiang, Chengze, et autres
Publié: (2025)
par: Jiang, Chengze, et autres
Publié: (2025)
Verb Mirage: Unveiling and Assessing Verb Concept Hallucinations in Multimodal Large Language Models
par: Wang, Zehao, et autres
Publié: (2024)
par: Wang, Zehao, et autres
Publié: (2024)
Look Carefully: Adaptive Visual Reinforcements in Multimodal Large Language Models for Hallucination Mitigation
par: Zhu, Xingyu, et autres
Publié: (2026)
par: Zhu, Xingyu, et autres
Publié: (2026)
Causal Decoding for Hallucination-Resistant Multimodal Large Language Models
par: Tan, Shiwei, et autres
Publié: (2026)
par: Tan, Shiwei, et autres
Publié: (2026)
Collaborative Multi-Mode Pruning for Vision-Language Models
par: Wu, Zimeng, et autres
Publié: (2026)
par: Wu, Zimeng, et autres
Publié: (2026)
Documents similaires
-
AdapNet: Adaptive Noise-Based Network for Low-Quality Image Retrieval
par: Zhang, Sihe, et autres
Publié: (2024) -
FitDiT: Advancing the Authentic Garment Details for High-fidelity Virtual Try-on
par: Jiang, Boyuan, et autres
Publié: (2024) -
Unveil Inversion and Invariance in Flow Transformer for Versatile Image Editing
par: Xu, Pengcheng, et autres
Publié: (2024) -
Efficient Multimodal Large Language Models: A Survey
par: Jin, Yizhang, et autres
Publié: (2024) -
UniM-OV3D: Uni-Modality Open-Vocabulary 3D Scene Understanding with Fine-Grained Feature Representation
par: He, Qingdong, et autres
Publié: (2024)