Debiasing Multimodal Large Language Models via Penalization of Language Priors
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhang, YiFan, Shi, Yang, Yu, Weichen, Wen, Qingsong, Wang, Xue, Yang, Wenjing, Zhang, Zhang, Wang, Liang, Jin, Rong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models
von: Zhang, Yi-Fan, et al.
Veröffentlicht: (2024)
von: Zhang, Yi-Fan, et al.
Veröffentlicht: (2024)
Debiasing Multimodal Large Language Models via Noise-Aware Preference Optimization
von: Zhang, Zefeng, et al.
Veröffentlicht: (2025)
von: Zhang, Zefeng, et al.
Veröffentlicht: (2025)
Prompt-Aware Adapter: Towards Learning Adaptive Visual Tokens for Multimodal Large Language Models
von: Zhang, Yue, et al.
Veröffentlicht: (2024)
von: Zhang, Yue, et al.
Veröffentlicht: (2024)
ChatTracker: Enhancing Visual Tracking Performance via Chatting with Multimodal Large Language Model
von: Sun, Yiming, et al.
Veröffentlicht: (2024)
von: Sun, Yiming, et al.
Veröffentlicht: (2024)
MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?
von: Zhang, Yi-Fan, et al.
Veröffentlicht: (2024)
von: Zhang, Yi-Fan, et al.
Veröffentlicht: (2024)
Mavors: Multi-granularity Video Representation for Multimodal Large Language Model
von: Shi, Yang, et al.
Veröffentlicht: (2025)
von: Shi, Yang, et al.
Veröffentlicht: (2025)
Towards Multimodal Sentiment Analysis Debiasing via Bias Purification
von: Yang, Dingkang, et al.
Veröffentlicht: (2024)
von: Yang, Dingkang, et al.
Veröffentlicht: (2024)
Image Regeneration: Evaluating Text-to-Image Model via Generating Identical Image with Multimodal Large Language Models
von: Meng, Chutian, et al.
Veröffentlicht: (2024)
von: Meng, Chutian, et al.
Veröffentlicht: (2024)
Assessment of Multimodal Large Language Models in Alignment with Human Values
von: Shi, Zhelun, et al.
Veröffentlicht: (2024)
von: Shi, Zhelun, et al.
Veröffentlicht: (2024)
LanP: Rethinking the Impact of Language Priors in Large Vision-Language Models
von: Wu, Zongyu, et al.
Veröffentlicht: (2025)
von: Wu, Zongyu, et al.
Veröffentlicht: (2025)
Dynamic Multimodal Evaluation with Flexible Complexity by Vision-Language Bootstrapping
von: Yang, Yue, et al.
Veröffentlicht: (2024)
von: Yang, Yue, et al.
Veröffentlicht: (2024)
GroundVTS: Visual Token Sampling in Multimodal Large Language Models for Video Temporal Grounding
von: Fan, Rong, et al.
Veröffentlicht: (2026)
von: Fan, Rong, et al.
Veröffentlicht: (2026)
Multi-Dimensional Insights: Benchmarking Real-World Personalization in Large Multimodal Models
von: Zhang, YiFan, et al.
Veröffentlicht: (2024)
von: Zhang, YiFan, et al.
Veröffentlicht: (2024)
MCIE: Multimodal LLM-Driven Complex Instruction Image Editing with Spatial Guidance
von: Bai, Xuehai, et al.
Veröffentlicht: (2026)
von: Bai, Xuehai, et al.
Veröffentlicht: (2026)
MM-RLHF: The Next Step Forward in Multimodal LLM Alignment
von: Zhang, Yi-Fan, et al.
Veröffentlicht: (2025)
von: Zhang, Yi-Fan, et al.
Veröffentlicht: (2025)
SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model
von: Yu, Chunlin, et al.
Veröffentlicht: (2024)
von: Yu, Chunlin, et al.
Veröffentlicht: (2024)
OpenHOI: Open-World Hand-Object Interaction Synthesis with Multimodal Large Language Model
von: Zhang, Zhenhao, et al.
Veröffentlicht: (2025)
von: Zhang, Zhenhao, et al.
Veröffentlicht: (2025)
Look Carefully: Adaptive Visual Reinforcements in Multimodal Large Language Models for Hallucination Mitigation
von: Zhu, Xingyu, et al.
Veröffentlicht: (2026)
von: Zhu, Xingyu, et al.
Veröffentlicht: (2026)
Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models
von: Zhang, Quan, et al.
Veröffentlicht: (2024)
von: Zhang, Quan, et al.
Veröffentlicht: (2024)
On the Out-Of-Distribution Generalization of Multimodal Large Language Models
von: Zhang, Xingxuan, et al.
Veröffentlicht: (2024)
von: Zhang, Xingxuan, et al.
Veröffentlicht: (2024)
Time-VLM: Exploring Multimodal Vision-Language Models for Augmented Time Series Forecasting
von: Zhong, Siru, et al.
Veröffentlicht: (2025)
von: Zhong, Siru, et al.
Veröffentlicht: (2025)
A Comprehensive Study of Multimodal Large Language Models for Image Quality Assessment
von: Wu, Tianhe, et al.
Veröffentlicht: (2024)
von: Wu, Tianhe, et al.
Veröffentlicht: (2024)
Proactive Reasoning-with-Retrieval Framework for Medical Multimodal Large Language Models
von: Wang, Lehan, et al.
Veröffentlicht: (2025)
von: Wang, Lehan, et al.
Veröffentlicht: (2025)
Multimodal Semantic-Aware Automatic Colorization with Diffusion Prior
von: Wang, Han, et al.
Veröffentlicht: (2024)
von: Wang, Han, et al.
Veröffentlicht: (2024)
MMaDA: Multimodal Large Diffusion Language Models
von: Yang, Ling, et al.
Veröffentlicht: (2025)
von: Yang, Ling, et al.
Veröffentlicht: (2025)
Debiasing Vison-Language Models with Text-Only Training
von: Yang, Yunfan, et al.
Veröffentlicht: (2024)
von: Yang, Yunfan, et al.
Veröffentlicht: (2024)
Zero-Reference Low-Light Enhancement via Physical Quadruple Priors
von: Wang, Wenjing, et al.
Veröffentlicht: (2024)
von: Wang, Wenjing, et al.
Veröffentlicht: (2024)
MCRL4OR: Multimodal Contrastive Representation Learning for Off-Road Environmental Perception
von: Yang, Yi, et al.
Veröffentlicht: (2025)
von: Yang, Yi, et al.
Veröffentlicht: (2025)
Griffon-G: Bridging Vision-Language and Vision-Centric Tasks via Large Multimodal Models
von: Zhan, Yufei, et al.
Veröffentlicht: (2024)
von: Zhan, Yufei, et al.
Veröffentlicht: (2024)
InstructEngine: Instruction-driven Text-to-Image Alignment
von: Lu, Xingyu, et al.
Veröffentlicht: (2025)
von: Lu, Xingyu, et al.
Veröffentlicht: (2025)
Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis
von: Wang, Pengfei, et al.
Veröffentlicht: (2025)
von: Wang, Pengfei, et al.
Veröffentlicht: (2025)
Sparse Shortcuts: Facilitating Efficient Fusion in Multimodal Large Language Models
von: Zhang, Jingrui, et al.
Veröffentlicht: (2026)
von: Zhang, Jingrui, et al.
Veröffentlicht: (2026)
AI-Driven Virtual Teacher for Enhanced Educational Efficiency: Leveraging Large Pretrain Models for Autonomous Error Analysis and Correction
von: Xu, Tianlong, et al.
Veröffentlicht: (2024)
von: Xu, Tianlong, et al.
Veröffentlicht: (2024)
GeoLLaVA-8K: Scaling Remote-Sensing Multimodal Large Language Models to 8K Resolution
von: Wang, Fengxiang, et al.
Veröffentlicht: (2025)
von: Wang, Fengxiang, et al.
Veröffentlicht: (2025)
Language as Prior, Vision as Calibration: Metric Scale Recovery for Monocular Depth Estimation
von: Zhan, Mingxia, et al.
Veröffentlicht: (2026)
von: Zhan, Mingxia, et al.
Veröffentlicht: (2026)
Robust Emotion Recognition in Context Debiasing
von: Yang, Dingkang, et al.
Veröffentlicht: (2024)
von: Yang, Dingkang, et al.
Veröffentlicht: (2024)
Mitigating Modality Prior-Induced Hallucinations in Multimodal Large Language Models via Deciphering Attention Causality
von: Zhou, Guanyu, et al.
Veröffentlicht: (2024)
von: Zhou, Guanyu, et al.
Veröffentlicht: (2024)
Towards Language-Driven Video Inpainting via Multimodal Large Language Models
von: Wu, Jianzong, et al.
Veröffentlicht: (2024)
von: Wu, Jianzong, et al.
Veröffentlicht: (2024)
Navigation Instruction Generation with BEV Perception and Large Language Models
von: Fan, Sheng, et al.
Veröffentlicht: (2024)
von: Fan, Sheng, et al.
Veröffentlicht: (2024)
ShaRP: SHAllow-LayeR Pruning for Efficient Video Large Language Models
von: Xia, Yingjie, et al.
Veröffentlicht: (2025)
von: Xia, Yingjie, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models
von: Zhang, Yi-Fan, et al.
Veröffentlicht: (2024) -
Debiasing Multimodal Large Language Models via Noise-Aware Preference Optimization
von: Zhang, Zefeng, et al.
Veröffentlicht: (2025) -
Prompt-Aware Adapter: Towards Learning Adaptive Visual Tokens for Multimodal Large Language Models
von: Zhang, Yue, et al.
Veröffentlicht: (2024) -
ChatTracker: Enhancing Visual Tracking Performance via Chatting with Multimodal Large Language Model
von: Sun, Yiming, et al.
Veröffentlicht: (2024) -
MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?
von: Zhang, Yi-Fan, et al.
Veröffentlicht: (2024)