The Instinctive Bias: Spurious Images lead to Illusion in MLLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Han, Tianyang, Lian, Qing, Pan, Rui, Pi, Renjie, Zhang, Jipeng, Diao, Shizhe, Lin, Yong, Zhang, Tong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Strengthening Multimodal Large Language Model with Bootstrapped Preference Optimization
por: Pi, Renjie, et al.
Publicado: (2024)
por: Pi, Renjie, et al.
Publicado: (2024)
MLLM-Protector: Ensuring MLLM's Safety without Hurting Performance
por: Pi, Renjie, et al.
Publicado: (2024)
por: Pi, Renjie, et al.
Publicado: (2024)
Image Textualization: An Automatic Framework for Creating Accurate and Detailed Image Descriptions
por: Pi, Renjie, et al.
Publicado: (2024)
por: Pi, Renjie, et al.
Publicado: (2024)
LISA: Layerwise Importance Sampling for Memory-Efficient Large Language Model Fine-Tuning
por: Pan, Rui, et al.
Publicado: (2024)
por: Pan, Rui, et al.
Publicado: (2024)
Personalized Visual Instruction Tuning
por: Pi, Renjie, et al.
Publicado: (2024)
por: Pi, Renjie, et al.
Publicado: (2024)
Adapt-Pruner: Adaptive Structural Pruning for Efficient Small Language Model Training
por: Pan, Rui, et al.
Publicado: (2025)
por: Pan, Rui, et al.
Publicado: (2025)
VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training
por: Zhang, Jipeng, et al.
Publicado: (2025)
por: Zhang, Jipeng, et al.
Publicado: (2025)
MA-LoT: Model-Collaboration Lean-based Long Chain-of-Thought Reasoning enhances Formal Theorem Proving
por: Wang, Ruida, et al.
Publicado: (2025)
por: Wang, Ruida, et al.
Publicado: (2025)
Generalizable Geometric Image Caption Synthesis
por: Xin, Yue, et al.
Publicado: (2025)
por: Xin, Yue, et al.
Publicado: (2025)
Active Prompting with Chain-of-Thought for Large Language Models
por: Diao, Shizhe, et al.
Publicado: (2023)
por: Diao, Shizhe, et al.
Publicado: (2023)
TAGCOS: Task-agnostic Gradient Clustered Coreset Selection for Instruction Tuning Data
por: Zhang, Jipeng, et al.
Publicado: (2024)
por: Zhang, Jipeng, et al.
Publicado: (2024)
TheoremLlama: Transforming General-Purpose LLMs into Lean4 Experts
por: Wang, Ruida, et al.
Publicado: (2024)
por: Wang, Ruida, et al.
Publicado: (2024)
LMFlow: An Extensible Toolkit for Finetuning and Inference of Large Foundation Models
por: Diao, Shizhe, et al.
Publicado: (2023)
por: Diao, Shizhe, et al.
Publicado: (2023)
Bridge-Coder: Unlocking LLMs' Potential to Overcome Language Gaps in Low-Resource Code
por: Zhang, Jipeng, et al.
Publicado: (2024)
por: Zhang, Jipeng, et al.
Publicado: (2024)
Automatic Prompt Augmentation and Selection with Chain-of-Thought from Labeled Data
por: Shum, KaShun, et al.
Publicado: (2023)
por: Shum, KaShun, et al.
Publicado: (2023)
R-Tuning: Instructing Large Language Models to Say `I Don't Know'
por: Zhang, Hanning, et al.
Publicado: (2023)
por: Zhang, Hanning, et al.
Publicado: (2023)
The Side Effects of Being Smart: Safety Risks in MLLMs' Multi-Image Reasoning
por: Chen, Renmiao, et al.
Publicado: (2026)
por: Chen, Renmiao, et al.
Publicado: (2026)
Entropy-Regularized Process Reward Model
por: Zhang, Hanning, et al.
Publicado: (2024)
por: Zhang, Hanning, et al.
Publicado: (2024)
Can MLLMs Understand the Deep Implication Behind Chinese Images?
por: Zhang, Chenhao, et al.
Publicado: (2024)
por: Zhang, Chenhao, et al.
Publicado: (2024)
Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective Rewards
por: Wang, Haoxiang, et al.
Publicado: (2024)
por: Wang, Haoxiang, et al.
Publicado: (2024)
The Illusion-Illusion: Vision Language Models See Illusions Where There are None
por: Ullman, Tomer
Publicado: (2024)
por: Ullman, Tomer
Publicado: (2024)
Unhackable Temporal Rewarding for Scalable Video MLLMs
por: Yu, En, et al.
Publicado: (2025)
por: Yu, En, et al.
Publicado: (2025)
IllusionVQA: A Challenging Optical Illusion Dataset for Vision Language Models
por: Shahgir, Haz Sameen, et al.
Publicado: (2024)
por: Shahgir, Haz Sameen, et al.
Publicado: (2024)
MedRCube: A Multidimensional Framework for Fine-Grained and In-Depth Evaluation of MLLMs in Medical Imaging
por: Bao, Zhijie, et al.
Publicado: (2026)
por: Bao, Zhijie, et al.
Publicado: (2026)
Interpretable and Reliable Detection of AI-Generated Images via Grounded Reasoning in MLLMs
por: Ji, Yikun, et al.
Publicado: (2025)
por: Ji, Yikun, et al.
Publicado: (2025)
GRIT: Teaching MLLMs to Think with Images
por: Fan, Yue, et al.
Publicado: (2025)
por: Fan, Yue, et al.
Publicado: (2025)
Linking Perception, Confidence and Accuracy in MLLMs
por: Du, Yuetian, et al.
Publicado: (2026)
por: Du, Yuetian, et al.
Publicado: (2026)
Latent Sketchpad: Sketching Visual Thoughts to Elicit Multimodal Reasoning in MLLMs
por: Zhang, Huanyu, et al.
Publicado: (2025)
por: Zhang, Huanyu, et al.
Publicado: (2025)
Tables as Texts or Images: Evaluating the Table Reasoning Ability of LLMs and MLLMs
por: Deng, Naihao, et al.
Publicado: (2024)
por: Deng, Naihao, et al.
Publicado: (2024)
FIRST: Teach A Reliable Large Language Model Through Efficient Trustworthy Distillation
por: Shum, KaShun, et al.
Publicado: (2024)
por: Shum, KaShun, et al.
Publicado: (2024)
Benchmarking Spurious Bias in Few-Shot Image Classifiers
por: Zheng, Guangtao, et al.
Publicado: (2024)
por: Zheng, Guangtao, et al.
Publicado: (2024)
A Sober Look at the Robustness of CLIPs to Spurious Features
por: Wang, Qizhou, et al.
Publicado: (2024)
por: Wang, Qizhou, et al.
Publicado: (2024)
Localize-and-Stitch: Efficient Model Merging via Sparse Task Arithmetic
por: He, Yifei, et al.
Publicado: (2024)
por: He, Yifei, et al.
Publicado: (2024)
p-MoD: Building Mixture-of-Depths MLLMs via Progressive Ratio Decay
por: Zhang, Jun, et al.
Publicado: (2024)
por: Zhang, Jun, et al.
Publicado: (2024)
AMBER: An LLM-free Multi-dimensional Benchmark for MLLMs Hallucination Evaluation
por: Wang, Junyang, et al.
Publicado: (2023)
por: Wang, Junyang, et al.
Publicado: (2023)
Seeing from Another Perspective: Evaluating Multi-View Understanding in MLLMs
por: Yeh, Chun-Hsiao, et al.
Publicado: (2025)
por: Yeh, Chun-Hsiao, et al.
Publicado: (2025)
Seeing the Poem: Image-Semantic Detection of AI-Generated Modern Chinese Poetry with MLLMs
por: Wang, Shanshan, et al.
Publicado: (2026)
por: Wang, Shanshan, et al.
Publicado: (2026)
ExeSQL: Self-Taught Text-to-SQL Models with Execution-Driven Bootstrapping for SQL Dialects
por: Zhang, Jipeng, et al.
Publicado: (2025)
por: Zhang, Jipeng, et al.
Publicado: (2025)
CoCA: Regaining Safety-awareness of Multimodal Large Language Models with Constitutional Calibration
por: Gao, Jiahui, et al.
Publicado: (2024)
por: Gao, Jiahui, et al.
Publicado: (2024)
Exploring the Design Space of Visual Context Representation in Video MLLMs
por: Du, Yifan, et al.
Publicado: (2024)
por: Du, Yifan, et al.
Publicado: (2024)
Ejemplares similares
-
Strengthening Multimodal Large Language Model with Bootstrapped Preference Optimization
por: Pi, Renjie, et al.
Publicado: (2024) -
MLLM-Protector: Ensuring MLLM's Safety without Hurting Performance
por: Pi, Renjie, et al.
Publicado: (2024) -
Image Textualization: An Automatic Framework for Creating Accurate and Detailed Image Descriptions
por: Pi, Renjie, et al.
Publicado: (2024) -
LISA: Layerwise Importance Sampling for Memory-Efficient Large Language Model Fine-Tuning
por: Pan, Rui, et al.
Publicado: (2024) -
Personalized Visual Instruction Tuning
por: Pi, Renjie, et al.
Publicado: (2024)