The Cost of Language: Centroid Erasure Exposes and Exploits Modal Competition in Multimodal Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Paruchuri, Akshay, Chatterjee, Ishan, Fuchs, Henry, Adeli, Ehsan, Didyk, Piotr |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Images are Achilles' Heel of Alignment: Exploiting Visual Vulnerabilities for Jailbreaking Multimodal Large Language Models
di: Li, Yifan, et al.
Pubblicazione: (2024)
di: Li, Yifan, et al.
Pubblicazione: (2024)
Summarization of Multimodal Presentations with Vision-Language Models: Study of the Effect of Modalities and Structure
di: Gigant, Théo, et al.
Pubblicazione: (2025)
di: Gigant, Théo, et al.
Pubblicazione: (2025)
ESREAL: Exploiting Semantic Reconstruction to Mitigate Hallucinations in Vision-Language Models
di: Kim, Minchan, et al.
Pubblicazione: (2024)
di: Kim, Minchan, et al.
Pubblicazione: (2024)
Robust Multimodal Large Language Models Against Modality Conflict
di: Zhang, Zongmeng, et al.
Pubblicazione: (2025)
di: Zhang, Zongmeng, et al.
Pubblicazione: (2025)
LEO-MINI: An Efficient Multimodal Large Language Model using Conditional Token Reduction and Mixture of Multi-Modal Experts
di: Wang, Yimu, et al.
Pubblicazione: (2025)
di: Wang, Yimu, et al.
Pubblicazione: (2025)
CURE: Centroid-guided Unsupervised Representation Erasure for Facial Recognition Systems
di: Shivam, Fnu, et al.
Pubblicazione: (2025)
di: Shivam, Fnu, et al.
Pubblicazione: (2025)
Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate
di: Huang, Qidong, et al.
Pubblicazione: (2024)
di: Huang, Qidong, et al.
Pubblicazione: (2024)
Learning to Exploit Temporal Structure for Biomedical Vision-Language Processing
di: Bannur, Shruthi, et al.
Pubblicazione: (2023)
di: Bannur, Shruthi, et al.
Pubblicazione: (2023)
ColorSwap: A Color and Word Order Dataset for Multimodal Evaluation
di: Burapacheep, Jirayu, et al.
Pubblicazione: (2024)
di: Burapacheep, Jirayu, et al.
Pubblicazione: (2024)
Temporal Image Caption Retrieval Competition -- Description and Results
di: Pokrywka, Jakub, et al.
Pubblicazione: (2024)
di: Pokrywka, Jakub, et al.
Pubblicazione: (2024)
Reka Core, Flash, and Edge: A Series of Powerful Multimodal Language Models
di: Reka Team, et al.
Pubblicazione: (2024)
di: Reka Team, et al.
Pubblicazione: (2024)
Can We Predict Performance of Large Models across Vision-Language Tasks?
di: Zhao, Qinyu, et al.
Pubblicazione: (2024)
di: Zhao, Qinyu, et al.
Pubblicazione: (2024)
Cross-Modal Obfuscation for Jailbreak Attacks on Large Vision-Language Models
di: Jiang, Lei, et al.
Pubblicazione: (2025)
di: Jiang, Lei, et al.
Pubblicazione: (2025)
Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language Models
di: Zhu, Tinghui, et al.
Pubblicazione: (2024)
di: Zhu, Tinghui, et al.
Pubblicazione: (2024)
Do Multimodal Large Language Models Understand Welding?
di: Khvatskii, Grigorii, et al.
Pubblicazione: (2025)
di: Khvatskii, Grigorii, et al.
Pubblicazione: (2025)
EgoTrigger: Toward Audio-Driven Image Capture for Human Memory Enhancement in All-Day Energy-Efficient Smart Glasses
di: Paruchuri, Akshay, et al.
Pubblicazione: (2025)
di: Paruchuri, Akshay, et al.
Pubblicazione: (2025)
A Comprehensive Analysis for Visual Object Hallucination in Large Vision-Language Models
di: Jing, Liqiang, et al.
Pubblicazione: (2025)
di: Jing, Liqiang, et al.
Pubblicazione: (2025)
Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation
di: Liang, Yupu, et al.
Pubblicazione: (2025)
di: Liang, Yupu, et al.
Pubblicazione: (2025)
The First to Know: How Token Distributions Reveal Hidden Knowledge in Large Vision-Language Models?
di: Zhao, Qinyu, et al.
Pubblicazione: (2024)
di: Zhao, Qinyu, et al.
Pubblicazione: (2024)
LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model
di: Zhu, Yichen, et al.
Pubblicazione: (2024)
di: Zhu, Yichen, et al.
Pubblicazione: (2024)
A Spectrum Evaluation Benchmark for Medical Multi-Modal Large Language Models
di: Liu, Jie, et al.
Pubblicazione: (2024)
di: Liu, Jie, et al.
Pubblicazione: (2024)
Scaffolding Coordinates to Promote Vision-Language Coordination in Large Multi-Modal Models
di: Lei, Xuanyu, et al.
Pubblicazione: (2024)
di: Lei, Xuanyu, et al.
Pubblicazione: (2024)
How to Bridge the Gap between Modalities: Survey on Multimodal Large Language Model
di: Song, Shezheng, et al.
Pubblicazione: (2023)
di: Song, Shezheng, et al.
Pubblicazione: (2023)
Modality-Aware and Anatomical Vector-Quantized Autoencoding for Multimodal Brain MRI
di: Li, Mingjie, et al.
Pubblicazione: (2026)
di: Li, Mingjie, et al.
Pubblicazione: (2026)
Plug-and-Play Grounding of Reasoning in Multimodal Large Language Models
di: Chen, Jiaxing, et al.
Pubblicazione: (2024)
di: Chen, Jiaxing, et al.
Pubblicazione: (2024)
Multimodal Abstractive Summarization of Instructional Videos with Vision-Language Models
di: Nazir, Maham, et al.
Pubblicazione: (2026)
di: Nazir, Maham, et al.
Pubblicazione: (2026)
The Impact of Image Resolution on Biomedical Multimodal Large Language Models
di: Chen, Liangyu, et al.
Pubblicazione: (2025)
di: Chen, Liangyu, et al.
Pubblicazione: (2025)
Optimizing Multimodal Language Models through Attention-based Interpretability
di: Sergeev, Alexander, et al.
Pubblicazione: (2025)
di: Sergeev, Alexander, et al.
Pubblicazione: (2025)
Can Large Vision-Language Models Understand Multimodal Sarcasm?
di: Wang, Xinyu, et al.
Pubblicazione: (2025)
di: Wang, Xinyu, et al.
Pubblicazione: (2025)
LLAVADI: What Matters For Multimodal Large Language Models Distillation
di: Xu, Shilin, et al.
Pubblicazione: (2024)
di: Xu, Shilin, et al.
Pubblicazione: (2024)
Strengthening Multimodal Large Language Model with Bootstrapped Preference Optimization
di: Pi, Renjie, et al.
Pubblicazione: (2024)
di: Pi, Renjie, et al.
Pubblicazione: (2024)
Modality-Specialized Synergizers for Interleaved Vision-Language Generalists
di: Xu, Zhiyang, et al.
Pubblicazione: (2024)
di: Xu, Zhiyang, et al.
Pubblicazione: (2024)
Modality-Agnostic fMRI Decoding of Vision and Language
di: Nikolaus, Mitja, et al.
Pubblicazione: (2024)
di: Nikolaus, Mitja, et al.
Pubblicazione: (2024)
AdaVid: Adaptive Video-Language Pretraining
di: Patel, Chaitanya, et al.
Pubblicazione: (2025)
di: Patel, Chaitanya, et al.
Pubblicazione: (2025)
LLM2CLIP: Powerful Language Model Unlocks Richer Cross-Modality Representation
di: Huang, Weiquan, et al.
Pubblicazione: (2024)
di: Huang, Weiquan, et al.
Pubblicazione: (2024)
Model Merging to Maintain Language-Only Performance in Developmentally Plausible Multimodal Models
di: Takmaz, Ece, et al.
Pubblicazione: (2025)
di: Takmaz, Ece, et al.
Pubblicazione: (2025)
ODE: Open-Set Evaluation of Hallucinations in Multimodal Large Language Models
di: Tu, Yahan, et al.
Pubblicazione: (2024)
di: Tu, Yahan, et al.
Pubblicazione: (2024)
EmotionHallucer: Evaluating Emotion Hallucinations in Multimodal Large Language Models
di: Xing, Bohao, et al.
Pubblicazione: (2025)
di: Xing, Bohao, et al.
Pubblicazione: (2025)
Exploring Multimodal Large Language Models for Radiology Report Error-checking
di: Wu, Jinge, et al.
Pubblicazione: (2023)
di: Wu, Jinge, et al.
Pubblicazione: (2023)
Mipha: A Comprehensive Overhaul of Multimodal Assistant with Small Language Models
di: Zhu, Minjie, et al.
Pubblicazione: (2024)
di: Zhu, Minjie, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Images are Achilles' Heel of Alignment: Exploiting Visual Vulnerabilities for Jailbreaking Multimodal Large Language Models
di: Li, Yifan, et al.
Pubblicazione: (2024) -
Summarization of Multimodal Presentations with Vision-Language Models: Study of the Effect of Modalities and Structure
di: Gigant, Théo, et al.
Pubblicazione: (2025) -
ESREAL: Exploiting Semantic Reconstruction to Mitigate Hallucinations in Vision-Language Models
di: Kim, Minchan, et al.
Pubblicazione: (2024) -
Robust Multimodal Large Language Models Against Modality Conflict
di: Zhang, Zongmeng, et al.
Pubblicazione: (2025) -
LEO-MINI: An Efficient Multimodal Large Language Model using Conditional Token Reduction and Mixture of Multi-Modal Experts
di: Wang, Yimu, et al.
Pubblicazione: (2025)