PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Yixuan, Zhang, Yang, Wu, Jian, Torr, Philip, Gu, Jindong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
An Image Is Worth 1000 Lies: Adversarial Transferability across Prompts on Vision-Language Models
par: Luo, Haochen, et autres
Publié: (2024)
par: Luo, Haochen, et autres
Publié: (2024)
Influencer Backdoor Attack on Semantic Segmentation
par: Lan, Haoheng, et autres
Publié: (2023)
par: Lan, Haoheng, et autres
Publié: (2023)
Self-Discovering Interpretable Diffusion Latent Directions for Responsible Text-to-Image Generation
par: Li, Hang, et autres
Publié: (2023)
par: Li, Hang, et autres
Publié: (2023)
As Firm As Their Foundations: Can open-sourced foundation models be used to create adversarial examples for downstream tasks?
par: Hu, Anjun, et autres
Publié: (2024)
par: Hu, Anjun, et autres
Publié: (2024)
Which Model Generated This Image? A Model-Agnostic Approach for Origin Attribution
par: Liu, Fengyuan, et autres
Publié: (2024)
par: Liu, Fengyuan, et autres
Publié: (2024)
From Pixels to Feelings: Aligning MLLMs with Human Cognitive Perception of Images
par: Chen, Yiming, et autres
Publié: (2025)
par: Chen, Yiming, et autres
Publié: (2025)
Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models
par: Xing, Songlong, et autres
Publié: (2026)
par: Xing, Songlong, et autres
Publié: (2026)
Visual Jigsaw Post-Training Improves MLLMs
par: Wu, Penghao, et autres
Publié: (2025)
par: Wu, Penghao, et autres
Publié: (2025)
Improving Adversarial Transferability in MLLMs via Dynamic Vision-Language Alignment Attack
par: Gu, Chenhe, et autres
Publié: (2025)
par: Gu, Chenhe, et autres
Publié: (2025)
Localizing Events in Videos with Multimodal Queries
par: Zhang, Gengyuan, et autres
Publié: (2024)
par: Zhang, Gengyuan, et autres
Publié: (2024)
Learning Visual Prompts for Guiding the Attention of Vision Transformers
par: Rezaei, Razieh, et autres
Publié: (2024)
par: Rezaei, Razieh, et autres
Publié: (2024)
True Multimodal In-Context Learning Needs Attention to the Visual Context
par: Chen, Shuo, et autres
Publié: (2025)
par: Chen, Shuo, et autres
Publié: (2025)
Improving Adversarial Transferability via Model Alignment
par: Ma, Avery, et autres
Publié: (2023)
par: Ma, Avery, et autres
Publié: (2023)
AlignGuard: Scalable Safety Alignment for Text-to-Image Generation
par: Liu, Runtao, et autres
Publié: (2024)
par: Liu, Runtao, et autres
Publié: (2024)
DetToolChain: A New Prompting Paradigm to Unleash Detection Ability of MLLM
par: Wu, Yixuan, et autres
Publié: (2024)
par: Wu, Yixuan, et autres
Publié: (2024)
SpaceMind++: Toward Allocentric Cognitive Maps for Spatially Grounded Video MLLMs
par: Gu, Bo, et autres
Publié: (2026)
par: Gu, Bo, et autres
Publié: (2026)
GroundingME: Exposing the Visual Grounding Gap in MLLMs through Multi-Dimensional Evaluation
par: Li, Rang, et autres
Publié: (2025)
par: Li, Rang, et autres
Publié: (2025)
Can Multimodal Large Language Models Truly Perform Multimodal In-Context Learning?
par: Chen, Shuo, et autres
Publié: (2023)
par: Chen, Shuo, et autres
Publié: (2023)
Open Eyes, Then Reason: Fine-grained Visual Mathematical Understanding in MLLMs
par: Zhang, Shan, et autres
Publié: (2025)
par: Zhang, Shan, et autres
Publié: (2025)
Latent Guard: a Safety Framework for Text-to-image Generation
par: Liu, Runtao, et autres
Publié: (2024)
par: Liu, Runtao, et autres
Publié: (2024)
Inducing High Energy-Latency of Large Vision-Language Models with Verbose Images
par: Gao, Kuofeng, et autres
Publié: (2024)
par: Gao, Kuofeng, et autres
Publié: (2024)
Energy-Latency Manipulation of Multi-modal Large Language Models via Verbose Samples
par: Gao, Kuofeng, et autres
Publié: (2024)
par: Gao, Kuofeng, et autres
Publié: (2024)
OmniAlign-V: Towards Enhanced Alignment of MLLMs with Human Preference
par: Zhao, Xiangyu, et autres
Publié: (2025)
par: Zhao, Xiangyu, et autres
Publié: (2025)
CodePercept: Code-Grounded Visual STEM Perception for MLLMs
par: Guan, Tongkun, et autres
Publié: (2026)
par: Guan, Tongkun, et autres
Publié: (2026)
Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark
par: Hao, Yunzhuo, et autres
Publié: (2025)
par: Hao, Yunzhuo, et autres
Publié: (2025)
Self-Ensemble Post Learning for Noisy Domain Generalization
par: Lu, Wang, et autres
Publié: (2025)
par: Lu, Wang, et autres
Publié: (2025)
The Perceptual Observatory Characterizing Robustness and Grounding in MLLMs
par: Anvekar, Tejas, et autres
Publié: (2025)
par: Anvekar, Tejas, et autres
Publié: (2025)
AlignedGen: Aligning Style Across Generated Images
par: Zhang, Jiexuan, et autres
Publié: (2025)
par: Zhang, Jiexuan, et autres
Publié: (2025)
Latent Sketchpad: Sketching Visual Thoughts to Elicit Multimodal Reasoning in MLLMs
par: Zhang, Huanyu, et autres
Publié: (2025)
par: Zhang, Huanyu, et autres
Publié: (2025)
RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs
par: Li, Hongliang, et autres
Publié: (2025)
par: Li, Hongliang, et autres
Publié: (2025)
Improving the Reasoning of Multi-Image Grounding in MLLMs via Reinforcement Learning
par: Zhang, Bob, et autres
Publié: (2025)
par: Zhang, Bob, et autres
Publié: (2025)
Seeing is Believing: Rich-Context Hallucination Detection for MLLMs via Backward Visual Grounding
par: Guo, Pinxue, et autres
Publié: (2025)
par: Guo, Pinxue, et autres
Publié: (2025)
MC-Bench: A Benchmark for Multi-Context Visual Grounding in the Era of MLLMs
par: Xu, Yunqiu, et autres
Publié: (2024)
par: Xu, Yunqiu, et autres
Publié: (2024)
Sketch-in-Latents: Eliciting Unified Reasoning in MLLMs
par: Tong, Jintao, et autres
Publié: (2025)
par: Tong, Jintao, et autres
Publié: (2025)
Multimodal Pragmatic Jailbreak on Text-to-image Models
par: Liu, Tong, et autres
Publié: (2024)
par: Liu, Tong, et autres
Publié: (2024)
Minimalist Concept Erasure in Generative Models
par: Zhang, Yang, et autres
Publié: (2025)
par: Zhang, Yang, et autres
Publié: (2025)
STORM: Benchmarking Visual Rating of MLLMs with a Comprehensive Ordinal Regression Dataset
par: Wang, Jinhong, et autres
Publié: (2025)
par: Wang, Jinhong, et autres
Publié: (2025)
ExpAlign: Expectation-Guided Vision-Language Alignment for Open-Vocabulary Grounding
par: Hu, Junyi, et autres
Publié: (2026)
par: Hu, Junyi, et autres
Publié: (2026)
MM-SafetyBench: A Benchmark for Safety Evaluation of Multimodal Large Language Models
par: Liu, Xin, et autres
Publié: (2023)
par: Liu, Xin, et autres
Publié: (2023)
SliceLens: Fine-Grained and Grounded Error Slice Discovery for Multi-Instance Vision Tasks
par: Zhang, Wei, et autres
Publié: (2025)
par: Zhang, Wei, et autres
Publié: (2025)
Documents similaires
-
An Image Is Worth 1000 Lies: Adversarial Transferability across Prompts on Vision-Language Models
par: Luo, Haochen, et autres
Publié: (2024) -
Influencer Backdoor Attack on Semantic Segmentation
par: Lan, Haoheng, et autres
Publié: (2023) -
Self-Discovering Interpretable Diffusion Latent Directions for Responsible Text-to-Image Generation
par: Li, Hang, et autres
Publié: (2023) -
As Firm As Their Foundations: Can open-sourced foundation models be used to create adversarial examples for downstream tasks?
par: Hu, Anjun, et autres
Publié: (2024) -
Which Model Generated This Image? A Model-Agnostic Approach for Origin Attribution
par: Liu, Fengyuan, et autres
Publié: (2024)