Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dong, Xinpeng, Zhang, Min, Han, Kairong, Tan, Xu, Wu, Fei, Kuang, Kun |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
V-ITI: Mitigating Hallucinations in Multimodal Large Language Models via Visual Inference-Time Intervention
par: Sun, Nan, et autres
Publié: (2025)
par: Sun, Nan, et autres
Publié: (2025)
Cross-Layer Vision Smoothing: Enhancing Visual Understanding via Sustained Focus on Key Objects in Large Vision-Language Models
par: Zhao, Jianfei, et autres
Publié: (2025)
par: Zhao, Jianfei, et autres
Publié: (2025)
Divide-and-Conquer Inference for Large-Scale Visual Recognition with Multimodal Large Language Models
par: Ye, Zhipeng, et autres
Publié: (2026)
par: Ye, Zhipeng, et autres
Publié: (2026)
Visual Graph Arena: Evaluating Visual Conceptualization of Vision and Multimodal Large Language Models
par: Babaiee, Zahra, et autres
Publié: (2025)
par: Babaiee, Zahra, et autres
Publié: (2025)
Boosting Multimodal Large Language Models with Visual Tokens Withdrawal for Rapid Inference
par: Lin, Zhihang, et autres
Publié: (2024)
par: Lin, Zhihang, et autres
Publié: (2024)
Exploring the Transferability of Visual Prompting for Multimodal Large Language Models
par: Zhang, Yichi, et autres
Publié: (2024)
par: Zhang, Yichi, et autres
Publié: (2024)
Semantic Alignment for Multimodal Large Language Models
par: Wu, Tao, et autres
Publié: (2024)
par: Wu, Tao, et autres
Publié: (2024)
Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism
par: Chen, Tao, et autres
Publié: (2026)
par: Chen, Tao, et autres
Publié: (2026)
Enhancing Visual Token Representations for Video Large Language Models via Training-Free Spatial-Temporal Pooling and Gridding
par: Luo, Bingjun, et autres
Publié: (2026)
par: Luo, Bingjun, et autres
Publié: (2026)
Unleashing the Intrinsic Visual Representation Capability of Multimodal Large Language Models
par: Li, Hengzhuang, et autres
Publié: (2025)
par: Li, Hengzhuang, et autres
Publié: (2025)
Towards Self-Refinement of Vision-Language Models with Triangular Consistency
par: Deng, Yunlong, et autres
Publié: (2025)
par: Deng, Yunlong, et autres
Publié: (2025)
Erase Persona, Forget Lore: Benchmarking Multimodal Copyright Unlearning in Large Vision Language Models
par: Kwon, JuneHyoung, et autres
Publié: (2026)
par: Kwon, JuneHyoung, et autres
Publié: (2026)
Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing
par: Wu, Junfei, et autres
Publié: (2025)
par: Wu, Junfei, et autres
Publié: (2025)
Learning to Inference Adaptively for Multimodal Large Language Models
par: Xu, Zhuoyan, et autres
Publié: (2025)
par: Xu, Zhuoyan, et autres
Publié: (2025)
TwiFF (Think With Future Frames): A Large-Scale Dataset for Dynamic Visual Reasoning
par: Liu, Junhua, et autres
Publié: (2026)
par: Liu, Junhua, et autres
Publié: (2026)
Dynamic Multimodal Activation Steering for Hallucination Mitigation in Large Vision-Language Models
par: Yin, Jianghao, et autres
Publié: (2026)
par: Yin, Jianghao, et autres
Publié: (2026)
Mitigating Hallucinations in Large Vision-Language Models via Entity-Centric Multimodal Preference Optimization
par: Wu, Jiulong, et autres
Publié: (2025)
par: Wu, Jiulong, et autres
Publié: (2025)
Check Field Detection Agent (CFD-Agent) using Multimodal Large Language and Vision Language Models
par: Halder, Sourav, et autres
Publié: (2025)
par: Halder, Sourav, et autres
Publié: (2025)
Visual-Noise Guided In-Context Distillation for Multimodal Large Language Model Unlearning
par: Chen, Junkai, et autres
Publié: (2026)
par: Chen, Junkai, et autres
Publié: (2026)
Unveiling the Tapestry of Consistency in Large Vision-Language Models
par: Zhang, Yuan, et autres
Publié: (2024)
par: Zhang, Yuan, et autres
Publié: (2024)
MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks
par: Xu, Yushen, et autres
Publié: (2025)
par: Xu, Yushen, et autres
Publié: (2025)
VDC: Versatile Data Cleanser based on Visual-Linguistic Inconsistency by Multimodal Large Language Models
par: Zhu, Zihao, et autres
Publié: (2023)
par: Zhu, Zihao, et autres
Publié: (2023)
MQuant: Unleashing the Inference Potential of Multimodal Large Language Models via Full Static Quantization
par: Yu, JiangYong, et autres
Publié: (2025)
par: Yu, JiangYong, et autres
Publié: (2025)
BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models
par: Tang, Jianting, et autres
Publié: (2025)
par: Tang, Jianting, et autres
Publié: (2025)
Taxonomy-Aware Representation Alignment for Hierarchical Visual Recognition with Large Multimodal Models
par: He, Hulingxiao, et autres
Publié: (2026)
par: He, Hulingxiao, et autres
Publié: (2026)
MVP-Bench: Can Large Vision--Language Models Conduct Multi-level Visual Perception Like Humans?
par: Li, Guanzhen, et autres
Publié: (2024)
par: Li, Guanzhen, et autres
Publié: (2024)
The Paradigm Shift: A Comprehensive Survey on Large Vision Language Models for Multimodal Fake News Detection
par: Ai, Wei, et autres
Publié: (2026)
par: Ai, Wei, et autres
Publié: (2026)
VisionGraph: Leveraging Large Multimodal Models for Graph Theory Problems in Visual Context
par: Li, Yunxin, et autres
Publié: (2024)
par: Li, Yunxin, et autres
Publié: (2024)
Retrieval Visual Contrastive Decoding to Mitigate Object Hallucinations in Large Vision-Language Models
par: Lee, Jihoon, et autres
Publié: (2025)
par: Lee, Jihoon, et autres
Publié: (2025)
Demystifying the Visual Quality Paradox in Multimodal Large Language Models
par: Xing, Shuo, et autres
Publié: (2025)
par: Xing, Shuo, et autres
Publié: (2025)
D-Fusion: Direct Preference Optimization for Aligning Diffusion Models with Visually Consistent Samples
par: Hu, Zijing, et autres
Publié: (2025)
par: Hu, Zijing, et autres
Publié: (2025)
Visual Large Language Models for Generalized and Specialized Applications
par: Li, Yifan, et autres
Publié: (2025)
par: Li, Yifan, et autres
Publié: (2025)
PathGLS: Evaluating Pathology Vision-Language Models without Ground Truth through Multi-Dimensional Consistency
par: Chen, Minbing, et autres
Publié: (2026)
par: Chen, Minbing, et autres
Publié: (2026)
ViGoR: Improving Visual Grounding of Large Vision Language Models with Fine-Grained Reward Modeling
par: Yan, Siming, et autres
Publié: (2024)
par: Yan, Siming, et autres
Publié: (2024)
Visual Question Decomposition on Multimodal Large Language Models
par: Zhang, Haowei, et autres
Publié: (2024)
par: Zhang, Haowei, et autres
Publié: (2024)
V-DPO: Mitigating Hallucination in Large Vision Language Models via Vision-Guided Direct Preference Optimization
par: Xie, Yuxi, et autres
Publié: (2024)
par: Xie, Yuxi, et autres
Publié: (2024)
WaveFormer: Frequency-Time Decoupled Vision Modeling with Wave Equation
par: Shu, Zishan, et autres
Publié: (2026)
par: Shu, Zishan, et autres
Publié: (2026)
Mitigating Object Hallucinations in Large Vision-Language Models via Attention Calibration
par: Zhu, Younan, et autres
Publié: (2025)
par: Zhu, Younan, et autres
Publié: (2025)
White-box Multimodal Jailbreaks Against Large Vision-Language Models
par: Wang, Ruofan, et autres
Publié: (2024)
par: Wang, Ruofan, et autres
Publié: (2024)
Investigating Redundancy in Multimodal Large Language Models with Multiple Vision Encoders
par: Wang, Yizhou, et autres
Publié: (2025)
par: Wang, Yizhou, et autres
Publié: (2025)
Documents similaires
-
V-ITI: Mitigating Hallucinations in Multimodal Large Language Models via Visual Inference-Time Intervention
par: Sun, Nan, et autres
Publié: (2025) -
Cross-Layer Vision Smoothing: Enhancing Visual Understanding via Sustained Focus on Key Objects in Large Vision-Language Models
par: Zhao, Jianfei, et autres
Publié: (2025) -
Divide-and-Conquer Inference for Large-Scale Visual Recognition with Multimodal Large Language Models
par: Ye, Zhipeng, et autres
Publié: (2026) -
Visual Graph Arena: Evaluating Visual Conceptualization of Vision and Multimodal Large Language Models
par: Babaiee, Zahra, et autres
Publié: (2025) -
Boosting Multimodal Large Language Models with Visual Tokens Withdrawal for Rapid Inference
par: Lin, Zhihang, et autres
Publié: (2024)