Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Dong, Xinpeng, Zhang, Min, Han, Kairong, Tan, Xu, Wu, Fei, Kuang, Kun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
V-ITI: Mitigating Hallucinations in Multimodal Large Language Models via Visual Inference-Time Intervention
por: Sun, Nan, et al.
Publicado: (2025)
por: Sun, Nan, et al.
Publicado: (2025)
Cross-Layer Vision Smoothing: Enhancing Visual Understanding via Sustained Focus on Key Objects in Large Vision-Language Models
por: Zhao, Jianfei, et al.
Publicado: (2025)
por: Zhao, Jianfei, et al.
Publicado: (2025)
Divide-and-Conquer Inference for Large-Scale Visual Recognition with Multimodal Large Language Models
por: Ye, Zhipeng, et al.
Publicado: (2026)
por: Ye, Zhipeng, et al.
Publicado: (2026)
Visual Graph Arena: Evaluating Visual Conceptualization of Vision and Multimodal Large Language Models
por: Babaiee, Zahra, et al.
Publicado: (2025)
por: Babaiee, Zahra, et al.
Publicado: (2025)
Boosting Multimodal Large Language Models with Visual Tokens Withdrawal for Rapid Inference
por: Lin, Zhihang, et al.
Publicado: (2024)
por: Lin, Zhihang, et al.
Publicado: (2024)
Exploring the Transferability of Visual Prompting for Multimodal Large Language Models
por: Zhang, Yichi, et al.
Publicado: (2024)
por: Zhang, Yichi, et al.
Publicado: (2024)
Semantic Alignment for Multimodal Large Language Models
por: Wu, Tao, et al.
Publicado: (2024)
por: Wu, Tao, et al.
Publicado: (2024)
Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism
por: Chen, Tao, et al.
Publicado: (2026)
por: Chen, Tao, et al.
Publicado: (2026)
Enhancing Visual Token Representations for Video Large Language Models via Training-Free Spatial-Temporal Pooling and Gridding
por: Luo, Bingjun, et al.
Publicado: (2026)
por: Luo, Bingjun, et al.
Publicado: (2026)
Unleashing the Intrinsic Visual Representation Capability of Multimodal Large Language Models
por: Li, Hengzhuang, et al.
Publicado: (2025)
por: Li, Hengzhuang, et al.
Publicado: (2025)
Towards Self-Refinement of Vision-Language Models with Triangular Consistency
por: Deng, Yunlong, et al.
Publicado: (2025)
por: Deng, Yunlong, et al.
Publicado: (2025)
Erase Persona, Forget Lore: Benchmarking Multimodal Copyright Unlearning in Large Vision Language Models
por: Kwon, JuneHyoung, et al.
Publicado: (2026)
por: Kwon, JuneHyoung, et al.
Publicado: (2026)
Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing
por: Wu, Junfei, et al.
Publicado: (2025)
por: Wu, Junfei, et al.
Publicado: (2025)
Learning to Inference Adaptively for Multimodal Large Language Models
por: Xu, Zhuoyan, et al.
Publicado: (2025)
por: Xu, Zhuoyan, et al.
Publicado: (2025)
TwiFF (Think With Future Frames): A Large-Scale Dataset for Dynamic Visual Reasoning
por: Liu, Junhua, et al.
Publicado: (2026)
por: Liu, Junhua, et al.
Publicado: (2026)
Dynamic Multimodal Activation Steering for Hallucination Mitigation in Large Vision-Language Models
por: Yin, Jianghao, et al.
Publicado: (2026)
por: Yin, Jianghao, et al.
Publicado: (2026)
Mitigating Hallucinations in Large Vision-Language Models via Entity-Centric Multimodal Preference Optimization
por: Wu, Jiulong, et al.
Publicado: (2025)
por: Wu, Jiulong, et al.
Publicado: (2025)
Check Field Detection Agent (CFD-Agent) using Multimodal Large Language and Vision Language Models
por: Halder, Sourav, et al.
Publicado: (2025)
por: Halder, Sourav, et al.
Publicado: (2025)
Visual-Noise Guided In-Context Distillation for Multimodal Large Language Model Unlearning
por: Chen, Junkai, et al.
Publicado: (2026)
por: Chen, Junkai, et al.
Publicado: (2026)
Unveiling the Tapestry of Consistency in Large Vision-Language Models
por: Zhang, Yuan, et al.
Publicado: (2024)
por: Zhang, Yuan, et al.
Publicado: (2024)
MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks
por: Xu, Yushen, et al.
Publicado: (2025)
por: Xu, Yushen, et al.
Publicado: (2025)
VDC: Versatile Data Cleanser based on Visual-Linguistic Inconsistency by Multimodal Large Language Models
por: Zhu, Zihao, et al.
Publicado: (2023)
por: Zhu, Zihao, et al.
Publicado: (2023)
MQuant: Unleashing the Inference Potential of Multimodal Large Language Models via Full Static Quantization
por: Yu, JiangYong, et al.
Publicado: (2025)
por: Yu, JiangYong, et al.
Publicado: (2025)
BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models
por: Tang, Jianting, et al.
Publicado: (2025)
por: Tang, Jianting, et al.
Publicado: (2025)
Taxonomy-Aware Representation Alignment for Hierarchical Visual Recognition with Large Multimodal Models
por: He, Hulingxiao, et al.
Publicado: (2026)
por: He, Hulingxiao, et al.
Publicado: (2026)
MVP-Bench: Can Large Vision--Language Models Conduct Multi-level Visual Perception Like Humans?
por: Li, Guanzhen, et al.
Publicado: (2024)
por: Li, Guanzhen, et al.
Publicado: (2024)
The Paradigm Shift: A Comprehensive Survey on Large Vision Language Models for Multimodal Fake News Detection
por: Ai, Wei, et al.
Publicado: (2026)
por: Ai, Wei, et al.
Publicado: (2026)
VisionGraph: Leveraging Large Multimodal Models for Graph Theory Problems in Visual Context
por: Li, Yunxin, et al.
Publicado: (2024)
por: Li, Yunxin, et al.
Publicado: (2024)
Retrieval Visual Contrastive Decoding to Mitigate Object Hallucinations in Large Vision-Language Models
por: Lee, Jihoon, et al.
Publicado: (2025)
por: Lee, Jihoon, et al.
Publicado: (2025)
Demystifying the Visual Quality Paradox in Multimodal Large Language Models
por: Xing, Shuo, et al.
Publicado: (2025)
por: Xing, Shuo, et al.
Publicado: (2025)
D-Fusion: Direct Preference Optimization for Aligning Diffusion Models with Visually Consistent Samples
por: Hu, Zijing, et al.
Publicado: (2025)
por: Hu, Zijing, et al.
Publicado: (2025)
Visual Large Language Models for Generalized and Specialized Applications
por: Li, Yifan, et al.
Publicado: (2025)
por: Li, Yifan, et al.
Publicado: (2025)
PathGLS: Evaluating Pathology Vision-Language Models without Ground Truth through Multi-Dimensional Consistency
por: Chen, Minbing, et al.
Publicado: (2026)
por: Chen, Minbing, et al.
Publicado: (2026)
ViGoR: Improving Visual Grounding of Large Vision Language Models with Fine-Grained Reward Modeling
por: Yan, Siming, et al.
Publicado: (2024)
por: Yan, Siming, et al.
Publicado: (2024)
Visual Question Decomposition on Multimodal Large Language Models
por: Zhang, Haowei, et al.
Publicado: (2024)
por: Zhang, Haowei, et al.
Publicado: (2024)
V-DPO: Mitigating Hallucination in Large Vision Language Models via Vision-Guided Direct Preference Optimization
por: Xie, Yuxi, et al.
Publicado: (2024)
por: Xie, Yuxi, et al.
Publicado: (2024)
WaveFormer: Frequency-Time Decoupled Vision Modeling with Wave Equation
por: Shu, Zishan, et al.
Publicado: (2026)
por: Shu, Zishan, et al.
Publicado: (2026)
Mitigating Object Hallucinations in Large Vision-Language Models via Attention Calibration
por: Zhu, Younan, et al.
Publicado: (2025)
por: Zhu, Younan, et al.
Publicado: (2025)
White-box Multimodal Jailbreaks Against Large Vision-Language Models
por: Wang, Ruofan, et al.
Publicado: (2024)
por: Wang, Ruofan, et al.
Publicado: (2024)
Investigating Redundancy in Multimodal Large Language Models with Multiple Vision Encoders
por: Wang, Yizhou, et al.
Publicado: (2025)
por: Wang, Yizhou, et al.
Publicado: (2025)
Ejemplares similares
-
V-ITI: Mitigating Hallucinations in Multimodal Large Language Models via Visual Inference-Time Intervention
por: Sun, Nan, et al.
Publicado: (2025) -
Cross-Layer Vision Smoothing: Enhancing Visual Understanding via Sustained Focus on Key Objects in Large Vision-Language Models
por: Zhao, Jianfei, et al.
Publicado: (2025) -
Divide-and-Conquer Inference for Large-Scale Visual Recognition with Multimodal Large Language Models
por: Ye, Zhipeng, et al.
Publicado: (2026) -
Visual Graph Arena: Evaluating Visual Conceptualization of Vision and Multimodal Large Language Models
por: Babaiee, Zahra, et al.
Publicado: (2025) -
Boosting Multimodal Large Language Models with Visual Tokens Withdrawal for Rapid Inference
por: Lin, Zhihang, et al.
Publicado: (2024)