Focusing Where Vision Matters: Selective Training for Large Vision Language Models via Visual Information Gain
Fuente:
arXiv
Guardado en:
| Autores principales: | Lee, Seulbi, Hwang, Sangheum |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Reflexive Guidance: Improving OoDD in Vision-Language Models via Self-Guided Image-Adaptive Concept Generation
por: Kim, Jihyo, et al.
Publicado: (2024)
por: Kim, Jihyo, et al.
Publicado: (2024)
StochCA: A Novel Approach for Exploiting Pretrained Models with Cross-Attention
por: Seo, Seungwon, et al.
Publicado: (2024)
por: Seo, Seungwon, et al.
Publicado: (2024)
Localized Concept Erasure in Text-to-Image Diffusion Models via High-Level Representation Misdirection
por: Lee, Uichan, et al.
Publicado: (2026)
por: Lee, Uichan, et al.
Publicado: (2026)
Concept-skill Transferability-based Data Selection for Large Vision-Language Models
por: Lee, Jaewoo, et al.
Publicado: (2024)
por: Lee, Jaewoo, et al.
Publicado: (2024)
Enhanced OoD Detection through Cross-Modal Alignment of Multi-Modal Representations
por: Kim, Jeonghyeon, et al.
Publicado: (2025)
por: Kim, Jeonghyeon, et al.
Publicado: (2025)
Intriguing Properties of Large Language and Vision Models
por: Lee, Young-Jun, et al.
Publicado: (2024)
por: Lee, Young-Jun, et al.
Publicado: (2024)
Cross-Layer Vision Smoothing: Enhancing Visual Understanding via Sustained Focus on Key Objects in Large Vision-Language Models
por: Zhao, Jianfei, et al.
Publicado: (2025)
por: Zhao, Jianfei, et al.
Publicado: (2025)
Foveated Reasoning: Stateful, Action-based Visual Focusing for Vision-Language Models
por: Min, Juhong, et al.
Publicado: (2026)
por: Min, Juhong, et al.
Publicado: (2026)
When and Where to Attack? Stage-wise Attention-Guided Adversarial Attack on Large Vision Language Models
por: Kwak, Jaehyun, et al.
Publicado: (2026)
por: Kwak, Jaehyun, et al.
Publicado: (2026)
Focus on What Matters: Enhancing Medical Vision-Language Models with Automatic Attention Alignment Tuning
por: Chang, Aofei, et al.
Publicado: (2025)
por: Chang, Aofei, et al.
Publicado: (2025)
Parallel Rescaling: Rebalancing Consistency Guidance for Personalized Diffusion Models
por: Chae, JungWoo, et al.
Publicado: (2025)
por: Chae, JungWoo, et al.
Publicado: (2025)
SURf: Teaching Large Vision-Language Models to Selectively Utilize Retrieved Information
por: Sun, Jiashuo, et al.
Publicado: (2024)
por: Sun, Jiashuo, et al.
Publicado: (2024)
Focus Matters: Phase-Aware Suppression for Hallucination in Vision-Language Models
por: Kim, Sohyeon, et al.
Publicado: (2026)
por: Kim, Sohyeon, et al.
Publicado: (2026)
Where do Large Vision-Language Models Look at when Answering Questions?
por: Xing, Xiaoying, et al.
Publicado: (2025)
por: Xing, Xiaoying, et al.
Publicado: (2025)
Selective State Space Memory for Large Vision-Language Models
por: Ng, Chee, et al.
Publicado: (2024)
por: Ng, Chee, et al.
Publicado: (2024)
DeepScan: A Training-Free Framework for Visually Grounded Reasoning in Large Vision-Language Models
por: Li, Yangfu, et al.
Publicado: (2026)
por: Li, Yangfu, et al.
Publicado: (2026)
Visual In-Context Learning for Large Vision-Language Models
por: Zhou, Yucheng, et al.
Publicado: (2024)
por: Zhou, Yucheng, et al.
Publicado: (2024)
CustomKD: Customizing Large Vision Foundation for Edge Model Improvement via Knowledge Distillation
por: Lee, Jungsoo, et al.
Publicado: (2025)
por: Lee, Jungsoo, et al.
Publicado: (2025)
Where Does Vision Meet Language? Understanding and Refining Visual Fusion in MLLMs via Contrastive Attention
por: Song, Shezheng, et al.
Publicado: (2026)
por: Song, Shezheng, et al.
Publicado: (2026)
Training A Small Emotional Vision Language Model for Visual Art Comprehension
por: Zhang, Jing, et al.
Publicado: (2024)
por: Zhang, Jing, et al.
Publicado: (2024)
CaMo: Camera Motion Grounded Evaluation and Training for Vision-Language Models
por: Huang, Hsiang-Wei, et al.
Publicado: (2026)
por: Huang, Hsiang-Wei, et al.
Publicado: (2026)
Phantom of Latent for Large Language and Vision Models
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
Mamba as a Bridge: Where Vision Foundation Models Meet Vision Language Models for Domain-Generalized Semantic Segmentation
por: Zhang, Xin, et al.
Publicado: (2025)
por: Zhang, Xin, et al.
Publicado: (2025)
Personalization Toolkit: Training Free Personalization of Large Vision Language Models
por: Seifi, Soroush, et al.
Publicado: (2025)
por: Seifi, Soroush, et al.
Publicado: (2025)
Your Large Vision-Language Model Only Needs A Few Attention Heads For Visual Grounding
por: Kang, Seil, et al.
Publicado: (2025)
por: Kang, Seil, et al.
Publicado: (2025)
Mitigating Mask Prior Drift and Positional Attention Collapse in Large Diffusion Vision-Language Models
por: Hong, Sujung, et al.
Publicado: (2026)
por: Hong, Sujung, et al.
Publicado: (2026)
Benchmarking and Mitigating MCQA Selection Bias of Large Vision-Language Models
por: Atabuzzaman, Md., et al.
Publicado: (2025)
por: Atabuzzaman, Md., et al.
Publicado: (2025)
IKOD: Mitigating Visual Attention Degradation in Large Vision-Language Models
por: Yang, Jiabing, et al.
Publicado: (2025)
por: Yang, Jiabing, et al.
Publicado: (2025)
To Sink or Not to Sink: Visual Information Pathways in Large Vision-Language Models
por: Luo, Jiayun, et al.
Publicado: (2025)
por: Luo, Jiayun, et al.
Publicado: (2025)
Concept-Based Explanations in Computer Vision: Where Are We and Where Could We Go?
por: Lee, Jae Hee, et al.
Publicado: (2024)
por: Lee, Jae Hee, et al.
Publicado: (2024)
Improving Calibration in Test-Time Prompt Tuning for Vision-Language Models via Data-Free Flatness-Aware Prompt Pretraining
por: Jang, Hyeonseo, et al.
Publicado: (2026)
por: Jang, Hyeonseo, et al.
Publicado: (2026)
VLA-IAP: Training-Free Visual Token Pruning via Interaction Alignment for Vision-Language-Action Models
por: Cheng, Jintao, et al.
Publicado: (2026)
por: Cheng, Jintao, et al.
Publicado: (2026)
SPARK: Multi-Vision Sensor Perception and Reasoning Benchmark for Large-scale Vision-Language Models
por: Yu, Youngjoon, et al.
Publicado: (2024)
por: Yu, Youngjoon, et al.
Publicado: (2024)
LLMind: Bio-inspired Training-free Adaptive Visual Representations for Vision-Language Models
por: Debnath, Soumyaratna, et al.
Publicado: (2026)
por: Debnath, Soumyaratna, et al.
Publicado: (2026)
SAVER: Mitigating Hallucinations in Large Vision-Language Models via Style-Aware Visual Early Revision
por: Li, Zhaoxu, et al.
Publicado: (2025)
por: Li, Zhaoxu, et al.
Publicado: (2025)
Griffon-G: Bridging Vision-Language and Vision-Centric Tasks via Large Multimodal Models
por: Zhan, Yufei, et al.
Publicado: (2024)
por: Zhan, Yufei, et al.
Publicado: (2024)
Reasoning or Pattern Matching? Probing Large Vision-Language Models with Visual Puzzles
por: Lymperaiou, Maria, et al.
Publicado: (2026)
por: Lymperaiou, Maria, et al.
Publicado: (2026)
RelationVLM: Making Large Vision-Language Models Understand Visual Relations
por: Huang, Zhipeng, et al.
Publicado: (2024)
por: Huang, Zhipeng, et al.
Publicado: (2024)
Multi-Cue Adaptive Visual Token Pruning for Large Vision-Language Models
por: Luan, Bozhi, et al.
Publicado: (2025)
por: Luan, Bozhi, et al.
Publicado: (2025)
Contextualized Visual Personalization in Vision-Language Models
por: Oh, Yeongtak, et al.
Publicado: (2026)
por: Oh, Yeongtak, et al.
Publicado: (2026)
Ejemplares similares
-
Reflexive Guidance: Improving OoDD in Vision-Language Models via Self-Guided Image-Adaptive Concept Generation
por: Kim, Jihyo, et al.
Publicado: (2024) -
StochCA: A Novel Approach for Exploiting Pretrained Models with Cross-Attention
por: Seo, Seungwon, et al.
Publicado: (2024) -
Localized Concept Erasure in Text-to-Image Diffusion Models via High-Level Representation Misdirection
por: Lee, Uichan, et al.
Publicado: (2026) -
Concept-skill Transferability-based Data Selection for Large Vision-Language Models
por: Lee, Jaewoo, et al.
Publicado: (2024) -
Enhanced OoD Detection through Cross-Modal Alignment of Multi-Modal Representations
por: Kim, Jeonghyeon, et al.
Publicado: (2025)