Don't Miss the Forest for the Trees: Attentional Vision Calibration for Large Vision Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Woo, Sangmin, Kim, Donguk, Jang, Jaehyuk, Choi, Yubin, Kim, Changick |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
RITUAL: Random Image Transformations as a Universal Anti-hallucination Lever in Large Vision Language Models
di: Woo, Sangmin, et al.
Pubblicazione: (2024)
di: Woo, Sangmin, et al.
Pubblicazione: (2024)
Bridging the Missing-Modality Gap: Improving Text-Only Calibration of Vision Language Models
di: Kim, Mingyeong, et al.
Pubblicazione: (2026)
di: Kim, Mingyeong, et al.
Pubblicazione: (2026)
Denoising Task Routing for Diffusion Models
di: Park, Byeongjun, et al.
Pubblicazione: (2023)
di: Park, Byeongjun, et al.
Pubblicazione: (2023)
Diffusion Model Patching via Mixture-of-Prompts
di: Ham, Seokil, et al.
Pubblicazione: (2024)
di: Ham, Seokil, et al.
Pubblicazione: (2024)
Vision Transformers Don't Need Trained Registers
di: Jiang, Nick, et al.
Pubblicazione: (2025)
di: Jiang, Nick, et al.
Pubblicazione: (2025)
Avoid Wasted Annotation Costs in Open-set Active Learning with Pre-trained Vision-Language Model
di: Heo, Jaehyuk, et al.
Pubblicazione: (2024)
di: Heo, Jaehyuk, et al.
Pubblicazione: (2024)
Mitigating Object Hallucinations in Large Vision-Language Models via Attention Calibration
di: Zhu, Younan, et al.
Pubblicazione: (2025)
di: Zhu, Younan, et al.
Pubblicazione: (2025)
Your Large Vision-Language Model Only Needs A Few Attention Heads For Visual Grounding
di: Kang, Seil, et al.
Pubblicazione: (2025)
di: Kang, Seil, et al.
Pubblicazione: (2025)
Revealing Multi-View Hallucination in Large Vision-Language Models
di: Park, Wooje, et al.
Pubblicazione: (2026)
di: Park, Wooje, et al.
Pubblicazione: (2026)
Are Large Vision-Language Models Ready to Guide Blind and Low-Vision Individuals?
di: Kim, Eunki, et al.
Pubblicazione: (2025)
di: Kim, Eunki, et al.
Pubblicazione: (2025)
Explainable Adversarial-Robust Vision-Language-Action Model for Robotic Manipulation
di: Kim, Ju-Young, et al.
Pubblicazione: (2025)
di: Kim, Ju-Young, et al.
Pubblicazione: (2025)
Interpreting Attention Heads for Image-to-Text Information Flow in Large Vision-Language Models
di: Kim, Jinyeong, et al.
Pubblicazione: (2025)
di: Kim, Jinyeong, et al.
Pubblicazione: (2025)
Towards Calibrated Robust Fine-Tuning of Vision-Language Models
di: Oh, Changdae, et al.
Pubblicazione: (2023)
di: Oh, Changdae, et al.
Pubblicazione: (2023)
What and When to Look?: Temporal Span Proposal Network for Video Relation Detection
di: Woo, Sangmin, et al.
Pubblicazione: (2021)
di: Woo, Sangmin, et al.
Pubblicazione: (2021)
How Blind and Low-Vision Individuals Prefer Large Vision-Language Model-Generated Scene Descriptions
di: An, Na Min, et al.
Pubblicazione: (2025)
di: An, Na Min, et al.
Pubblicazione: (2025)
Efficient Test-Time Optimization for Depth Completion via Low-Rank Decoder Adaptation
di: Seo, Minseok, et al.
Pubblicazione: (2026)
di: Seo, Minseok, et al.
Pubblicazione: (2026)
Uncertainty-guided Compositional Alignment with Part-to-Whole Semantic Representativeness in Hyperbolic Vision-Language Models
di: Kim, Hayeon, et al.
Pubblicazione: (2026)
di: Kim, Hayeon, et al.
Pubblicazione: (2026)
Black-Box Visual Prompt Engineering for Mitigating Object Hallucination in Large Vision Language Models
di: Woo, Sangmin, et al.
Pubblicazione: (2025)
di: Woo, Sangmin, et al.
Pubblicazione: (2025)
Large Vision-Language Models Get Lost in Attention
di: Xi, Gongli, et al.
Pubblicazione: (2026)
di: Xi, Gongli, et al.
Pubblicazione: (2026)
Attention Prompting on Image for Large Vision-Language Models
di: Yu, Runpeng, et al.
Pubblicazione: (2024)
di: Yu, Runpeng, et al.
Pubblicazione: (2024)
Focus, Don't Prune: Identifying Instruction-Relevant Regions for Information-Rich Image Understanding
di: Kwon, Mincheol, et al.
Pubblicazione: (2026)
di: Kwon, Mincheol, et al.
Pubblicazione: (2026)
A-VL: Adaptive Attention for Large Vision-Language Models
di: Zhang, Junyang, et al.
Pubblicazione: (2024)
di: Zhang, Junyang, et al.
Pubblicazione: (2024)
Spatio-Temporal Proximity-Aware Dual-Path Model for Panoramic Activity Recognition
di: Lee, Sumin, et al.
Pubblicazione: (2024)
di: Lee, Sumin, et al.
Pubblicazione: (2024)
Continual Vision-and-Language Navigation
di: Jeong, Seongjun, et al.
Pubblicazione: (2024)
di: Jeong, Seongjun, et al.
Pubblicazione: (2024)
Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models
di: Jung, Mingi, et al.
Pubblicazione: (2025)
di: Jung, Mingi, et al.
Pubblicazione: (2025)
Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens
di: Kim, Sohee, et al.
Pubblicazione: (2025)
di: Kim, Sohee, et al.
Pubblicazione: (2025)
Bridging Implicit and Explicit Geometric Transformation for Single-Image View Synthesis
di: Park, Byeongjun, et al.
Pubblicazione: (2022)
di: Park, Byeongjun, et al.
Pubblicazione: (2022)
IWP: Token Pruning as Implicit Weight Pruning in Large Vision Language Models
di: Lee, Dong-Jae, et al.
Pubblicazione: (2026)
di: Lee, Dong-Jae, et al.
Pubblicazione: (2026)
Don't Deceive Me: Mitigating Gaslighting through Attention Reallocation in LMMs
di: Jiao, Pengkun, et al.
Pubblicazione: (2025)
di: Jiao, Pengkun, et al.
Pubblicazione: (2025)
World Models That Know When They Don't Know - Controllable Video Generation with Calibrated Uncertainty
di: Mei, Zhiting, et al.
Pubblicazione: (2025)
di: Mei, Zhiting, et al.
Pubblicazione: (2025)
Collaborative Edge-to-Server Inference for Vision-Language Models
di: Song, Soochang, et al.
Pubblicazione: (2025)
di: Song, Soochang, et al.
Pubblicazione: (2025)
Self-Aug: Query and Entropy Adaptive Decoding for Large Vision-Language Models
di: Im, Eun Woo, et al.
Pubblicazione: (2025)
di: Im, Eun Woo, et al.
Pubblicazione: (2025)
ZERO: Industry-ready Vision Foundation Model with Multi-modal Prompts
di: Choi, Sangbum, et al.
Pubblicazione: (2025)
di: Choi, Sangbum, et al.
Pubblicazione: (2025)
VL-Calibration: Decoupled Confidence Calibration for Large Vision-Language Models Reasoning
di: Xiao, Wenyi, et al.
Pubblicazione: (2026)
di: Xiao, Wenyi, et al.
Pubblicazione: (2026)
HoliSafe: Holistic Safety Benchmarking and Modeling for Vision-Language Model
di: Lee, Youngwan, et al.
Pubblicazione: (2025)
di: Lee, Youngwan, et al.
Pubblicazione: (2025)
You Don't Need All That Attention: Surgical Memorization Mitigation in Text-to-Image Diffusion Models
di: Zhao, Kairan, et al.
Pubblicazione: (2026)
di: Zhao, Kairan, et al.
Pubblicazione: (2026)
VFM-VLM: Vision Foundation Model and Vision Language Model based Visual Comparison for 3D Pose Estimation
di: Sarowar, Md Selim, et al.
Pubblicazione: (2025)
di: Sarowar, Md Selim, et al.
Pubblicazione: (2025)
Benign-to-Toxic Jailbreaking: Inducing Harmful Responses from Harmless Prompts
di: Kim, Hee-Seon, et al.
Pubblicazione: (2025)
di: Kim, Hee-Seon, et al.
Pubblicazione: (2025)
3D-Aware Vision-Language Models Fine-Tuning with Geometric Distillation
di: Lee, Seonho, et al.
Pubblicazione: (2025)
di: Lee, Seonho, et al.
Pubblicazione: (2025)
Watch Video, Catch Keyword: Context-aware Keyword Attention for Moment Retrieval and Highlight Detection
di: Um, Sung Jin, et al.
Pubblicazione: (2025)
di: Um, Sung Jin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
RITUAL: Random Image Transformations as a Universal Anti-hallucination Lever in Large Vision Language Models
di: Woo, Sangmin, et al.
Pubblicazione: (2024) -
Bridging the Missing-Modality Gap: Improving Text-Only Calibration of Vision Language Models
di: Kim, Mingyeong, et al.
Pubblicazione: (2026) -
Denoising Task Routing for Diffusion Models
di: Park, Byeongjun, et al.
Pubblicazione: (2023) -
Diffusion Model Patching via Mixture-of-Prompts
di: Ham, Seokil, et al.
Pubblicazione: (2024) -
Vision Transformers Don't Need Trained Registers
di: Jiang, Nick, et al.
Pubblicazione: (2025)