Aligning What Vision-Language Models See and Perceive with Adaptive Information Flow
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Chengxin, Choi, Wonseok, Zhang, Chenshuang, Oh, Tae-Hyun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
VLM's Eye Examination: Instruct and Inspect Visual Competency of Vision Language Models
por: Hyeon-Woo, Nam, et al.
Publicado: (2024)
por: Hyeon-Woo, Nam, et al.
Publicado: (2024)
BEAF: Observing BEfore-AFter Changes to Evaluate Hallucination in Vision-language Models
por: Ye-Bin, Moon, et al.
Publicado: (2024)
por: Ye-Bin, Moon, et al.
Publicado: (2024)
Do Vision Encoders Truly Explain Object Hallucination?: Mitigating Object Hallucination via Simple Fine-Grained CLIPScore
por: Oh, Hongseok, et al.
Publicado: (2025)
por: Oh, Hongseok, et al.
Publicado: (2025)
Aligning What EEG Can See: Structural Representations for Brain-Vision Matching
por: Tang, Jingyi, et al.
Publicado: (2026)
por: Tang, Jingyi, et al.
Publicado: (2026)
RetouchLLM: Training-free Code-based Image Retouching with Vision Language Models
por: Ye-Bin, Moon, et al.
Publicado: (2025)
por: Ye-Bin, Moon, et al.
Publicado: (2025)
Mitigating Hallucination in Large Vision-Language Models through Aligning Attention Distribution to Information Flow
por: Zhao, Jianfei, et al.
Publicado: (2025)
por: Zhao, Jianfei, et al.
Publicado: (2025)
SYNAuG: Exploiting Synthetic Data for Data Imbalance Problems
por: Ye-Bin, Moon, et al.
Publicado: (2023)
por: Ye-Bin, Moon, et al.
Publicado: (2023)
AlignDiT: Multimodal Aligned Diffusion Transformer for Synchronized Speech Generation
por: Choi, Jeongsoo, et al.
Publicado: (2025)
por: Choi, Jeongsoo, et al.
Publicado: (2025)
CLAY: Conditional Visual Similarity Modulation in Vision-Language Embedding Space
por: Lim, Sohwi, et al.
Publicado: (2026)
por: Lim, Sohwi, et al.
Publicado: (2026)
Multi-Turn Adaptive Prompting Attack on Large Vision-Language Models
por: Choi, In Chong, et al.
Publicado: (2026)
por: Choi, In Chong, et al.
Publicado: (2026)
Query-Calibrated Segmental Admission for Descriptor-Agnostic LiDAR Loop Closure in Repetitive Environments
por: Kim, Jaehyun, et al.
Publicado: (2025)
por: Kim, Jaehyun, et al.
Publicado: (2025)
MemBench: Memorized Image Trigger Prompt Dataset for Diffusion Models
por: Hong, Chunsan, et al.
Publicado: (2024)
por: Hong, Chunsan, et al.
Publicado: (2024)
Sparsity as a Key: Unlocking New Insights from Latent Structures for Out-of-Distribution Detection
por: Oh, Ahyoung, et al.
Publicado: (2026)
por: Oh, Ahyoung, et al.
Publicado: (2026)
AVHBench: A Cross-Modal Hallucination Benchmark for Audio-Visual Large Language Models
por: Sung-Bin, Kim, et al.
Publicado: (2024)
por: Sung-Bin, Kim, et al.
Publicado: (2024)
FRAMER: Frequency-Aligned Self-Distillation with Adaptive Modulation Leveraging Diffusion Priors for Real-World Image Super-Resolution
por: Choi, Seungho, et al.
Publicado: (2025)
por: Choi, Seungho, et al.
Publicado: (2025)
Vision-Language Models Can't See the Obvious
por: Dahou, Yasser, et al.
Publicado: (2025)
por: Dahou, Yasser, et al.
Publicado: (2025)
Patch-wise Retrieval: A Bag of Practical Techniques for Instance-level Matching
por: Choi, Wonseok, et al.
Publicado: (2025)
por: Choi, Wonseok, et al.
Publicado: (2025)
See What I Mean: Aligning Vision and Language Representations for Video Fine-grained Object Understanding
por: Sun, Boyuan, et al.
Publicado: (2026)
por: Sun, Boyuan, et al.
Publicado: (2026)
Learning More by Seeing Less: Structure First Learning for Efficient, Transferable, and Human-Aligned Vision
por: Li, Tianqin, et al.
Publicado: (2025)
por: Li, Tianqin, et al.
Publicado: (2025)
See What Matters: Differentiable Grid Sample Pruning for Generalizable Vision-Language-Action Model
por: Feng, Yixu, et al.
Publicado: (2026)
por: Feng, Yixu, et al.
Publicado: (2026)
HDR-NSFF: High Dynamic Range Neural Scene Flow Fields
por: Dong-Yeon, Shin, et al.
Publicado: (2026)
por: Dong-Yeon, Shin, et al.
Publicado: (2026)
See-Saw Modality Balance: See Gradient, and Sew Impaired Vision-Language Balance to Mitigate Dominant Modality Bias
por: Kwon, JuneHyoung, et al.
Publicado: (2025)
por: Kwon, JuneHyoung, et al.
Publicado: (2025)
BLINK: Multimodal Large Language Models Can See but Not Perceive
por: Fu, Xingyu, et al.
Publicado: (2024)
por: Fu, Xingyu, et al.
Publicado: (2024)
Modest-Align: Data-Efficient Alignment for Vision-Language Models
por: Liu, Jiaxiang, et al.
Publicado: (2025)
por: Liu, Jiaxiang, et al.
Publicado: (2025)
SurgCheck: Do Vision-Language Models Really Look at Images in Surgical VQA?
por: Shin, Jongmin, et al.
Publicado: (2026)
por: Shin, Jongmin, et al.
Publicado: (2026)
DarkQA: Benchmarking Vision-Language Models on Visual-Primitive Question Answering in Low-Light Indoor Scenes
por: Park, Yohan, et al.
Publicado: (2025)
por: Park, Yohan, et al.
Publicado: (2025)
Bi-MCQ: Reformulating Vision-Language Alignment for Negation Understanding
por: Kim, Tae Hun, et al.
Publicado: (2026)
por: Kim, Tae Hun, et al.
Publicado: (2026)
Seeing the Abstract: Translating the Abstract Language for Vision Language Models
por: Talon, Davide, et al.
Publicado: (2025)
por: Talon, Davide, et al.
Publicado: (2025)
What Do You See in Vehicle? Comprehensive Vision Solution for In-Vehicle Gaze Estimation
por: Cheng, Yihua, et al.
Publicado: (2024)
por: Cheng, Yihua, et al.
Publicado: (2024)
How Well Can Vision Language Models See Image Details?
por: Gou, Chenhui, et al.
Publicado: (2024)
por: Gou, Chenhui, et al.
Publicado: (2024)
Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning
por: Liang, Dayong, et al.
Publicado: (2025)
por: Liang, Dayong, et al.
Publicado: (2025)
Seeing Clearly, Reasoning Confidently: Plug-and-Play Remedies for Vision Language Model Blindness
por: Hu, Xin, et al.
Publicado: (2026)
por: Hu, Xin, et al.
Publicado: (2026)
See-in-Pairs: Reference Image-Guided Comparative Vision-Language Models for Medical Diagnosis
por: Jin, Ruinan, et al.
Publicado: (2025)
por: Jin, Ruinan, et al.
Publicado: (2025)
From Flatland to Space: Teaching Vision-Language Models to Perceive and Reason in 3D
por: Zhang, Jiahui, et al.
Publicado: (2025)
por: Zhang, Jiahui, et al.
Publicado: (2025)
Continuous Degradation Modeling via Latent Flow Matching for Real-World Super-Resolution
por: Kim, Hyeonjae, et al.
Publicado: (2026)
por: Kim, Hyeonjae, et al.
Publicado: (2026)
Think-as-You-See: Streaming Chain-of-Thought Reasoning for Large Vision-Language Models
por: Zhang, Jialiang, et al.
Publicado: (2026)
por: Zhang, Jialiang, et al.
Publicado: (2026)
See then Tell: Enhancing Key Information Extraction with Vision Grounding
por: Liu, Shuhang, et al.
Publicado: (2024)
por: Liu, Shuhang, et al.
Publicado: (2024)
VSC: Visual Search Compositional Text-to-Image Diffusion Model
por: Dat, Do Huu, et al.
Publicado: (2025)
por: Dat, Do Huu, et al.
Publicado: (2025)
Reading $\neq$ Seeing: Diagnosing and Closing the Typography Gap in Vision-Language Models
por: Zhou, Heng, et al.
Publicado: (2026)
por: Zhou, Heng, et al.
Publicado: (2026)
Seeing is Believing? Enhancing Vision-Language Navigation using Visual Perturbations
por: Zhang, Xuesong, et al.
Publicado: (2024)
por: Zhang, Xuesong, et al.
Publicado: (2024)
Ejemplares similares
-
VLM's Eye Examination: Instruct and Inspect Visual Competency of Vision Language Models
por: Hyeon-Woo, Nam, et al.
Publicado: (2024) -
BEAF: Observing BEfore-AFter Changes to Evaluate Hallucination in Vision-language Models
por: Ye-Bin, Moon, et al.
Publicado: (2024) -
Do Vision Encoders Truly Explain Object Hallucination?: Mitigating Object Hallucination via Simple Fine-Grained CLIPScore
por: Oh, Hongseok, et al.
Publicado: (2025) -
Aligning What EEG Can See: Structural Representations for Brain-Vision Matching
por: Tang, Jingyi, et al.
Publicado: (2026) -
RetouchLLM: Training-free Code-based Image Retouching with Vision Language Models
por: Ye-Bin, Moon, et al.
Publicado: (2025)