Visual Funnel: Resolving Contextual Blindness in Multimodal Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Jung, Woojun, Go, Jaehoon, Jeon, Mingyu, Yoon, Sunjae, Kim, Junyeong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
QEVA: A Reference-Free Evaluation Metric for Narrative Video Summarization with Multimodal Question Answering
por: Jung, Woojun, et al.
Publicado: (2026)
por: Jung, Woojun, et al.
Publicado: (2026)
Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models
por: Jung, Mingi, et al.
Publicado: (2025)
por: Jung, Mingi, et al.
Publicado: (2025)
Thinking Diffusion: Penalize and Guide Visual-Grounded Reasoning in Diffusion Multimodal Language Models
por: Kim, Keuntae, et al.
Publicado: (2026)
por: Kim, Keuntae, et al.
Publicado: (2026)
Contextual Object Detection with Multimodal Large Language Models
por: Zang, Yuhang, et al.
Publicado: (2023)
por: Zang, Yuhang, et al.
Publicado: (2023)
GranAlign: Granularity-Aware Alignment Framework for Zero-Shot Video Moment Retrieval
por: Jeon, Mingyu, et al.
Publicado: (2026)
por: Jeon, Mingyu, et al.
Publicado: (2026)
Beyond Visual Safety: Jailbreaking Multimodal Large Language Models for Harmful Image Generation via Semantic-Agnostic Inputs
por: Yu, Mingyu, et al.
Publicado: (2026)
por: Yu, Mingyu, et al.
Publicado: (2026)
Forgotten Polygons: Multimodal Large Language Models are Shape-Blind
por: Rudman, William, et al.
Publicado: (2025)
por: Rudman, William, et al.
Publicado: (2025)
Are Large Vision-Language Models Ready to Guide Blind and Low-Vision Individuals?
por: Kim, Eunki, et al.
Publicado: (2025)
por: Kim, Eunki, et al.
Publicado: (2025)
Erase Persona, Forget Lore: Benchmarking Multimodal Copyright Unlearning in Large Vision Language Models
por: Kwon, JuneHyoung, et al.
Publicado: (2026)
por: Kwon, JuneHyoung, et al.
Publicado: (2026)
VLind-Bench: Measuring Language Priors in Large Vision-Language Models
por: Lee, Kang-il, et al.
Publicado: (2024)
por: Lee, Kang-il, et al.
Publicado: (2024)
Is 'Right' Right? Enhancing Object Orientation Understanding in Multimodal Large Language Models through Egocentric Instruction Tuning
por: Jung, Ji Hyeok, et al.
Publicado: (2024)
por: Jung, Ji Hyeok, et al.
Publicado: (2024)
Demystifying the Visual Quality Paradox in Multimodal Large Language Models
por: Xing, Shuo, et al.
Publicado: (2025)
por: Xing, Shuo, et al.
Publicado: (2025)
See What You Are Told: Visual Attention Sink in Large Multimodal Models
por: Kang, Seil, et al.
Publicado: (2025)
por: Kang, Seil, et al.
Publicado: (2025)
Is a Picture Worth a Thousand Words? Adaptive Multimodal Fact-Checking with Visual Evidence Necessity
por: Jung, Jaeyoon, et al.
Publicado: (2026)
por: Jung, Jaeyoon, et al.
Publicado: (2026)
Visual Graph Arena: Evaluating Visual Conceptualization of Vision and Multimodal Large Language Models
por: Babaiee, Zahra, et al.
Publicado: (2025)
por: Babaiee, Zahra, et al.
Publicado: (2025)
VLMs Trace Without Tracking: Diagnosing Failures in Visual Path Following
por: Hong, Hyesoo, et al.
Publicado: (2026)
por: Hong, Hyesoo, et al.
Publicado: (2026)
How Blind and Low-Vision Individuals Prefer Large Vision-Language Model-Generated Scene Descriptions
por: An, Na Min, et al.
Publicado: (2025)
por: An, Na Min, et al.
Publicado: (2025)
LLM4SGG: Large Language Models for Weakly Supervised Scene Graph Generation
por: Kim, Kibum, et al.
Publicado: (2023)
por: Kim, Kibum, et al.
Publicado: (2023)
Unleashing the Intrinsic Visual Representation Capability of Multimodal Large Language Models
por: Li, Hengzhuang, et al.
Publicado: (2025)
por: Li, Hengzhuang, et al.
Publicado: (2025)
Imagery as Inquiry: Exploring A Multimodal Dataset for Conversational Recommendation
por: Yoon, Se-eun, et al.
Publicado: (2024)
por: Yoon, Se-eun, et al.
Publicado: (2024)
Divide-and-Conquer Inference for Large-Scale Visual Recognition with Multimodal Large Language Models
por: Ye, Zhipeng, et al.
Publicado: (2026)
por: Ye, Zhipeng, et al.
Publicado: (2026)
LaViC: Adapting Large Vision-Language Models to Visually-Aware Conversational Recommendation
por: Jeon, Hyunsik, et al.
Publicado: (2025)
por: Jeon, Hyunsik, et al.
Publicado: (2025)
Is it safe to cross? Interpretable Risk Assessment with GPT-4V for Safety-Aware Street Crossing
por: Hwang, Hochul, et al.
Publicado: (2024)
por: Hwang, Hochul, et al.
Publicado: (2024)
Visual-Noise Guided In-Context Distillation for Multimodal Large Language Model Unlearning
por: Chen, Junkai, et al.
Publicado: (2026)
por: Chen, Junkai, et al.
Publicado: (2026)
Boosting Multimodal Large Language Models with Visual Tokens Withdrawal for Rapid Inference
por: Lin, Zhihang, et al.
Publicado: (2024)
por: Lin, Zhihang, et al.
Publicado: (2024)
Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models
por: Dong, Xinpeng, et al.
Publicado: (2026)
por: Dong, Xinpeng, et al.
Publicado: (2026)
PARTONOMY: Large Multimodal Models with Part-Level Visual Understanding
por: Blume, Ansel, et al.
Publicado: (2025)
por: Blume, Ansel, et al.
Publicado: (2025)
Multimodal Distribution Matching for Vision-Language Dataset Distillation
por: Jeong, Jongoh, et al.
Publicado: (2026)
por: Jeong, Jongoh, et al.
Publicado: (2026)
Reducing Peak Memory Usage for Modern Multimodal Large Language Model Pipelines
por: Kim, Junwan, et al.
Publicado: (2026)
por: Kim, Junwan, et al.
Publicado: (2026)
BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models
por: Tang, Jianting, et al.
Publicado: (2025)
por: Tang, Jianting, et al.
Publicado: (2025)
KOFFVQA: An Objectively Evaluated Free-form VQA Benchmark for Large Vision-Language Models in the Korean Language
por: Kim, Yoonshik, et al.
Publicado: (2025)
por: Kim, Yoonshik, et al.
Publicado: (2025)
Active-O3: Empowering Multimodal Large Language Models with Active Perception via GRPO
por: Zhu, Muzhi, et al.
Publicado: (2025)
por: Zhu, Muzhi, et al.
Publicado: (2025)
CoViPAL: Layer-wise Contextualized Visual Token Pruning for Large Vision-Language Models
por: Tang, Zicong, et al.
Publicado: (2025)
por: Tang, Zicong, et al.
Publicado: (2025)
Parameter-Efficient Fine-Tuning Medical Multimodal Large Language Models for Medical Visual Grounding
por: He, Jinlong, et al.
Publicado: (2024)
por: He, Jinlong, et al.
Publicado: (2024)
VDC: Versatile Data Cleanser based on Visual-Linguistic Inconsistency by Multimodal Large Language Models
por: Zhu, Zihao, et al.
Publicado: (2023)
por: Zhu, Zihao, et al.
Publicado: (2023)
Prompt-Aware Adapter: Towards Learning Adaptive Visual Tokens for Multimodal Large Language Models
por: Zhang, Yue, et al.
Publicado: (2024)
por: Zhang, Yue, et al.
Publicado: (2024)
Advancing Multimodal Large Language Models in Chart Question Answering with Visualization-Referenced Instruction Tuning
por: Zeng, Xingchen, et al.
Publicado: (2024)
por: Zeng, Xingchen, et al.
Publicado: (2024)
Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism
por: Chen, Tao, et al.
Publicado: (2026)
por: Chen, Tao, et al.
Publicado: (2026)
Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens
por: Kim, Sohee, et al.
Publicado: (2025)
por: Kim, Sohee, et al.
Publicado: (2025)
By My Eyes: Grounding Multimodal Large Language Models with Sensor Data via Visual Prompting
por: Yoon, Hyungjun, et al.
Publicado: (2024)
por: Yoon, Hyungjun, et al.
Publicado: (2024)
Ejemplares similares
-
QEVA: A Reference-Free Evaluation Metric for Narrative Video Summarization with Multimodal Question Answering
por: Jung, Woojun, et al.
Publicado: (2026) -
Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models
por: Jung, Mingi, et al.
Publicado: (2025) -
Thinking Diffusion: Penalize and Guide Visual-Grounded Reasoning in Diffusion Multimodal Language Models
por: Kim, Keuntae, et al.
Publicado: (2026) -
Contextual Object Detection with Multimodal Large Language Models
por: Zang, Yuhang, et al.
Publicado: (2023) -
GranAlign: Granularity-Aware Alignment Framework for Zero-Shot Video Moment Retrieval
por: Jeon, Mingyu, et al.
Publicado: (2026)