Can visual language models resolve textual ambiguity with visual cues? Let visual puns tell you!
Fuente:
arXiv
Saved in:
| Main Authors: | Chung, Jiwan, Lim, Seungwon, Jeon, Jaehyun, Lee, Seungbeen, Yu, Youngjae |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MASS: Overcoming Language Bias in Image-Text Matching
by: Chung, Jiwan, et al.
Published: (2025)
by: Chung, Jiwan, et al.
Published: (2025)
Quantifying the human visual exposome with vision language models
by: Rominger, Christian, et al.
Published: (2026)
by: Rominger, Christian, et al.
Published: (2026)
BRAVE: Broadening the visual encoding of vision-language models
by: Kar, Oğuzhan Fatih, et al.
Published: (2024)
by: Kar, Oğuzhan Fatih, et al.
Published: (2024)
Neuromorphic visual attention for Sign-language recognition on SpiNNaker
by: Liskova, Sarka, et al.
Published: (2026)
by: Liskova, Sarka, et al.
Published: (2026)
VAGUE: Visual Contexts Clarify Ambiguous Expressions
by: Nam, Heejeong, et al.
Published: (2024)
by: Nam, Heejeong, et al.
Published: (2024)
Towards Visual Text Design Transfer Across Languages
by: Choi, Yejin, et al.
Published: (2024)
by: Choi, Yejin, et al.
Published: (2024)
Unlocking the Capabilities of Masked Generative Models for Image Synthesis via Self-Guidance
by: Hur, Jiwan, et al.
Published: (2024)
by: Hur, Jiwan, et al.
Published: (2024)
Bridging the gap to real-world language-grounded visual concept learning
by: Jung, Whie, et al.
Published: (2025)
by: Jung, Whie, et al.
Published: (2025)
Exploring visual language models as a powerful tool in the diagnosis of Ewing Sarcoma
by: Pastor-Naranjo, Alvaro, et al.
Published: (2025)
by: Pastor-Naranjo, Alvaro, et al.
Published: (2025)
Vision language models are blind: Failing to translate detailed visual features into words
by: Rahmanzadehgervi, Pooyan, et al.
Published: (2024)
by: Rahmanzadehgervi, Pooyan, et al.
Published: (2024)
MIMO: A medical vision language model with visual referring multimodal input and pixel grounding multimodal output
by: Chen, Yanyuan, et al.
Published: (2025)
by: Chen, Yanyuan, et al.
Published: (2025)
On the rankability of visual embeddings
by: Sonthalia, Ankit, et al.
Published: (2025)
by: Sonthalia, Ankit, et al.
Published: (2025)
UNBOX: Unveiling Black-box visual models with Natural-language
by: Carnemolla, Simone, et al.
Published: (2026)
by: Carnemolla, Simone, et al.
Published: (2026)
v1: Learning to Point Visual Tokens for Multimodal Grounded Reasoning
by: Chung, Jiwan, et al.
Published: (2025)
by: Chung, Jiwan, et al.
Published: (2025)
Assessing the alignment between infants' visual and linguistic experience using multimodal language models
by: Tan, Alvin Wei Ming, et al.
Published: (2025)
by: Tan, Alvin Wei Ming, et al.
Published: (2025)
Bridging visual saliency and large language models for explainable deep learning in medical imaging
by: Nguezet, Paul Valery, et al.
Published: (2026)
by: Nguezet, Paul Valery, et al.
Published: (2026)
Spotting tell-tale visual artifacts in face swapping videos: strengths and pitfalls of CNN detectors
by: Ziglio, Riccardo, et al.
Published: (2025)
by: Ziglio, Riccardo, et al.
Published: (2025)
Incremental dimension reduction for efficient and accurate visual anomaly detection
by: Lee, Teng-Yok
Published: (2026)
by: Lee, Teng-Yok
Published: (2026)
Can we make NeRF-based visual localization privacy-preserving?
by: Pietrantoni, Maxime, et al.
Published: (2025)
by: Pietrantoni, Maxime, et al.
Published: (2025)
Selective Vision is the Challenge for Visual Reasoning: A Benchmark for Visual Argument Understanding
by: Chung, Jiwan, et al.
Published: (2024)
by: Chung, Jiwan, et al.
Published: (2024)
Teaching Metric Distance to Discrete Autoregressive Language Models
by: Chung, Jiwan, et al.
Published: (2025)
by: Chung, Jiwan, et al.
Published: (2025)
EyeCLIP: A visual-language foundation model for multi-modal ophthalmic image analysis
by: Shi, Danli, et al.
Published: (2024)
by: Shi, Danli, et al.
Published: (2024)
Learning Neural Deformation Representation for 4D Dynamic Shape Generation
by: Han, Gyojin, et al.
Published: (2026)
by: Han, Gyojin, et al.
Published: (2026)
GuideDog: A Real-World Egocentric Multimodal Dataset for Blind and Low-Vision Accessibility-Aware Guidance
by: Kim, Junhyeok, et al.
Published: (2025)
by: Kim, Junhyeok, et al.
Published: (2025)
Efficient coding along the visual hierarchy
by: Passi, Ananya, et al.
Published: (2026)
by: Passi, Ananya, et al.
Published: (2026)
Sparse autoencoders reveal selective remapping of visual concepts during adaptation
by: Lim, Hyesu, et al.
Published: (2024)
by: Lim, Hyesu, et al.
Published: (2024)
Do text-free diffusion models learn discriminative visual representations?
by: Mukhopadhyay, Soumik, et al.
Published: (2023)
by: Mukhopadhyay, Soumik, et al.
Published: (2023)
Rapidly deploying on-device eye tracking by distilling visual foundation models
by: Jiang, Cheng, et al.
Published: (2026)
by: Jiang, Cheng, et al.
Published: (2026)
Frequency-Aware Token Reduction for Efficient Vision Transformer
by: Lee, Dong-Jae, et al.
Published: (2025)
by: Lee, Dong-Jae, et al.
Published: (2025)
Universal dimensions of visual representation
by: Chen, Zirui, et al.
Published: (2024)
by: Chen, Zirui, et al.
Published: (2024)
Large-scale visual SLAM for in-the-wild videos
by: Sun, Shuo, et al.
Published: (2025)
by: Sun, Shuo, et al.
Published: (2025)
Let's Roll a BiFTA: Bi-refinement for Fine-grained Text-visual Alignment in Vision-Language Models
by: Sun, Yuhao, et al.
Published: (2026)
by: Sun, Yuhao, et al.
Published: (2026)
Can ChatGPT assist visually impaired people with micro-navigation?
by: He, Junxian, et al.
Published: (2024)
by: He, Junxian, et al.
Published: (2024)
Learning complete and explainable visual representations from itemized text supervision
by: Lyu, Yiwei, et al.
Published: (2025)
by: Lyu, Yiwei, et al.
Published: (2025)
Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues
by: Kim, Youngmin, et al.
Published: (2025)
by: Kim, Youngmin, et al.
Published: (2025)
Characterizing the visual representation of objects from the child's view
by: Yang, Jane, et al.
Published: (2026)
by: Yang, Jane, et al.
Published: (2026)
A transition towards virtual representations of visual scenes
by: Pereira, Américo, et al.
Published: (2024)
by: Pereira, Américo, et al.
Published: (2024)
AI-driven visual monitoring of industrial assembly tasks
by: Nardon, Mattia, et al.
Published: (2025)
by: Nardon, Mattia, et al.
Published: (2025)
Perception Encoder: The best visual embeddings are not at the output of the network
by: Bolya, Daniel, et al.
Published: (2025)
by: Bolya, Daniel, et al.
Published: (2025)
Improved visual-information-driven model for crowd simulation and its modular application
by: Liang, Xuanwen, et al.
Published: (2025)
by: Liang, Xuanwen, et al.
Published: (2025)
Similar Items
-
MASS: Overcoming Language Bias in Image-Text Matching
by: Chung, Jiwan, et al.
Published: (2025) -
Quantifying the human visual exposome with vision language models
by: Rominger, Christian, et al.
Published: (2026) -
BRAVE: Broadening the visual encoding of vision-language models
by: Kar, Oğuzhan Fatih, et al.
Published: (2024) -
Neuromorphic visual attention for Sign-language recognition on SpiNNaker
by: Liskova, Sarka, et al.
Published: (2026) -
VAGUE: Visual Contexts Clarify Ambiguous Expressions
by: Nam, Heejeong, et al.
Published: (2024)