ColorFoil: Investigating Color Blindness in Large Vision and Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Samin, Ahnaf Mozib, Ahmed, M. Firoz, Rafee, Md. Mushtaq Shahriyar |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ColorBlindnessEval: Can Vision-Language Models Pass Color Blindness Tests?
di: Ling, Zijian, et al.
Pubblicazione: (2025)
di: Ling, Zijian, et al.
Pubblicazione: (2025)
Byte Pair Encoding Is All You Need For Automatic Bengali Speech Recognition
di: Samin, Ahnaf Mozib
Pubblicazione: (2024)
di: Samin, Ahnaf Mozib
Pubblicazione: (2024)
Diagnosing Vision Language Models' Perception by Leveraging Human Methods for Color Vision Deficiencies
di: Hayashi, Kazuki, et al.
Pubblicazione: (2025)
di: Hayashi, Kazuki, et al.
Pubblicazione: (2025)
IllusionVQA: A Challenging Optical Illusion Dataset for Vision Language Models
di: Shahgir, Haz Sameen, et al.
Pubblicazione: (2024)
di: Shahgir, Haz Sameen, et al.
Pubblicazione: (2024)
Seeing No Evil: Blinding Large Vision-Language Models to Safety Instructions via Adversarial Attention Hijacking
di: Li, Jingru, et al.
Pubblicazione: (2026)
di: Li, Jingru, et al.
Pubblicazione: (2026)
Seeing Isn't Believing: Uncovering Blind Spots in Evaluator Vision-Language Models
di: Khan, Mohammed Safi Ur Rahman, et al.
Pubblicazione: (2026)
di: Khan, Mohammed Safi Ur Rahman, et al.
Pubblicazione: (2026)
Using Vision + Language Models to Predict Item Difficulty
di: Khan, Samin
Pubblicazione: (2026)
di: Khan, Samin
Pubblicazione: (2026)
A Lightweight Vision-Language Fusion Framework for Predicting App Ratings from User Interfaces and Metadata
di: Sultana, Azrin, et al.
Pubblicazione: (2026)
di: Sultana, Azrin, et al.
Pubblicazione: (2026)
Judging the Judges: Can Large Vision-Language Models Fairly Evaluate Chart Comprehension and Reasoning?
di: Laskar, Md Tahmid Rahman, et al.
Pubblicazione: (2025)
di: Laskar, Md Tahmid Rahman, et al.
Pubblicazione: (2025)
PEFT A2Z: Parameter-Efficient Fine-Tuning Survey for Large Language and Vision Models
di: Prottasha, Nusrat Jahan, et al.
Pubblicazione: (2025)
di: Prottasha, Nusrat Jahan, et al.
Pubblicazione: (2025)
Finer: Investigating and Enhancing Fine-Grained Visual Concept Recognition in Large Vision Language Models
di: Kim, Jeonghwan, et al.
Pubblicazione: (2024)
di: Kim, Jeonghwan, et al.
Pubblicazione: (2024)
Investigating Spatial Attention Bias in Vision-Language Models
di: Chaudhary, Aryan, et al.
Pubblicazione: (2025)
di: Chaudhary, Aryan, et al.
Pubblicazione: (2025)
ColorConceptBench: A Benchmark for Probabilistic Color-Concept Understanding in Text-to-Image Models
di: Ruan, Chenxi, et al.
Pubblicazione: (2026)
di: Ruan, Chenxi, et al.
Pubblicazione: (2026)
Arbitration Failure, Not Perceptual Blindness: How Vision-Language Models Resolve Visual-Linguistic Conflicts
di: Nooralahzadeh, Farhad, et al.
Pubblicazione: (2026)
di: Nooralahzadeh, Farhad, et al.
Pubblicazione: (2026)
ColorSwap: A Color and Word Order Dataset for Multimodal Evaluation
di: Burapacheep, Jirayu, et al.
Pubblicazione: (2024)
di: Burapacheep, Jirayu, et al.
Pubblicazione: (2024)
Investigating and Mitigating the Multimodal Hallucination Snowballing in Large Vision-Language Models
di: Zhong, Weihong, et al.
Pubblicazione: (2024)
di: Zhong, Weihong, et al.
Pubblicazione: (2024)
Intriguing Properties of Large Language and Vision Models
di: Lee, Young-Jun, et al.
Pubblicazione: (2024)
di: Lee, Young-Jun, et al.
Pubblicazione: (2024)
TimeSpot: Benchmarking Geo-Temporal Understanding in Vision-Language Models in Real-World Settings
di: Wasi, Azmine Toushik, et al.
Pubblicazione: (2026)
di: Wasi, Azmine Toushik, et al.
Pubblicazione: (2026)
ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos
di: Hannan, Tanveer, et al.
Pubblicazione: (2024)
di: Hannan, Tanveer, et al.
Pubblicazione: (2024)
Visual In-Context Learning for Large Vision-Language Models
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
Instruction-Following Evaluation of Large Vision-Language Models
di: Shiono, Daiki, et al.
Pubblicazione: (2025)
di: Shiono, Daiki, et al.
Pubblicazione: (2025)
Vision-centric Token Compression in Large Language Model
di: Xing, Ling, et al.
Pubblicazione: (2025)
di: Xing, Ling, et al.
Pubblicazione: (2025)
Color Names in Vision-Language Models
di: Gomez-Villa, Alexandra, et al.
Pubblicazione: (2025)
di: Gomez-Villa, Alexandra, et al.
Pubblicazione: (2025)
Forgotten Polygons: Multimodal Large Language Models are Shape-Blind
di: Rudman, William, et al.
Pubblicazione: (2025)
di: Rudman, William, et al.
Pubblicazione: (2025)
The Telephone Game: Evaluating Semantic Drift in Unified Models
di: Mollah, Sabbir, et al.
Pubblicazione: (2025)
di: Mollah, Sabbir, et al.
Pubblicazione: (2025)
Beyond the Vision Encoder: Identifying and Mitigating Spatial Bias in Large Vision-Language Models
di: Zhu, Yingjie, et al.
Pubblicazione: (2025)
di: Zhu, Yingjie, et al.
Pubblicazione: (2025)
Diving into Mitigating Hallucinations from a Vision Perspective for Large Vision-Language Models
di: Wang, Weihang, et al.
Pubblicazione: (2025)
di: Wang, Weihang, et al.
Pubblicazione: (2025)
Toward Interactive Regional Understanding in Vision-Large Language Models
di: Lee, Jungbeom, et al.
Pubblicazione: (2024)
di: Lee, Jungbeom, et al.
Pubblicazione: (2024)
PUMGPT: A Large Vision-Language Model for Product Understanding
di: Xue, Wei, et al.
Pubblicazione: (2023)
di: Xue, Wei, et al.
Pubblicazione: (2023)
Can Large Vision-Language Models Understand Multimodal Sarcasm?
di: Wang, Xinyu, et al.
Pubblicazione: (2025)
di: Wang, Xinyu, et al.
Pubblicazione: (2025)
Evaluation and Enhancement of Semantic Grounding in Large Vision-Language Models
di: Lu, Jiaying, et al.
Pubblicazione: (2023)
di: Lu, Jiaying, et al.
Pubblicazione: (2023)
Centurio: On Drivers of Multilingual Ability of Large Vision-Language Model
di: Geigle, Gregor, et al.
Pubblicazione: (2025)
di: Geigle, Gregor, et al.
Pubblicazione: (2025)
A Two-Stage Multitask Vision-Language Framework for Explainable Crop Disease Visual Question Answering
di: Hossain, Md. Zahid, et al.
Pubblicazione: (2026)
di: Hossain, Md. Zahid, et al.
Pubblicazione: (2026)
NPHardEval4V: Dynamic Evaluation of Large Vision-Language Models with Effects of Vision
di: Li, Xiang, et al.
Pubblicazione: (2024)
di: Li, Xiang, et al.
Pubblicazione: (2024)
IdealGPT: Iteratively Decomposing Vision and Language Reasoning via Large Language Models
di: You, Haoxuan, et al.
Pubblicazione: (2023)
di: You, Haoxuan, et al.
Pubblicazione: (2023)
Large Vision-Language Models for Remote Sensing Visual Question Answering
di: Siripong, Surasakdi, et al.
Pubblicazione: (2024)
di: Siripong, Surasakdi, et al.
Pubblicazione: (2024)
TUBench: Benchmarking Large Vision-Language Models on Trustworthiness with Unanswerable Questions
di: He, Xingwei, et al.
Pubblicazione: (2024)
di: He, Xingwei, et al.
Pubblicazione: (2024)
Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language Models
di: Zhu, Tinghui, et al.
Pubblicazione: (2024)
di: Zhu, Tinghui, et al.
Pubblicazione: (2024)
Enhancing Large Vision Language Models with Self-Training on Image Comprehension
di: Deng, Yihe, et al.
Pubblicazione: (2024)
di: Deng, Yihe, et al.
Pubblicazione: (2024)
A Unified Hallucination Mitigation Framework for Large Vision-Language Models
di: Chang, Yue, et al.
Pubblicazione: (2024)
di: Chang, Yue, et al.
Pubblicazione: (2024)
Documenti analoghi
-
ColorBlindnessEval: Can Vision-Language Models Pass Color Blindness Tests?
di: Ling, Zijian, et al.
Pubblicazione: (2025) -
Byte Pair Encoding Is All You Need For Automatic Bengali Speech Recognition
di: Samin, Ahnaf Mozib
Pubblicazione: (2024) -
Diagnosing Vision Language Models' Perception by Leveraging Human Methods for Color Vision Deficiencies
di: Hayashi, Kazuki, et al.
Pubblicazione: (2025) -
IllusionVQA: A Challenging Optical Illusion Dataset for Vision Language Models
di: Shahgir, Haz Sameen, et al.
Pubblicazione: (2024) -
Seeing No Evil: Blinding Large Vision-Language Models to Safety Instructions via Adversarial Attention Hijacking
di: Li, Jingru, et al.
Pubblicazione: (2026)