Owls are wise and foxes are unfaithful: Uncovering animal stereotypes in vision-language models
Fuente:
arXiv
Saved in:
| Main Authors: | Aman, Tabinda, Nadeem, Mohammad, Sohail, Shahab Saquib, Anas, Mohammad, Cambria, Erik |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Gender Bias in Text-to-Video Generation Models: A case study of Sora
by: Nadeem, Mohammad, et al.
Published: (2024)
by: Nadeem, Mohammad, et al.
Published: (2024)
IndicFairFace: Balanced Indian Face Dataset for Auditing and Mitigating Geographical Bias in Vision-Language Models
by: Mohsin, Aarish Shah, et al.
Published: (2026)
by: Mohsin, Aarish Shah, et al.
Published: (2026)
Surgeons Are Indian Males and Speech Therapists Are White Females: Auditing Biases in Vision-Language Models for Healthcare Professionals
by: Siddiqui, Zohaib Hasan, et al.
Published: (2025)
by: Siddiqui, Zohaib Hasan, et al.
Published: (2025)
Negation Blindness in Large Language Models: Unveiling the NO Syndrome in Image Generation
by: Nadeem, Mohammad, et al.
Published: (2024)
by: Nadeem, Mohammad, et al.
Published: (2024)
Frame Sampling Strategies Matter: A Benchmark for small vision language models
by: Brkic, Marija, et al.
Published: (2025)
by: Brkic, Marija, et al.
Published: (2025)
Beyond Specialization: Benchmarking LLMs for Transliteration of Indian Languages
by: Azam, Gulfarogh, et al.
Published: (2025)
by: Azam, Gulfarogh, et al.
Published: (2025)
Debiasing CLIP: Interpreting and Correcting Bias in Attention Heads
by: Yeo, Wei Jie, et al.
Published: (2025)
by: Yeo, Wei Jie, et al.
Published: (2025)
Interpreting the linear structure of vision-language model embedding spaces
by: Papadimitriou, Isabel, et al.
Published: (2025)
by: Papadimitriou, Isabel, et al.
Published: (2025)
EduStory: A Unified Framework for Pedagogically-Consistent Multi-Shot STEM Instructional Video Generation
by: Wu, Xinyi, et al.
Published: (2026)
by: Wu, Xinyi, et al.
Published: (2026)
PubMed-Ophtha: An open resource for training ophthalmology vision-language models on scientific literature
by: Hallitschke, Verena Jasmin, et al.
Published: (2026)
by: Hallitschke, Verena Jasmin, et al.
Published: (2026)
The in-context inductive biases of vision-language models differ across modalities
by: Allen, Kelsey, et al.
Published: (2025)
by: Allen, Kelsey, et al.
Published: (2025)
When language and vision meet road safety: leveraging multimodal large language models for video-based traffic accident analysis
by: Zhang, Ruixuan, et al.
Published: (2025)
by: Zhang, Ruixuan, et al.
Published: (2025)
Advancing 3D Point Cloud Understanding through Deep Transfer Learning: A Comprehensive Survey
by: Sohail, Shahab Saquib, et al.
Published: (2024)
by: Sohail, Shahab Saquib, et al.
Published: (2024)
OmDet: Large-scale vision-language multi-dataset pre-training with multimodal detection network
by: Zhao, Tiancheng, et al.
Published: (2022)
by: Zhao, Tiancheng, et al.
Published: (2022)
Towards Deployable OCR models for Indic languages
by: Mathew, Minesh, et al.
Published: (2022)
by: Mathew, Minesh, et al.
Published: (2022)
Cross-modal linkage risk in clinical vision-language models
by: Arasteh, Soroosh Tayebi, et al.
Published: (2026)
by: Arasteh, Soroosh Tayebi, et al.
Published: (2026)
Mitigating Multimodal Hallucination via Phase-wise Self-reward
by: Zhang, Yu, et al.
Published: (2026)
by: Zhang, Yu, et al.
Published: (2026)
GC-KBVQA: A New Four-Stage Framework for Enhancing Knowledge Based Visual Question Answering Performance
by: Moradi, Mohammad Mahdi, et al.
Published: (2025)
by: Moradi, Mohammad Mahdi, et al.
Published: (2025)
The Abstraction Gap in Vision-Language Causal Reasoning
by: Hoang, Chinh, et al.
Published: (2026)
by: Hoang, Chinh, et al.
Published: (2026)
Sumotosima: A Framework and Dataset for Classifying and Summarizing Otoscopic Images
by: Khan, Eram Anwarul, et al.
Published: (2024)
by: Khan, Eram Anwarul, et al.
Published: (2024)
Uncovering Entity Identity Confusion in Multimodal Knowledge Editing
by: Wu, Shu, et al.
Published: (2026)
by: Wu, Shu, et al.
Published: (2026)
Npix2Cpix: A GAN-Based Image-to-Image Translation Network With Retrieval- Classification Integration for Watermark Retrieval From Historical Document Images
by: Saha, Utsab, et al.
Published: (2024)
by: Saha, Utsab, et al.
Published: (2024)
Advancing vision-language models in front-end development via data synthesis
by: Ge, Tong, et al.
Published: (2025)
by: Ge, Tong, et al.
Published: (2025)
PathAlign: A vision-language model for whole slide images in histopathology
by: Ahmed, Faruk, et al.
Published: (2024)
by: Ahmed, Faruk, et al.
Published: (2024)
Hallucination as an Upper Bound: A New Perspective on Text-to-Image Evaluation
by: Kasaei, Seyed Amir, et al.
Published: (2025)
by: Kasaei, Seyed Amir, et al.
Published: (2025)
Assessing the alignment between infants' visual and linguistic experience using multimodal language models
by: Tan, Alvin Wei Ming, et al.
Published: (2025)
by: Tan, Alvin Wei Ming, et al.
Published: (2025)
ProfVLM: A lightweight video-language model for multi-view proficiency estimation
by: Bianchi, Edoardo, et al.
Published: (2025)
by: Bianchi, Edoardo, et al.
Published: (2025)
EnTri: Ensemble Learning with Tri-level Representations for Explainable Scene Recognition
by: Aminimehr, Amirhossein, et al.
Published: (2023)
by: Aminimehr, Amirhossein, et al.
Published: (2023)
MediConfusion: Can you trust your AI radiologist? Probing the reliability of multimodal medical foundation models
by: Sepehri, Mohammad Shahab, et al.
Published: (2024)
by: Sepehri, Mohammad Shahab, et al.
Published: (2024)
Are VLMs Seeing or Just Saying? Uncovering the Illusion of Visual Re-examination
by: Shi, Chufan, et al.
Published: (2026)
by: Shi, Chufan, et al.
Published: (2026)
Kaleidoscope: In-language Exams for Massively Multilingual Vision Evaluation
by: Salazar, Israfel, et al.
Published: (2025)
by: Salazar, Israfel, et al.
Published: (2025)
Seeing Isn't Believing: Uncovering Blind Spots in Evaluator Vision-Language Models
by: Khan, Mohammed Safi Ur Rahman, et al.
Published: (2026)
by: Khan, Mohammed Safi Ur Rahman, et al.
Published: (2026)
Voting-based Multimodal Automatic Deception Detection
by: Touma, Lana, et al.
Published: (2023)
by: Touma, Lana, et al.
Published: (2023)
Automating construction safety inspections using a multi-modal vision-language RAG framework
by: Wang, Chenxin, et al.
Published: (2025)
by: Wang, Chenxin, et al.
Published: (2025)
Image captioning in different languages
by: van Miltenburg, Emiel
Published: (2024)
by: van Miltenburg, Emiel
Published: (2024)
Evaluating the Evaluators: Metrics for Compositional Text-to-Image Generation
by: Kasaei, Seyed Amir, et al.
Published: (2025)
by: Kasaei, Seyed Amir, et al.
Published: (2025)
Multimodal Large Language Models for Enhanced Traffic Safety: A Comprehensive Review and Future Trends
by: Tami, Mohammad Abu, et al.
Published: (2025)
by: Tami, Mohammad Abu, et al.
Published: (2025)
HazardNet: A Small-Scale Vision Language Model for Real-Time Traffic Safety Detection at Edge Devices
by: Tami, Mohammad Abu, et al.
Published: (2025)
by: Tami, Mohammad Abu, et al.
Published: (2025)
Layer-wise Alignment: Examining Safety Alignment Across Image Encoder Layers in Vision Language Models
by: Bachu, Saketh, et al.
Published: (2024)
by: Bachu, Saketh, et al.
Published: (2024)
Head-wise Modality Specialization within MLLMs for Robust Fake News Detection under Missing Modality
by: Qian, Kai, et al.
Published: (2026)
by: Qian, Kai, et al.
Published: (2026)
Similar Items
-
Gender Bias in Text-to-Video Generation Models: A case study of Sora
by: Nadeem, Mohammad, et al.
Published: (2024) -
IndicFairFace: Balanced Indian Face Dataset for Auditing and Mitigating Geographical Bias in Vision-Language Models
by: Mohsin, Aarish Shah, et al.
Published: (2026) -
Surgeons Are Indian Males and Speech Therapists Are White Females: Auditing Biases in Vision-Language Models for Healthcare Professionals
by: Siddiqui, Zohaib Hasan, et al.
Published: (2025) -
Negation Blindness in Large Language Models: Unveiling the NO Syndrome in Image Generation
by: Nadeem, Mohammad, et al.
Published: (2024) -
Frame Sampling Strategies Matter: A Benchmark for small vision language models
by: Brkic, Marija, et al.
Published: (2025)