BBQ-V: Benchmarking Visual Stereotype Bias in Large Multimodal Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Narnaware, Vishal, Vayani, Ashmal, Gupta, Rohit, Swetha, Sirnam, Shah, Mubarak |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
StretchySnake: Flexible SSM Training Unlocks Action Recognition Across Spatio-Temporal Scales
par: Siddiqui, Nyle, et autres
Publié: (2025)
par: Siddiqui, Nyle, et autres
Publié: (2025)
TimeLogic: A Temporal Logic Benchmark for Video QA
par: Swetha, Sirnam, et autres
Publié: (2025)
par: Swetha, Sirnam, et autres
Publié: (2025)
Seeing to Ground: Visual Attention for Hallucination-Resilient MDLLMs
par: Narnaware, Vishal, et autres
Publié: (2026)
par: Narnaware, Vishal, et autres
Publié: (2026)
Safe-LLaVA: A Privacy-Preserving Vision-Language Dataset and Benchmark for Biometric Safety
par: Kim, Younggun, et autres
Publié: (2025)
par: Kim, Younggun, et autres
Publié: (2025)
The Telephone Game: Evaluating Semantic Drift in Unified Models
par: Mollah, Sabbir, et autres
Publié: (2025)
par: Mollah, Sabbir, et autres
Publié: (2025)
TIGeR: A Unified Framework for Time, Images and Geo-location Retrieval
par: Shatwell, David G., et autres
Publié: (2026)
par: Shatwell, David G., et autres
Publié: (2026)
GT-Loc: Unifying When and Where in Images Through a Joint Embedding Space
par: Shatwell, David G., et autres
Publié: (2025)
par: Shatwell, David G., et autres
Publié: (2025)
VRR-QA: Visual Relational Reasoning in Videos Beyond Explicit Cues
par: Swetha, Sirnam, et autres
Publié: (2025)
par: Swetha, Sirnam, et autres
Publié: (2025)
HumaniBench: A Human-Centric Framework for Large Multimodal Models Evaluation
par: Raza, Shaina, et autres
Publié: (2025)
par: Raza, Shaina, et autres
Publié: (2025)
GAEA: A Geolocation Aware Conversational Assistant
par: Campos, Ron, et autres
Publié: (2025)
par: Campos, Ron, et autres
Publié: (2025)
MedRoute: RL-Based Dynamic Specialist Routing in Multi-Agent Medical Diagnosis
par: Vayani, Ashmal, et autres
Publié: (2026)
par: Vayani, Ashmal, et autres
Publié: (2026)
Cross-View Open-Vocabulary Object Detection in Aerial Imagery
par: Kini, Jyoti, et autres
Publié: (2025)
par: Kini, Jyoti, et autres
Publié: (2025)
VURF: A General-purpose Reasoning and Self-refinement Framework for Video Understanding
par: Mahmood, Ahmad, et autres
Publié: (2024)
par: Mahmood, Ahmad, et autres
Publié: (2024)
X-Former: Unifying Contrastive and Reconstruction Learning for MLLMs
par: Swetha, Sirnam, et autres
Publié: (2024)
par: Swetha, Sirnam, et autres
Publié: (2024)
VidTAG: Temporally Aligned Video to GPS Geolocalization with Denoising Sequence Prediction at a Global Scale
par: Kulkarni, Parth Parag, et autres
Publié: (2026)
par: Kulkarni, Parth Parag, et autres
Publié: (2026)
A Culturally-diverse Multilingual Multimodal Video Benchmark & Model
par: Shafique, Bhuiyan Sanjid, et autres
Publié: (2025)
par: Shafique, Bhuiyan Sanjid, et autres
Publié: (2025)
ViLL-E: Video LLM Embeddings for Retrieval
par: Gupta, Rohit, et autres
Publié: (2026)
par: Gupta, Rohit, et autres
Publié: (2026)
BBQ-to-Image: Numeric Bounding Box and Qolor Control in Large-Scale Text-to-Image Models
par: Kachlon, Eliran, et autres
Publié: (2026)
par: Kachlon, Eliran, et autres
Publié: (2026)
Leveraging Pre-Trained Visual Models for AI-Generated Video Detection
par: Veeramachaneni, Keerthi, et autres
Publié: (2025)
par: Veeramachaneni, Keerthi, et autres
Publié: (2025)
STROKEVISION-BENCH: A Multimodal Video And 2D Pose Benchmark For Tracking Stroke Recovery
par: Robinson, David, et autres
Publié: (2025)
par: Robinson, David, et autres
Publié: (2025)
ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models
par: Roberts, Jonathan, et autres
Publié: (2025)
par: Roberts, Jonathan, et autres
Publié: (2025)
SegVG: Transferring Object Bounding Box to Segmentation for Visual Grounding
par: Kang, Weitai, et autres
Publié: (2024)
par: Kang, Weitai, et autres
Publié: (2024)
From Play to Replay: Composed Video Retrieval for Temporally Fine-Grained Videos
par: Gupta, Animesh, et autres
Publié: (2025)
par: Gupta, Animesh, et autres
Publié: (2025)
PDB-Eval: An Evaluation of Large Multimodal Models for Description and Explanation of Personalized Driving Behavior
par: Wu, Junda, et autres
Publié: (2025)
par: Wu, Junda, et autres
Publié: (2025)
Can Visual Input Be Compressed? A Visual Token Compression Benchmark for Large Multimodal Models
par: Peng, Tianfan, et autres
Publié: (2025)
par: Peng, Tianfan, et autres
Publié: (2025)
Open Vocabulary Multi-Label Video Classification
par: Gupta, Rohit, et autres
Publié: (2024)
par: Gupta, Rohit, et autres
Publié: (2024)
The Digital Mirror: Gender Bias and Occupational Stereotypes in AI-Generated Images
par: Leppälampi, Siiri, et autres
Publié: (2025)
par: Leppälampi, Siiri, et autres
Publié: (2025)
Class Prototypes based Contrastive Learning for Classifying Multi-Label and Fine-Grained Educational Videos
par: Gupta, Rohit, et autres
Publié: (2025)
par: Gupta, Rohit, et autres
Publié: (2025)
Visual Cues of Gender and Race are Associated with Stereotyping in Vision-Language Models
par: Lee, Messi H. J., et autres
Publié: (2025)
par: Lee, Messi H. J., et autres
Publié: (2025)
VP-Bench: A Comprehensive Benchmark for Visual Prompting in Multimodal Large Language Models
par: Xu, Mingjie, et autres
Publié: (2025)
par: Xu, Mingjie, et autres
Publié: (2025)
Seeing Is Believing? A Benchmark for Multimodal Large Language Models on Visual Illusions and Anomalies
par: Hou, Wenjin, et autres
Publié: (2026)
par: Hou, Wenjin, et autres
Publié: (2026)
Enhancing Privacy-Utility Trade-offs to Mitigate Memorization in Diffusion Models
par: Chen, Chen, et autres
Publié: (2025)
par: Chen, Chen, et autres
Publié: (2025)
Exploring Local Memorization in Diffusion Models via Bright Ending Attention
par: Chen, Chen, et autres
Publié: (2024)
par: Chen, Chen, et autres
Publié: (2024)
Learnability-Guided Diffusion for Dataset Distillation
par: Chan-Santiago, Jeffrey A., et autres
Publié: (2026)
par: Chan-Santiago, Jeffrey A., et autres
Publié: (2026)
PackCache: A Training-Free Acceleration Method for Unified Autoregressive Video Generation via Compact KV-Cache
par: Li, Kunyang, et autres
Publié: (2026)
par: Li, Kunyang, et autres
Publié: (2026)
CODIS: Benchmarking Context-Dependent Visual Comprehension for Multimodal Large Language Models
par: Luo, Fuwen, et autres
Publié: (2024)
par: Luo, Fuwen, et autres
Publié: (2024)
Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models
par: Dong, Yuhao, et autres
Publié: (2024)
par: Dong, Yuhao, et autres
Publié: (2024)
Enhancing Box and Block Test with Computer Vision for Post-Stroke Upper Extremity Motor Evaluation
par: Robinson, David, et autres
Publié: (2026)
par: Robinson, David, et autres
Publié: (2026)
Mind's Eye: A Benchmark of Visual Abstraction, Transformation and Composition for Multimodal LLMs
par: Sinha, Rohit, et autres
Publié: (2026)
par: Sinha, Rohit, et autres
Publié: (2026)
UNIKIE-BENCH: Benchmarking Large Multimodal Models for Key Information Extraction in Visual Documents
par: Ji, Yifan, et autres
Publié: (2026)
par: Ji, Yifan, et autres
Publié: (2026)
Documents similaires
-
StretchySnake: Flexible SSM Training Unlocks Action Recognition Across Spatio-Temporal Scales
par: Siddiqui, Nyle, et autres
Publié: (2025) -
TimeLogic: A Temporal Logic Benchmark for Video QA
par: Swetha, Sirnam, et autres
Publié: (2025) -
Seeing to Ground: Visual Attention for Hallucination-Resilient MDLLMs
par: Narnaware, Vishal, et autres
Publié: (2026) -
Safe-LLaVA: A Privacy-Preserving Vision-Language Dataset and Benchmark for Biometric Safety
par: Kim, Younggun, et autres
Publié: (2025) -
The Telephone Game: Evaluating Semantic Drift in Unified Models
par: Mollah, Sabbir, et autres
Publié: (2025)