When Vision-Language Models Judge Without Seeing: Exposing Informativeness Bias
Fuente:
arXiv
Salvato in:
| Autori principali: | Zou, Xiaohan, Sridhar, Roshan, Safarzadeh, Mohammadtaher, Roth, Dan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Evaluating NL2SQL via SQL2NL
di: Safarzadeh, Mohammadtaher, et al.
Pubblicazione: (2025)
di: Safarzadeh, Mohammadtaher, et al.
Pubblicazione: (2025)
SPENCE: A Syntactic Probe for Detecting Contamination in NL2SQL Benchmarks
di: Safarzadeh, Mohammadtaher, et al.
Pubblicazione: (2026)
di: Safarzadeh, Mohammadtaher, et al.
Pubblicazione: (2026)
Freeze and Reveal: Exposing Modality Bias in Vision-Language Models
di: Kavuri, Vivek Hruday, et al.
Pubblicazione: (2025)
di: Kavuri, Vivek Hruday, et al.
Pubblicazione: (2025)
Hidden Clones: Exposing and Fixing Family Bias in Vision-Language Model Ensembles
di: Bugaud, Zacharie
Pubblicazione: (2026)
di: Bugaud, Zacharie
Pubblicazione: (2026)
Tree-based Dialogue Reinforced Policy Optimization for Red-Teaming Attacks
di: Guo, Ruohao, et al.
Pubblicazione: (2025)
di: Guo, Ruohao, et al.
Pubblicazione: (2025)
When Seeing Overrides Knowing: Disentangling Knowledge Conflicts in Vision-Language Models
di: Ortu, Francesco, et al.
Pubblicazione: (2025)
di: Ortu, Francesco, et al.
Pubblicazione: (2025)
Vision Language Models See What You Want but not What You See
di: Gao, Qingying, et al.
Pubblicazione: (2024)
di: Gao, Qingying, et al.
Pubblicazione: (2024)
Large Causal Models from Large Language Models
di: Mahadevan, Sridhar
Pubblicazione: (2025)
di: Mahadevan, Sridhar
Pubblicazione: (2025)
HInter: Exposing Hidden Intersectional Bias in Large Language Models
di: Souani, Badr, et al.
Pubblicazione: (2025)
di: Souani, Badr, et al.
Pubblicazione: (2025)
When Agents See Humans as the Outgroup: Belief-Dependent Bias in LLM-Powered Agents
di: Wang, Zongwei, et al.
Pubblicazione: (2026)
di: Wang, Zongwei, et al.
Pubblicazione: (2026)
Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models
di: Lyu, Zesen, et al.
Pubblicazione: (2025)
di: Lyu, Zesen, et al.
Pubblicazione: (2025)
Efficient Bias Mitigation Without Privileged Information
di: Zarlenga, Mateo Espinosa, et al.
Pubblicazione: (2024)
di: Zarlenga, Mateo Espinosa, et al.
Pubblicazione: (2024)
Judging the Judges: A Systematic Evaluation of Bias Mitigation Strategies in LLM-as-a-Judge Pipelines
di: Soumik, Sadman Kabir
Pubblicazione: (2026)
di: Soumik, Sadman Kabir
Pubblicazione: (2026)
Multimodal Language Models See Better When They Look Shallower
di: Chen, Haoran, et al.
Pubblicazione: (2025)
di: Chen, Haoran, et al.
Pubblicazione: (2025)
Automated Localization of Blood Vessels in Retinal Images
di: Safarzadeh, Vahid Mohammadi
Pubblicazione: (2023)
di: Safarzadeh, Vahid Mohammadi
Pubblicazione: (2023)
RICL: Adding In-Context Adaptability to Pre-Trained Vision-Language-Action Models
di: Sridhar, Kaustubh, et al.
Pubblicazione: (2025)
di: Sridhar, Kaustubh, et al.
Pubblicazione: (2025)
A Peek into Token Bias: Large Language Models Are Not Yet Genuine Reasoners
di: Jiang, Bowen, et al.
Pubblicazione: (2024)
di: Jiang, Bowen, et al.
Pubblicazione: (2024)
Seeing the Abstract: Translating the Abstract Language for Vision Language Models
di: Talon, Davide, et al.
Pubblicazione: (2025)
di: Talon, Davide, et al.
Pubblicazione: (2025)
Judging the Judges: A Systematic Study of Position Bias in LLM-as-a-Judge
di: Shi, Lin, et al.
Pubblicazione: (2024)
di: Shi, Lin, et al.
Pubblicazione: (2024)
Decoding Biases: Automated Methods and LLM Judges for Gender Bias Detection in Language Models
di: Kumar, Shachi H, et al.
Pubblicazione: (2024)
di: Kumar, Shachi H, et al.
Pubblicazione: (2024)
CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction
di: Zou, Jing, et al.
Pubblicazione: (2025)
di: Zou, Jing, et al.
Pubblicazione: (2025)
BLINK: Multimodal Large Language Models Can See but Not Perceive
di: Fu, Xingyu, et al.
Pubblicazione: (2024)
di: Fu, Xingyu, et al.
Pubblicazione: (2024)
When AIs Judge AIs: The Rise of Agent-as-a-Judge Evaluation for LLMs
di: Yu, Fangyi
Pubblicazione: (2025)
di: Yu, Fangyi
Pubblicazione: (2025)
Egocentric Bias in Vision-Language Models
di: Wang, Maijunxian, et al.
Pubblicazione: (2026)
di: Wang, Maijunxian, et al.
Pubblicazione: (2026)
Judging by Appearances? Auditing and Intervening Vision-Language Models for Bail Prediction
di: Basu, Sagnik, et al.
Pubblicazione: (2025)
di: Basu, Sagnik, et al.
Pubblicazione: (2025)
Context Over Content: Exposing Evaluation Faking in Automated Judges
di: Gupta, Manan, et al.
Pubblicazione: (2026)
di: Gupta, Manan, et al.
Pubblicazione: (2026)
Fairness or Fluency? An Investigation into Language Bias of Pairwise LLM-as-a-Judge
di: Zhou, Xiaolin, et al.
Pubblicazione: (2026)
di: Zhou, Xiaolin, et al.
Pubblicazione: (2026)
JAF: Judge Agent Forest
di: Garg, Sahil, et al.
Pubblicazione: (2026)
di: Garg, Sahil, et al.
Pubblicazione: (2026)
Not All Tokens See Equally: Perception-Grounded Policy Optimization for Large Vision-Language Models
di: Ye, Zekai, et al.
Pubblicazione: (2026)
di: Ye, Zekai, et al.
Pubblicazione: (2026)
Exposing Product Bias in LLM Investment Recommendation
di: Zhi, Yuhan, et al.
Pubblicazione: (2025)
di: Zhi, Yuhan, et al.
Pubblicazione: (2025)
SocREval: Large Language Models with the Socratic Method for Reference-Free Reasoning Evaluation
di: He, Hangfeng, et al.
Pubblicazione: (2023)
di: He, Hangfeng, et al.
Pubblicazione: (2023)
JudgeLRM: Large Reasoning Models as a Judge
di: Chen, Nuo, et al.
Pubblicazione: (2025)
di: Chen, Nuo, et al.
Pubblicazione: (2025)
Seeing Through Experts Eyes A Foundational Vision Language Model Trained on Radiologists Gaze and Reasoning
di: Lee, Kinhei, et al.
Pubblicazione: (2026)
di: Lee, Kinhei, et al.
Pubblicazione: (2026)
Topos Causal Models
di: Mahadevan, Sridhar
Pubblicazione: (2025)
di: Mahadevan, Sridhar
Pubblicazione: (2025)
Beyond Consensus: Mitigating the Agreeableness Bias in LLM Judge Evaluations
di: Jain, Suryaansh, et al.
Pubblicazione: (2025)
di: Jain, Suryaansh, et al.
Pubblicazione: (2025)
PairBench: Are Vision-Language Models Reliable at Comparing What They See?
di: Feizi, Aarash, et al.
Pubblicazione: (2025)
di: Feizi, Aarash, et al.
Pubblicazione: (2025)
Discovering Latent Knowledge in Language Models Without Supervision
di: Burns, Collin, et al.
Pubblicazione: (2022)
di: Burns, Collin, et al.
Pubblicazione: (2022)
Mitigating Translationese Bias in Multilingual LLM-as-a-Judge via Disentangled Information Bottleneck
di: Zhang, Hongbin, et al.
Pubblicazione: (2026)
di: Zhang, Hongbin, et al.
Pubblicazione: (2026)
Beyond Reproducibility: Token Probabilities Expose Large Language Model Nondeterminism
di: Fu, Tairan, et al.
Pubblicazione: (2026)
di: Fu, Tairan, et al.
Pubblicazione: (2026)
Benchmarking Adversarial Robustness to Bias Elicitation in Large Language Models: Scalable Automated Assessment with LLM-as-a-Judge
di: Cantini, Riccardo, et al.
Pubblicazione: (2025)
di: Cantini, Riccardo, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Evaluating NL2SQL via SQL2NL
di: Safarzadeh, Mohammadtaher, et al.
Pubblicazione: (2025) -
SPENCE: A Syntactic Probe for Detecting Contamination in NL2SQL Benchmarks
di: Safarzadeh, Mohammadtaher, et al.
Pubblicazione: (2026) -
Freeze and Reveal: Exposing Modality Bias in Vision-Language Models
di: Kavuri, Vivek Hruday, et al.
Pubblicazione: (2025) -
Hidden Clones: Exposing and Fixing Family Bias in Vision-Language Model Ensembles
di: Bugaud, Zacharie
Pubblicazione: (2026) -
Tree-based Dialogue Reinforced Policy Optimization for Red-Teaming Attacks
di: Guo, Ruohao, et al.
Pubblicazione: (2025)