Mitigating the Bias of Large Language Model Evaluation
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhou, Hongli, Huang, Hui, Long, Yunfei, Xu, Bing, Zhu, Conghui, Cao, Hailong, Yang, Muyun, Zhao, Tiejun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Toward Robust LLM-Based Judges: Taxonomic Bias Evaluation and Debiasing Optimization
di: Zhou, Hongli, et al.
Pubblicazione: (2026)
di: Zhou, Hongli, et al.
Pubblicazione: (2026)
Lost in Benchmarks? Rethinking Large Language Model Benchmarking with Item Response Theory
di: Zhou, Hongli, et al.
Pubblicazione: (2025)
di: Zhou, Hongli, et al.
Pubblicazione: (2025)
Long-form RewardBench: Evaluating Reward Models for Long-form Generation
di: Huang, Hui, et al.
Pubblicazione: (2026)
di: Huang, Hui, et al.
Pubblicazione: (2026)
Self-Evaluation of Large Language Model based on Glass-box Features
di: Huang, Hui, et al.
Pubblicazione: (2024)
di: Huang, Hui, et al.
Pubblicazione: (2024)
An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4
di: Huang, Hui, et al.
Pubblicazione: (2024)
di: Huang, Hui, et al.
Pubblicazione: (2024)
LoRA-drop: Efficient LoRA Parameter Pruning based on Output Evaluation
di: Zhou, Hongyun, et al.
Pubblicazione: (2024)
di: Zhou, Hongyun, et al.
Pubblicazione: (2024)
MuSC: Improving Complex Instruction Following with Multi-granularity Self-Contrastive Training
di: Huang, Hui, et al.
Pubblicazione: (2025)
di: Huang, Hui, et al.
Pubblicazione: (2025)
RM-Distiller: Exploiting Generative LLM for Reward Model Distillation
di: Zhou, Hongli, et al.
Pubblicazione: (2026)
di: Zhou, Hongli, et al.
Pubblicazione: (2026)
Enhancing Large Language Models'Machine Translation via Dynamic Focus Anchoring
di: Ding, Qiuyu, et al.
Pubblicazione: (2025)
di: Ding, Qiuyu, et al.
Pubblicazione: (2025)
DuplexMamba: Enhancing Real-time Speech Conversations with Duplex and Streaming Capabilities
di: Lu, Xiangyu, et al.
Pubblicazione: (2025)
di: Lu, Xiangyu, et al.
Pubblicazione: (2025)
Speculative Decoding Meets Quantization: Compatibility Evaluation and Hierarchical Framework Design
di: Zhang, Yudi, et al.
Pubblicazione: (2025)
di: Zhang, Yudi, et al.
Pubblicazione: (2025)
Beyond Token-Level Policy Gradients for Complex Reasoning with Large Language Models
di: Xu, Mufan, et al.
Pubblicazione: (2026)
di: Xu, Mufan, et al.
Pubblicazione: (2026)
Cross-Domain Bilingual Lexicon Induction via Pretrained Language Models
di: Ding, Qiuyu, et al.
Pubblicazione: (2025)
di: Ding, Qiuyu, et al.
Pubblicazione: (2025)
Large Language Models for Classical Chinese Poetry Translation: Benchmarking, Evaluating, and Improving
di: Chen, Andong, et al.
Pubblicazione: (2024)
di: Chen, Andong, et al.
Pubblicazione: (2024)
Bias in Large Language Models: Origin, Evaluation, and Mitigation
di: Guo, Yufei, et al.
Pubblicazione: (2024)
di: Guo, Yufei, et al.
Pubblicazione: (2024)
PMoL: Parameter Efficient MoE for Preference Mixing of LLM Alignment
di: Liu, Dongxu, et al.
Pubblicazione: (2024)
di: Liu, Dongxu, et al.
Pubblicazione: (2024)
Dual Instruction Tuning with Large Language Models for Mathematical Reasoning
di: Zhou, Yongwei, et al.
Pubblicazione: (2024)
di: Zhou, Yongwei, et al.
Pubblicazione: (2024)
A Survey on Human Preference Learning for Large Language Models
di: Jiang, Ruili, et al.
Pubblicazione: (2024)
di: Jiang, Ruili, et al.
Pubblicazione: (2024)
From Perception to Reasoning: Deep Thinking Empowers Multimodal Large Language Models
di: Zhu, Wenxin, et al.
Pubblicazione: (2025)
di: Zhu, Wenxin, et al.
Pubblicazione: (2025)
Evaluating o1-Like LLMs: Unlocking Reasoning for Translation through Comprehensive Analysis
di: Chen, Andong, et al.
Pubblicazione: (2025)
di: Chen, Andong, et al.
Pubblicazione: (2025)
DUAL-REFLECT: Enhancing Large Language Models for Reflective Translation through Dual Learning Feedback Mechanisms
di: Chen, Andong, et al.
Pubblicazione: (2024)
di: Chen, Andong, et al.
Pubblicazione: (2024)
Evaluating and Mitigating Social Bias for Large Language Models in Open-ended Settings
di: Liu, Zhao, et al.
Pubblicazione: (2024)
di: Liu, Zhao, et al.
Pubblicazione: (2024)
BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models
di: Huang, Xu, et al.
Pubblicazione: (2025)
di: Huang, Xu, et al.
Pubblicazione: (2025)
SEO: Stochastic Experience Optimization for Large Language Models
di: Xu, Jitao, et al.
Pubblicazione: (2025)
di: Xu, Jitao, et al.
Pubblicazione: (2025)
LLM-based Discriminative Reasoning for Knowledge Graph Question Answering
di: Xu, Mufan, et al.
Pubblicazione: (2024)
di: Xu, Mufan, et al.
Pubblicazione: (2024)
DiVA: Fine-grained Factuality Verification with Agentic-Discriminative Verifier
di: Huang, Hui, et al.
Pubblicazione: (2026)
di: Huang, Hui, et al.
Pubblicazione: (2026)
Faithful-Patchscopes: Understanding and Mitigating Model Bias in Hidden Representations Explanation of Large Language Models
di: Gong, Xilin, et al.
Pubblicazione: (2026)
di: Gong, Xilin, et al.
Pubblicazione: (2026)
Locating and Mitigating Gender Bias in Large Language Models
di: Cai, Yuchen, et al.
Pubblicazione: (2024)
di: Cai, Yuchen, et al.
Pubblicazione: (2024)
Reasoning Model Is Superior LLM-Judge, Yet Suffers from Biases
di: Huang, Hui, et al.
Pubblicazione: (2026)
di: Huang, Hui, et al.
Pubblicazione: (2026)
Likelihood-based Mitigation of Evaluation Bias in Large Language Models
di: Oi, Masanari, et al.
Pubblicazione: (2024)
di: Oi, Masanari, et al.
Pubblicazione: (2024)
User-Aware Active Knowledge Acquisition for Emotional Support Dialogue
di: Xu, Mufan, et al.
Pubblicazione: (2026)
di: Xu, Mufan, et al.
Pubblicazione: (2026)
Make Imagination Clearer! Stable Diffusion-based Visual Imagination for Multimodal Machine Translation
di: Chen, Andong, et al.
Pubblicazione: (2024)
di: Chen, Andong, et al.
Pubblicazione: (2024)
Memory-augmented Query Reconstruction for LLM-based Knowledge Graph Reasoning
di: Xu, Mufan, et al.
Pubblicazione: (2025)
di: Xu, Mufan, et al.
Pubblicazione: (2025)
Mitigating Label Length Bias in Large Language Models
di: Sanz-Guerrero, Mario, et al.
Pubblicazione: (2025)
di: Sanz-Guerrero, Mario, et al.
Pubblicazione: (2025)
Unveiling and Mitigating Bias in Mental Health Analysis with Large Language Models
di: Wang, Yuqing, et al.
Pubblicazione: (2024)
di: Wang, Yuqing, et al.
Pubblicazione: (2024)
Do Multilingual Large Language Models Mitigate Stereotype Bias?
di: Nie, Shangrui, et al.
Pubblicazione: (2024)
di: Nie, Shangrui, et al.
Pubblicazione: (2024)
Detection, Classification, and Mitigation of Gender Bias in Large Language Models
di: Cheng, Xiaoqing, et al.
Pubblicazione: (2025)
di: Cheng, Xiaoqing, et al.
Pubblicazione: (2025)
Auto-Search and Refinement: An Automated Framework for Gender Bias Mitigation in Large Language Models
di: Xu, Yue, et al.
Pubblicazione: (2025)
di: Xu, Yue, et al.
Pubblicazione: (2025)
Large Language Models Meet Symbolic Provers for Logical Reasoning Evaluation
di: Qi, Chengwen, et al.
Pubblicazione: (2025)
di: Qi, Chengwen, et al.
Pubblicazione: (2025)
Thinking in Character: Advancing Role-Playing Agents with Role-Aware Reasoning
di: Tang, Yihong, et al.
Pubblicazione: (2025)
di: Tang, Yihong, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Toward Robust LLM-Based Judges: Taxonomic Bias Evaluation and Debiasing Optimization
di: Zhou, Hongli, et al.
Pubblicazione: (2026) -
Lost in Benchmarks? Rethinking Large Language Model Benchmarking with Item Response Theory
di: Zhou, Hongli, et al.
Pubblicazione: (2025) -
Long-form RewardBench: Evaluating Reward Models for Long-form Generation
di: Huang, Hui, et al.
Pubblicazione: (2026) -
Self-Evaluation of Large Language Model based on Glass-box Features
di: Huang, Hui, et al.
Pubblicazione: (2024) -
An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4
di: Huang, Hui, et al.
Pubblicazione: (2024)