Pride and Prejudice: LLM Amplifies Self-Bias in Self-Refinement
Fuente:
arXiv
Salvato in:
| Autori principali: | Xu, Wenda, Zhu, Guanglei, Zhao, Xuandong, Pan, Liangming, Li, Lei, Wang, William Yang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
BPO: Staying Close to the Behavior LLM Creates Better Online LLM Alignment
di: Xu, Wenda, et al.
Pubblicazione: (2024)
di: Xu, Wenda, et al.
Pubblicazione: (2024)
Atomic Skills are the Prerequisite: When Reinforcement Learning Synthesizes Compositional Reasoning, and When It Only Amplifies
di: Cheng, Sitao, et al.
Pubblicazione: (2025)
di: Cheng, Sitao, et al.
Pubblicazione: (2025)
When LLMs Benchmark Themselves: Deconstructing Self-Bias in Automated Evaluation
di: Xu, Wenda, et al.
Pubblicazione: (2025)
di: Xu, Wenda, et al.
Pubblicazione: (2025)
The Knowledge Alignment Problem: Bridging Human and External Knowledge for Large Language Models
di: Zhang, Shuo, et al.
Pubblicazione: (2023)
di: Zhang, Shuo, et al.
Pubblicazione: (2023)
A Practical Examination of AI-Generated Text Detectors for Large Language Models
di: Tufts, Brian, et al.
Pubblicazione: (2024)
di: Tufts, Brian, et al.
Pubblicazione: (2024)
Scalable Best-of-N Selection for Large Language Models via Self-Certainty
di: Kang, Zhewei, et al.
Pubblicazione: (2025)
di: Kang, Zhewei, et al.
Pubblicazione: (2025)
AKEW: Assessing Knowledge Editing in the Wild
di: Wu, Xiaobao, et al.
Pubblicazione: (2024)
di: Wu, Xiaobao, et al.
Pubblicazione: (2024)
Justice or Prejudice? Quantifying Biases in LLM-as-a-Judge
di: Ye, Jiayi, et al.
Pubblicazione: (2024)
di: Ye, Jiayi, et al.
Pubblicazione: (2024)
Mechanistic Data Attribution: Tracing the Training Origins of Interpretable LLM Units
di: Chen, Jianhui, et al.
Pubblicazione: (2026)
di: Chen, Jianhui, et al.
Pubblicazione: (2026)
How Is LLM Reasoning Distracted by Irrelevant Context? An Analysis Using a Controlled Benchmark
di: Yang, Minglai, et al.
Pubblicazione: (2025)
di: Yang, Minglai, et al.
Pubblicazione: (2025)
Spontaneous Reward Hacking in Iterative Self-Refinement
di: Pan, Jane, et al.
Pubblicazione: (2024)
di: Pan, Jane, et al.
Pubblicazione: (2024)
TEaR: Improving LLM-based Machine Translation with Systematic Self-Refinement
di: Feng, Zhaopeng, et al.
Pubblicazione: (2024)
di: Feng, Zhaopeng, et al.
Pubblicazione: (2024)
GRAPHMOE: Amplifying Cognitive Depth of Mixture-of-Experts Network via Introducing Self-Rethinking Mechanism
di: Lv, Bo, et al.
Pubblicazione: (2025)
di: Lv, Bo, et al.
Pubblicazione: (2025)
Learning to Refine: Self-Refinement of Parallel Reasoning in LLMs
di: Wang, Qibin, et al.
Pubblicazione: (2025)
di: Wang, Qibin, et al.
Pubblicazione: (2025)
SelfPrompt: Autonomously Evaluating LLM Robustness via Domain-Constrained Knowledge Guidelines and Refined Adversarial Prompts
di: Pei, Aihua, et al.
Pubblicazione: (2024)
di: Pei, Aihua, et al.
Pubblicazione: (2024)
SafeKey: Amplifying Aha-Moment Insights for Safety Reasoning
di: Zhou, Kaiwen, et al.
Pubblicazione: (2025)
di: Zhou, Kaiwen, et al.
Pubblicazione: (2025)
Investigating the Transferability of Code Repair for Low-Resource Programming Languages
di: Wong, Kyle, et al.
Pubblicazione: (2024)
di: Wong, Kyle, et al.
Pubblicazione: (2024)
Database Normalization via Dual-LLM Self-Refinement
di: Jo, Eunjae, et al.
Pubblicazione: (2025)
di: Jo, Eunjae, et al.
Pubblicazione: (2025)
Knowledge of Knowledge: Exploring Known-Unknowns Uncertainty with Large Language Models
di: Amayuelas, Alfonso, et al.
Pubblicazione: (2023)
di: Amayuelas, Alfonso, et al.
Pubblicazione: (2023)
Quantifying and Mitigating Self-Preference Bias of LLM Judges
di: Yang, Jinming, et al.
Pubblicazione: (2026)
di: Yang, Jinming, et al.
Pubblicazione: (2026)
Prompt and Prejudice
di: Berlincioni, Lorenzo, et al.
Pubblicazione: (2024)
di: Berlincioni, Lorenzo, et al.
Pubblicazione: (2024)
CA*: Addressing Evaluation Pitfalls in Computation-Aware Latency for Simultaneous Speech Translation
di: Xu, Xi, et al.
Pubblicazione: (2024)
di: Xu, Xi, et al.
Pubblicazione: (2024)
Auto-Search and Refinement: An Automated Framework for Gender Bias Mitigation in Large Language Models
di: Xu, Yue, et al.
Pubblicazione: (2025)
di: Xu, Yue, et al.
Pubblicazione: (2025)
Opening the Black Box: A Survey on the Mechanisms of Multi-Step Reasoning in Large Language Models
di: Pan, Liangming, et al.
Pubblicazione: (2026)
di: Pan, Liangming, et al.
Pubblicazione: (2026)
Side-by-side Comparison Amplifies Dialect Bias in Language Models
di: Kondapally, Kritee, et al.
Pubblicazione: (2026)
di: Kondapally, Kritee, et al.
Pubblicazione: (2026)
Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge
di: Spiliopoulou, Evangelia, et al.
Pubblicazione: (2025)
di: Spiliopoulou, Evangelia, et al.
Pubblicazione: (2025)
TAD: Temporal-Aware Trajectory Self-Distillation for Fast and Accurate Diffusion LLM
di: Zhou, Haoyang, et al.
Pubblicazione: (2026)
di: Zhou, Haoyang, et al.
Pubblicazione: (2026)
RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios
di: Zhou, Ruiwen, et al.
Pubblicazione: (2024)
di: Zhou, Ruiwen, et al.
Pubblicazione: (2024)
Observations and Remedies for Large Language Model Bias in Self-Consuming Performative Loop
di: Wang, Yaxuan, et al.
Pubblicazione: (2026)
di: Wang, Yaxuan, et al.
Pubblicazione: (2026)
CoRefine: Confidence-Guided Self-Refinement for Adaptive Test-Time Compute
di: Jin, Chen, et al.
Pubblicazione: (2026)
di: Jin, Chen, et al.
Pubblicazione: (2026)
MultiAgent Collaboration Attack: Investigating Adversarial Attacks in Large Language Model Collaborations via Debate
di: Amayuelas, Alfonso, et al.
Pubblicazione: (2024)
di: Amayuelas, Alfonso, et al.
Pubblicazione: (2024)
Understanding Reasoning Ability of Language Models From the Perspective of Reasoning Paths Aggregation
di: Wang, Xinyi, et al.
Pubblicazione: (2024)
di: Wang, Xinyi, et al.
Pubblicazione: (2024)
A Stitch in Time Saves Nine: Proactive Self-Refinement for Language Models
di: Han, Jinyi, et al.
Pubblicazione: (2025)
di: Han, Jinyi, et al.
Pubblicazione: (2025)
OSCAR: Orchestrated Self-verification and Cross-path Refinement
di: Shah, Yash, et al.
Pubblicazione: (2026)
di: Shah, Yash, et al.
Pubblicazione: (2026)
Ratchet: A Minimal Hygiene Recipe for Self-Evolving LLM Agents
di: Zhang, Xing, et al.
Pubblicazione: (2026)
di: Zhang, Xing, et al.
Pubblicazione: (2026)
Direct Alignment of Language Models via Quality-Aware Self-Refinement
di: Yu, Runsheng, et al.
Pubblicazione: (2024)
di: Yu, Runsheng, et al.
Pubblicazione: (2024)
SCIR: A Self-Correcting Iterative Refinement Framework for Enhanced Information Extraction Based on Schema
di: Fang, Yushen, et al.
Pubblicazione: (2025)
di: Fang, Yushen, et al.
Pubblicazione: (2025)
LEDOM: Reverse Language Model
di: Yin, Xunjian, et al.
Pubblicazione: (2025)
di: Yin, Xunjian, et al.
Pubblicazione: (2025)
Meta-aware Learning in text-to-SQL Large Language Model
di: Zhang, Wenda
Pubblicazione: (2025)
di: Zhang, Wenda
Pubblicazione: (2025)
De Jure: Iterative LLM Self-Refinement for Structured Extraction of Regulatory Rules
di: Guliani, Keerat, et al.
Pubblicazione: (2026)
di: Guliani, Keerat, et al.
Pubblicazione: (2026)
Documenti analoghi
-
BPO: Staying Close to the Behavior LLM Creates Better Online LLM Alignment
di: Xu, Wenda, et al.
Pubblicazione: (2024) -
Atomic Skills are the Prerequisite: When Reinforcement Learning Synthesizes Compositional Reasoning, and When It Only Amplifies
di: Cheng, Sitao, et al.
Pubblicazione: (2025) -
When LLMs Benchmark Themselves: Deconstructing Self-Bias in Automated Evaluation
di: Xu, Wenda, et al.
Pubblicazione: (2025) -
The Knowledge Alignment Problem: Bridging Human and External Knowledge for Large Language Models
di: Zhang, Shuo, et al.
Pubblicazione: (2023) -
A Practical Examination of AI-Generated Text Detectors for Large Language Models
di: Tufts, Brian, et al.
Pubblicazione: (2024)