Reinforcement Learning from Multi-role Debates as Feedback for Bias Mitigation in LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Cheng, Ruoxi, Ma, Haoxuan, Cao, Shuirong, Li, Jiaqi, Pei, Aihua, Wang, Zhiqiang, Ji, Pengliang, Wang, Haoyu, Huo, Jiaqi |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AGR: Age Group fairness Reward for Bias Mitigation in LLMs
par: Cao, Shuirong, et autres
Publié: (2024)
par: Cao, Shuirong, et autres
Publié: (2024)
Gibberish is All You Need for Membership Inference Detection in Contrastive Language-Audio Pretraining
par: Cheng, Ruoxi, et autres
Publié: (2024)
par: Cheng, Ruoxi, et autres
Publié: (2024)
PBI-Attack: Prior-Guided Bimodal Interactive Black-Box Jailbreak Attack for Toxicity Maximization
par: Cheng, Ruoxi, et autres
Publié: (2024)
par: Cheng, Ruoxi, et autres
Publié: (2024)
EcoAlign: An Economically Rational Framework for Efficient LVLM Alignment
par: Cheng, Ruoxi, et autres
Publié: (2025)
par: Cheng, Ruoxi, et autres
Publié: (2025)
SelfPrompt: Autonomously Evaluating LLM Robustness via Domain-Constrained Knowledge Guidelines and Refined Adversarial Prompts
par: Pei, Aihua, et autres
Publié: (2024)
par: Pei, Aihua, et autres
Publié: (2024)
KGPA: Robustness Evaluation for Large Language Models via Cross-Domain Knowledge Graphs
par: Pei, Aihua, et autres
Publié: (2024)
par: Pei, Aihua, et autres
Publié: (2024)
Inverse Reinforcement Learning with Dynamic Reward Scaling for LLM Alignment
par: Cheng, Ruoxi, et autres
Publié: (2025)
par: Cheng, Ruoxi, et autres
Publié: (2025)
RLFR: Extending Reinforcement Learning for LLMs with Flow Environment
par: Zhang, Jinghao, et autres
Publié: (2025)
par: Zhang, Jinghao, et autres
Publié: (2025)
Mitigating Gender Bias in Depression Detection via Counterfactual Inference
par: Hu, Mingxuan, et autres
Publié: (2025)
par: Hu, Mingxuan, et autres
Publié: (2025)
Unmasking Bias in AI: A Systematic Review of Bias Detection and Mitigation Strategies in Electronic Health Record-based Models
par: Chen, Feng, et autres
Publié: (2023)
par: Chen, Feng, et autres
Publié: (2023)
Learning Universal Human Mobility Patterns with a Foundation Model for Cross-domain Data Fusion
par: Ma, Haoxuan, et autres
Publié: (2025)
par: Ma, Haoxuan, et autres
Publié: (2025)
Human Mobility Modeling with Household Coordination Activities under Limited Information via Retrieval-Augmented LLMs
par: Liu, Yifan, et autres
Publié: (2024)
par: Liu, Yifan, et autres
Publié: (2024)
Graph Negative Feedback Bias Correction Framework for Adaptive Heterophily Modeling
par: Lv, Jiaqi, et autres
Publié: (2026)
par: Lv, Jiaqi, et autres
Publié: (2026)
Adversarial Orthogonal Disentanglement for LVLM Hallucination Mitigation
par: Cheng, Ruoxi, et autres
Publié: (2026)
par: Cheng, Ruoxi, et autres
Publié: (2026)
SafeBehavior: Simulating Human-Like Multistage Reasoning to Mitigate Jailbreak Attacks in Large Language Models
par: Zhao, Qinjian, et autres
Publié: (2025)
par: Zhao, Qinjian, et autres
Publié: (2025)
Beyond 9-to-5: A Generative Model for Augmenting Mobility Data of Underrepresented Shift Workers
par: Ma, Haoxuan, et autres
Publié: (2025)
par: Ma, Haoxuan, et autres
Publié: (2025)
LANPO: Bootstrapping Language and Numerical Feedback for Reinforcement Learning in LLMs
par: Li, Ang, et autres
Publié: (2025)
par: Li, Ang, et autres
Publié: (2025)
Composition Vision-Language Understanding via Segment and Depth Anything Model
par: Huo, Mingxiao, et autres
Publié: (2024)
par: Huo, Mingxiao, et autres
Publié: (2024)
Boosting Maximum Entropy Reinforcement Learning via One-Step Flow Matching
par: Li, Zeqiao, et autres
Publié: (2026)
par: Li, Zeqiao, et autres
Publié: (2026)
Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language Models
par: Wang, Jiaqi, et autres
Publié: (2025)
par: Wang, Jiaqi, et autres
Publié: (2025)
Revealing Political Bias in LLMs through Structured Multi-Agent Debate
par: Bandaru, Aishwarya, et autres
Publié: (2025)
par: Bandaru, Aishwarya, et autres
Publié: (2025)
Structured Self-Consistency:A Multi-Task Evaluation of LLMs on VirtualHome
par: Xu, Jiaqi, et autres
Publié: (2026)
par: Xu, Jiaqi, et autres
Publié: (2026)
Towards Collaborative Fairness in Federated Learning Under Imbalanced Covariate Shift
par: Yu, Tianrun, et autres
Publié: (2025)
par: Yu, Tianrun, et autres
Publié: (2025)
MobiVerse: Scaling Urban Mobility Simulation with Hybrid Lightweight Domain-Specific Generator and Large Language Models
par: Liu, Yifan, et autres
Publié: (2025)
par: Liu, Yifan, et autres
Publié: (2025)
DMRL: Data- and Model-aware Reward Learning for Data Extraction
par: Wang, Zhiqiang, et autres
Publié: (2025)
par: Wang, Zhiqiang, et autres
Publié: (2025)
RUMAD: Reinforcement-Unifying Multi-Agent Debate
par: Wang, Chao, et autres
Publié: (2026)
par: Wang, Chao, et autres
Publié: (2026)
Information-Preserving CSI Feedback: Invertible Networks with Endogenous Quantization and Channel Error Mitigation
par: Tian, Haotian, et autres
Publié: (2025)
par: Tian, Haotian, et autres
Publié: (2025)
Deep Reinforcement Learning for Digital Twin-Oriented Complex Networked Systems
par: Wen, Jiaqi, et autres
Publié: (2024)
par: Wen, Jiaqi, et autres
Publié: (2024)
Rethinking Spatio-Temporal Transformer for Traffic Prediction:Multi-level Multi-view Augmented Learning Framework
par: Lin, Jiaqi, et autres
Publié: (2024)
par: Lin, Jiaqi, et autres
Publié: (2024)
KnowBias: Mitigating Social Bias in LLMs via Know-Bias Neuron Enhancement
par: Pan, Jinhao, et autres
Publié: (2026)
par: Pan, Jinhao, et autres
Publié: (2026)
Vision-Based Generic Potential Function for Policy Alignment in Multi-Agent Reinforcement Learning
par: Ma, Hao, et autres
Publié: (2025)
par: Ma, Hao, et autres
Publié: (2025)
Fair Machine Unlearning: Data Removal while Mitigating Disparities
par: Oesterling, Alex, et autres
Publié: (2023)
par: Oesterling, Alex, et autres
Publié: (2023)
Toward an Engineering of Science: Rebalancing Generation and Verification in the Age of AI
par: Ma, Jiaqi W.
Publié: (2026)
par: Ma, Jiaqi W.
Publié: (2026)
Reinfier and Reintrainer: Verification and Interpretation-Driven Safe Deep Reinforcement Learning Frameworks
par: Yang, Zixuan, et autres
Publié: (2024)
par: Yang, Zixuan, et autres
Publié: (2024)
Semantic Trajectory Data Mining with LLM-Informed POI Classification
par: Liu, Yifan, et autres
Publié: (2024)
par: Liu, Yifan, et autres
Publié: (2024)
Uncertainty-Aware Trip Purpose Inference from GPS Trajectories via POI Semantic Zones and Pareto Calibration
par: Yang, Bo, et autres
Publié: (2026)
par: Yang, Bo, et autres
Publié: (2026)
From Learning to Mastery: Achieving Safe and Efficient Real-World Autonomous Driving with Human-In-The-Loop Reinforcement Learning
par: Zeqiao, Li, et autres
Publié: (2025)
par: Zeqiao, Li, et autres
Publié: (2025)
PERSA: Reinforcement Learning for Professor-Style Personalized Feedback with LLMs
par: Ranjan, Ravi, et autres
Publié: (2026)
par: Ranjan, Ravi, et autres
Publié: (2026)
MINT: Evaluating LLMs in Multi-turn Interaction with Tools and Language Feedback
par: Wang, Xingyao, et autres
Publié: (2023)
par: Wang, Xingyao, et autres
Publié: (2023)
KARL: Mitigating Hallucinations in LLMs via Knowledge-Boundary-Aware Reinforcement Learning
par: Gao, Cheng, et autres
Publié: (2026)
par: Gao, Cheng, et autres
Publié: (2026)
Documents similaires
-
AGR: Age Group fairness Reward for Bias Mitigation in LLMs
par: Cao, Shuirong, et autres
Publié: (2024) -
Gibberish is All You Need for Membership Inference Detection in Contrastive Language-Audio Pretraining
par: Cheng, Ruoxi, et autres
Publié: (2024) -
PBI-Attack: Prior-Guided Bimodal Interactive Black-Box Jailbreak Attack for Toxicity Maximization
par: Cheng, Ruoxi, et autres
Publié: (2024) -
EcoAlign: An Economically Rational Framework for Efficient LVLM Alignment
par: Cheng, Ruoxi, et autres
Publié: (2025) -
SelfPrompt: Autonomously Evaluating LLM Robustness via Domain-Constrained Knowledge Guidelines and Refined Adversarial Prompts
par: Pei, Aihua, et autres
Publié: (2024)