Information Gain-Guided Causal Intervention for Autonomous Debiasing Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Sun, Zhouhao, Ding, Xiao, Du, Li, Xu, Yunpeng, Ma, Yixuan, Zhao, Yang, Qin, Bing, Liu, Ting |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Causal-Guided Active Learning for Debiasing Large Language Models
by: Du, Li, et al.
Published: (2024)
by: Du, Li, et al.
Published: (2024)
Large Language Models Are Still Misled by Simple Bias Ensembles
by: Sun, Zhouhao, et al.
Published: (2025)
by: Sun, Zhouhao, et al.
Published: (2025)
Deciphering the Impact of Pretraining Data on Large Language Models through Machine Unlearning
by: Zhao, Yang, et al.
Published: (2024)
by: Zhao, Yang, et al.
Published: (2024)
Towards Generalizable and Faithful Logic Reasoning over Natural Language via Resolution Refutation
by: Sun, Zhouhao, et al.
Published: (2024)
by: Sun, Zhouhao, et al.
Published: (2024)
Com$^2$: A Causal-Guided Benchmark for Exploring Complex Commonsense Reasoning in Large Language Models
by: Xiong, Kai, et al.
Published: (2025)
by: Xiong, Kai, et al.
Published: (2025)
Self-Route: Automatic Mode Switching via Capability Estimation for Efficient Reasoning
by: He, Yang, et al.
Published: (2025)
by: He, Yang, et al.
Published: (2025)
LLM4Rec: Large Language Models for Multimodal Generative Recommendation with Causal Debiasing
by: Ma, Bo, et al.
Published: (2025)
by: Ma, Bo, et al.
Published: (2025)
MAESTRO: Meta-learning Adaptive Estimation of Scalarization Trade-offs for Reward Optimization
by: Zhao, Yang, et al.
Published: (2026)
by: Zhao, Yang, et al.
Published: (2026)
LIDAO: Towards Limited Interventions for Debiasing (Large) Language Models
by: Liu, Tianci, et al.
Published: (2024)
by: Liu, Tianci, et al.
Published: (2024)
Beyond Similarity: A Gradient-based Graph Method for Instruction Tuning Data Selection
by: Zhao, Yang, et al.
Published: (2025)
by: Zhao, Yang, et al.
Published: (2025)
Examining Inter-Consistency of Large Language Models Collaboration: An In-depth Analysis via Debate
by: Xiong, Kai, et al.
Published: (2023)
by: Xiong, Kai, et al.
Published: (2023)
Self-Debias: Self-correcting for Debiasing Large Language Models
by: Feng, Xuan, et al.
Published: (2026)
by: Feng, Xuan, et al.
Published: (2026)
Debiasing Large Language Models via Adaptive Causal Prompting with Sketch-of-Thought
by: Li, Bowen, et al.
Published: (2026)
by: Li, Bowen, et al.
Published: (2026)
GR-Ben: A General Reasoning Benchmark for Evaluating Process Reward Models
by: Sun, Zhouhao, et al.
Published: (2026)
by: Sun, Zhouhao, et al.
Published: (2026)
Debiasing Reward Models via Causally Motivated Inference-Time Intervention
by: Shinoda, Kazutoshi, et al.
Published: (2026)
by: Shinoda, Kazutoshi, et al.
Published: (2026)
UFO-RL: Uncertainty-Focused Optimization for Efficient Reinforcement Learning Data Selection
by: Zhao, Yang, et al.
Published: (2025)
by: Zhao, Yang, et al.
Published: (2025)
Meaningful Learning: Enhancing Abstract Reasoning in Large Language Models via Generic Fact Guidance
by: Xiong, Kai, et al.
Published: (2024)
by: Xiong, Kai, et al.
Published: (2024)
Causal Prompting: Debiasing Large Language Model Prompting based on Front-Door Adjustment
by: Zhang, Congzhi, et al.
Published: (2024)
by: Zhang, Congzhi, et al.
Published: (2024)
Bi-directional Bias Attribution: Debiasing Large Language Models without Modifying Prompts
by: Lin, Yujie, et al.
Published: (2026)
by: Lin, Yujie, et al.
Published: (2026)
Rethinking Prompt-based Debiasing in Large Language Models
by: Yang, Xinyi, et al.
Published: (2025)
by: Yang, Xinyi, et al.
Published: (2025)
RKLD: Reverse KL-Divergence-based Knowledge Distillation for Unlearning Personal Information in Large Language Models
by: Wang, Bichen, et al.
Published: (2024)
by: Wang, Bichen, et al.
Published: (2024)
Supervised Fine-Tuning Achieve Rapid Task Adaption Via Alternating Attention Head Activation Patterns
by: Zhao, Yang, et al.
Published: (2024)
by: Zhao, Yang, et al.
Published: (2024)
Self-Evolving GPT: A Lifelong Autonomous Experiential Learner
by: Gao, Jinglong, et al.
Published: (2024)
by: Gao, Jinglong, et al.
Published: (2024)
Large Language Model Agents Are Not Always Faithful Self-Evolvers
by: Zhao, Weixiang, et al.
Published: (2026)
by: Zhao, Weixiang, et al.
Published: (2026)
Teacher-Student Training for Debiasing: General Permutation Debiasing for Large Language Models
by: Liusie, Adian, et al.
Published: (2024)
by: Liusie, Adian, et al.
Published: (2024)
Text Difficulty Study: Do machines behave the same as humans regarding text difficulty?
by: Chen, Bowen, et al.
Published: (2022)
by: Chen, Bowen, et al.
Published: (2022)
Chain of Strategy Optimization Makes Large Language Models Better Emotional Supporter
by: Zhao, Weixiang, et al.
Published: (2025)
by: Zhao, Weixiang, et al.
Published: (2025)
UGID: Unified Graph Isomorphism for Debiasing Large Language Models
by: Ding, Zikang, et al.
Published: (2026)
by: Ding, Zikang, et al.
Published: (2026)
Any Large Language Model Can Be a Reliable Judge: Debiasing with a Reasoning-based Bias Detector
by: Yang, Haoyan, et al.
Published: (2025)
by: Yang, Haoyan, et al.
Published: (2025)
Enhancing Complex Causality Extraction via Improved Subtask Interaction and Knowledge Fusion
by: Gao, Jinglong, et al.
Published: (2024)
by: Gao, Jinglong, et al.
Published: (2024)
ReCo: Reliable Causal Chain Reasoning via Structural Causal Recurrent Neural Networks
by: Xiong, Kai, et al.
Published: (2022)
by: Xiong, Kai, et al.
Published: (2022)
Expert-Guided Extinction of Toxic Tokens for Debiased Generation
by: Sun, Xueyao, et al.
Published: (2024)
by: Sun, Xueyao, et al.
Published: (2024)
Towards Reliable and Interpretable Traffic Crash Pattern Prediction and Safety Interventions Using Customized Large Language Models
by: Zhao, Yang, et al.
Published: (2025)
by: Zhao, Yang, et al.
Published: (2025)
Lens: Rethinking Multilingual Enhancement for Large Language Models
by: Zhao, Weixiang, et al.
Published: (2024)
by: Zhao, Weixiang, et al.
Published: (2024)
Uncovering Limitations of Large Language Models in Information Seeking from Tables
by: Pang, Chaoxu, et al.
Published: (2024)
by: Pang, Chaoxu, et al.
Published: (2024)
Role-Play Paradox in Large Language Models: Reasoning Performance Gains and Ethical Dilemmas
by: Zhao, Jinman, et al.
Published: (2024)
by: Zhao, Jinman, et al.
Published: (2024)
Ensemble Learning for Heterogeneous Large Language Models with Deep Parallel Collaboration
by: Huang, Yichong, et al.
Published: (2024)
by: Huang, Yichong, et al.
Published: (2024)
C$^2$DLM: Causal Concept-Guided Diffusion Large Language Models
by: Han, Kairong, et al.
Published: (2025)
by: Han, Kairong, et al.
Published: (2025)
Compressed Sensing for Capability Localization in Large Language Models
by: Bair, Anna, et al.
Published: (2026)
by: Bair, Anna, et al.
Published: (2026)
Safety-Aware Fine-Tuning of Large Language Models
by: Choi, Hyeong Kyu, et al.
Published: (2024)
by: Choi, Hyeong Kyu, et al.
Published: (2024)
Similar Items
-
Causal-Guided Active Learning for Debiasing Large Language Models
by: Du, Li, et al.
Published: (2024) -
Large Language Models Are Still Misled by Simple Bias Ensembles
by: Sun, Zhouhao, et al.
Published: (2025) -
Deciphering the Impact of Pretraining Data on Large Language Models through Machine Unlearning
by: Zhao, Yang, et al.
Published: (2024) -
Towards Generalizable and Faithful Logic Reasoning over Natural Language via Resolution Refutation
by: Sun, Zhouhao, et al.
Published: (2024) -
Com$^2$: A Causal-Guided Benchmark for Exploring Complex Commonsense Reasoning in Large Language Models
by: Xiong, Kai, et al.
Published: (2025)