Debiasing Reward Models via Causally Motivated Inference-Time Intervention
Fuente:
arXiv
Saved in:
| Main Authors: | Shinoda, Kazutoshi, Nishida, Kosuke, Nishida, Kyosuke |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Let's Put Ourselves in Sally's Shoes: Shoes-of-Others Prefilling Improves Theory of Mind in Large Language Models
by: Shinoda, Kazutoshi, et al.
Published: (2025)
by: Shinoda, Kazutoshi, et al.
Published: (2025)
ToMATO: Verbalizing the Mental States of Role-Playing LLMs for Benchmarking Theory of Mind
by: Shinoda, Kazutoshi, et al.
Published: (2025)
by: Shinoda, Kazutoshi, et al.
Published: (2025)
Relative Density Ratio Optimization for Stable and Statistically Consistent Model Alignment
by: Takahashi, Hiroshi, et al.
Published: (2026)
by: Takahashi, Hiroshi, et al.
Published: (2026)
Initialization of Large Language Models via Reparameterization to Mitigate Loss Spikes
by: Nishida, Kosuke, et al.
Published: (2024)
by: Nishida, Kosuke, et al.
Published: (2024)
Can LLMs Detect Their Own Hallucinations?
by: Kadotani, Sora, et al.
Published: (2025)
by: Kadotani, Sora, et al.
Published: (2025)
Responses Fall Short of Understanding: Revealing the Gap between Internal Representations and Responses in Visual Document Understanding
by: Kawasaki, Haruka, et al.
Published: (2026)
by: Kawasaki, Haruka, et al.
Published: (2026)
Information Gain-Guided Causal Intervention for Autonomous Debiasing Large Language Models
by: Sun, Zhouhao, et al.
Published: (2025)
by: Sun, Zhouhao, et al.
Published: (2025)
Inference-Time Selective Debiasing to Enhance Fairness in Text Classification Models
by: Kuzmin, Gleb, et al.
Published: (2024)
by: Kuzmin, Gleb, et al.
Published: (2024)
Lossless Vocabulary Reduction for Auto-Regressive Language Models
by: Chijiwa, Daiki, et al.
Published: (2025)
by: Chijiwa, Daiki, et al.
Published: (2025)
DINER: Debiasing Aspect-based Sentiment Analysis with Multi-variable Causal Inference
by: Wu, Jialong, et al.
Published: (2024)
by: Wu, Jialong, et al.
Published: (2024)
Debiasing Large Language Models via Adaptive Causal Prompting with Sketch-of-Thought
by: Li, Bowen, et al.
Published: (2026)
by: Li, Bowen, et al.
Published: (2026)
VDocRAG: Retrieval-Augmented Generation over Visually-Rich Documents
by: Tanaka, Ryota, et al.
Published: (2025)
by: Tanaka, Ryota, et al.
Published: (2025)
Causal-Guided Active Learning for Debiasing Large Language Models
by: Du, Li, et al.
Published: (2024)
by: Du, Li, et al.
Published: (2024)
Explanation Bottleneck Models
by: Yamaguchi, Shin'ya, et al.
Published: (2024)
by: Yamaguchi, Shin'ya, et al.
Published: (2024)
A Comparative Study of Demonstration Selection for Practical Large Language Models-based Next POI Prediction
by: Nishida, Ryo, et al.
Published: (2026)
by: Nishida, Ryo, et al.
Published: (2026)
Fixing the Broken Compass: Diagnosing and Improving Inference-Time Reward Modeling
by: Li, Jiachun, et al.
Published: (2025)
by: Li, Jiachun, et al.
Published: (2025)
Inference-Time Scaling for Generalist Reward Modeling
by: Liu, Zijun, et al.
Published: (2025)
by: Liu, Zijun, et al.
Published: (2025)
Portable Reward Tuning: Towards Reusable Fine-Tuning across Different Pretrained Models
by: Chijiwa, Daiki, et al.
Published: (2025)
by: Chijiwa, Daiki, et al.
Published: (2025)
Recent Trends in Personalized Dialogue Generation: A Review of Datasets, Methodologies, and Evaluations
by: Chen, Yi-Pei, et al.
Published: (2024)
by: Chen, Yi-Pei, et al.
Published: (2024)
Position Debiasing Fine-Tuning for Causal Perception in Long-Term Dialogue
by: Fan, Shixuan, et al.
Published: (2024)
by: Fan, Shixuan, et al.
Published: (2024)
CausalDetox: Causal Head Selection and Intervention for Language Model Detoxification
by: Wang, Yian, et al.
Published: (2026)
by: Wang, Yian, et al.
Published: (2026)
RATE: Causal Explainability of Reward Models with Imperfect Counterfactuals
by: Reber, David, et al.
Published: (2024)
by: Reber, David, et al.
Published: (2024)
BayesPrompt: Prompting Large-Scale Pre-Trained Language Models on Few-shot Inference via Debiased Domain Abstraction
by: Li, Jiangmeng, et al.
Published: (2024)
by: Li, Jiangmeng, et al.
Published: (2024)
Take its Essence, Discard its Dross! Debiasing for Toxic Language Detection via Counterfactual Causal Effect
by: Lu, Junyu, et al.
Published: (2024)
by: Lu, Junyu, et al.
Published: (2024)
Beyond Spurious Signals: Debiasing Multimodal Large Language Models via Counterfactual Inference and Adaptive Expert Routing
by: Wu, Zichen, et al.
Published: (2025)
by: Wu, Zichen, et al.
Published: (2025)
CoLD: Counterfactually-Guided Length Debiasing for Process Reward Models in Mathematical Reasoning
by: Zheng, Congmin, et al.
Published: (2025)
by: Zheng, Congmin, et al.
Published: (2025)
General Phrase Debiaser: Debiasing Masked Language Models at a Multi-Token Level
by: Shi, Bingkang, et al.
Published: (2023)
by: Shi, Bingkang, et al.
Published: (2023)
Reward Models Identify Consistency, Not Causality
by: Xu, Yuhui, et al.
Published: (2025)
by: Xu, Yuhui, et al.
Published: (2025)
LLM4Rec: Large Language Models for Multimodal Generative Recommendation with Causal Debiasing
by: Ma, Bo, et al.
Published: (2025)
by: Ma, Bo, et al.
Published: (2025)
Test-Time Scaling with Diffusion Language Models via Reward-Guided Stitching
by: Miles, Roy, et al.
Published: (2026)
by: Miles, Roy, et al.
Published: (2026)
Potential and Challenges of Model Editing for Social Debiasing
by: Yan, Jianhao, et al.
Published: (2024)
by: Yan, Jianhao, et al.
Published: (2024)
Causal Inference with Large Language Model: A Survey
by: Ma, Jing
Published: (2024)
by: Ma, Jing
Published: (2024)
MPF: Aligning and Debiasing Language Models post Deployment via Multi Perspective Fusion
by: Guan, Xin, et al.
Published: (2025)
by: Guan, Xin, et al.
Published: (2025)
Debiasing Large Language Models in Thai Political Stance Detection via Counterfactual Calibration
by: Sermsri, Kasidit, et al.
Published: (2025)
by: Sermsri, Kasidit, et al.
Published: (2025)
Inference-Time Intervention: Eliciting Truthful Answers from a Language Model
by: Li, Kenneth, et al.
Published: (2023)
by: Li, Kenneth, et al.
Published: (2023)
GradeSQL: Test-Time Inference with Outcome Reward Models for Text-to-SQL Generation from Large Language Models
by: Tritto, Mattia, et al.
Published: (2025)
by: Tritto, Mattia, et al.
Published: (2025)
Large Language Models and Causal Inference in Collaboration: A Survey
by: Liu, Xiaoyu, et al.
Published: (2024)
by: Liu, Xiaoyu, et al.
Published: (2024)
How to Make the Most of LLMs' Grammatical Knowledge for Acceptability Judgments
by: Ide, Yusuke, et al.
Published: (2024)
by: Ide, Yusuke, et al.
Published: (2024)
Causal Order: The Key to Leveraging Imperfect Experts in Causal Inference
by: Vashishtha, Aniket, et al.
Published: (2023)
by: Vashishtha, Aniket, et al.
Published: (2023)
Causal Interventions on Causal Paths: Mapping GPT-2's Reasoning From Syntax to Semantics
by: Lee, Isabelle, et al.
Published: (2024)
by: Lee, Isabelle, et al.
Published: (2024)
Similar Items
-
Let's Put Ourselves in Sally's Shoes: Shoes-of-Others Prefilling Improves Theory of Mind in Large Language Models
by: Shinoda, Kazutoshi, et al.
Published: (2025) -
ToMATO: Verbalizing the Mental States of Role-Playing LLMs for Benchmarking Theory of Mind
by: Shinoda, Kazutoshi, et al.
Published: (2025) -
Relative Density Ratio Optimization for Stable and Statistically Consistent Model Alignment
by: Takahashi, Hiroshi, et al.
Published: (2026) -
Initialization of Large Language Models via Reparameterization to Mitigate Loss Spikes
by: Nishida, Kosuke, et al.
Published: (2024) -
Can LLMs Detect Their Own Hallucinations?
by: Kadotani, Sora, et al.
Published: (2025)