Doubly Robust Alignment for Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xu, Erhan, Ye, Kai, Zhou, Hongyi, Zhu, Luhan, Quinzan, Francesco, Shi, Chengchun |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Robust Reinforcement Learning from Human Feedback for Large Language Models Fine-Tuning
par: Ye, Kai, et autres
Publié: (2025)
par: Ye, Kai, et autres
Publié: (2025)
Learn-to-Distance: Distance Learning for Detecting LLM-Generated Text
par: Zhou, Hongyi, et autres
Publié: (2026)
par: Zhou, Hongyi, et autres
Publié: (2026)
BASIS: Batchwise Advantage Estimation from Single-Rollout Information Sharing for LLM Reasoning
par: Gong, Shijin, et autres
Publié: (2026)
par: Gong, Shijin, et autres
Publié: (2026)
Doubly Inhomogeneous Reinforcement Learning
par: Hu, Liyuan, et autres
Publié: (2022)
par: Hu, Liyuan, et autres
Publié: (2022)
Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation
par: Zhou, Hongyi, et autres
Publié: (2025)
par: Zhou, Hongyi, et autres
Publié: (2025)
Robust Offline Reinforcement learning with Heavy-Tailed Rewards
par: Zhu, Jin, et autres
Publié: (2023)
par: Zhu, Jin, et autres
Publié: (2023)
AdaDetectGPT: Adaptive Detection of LLM-Generated Text with Statistical Guarantees
par: Zhou, Hongyi, et autres
Publié: (2025)
par: Zhou, Hongyi, et autres
Publié: (2025)
Demystifying Group Relative Policy Optimization: Its Policy Gradient is a U-Statistic
par: Zhou, Hongyi, et autres
Publié: (2026)
par: Zhou, Hongyi, et autres
Publié: (2026)
Representation Invariance and Allocation: When Subgroup Balance Matters
par: Alloula, Anissa, et autres
Publié: (2025)
par: Alloula, Anissa, et autres
Publié: (2025)
Beam Prediction based on Large Language Models
par: Sheng, Yucheng, et autres
Publié: (2024)
par: Sheng, Yucheng, et autres
Publié: (2024)
Doubly Robust Monte Carlo Tree Search
par: Liu, Manqing, et autres
Publié: (2025)
par: Liu, Manqing, et autres
Publié: (2025)
A Unified Theoretical Analysis of Private and Robust Offline Alignment: from RLHF to DPO
par: Zhou, Xingyu, et autres
Publié: (2025)
par: Zhou, Xingyu, et autres
Publié: (2025)
Counterfactual Reasoning for Steerable Pluralistic Value Alignment of Large Language Models
par: Guo, Hanze, et autres
Publié: (2025)
par: Guo, Hanze, et autres
Publié: (2025)
Pessimistic Causal Reinforcement Learning with Mediators for Confounded Offline Data
par: Wang, Danyang, et autres
Publié: (2024)
par: Wang, Danyang, et autres
Publié: (2024)
Causal Deepsets for Off-policy Evaluation under Spatial or Spatio-temporal Interferences
par: Dai, Runpeng, et autres
Publié: (2024)
par: Dai, Runpeng, et autres
Publié: (2024)
ROPO: Robust Preference Optimization for Large Language Models
par: Liang, Xize, et autres
Publié: (2024)
par: Liang, Xize, et autres
Publié: (2024)
Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment
par: Wang, Chaoqi, et autres
Publié: (2025)
par: Wang, Chaoqi, et autres
Publié: (2025)
Evidence-based Distributional Alignment for Large Language Models
par: Pham, Viet-Thanh, et autres
Publié: (2026)
par: Pham, Viet-Thanh, et autres
Publié: (2026)
Learning on Graphs with Large Language Models(LLMs): A Deep Dive into Model Robustness
par: Guo, Kai, et autres
Publié: (2024)
par: Guo, Kai, et autres
Publié: (2024)
On the Robustness of Reward Models for Language Model Alignment
par: Hong, Jiwoo, et autres
Publié: (2025)
par: Hong, Jiwoo, et autres
Publié: (2025)
Robust Batch-Level Query Routing for Large Language Models under Cost and Capacity Constraints
par: Markovic-Voronov, Jelena, et autres
Publié: (2026)
par: Markovic-Voronov, Jelena, et autres
Publié: (2026)
Semi-pessimistic Reinforcement Learning
par: Zhu, Jin, et autres
Publié: (2025)
par: Zhu, Jin, et autres
Publié: (2025)
Bridging Large Language Models and Graph Structure Learning Models for Robust Representation Learning
par: Su, Guangxin, et autres
Publié: (2024)
par: Su, Guangxin, et autres
Publié: (2024)
VC-Soup: Value-Consistency Guided Multi-Value Alignment for Large Language Models
par: Xu, Hefei, et autres
Publié: (2026)
par: Xu, Hefei, et autres
Publié: (2026)
Symmetric Pruning of Large Language Models
par: Yi, Kai, et autres
Publié: (2025)
par: Yi, Kai, et autres
Publié: (2025)
RSPO: Regularized Self-Play Alignment of Large Language Models
par: Tang, Xiaohang, et autres
Publié: (2025)
par: Tang, Xiaohang, et autres
Publié: (2025)
A Probabilistic Perspective on Unlearning and Alignment for Large Language Models
par: Scholten, Yan, et autres
Publié: (2024)
par: Scholten, Yan, et autres
Publié: (2024)
Offline Regularised Reinforcement Learning for Large Language Models Alignment
par: Richemond, Pierre Harvey, et autres
Publié: (2024)
par: Richemond, Pierre Harvey, et autres
Publié: (2024)
Improved Bounds for Private and Robust Alignment
par: Weng, Wenqian, et autres
Publié: (2025)
par: Weng, Wenqian, et autres
Publié: (2025)
Cost-optimal Sequential Testing via Doubly Robust Q-learning
par: Zhou, Doudou, et autres
Publié: (2026)
par: Zhou, Doudou, et autres
Publié: (2026)
Provably Robust Adaptation for Language-Empowered Foundation Models
par: Lai, Yuni, et autres
Publié: (2025)
par: Lai, Yuni, et autres
Publié: (2025)
Robust Uncertainty Quantification for Self-Evolving Large Language Models via Continual Domain Pretraining
par: Zhou, Xiaofan, et autres
Publié: (2025)
par: Zhou, Xiaofan, et autres
Publié: (2025)
Alignment and Safety in Large Language Models: Safety Mechanisms, Training Paradigms, and Emerging Challenges
par: Lu, Haoran, et autres
Publié: (2025)
par: Lu, Haoran, et autres
Publié: (2025)
OBLIVIATE: Robust and Practical Machine Unlearning for Large Language Models
par: Xu, Xiaoyu, et autres
Publié: (2025)
par: Xu, Xiaoyu, et autres
Publié: (2025)
DLLM-Searcher: Adapting Diffusion Large Language Model for Search Agents
par: Zhao, Jiahao, et autres
Publié: (2026)
par: Zhao, Jiahao, et autres
Publié: (2026)
Reasoning-as-Logic-Units: Scaling Test-Time Reasoning in Large Language Models Through Logic Unit Alignment
par: Li, Cheryl, et autres
Publié: (2025)
par: Li, Cheryl, et autres
Publié: (2025)
Alignment Revisited: Are Large Language Models Consistent in Stated and Revealed Preferences?
par: Gu, Zhuojun, et autres
Publié: (2025)
par: Gu, Zhuojun, et autres
Publié: (2025)
Context-Adaptive Multi-Prompt Embedding with Large Language Models for Vision-Language Alignment
par: Kim, Dahun, et autres
Publié: (2025)
par: Kim, Dahun, et autres
Publié: (2025)
Human Alignment of Large Language Models through Online Preference Optimisation
par: Calandriello, Daniele, et autres
Publié: (2024)
par: Calandriello, Daniele, et autres
Publié: (2024)
Semantic-aware Wasserstein Policy Regularization for Large Language Model Alignment
par: Na, Byeonghu, et autres
Publié: (2026)
par: Na, Byeonghu, et autres
Publié: (2026)
Documents similaires
-
Robust Reinforcement Learning from Human Feedback for Large Language Models Fine-Tuning
par: Ye, Kai, et autres
Publié: (2025) -
Learn-to-Distance: Distance Learning for Detecting LLM-Generated Text
par: Zhou, Hongyi, et autres
Publié: (2026) -
BASIS: Batchwise Advantage Estimation from Single-Rollout Information Sharing for LLM Reasoning
par: Gong, Shijin, et autres
Publié: (2026) -
Doubly Inhomogeneous Reinforcement Learning
par: Hu, Liyuan, et autres
Publié: (2022) -
Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation
par: Zhou, Hongyi, et autres
Publié: (2025)