Overton Pluralistic Reinforcement Learning for Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Fu, Yu, Son, Seongho, Bogunovic, Ilija |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
RSPO: Regularized Self-Play Alignment of Large Language Models
von: Tang, Xiaohang, et al.
Veröffentlicht: (2025)
von: Tang, Xiaohang, et al.
Veröffentlicht: (2025)
This Is Your Doge, If It Please You: Exploring Deception and Robustness in Mixture of LLMs
von: Wolf, Lorenz, et al.
Veröffentlicht: (2025)
von: Wolf, Lorenz, et al.
Veröffentlicht: (2025)
On Almost Surely Safe Alignment of Large Language Models at Inference-Time
von: Ji, Xiaotong, et al.
Veröffentlicht: (2025)
von: Ji, Xiaotong, et al.
Veröffentlicht: (2025)
Robust Multi-Objective Controlled Decoding of Large Language Models
von: Son, Seongho, et al.
Veröffentlicht: (2025)
von: Son, Seongho, et al.
Veröffentlicht: (2025)
From Distributional to Overton Pluralism: Investigating Large Language Model Alignment
von: Lake, Thom, et al.
Veröffentlicht: (2024)
von: Lake, Thom, et al.
Veröffentlicht: (2024)
A Survey on Personalized and Pluralistic Preference Alignment in Large Language Models
von: Xie, Zhouhang, et al.
Veröffentlicht: (2025)
von: Xie, Zhouhang, et al.
Veröffentlicht: (2025)
Right Now, Wrong Then: Non-Stationary Direct Preference Optimization under Preference Drift
von: Son, Seongho, et al.
Veröffentlicht: (2024)
von: Son, Seongho, et al.
Veröffentlicht: (2024)
VALUEFLOW: Toward Pluralistic and Steerable Value-based Alignment in Large Language Models
von: Kim, Woojin, et al.
Veröffentlicht: (2026)
von: Kim, Woojin, et al.
Veröffentlicht: (2026)
The Pluralistic Moral Gap: Understanding Judgment and Value Differences between Humans and Large Language Models
von: Russo, Giuseppe, et al.
Veröffentlicht: (2025)
von: Russo, Giuseppe, et al.
Veröffentlicht: (2025)
Pluralistic Off-policy Evaluation and Alignment
von: Huang, Chengkai, et al.
Veröffentlicht: (2025)
von: Huang, Chengkai, et al.
Veröffentlicht: (2025)
Public Data Assisted Differentially Private In-Context Learning
von: Joo, Seongho, et al.
Veröffentlicht: (2025)
von: Joo, Seongho, et al.
Veröffentlicht: (2025)
MEMETRON: Metaheuristic Mechanisms for Test-time Response Optimization of Large Language Models
von: Nguyen, Son The, et al.
Veröffentlicht: (2025)
von: Nguyen, Son The, et al.
Veröffentlicht: (2025)
Correcting Negative Bias in Large Language Models through Negative Attention Score Alignment
von: Yu, Sangwon, et al.
Veröffentlicht: (2024)
von: Yu, Sangwon, et al.
Veröffentlicht: (2024)
Group Robust Preference Optimization in Reward-free RLHF
von: Ramesh, Shyam Sundhar, et al.
Veröffentlicht: (2024)
von: Ramesh, Shyam Sundhar, et al.
Veröffentlicht: (2024)
Interleaved Reasoning for Large Language Models via Reinforcement Learning
von: Xie, Roy, et al.
Veröffentlicht: (2025)
von: Xie, Roy, et al.
Veröffentlicht: (2025)
Revolutionizing Reinforcement Learning Framework for Diffusion Large Language Models
von: Wang, Yinjie, et al.
Veröffentlicht: (2025)
von: Wang, Yinjie, et al.
Veröffentlicht: (2025)
SPICA: Retrieving Scenarios for Pluralistic In-Context Alignment
von: Chen, Quan Ze, et al.
Veröffentlicht: (2024)
von: Chen, Quan Ze, et al.
Veröffentlicht: (2024)
PERSONA: A Reproducible Testbed for Pluralistic Alignment
von: Castricato, Louis, et al.
Veröffentlicht: (2024)
von: Castricato, Louis, et al.
Veröffentlicht: (2024)
RLAR: An Agentic Reward System for Multi-task Reinforcement Learning on Large Language Models
von: Feng, Andrew Zhuoer, et al.
Veröffentlicht: (2026)
von: Feng, Andrew Zhuoer, et al.
Veröffentlicht: (2026)
PluralLLM: Pluralistic Alignment in LLMs via Federated Learning
von: Srewa, Mahmoud, et al.
Veröffentlicht: (2025)
von: Srewa, Mahmoud, et al.
Veröffentlicht: (2025)
Reinforcement Learning Problem Solving with Large Language Models
von: Gholamian, Sina, et al.
Veröffentlicht: (2024)
von: Gholamian, Sina, et al.
Veröffentlicht: (2024)
AdaSearch: Balancing Parametric Knowledge and Search in Large Language Models via Reinforcement Learning
von: Lin, Tzu-Han, et al.
Veröffentlicht: (2025)
von: Lin, Tzu-Han, et al.
Veröffentlicht: (2025)
Off-Policy Value-Based Reinforcement Learning for Large Language Models
von: Wang, Peng-Yuan, et al.
Veröffentlicht: (2026)
von: Wang, Peng-Yuan, et al.
Veröffentlicht: (2026)
Model-Dowser: Data-Free Importance Probing to Mitigate Catastrophic Forgetting in Multimodal Large Language Models
von: Hwang, Hyeontaek, et al.
Veröffentlicht: (2026)
von: Hwang, Hyeontaek, et al.
Veröffentlicht: (2026)
A Roadmap to Pluralistic Alignment
von: Sorensen, Taylor, et al.
Veröffentlicht: (2024)
von: Sorensen, Taylor, et al.
Veröffentlicht: (2024)
From Reasoning to Agentic: Credit Assignment in Reinforcement Learning for Large Language Models
von: Zhang, Chenchen
Veröffentlicht: (2026)
von: Zhang, Chenchen
Veröffentlicht: (2026)
Trustworthy Alignment of Retrieval-Augmented Large Language Models via Reinforcement Learning
von: Zhang, Zongmeng, et al.
Veröffentlicht: (2024)
von: Zhang, Zongmeng, et al.
Veröffentlicht: (2024)
GTA: Supervised-Guided Reinforcement Learning for Text Classification with Large Language Models
von: Zeng, Min, et al.
Veröffentlicht: (2025)
von: Zeng, Min, et al.
Veröffentlicht: (2025)
MixDPO: Modeling Preference Strength for Pluralistic Alignment
von: Imai, Saki, et al.
Veröffentlicht: (2026)
von: Imai, Saki, et al.
Veröffentlicht: (2026)
Harmful Prompt Laundering: Jailbreaking LLMs with Abductive Styles and Symbolic Encoding
von: Joo, Seongho, et al.
Veröffentlicht: (2025)
von: Joo, Seongho, et al.
Veröffentlicht: (2025)
RAISE: Reinforced Adaptive Instruction Selection For Large Language Models
von: Lv, Qingsong, et al.
Veröffentlicht: (2025)
von: Lv, Qingsong, et al.
Veröffentlicht: (2025)
Modular Pluralism: Pluralistic Alignment via Multi-LLM Collaboration
von: Feng, Shangbin, et al.
Veröffentlicht: (2024)
von: Feng, Shangbin, et al.
Veröffentlicht: (2024)
SEM: Reinforcement Learning for Search-Efficient Large Language Models
von: Sha, Zeyang, et al.
Veröffentlicht: (2025)
von: Sha, Zeyang, et al.
Veröffentlicht: (2025)
Improving Sample Efficiency of Reinforcement Learning with Background Knowledge from Large Language Models
von: Zhang, Fuxiang, et al.
Veröffentlicht: (2024)
von: Zhang, Fuxiang, et al.
Veröffentlicht: (2024)
POW: Political Overton Windows of Large Language Models
von: Azzopardi, Leif, et al.
Veröffentlicht: (2025)
von: Azzopardi, Leif, et al.
Veröffentlicht: (2025)
MoReBench: Evaluating Procedural and Pluralistic Moral Reasoning in Language Models, More than Outcomes
von: Chiu, Yu Ying, et al.
Veröffentlicht: (2025)
von: Chiu, Yu Ying, et al.
Veröffentlicht: (2025)
RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models
von: Dang, Quy-Anh, et al.
Veröffentlicht: (2026)
von: Dang, Quy-Anh, et al.
Veröffentlicht: (2026)
Improving the Language Understanding Capabilities of Large Language Models Using Reinforcement Learning
von: Hu, Bokai, et al.
Veröffentlicht: (2024)
von: Hu, Bokai, et al.
Veröffentlicht: (2024)
Evaluating Moral Beliefs across LLMs through a Pluralistic Framework
von: Liu, Xuelin, et al.
Veröffentlicht: (2024)
von: Liu, Xuelin, et al.
Veröffentlicht: (2024)
Composition-RL: Compose Your Verifiable Prompts for Reinforcement Learning of Large Language Models
von: Xu, Xin, et al.
Veröffentlicht: (2026)
von: Xu, Xin, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
RSPO: Regularized Self-Play Alignment of Large Language Models
von: Tang, Xiaohang, et al.
Veröffentlicht: (2025) -
This Is Your Doge, If It Please You: Exploring Deception and Robustness in Mixture of LLMs
von: Wolf, Lorenz, et al.
Veröffentlicht: (2025) -
On Almost Surely Safe Alignment of Large Language Models at Inference-Time
von: Ji, Xiaotong, et al.
Veröffentlicht: (2025) -
Robust Multi-Objective Controlled Decoding of Large Language Models
von: Son, Seongho, et al.
Veröffentlicht: (2025) -
From Distributional to Overton Pluralism: Investigating Large Language Model Alignment
von: Lake, Thom, et al.
Veröffentlicht: (2024)