Owen-Shapley Policy Optimization: A Principled RL Algorithm for Generative Search LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Nath, Abhijnan, Garakani, Alireza Bagheri, Zhou, Tianchen, Yang, Fan, Gao, Yan, Krishnaswamy, Nikhil |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Learning "Partner-Aware" Collaborators in Multi-Party Collaboration
par: Nath, Abhijnan, et autres
Publié: (2025)
par: Nath, Abhijnan, et autres
Publié: (2025)
Collaborate, Deliberate, Evaluate: How LLM Alignment Affects Coordinated Multi-Agent Outcomes
par: Nath, Abhijnan, et autres
Publié: (2025)
par: Nath, Abhijnan, et autres
Publié: (2025)
CRAFT: Grounded Multi-Agent Coordination Under Partial Information
par: Nath, Abhijnan, et autres
Publié: (2026)
par: Nath, Abhijnan, et autres
Publié: (2026)
Frictive Policy Optimization for LLMs: Epistemic Intervention, Risk-Sensitive Control, and Reflective Alignment
par: Pustejovsky, James, et autres
Publié: (2026)
par: Pustejovsky, James, et autres
Publié: (2026)
Fairness Analysis with Shapley-Owen Effects
par: Ruess, Harald
Publié: (2024)
par: Ruess, Harald
Publié: (2024)
Large Language Model-Enhanced Reinforcement Learning for Diverse and Novel Recommendations
par: Woo, Jiin, et autres
Publié: (2025)
par: Woo, Jiin, et autres
Publié: (2025)
Okay, Let's Do This! Modeling Event Coreference with Generated Rationales and Knowledge Distillation
par: Nath, Abhijnan, et autres
Publié: (2024)
par: Nath, Abhijnan, et autres
Publié: (2024)
Frictional Agent Alignment Framework: Slow Down and Don't Break Things
par: Nath, Abhijnan, et autres
Publié: (2025)
par: Nath, Abhijnan, et autres
Publié: (2025)
Simultaneous Reward Distillation and Preference Learning: Get You a Language Model Who Can Do Both
par: Nath, Abhijnan, et autres
Publié: (2024)
par: Nath, Abhijnan, et autres
Publié: (2024)
Principled RL for Flow Matching Emerges from the Chunk-level Policy Optimization
par: Luo, Yifu, et autres
Publié: (2025)
par: Luo, Yifu, et autres
Publié: (2025)
When are LLMs Sufficient Policy Optimizers for Sequential RL Tasks?
par: Hatgis-Kessell, Stephane, et autres
Publié: (2026)
par: Hatgis-Kessell, Stephane, et autres
Publié: (2026)
MaxShapley: Towards Incentive-compatible Generative Search with Fair Context Attribution
par: Patel, Sara, et autres
Publié: (2025)
par: Patel, Sara, et autres
Publié: (2025)
Partial Policy Gradients for RL in LLMs
par: Mathur, Puneet, et autres
Publié: (2026)
par: Mathur, Puneet, et autres
Publié: (2026)
Algorithmic Identification of Essential Exogenous Nodes for Causal Sufficiency in Brain Networks
par: Bagheri, Abdolmahdi, et autres
Publié: (2024)
par: Bagheri, Abdolmahdi, et autres
Publié: (2024)
Enhancing Interpretability for Vision Models via Shapley Value Optimization
par: Fan, Kanglong, et autres
Publié: (2025)
par: Fan, Kanglong, et autres
Publié: (2025)
Stable Asynchrony: Variance-Controlled Off-Policy RL for LLMs
par: Huang, Luke J., et autres
Publié: (2026)
par: Huang, Luke J., et autres
Publié: (2026)
Owen-based Semantics and Hierarchy-Aware Explanation (O-Shap)
par: Zhou, Xiangyu, et autres
Publié: (2026)
par: Zhou, Xiangyu, et autres
Publié: (2026)
Scalable Policy-Based RL Algorithms for POMDPs
par: Anjarlekar, Ameya, et autres
Publié: (2025)
par: Anjarlekar, Ameya, et autres
Publié: (2025)
Search-Based LLMs for Code Optimization
par: Gao, Shuzheng, et autres
Publié: (2024)
par: Gao, Shuzheng, et autres
Publié: (2024)
Dynamic Epistemic Friction in Dialogue
par: Obiso, Timothy, et autres
Publié: (2025)
par: Obiso, Timothy, et autres
Publié: (2025)
A Comparison of DeepSeek and Other LLMs
par: Gao, Tianchen, et autres
Publié: (2025)
par: Gao, Tianchen, et autres
Publié: (2025)
Beyond Human Preferences: Exploring Reinforcement Learning Trajectory Evaluation and Improvement through LLMs
par: Shen, Zichao, et autres
Publié: (2024)
par: Shen, Zichao, et autres
Publié: (2024)
Latent Heuristic Search: Continuous Optimization for Automated Algorithm Design
par: Ahmed, Cheikh, et autres
Publié: (2026)
par: Ahmed, Cheikh, et autres
Publié: (2026)
Shapley Uncertainty in Natural Language Generation
par: Zhu, Meilin, et autres
Publié: (2025)
par: Zhu, Meilin, et autres
Publié: (2025)
Adaptive Collaboration with Humans: Metacognitive Policy Optimization for Multi-Agent LLMs with Continual Learning
par: Yang, Wei, et autres
Publié: (2026)
par: Yang, Wei, et autres
Publié: (2026)
Your Reward Function for RL is Your Best PRM for Search: Unifying RL and Search-Based TTS
par: Jin, Can, et autres
Publié: (2025)
par: Jin, Can, et autres
Publié: (2025)
Soft Policy Optimization: Online Off-Policy RL for Sequence Models
par: Cohen, Taco, et autres
Publié: (2025)
par: Cohen, Taco, et autres
Publié: (2025)
Computational Thought Experiments for a More Rigorous Philosophy and Science of the Mind
par: Oved, Iris, et autres
Publié: (2024)
par: Oved, Iris, et autres
Publié: (2024)
TSPO: Breaking the Double Homogenization Dilemma in Multi-turn Search Policy Optimization
par: Ma, Shichao, et autres
Publié: (2026)
par: Ma, Shichao, et autres
Publié: (2026)
In-Run Data Shapley for Adam Optimizer
par: Ding, Meng, et autres
Publié: (2026)
par: Ding, Meng, et autres
Publié: (2026)
EARL: Entropy-Aware RL Alignment of LLMs for Reliable RTL Code Generation
par: Shi, Jiahe, et autres
Publié: (2025)
par: Shi, Jiahe, et autres
Publié: (2025)
BAPO: Boundary-Aware Policy Optimization for Reliable Agentic Search
par: Liu, Shiyu, et autres
Publié: (2026)
par: Liu, Shiyu, et autres
Publié: (2026)
Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone
par: Mark, Max Sobol, et autres
Publié: (2024)
par: Mark, Max Sobol, et autres
Publié: (2024)
Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training
par: Fakoor, Rasool, et autres
Publié: (2026)
par: Fakoor, Rasool, et autres
Publié: (2026)
One-Way Policy Optimization for Self-Evolving LLMs
par: Yang, Shuo, et autres
Publié: (2026)
par: Yang, Shuo, et autres
Publié: (2026)
Metacognitive AI: Framework and the Case for a Neurosymbolic Approach
par: Wei, Hua, et autres
Publié: (2024)
par: Wei, Hua, et autres
Publié: (2024)
Principled RL for Diffusion LLMs Emerges from a Sequence-Level Perspective
par: Ou, Jingyang, et autres
Publié: (2025)
par: Ou, Jingyang, et autres
Publié: (2025)
Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning
par: Hu, Xiao, et autres
Publié: (2025)
par: Hu, Xiao, et autres
Publié: (2025)
StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization
par: Wang, Ziliang, et autres
Publié: (2025)
par: Wang, Ziliang, et autres
Publié: (2025)
Planning without Search: Refining Frontier LLMs with Offline Goal-Conditioned RL
par: Hong, Joey, et autres
Publié: (2025)
par: Hong, Joey, et autres
Publié: (2025)
Documents similaires
-
Learning "Partner-Aware" Collaborators in Multi-Party Collaboration
par: Nath, Abhijnan, et autres
Publié: (2025) -
Collaborate, Deliberate, Evaluate: How LLM Alignment Affects Coordinated Multi-Agent Outcomes
par: Nath, Abhijnan, et autres
Publié: (2025) -
CRAFT: Grounded Multi-Agent Coordination Under Partial Information
par: Nath, Abhijnan, et autres
Publié: (2026) -
Frictive Policy Optimization for LLMs: Epistemic Intervention, Risk-Sensitive Control, and Reflective Alignment
par: Pustejovsky, James, et autres
Publié: (2026) -
Fairness Analysis with Shapley-Owen Effects
par: Ruess, Harald
Publié: (2024)