Towards Provable Log Density Policy Gradient
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Katdare, Pulkit, Joshi, Anant, Driggs-Campbell, Katherine |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Tool-as-Interface: Learning Robot Policies from Observing Human Tool Use
par: Chen, Haonan, et autres
Publié: (2025)
par: Chen, Haonan, et autres
Publié: (2025)
Cooperative Advisory Residual Policies for Congestion Mitigation
par: Hasan, Aamir, et autres
Publié: (2024)
par: Hasan, Aamir, et autres
Publié: (2024)
Structured Graph Network for Constrained Robot Crowd Navigation with Low Fidelity Simulation
par: Liu, Shuijing, et autres
Publié: (2024)
par: Liu, Shuijing, et autres
Publié: (2024)
Decentralized Structural-RNN for Robot Crowd Navigation with Deep Reinforcement Learning
par: Liu, Shuijing, et autres
Publié: (2020)
par: Liu, Shuijing, et autres
Publié: (2020)
Multi-Modal Manipulation via Multi-Modal Policy Consensus
par: Chen, Haonan, et autres
Publié: (2025)
par: Chen, Haonan, et autres
Publié: (2025)
An Expert Ensemble for Detecting Anomalous Scenes, Interactions, and Behaviors in Autonomous Driving
par: Ji, Tianchen, et autres
Publié: (2025)
par: Ji, Tianchen, et autres
Publié: (2025)
Policy Gradient Methods for Risk-Sensitive Distributional Reinforcement Learning with Provable Convergence
par: Xiao, Minheng, et autres
Publié: (2024)
par: Xiao, Minheng, et autres
Publié: (2024)
Going Beyond Heuristics by Imposing Policy Improvement as a Constraint
par: Lee, Chi-Chang, et autres
Publié: (2025)
par: Lee, Chi-Chang, et autres
Publié: (2025)
Provable and Practical In-Context Policy Optimization for Self-Improvement
par: Yu, Tianrun, et autres
Publié: (2026)
par: Yu, Tianrun, et autres
Publié: (2026)
HEIGHT: Heterogeneous Interaction Graph Transformer for Robot Navigation in Crowded and Constrained Environments
par: Liu, Shuijing, et autres
Publié: (2024)
par: Liu, Shuijing, et autres
Publié: (2024)
Leveraging Analytic Gradients in Provably Safe Reinforcement Learning
par: Walter, Tim, et autres
Publié: (2025)
par: Walter, Tim, et autres
Publié: (2025)
Transformers Provably Implement In-Context Reinforcement Learning with Policy Improvement
par: Liang, Haodong, et autres
Publié: (2026)
par: Liang, Haodong, et autres
Publié: (2026)
How Log-Barrier Helps Exploration in Policy Optimization
par: Cesani, Leonardo, et autres
Publié: (2026)
par: Cesani, Leonardo, et autres
Publié: (2026)
Behaviour Policy Optimization: Provably Lower Variance Return Estimates for Off-Policy Reinforcement Learning
par: Goodall, Alexander W., et autres
Publié: (2025)
par: Goodall, Alexander W., et autres
Publié: (2025)
SafeAdapt: Provably Safe Policy Updates in Deep Reinforcement Learning
par: Anisimov, Maksim, et autres
Publié: (2026)
par: Anisimov, Maksim, et autres
Publié: (2026)
Rethinking Adversarial Policies: A Generalized Attack Formulation and Provable Defense in RL
par: Liu, Xiangyu, et autres
Publié: (2023)
par: Liu, Xiangyu, et autres
Publié: (2023)
Learning General Policies with Policy Gradient Methods
par: Ståhlberg, Simon, et autres
Publié: (2025)
par: Ståhlberg, Simon, et autres
Publié: (2025)
Policy Gradient with Kernel Quadrature
par: Hayakawa, Satoshi, et autres
Publié: (2023)
par: Hayakawa, Satoshi, et autres
Publié: (2023)
Policy Gradient with Tree Expansion
par: Dalal, Gal, et autres
Publié: (2023)
par: Dalal, Gal, et autres
Publié: (2023)
ORSO: Accelerating Reward Design via Online Reward Selection and Policy Optimization
par: Zhang, Chen Bo Calvin, et autres
Publié: (2024)
par: Zhang, Chen Bo Calvin, et autres
Publié: (2024)
Decentralized Federated Policy Gradient with Byzantine Fault-Tolerance and Provably Fast Convergence
par: Jordan, Philip, et autres
Publié: (2024)
par: Jordan, Philip, et autres
Publié: (2024)
Gradient Extrapolation-Based Policy Optimization
par: Swapnil, Ismam Nur, et autres
Publié: (2026)
par: Swapnil, Ismam Nur, et autres
Publié: (2026)
Partial Policy Gradients for RL in LLMs
par: Mathur, Puneet, et autres
Publié: (2026)
par: Mathur, Puneet, et autres
Publié: (2026)
A Multi-Component AI Framework for Computational Psychology: From Robust Predictive Modeling to Deployed Generative Dialogue
par: Pareek, Anant
Publié: (2025)
par: Pareek, Anant
Publié: (2025)
Towards Efficient Risk-Sensitive Policy Gradient: An Iteration Complexity Analysis
par: Liu, Rui, et autres
Publié: (2024)
par: Liu, Rui, et autres
Publié: (2024)
Policy Gradient for Robust Markov Decision Processes
par: Wang, Qiuhao, et autres
Publié: (2024)
par: Wang, Qiuhao, et autres
Publié: (2024)
Logit Dynamics in Softmax Policy Gradient Methods
par: Li, Yingru
Publié: (2025)
par: Li, Yingru
Publié: (2025)
Measures of Variability for Risk-averse Policy Gradient
par: Luo, Yudong, et autres
Publié: (2025)
par: Luo, Yudong, et autres
Publié: (2025)
Soft Deterministic Policy Gradient with Gaussian Smoothing
par: Na, Hyunjun, et autres
Publié: (2026)
par: Na, Hyunjun, et autres
Publié: (2026)
Sequential Policy Gradient for Adaptive Hyperparameter Optimization
par: Li, Zheng, et autres
Publié: (2025)
par: Li, Zheng, et autres
Publié: (2025)
Agentic Retrieval of Topics and Insights from Earnings Calls
par: Gupta, Anant, et autres
Publié: (2025)
par: Gupta, Anant, et autres
Publié: (2025)
Bellman Unbiasedness: Toward Provably Efficient Distributional Reinforcement Learning with General Value Function Approximation
par: Cho, Taehyun, et autres
Publié: (2024)
par: Cho, Taehyun, et autres
Publié: (2024)
Does "Do Differentiable Simulators Give Better Policy Gradients?'' Give Better Policy Gradients?
par: Onoda, Ku, et autres
Publié: (2026)
par: Onoda, Ku, et autres
Publié: (2026)
LoRA-One: One-Step Full Gradient Could Suffice for Fine-Tuning Large Language Models, Provably and Efficiently
par: Zhang, Yuanhe, et autres
Publié: (2025)
par: Zhang, Yuanhe, et autres
Publié: (2025)
Provable Failure of Language Models in Learning Majority Boolean Logic via Gradient Descent
par: Chen, Bo, et autres
Publié: (2025)
par: Chen, Bo, et autres
Publié: (2025)
Vertical Symbolic Regression via Deep Policy Gradient
par: Jiang, Nan, et autres
Publié: (2024)
par: Jiang, Nan, et autres
Publié: (2024)
Fast Explanations via Policy Gradient-Optimized Explainer
par: Pan, Deng, et autres
Publié: (2024)
par: Pan, Deng, et autres
Publié: (2024)
Matrix Low-Rank Approximation For Policy Gradient Methods
par: Rozada, Sergio, et autres
Publié: (2024)
par: Rozada, Sergio, et autres
Publié: (2024)
Policy Gradients for Cumulative Prospect Theory in Reinforcement Learning
par: Lepel, Olivier, et autres
Publié: (2024)
par: Lepel, Olivier, et autres
Publié: (2024)
Policy Gradient Methods for Non-Markovian Reinforcement Learning
par: Kar, Avik, et autres
Publié: (2026)
par: Kar, Avik, et autres
Publié: (2026)
Documents similaires
-
Tool-as-Interface: Learning Robot Policies from Observing Human Tool Use
par: Chen, Haonan, et autres
Publié: (2025) -
Cooperative Advisory Residual Policies for Congestion Mitigation
par: Hasan, Aamir, et autres
Publié: (2024) -
Structured Graph Network for Constrained Robot Crowd Navigation with Low Fidelity Simulation
par: Liu, Shuijing, et autres
Publié: (2024) -
Decentralized Structural-RNN for Robot Crowd Navigation with Deep Reinforcement Learning
par: Liu, Shuijing, et autres
Publié: (2020) -
Multi-Modal Manipulation via Multi-Modal Policy Consensus
par: Chen, Haonan, et autres
Publié: (2025)