Value-Free Policy Optimization via Reward Partitioning
Fuente:
arXiv
Saved in:
| Main Authors: | Faye, Bilal, Azzag, Hanane, Lebbah, Mustapha |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Lightweight Cross-Modal Representation Learning
by: Faye, Bilal, et al.
Published: (2024)
by: Faye, Bilal, et al.
Published: (2024)
Enhancing Neural Network Representations with Prior Knowledge-Based Normalization
by: Faye, Bilal, et al.
Published: (2024)
by: Faye, Bilal, et al.
Published: (2024)
Prototype-Guided Diffusion: Visual Conditioning without External Memory
by: Faye, Bilal, et al.
Published: (2025)
by: Faye, Bilal, et al.
Published: (2025)
Supervised Batch Normalization
by: Faye, Bilal, et al.
Published: (2024)
by: Faye, Bilal, et al.
Published: (2024)
OneEncoder: A Lightweight Framework for Progressive Alignment of Modalities
by: Faye, Bilal, et al.
Published: (2024)
by: Faye, Bilal, et al.
Published: (2024)
Lightweight Modular Parameter-Efficient Tuning for Open-Vocabulary Object Detection
by: Faye, Bilal, et al.
Published: (2024)
by: Faye, Bilal, et al.
Published: (2024)
Context Normalization Layer with Applications
by: Faye, Bilal, et al.
Published: (2023)
by: Faye, Bilal, et al.
Published: (2023)
Unsupervised Adaptive Normalization
by: Faye, Bilal, et al.
Published: (2024)
by: Faye, Bilal, et al.
Published: (2024)
Adaptive Head Budgeting for Efficient Multi-Head Attention
by: Faye, Bilal, et al.
Published: (2026)
by: Faye, Bilal, et al.
Published: (2026)
Adaptative Context Normalization: A Boost for Deep Learning in Image Processing
by: Faye, Bilal, et al.
Published: (2024)
by: Faye, Bilal, et al.
Published: (2024)
Game Theory Meets Statistical Mechanics in Deep Learning Design
by: Bouchaffra, Djamel, et al.
Published: (2024)
by: Bouchaffra, Djamel, et al.
Published: (2024)
Energy-Regularized Spatial Masking: A Novel Approach to Enhancing Robustness and Interpretability in Vision Models
by: Devynck, Tom, et al.
Published: (2026)
by: Devynck, Tom, et al.
Published: (2026)
A Collective Variational Principle Unifying Bayesian Inference, Game Theory, and Thermodynamics
by: Bouchaffra, Djamel, et al.
Published: (2026)
by: Bouchaffra, Djamel, et al.
Published: (2026)
NeuroGame Transformer: Gibbs-Inspired Attention Driven by Game Theory and Statistical Physics
by: Bouchaffra, Djamel, et al.
Published: (2026)
by: Bouchaffra, Djamel, et al.
Published: (2026)
MB-ORES: A Multi-Branch Object Reasoner for Visual Grounding in Remote Sensing
by: Radouane, Karim, et al.
Published: (2025)
by: Radouane, Karim, et al.
Published: (2025)
Manual Verbalizer Enrichment for Few-Shot Text Classification
by: Nguyen, Quang Anh, et al.
Published: (2024)
by: Nguyen, Quang Anh, et al.
Published: (2024)
Pretrain Value, Not Reward: Decoupled Value Policy Optimization
by: Huang, Chenghua, et al.
Published: (2025)
by: Huang, Chenghua, et al.
Published: (2025)
Distributed MCMC inference for Bayesian Non-Parametric Latent Block Model
by: Khoufache, Reda, et al.
Published: (2024)
by: Khoufache, Reda, et al.
Published: (2024)
Coalition Free Energy and Adaptive Precision in Multi-Agent Cooperation
by: Bouchaffra, Djamel, et al.
Published: (2026)
by: Bouchaffra, Djamel, et al.
Published: (2026)
Intrinsic Reward Policy Optimization for Sparse-Reward Environments
by: Cho, Minjae, et al.
Published: (2026)
by: Cho, Minjae, et al.
Published: (2026)
DRPO: Efficient Reasoning via Decoupled Reward Policy Optimization
by: Li, Gang, et al.
Published: (2025)
by: Li, Gang, et al.
Published: (2025)
ORSO: Accelerating Reward Design via Online Reward Selection and Policy Optimization
by: Zhang, Chen Bo Calvin, et al.
Published: (2024)
by: Zhang, Chen Bo Calvin, et al.
Published: (2024)
GOPO: Policy Optimization using Ranked Rewards
by: Choi, Kyuseong, et al.
Published: (2026)
by: Choi, Kyuseong, et al.
Published: (2026)
Overcoming Reward Overoptimization via Adversarial Policy Optimization with Lightweight Uncertainty Estimation
by: Zhang, Xiaoying, et al.
Published: (2024)
by: Zhang, Xiaoying, et al.
Published: (2024)
Reward Weighted Classifier-Free Guidance as Policy Improvement in Autoregressive Models
by: Peysakhovich, Alexander, et al.
Published: (2026)
by: Peysakhovich, Alexander, et al.
Published: (2026)
RiskPO: Risk-based Policy Optimization via Verifiable Reward for LLM Post-Training
by: Ren, Tao, et al.
Published: (2025)
by: Ren, Tao, et al.
Published: (2025)
ODRPO: Ordinal Decompositions of Discrete Rewards for Robust Policy Optimization
by: Patel, Nirmal, et al.
Published: (2026)
by: Patel, Nirmal, et al.
Published: (2026)
CROP: Conservative Reward for Model-based Offline Policy Optimization
by: Li, Hao, et al.
Published: (2023)
by: Li, Hao, et al.
Published: (2023)
Quasimetric Value Functions with Dense Rewards
by: Valieva, Khadichabonu, et al.
Published: (2024)
by: Valieva, Khadichabonu, et al.
Published: (2024)
HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime
by: Sana, Mohamed, et al.
Published: (2026)
by: Sana, Mohamed, et al.
Published: (2026)
Verifier-Free RL for LLMs via Intrinsic Gradient-Norm Reward
by: Wen, Xuexiang, et al.
Published: (2026)
by: Wen, Xuexiang, et al.
Published: (2026)
Trust Region Reward Optimization and Proximal Inverse Reward Optimization Algorithm
by: Chen, Yang, et al.
Published: (2025)
by: Chen, Yang, et al.
Published: (2025)
PVPO: Pre-Estimated Value-Based Policy Optimization for Agentic Reasoning
by: Feng, Wenfeng, et al.
Published: (2025)
by: Feng, Wenfeng, et al.
Published: (2025)
Model-Based Epistemic Variance of Values for Risk-Aware Policy Optimization
by: Luis, Carlos E., et al.
Published: (2023)
by: Luis, Carlos E., et al.
Published: (2023)
Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards
by: Ahmad, Ahmad, et al.
Published: (2024)
by: Ahmad, Ahmad, et al.
Published: (2024)
Explainable RL Policies by Distilling to Locally-Specialized Linear Policies with Voronoi State Partitioning
by: Deproost, Senne, et al.
Published: (2025)
by: Deproost, Senne, et al.
Published: (2025)
LFPO: Likelihood-Free Policy Optimization for Masked Diffusion Models
by: Wei, Chenxing, et al.
Published: (2026)
by: Wei, Chenxing, et al.
Published: (2026)
ReDit: Reward Dithering for Improved LLM Policy Optimization
by: Wei, Chenxing, et al.
Published: (2025)
by: Wei, Chenxing, et al.
Published: (2025)
Value of Information and Reward Specification in Active Inference and POMDPs
by: Wei, Ran
Published: (2024)
by: Wei, Ran
Published: (2024)
DVPO: Distributional Value Modeling-based Policy Optimization for LLM Post-Training
by: Zhu, Dingwei, et al.
Published: (2025)
by: Zhu, Dingwei, et al.
Published: (2025)
Similar Items
-
Lightweight Cross-Modal Representation Learning
by: Faye, Bilal, et al.
Published: (2024) -
Enhancing Neural Network Representations with Prior Knowledge-Based Normalization
by: Faye, Bilal, et al.
Published: (2024) -
Prototype-Guided Diffusion: Visual Conditioning without External Memory
by: Faye, Bilal, et al.
Published: (2025) -
Supervised Batch Normalization
by: Faye, Bilal, et al.
Published: (2024) -
OneEncoder: A Lightweight Framework for Progressive Alignment of Modalities
by: Faye, Bilal, et al.
Published: (2024)