Guardado en:
| Autores principales: | Zhang, Zhen-Yu, Tang, Yuting, Zhang, Jiandong, Ma, Lanjihong, Sugiyama, Masashi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2605.04477 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Off-Policy Corrected Reward Modeling for Reinforcement Learning from Human Feedback
por: Ackermann, Johannes, et al.
Publicado: (2025)
por: Ackermann, Johannes, et al.
Publicado: (2025)
In-context Demonstration Matters: On Prompt Optimization for Pseudo-Supervision Refinement
por: Zhang, Zhen-Yu, et al.
Publicado: (2024)
por: Zhang, Zhen-Yu, et al.
Publicado: (2024)
Adapting to Continuous Covariate Shift via Online Density Ratio Estimation
por: Zhang, Yu-Jie, et al.
Publicado: (2023)
por: Zhang, Yu-Jie, et al.
Publicado: (2023)
Gradient Regularization Prevents Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards
por: Ackermann, Johannes, et al.
Publicado: (2026)
por: Ackermann, Johannes, et al.
Publicado: (2026)
Reinforcement Learning from Bagged Reward
por: Tang, Yuting, et al.
Publicado: (2024)
por: Tang, Yuting, et al.
Publicado: (2024)
Non-stationary Online Learning for Curved Losses: Improved Dynamic Regret via Mixability
por: Zhang, Yu-Jie, et al.
Publicado: (2025)
por: Zhang, Yu-Jie, et al.
Publicado: (2025)
A Fast Algorithm for the Real-Valued Combinatorial Pure Exploration of Multi-Armed Bandit
por: Nakamura, Shintaro, et al.
Publicado: (2023)
por: Nakamura, Shintaro, et al.
Publicado: (2023)
Offline Reinforcement Learning with Domain-Unlabeled Data
por: Nishimori, Soichiro, et al.
Publicado: (2024)
por: Nishimori, Soichiro, et al.
Publicado: (2024)
Beyond Simple Sum of Delayed Rewards: Non-Markovian Reward Modeling for Reinforcement Learning
por: Tang, Yuting, et al.
Publicado: (2024)
por: Tang, Yuting, et al.
Publicado: (2024)
Reinforcement Learning with Options and State Representation
por: Ghriss, Ayoub, et al.
Publicado: (2024)
por: Ghriss, Ayoub, et al.
Publicado: (2024)
Recursive Reward Aggregation
por: Tang, Yuting, et al.
Publicado: (2025)
por: Tang, Yuting, et al.
Publicado: (2025)
Towards Efficient Online Exploration for Reinforcement Learning with Human Feedback
por: Li, Gen, et al.
Publicado: (2025)
por: Li, Gen, et al.
Publicado: (2025)
Offline Reinforcement Learning from Datasets with Structured Non-Stationarity
por: Ackermann, Johannes, et al.
Publicado: (2024)
por: Ackermann, Johannes, et al.
Publicado: (2024)
LLM Routing with Dueling Feedback
por: Chiang, Chao-Kai, et al.
Publicado: (2025)
por: Chiang, Chao-Kai, et al.
Publicado: (2025)
Thompson Exploration with Best Challenger Rule in Best Arm Identification
por: Lee, Jongyeong, et al.
Publicado: (2023)
por: Lee, Jongyeong, et al.
Publicado: (2023)
Online Iterative Reinforcement Learning from Human Feedback with General Preference Model
por: Ye, Chenlu, et al.
Publicado: (2024)
por: Ye, Chenlu, et al.
Publicado: (2024)
Enriching Disentanglement: From Logical Definitions to Quantitative Metrics
por: Zhang, Yivan, et al.
Publicado: (2023)
por: Zhang, Yivan, et al.
Publicado: (2023)
A Category-theoretical Meta-analysis of Definitions of Disentanglement
por: Zhang, Yivan, et al.
Publicado: (2023)
por: Zhang, Yivan, et al.
Publicado: (2023)
Robust Reinforcement Learning from Corrupted Human Feedback
por: Bukharin, Alexander, et al.
Publicado: (2024)
por: Bukharin, Alexander, et al.
Publicado: (2024)
Mahjax: A GPU-Accelerated Mahjong Simulator for Reinforcement Learning in JAX
por: Nishimori, Soichiro, et al.
Publicado: (2026)
por: Nishimori, Soichiro, et al.
Publicado: (2026)
Towards Scalable Oversight via Partitioned Human Supervision
por: Yin, Ren, et al.
Publicado: (2025)
por: Yin, Ren, et al.
Publicado: (2025)
Learning with Complementary Labels Revisited: The Selected-Completely-at-Random Setting Is More Practical
por: Wang, Wei, et al.
Publicado: (2023)
por: Wang, Wei, et al.
Publicado: (2023)
Generating Chain-of-Thoughts with a Pairwise-Comparison Approach to Searching for the Most Promising Intermediate Thought
por: Zhang, Zhen-Yu, et al.
Publicado: (2024)
por: Zhang, Zhen-Yu, et al.
Publicado: (2024)
Generalized Linear Bandits: Almost Optimal Regret with One-Pass Update
por: Zhang, Yu-Jie, et al.
Publicado: (2025)
por: Zhang, Yu-Jie, et al.
Publicado: (2025)
BrokenBind: Universal Modality Exploration beyond Dataset Boundaries
por: Huang, Zhuo, et al.
Publicado: (2026)
por: Huang, Zhuo, et al.
Publicado: (2026)
Exploring Data Scaling Trends and Effects in Reinforcement Learning from Human Feedback
por: Shen, Wei, et al.
Publicado: (2025)
por: Shen, Wei, et al.
Publicado: (2025)
Provable Reinforcement Learning from Human Feedback with an Unknown Link Function
por: Zhang, Qining, et al.
Publicado: (2025)
por: Zhang, Qining, et al.
Publicado: (2025)
Reinforcement Learning from Human Feedback
por: Lambert, Nathan
Publicado: (2025)
por: Lambert, Nathan
Publicado: (2025)
Multi-Player Approaches for Dueling Bandits
por: Raveh, Or, et al.
Publicado: (2024)
por: Raveh, Or, et al.
Publicado: (2024)
Riemannian Langevin Dynamics: Strong Convergence of Geometric Euler-Maruyama Scheme
por: Zhan, Zhiyuan, et al.
Publicado: (2026)
por: Zhan, Zhiyuan, et al.
Publicado: (2026)
VEC-SBM: Optimal Community Detection with Vectorial Edges Covariates
por: Braun, Guillaume, et al.
Publicado: (2024)
por: Braun, Guillaume, et al.
Publicado: (2024)
On Symmetric Losses for Robust Policy Optimization with Noisy Preferences
por: Nishimori, Soichiro, et al.
Publicado: (2025)
por: Nishimori, Soichiro, et al.
Publicado: (2025)
VickreyFeedback: Cost-efficient Data Construction for Reinforcement Learning from Human Feedback
por: Zhang, Guoxi, et al.
Publicado: (2024)
por: Zhang, Guoxi, et al.
Publicado: (2024)
Strategyproof Reinforcement Learning from Human Feedback
por: Buening, Thomas Kleine, et al.
Publicado: (2025)
por: Buening, Thomas Kleine, et al.
Publicado: (2025)
Uncertainty-Penalized Reinforcement Learning from Human Feedback with Diverse Reward LoRA Ensembles
por: Zhai, Yuanzhao, et al.
Publicado: (2023)
por: Zhai, Yuanzhao, et al.
Publicado: (2023)
VI-CuRL: Stabilizing Verifier-Independent RL Reasoning via Confidence-Guided Variance Reduction
por: Cai, Xin-Qiang, et al.
Publicado: (2026)
por: Cai, Xin-Qiang, et al.
Publicado: (2026)
Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers
por: Cai, Xin-Qiang, et al.
Publicado: (2025)
por: Cai, Xin-Qiang, et al.
Publicado: (2025)
Practical estimation of the optimal classification error with soft labels and calibration
por: Ushio, Ryota, et al.
Publicado: (2025)
por: Ushio, Ryota, et al.
Publicado: (2025)
The Survival Bandit Problem
por: Riou, Charles, et al.
Publicado: (2022)
por: Riou, Charles, et al.
Publicado: (2022)
Zeroth-Order Policy Gradient for Reinforcement Learning from Human Feedback without Reward Inference
por: Zhang, Qining, et al.
Publicado: (2024)
por: Zhang, Qining, et al.
Publicado: (2024)
Ejemplares similares
-
Off-Policy Corrected Reward Modeling for Reinforcement Learning from Human Feedback
por: Ackermann, Johannes, et al.
Publicado: (2025) -
In-context Demonstration Matters: On Prompt Optimization for Pseudo-Supervision Refinement
por: Zhang, Zhen-Yu, et al.
Publicado: (2024) -
Adapting to Continuous Covariate Shift via Online Density Ratio Estimation
por: Zhang, Yu-Jie, et al.
Publicado: (2023) -
Gradient Regularization Prevents Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards
por: Ackermann, Johannes, et al.
Publicado: (2026) -
Reinforcement Learning from Bagged Reward
por: Tang, Yuting, et al.
Publicado: (2024)