Planning-Augmented Sampling with Early Guidance for High-Reward Discovery
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhu, Rui, Zhang, Yudong, Yu, Xuan, Zhang, Chen, Wang, Xu, Wang, Yang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Reward-Augmented Data Enhances Direct Preference Alignment of LLMs
por: Zhang, Shenao, et al.
Publicado: (2024)
por: Zhang, Shenao, et al.
Publicado: (2024)
Lookahead Sample Reward Guidance for Test-Time Scaling of Diffusion Models
por: Kim, Yeongmin, et al.
Publicado: (2026)
por: Kim, Yeongmin, et al.
Publicado: (2026)
TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization
por: Zhu, Mingkang, et al.
Publicado: (2025)
por: Zhu, Mingkang, et al.
Publicado: (2025)
Diffusion-DICE: In-Sample Diffusion Guidance for Offline Reinforcement Learning
por: Mao, Liyuan, et al.
Publicado: (2024)
por: Mao, Liyuan, et al.
Publicado: (2024)
MoEQuant: Enhancing Quantization for Mixture-of-Experts Large Language Models via Expert-Balanced Sampling and Affinity Guidance
por: Hu, Xing, et al.
Publicado: (2025)
por: Hu, Xing, et al.
Publicado: (2025)
Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment
por: Wang, Chaoqi, et al.
Publicado: (2025)
por: Wang, Chaoqi, et al.
Publicado: (2025)
Reward Models in Deep Reinforcement Learning: A Survey
por: Yu, Rui, et al.
Publicado: (2025)
por: Yu, Rui, et al.
Publicado: (2025)
Eliminating Inductive Bias in Reward Models with Information-Theoretic Guidance
por: Li, Zhuo, et al.
Publicado: (2025)
por: Li, Zhuo, et al.
Publicado: (2025)
Potential Score Matching: Debiasing Molecular Structure Sampling with Potential Energy Guidance
por: Guo, Liya, et al.
Publicado: (2025)
por: Guo, Liya, et al.
Publicado: (2025)
DynaSearcher: Dynamic Knowledge Graph Augmented Search Agent via Multi-Reward Reinforcement Learning
por: Hao, Chuzhan, et al.
Publicado: (2025)
por: Hao, Chuzhan, et al.
Publicado: (2025)
Boosting Reinforcement Learning with Verifiable Rewards via Randomly Selected Few-Shot Guidance
por: Yan, Kai, et al.
Publicado: (2026)
por: Yan, Kai, et al.
Publicado: (2026)
Automatic Reward Shaping from Multi-Objective Human Heuristics
por: Xie, Yuqing, et al.
Publicado: (2025)
por: Xie, Yuqing, et al.
Publicado: (2025)
Trust Region Reward Optimization and Proximal Inverse Reward Optimization Algorithm
por: Chen, Yang, et al.
Publicado: (2025)
por: Chen, Yang, et al.
Publicado: (2025)
Exploring Multiple High-Scoring Subspaces in Generative Flow Networks
por: Yu, Xuan, et al.
Publicado: (2026)
por: Yu, Xuan, et al.
Publicado: (2026)
Finite-time Convergence Analysis of Actor-Critic with Evolving Reward
por: Hu, Rui, et al.
Publicado: (2025)
por: Hu, Rui, et al.
Publicado: (2025)
TingIS: Real-time Risk Event Discovery from Noisy Customer Incidents at Enterprise Scale
por: Wang, Jun, et al.
Publicado: (2026)
por: Wang, Jun, et al.
Publicado: (2026)
FedRD: Reducing Divergences for Generalized Federated Learning via Heterogeneity-aware Parameter Guidance
por: Wang, Kaile, et al.
Publicado: (2026)
por: Wang, Kaile, et al.
Publicado: (2026)
Sampling for Quality: Training-Free Reward-Guided LLM Decoding via Sequential Monte Carlo
por: Markovic-Voronov, Jelena, et al.
Publicado: (2026)
por: Markovic-Voronov, Jelena, et al.
Publicado: (2026)
Reward Guidance for Reinforcement Learning Tasks Based on Large Language Models: The LMGT Framework
por: Deng, Yongxin, et al.
Publicado: (2024)
por: Deng, Yongxin, et al.
Publicado: (2024)
Variance-Reduction Guidance: Sampling Trajectory Optimization for Diffusion Models
por: Xu, Shifeng, et al.
Publicado: (2025)
por: Xu, Shifeng, et al.
Publicado: (2025)
CHARM: Calibrating Reward Models With Chatbot Arena Scores
por: Zhu, Xiao, et al.
Publicado: (2025)
por: Zhu, Xiao, et al.
Publicado: (2025)
LoRA-One: One-Step Full Gradient Could Suffice for Fine-Tuning Large Language Models, Provably and Efficiently
por: Zhang, Yuanhe, et al.
Publicado: (2025)
por: Zhang, Yuanhe, et al.
Publicado: (2025)
Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation
por: Guo, Yihong, et al.
Publicado: (2024)
por: Guo, Yihong, et al.
Publicado: (2024)
Beyond the Proxy: Trajectory-Distilled Guidance for Offline GFlowNet Training
por: Chen, Ruishuo, et al.
Publicado: (2025)
por: Chen, Ruishuo, et al.
Publicado: (2025)
Adversarial Reward Auditing for Active Detection and Mitigation of Reward Hacking
por: Beigi, Mohammad, et al.
Publicado: (2026)
por: Beigi, Mohammad, et al.
Publicado: (2026)
Reward Weighted Classifier-Free Guidance as Policy Improvement in Autoregressive Models
por: Peysakhovich, Alexander, et al.
Publicado: (2026)
por: Peysakhovich, Alexander, et al.
Publicado: (2026)
Accelerating LLM Reasoning via Early Rejection with Partial Reward Modeling
por: Cheshmi, Seyyed Saeid, et al.
Publicado: (2025)
por: Cheshmi, Seyyed Saeid, et al.
Publicado: (2025)
Verifier-Free RL for LLMs via Intrinsic Gradient-Norm Reward
por: Wen, Xuexiang, et al.
Publicado: (2026)
por: Wen, Xuexiang, et al.
Publicado: (2026)
Diffusion-Based Planning for Autonomous Driving with Flexible Guidance
por: Zheng, Yinan, et al.
Publicado: (2025)
por: Zheng, Yinan, et al.
Publicado: (2025)
RM-R1: Reward Modeling as Reasoning
por: Chen, Xiusi, et al.
Publicado: (2025)
por: Chen, Xiusi, et al.
Publicado: (2025)
Decoupled Guidance Diffusion for Adaptive Offline Safe Reinforcement Learning
por: Chen, Rufeng, et al.
Publicado: (2026)
por: Chen, Rufeng, et al.
Publicado: (2026)
Manifold-based Incomplete Multi-view Clustering via Bi-Consistency Guidance
por: Wang, Huibing, et al.
Publicado: (2024)
por: Wang, Huibing, et al.
Publicado: (2024)
RewardAnything: Generalizable Principle-Following Reward Models
por: Yu, Zhuohao, et al.
Publicado: (2025)
por: Yu, Zhuohao, et al.
Publicado: (2025)
GHPO: Adaptive Guidance for Stable and Efficient LLM Reinforcement Learning
por: Liu, Ziru, et al.
Publicado: (2025)
por: Liu, Ziru, et al.
Publicado: (2025)
On the Overscaling Curse of Parallel Thinking: System Efficacy Contradicts Sample Efficiency
por: Wang, Yiming, et al.
Publicado: (2026)
por: Wang, Yiming, et al.
Publicado: (2026)
Adaptive Conformal Guidance for Learning under Uncertainty
por: Liu, Rui, et al.
Publicado: (2025)
por: Liu, Rui, et al.
Publicado: (2025)
Learning Diverse Policies with Soft Self-Generated Guidance
por: Wang, Guojian, et al.
Publicado: (2024)
por: Wang, Guojian, et al.
Publicado: (2024)
Scalable Differentiable Causal Discovery in the Presence of Latent Confounders with Skeleton Posterior (Extended Version)
por: Ma, Pingchuan, et al.
Publicado: (2024)
por: Ma, Pingchuan, et al.
Publicado: (2024)
Equivariant Action Sampling for Reinforcement Learning and Planning
por: Zhao, Linfeng, et al.
Publicado: (2024)
por: Zhao, Linfeng, et al.
Publicado: (2024)
ProgRM: Build Better GUI Agents with Progress Rewards
por: Zhang, Danyang, et al.
Publicado: (2025)
por: Zhang, Danyang, et al.
Publicado: (2025)
Ejemplares similares
-
Reward-Augmented Data Enhances Direct Preference Alignment of LLMs
por: Zhang, Shenao, et al.
Publicado: (2024) -
Lookahead Sample Reward Guidance for Test-Time Scaling of Diffusion Models
por: Kim, Yeongmin, et al.
Publicado: (2026) -
TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization
por: Zhu, Mingkang, et al.
Publicado: (2025) -
Diffusion-DICE: In-Sample Diffusion Guidance for Offline Reinforcement Learning
por: Mao, Liyuan, et al.
Publicado: (2024) -
MoEQuant: Enhancing Quantization for Mixture-of-Experts Large Language Models via Expert-Balanced Sampling and Affinity Guidance
por: Hu, Xing, et al.
Publicado: (2025)