Intra-Trajectory Consistency for Reward Modeling
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhou, Chaoyang, Liu, Shunyu, Wang, Zengmao, Wang, Di, Tu, Rong-Cheng, Du, Bo, Tao, Dacheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CoVeR: Conformal Calibration for Versatile and Reliable Autoregressive Next-Token Prediction
por: Chen, Yuzhu, et al.
Publicado: (2025)
por: Chen, Yuzhu, et al.
Publicado: (2025)
InfoRM: Mitigating Reward Hacking in RLHF via Information-Theoretic Reward Modeling
por: Miao, Yuchun, et al.
Publicado: (2024)
por: Miao, Yuchun, et al.
Publicado: (2024)
Diffusion Model-Based Video Editing: A Survey
por: Sun, Wenhao, et al.
Publicado: (2024)
por: Sun, Wenhao, et al.
Publicado: (2024)
SPA-Cache: Singular Proxies for Adaptive Caching in Diffusion Language Models
por: Sun, Wenhao, et al.
Publicado: (2026)
por: Sun, Wenhao, et al.
Publicado: (2026)
COLA: Cross-city Mobility Transformer for Human Trajectory Simulation
por: Wang, Yu, et al.
Publicado: (2024)
por: Wang, Yu, et al.
Publicado: (2024)
Separable Power of Classical and Quantum Learning Protocols Through the Lens of No-Free-Lunch Theorem
por: Wang, Xinbiao, et al.
Publicado: (2024)
por: Wang, Xinbiao, et al.
Publicado: (2024)
Accelerating Diffusion Planners in Offline RL via Reward-Aware Consistency Trajectory Distillation
por: Duan, Xintong, et al.
Publicado: (2025)
por: Duan, Xintong, et al.
Publicado: (2025)
Reward Models Identify Consistency, Not Causality
por: Xu, Yuhui, et al.
Publicado: (2025)
por: Xu, Yuhui, et al.
Publicado: (2025)
ConsistRM: Improving Generative Reward Models via Consistency-Aware Self-Training
por: Liang, Yu, et al.
Publicado: (2026)
por: Liang, Yu, et al.
Publicado: (2026)
A Theoretical Survey on Foundation Models
por: Fu, Shi, et al.
Publicado: (2024)
por: Fu, Shi, et al.
Publicado: (2024)
When Data-Free Knowledge Distillation Meets Non-Transferable Teacher: Escaping Out-of-Distribution Trap is All You Need
por: Hong, Ziming, et al.
Publicado: (2025)
por: Hong, Ziming, et al.
Publicado: (2025)
Offline Behavioral Data Selection
por: Lei, Shiye, et al.
Publicado: (2025)
por: Lei, Shiye, et al.
Publicado: (2025)
A Step Back: Prefix Importance Ratio Stabilizes Policy Optimization
por: Lei, Shiye, et al.
Publicado: (2026)
por: Lei, Shiye, et al.
Publicado: (2026)
TROJail: Trajectory-Level Optimization for Multi-Turn Large Language Model Jailbreaks with Process Rewards
por: Xiong, Xiqiao, et al.
Publicado: (2025)
por: Xiong, Xiqiao, et al.
Publicado: (2025)
SemiReward: A General Reward Model for Semi-supervised Learning
por: Li, Siyuan, et al.
Publicado: (2023)
por: Li, Siyuan, et al.
Publicado: (2023)
Consistency Trajectory Planning: High-Quality and Efficient Trajectory Optimization for Offline Model-Based Reinforcement Learning
por: Wang, Guanquan, et al.
Publicado: (2025)
por: Wang, Guanquan, et al.
Publicado: (2025)
Near-Oracle KV Selection via Pre-hoc Sparsity for Long-Context Inference
por: Gao, Yifei, et al.
Publicado: (2026)
por: Gao, Yifei, et al.
Publicado: (2026)
Towards Theoretical Understandings of Self-Consuming Generative Models
por: Fu, Shi, et al.
Publicado: (2024)
por: Fu, Shi, et al.
Publicado: (2024)
Robometer: Scaling General-Purpose Robotic Reward Models via Trajectory Comparisons
por: Liang, Anthony, et al.
Publicado: (2026)
por: Liang, Anthony, et al.
Publicado: (2026)
Transition Role of Entangled Data in Quantum Machine Learning
por: Wang, Xinbiao, et al.
Publicado: (2023)
por: Wang, Xinbiao, et al.
Publicado: (2023)
IntraSlice: Towards High-Performance Structural Pruning with Block-Intra PCA for LLMs
por: Li, Meng, et al.
Publicado: (2026)
por: Li, Meng, et al.
Publicado: (2026)
SMILE: Zero-Shot Sparse Mixture of Low-Rank Experts Construction From Pre-Trained Foundation Models
por: Tang, Anke, et al.
Publicado: (2024)
por: Tang, Anke, et al.
Publicado: (2024)
A Theoretical Perspective: How to Prevent Model Collapse in Self-consuming Training Loops
por: Fu, Shi, et al.
Publicado: (2025)
por: Fu, Shi, et al.
Publicado: (2025)
Adaptive Defense against Harmful Fine-Tuning for Large Language Models via Bayesian Data Scheduler
por: Hu, Zixuan, et al.
Publicado: (2025)
por: Hu, Zixuan, et al.
Publicado: (2025)
Efficient Differentiable Causal Discovery via Reliable Super-Structure Learning
por: Ma, Pingchuan, et al.
Publicado: (2026)
por: Ma, Pingchuan, et al.
Publicado: (2026)
One Fits All: General Mobility Trajectory Modeling via Masked Conditional Diffusion
por: Long, Qingyue, et al.
Publicado: (2025)
por: Long, Qingyue, et al.
Publicado: (2025)
Design Conditions for Intra-Group Learning of Sequence-Level Rewards: Token Gradient Cancellation
por: Ding, Fei, et al.
Publicado: (2026)
por: Ding, Fei, et al.
Publicado: (2026)
Explaining Learned Reward Functions with Counterfactual Trajectories
por: Wehner, Jan, et al.
Publicado: (2024)
por: Wehner, Jan, et al.
Publicado: (2024)
Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning
por: Zhang, Kongcheng, et al.
Publicado: (2025)
por: Zhang, Kongcheng, et al.
Publicado: (2025)
MG-Net: Learn to Customize QAOA with Circuit Depth Awareness
por: Qian, Yang, et al.
Publicado: (2024)
por: Qian, Yang, et al.
Publicado: (2024)
Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment
por: Wang, Chaoqi, et al.
Publicado: (2025)
por: Wang, Chaoqi, et al.
Publicado: (2025)
SplitMeanFlow: Interval Splitting Consistency in Few-Step Generative Modeling
por: Guo, Yi, et al.
Publicado: (2025)
por: Guo, Yi, et al.
Publicado: (2025)
Temporal Prototype-Aware Learning for Active Voltage Control on Power Distribution Networks
por: Xu, Feiyang, et al.
Publicado: (2024)
por: Xu, Feiyang, et al.
Publicado: (2024)
Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections
por: Wang, Bo, et al.
Publicado: (2025)
por: Wang, Bo, et al.
Publicado: (2025)
DiffMove: Group Mobility Tendency Enhanced Trajectory Recovery via Diffusion Model
por: Long, Qingyue, et al.
Publicado: (2025)
por: Long, Qingyue, et al.
Publicado: (2025)
CodeScaler: Scaling Code LLM Training and Test-Time Inference via Reward Models
por: Zhu, Xiao, et al.
Publicado: (2026)
por: Zhu, Xiao, et al.
Publicado: (2026)
R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization
por: Zhang, Jingyi, et al.
Publicado: (2025)
por: Zhang, Jingyi, et al.
Publicado: (2025)
Learning from models beyond fine-tuning
por: Zheng, Hongling, et al.
Publicado: (2023)
por: Zheng, Hongling, et al.
Publicado: (2023)
Offline Behavior Distillation
por: Lei, Shiye, et al.
Publicado: (2024)
por: Lei, Shiye, et al.
Publicado: (2024)
Continual Learning on Graphs: Challenges, Solutions, and Opportunities
por: Zhang, Xikun, et al.
Publicado: (2024)
por: Zhang, Xikun, et al.
Publicado: (2024)
Ejemplares similares
-
CoVeR: Conformal Calibration for Versatile and Reliable Autoregressive Next-Token Prediction
por: Chen, Yuzhu, et al.
Publicado: (2025) -
InfoRM: Mitigating Reward Hacking in RLHF via Information-Theoretic Reward Modeling
por: Miao, Yuchun, et al.
Publicado: (2024) -
Diffusion Model-Based Video Editing: A Survey
por: Sun, Wenhao, et al.
Publicado: (2024) -
SPA-Cache: Singular Proxies for Adaptive Caching in Diffusion Language Models
por: Sun, Wenhao, et al.
Publicado: (2026) -
COLA: Cross-city Mobility Transformer for Human Trajectory Simulation
por: Wang, Yu, et al.
Publicado: (2024)