StepOPSD: Step-Aware Online Preference Distillation for Agent Reinforcement Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Yanfei, Lin, Xu, Wu, Chenglin |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Interference-Aware K-Step Reachable Communication in Multi-Agent Reinforcement Learning
by: Cheng, Ziyu, et al.
Published: (2026)
by: Cheng, Ziyu, et al.
Published: (2026)
Two-Step Offline Preference-Based Reinforcement Learning with Constrained Actions
by: Xu, Yinglun, et al.
Published: (2023)
by: Xu, Yinglun, et al.
Published: (2023)
Rewarding What Matters: Step-by-Step Reinforcement Learning for Task-Oriented Dialogue
by: Du, Huifang, et al.
Published: (2024)
by: Du, Huifang, et al.
Published: (2024)
Agent-as-Tool: A Study on the Hierarchical Decision Making with Reinforcement Learning
by: Zhang, Yanfei
Published: (2025)
by: Zhang, Yanfei
Published: (2025)
SOD: Step-wise On-policy Distillation for Small Language Model Agents
by: Zhong, Qiyong, et al.
Published: (2026)
by: Zhong, Qiyong, et al.
Published: (2026)
Supervised Reinforcement Learning: From Expert Trajectories to Step-wise Reasoning
by: Deng, Yihe, et al.
Published: (2025)
by: Deng, Yihe, et al.
Published: (2025)
Hierarchical Reinforcement Learning with Augmented Step-Level Transitions for LLM Agents
by: Zhen, Shuai, et al.
Published: (2026)
by: Zhen, Shuai, et al.
Published: (2026)
StepFun-Prover Preview: Let's Think and Verify Step by Step
by: Shang, Shijie, et al.
Published: (2025)
by: Shang, Shijie, et al.
Published: (2025)
Diffusion World Model: Future Modeling Beyond Step-by-Step Rollout for Offline Reinforcement Learning
by: Ding, Zihan, et al.
Published: (2024)
by: Ding, Zihan, et al.
Published: (2024)
D-OPSD: On-Policy Self-Distillation for Continuously Tuning Step-Distilled Diffusion Models
by: Jiang, Dengyang, et al.
Published: (2026)
by: Jiang, Dengyang, et al.
Published: (2026)
One Step Beyond: Feedthrough & Placement-Aware Rectilinear Floorplanner
by: Xu, Zhexuan, et al.
Published: (2025)
by: Xu, Zhexuan, et al.
Published: (2025)
R3-RAG: Learning Step-by-Step Reasoning and Retrieval for LLMs via Reinforcement Learning
by: Li, Yuan, et al.
Published: (2025)
by: Li, Yuan, et al.
Published: (2025)
Offline Reinforcement Learning for LLM Multi-Step Reasoning
by: Wang, Huaijie, et al.
Published: (2024)
by: Wang, Huaijie, et al.
Published: (2024)
SSPO: Self-traced Step-wise Preference Optimization for Process Supervision and Reasoning Compression
by: Xu, Yuyang, et al.
Published: (2025)
by: Xu, Yuyang, et al.
Published: (2025)
Preference Elicitation for Step-Wise Explanations in Logic Puzzles
by: Foschini, Marco, et al.
Published: (2025)
by: Foschini, Marco, et al.
Published: (2025)
DSFlow: Dual Supervision and Step-Aware Architecture for One-Step Flow Matching Speech Synthesis
by: Lin, Bin, et al.
Published: (2026)
by: Lin, Bin, et al.
Published: (2026)
StepMathAgent: A Step-Wise Agent for Evaluating Mathematical Processes through Tree-of-Error
by: Yang, Shu-Xun, et al.
Published: (2025)
by: Yang, Shu-Xun, et al.
Published: (2025)
Step-Back Profiling: Distilling User History for Personalized Scientific Writing
by: Tang, Xiangru, et al.
Published: (2024)
by: Tang, Xiangru, et al.
Published: (2024)
KD-MARL: Resource-Aware Knowledge Distillation in Multi-Agent Reinforcement Learning
by: Pavel, Monirul Islam, et al.
Published: (2026)
by: Pavel, Monirul Islam, et al.
Published: (2026)
Watch Every Step! LLM Agent Learning via Iterative Step-Level Process Refinement
by: Xiong, Weimin, et al.
Published: (2024)
by: Xiong, Weimin, et al.
Published: (2024)
MathMistake Checker: A Comprehensive Demonstration for Step-by-Step Math Problem Mistake Finding by Prompt-Guided LLMs
by: Zhang, Tianyang, et al.
Published: (2025)
by: Zhang, Tianyang, et al.
Published: (2025)
Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs
by: Lai, Xin, et al.
Published: (2024)
by: Lai, Xin, et al.
Published: (2024)
Infinite Mask Diffusion for Few-Step Distillation
by: Yoo, Jaehoon, et al.
Published: (2026)
by: Yoo, Jaehoon, et al.
Published: (2026)
Safe Reinforcement Learning with Preference-based Constraint Inference
by: Li, Chenglin, et al.
Published: (2026)
by: Li, Chenglin, et al.
Published: (2026)
One Step is Enough: Multi-Agent Reinforcement Learning based on One-Step Policy Optimization for Order Dispatch on Ride-Sharing Platforms
by: Zhao, Zijian, et al.
Published: (2025)
by: Zhao, Zijian, et al.
Published: (2025)
Refining Alignment Framework for Diffusion Models with Intermediate-Step Preference Ranking
by: Ren, Jie, et al.
Published: (2025)
by: Ren, Jie, et al.
Published: (2025)
One-Step Detection Paradigm for Hyperspectral Anomaly Detection via Spectral Deviation Relationship Learning
by: Li, Jingtao, et al.
Published: (2023)
by: Li, Jingtao, et al.
Published: (2023)
OPSD: an Offensive Persian Social media Dataset and its baseline evaluations
by: Safayani, Mehran, et al.
Published: (2024)
by: Safayani, Mehran, et al.
Published: (2024)
Step-level Value Preference Optimization for Mathematical Reasoning
by: Chen, Guoxin, et al.
Published: (2024)
by: Chen, Guoxin, et al.
Published: (2024)
CoFlow: Coordinated Few-Step Flow for Offline Multi-Agent Decision Making
by: Zou, Guowei, et al.
Published: (2026)
by: Zou, Guowei, et al.
Published: (2026)
Evaluating VLMs' Spatial Reasoning Over Robot Motion: A Step Towards Robot Planning with Motion Preferences
by: Wu, Wenxi, et al.
Published: (2026)
by: Wu, Wenxi, et al.
Published: (2026)
Every Step Evolves: Scaling Reinforcement Learning for Trillion-Scale Thinking Model
by: Ling Team, et al.
Published: (2025)
by: Ling Team, et al.
Published: (2025)
GroundedPRM: Tree-Guided and Fidelity-Aware Process Reward Modeling for Step-Level Reasoning
by: Zhang, Yao, et al.
Published: (2025)
by: Zhang, Yao, et al.
Published: (2025)
Exploring Time-Step Size in Reinforcement Learning for Sepsis Treatment
by: Sun, Yingchuan, et al.
Published: (2025)
by: Sun, Yingchuan, et al.
Published: (2025)
STEPER: Step-wise Knowledge Distillation for Enhancing Reasoning Ability in Multi-Step Retrieval-Augmented Language Models
by: Lee, Kyumin, et al.
Published: (2025)
by: Lee, Kyumin, et al.
Published: (2025)
Step-by-Step Causality: Transparent Causal Discovery with Multi-Agent Tree-Query and Adversarial Confidence Estimation
by: Ding, Ziyi, et al.
Published: (2026)
by: Ding, Ziyi, et al.
Published: (2026)
Beyond Single-Step Updates: Reinforcement Learning of Heuristics with Limited-Horizon Search
by: Hadar, Gal, et al.
Published: (2025)
by: Hadar, Gal, et al.
Published: (2025)
Flash-DMD: Towards High-Fidelity Few-Step Image Generation with Efficient Distillation and Joint Reinforcement Learning
by: Chen, Guanjie, et al.
Published: (2025)
by: Chen, Guanjie, et al.
Published: (2025)
SCOPE: Compress Mathematical Reasoning Steps for Efficient Automated Process Annotation
by: Xu, Huimin, et al.
Published: (2025)
by: Xu, Huimin, et al.
Published: (2025)
Better Accuracies, Worse Reasoning: A Step-Level Audit of Medical Chain-of-Thought Distillation
by: Jiang, Zhaoyang, et al.
Published: (2026)
by: Jiang, Zhaoyang, et al.
Published: (2026)
Similar Items
-
Interference-Aware K-Step Reachable Communication in Multi-Agent Reinforcement Learning
by: Cheng, Ziyu, et al.
Published: (2026) -
Two-Step Offline Preference-Based Reinforcement Learning with Constrained Actions
by: Xu, Yinglun, et al.
Published: (2023) -
Rewarding What Matters: Step-by-Step Reinforcement Learning for Task-Oriented Dialogue
by: Du, Huifang, et al.
Published: (2024) -
Agent-as-Tool: A Study on the Hierarchical Decision Making with Reinforcement Learning
by: Zhang, Yanfei
Published: (2025) -
SOD: Step-wise On-policy Distillation for Small Language Model Agents
by: Zhong, Qiyong, et al.
Published: (2026)