StepOPSD: Step-Aware Online Preference Distillation for Agent Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Yanfei, Lin, Xu, Wu, Chenglin |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Interference-Aware K-Step Reachable Communication in Multi-Agent Reinforcement Learning
par: Cheng, Ziyu, et autres
Publié: (2026)
par: Cheng, Ziyu, et autres
Publié: (2026)
Two-Step Offline Preference-Based Reinforcement Learning with Constrained Actions
par: Xu, Yinglun, et autres
Publié: (2023)
par: Xu, Yinglun, et autres
Publié: (2023)
Rewarding What Matters: Step-by-Step Reinforcement Learning for Task-Oriented Dialogue
par: Du, Huifang, et autres
Publié: (2024)
par: Du, Huifang, et autres
Publié: (2024)
Agent-as-Tool: A Study on the Hierarchical Decision Making with Reinforcement Learning
par: Zhang, Yanfei
Publié: (2025)
par: Zhang, Yanfei
Publié: (2025)
SOD: Step-wise On-policy Distillation for Small Language Model Agents
par: Zhong, Qiyong, et autres
Publié: (2026)
par: Zhong, Qiyong, et autres
Publié: (2026)
Supervised Reinforcement Learning: From Expert Trajectories to Step-wise Reasoning
par: Deng, Yihe, et autres
Publié: (2025)
par: Deng, Yihe, et autres
Publié: (2025)
Hierarchical Reinforcement Learning with Augmented Step-Level Transitions for LLM Agents
par: Zhen, Shuai, et autres
Publié: (2026)
par: Zhen, Shuai, et autres
Publié: (2026)
StepFun-Prover Preview: Let's Think and Verify Step by Step
par: Shang, Shijie, et autres
Publié: (2025)
par: Shang, Shijie, et autres
Publié: (2025)
Diffusion World Model: Future Modeling Beyond Step-by-Step Rollout for Offline Reinforcement Learning
par: Ding, Zihan, et autres
Publié: (2024)
par: Ding, Zihan, et autres
Publié: (2024)
D-OPSD: On-Policy Self-Distillation for Continuously Tuning Step-Distilled Diffusion Models
par: Jiang, Dengyang, et autres
Publié: (2026)
par: Jiang, Dengyang, et autres
Publié: (2026)
One Step Beyond: Feedthrough & Placement-Aware Rectilinear Floorplanner
par: Xu, Zhexuan, et autres
Publié: (2025)
par: Xu, Zhexuan, et autres
Publié: (2025)
R3-RAG: Learning Step-by-Step Reasoning and Retrieval for LLMs via Reinforcement Learning
par: Li, Yuan, et autres
Publié: (2025)
par: Li, Yuan, et autres
Publié: (2025)
Offline Reinforcement Learning for LLM Multi-Step Reasoning
par: Wang, Huaijie, et autres
Publié: (2024)
par: Wang, Huaijie, et autres
Publié: (2024)
SSPO: Self-traced Step-wise Preference Optimization for Process Supervision and Reasoning Compression
par: Xu, Yuyang, et autres
Publié: (2025)
par: Xu, Yuyang, et autres
Publié: (2025)
Preference Elicitation for Step-Wise Explanations in Logic Puzzles
par: Foschini, Marco, et autres
Publié: (2025)
par: Foschini, Marco, et autres
Publié: (2025)
DSFlow: Dual Supervision and Step-Aware Architecture for One-Step Flow Matching Speech Synthesis
par: Lin, Bin, et autres
Publié: (2026)
par: Lin, Bin, et autres
Publié: (2026)
StepMathAgent: A Step-Wise Agent for Evaluating Mathematical Processes through Tree-of-Error
par: Yang, Shu-Xun, et autres
Publié: (2025)
par: Yang, Shu-Xun, et autres
Publié: (2025)
Step-Back Profiling: Distilling User History for Personalized Scientific Writing
par: Tang, Xiangru, et autres
Publié: (2024)
par: Tang, Xiangru, et autres
Publié: (2024)
KD-MARL: Resource-Aware Knowledge Distillation in Multi-Agent Reinforcement Learning
par: Pavel, Monirul Islam, et autres
Publié: (2026)
par: Pavel, Monirul Islam, et autres
Publié: (2026)
Watch Every Step! LLM Agent Learning via Iterative Step-Level Process Refinement
par: Xiong, Weimin, et autres
Publié: (2024)
par: Xiong, Weimin, et autres
Publié: (2024)
MathMistake Checker: A Comprehensive Demonstration for Step-by-Step Math Problem Mistake Finding by Prompt-Guided LLMs
par: Zhang, Tianyang, et autres
Publié: (2025)
par: Zhang, Tianyang, et autres
Publié: (2025)
Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs
par: Lai, Xin, et autres
Publié: (2024)
par: Lai, Xin, et autres
Publié: (2024)
Infinite Mask Diffusion for Few-Step Distillation
par: Yoo, Jaehoon, et autres
Publié: (2026)
par: Yoo, Jaehoon, et autres
Publié: (2026)
Safe Reinforcement Learning with Preference-based Constraint Inference
par: Li, Chenglin, et autres
Publié: (2026)
par: Li, Chenglin, et autres
Publié: (2026)
One Step is Enough: Multi-Agent Reinforcement Learning based on One-Step Policy Optimization for Order Dispatch on Ride-Sharing Platforms
par: Zhao, Zijian, et autres
Publié: (2025)
par: Zhao, Zijian, et autres
Publié: (2025)
Refining Alignment Framework for Diffusion Models with Intermediate-Step Preference Ranking
par: Ren, Jie, et autres
Publié: (2025)
par: Ren, Jie, et autres
Publié: (2025)
One-Step Detection Paradigm for Hyperspectral Anomaly Detection via Spectral Deviation Relationship Learning
par: Li, Jingtao, et autres
Publié: (2023)
par: Li, Jingtao, et autres
Publié: (2023)
OPSD: an Offensive Persian Social media Dataset and its baseline evaluations
par: Safayani, Mehran, et autres
Publié: (2024)
par: Safayani, Mehran, et autres
Publié: (2024)
Step-level Value Preference Optimization for Mathematical Reasoning
par: Chen, Guoxin, et autres
Publié: (2024)
par: Chen, Guoxin, et autres
Publié: (2024)
CoFlow: Coordinated Few-Step Flow for Offline Multi-Agent Decision Making
par: Zou, Guowei, et autres
Publié: (2026)
par: Zou, Guowei, et autres
Publié: (2026)
Evaluating VLMs' Spatial Reasoning Over Robot Motion: A Step Towards Robot Planning with Motion Preferences
par: Wu, Wenxi, et autres
Publié: (2026)
par: Wu, Wenxi, et autres
Publié: (2026)
Every Step Evolves: Scaling Reinforcement Learning for Trillion-Scale Thinking Model
par: Ling Team, et autres
Publié: (2025)
par: Ling Team, et autres
Publié: (2025)
GroundedPRM: Tree-Guided and Fidelity-Aware Process Reward Modeling for Step-Level Reasoning
par: Zhang, Yao, et autres
Publié: (2025)
par: Zhang, Yao, et autres
Publié: (2025)
Exploring Time-Step Size in Reinforcement Learning for Sepsis Treatment
par: Sun, Yingchuan, et autres
Publié: (2025)
par: Sun, Yingchuan, et autres
Publié: (2025)
STEPER: Step-wise Knowledge Distillation for Enhancing Reasoning Ability in Multi-Step Retrieval-Augmented Language Models
par: Lee, Kyumin, et autres
Publié: (2025)
par: Lee, Kyumin, et autres
Publié: (2025)
Step-by-Step Causality: Transparent Causal Discovery with Multi-Agent Tree-Query and Adversarial Confidence Estimation
par: Ding, Ziyi, et autres
Publié: (2026)
par: Ding, Ziyi, et autres
Publié: (2026)
Beyond Single-Step Updates: Reinforcement Learning of Heuristics with Limited-Horizon Search
par: Hadar, Gal, et autres
Publié: (2025)
par: Hadar, Gal, et autres
Publié: (2025)
Flash-DMD: Towards High-Fidelity Few-Step Image Generation with Efficient Distillation and Joint Reinforcement Learning
par: Chen, Guanjie, et autres
Publié: (2025)
par: Chen, Guanjie, et autres
Publié: (2025)
SCOPE: Compress Mathematical Reasoning Steps for Efficient Automated Process Annotation
par: Xu, Huimin, et autres
Publié: (2025)
par: Xu, Huimin, et autres
Publié: (2025)
Better Accuracies, Worse Reasoning: A Step-Level Audit of Medical Chain-of-Thought Distillation
par: Jiang, Zhaoyang, et autres
Publié: (2026)
par: Jiang, Zhaoyang, et autres
Publié: (2026)
Documents similaires
-
Interference-Aware K-Step Reachable Communication in Multi-Agent Reinforcement Learning
par: Cheng, Ziyu, et autres
Publié: (2026) -
Two-Step Offline Preference-Based Reinforcement Learning with Constrained Actions
par: Xu, Yinglun, et autres
Publié: (2023) -
Rewarding What Matters: Step-by-Step Reinforcement Learning for Task-Oriented Dialogue
par: Du, Huifang, et autres
Publié: (2024) -
Agent-as-Tool: A Study on the Hierarchical Decision Making with Reinforcement Learning
par: Zhang, Yanfei
Publié: (2025) -
SOD: Step-wise On-policy Distillation for Small Language Model Agents
par: Zhong, Qiyong, et autres
Publié: (2026)