Supervised Reinforcement Learning: From Expert Trajectories to Step-wise Reasoning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Deng, Yihe, Hsu, I-Hung, Yan, Jun, Wang, Zifeng, Han, Rujun, Zhang, Gufeng, Chen, Yanfei, Wang, Wei, Pfister, Tomas, Lee, Chen-Yu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
SAGE: Steerable Agentic Data Generation for Deep Search with Execution Feedback
von: Xu, Fangyuan, et al.
Veröffentlicht: (2026)
von: Xu, Fangyuan, et al.
Veröffentlicht: (2026)
ReasoningBank: Scaling Agent Self-Evolving with Reasoning Memory
von: Ouyang, Siru, et al.
Veröffentlicht: (2025)
von: Ouyang, Siru, et al.
Veröffentlicht: (2025)
In Prospect and Retrospect: Reflective Memory Management for Long-term Personalized Dialogue Agents
von: Tan, Zhen, et al.
Veröffentlicht: (2025)
von: Tan, Zhen, et al.
Veröffentlicht: (2025)
Budget-Aware Tool-Use Enables Effective Agent Scaling
von: Liu, Tengxiao, et al.
Veröffentlicht: (2025)
von: Liu, Tengxiao, et al.
Veröffentlicht: (2025)
From Novice to Expert: LLM Agent Policy Optimization via Step-wise Reinforcement Learning
von: Deng, Zhirui, et al.
Veröffentlicht: (2024)
von: Deng, Zhirui, et al.
Veröffentlicht: (2024)
RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards
von: Li, Gaotang, et al.
Veröffentlicht: (2026)
von: Li, Gaotang, et al.
Veröffentlicht: (2026)
CaLM: Contrasting Large and Small Language Models to Verify Grounded Generation
von: Hsu, I-Hung, et al.
Veröffentlicht: (2024)
von: Hsu, I-Hung, et al.
Veröffentlicht: (2024)
Magnet: Multi-turn Tool-use Data Synthesis and Distillation via Graph Translation
von: Yin, Fan, et al.
Veröffentlicht: (2025)
von: Yin, Fan, et al.
Veröffentlicht: (2025)
Reverse Thinking Makes LLMs Stronger Reasoners
von: Chen, Justin Chih-Yao, et al.
Veröffentlicht: (2024)
von: Chen, Justin Chih-Yao, et al.
Veröffentlicht: (2024)
COSTAR: Improved Temporal Counterfactual Estimation with Self-Supervised Learning
von: Meng, Chuizheng, et al.
Veröffentlicht: (2023)
von: Meng, Chuizheng, et al.
Veröffentlicht: (2023)
PlanGEN: A Multi-Agent Framework for Generating Planning and Reasoning Trajectories for Complex Problem Solving
von: Parmar, Mihir, et al.
Veröffentlicht: (2025)
von: Parmar, Mihir, et al.
Veröffentlicht: (2025)
Full-Step-DPO: Self-Supervised Preference Optimization with Step-wise Rewards for Mathematical Reasoning
von: Xu, Huimin, et al.
Veröffentlicht: (2025)
von: Xu, Huimin, et al.
Veröffentlicht: (2025)
Speculative Knowledge Distillation: Bridging the Teacher-Student Gap Through Interleaved Sampling
von: Xu, Wenda, et al.
Veröffentlicht: (2024)
von: Xu, Wenda, et al.
Veröffentlicht: (2024)
SkillOS: Learning Skill Curation for Self-Evolving Agents
von: Ouyang, Siru, et al.
Veröffentlicht: (2026)
von: Ouyang, Siru, et al.
Veröffentlicht: (2026)
Step-wise Adaptive Integration of Supervised Fine-tuning and Reinforcement Learning for Task-Specific LLMs
von: Chen, Jack, et al.
Veröffentlicht: (2025)
von: Chen, Jack, et al.
Veröffentlicht: (2025)
Towards Compute-Optimal Many-Shot In-Context Learning
von: Golchin, Shahriar, et al.
Veröffentlicht: (2025)
von: Golchin, Shahriar, et al.
Veröffentlicht: (2025)
Step-wise Rubric Rewards for LLM Reasoning
von: Xie, Weichu, et al.
Veröffentlicht: (2026)
von: Xie, Weichu, et al.
Veröffentlicht: (2026)
TableRAG: Million-Token Table Understanding with Language Models
von: Chen, Si-An, et al.
Veröffentlicht: (2024)
von: Chen, Si-An, et al.
Veröffentlicht: (2024)
Search-Adaptor: Embedding Customization for Information Retrieval
von: Yoon, Jinsung, et al.
Veröffentlicht: (2023)
von: Yoon, Jinsung, et al.
Veröffentlicht: (2023)
Learned Feature Importance Scores for Automated Feature Engineering
von: Dong, Yihe, et al.
Veröffentlicht: (2024)
von: Dong, Yihe, et al.
Veröffentlicht: (2024)
ESCoT: An Enhanced Step-based Coordinate Trajectory Planning Method for Multiple Car-like Robots
von: Jiang, Junkai, et al.
Veröffentlicht: (2025)
von: Jiang, Junkai, et al.
Veröffentlicht: (2025)
Boundary-to-Region Supervision for Offline Safe Reinforcement Learning
von: Su, Huikang, et al.
Veröffentlicht: (2025)
von: Su, Huikang, et al.
Veröffentlicht: (2025)
Model Swarms: Collaborative Search to Adapt LLM Experts via Swarm Intelligence
von: Feng, Shangbin, et al.
Veröffentlicht: (2024)
von: Feng, Shangbin, et al.
Veröffentlicht: (2024)
LegalReasoner: Step-wised Verification-Correction for Legal Judgment Reasoning
von: Shi, Weijie, et al.
Veröffentlicht: (2025)
von: Shi, Weijie, et al.
Veröffentlicht: (2025)
Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs
von: Lai, Xin, et al.
Veröffentlicht: (2024)
von: Lai, Xin, et al.
Veröffentlicht: (2024)
LANISTR: Multimodal Learning from Structured and Unstructured Data
von: Ebrahimi, Sayna, et al.
Veröffentlicht: (2023)
von: Ebrahimi, Sayna, et al.
Veröffentlicht: (2023)
SSPO: Self-traced Step-wise Preference Optimization for Process Supervision and Reasoning Compression
von: Xu, Yuyang, et al.
Veröffentlicht: (2025)
von: Xu, Yuyang, et al.
Veröffentlicht: (2025)
StepOPSD: Step-Aware Online Preference Distillation for Agent Reinforcement Learning
von: Zhang, Yanfei, et al.
Veröffentlicht: (2026)
von: Zhang, Yanfei, et al.
Veröffentlicht: (2026)
LogicReward: Incentivizing LLM Reasoning via Step-Wise Logical Supervision
von: Xu, Jundong, et al.
Veröffentlicht: (2025)
von: Xu, Jundong, et al.
Veröffentlicht: (2025)
Flow-DPO: Improving LLM Mathematical Reasoning through Online Multi-Agent Learning
von: Deng, Yihe, et al.
Veröffentlicht: (2024)
von: Deng, Yihe, et al.
Veröffentlicht: (2024)
Chain-of-Table: Evolving Tables in the Reasoning Chain for Table Understanding
von: Wang, Zilong, et al.
Veröffentlicht: (2024)
von: Wang, Zilong, et al.
Veröffentlicht: (2024)
Rethinking Expert Trajectory Utilization in LLM Post-training for Mathematical Reasoning
von: Ding, Bowen, et al.
Veröffentlicht: (2025)
von: Ding, Bowen, et al.
Veröffentlicht: (2025)
SE-Agent: Self-Evolution Trajectory Optimization in Multi-Step Reasoning with LLM-Based Agents
von: Lin, Jiaye, et al.
Veröffentlicht: (2025)
von: Lin, Jiaye, et al.
Veröffentlicht: (2025)
Omanic: Towards Step-wise Evaluation of Multi-hop Reasoning in Large Language Models
von: Gu, Xiaojie, et al.
Veröffentlicht: (2026)
von: Gu, Xiaojie, et al.
Veröffentlicht: (2026)
STEPER: Step-wise Knowledge Distillation for Enhancing Reasoning Ability in Multi-Step Retrieval-Augmented Language Models
von: Lee, Kyumin, et al.
Veröffentlicht: (2025)
von: Lee, Kyumin, et al.
Veröffentlicht: (2025)
RPRO: Ranked Preference Reinforcement Optimization for Enhancing Medical QA and Diagnostic Reasoning
von: Hsu, Chia-Hsuan, et al.
Veröffentlicht: (2025)
von: Hsu, Chia-Hsuan, et al.
Veröffentlicht: (2025)
Re-Invoke: Tool Invocation Rewriting for Zero-Shot Tool Retrieval
von: Chen, Yanfei, et al.
Veröffentlicht: (2024)
von: Chen, Yanfei, et al.
Veröffentlicht: (2024)
CodecLM: Aligning Language Models with Tailored Synthetic Data
von: Wang, Zifeng, et al.
Veröffentlicht: (2024)
von: Wang, Zifeng, et al.
Veröffentlicht: (2024)
Chain of Agents: Large Language Models Collaborating on Long-Context Tasks
von: Zhang, Yusen, et al.
Veröffentlicht: (2024)
von: Zhang, Yusen, et al.
Veröffentlicht: (2024)
DeepVIS: Bridging Natural Language and Data Visualization Through Step-wise Reasoning
von: Shuai, Zhihao, et al.
Veröffentlicht: (2025)
von: Shuai, Zhihao, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
SAGE: Steerable Agentic Data Generation for Deep Search with Execution Feedback
von: Xu, Fangyuan, et al.
Veröffentlicht: (2026) -
ReasoningBank: Scaling Agent Self-Evolving with Reasoning Memory
von: Ouyang, Siru, et al.
Veröffentlicht: (2025) -
In Prospect and Retrospect: Reflective Memory Management for Long-term Personalized Dialogue Agents
von: Tan, Zhen, et al.
Veröffentlicht: (2025) -
Budget-Aware Tool-Use Enables Effective Agent Scaling
von: Liu, Tengxiao, et al.
Veröffentlicht: (2025) -
From Novice to Expert: LLM Agent Policy Optimization via Step-wise Reinforcement Learning
von: Deng, Zhirui, et al.
Veröffentlicht: (2024)