SHARP: Synthesizing High-quality Aligned Reasoning Problems for Large Reasoning Models Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Xiong Jun, Zhang, Zhenduo, Wen, ZuJie, Zhang, Zhiqiang, Ren, Wang, Shi, Lei, Chen, Cai, Zhao, Deng, Wang, Qing, Han, Xudong, Tang, Chengfu, Jin, Dingnan, Cui, Qing, Zhou, Jun |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
StepCodeReasoner: Aligning Code Reasoning with Stepwise Execution Traces via Reinforcement Learning
par: Wang, Hao, et autres
Publié: (2026)
par: Wang, Hao, et autres
Publié: (2026)
Ring-lite: Scalable Reasoning via C3PO-Stabilized Reinforcement Learning for LLMs
par: Ling Team, et autres
Publié: (2025)
par: Ling Team, et autres
Publié: (2025)
DiffScore: Text Evaluation Beyond Autoregressive Likelihood
par: Lai, Wen, et autres
Publié: (2026)
par: Lai, Wen, et autres
Publié: (2026)
Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward
par: Tang, Xinyu, et autres
Publié: (2025)
par: Tang, Xinyu, et autres
Publié: (2025)
ReAlign: Generalizable Image Forgery Detection via Reasoning-Aligned Representation
par: Huang, Qing, et autres
Publié: (2026)
par: Huang, Qing, et autres
Publié: (2026)
Rethinking Sample Polarity in Reinforcement Learning with Verifiable Rewards
par: Tang, Xinyu, et autres
Publié: (2025)
par: Tang, Xinyu, et autres
Publié: (2025)
Reasons to Reject? Aligning Language Models with Judgments
par: Xu, Weiwen, et autres
Publié: (2023)
par: Xu, Weiwen, et autres
Publié: (2023)
SHARP: Spectrum-aware Highly-dynamic Adaptation for Resolution Promotion in Remote Sensing Synthesis
par: Zhao, Bingxuan, et autres
Publié: (2026)
par: Zhao, Bingxuan, et autres
Publié: (2026)
On Representation Redundancy in Large-Scale Instruction Tuning Data Selection
par: Shu, Youwei, et autres
Publié: (2026)
par: Shu, Youwei, et autres
Publié: (2026)
From Prediction to Justification: Aligning Sentiment Reasoning with Human Rationale via Reinforcement Learning
par: Zhang, Shihao, et autres
Publié: (2026)
par: Zhang, Shihao, et autres
Publié: (2026)
Incentivizing Dual Process Thinking for Efficient Large Language Model Reasoning
par: Cheng, Xiaoxue, et autres
Publié: (2025)
par: Cheng, Xiaoxue, et autres
Publié: (2025)
Reasoning-Table: Exploring Reinforcement Learning for Table Reasoning
par: Lei, Fangyu, et autres
Publié: (2025)
par: Lei, Fangyu, et autres
Publié: (2025)
Tree-of-Reasoning: Towards Complex Medical Diagnosis via Multi-Agent Reasoning with Evidence Tree
par: Peng, Qi, et autres
Publié: (2025)
par: Peng, Qi, et autres
Publié: (2025)
What Really Improves Mathematical Reasoning: Structured Reasoning Signals Beyond Pure Code
par: Zhao, Yuze, et autres
Publié: (2026)
par: Zhao, Yuze, et autres
Publié: (2026)
Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning
par: Cui, Jin, et autres
Publié: (2026)
par: Cui, Jin, et autres
Publié: (2026)
REA-RL: Reflection-Aware Online Reinforcement Learning for Efficient Reasoning
par: Deng, Hexuan, et autres
Publié: (2025)
par: Deng, Hexuan, et autres
Publié: (2025)
Distribution-Aligned Sequence Distillation for Superior Long-CoT Reasoning
par: Yan, Shaotian, et autres
Publié: (2026)
par: Yan, Shaotian, et autres
Publié: (2026)
How Do Answer Tokens Read Reasoning Traces? Self-Reading Patterns in Thinking LLMs for Quantitative Reasoning
par: Chen, Haoyang, et autres
Publié: (2026)
par: Chen, Haoyang, et autres
Publié: (2026)
Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models
par: Ling, Yiran, et autres
Publié: (2026)
par: Ling, Yiran, et autres
Publié: (2026)
Towards an AI Musician: Synthesizing Sheet Music Problems for Musical Reasoning
par: Wang, Zhilin, et autres
Publié: (2025)
par: Wang, Zhilin, et autres
Publié: (2025)
Unilaw-R1: A Large Language Model for Legal Reasoning with Reinforcement Learning and Iterative Inference
par: Cai, Hua, et autres
Publié: (2025)
par: Cai, Hua, et autres
Publié: (2025)
InftyThink+: Effective and Efficient Infinite-Horizon Reasoning via Reinforcement Learning
par: Yan, Yuchen, et autres
Publié: (2026)
par: Yan, Yuchen, et autres
Publié: (2026)
Mix Data or Merge Models? Balancing the Helpfulness, Honesty, and Harmlessness of Large Language Model via Model Merging
par: Yang, Jinluan, et autres
Publié: (2025)
par: Yang, Jinluan, et autres
Publié: (2025)
Enhanced Electrochemical Performance of NiMn Layered Double Hydroxides/Graphene Oxide Composites Synthesized by One‐Step Hydrothermal Method for Supercapacitors
par: Jun Chen, et autres
Publié: (2024)
par: Jun Chen, et autres
Publié: (2024)
Reason-Align-Respond: Aligning LLM Reasoning with Knowledge Graphs for KGQA
par: Shen, Xiangqing, et autres
Publié: (2025)
par: Shen, Xiangqing, et autres
Publié: (2025)
Aligning Green Finance, Technological Innovation, and Energy Consumption for CO 2 Emission Reduction: Insights From BRICS + Countries
par: Chengfu Mu, et autres
Publié: (2026)
par: Chengfu Mu, et autres
Publié: (2026)
Long Grounded Thoughts: Synthesizing Visual Problems and Reasoning Chains at Scale
par: Acuna, David, et autres
Publié: (2025)
par: Acuna, David, et autres
Publié: (2025)
NFT: Bridging Supervised Learning and Reinforcement Learning in Math Reasoning
par: Chen, Huayu, et autres
Publié: (2025)
par: Chen, Huayu, et autres
Publié: (2025)
Exploration of the Photoluminescence Behavior and Emission Mechanism of Thioester Polyacrylamide Tablets During the Gradual Increase of Molecular Weight
par: Qing Zhou, et autres
Publié: (2024)
par: Qing Zhou, et autres
Publié: (2024)
Continuity Reinforcement Skeleton for Pixel-based Haptic Display
par: Wang, Xinyuan, et autres
Publié: (2024)
par: Wang, Xinyuan, et autres
Publié: (2024)
RV-Syn: Rational and Verifiable Mathematical Reasoning Data Synthesis based on Structured Function Library
par: Wang, Jiapeng, et autres
Publié: (2025)
par: Wang, Jiapeng, et autres
Publié: (2025)
ThinkRL-Edit: Thinking in Reinforcement Learning for Reasoning-Centric Image Editing
par: Li, Hengjia, et autres
Publié: (2026)
par: Li, Hengjia, et autres
Publié: (2026)
SURE: Semi-dense Uncertainty-REfined Feature Matching
par: Li, Sicheng, et autres
Publié: (2026)
par: Li, Sicheng, et autres
Publié: (2026)
Answer First, Reason Later: Aligning Search Relevance via Mode-Balanced Reinforcement Learning
par: Zhang, Shijie, et autres
Publié: (2026)
par: Zhang, Shijie, et autres
Publié: (2026)
Native Parallel Reasoner: Reasoning in Parallelism via Self-Distilled Reinforcement Learning
par: Wu, Tong, et autres
Publié: (2025)
par: Wu, Tong, et autres
Publié: (2025)
Evaluating Interactive Reasoning in Large Language Models: A Hierarchical Benchmark with Executable Games
par: Fan, Mingyuan, et autres
Publié: (2026)
par: Fan, Mingyuan, et autres
Publié: (2026)
Supervised Reinforcement Learning: From Expert Trajectories to Step-wise Reasoning
par: Deng, Yihe, et autres
Publié: (2025)
par: Deng, Yihe, et autres
Publié: (2025)
Experimental Study on Mechanical Properties and Micromechanisms of Cement‐Improved Granite Residual Soil
par: Jun Xiong, et autres
Publié: (2025)
par: Jun Xiong, et autres
Publié: (2025)
Plan before Solving: Problem-Aware Strategy Routing for Mathematical Reasoning with LLMs
par: Qi, Shihao, et autres
Publié: (2025)
par: Qi, Shihao, et autres
Publié: (2025)
Realizing modular data from centers of near-group categories
par: Yu, Zhiqiang, et autres
Publié: (2024)
par: Yu, Zhiqiang, et autres
Publié: (2024)
Documents similaires
-
StepCodeReasoner: Aligning Code Reasoning with Stepwise Execution Traces via Reinforcement Learning
par: Wang, Hao, et autres
Publié: (2026) -
Ring-lite: Scalable Reasoning via C3PO-Stabilized Reinforcement Learning for LLMs
par: Ling Team, et autres
Publié: (2025) -
DiffScore: Text Evaluation Beyond Autoregressive Likelihood
par: Lai, Wen, et autres
Publié: (2026) -
Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward
par: Tang, Xinyu, et autres
Publié: (2025) -
ReAlign: Generalizable Image Forgery Detection via Reasoning-Aligned Representation
par: Huang, Qing, et autres
Publié: (2026)