Guardado en:
| Autores principales: | Xie, Zhihui, Chen, Jie, Chen, Liyu, Mao, Weichao, Xu, Jingjing, Kong, Lingpeng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2502.03492 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DLM-Scope: Mechanistic Interpretability of Diffusion Language Models via Sparse Autoencoders
por: Wang, Xu, et al.
Publicado: (2026)
por: Wang, Xu, et al.
Publicado: (2026)
PromptCoT: Synthesizing Olympiad-level Problems for Mathematical Reasoning in Large Language Models
por: Zhao, Xueliang, et al.
Publicado: (2025)
por: Zhao, Xueliang, et al.
Publicado: (2025)
$\mathbf{(N,K)}$-Puzzle: A Cost-Efficient Testbed for Benchmarking Reinforcement Learning Algorithms in Generative Language Model
por: Zhang, Yufeng, et al.
Publicado: (2024)
por: Zhang, Yufeng, et al.
Publicado: (2024)
Scaling Reasoning without Attention
por: Zhao, Xueliang, et al.
Publicado: (2025)
por: Zhao, Xueliang, et al.
Publicado: (2025)
DeepCritic: Deliberate Critique with Large Language Models
por: Yang, Wenkai, et al.
Publicado: (2025)
por: Yang, Wenkai, et al.
Publicado: (2025)
Teaching LLMs for Step-Level Automatic Math Correction via Reinforcement Learning
por: Li, Junsong, et al.
Publicado: (2025)
por: Li, Junsong, et al.
Publicado: (2025)
Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models
por: Sim, Shamus, et al.
Publicado: (2024)
por: Sim, Shamus, et al.
Publicado: (2024)
Self-Generated Critiques Boost Reward Modeling for Language Models
por: Yu, Yue, et al.
Publicado: (2024)
por: Yu, Yue, et al.
Publicado: (2024)
Incentivizing Agentic Reasoning in LLM Judges via Tool-Integrated Reinforcement Learning
por: Xu, Ran, et al.
Publicado: (2025)
por: Xu, Ran, et al.
Publicado: (2025)
Diffusion of Thoughts: Chain-of-Thought Reasoning in Diffusion Language Models
por: Ye, Jiacheng, et al.
Publicado: (2024)
por: Ye, Jiacheng, et al.
Publicado: (2024)
Self-Evolving Critique Abilities in Large Language Models
por: Tang, Zhengyang, et al.
Publicado: (2025)
por: Tang, Zhengyang, et al.
Publicado: (2025)
Scalable Oversight for Superhuman AI via Recursive Self-Critiquing
por: Wen, Xueru, et al.
Publicado: (2025)
por: Wen, Xueru, et al.
Publicado: (2025)
NOVER: Incentive Training for Language Models via Verifier-Free Reinforcement Learning
por: Liu, Wei, et al.
Publicado: (2025)
por: Liu, Wei, et al.
Publicado: (2025)
Deep Dense Exploration for LLM Reinforcement Learning via Pivot-Driven Resampling
por: Guo, Yiran, et al.
Publicado: (2026)
por: Guo, Yiran, et al.
Publicado: (2026)
RealCritic: Towards Effectiveness-Driven Evaluation of Language Model Critiques
por: Tang, Zhengyang, et al.
Publicado: (2025)
por: Tang, Zhengyang, et al.
Publicado: (2025)
The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models
por: Cui, Ganqu, et al.
Publicado: (2025)
por: Cui, Ganqu, et al.
Publicado: (2025)
SubgoalXL: Subgoal-based Expert Learning for Theorem Proving
por: Zhao, Xueliang, et al.
Publicado: (2024)
por: Zhao, Xueliang, et al.
Publicado: (2024)
Scaling Multimodal Search and Recommendation with Small Language Models via Upside-Down Reinforcement Learning
por: Lin, Yu-Chen, et al.
Publicado: (2025)
por: Lin, Yu-Chen, et al.
Publicado: (2025)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
por: Xie, Tianbao, et al.
Publicado: (2023)
por: Xie, Tianbao, et al.
Publicado: (2023)
Self-Hinting Language Models Enhance Reinforcement Learning
por: Liao, Baohao, et al.
Publicado: (2026)
por: Liao, Baohao, et al.
Publicado: (2026)
Nested-ReFT: Efficient Reinforcement Learning for Large Language Model Fine-Tuning via Off-Policy Rollouts
por: Heuillet, Maxime, et al.
Publicado: (2025)
por: Heuillet, Maxime, et al.
Publicado: (2025)
RAVEN: In-Context Learning with Retrieval-Augmented Encoder-Decoder Language Models
por: Huang, Jie, et al.
Publicado: (2023)
por: Huang, Jie, et al.
Publicado: (2023)
Enhancing LLM Reasoning via Critique Models with Test-Time and Training-Time Supervision
por: Xi, Zhiheng, et al.
Publicado: (2024)
por: Xi, Zhiheng, et al.
Publicado: (2024)
SelfIE: Self-Interpretation of Large Language Model Embeddings
por: Chen, Haozhe, et al.
Publicado: (2024)
por: Chen, Haozhe, et al.
Publicado: (2024)
SambaLingo: Teaching Large Language Models New Languages
por: Csaki, Zoltan, et al.
Publicado: (2024)
por: Csaki, Zoltan, et al.
Publicado: (2024)
Router-R1: Teaching LLMs Multi-Round Routing and Aggregation via Reinforcement Learning
por: Zhang, Haozhen, et al.
Publicado: (2025)
por: Zhang, Haozhen, et al.
Publicado: (2025)
WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct
por: Luo, Haipeng, et al.
Publicado: (2023)
por: Luo, Haipeng, et al.
Publicado: (2023)
AttriLens-Mol: Attribute Guided Reinforcement Learning for Molecular Property Prediction with Large Language Models
por: Lin, Xuan, et al.
Publicado: (2025)
por: Lin, Xuan, et al.
Publicado: (2025)
Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences
por: Rosset, Corby, et al.
Publicado: (2024)
por: Rosset, Corby, et al.
Publicado: (2024)
Critique-RL: Training Language Models for Critiquing through Two-Stage Reinforcement Learning
por: Xi, Zhiheng, et al.
Publicado: (2025)
por: Xi, Zhiheng, et al.
Publicado: (2025)
Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning
por: Dong, Guanting, et al.
Publicado: (2025)
por: Dong, Guanting, et al.
Publicado: (2025)
Multi-Objective Reinforcement Learning for Large Language Model Optimization: Visionary Perspective
por: Kong, Lingxiao, et al.
Publicado: (2025)
por: Kong, Lingxiao, et al.
Publicado: (2025)
Learn To be Efficient: Build Structured Sparsity in Large Language Models
por: Zheng, Haizhong, et al.
Publicado: (2024)
por: Zheng, Haizhong, et al.
Publicado: (2024)
Benefits and Pitfalls of Reinforcement Learning for Language Model Planning: A Theoretical Perspective
por: Wang, Siwei, et al.
Publicado: (2025)
por: Wang, Siwei, et al.
Publicado: (2025)
Knowledgeable Agents by Offline Reinforcement Learning from Large Language Model Rollouts
por: Pang, Jing-Cheng, et al.
Publicado: (2024)
por: Pang, Jing-Cheng, et al.
Publicado: (2024)
PCL-Reasoner-V1.5: Advancing Math Reasoning with Offline Reinforcement Learning
por: Lu, Yao, et al.
Publicado: (2026)
por: Lu, Yao, et al.
Publicado: (2026)
Imitating Language via Scalable Inverse Reinforcement Learning
por: Wulfmeier, Markus, et al.
Publicado: (2024)
por: Wulfmeier, Markus, et al.
Publicado: (2024)
Reinforcement Learning for Reasoning in Large Language Models with One Training Example
por: Wang, Yiping, et al.
Publicado: (2025)
por: Wang, Yiping, et al.
Publicado: (2025)
From Emergence to Control: Probing and Modulating Self-Reflection in Language Models
por: Zhu, Xudong, et al.
Publicado: (2025)
por: Zhu, Xudong, et al.
Publicado: (2025)
Using Large Language Models to Automate and Expedite Reinforcement Learning with Reward Machine
por: Alsadat, Shayan Meshkat, et al.
Publicado: (2024)
por: Alsadat, Shayan Meshkat, et al.
Publicado: (2024)
Ejemplares similares
-
DLM-Scope: Mechanistic Interpretability of Diffusion Language Models via Sparse Autoencoders
por: Wang, Xu, et al.
Publicado: (2026) -
PromptCoT: Synthesizing Olympiad-level Problems for Mathematical Reasoning in Large Language Models
por: Zhao, Xueliang, et al.
Publicado: (2025) -
$\mathbf{(N,K)}$-Puzzle: A Cost-Efficient Testbed for Benchmarking Reinforcement Learning Algorithms in Generative Language Model
por: Zhang, Yufeng, et al.
Publicado: (2024) -
Scaling Reasoning without Attention
por: Zhao, Xueliang, et al.
Publicado: (2025) -
DeepCritic: Deliberate Critique with Large Language Models
por: Yang, Wenkai, et al.
Publicado: (2025)