Native Reasoning Models: Training Language Models to Reason on Unverifiable Data
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Yuanfu, Liu, Zhixuan, Li, Xiangtian, Lu, Chaochao, Yang, Chao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
REFLECTOR: Internalizing Step-wise Reflection against Indirect Jailbreak
por: Ma, Jiachen, et al.
Publicado: (2026)
por: Ma, Jiachen, et al.
Publicado: (2026)
SafeCoT: Improving VLM Safety with Minimal Reasoning
por: Ma, Jiachen, et al.
Publicado: (2025)
por: Ma, Jiachen, et al.
Publicado: (2025)
Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks
por: Xu, Yifei, et al.
Publicado: (2025)
por: Xu, Yifei, et al.
Publicado: (2025)
Can Post-Training Transform LLMs into Causal Reasoners?
por: Chen, Junqi, et al.
Publicado: (2026)
por: Chen, Junqi, et al.
Publicado: (2026)
Entropy-Guided Data-Efficient Training for Multimodal Reasoning Reward Models
por: Yang, Shidong, et al.
Publicado: (2026)
por: Yang, Shidong, et al.
Publicado: (2026)
Variational Reasoning for Language Models
por: Zhou, Xiangxin, et al.
Publicado: (2025)
por: Zhou, Xiangxin, et al.
Publicado: (2025)
Train at Moving Edge: Online-Verified Prompt Selection for Efficient RL Training of Large Reasoning Model
por: Wu, Jiahao, et al.
Publicado: (2026)
por: Wu, Jiahao, et al.
Publicado: (2026)
Hierarchical Reasoning Model
por: Wang, Guan, et al.
Publicado: (2025)
por: Wang, Guan, et al.
Publicado: (2025)
Self-ReSET: Learning to Self-Recover from Unsafe Reasoning Trajectories
por: Zhang, Dongcheng, et al.
Publicado: (2026)
por: Zhang, Dongcheng, et al.
Publicado: (2026)
Reinforcement Learning for Reasoning in Large Language Models with One Training Example
por: Wang, Yiping, et al.
Publicado: (2025)
por: Wang, Yiping, et al.
Publicado: (2025)
Interpretable by AI Mother Tongue: Native Symbolic Reasoning in Neural Models
por: Liu, Hung Ming
Publicado: (2025)
por: Liu, Hung Ming
Publicado: (2025)
Simulating Environments with Reasoning Models for Agent Training
por: Li, Yuetai, et al.
Publicado: (2025)
por: Li, Yuetai, et al.
Publicado: (2025)
FEVO: Financial Knowledge Expansion and Reasoning Evolution for Large Language Models
por: Pang, Bo, et al.
Publicado: (2025)
por: Pang, Bo, et al.
Publicado: (2025)
Weak-to-Strong Search: Align Large Language Models via Searching over Small Language Models
por: Zhou, Zhanhui, et al.
Publicado: (2024)
por: Zhou, Zhanhui, et al.
Publicado: (2024)
Training Large Language Models to Reason via EM Policy Gradient
por: Xu, Tianbing
Publicado: (2025)
por: Xu, Tianbing
Publicado: (2025)
TimeOmni-1: Incentivizing Complex Reasoning with Time Series in Large Language Models
por: Guan, Tong, et al.
Publicado: (2025)
por: Guan, Tong, et al.
Publicado: (2025)
Self-Training Elicits Concise Reasoning in Large Language Models
por: Munkhbat, Tergel, et al.
Publicado: (2025)
por: Munkhbat, Tergel, et al.
Publicado: (2025)
Are Your Reasoning Models Reasoning or Guessing? A Mechanistic Analysis of Hierarchical Reasoning Models
por: Ren, Zirui, et al.
Publicado: (2026)
por: Ren, Zirui, et al.
Publicado: (2026)
Reasoning Language Model Inference Serving Unveiled: An Empirical Study
por: Li, Qi, et al.
Publicado: (2025)
por: Li, Qi, et al.
Publicado: (2025)
On the Optimal Reasoning Length for RL-Trained Language Models
por: Nohara, Daisuke, et al.
Publicado: (2026)
por: Nohara, Daisuke, et al.
Publicado: (2026)
From Entropy to Calibrated Uncertainty: Training Language Models to Reason About Uncertainty
por: Jenane, Azza, et al.
Publicado: (2026)
por: Jenane, Azza, et al.
Publicado: (2026)
Post-Training as Reweighting: A Stochastic View of Reasoning Trajectories in Language Models
por: Bu, Dake, et al.
Publicado: (2025)
por: Bu, Dake, et al.
Publicado: (2025)
Scaling Unverifiable Rewards: A Case Study on Visual Insights
por: Gan, Shuyu, et al.
Publicado: (2025)
por: Gan, Shuyu, et al.
Publicado: (2025)
AdaReasoner: Adaptive Reasoning Enables More Flexible Thinking in Large Language Models
por: Wang, Xiangqi, et al.
Publicado: (2025)
por: Wang, Xiangqi, et al.
Publicado: (2025)
Training Large Language Models To Reason In Parallel With Global Forking Tokens
por: Jia, Sheng, et al.
Publicado: (2025)
por: Jia, Sheng, et al.
Publicado: (2025)
Small Generalizable Prompt Predictive Models Can Steer Efficient RL Post-Training of Large Reasoning Models
por: Qu, Yun, et al.
Publicado: (2026)
por: Qu, Yun, et al.
Publicado: (2026)
DecepChain: Inducing Deceptive Reasoning in Large Language Models
por: Shen, Wei, et al.
Publicado: (2025)
por: Shen, Wei, et al.
Publicado: (2025)
Are Large-Language Models Graph Algorithmic Reasoners?
por: Taylor, Alexander K, et al.
Publicado: (2024)
por: Taylor, Alexander K, et al.
Publicado: (2024)
Inference-Time Language Model Alignment via Integrated Value Guidance
por: Liu, Zhixuan, et al.
Publicado: (2024)
por: Liu, Zhixuan, et al.
Publicado: (2024)
Theoretical Perspectives on Data Quality and Synergistic Effects in Pre- and Post-Training Reasoning Models
por: Javanmard, Adel, et al.
Publicado: (2026)
por: Javanmard, Adel, et al.
Publicado: (2026)
Dynamic Adversarial Reinforcement Learning for Robust Multimodal Large Language Models
por: Bao, Yicheng, et al.
Publicado: (2026)
por: Bao, Yicheng, et al.
Publicado: (2026)
Reasoning Language Model for Personalized Lung Cancer Screening
por: Niu, Chuang, et al.
Publicado: (2025)
por: Niu, Chuang, et al.
Publicado: (2025)
Understanding Reasoning Ability of Language Models From the Perspective of Reasoning Paths Aggregation
por: Wang, Xinyi, et al.
Publicado: (2024)
por: Wang, Xinyi, et al.
Publicado: (2024)
LEAD: Length-Efficient Adaptive and Dynamic Reasoning for Large Language Models
por: Wei, Songtao, et al.
Publicado: (2026)
por: Wei, Songtao, et al.
Publicado: (2026)
A Hierarchical Language Model For Interpretable Graph Reasoning
por: Khurana, Sambhav, et al.
Publicado: (2024)
por: Khurana, Sambhav, et al.
Publicado: (2024)
Guiding Language Model Reasoning with Planning Tokens
por: Wang, Xinyi, et al.
Publicado: (2023)
por: Wang, Xinyi, et al.
Publicado: (2023)
CALM Before the STORM: Unlocking Native Reasoning for Optimization Modeling
por: Tang, Zhengyang, et al.
Publicado: (2025)
por: Tang, Zhengyang, et al.
Publicado: (2025)
Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning
por: Xi, Zhiheng, et al.
Publicado: (2024)
por: Xi, Zhiheng, et al.
Publicado: (2024)
ADORA: Training Reasoning Models with Dynamic Advantage Estimation on Reinforcement Learning
por: Ren, Qingnan, et al.
Publicado: (2026)
por: Ren, Qingnan, et al.
Publicado: (2026)
DEBATE, TRAIN, EVOLVE: Self Evolution of Language Model Reasoning
por: Srivastava, Gaurav, et al.
Publicado: (2025)
por: Srivastava, Gaurav, et al.
Publicado: (2025)
Ejemplares similares
-
REFLECTOR: Internalizing Step-wise Reflection against Indirect Jailbreak
por: Ma, Jiachen, et al.
Publicado: (2026) -
SafeCoT: Improving VLM Safety with Minimal Reasoning
por: Ma, Jiachen, et al.
Publicado: (2025) -
Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks
por: Xu, Yifei, et al.
Publicado: (2025) -
Can Post-Training Transform LLMs into Causal Reasoners?
por: Chen, Junqi, et al.
Publicado: (2026) -
Entropy-Guided Data-Efficient Training for Multimodal Reasoning Reward Models
por: Yang, Shidong, et al.
Publicado: (2026)