T1: Advancing Language Model Reasoning through Reinforcement Learning and Inference Scaling
Fuente:
arXiv
Guardado en:
| Autores principales: | Hou, Zhenyu, Lv, Xin, Lu, Rui, Zhang, Jiajie, Li, Yujiang, Yao, Zijun, Li, Juanzi, Tang, Jie, Dong, Yuxiao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
TreeRL: LLM Reinforcement Learning with On-Policy Tree Search
por: Hou, Zhenyu, et al.
Publicado: (2025)
por: Hou, Zhenyu, et al.
Publicado: (2025)
Chaining the Evidence: Robust Reinforcement Learning for Deep Search Agents with Citation-Aware Rubric Rewards
por: Zhang, Jiajie, et al.
Publicado: (2026)
por: Zhang, Jiajie, et al.
Publicado: (2026)
Pre-training Distillation for Large Language Models: A Design Space Exploration
por: Peng, Hao, et al.
Publicado: (2024)
por: Peng, Hao, et al.
Publicado: (2024)
LongAlign: A Recipe for Long Context Alignment of Large Language Models
por: Bai, Yushi, et al.
Publicado: (2024)
por: Bai, Yushi, et al.
Publicado: (2024)
LongReward: Improving Long-context Large Language Models with AI Feedback
por: Zhang, Jiajie, et al.
Publicado: (2024)
por: Zhang, Jiajie, et al.
Publicado: (2024)
DeepDive: Advancing Deep Search Agents with Knowledge Graphs and Multi-Turn RL
por: Lu, Rui, et al.
Publicado: (2025)
por: Lu, Rui, et al.
Publicado: (2025)
LongWriter: Unleashing 10,000+ Word Generation from Long Context LLMs
por: Bai, Yushi, et al.
Publicado: (2024)
por: Bai, Yushi, et al.
Publicado: (2024)
Untangle the KNOT: Interweaving Conflicting Knowledge and Reasoning Skills in Large Language Models
por: Liu, Yantao, et al.
Publicado: (2024)
por: Liu, Yantao, et al.
Publicado: (2024)
AtomR: Atomic Operator-Empowered Large Language Models for Heterogeneous Knowledge Reasoning
por: Xin, Amy, et al.
Publicado: (2024)
por: Xin, Amy, et al.
Publicado: (2024)
LongBench v2: Towards Deeper Understanding and Reasoning on Realistic Long-context Multitasks
por: Bai, Yushi, et al.
Publicado: (2024)
por: Bai, Yushi, et al.
Publicado: (2024)
SIRI: Scaling Iterative Reinforcement Learning with Interleaved Compression
por: Wen, Haoming, et al.
Publicado: (2025)
por: Wen, Haoming, et al.
Publicado: (2025)
RM-Bench: Benchmarking Reward Models of Language Models with Subtlety and Style
por: Liu, Yantao, et al.
Publicado: (2024)
por: Liu, Yantao, et al.
Publicado: (2024)
AdaptThink: Reasoning Models Can Learn When to Think
por: Zhang, Jiajie, et al.
Publicado: (2025)
por: Zhang, Jiajie, et al.
Publicado: (2025)
DICE: Detecting In-distribution Contamination in LLM's Fine-tuning Phase for Math Reasoning
por: Tu, Shangqing, et al.
Publicado: (2024)
por: Tu, Shangqing, et al.
Publicado: (2024)
CogCoM: A Visual Language Model with Chain-of-Manipulations Reasoning
por: Qi, Ji, et al.
Publicado: (2024)
por: Qi, Ji, et al.
Publicado: (2024)
Boundary-Guided Policy Optimization for Memory-efficient RL of Diffusion Large Language Models
por: Lin, Nianyi, et al.
Publicado: (2025)
por: Lin, Nianyi, et al.
Publicado: (2025)
LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding
por: Bai, Yushi, et al.
Publicado: (2023)
por: Bai, Yushi, et al.
Publicado: (2023)
PairJudge RM: Perform Best-of-N Sampling with Knockout Tournament
por: Liu, Yantao, et al.
Publicado: (2025)
por: Liu, Yantao, et al.
Publicado: (2025)
Evaluating Generative Language Models in Information Extraction as Subjective Question Correction
por: Fan, Yuchen, et al.
Publicado: (2024)
por: Fan, Yuchen, et al.
Publicado: (2024)
Auxiliary Metrics Help Decoding Skill Neurons in the Wild
por: Zhao, Yixiu, et al.
Publicado: (2025)
por: Zhao, Yixiu, et al.
Publicado: (2025)
LongCite: Enabling LLMs to Generate Fine-grained Citations in Long-context QA
por: Zhang, Jiajie, et al.
Publicado: (2024)
por: Zhang, Jiajie, et al.
Publicado: (2024)
WildReward: Learning Reward Models from In-the-Wild Human Interactions
por: Peng, Hao, et al.
Publicado: (2026)
por: Peng, Hao, et al.
Publicado: (2026)
LLMAEL: Large Language Models are Good Context Augmenters for Entity Linking
por: Xin, Amy, et al.
Publicado: (2024)
por: Xin, Amy, et al.
Publicado: (2024)
SWE-Dev: Building Software Engineering Agents with Training and Inference Scaling
por: Wang, Haoran, et al.
Publicado: (2025)
por: Wang, Haoran, et al.
Publicado: (2025)
LinguaLens: Towards Interpreting Linguistic Mechanisms of Large Language Models via Sparse Auto-Encoder
por: Jing, Yi, et al.
Publicado: (2025)
por: Jing, Yi, et al.
Publicado: (2025)
WebSeer: Training Deeper Search Agents through Reinforcement Learning with Self-Reflection
por: He, Guanzhong, et al.
Publicado: (2025)
por: He, Guanzhong, et al.
Publicado: (2025)
Aligning Teacher with Student Preferences for Tailored Training Data Generation
por: Liu, Yantao, et al.
Publicado: (2024)
por: Liu, Yantao, et al.
Publicado: (2024)
Are Reasoning Models More Prone to Hallucination?
por: Yao, Zijun, et al.
Publicado: (2025)
por: Yao, Zijun, et al.
Publicado: (2025)
KB-Plugin: A Plug-and-play Framework for Large Language Models to Induce Programs over Low-resourced Knowledge Bases
por: Zhang, Jiajie, et al.
Publicado: (2024)
por: Zhang, Jiajie, et al.
Publicado: (2024)
Transferable and Efficient Non-Factual Content Detection via Probe Training with Offline Consistency Checking
por: Zhang, Xiaokang, et al.
Publicado: (2024)
por: Zhang, Xiaokang, et al.
Publicado: (2024)
MM-THEBench: Do Reasoning MLLMs Think Reasonably?
por: Huang, Zhidian, et al.
Publicado: (2026)
por: Huang, Zhidian, et al.
Publicado: (2026)
ReaRAG: Knowledge-guided Reasoning Enhances Factuality of Large Reasoning Models with Iterative Retrieval Augmented Generation
por: Lee, Zhicheng, et al.
Publicado: (2025)
por: Lee, Zhicheng, et al.
Publicado: (2025)
Towards Understanding Safety Alignment: A Mechanistic Perspective from Safety Neurons
por: Chen, Jianhui, et al.
Publicado: (2024)
por: Chen, Jianhui, et al.
Publicado: (2024)
StockBench: Can LLM Agents Trade Stocks Profitably In Real-world Markets?
por: Chen, Yanxu, et al.
Publicado: (2025)
por: Chen, Yanxu, et al.
Publicado: (2025)
Agentic Reward Modeling: Integrating Human Preferences with Verifiable Correctness Signals for Reliable Reward Systems
por: Peng, Hao, et al.
Publicado: (2025)
por: Peng, Hao, et al.
Publicado: (2025)
VerIF: Verification Engineering for Reinforcement Learning in Instruction Following
por: Peng, Hao, et al.
Publicado: (2025)
por: Peng, Hao, et al.
Publicado: (2025)
Reverse That Number! Decoding Order Matters in Arithmetic Learning
por: Zhang-Li, Daniel, et al.
Publicado: (2024)
por: Zhang-Li, Daniel, et al.
Publicado: (2024)
PCL-Reasoner-V1.5: Advancing Math Reasoning with Offline Reinforcement Learning
por: Lu, Yao, et al.
Publicado: (2026)
por: Lu, Yao, et al.
Publicado: (2026)
ScaleDiff: Scaling Difficult Problems for Advanced Mathematical Reasoning
por: Pei, Qizhi, et al.
Publicado: (2025)
por: Pei, Qizhi, et al.
Publicado: (2025)
IndexCache: Accelerating Sparse Attention via Cross-Layer Index Reuse
por: Bai, Yushi, et al.
Publicado: (2026)
por: Bai, Yushi, et al.
Publicado: (2026)
Ejemplares similares
-
TreeRL: LLM Reinforcement Learning with On-Policy Tree Search
por: Hou, Zhenyu, et al.
Publicado: (2025) -
Chaining the Evidence: Robust Reinforcement Learning for Deep Search Agents with Citation-Aware Rubric Rewards
por: Zhang, Jiajie, et al.
Publicado: (2026) -
Pre-training Distillation for Large Language Models: A Design Space Exploration
por: Peng, Hao, et al.
Publicado: (2024) -
LongAlign: A Recipe for Long Context Alignment of Large Language Models
por: Bai, Yushi, et al.
Publicado: (2024) -
LongReward: Improving Long-context Large Language Models with AI Feedback
por: Zhang, Jiajie, et al.
Publicado: (2024)