CodePMP: Scalable Preference Model Pretraining for Large Language Model Reasoning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Yu, Huimu, Wu, Xing, Xu, Haotian, Zhang, Debing, Hu, Songlin |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions
von: Gao, Chaochen, et al.
Veröffentlicht: (2025)
von: Gao, Chaochen, et al.
Veröffentlicht: (2025)
NExtLong: Toward Effective Long-Context Training without Long Documents
von: Gao, Chaochen, et al.
Veröffentlicht: (2025)
von: Gao, Chaochen, et al.
Veröffentlicht: (2025)
Quest: Query-centric Data Synthesis Approach for Long-context Scaling of Large Language Model
von: Gao, Chaochen, et al.
Veröffentlicht: (2024)
von: Gao, Chaochen, et al.
Veröffentlicht: (2024)
LongBench Pro: A More Realistic and Comprehensive Bilingual Long-Context Evaluation Benchmark
von: Chen, Ziyang, et al.
Veröffentlicht: (2026)
von: Chen, Ziyang, et al.
Veröffentlicht: (2026)
EntropyLong: Effective Long-Context Training via Predictive Uncertainty
von: Jia, Junlong, et al.
Veröffentlicht: (2025)
von: Jia, Junlong, et al.
Veröffentlicht: (2025)
CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models
von: Liu, Guang, et al.
Veröffentlicht: (2025)
von: Liu, Guang, et al.
Veröffentlicht: (2025)
Aligning Large Language Models with Searcher Preferences
von: Wu, Wei, et al.
Veröffentlicht: (2026)
von: Wu, Wei, et al.
Veröffentlicht: (2026)
Disentangling Reasoning and Knowledge in Medical Large Language Models
von: Thapa, Rahul, et al.
Veröffentlicht: (2025)
von: Thapa, Rahul, et al.
Veröffentlicht: (2025)
MedAdapter: Efficient Test-Time Adaptation of Large Language Models towards Medical Reasoning
von: Shi, Wenqi, et al.
Veröffentlicht: (2024)
von: Shi, Wenqi, et al.
Veröffentlicht: (2024)
Coupled Variational Reinforcement Learning for Language Model General Reasoning
von: Wen, Xueru, et al.
Veröffentlicht: (2025)
von: Wen, Xueru, et al.
Veröffentlicht: (2025)
Libra: Large Chinese-based Safeguard for AI Content
von: Chen, Ziyang, et al.
Veröffentlicht: (2025)
von: Chen, Ziyang, et al.
Veröffentlicht: (2025)
To Think or Not To Think, That is The Question for Large Reasoning Models in Theory of Mind Tasks
von: Gong, Nanxu, et al.
Veröffentlicht: (2026)
von: Gong, Nanxu, et al.
Veröffentlicht: (2026)
DynaCode: A Dynamic Complexity-Aware Code Benchmark for Evaluating Large Language Models in Code Generation
von: Hu, Wenhao, et al.
Veröffentlicht: (2025)
von: Hu, Wenhao, et al.
Veröffentlicht: (2025)
EHRAgent: Code Empowers Large Language Models for Few-shot Complex Tabular Reasoning on Electronic Health Records
von: Shi, Wenqi, et al.
Veröffentlicht: (2024)
von: Shi, Wenqi, et al.
Veröffentlicht: (2024)
Large Language Models Could Be Rote Learners
von: Xu, Yuyang, et al.
Veröffentlicht: (2025)
von: Xu, Yuyang, et al.
Veröffentlicht: (2025)
Code-driven Number Sequence Calculation: Enhancing the inductive Reasoning Abilities of Large Language Models
von: Chen, Kedi, et al.
Veröffentlicht: (2025)
von: Chen, Kedi, et al.
Veröffentlicht: (2025)
Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models
von: Xu, Fengli, et al.
Veröffentlicht: (2025)
von: Xu, Fengli, et al.
Veröffentlicht: (2025)
A Survey on Large Language Models for Mathematical Reasoning
von: Wang, Peng-Yuan, et al.
Veröffentlicht: (2025)
von: Wang, Peng-Yuan, et al.
Veröffentlicht: (2025)
TimeBench: A Comprehensive Evaluation of Temporal Reasoning Abilities in Large Language Models
von: Chu, Zheng, et al.
Veröffentlicht: (2023)
von: Chu, Zheng, et al.
Veröffentlicht: (2023)
Fine-Grained Behavior Simulation with Role-Playing Large Language Model on Social Media
von: Li, Kun, et al.
Veröffentlicht: (2024)
von: Li, Kun, et al.
Veröffentlicht: (2024)
Code Pretraining Improves Entity Tracking Abilities of Language Models
von: Kim, Najoung, et al.
Veröffentlicht: (2024)
von: Kim, Najoung, et al.
Veröffentlicht: (2024)
PediaMind-R1: A Temperament-Aware Language Model for Personalized Early Childhood Care Reasoning via Cognitive Modeling and Preference Alignment
von: Zhang, Zihe, et al.
Veröffentlicht: (2025)
von: Zhang, Zihe, et al.
Veröffentlicht: (2025)
Mixture of Reasonings: Teach Large Language Models to Reason with Adaptive Strategies
von: Xiong, Tao, et al.
Veröffentlicht: (2025)
von: Xiong, Tao, et al.
Veröffentlicht: (2025)
Parrot Mind: Towards Explaining the Complex Task Reasoning of Pretrained Large Language Models with Template-Content Structure
von: Yang, Haotong, et al.
Veröffentlicht: (2023)
von: Yang, Haotong, et al.
Veröffentlicht: (2023)
Improving Attributed Text Generation of Large Language Models via Preference Learning
von: Li, Dongfang, et al.
Veröffentlicht: (2024)
von: Li, Dongfang, et al.
Veröffentlicht: (2024)
Who Reasons in the Large Language Models?
von: Shao, Jie, et al.
Veröffentlicht: (2025)
von: Shao, Jie, et al.
Veröffentlicht: (2025)
Reversal of Thought: Enhancing Large Language Models with Preference-Guided Reverse Reasoning Warm-up
von: Yuan, Jiahao, et al.
Veröffentlicht: (2024)
von: Yuan, Jiahao, et al.
Veröffentlicht: (2024)
AgentAlign: Navigating Safety Alignment in the Shift from Informative to Agentic Large Language Models
von: Zhang, Jinchuan, et al.
Veröffentlicht: (2025)
von: Zhang, Jinchuan, et al.
Veröffentlicht: (2025)
CodeMind: Evaluating Large Language Models for Code Reasoning
von: Liu, Changshu, et al.
Veröffentlicht: (2024)
von: Liu, Changshu, et al.
Veröffentlicht: (2024)
Pandora: A Code-Driven Large Language Model Agent for Unified Reasoning Across Diverse Structured Knowledge
von: Chen, Yongrui, et al.
Veröffentlicht: (2025)
von: Chen, Yongrui, et al.
Veröffentlicht: (2025)
LLM Reasoners: New Evaluation, Library, and Analysis of Step-by-Step Reasoning with Large Language Models
von: Hao, Shibo, et al.
Veröffentlicht: (2024)
von: Hao, Shibo, et al.
Veröffentlicht: (2024)
MASS: Mathematical Data Selection via Skill Graphs for Pretraining Large Language Models
von: Li, Jiazheng, et al.
Veröffentlicht: (2025)
von: Li, Jiazheng, et al.
Veröffentlicht: (2025)
Preference Curriculum: LLMs Should Always Be Pretrained on Their Preferred Data
von: Zhang, Xuemiao, et al.
Veröffentlicht: (2025)
von: Zhang, Xuemiao, et al.
Veröffentlicht: (2025)
Can Large Language Models do Analytical Reasoning?
von: Hu, Yebowen, et al.
Veröffentlicht: (2024)
von: Hu, Yebowen, et al.
Veröffentlicht: (2024)
MiMo: Unlocking the Reasoning Potential of Language Model -- From Pretraining to Posttraining
von: Xiaomi, LLM-Core, et al.
Veröffentlicht: (2025)
von: Xiaomi, LLM-Core, et al.
Veröffentlicht: (2025)
Large Language Models as Code Executors: An Exploratory Study
von: Lyu, Chenyang, et al.
Veröffentlicht: (2024)
von: Lyu, Chenyang, et al.
Veröffentlicht: (2024)
Weights-Rotated Preference Optimization for Large Language Models
von: Yang, Chenxu, et al.
Veröffentlicht: (2025)
von: Yang, Chenxu, et al.
Veröffentlicht: (2025)
Preference Packing: Efficient Preference Optimization for Large Language Models
von: Cho, Jaekyung
Veröffentlicht: (2026)
von: Cho, Jaekyung
Veröffentlicht: (2026)
Untie the Knots: An Efficient Data Augmentation Strategy for Long-Context Pre-Training in Language Models
von: Tian, Junfeng, et al.
Veröffentlicht: (2024)
von: Tian, Junfeng, et al.
Veröffentlicht: (2024)
Reasoning Factual Knowledge in Structured Data with Large Language Models
von: Huang, Sirui, et al.
Veröffentlicht: (2024)
von: Huang, Sirui, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions
von: Gao, Chaochen, et al.
Veröffentlicht: (2025) -
NExtLong: Toward Effective Long-Context Training without Long Documents
von: Gao, Chaochen, et al.
Veröffentlicht: (2025) -
Quest: Query-centric Data Synthesis Approach for Long-context Scaling of Large Language Model
von: Gao, Chaochen, et al.
Veröffentlicht: (2024) -
LongBench Pro: A More Realistic and Comprehensive Bilingual Long-Context Evaluation Benchmark
von: Chen, Ziyang, et al.
Veröffentlicht: (2026) -
EntropyLong: Effective Long-Context Training via Predictive Uncertainty
von: Jia, Junlong, et al.
Veröffentlicht: (2025)