Improving Data and Reward Design for Scientific Reasoning in Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Chen, Zijie, Lin, Zhenghao, Liu, Xiao, Lan, Zhenzhong, Gong, Yeyun, Cheng, Peng |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Ensembling Large Language Models with Process Reward-Guided Tree Search for Better Complex Reasoning
von: Park, Sungjin, et al.
Veröffentlicht: (2024)
von: Park, Sungjin, et al.
Veröffentlicht: (2024)
Beyond Length: Quantifying Long-Range Information for Long-Context LLM Pretraining Data
von: Deng, Haoran, et al.
Veröffentlicht: (2025)
von: Deng, Haoran, et al.
Veröffentlicht: (2025)
Process-based Self-Rewarding Language Models
von: Zhang, Shimao, et al.
Veröffentlicht: (2025)
von: Zhang, Shimao, et al.
Veröffentlicht: (2025)
Enhancing Large Language Model Performance with Gradient-Based Parameter Selection
von: Li, Haoling, et al.
Veröffentlicht: (2024)
von: Li, Haoling, et al.
Veröffentlicht: (2024)
Learning from the Best, Differently: A Diversity-Driven Rethinking on Data Selection
von: He, Hongyi, et al.
Veröffentlicht: (2025)
von: He, Hongyi, et al.
Veröffentlicht: (2025)
AnnoLLM: Making Large Language Models to Be Better Crowdsourced Annotators
von: He, Xingwei, et al.
Veröffentlicht: (2023)
von: He, Xingwei, et al.
Veröffentlicht: (2023)
Optimizing Large Language Model Training Using FP4 Quantization
von: Wang, Ruizhe, et al.
Veröffentlicht: (2025)
von: Wang, Ruizhe, et al.
Veröffentlicht: (2025)
LayerNorm Induces Recency Bias in Transformer Decoders
von: Kim, Junu, et al.
Veröffentlicht: (2025)
von: Kim, Junu, et al.
Veröffentlicht: (2025)
Overcoming Vocabulary Mismatch: Vocabulary-agnostic Teacher Guided Language Modeling
von: Shin, Haebin, et al.
Veröffentlicht: (2025)
von: Shin, Haebin, et al.
Veröffentlicht: (2025)
Think-on-Graph: Deep and Responsible Reasoning of Large Language Model on Knowledge Graph
von: Sun, Jiashuo, et al.
Veröffentlicht: (2023)
von: Sun, Jiashuo, et al.
Veröffentlicht: (2023)
Improving Phishing Email Detection Performance of Small Large Language Models
von: Lin, Zijie, et al.
Veröffentlicht: (2025)
von: Lin, Zijie, et al.
Veröffentlicht: (2025)
DND: Boosting Large Language Models with Dynamic Nested Depth
von: Chen, Tieyuan, et al.
Veröffentlicht: (2025)
von: Chen, Tieyuan, et al.
Veröffentlicht: (2025)
Key-Point-Driven Data Synthesis with its Enhancement on Mathematical Reasoning
von: Huang, Yiming, et al.
Veröffentlicht: (2024)
von: Huang, Yiming, et al.
Veröffentlicht: (2024)
FinLMM-R1: Enhancing Financial Reasoning in LMM through Scalable Data and Reward Design
von: Lan, Kai, et al.
Veröffentlicht: (2025)
von: Lan, Kai, et al.
Veröffentlicht: (2025)
Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey
von: Liu, Qiyuan, et al.
Veröffentlicht: (2025)
von: Liu, Qiyuan, et al.
Veröffentlicht: (2025)
Enhancing Chain-of-Thoughts Prompting with Iterative Bootstrapping in Large Language Models
von: Sun, Jiashuo, et al.
Veröffentlicht: (2023)
von: Sun, Jiashuo, et al.
Veröffentlicht: (2023)
QUBE: Enhancing Automatic Heuristic Design via Quality-Uncertainty Balanced Evolution
von: Chen, Zijie, et al.
Veröffentlicht: (2024)
von: Chen, Zijie, et al.
Veröffentlicht: (2024)
Exploring the Mystery of Influential Data for Mathematical Reasoning
von: Ni, Xinzhe, et al.
Veröffentlicht: (2024)
von: Ni, Xinzhe, et al.
Veröffentlicht: (2024)
Ensuring Safe and High-Quality Outputs: A Guideline Library Approach for Language Models
von: Luo, Yi, et al.
Veröffentlicht: (2024)
von: Luo, Yi, et al.
Veröffentlicht: (2024)
Training LLMs for Divide-and-Conquer Reasoning Elevates Test-Time Scalability
von: Liang, Xiao, et al.
Veröffentlicht: (2026)
von: Liang, Xiao, et al.
Veröffentlicht: (2026)
DeepThink: Aligning Language Models with Domain-Specific User Intents
von: Li, Yang, et al.
Veröffentlicht: (2025)
von: Li, Yang, et al.
Veröffentlicht: (2025)
Velocitune: A Velocity-based Dynamic Domain Reweighting Method for Continual Pre-training
von: Luo, Zheheng, et al.
Veröffentlicht: (2024)
von: Luo, Zheheng, et al.
Veröffentlicht: (2024)
Do Large Language Models Truly Grasp Addition? A Rule-Focused Diagnostic Using Two-Integer Arithmetic
von: Yan, Yang, et al.
Veröffentlicht: (2025)
von: Yan, Yang, et al.
Veröffentlicht: (2025)
HiCaM: A Hierarchical-Causal Modification Framework for Long-Form Text Modification
von: Shi, Yuntao, et al.
Veröffentlicht: (2025)
von: Shi, Yuntao, et al.
Veröffentlicht: (2025)
Dynamics of Instruction Fine-Tuning for Chinese Large Language Models
von: Song, Chiyu, et al.
Veröffentlicht: (2023)
von: Song, Chiyu, et al.
Veröffentlicht: (2023)
RECAP: Resistance Capture in Text-based Mental Health Counseling with Large Language Models
von: Li, Anqi, et al.
Veröffentlicht: (2026)
von: Li, Anqi, et al.
Veröffentlicht: (2026)
APOLLO: An Optimized Training Approach for Long-form Numerical Reasoning
von: Sun, Jiashuo, et al.
Veröffentlicht: (2022)
von: Sun, Jiashuo, et al.
Veröffentlicht: (2022)
CreditDecoding: Accelerating Parallel Decoding in Diffusion Large Language Models with Trace Credit
von: Wang, Kangyu, et al.
Veröffentlicht: (2025)
von: Wang, Kangyu, et al.
Veröffentlicht: (2025)
Facilitating Pornographic Text Detection for Open-Domain Dialogue Systems via Knowledge Distillation of Large Language Models
von: Qiu, Huachuan, et al.
Veröffentlicht: (2024)
von: Qiu, Huachuan, et al.
Veröffentlicht: (2024)
CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing
von: Gou, Zhibin, et al.
Veröffentlicht: (2023)
von: Gou, Zhibin, et al.
Veröffentlicht: (2023)
Scientific Knowledge-driven Decoding Constraints Improving the Reliability of LLMs
von: Ma, Maotian, et al.
Veröffentlicht: (2026)
von: Ma, Maotian, et al.
Veröffentlicht: (2026)
LogiNumSynth: Synthesizing Joint Logical-Numerical Reasoning Problems for Language Models
von: Liu, Yiwei, et al.
Veröffentlicht: (2025)
von: Liu, Yiwei, et al.
Veröffentlicht: (2025)
Information Re-Organization Improves Reasoning in Large Language Models
von: Cheng, Xiaoxia, et al.
Veröffentlicht: (2024)
von: Cheng, Xiaoxia, et al.
Veröffentlicht: (2024)
MoRI: Learning Motivation-Grounded Reasoning for Scientific Ideation in Large Language Models
von: Gu, Chenyang, et al.
Veröffentlicht: (2026)
von: Gu, Chenyang, et al.
Veröffentlicht: (2026)
AWPO: Enhancing Tool-Use of Large Language Models through Adaptive Integration of Reasoning Rewards
von: Lin, Zihan, et al.
Veröffentlicht: (2025)
von: Lin, Zihan, et al.
Veröffentlicht: (2025)
Breaking the Data Barrier -- Building GUI Agents Through Task Generalization
von: Zhang, Junlei, et al.
Veröffentlicht: (2025)
von: Zhang, Junlei, et al.
Veröffentlicht: (2025)
Judge as A Judge: Improving the Evaluation of Retrieval-Augmented Generation through the Judge-Consistency of Large Language Models
von: Liu, Shuliang, et al.
Veröffentlicht: (2025)
von: Liu, Shuliang, et al.
Veröffentlicht: (2025)
Data Mixing Agent: Learning to Re-weight Domains for Continual Pre-training
von: Yang, Kailai, et al.
Veröffentlicht: (2025)
von: Yang, Kailai, et al.
Veröffentlicht: (2025)
Competition-Level Problems are Effective LLM Evaluators
von: Huang, Yiming, et al.
Veröffentlicht: (2023)
von: Huang, Yiming, et al.
Veröffentlicht: (2023)
Rho-1: Not All Tokens Are What You Need
von: Lin, Zhenghao, et al.
Veröffentlicht: (2024)
von: Lin, Zhenghao, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Ensembling Large Language Models with Process Reward-Guided Tree Search for Better Complex Reasoning
von: Park, Sungjin, et al.
Veröffentlicht: (2024) -
Beyond Length: Quantifying Long-Range Information for Long-Context LLM Pretraining Data
von: Deng, Haoran, et al.
Veröffentlicht: (2025) -
Process-based Self-Rewarding Language Models
von: Zhang, Shimao, et al.
Veröffentlicht: (2025) -
Enhancing Large Language Model Performance with Gradient-Based Parameter Selection
von: Li, Haoling, et al.
Veröffentlicht: (2024) -
Learning from the Best, Differently: A Diversity-Driven Rethinking on Data Selection
von: He, Hongyi, et al.
Veröffentlicht: (2025)