How Should LLMs Consume High-Quality Data? Optimal Data Scheduling via Quality-Aware Functional Scaling Laws
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhu, Zhitao, Wang, Xili, Wu, Shizhe, Fu, Jiawei, Liu, Xiaoqing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
GneissWeb: Preparing High Quality Data for LLMs at Scale
di: Gohari, Hajar Emami, et al.
Pubblicazione: (2025)
di: Gohari, Hajar Emami, et al.
Pubblicazione: (2025)
How Do Your Code LLMs Perform? Empowering Code Instruction Tuning with High-Quality Data
di: Wang, Yejie, et al.
Pubblicazione: (2024)
di: Wang, Yejie, et al.
Pubblicazione: (2024)
Little Giants: Synthesizing High-Quality Embedding Data at Scale
di: Chen, Haonan, et al.
Pubblicazione: (2024)
di: Chen, Haonan, et al.
Pubblicazione: (2024)
CircuitSeer: Mining High-Quality Data by Probing Mathematical Reasoning Circuits in LLMs
di: Wang, Shaobo, et al.
Pubblicazione: (2025)
di: Wang, Shaobo, et al.
Pubblicazione: (2025)
Lean-ing on Quality: How High-Quality Data Beats Diverse Multilingual Data in AutoFormalization
di: Chan, Willy, et al.
Pubblicazione: (2025)
di: Chan, Willy, et al.
Pubblicazione: (2025)
SmolKalam: Ensemble Quality-Filtered Translation at Scale for High Quality Arabic Post-Training Data
di: Alrashed, Sultan, et al.
Pubblicazione: (2025)
di: Alrashed, Sultan, et al.
Pubblicazione: (2025)
Utility-Aware Data Pricing: Token-Level Quality and Empirical Training Gain for LLMs
di: Xu, Minghui, et al.
Pubblicazione: (2026)
di: Xu, Minghui, et al.
Pubblicazione: (2026)
Scaling Parameter-Constrained Language Models with Quality Data
di: Chang, Ernie, et al.
Pubblicazione: (2024)
di: Chang, Ernie, et al.
Pubblicazione: (2024)
Skywork-SWE: Unveiling Data Scaling Laws for Software Engineering in LLMs
di: Zeng, Liang, et al.
Pubblicazione: (2025)
di: Zeng, Liang, et al.
Pubblicazione: (2025)
Principled Synthetic Data Enables the First Scaling Laws for LLMs in Recommendation
di: Zhang, Benyu, et al.
Pubblicazione: (2026)
di: Zhang, Benyu, et al.
Pubblicazione: (2026)
Data Quality Awareness: A Journey from Traditional Data Management to Data Science Systems
di: Dong, Sijie, et al.
Pubblicazione: (2024)
di: Dong, Sijie, et al.
Pubblicazione: (2024)
Rethinking the Generation of High-Quality CoT Data from the Perspective of LLM-Adaptive Question Difficulty Grading
di: Yu, Qianjin, et al.
Pubblicazione: (2025)
di: Yu, Qianjin, et al.
Pubblicazione: (2025)
Forge: Quality-Aware Reinforcement Learning for NP-Hard Optimization in LLMs
di: Li, Xiaozhe, et al.
Pubblicazione: (2026)
di: Li, Xiaozhe, et al.
Pubblicazione: (2026)
Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs
di: Chen, Zhengyu, et al.
Pubblicazione: (2025)
di: Chen, Zhengyu, et al.
Pubblicazione: (2025)
LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws
di: Mayilvahanan, Prasanna, et al.
Pubblicazione: (2025)
di: Mayilvahanan, Prasanna, et al.
Pubblicazione: (2025)
MetaGAI: A Large-Scale and High-Quality Benchmark for Generative AI Model and Data Card Generation
di: Zhang, Haoxuan, et al.
Pubblicazione: (2026)
di: Zhang, Haoxuan, et al.
Pubblicazione: (2026)
Hierarchical Dataset Selection for High-Quality Data Sharing
di: Zhou, Xiaona, et al.
Pubblicazione: (2025)
di: Zhou, Xiaona, et al.
Pubblicazione: (2025)
Preference Curriculum: LLMs Should Always Be Pretrained on Their Preferred Data
di: Zhang, Xuemiao, et al.
Pubblicazione: (2025)
di: Zhang, Xuemiao, et al.
Pubblicazione: (2025)
Time is Not Compute: Scaling Laws for Wall-Clock Constrained Training on Consumer GPUs
di: Liu, Yi
Pubblicazione: (2026)
di: Liu, Yi
Pubblicazione: (2026)
Q-Probe: Scaling Image Quality Assessment to High Resolution via Context-Aware Agentic Probing
di: Li, Xiang, et al.
Pubblicazione: (2026)
di: Li, Xiang, et al.
Pubblicazione: (2026)
Generating High Quality Synthetic Data for Dutch Medical Conversations
di: Kuan, Cecilia, et al.
Pubblicazione: (2026)
di: Kuan, Cecilia, et al.
Pubblicazione: (2026)
Prosperity before Collapse: How Far Can Off-Policy RL Reach with Stale Data on LLMs?
di: Zheng, Haizhong, et al.
Pubblicazione: (2025)
di: Zheng, Haizhong, et al.
Pubblicazione: (2025)
AutoScale: Scale-Aware Data Mixing for Pre-Training LLMs
di: Kang, Feiyang, et al.
Pubblicazione: (2024)
di: Kang, Feiyang, et al.
Pubblicazione: (2024)
Curriculum Learning with Quality-Driven Data Selection
di: Wu, Biao, et al.
Pubblicazione: (2024)
di: Wu, Biao, et al.
Pubblicazione: (2024)
From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline
di: Li, Tianle, et al.
Pubblicazione: (2024)
di: Li, Tianle, et al.
Pubblicazione: (2024)
Programming Every Example: Lifting Pre-training Data Quality Like Experts at Scale
di: Zhou, Fan, et al.
Pubblicazione: (2024)
di: Zhou, Fan, et al.
Pubblicazione: (2024)
Not Every AI Problem is a Data Problem: We Should Be Intentional About Data Scaling
di: Rodchenko, Tanya, et al.
Pubblicazione: (2025)
di: Rodchenko, Tanya, et al.
Pubblicazione: (2025)
TikZilla: Scaling Text-to-TikZ with High-Quality Data and Reinforcement Learning
di: Greisinger, Christian, et al.
Pubblicazione: (2026)
di: Greisinger, Christian, et al.
Pubblicazione: (2026)
Factorized-Dreamer: Training A High-Quality Video Generator with Limited and Low-Quality Data
di: Yang, Tao, et al.
Pubblicazione: (2024)
di: Yang, Tao, et al.
Pubblicazione: (2024)
Systematic Evaluation of the Quality of Synthetic Clinical Notes Rephrased by LLMs at Million-Note Scale
di: Liu, Jinghui, et al.
Pubblicazione: (2026)
di: Liu, Jinghui, et al.
Pubblicazione: (2026)
Arctic-SnowCoder: Demystifying High-Quality Data in Code Pretraining
di: Wei, Yuxiang, et al.
Pubblicazione: (2024)
di: Wei, Yuxiang, et al.
Pubblicazione: (2024)
Data Quality Antipatterns for Software Analytics
di: Bhatia, Aaditya, et al.
Pubblicazione: (2024)
di: Bhatia, Aaditya, et al.
Pubblicazione: (2024)
QuAIL: Quality-Aware Inertial Learning for Robust Training under Data Corruption
di: Sabella, Mattia, et al.
Pubblicazione: (2026)
di: Sabella, Mattia, et al.
Pubblicazione: (2026)
Beyond Scaling Law: A Data-Efficient Distillation Framework for Reasoning
di: Wu, Xiaojun, et al.
Pubblicazione: (2025)
di: Wu, Xiaojun, et al.
Pubblicazione: (2025)
CoS: Towards Optimal Event Scheduling via Chain-of-Scheduling
di: Zhao, Yiming, et al.
Pubblicazione: (2025)
di: Zhao, Yiming, et al.
Pubblicazione: (2025)
Robustness of Probabilistic Models to Low-Quality Data: A Multi-Perspective Analysis
di: Peng, Liu, et al.
Pubblicazione: (2025)
di: Peng, Liu, et al.
Pubblicazione: (2025)
Scaling Laws of Synthetic Data for Language Models
di: Qin, Zeyu, et al.
Pubblicazione: (2025)
di: Qin, Zeyu, et al.
Pubblicazione: (2025)
How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data
di: Niklaus, Joel, et al.
Pubblicazione: (2026)
di: Niklaus, Joel, et al.
Pubblicazione: (2026)
EquivPruner: Boosting Efficiency and Quality in LLM-Based Search via Action Pruning
di: Liu, Jiawei, et al.
Pubblicazione: (2025)
di: Liu, Jiawei, et al.
Pubblicazione: (2025)
Scaling Laws for Energy Efficiency of Local LLMs
di: Alvarez, Ander, et al.
Pubblicazione: (2025)
di: Alvarez, Ander, et al.
Pubblicazione: (2025)
Documenti analoghi
-
GneissWeb: Preparing High Quality Data for LLMs at Scale
di: Gohari, Hajar Emami, et al.
Pubblicazione: (2025) -
How Do Your Code LLMs Perform? Empowering Code Instruction Tuning with High-Quality Data
di: Wang, Yejie, et al.
Pubblicazione: (2024) -
Little Giants: Synthesizing High-Quality Embedding Data at Scale
di: Chen, Haonan, et al.
Pubblicazione: (2024) -
CircuitSeer: Mining High-Quality Data by Probing Mathematical Reasoning Circuits in LLMs
di: Wang, Shaobo, et al.
Pubblicazione: (2025) -
Lean-ing on Quality: How High-Quality Data Beats Diverse Multilingual Data in AutoFormalization
di: Chan, Willy, et al.
Pubblicazione: (2025)