Data Value in the Age of Scaling: Understanding LLM Scaling Dynamics Under Real-Synthetic Data Mixtures
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Haohui, Qi, Jingyuan, Chen, Jianpeng, Wu, Jun, Huang, Lifu, Zheng, Lecheng, Choi, Kevin, Veeramani, Balaji, Bowen, Edward, Hu, Alison, Cody, Tyler, Zhou, Dawei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
EvoluNet: Advancing Dynamic Non-IID Transfer Learning on Graphs
par: Wang, Haohui, et autres
Publié: (2023)
par: Wang, Haohui, et autres
Publié: (2023)
LENSLLM: Unveiling Fine-Tuning Dynamics for LLM Selection
par: Zeng, Xinyue, et autres
Publié: (2025)
par: Zeng, Xinyue, et autres
Publié: (2025)
MetamatBench: Integrating Heterogeneous Data, Computational Tools, and Visual Interface for Metamaterial Discovery
par: Chen, Jianpeng, et autres
Publié: (2025)
par: Chen, Jianpeng, et autres
Publié: (2025)
Scaling Laws for Mixture Pretraining Under Data Constraints
par: Sedova, Anastasiia, et autres
Publié: (2026)
par: Sedova, Anastasiia, et autres
Publié: (2026)
Towards Heterogeneous Long-tailed Learning: Benchmarking, Metrics, and Toolbox
par: Wang, Haohui, et autres
Publié: (2023)
par: Wang, Haohui, et autres
Publié: (2023)
Indiaʼs Integration Into Global Value Chains: Policy Approaches to Growth and Industrial Upgrading
par: Veeramani Choorikkadan
Publié: (2026)
par: Veeramani Choorikkadan
Publié: (2026)
A Framework for Assessing the Value of RFID Implementation by Tier-One Suppliers to Major Retailers
par: Dharmaraj Veeramani
Publié: (2008)
par: Dharmaraj Veeramani
Publié: (2008)
Principled Synthetic Data Enables the First Scaling Laws for LLMs in Recommendation
par: Zhang, Benyu, et autres
Publié: (2026)
par: Zhang, Benyu, et autres
Publié: (2026)
Beyond Real Data: Synthetic Data through the Lens of Regularization
par: Shidani, Amitis, et autres
Publié: (2025)
par: Shidani, Amitis, et autres
Publié: (2025)
Scaling Tumor Segmentation: Best Lessons from Real and Synthetic Data
par: Chen, Qi, et autres
Publié: (2025)
par: Chen, Qi, et autres
Publié: (2025)
Scaling Laws for Optimal Data Mixtures
par: Shukor, Mustafa, et autres
Publié: (2025)
par: Shukor, Mustafa, et autres
Publié: (2025)
A Large-Scale Real-World Evaluation of LLM-Based Virtual Teaching Assistant
par: Kweon, Sunjun, et autres
Publié: (2025)
par: Kweon, Sunjun, et autres
Publié: (2025)
MoNDE: Mixture of Near-Data Experts for Large-Scale Sparse Models
par: Kim, Taehyun, et autres
Publié: (2024)
par: Kim, Taehyun, et autres
Publié: (2024)
Realistic Synthetic Household Data Generation at Scale
par: Singh, Siddharth, et autres
Publié: (2026)
par: Singh, Siddharth, et autres
Publié: (2026)
Scaling Laws of Synthetic Data for Language Models
par: Qin, Zeyu, et autres
Publié: (2025)
par: Qin, Zeyu, et autres
Publié: (2025)
Scaling Up Forest Vision with Synthetic Data
par: She, Yihang, et autres
Publié: (2025)
par: She, Yihang, et autres
Publié: (2025)
Patient-Zero: Scaling Synthetic Patient Agents to Real-World Distributions without Real Patient Data
par: Lai, Yunghwei, et autres
Publié: (2025)
par: Lai, Yunghwei, et autres
Publié: (2025)
DKT2: Revisiting Applicable and Comprehensive Knowledge Tracing in Large-Scale Data
par: Zhou, Yiyun, et autres
Publié: (2025)
par: Zhou, Yiyun, et autres
Publié: (2025)
RL on Incorrect Synthetic Data Scales the Efficiency of LLM Math Reasoning by Eight-Fold
par: Setlur, Amrith, et autres
Publié: (2024)
par: Setlur, Amrith, et autres
Publié: (2024)
Balancing Learning Rates Across Layers: Exact Two-Step Dynamics and Optimal Scaling in Linear Neural Networks
par: Pang, Tianyu, et autres
Publié: (2026)
par: Pang, Tianyu, et autres
Publié: (2026)
Scaling Text-Rich Image Understanding via Code-Guided Synthetic Multimodal Data Generation
par: Yang, Yue, et autres
Publié: (2025)
par: Yang, Yue, et autres
Publié: (2025)
Closed Loop Dynamic Driving Data Mixture for Real-Synthetic Co-Training
par: Ruan, Hongzhi, et autres
Publié: (2026)
par: Ruan, Hongzhi, et autres
Publié: (2026)
Characterizing Model Behavior Under Synthetic Data Training: An Empirical Study Across Scales and Mixing Ratios
par: Du, Y., et autres
Publié: (2025)
par: Du, Y., et autres
Publié: (2025)
Improving the Scaling Laws of Synthetic Data with Deliberate Practice
par: Askari-Hemmat, Reyhane, et autres
Publié: (2025)
par: Askari-Hemmat, Reyhane, et autres
Publié: (2025)
Synthetica: Large Scale Synthetic Data for Robot Perception
par: Singh, Ritvik, et autres
Publié: (2024)
par: Singh, Ritvik, et autres
Publié: (2024)
Scaling Trends for Data Poisoning in LLMs
par: Bowen, Dillon, et autres
Publié: (2024)
par: Bowen, Dillon, et autres
Publié: (2024)
BeyondWeb: Lessons from Scaling Synthetic Data for Trillion-scale Pretraining
par: DatologyAI, et autres
Publié: (2025)
par: DatologyAI, et autres
Publié: (2025)
SynPlay: Large-Scale Synthetic Human Data with Real-World Diversity for Aerial-View Perception
par: Yim, Jinsub, et autres
Publié: (2024)
par: Yim, Jinsub, et autres
Publié: (2024)
Understanding LLM Behaviors via Compression: Data Generation, Knowledge Acquisition and Scaling Laws
par: Pan, Zhixuan, et autres
Publié: (2025)
par: Pan, Zhixuan, et autres
Publié: (2025)
Multilingual Multi-Label Emotion Classification at Scale with Synthetic Data
par: Borisov, Vadim
Publié: (2026)
par: Borisov, Vadim
Publié: (2026)
Scaling Speech-Text Pre-training with Synthetic Interleaved Data
par: Zeng, Aohan, et autres
Publié: (2024)
par: Zeng, Aohan, et autres
Publié: (2024)
Scaling Planning for Automated Driving using Simplistic Synthetic Data
par: Stoll, Martin, et autres
Publié: (2023)
par: Stoll, Martin, et autres
Publié: (2023)
Demystifying Synthetic Data in LLM Pre-training: A Systematic Study of Scaling Laws, Benefits, and Pitfalls
par: Kang, Feiyang, et autres
Publié: (2025)
par: Kang, Feiyang, et autres
Publié: (2025)
DALDA: Data Augmentation Leveraging Diffusion Model and LLM with Adaptive Guidance Scaling
par: Jung, Kyuheon, et autres
Publié: (2024)
par: Jung, Kyuheon, et autres
Publié: (2024)
Addressing Bias in Spoken Language Systems Used in the Development and Implementation of Automated Child Language‐Based Assessment
par: Alison L. Bailey, et autres
Publié: (2025)
par: Alison L. Bailey, et autres
Publié: (2025)
Citations and Trust in LLM Generated Responses
par: Ding, Yifan, et autres
Publié: (2025)
par: Ding, Yifan, et autres
Publié: (2025)
Triply Laplacian Scale Mixture Modeling for Seismic Data Noise Suppression
par: Pan, Sirui, et autres
Publié: (2025)
par: Pan, Sirui, et autres
Publié: (2025)
Re-Mix: Optimizing Data Mixtures for Large Scale Imitation Learning
par: Hejna, Joey, et autres
Publié: (2024)
par: Hejna, Joey, et autres
Publié: (2024)
Large-Scale Multiple Testing of Composite Null Hypotheses Under Heteroskedasticity
par: Gang, Bowen, et autres
Publié: (2023)
par: Gang, Bowen, et autres
Publié: (2023)
On Data Engineering for Scaling LLM Terminal Capabilities
par: Pi, Renjie, et autres
Publié: (2026)
par: Pi, Renjie, et autres
Publié: (2026)
Documents similaires
-
EvoluNet: Advancing Dynamic Non-IID Transfer Learning on Graphs
par: Wang, Haohui, et autres
Publié: (2023) -
LENSLLM: Unveiling Fine-Tuning Dynamics for LLM Selection
par: Zeng, Xinyue, et autres
Publié: (2025) -
MetamatBench: Integrating Heterogeneous Data, Computational Tools, and Visual Interface for Metamaterial Discovery
par: Chen, Jianpeng, et autres
Publié: (2025) -
Scaling Laws for Mixture Pretraining Under Data Constraints
par: Sedova, Anastasiia, et autres
Publié: (2026) -
Towards Heterogeneous Long-tailed Learning: Benchmarking, Metrics, and Toolbox
par: Wang, Haohui, et autres
Publié: (2023)