RegMix: Data Mixture as Regression for Language Model Pre-training
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Liu, Qian, Zheng, Xiaosen, Muennighoff, Niklas, Zeng, Guangtao, Dou, Longxu, Pang, Tianyu, Jiang, Jing, Lin, Min |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Improved Few-Shot Jailbreaking Can Circumvent Aligned Language Models and Their Defenses
von: Zheng, Xiaosen, et al.
Veröffentlicht: (2024)
von: Zheng, Xiaosen, et al.
Veröffentlicht: (2024)
Sailor: Open Language Models for South-East Asia
von: Dou, Longxu, et al.
Veröffentlicht: (2024)
von: Dou, Longxu, et al.
Veröffentlicht: (2024)
Scaling Laws with Vocabulary: Larger Models Deserve Larger Vocabularies
von: Tao, Chaofan, et al.
Veröffentlicht: (2024)
von: Tao, Chaofan, et al.
Veröffentlicht: (2024)
SailCompass: Towards Reproducible and Robust Evaluation for Southeast Asian Languages
von: Guo, Jia, et al.
Veröffentlicht: (2024)
von: Guo, Jia, et al.
Veröffentlicht: (2024)
Cheating Automatic LLM Benchmarks: Null Models Achieve High Win Rates
von: Zheng, Xiaosen, et al.
Veröffentlicht: (2024)
von: Zheng, Xiaosen, et al.
Veröffentlicht: (2024)
RegMix: Adversarial Mutual and Generalization Regularization for Enhancing DNN Robustness
von: Liu, Zhenyu, et al.
Veröffentlicht: (2025)
von: Liu, Zhenyu, et al.
Veröffentlicht: (2025)
Intriguing Properties of Data Attribution on Diffusion Models
von: Zheng, Xiaosen, et al.
Veröffentlicht: (2023)
von: Zheng, Xiaosen, et al.
Veröffentlicht: (2023)
Agent Smith: A Single Image Can Jailbreak One Million Multimodal LLM Agents Exponentially Fast
von: Gu, Xiangming, et al.
Veröffentlicht: (2024)
von: Gu, Xiangming, et al.
Veröffentlicht: (2024)
Training Optimal Large Diffusion Language Models
von: Ni, Jinjie, et al.
Veröffentlicht: (2025)
von: Ni, Jinjie, et al.
Veröffentlicht: (2025)
Topic Over Source: The Key to Effective Data Mixing for Language Models Pre-training
von: Peng, Jiahui, et al.
Veröffentlicht: (2025)
von: Peng, Jiahui, et al.
Veröffentlicht: (2025)
DataMan: Data Manager for Pre-training Large Language Models
von: Peng, Ru, et al.
Veröffentlicht: (2025)
von: Peng, Ru, et al.
Veröffentlicht: (2025)
Nemotron-CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training
von: Diao, Shizhe, et al.
Veröffentlicht: (2025)
von: Diao, Shizhe, et al.
Veröffentlicht: (2025)
Reasoning Does Not Necessarily Improve Role-Playing Ability
von: Feng, Xiachong, et al.
Veröffentlicht: (2025)
von: Feng, Xiachong, et al.
Veröffentlicht: (2025)
Scaling up Masked Diffusion Models on Text
von: Nie, Shen, et al.
Veröffentlicht: (2024)
von: Nie, Shen, et al.
Veröffentlicht: (2024)
A Survey of Table Reasoning with Large Language Models
von: Zhang, Xuanliang, et al.
Veröffentlicht: (2024)
von: Zhang, Xuanliang, et al.
Veröffentlicht: (2024)
Nonparametric Data Attribution for Diffusion Models
von: Zhao, Yutian, et al.
Veröffentlicht: (2025)
von: Zhao, Yutian, et al.
Veröffentlicht: (2025)
Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning
von: Xia, Mengzhou, et al.
Veröffentlicht: (2023)
von: Xia, Mengzhou, et al.
Veröffentlicht: (2023)
Unnatural Languages Are Not Bugs but Features for LLMs
von: Duan, Keyu, et al.
Veröffentlicht: (2025)
von: Duan, Keyu, et al.
Veröffentlicht: (2025)
Metadata Conditioning Accelerates Language Model Pre-training
von: Gao, Tianyu, et al.
Veröffentlicht: (2025)
von: Gao, Tianyu, et al.
Veröffentlicht: (2025)
Masked Structural Growth for 2x Faster Language Model Pre-training
von: Yao, Yiqun, et al.
Veröffentlicht: (2023)
von: Yao, Yiqun, et al.
Veröffentlicht: (2023)
TiMix: Text-aware Image Mixing for Effective Vision-Language Pre-training
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)
OPUS: Towards Efficient and Principled Data Selection in Large Language Model Pre-training in Every Iteration
von: Wang, Shaobo, et al.
Veröffentlicht: (2026)
von: Wang, Shaobo, et al.
Veröffentlicht: (2026)
AfriqueLLM: How Data Mixing and Model Architecture Impact Continued Pre-training for African Languages
von: Yu, Hao, et al.
Veröffentlicht: (2026)
von: Yu, Hao, et al.
Veröffentlicht: (2026)
SampleMix: A Sample-wise Pre-training Data Mixing Strategey by Coordinating Data Quality and Diversity
von: Xi, Xiangyu, et al.
Veröffentlicht: (2025)
von: Xi, Xiangyu, et al.
Veröffentlicht: (2025)
Lory: Fully Differentiable Mixture-of-Experts for Autoregressive Language Model Pre-training
von: Zhong, Zexuan, et al.
Veröffentlicht: (2024)
von: Zhong, Zexuan, et al.
Veröffentlicht: (2024)
Investigating Data Contamination for Pre-training Language Models
von: Jiang, Minhao, et al.
Veröffentlicht: (2024)
von: Jiang, Minhao, et al.
Veröffentlicht: (2024)
Diffusion Language Models are Super Data Learners
von: Ni, Jinjie, et al.
Veröffentlicht: (2025)
von: Ni, Jinjie, et al.
Veröffentlicht: (2025)
Improving Demonstration Diversity by Human-Free Fusing for Text-to-SQL
von: Wang, Dingzirui, et al.
Veröffentlicht: (2024)
von: Wang, Dingzirui, et al.
Veröffentlicht: (2024)
Enhancing Numerical Reasoning with the Guidance of Reliable Reasoning Processes
von: Wang, Dingzirui, et al.
Veröffentlicht: (2024)
von: Wang, Dingzirui, et al.
Veröffentlicht: (2024)
DAC: Decomposed Automation Correction for Text-to-SQL
von: Wang, Dingzirui, et al.
Veröffentlicht: (2024)
von: Wang, Dingzirui, et al.
Veröffentlicht: (2024)
MURRE: Multi-Hop Table Retrieval with Removal for Open-Domain Text-to-SQL
von: Zhang, Xuanliang, et al.
Veröffentlicht: (2024)
von: Zhang, Xuanliang, et al.
Veröffentlicht: (2024)
Inside the Black Box: Detecting Data Leakage in Pre-trained Language Encoders
von: Xin, Yuan, et al.
Veröffentlicht: (2024)
von: Xin, Yuan, et al.
Veröffentlicht: (2024)
Scaling Speech-Text Pre-training with Synthetic Interleaved Data
von: Zeng, Aohan, et al.
Veröffentlicht: (2024)
von: Zeng, Aohan, et al.
Veröffentlicht: (2024)
ParaPO: Aligning Language Models to Reduce Verbatim Reproduction of Pre-training Data
von: Chen, Tong, et al.
Veröffentlicht: (2025)
von: Chen, Tong, et al.
Veröffentlicht: (2025)
A Comparative Study of Pre-training and Self-training
von: Wang, Yiheng, et al.
Veröffentlicht: (2024)
von: Wang, Yiheng, et al.
Veröffentlicht: (2024)
Probing Language Models for Pre-training Data Detection
von: Liu, Zhenhua, et al.
Veröffentlicht: (2024)
von: Liu, Zhenhua, et al.
Veröffentlicht: (2024)
Stable Language Model Pre-training by Reducing Embedding Variability
von: Chung, Woojin, et al.
Veröffentlicht: (2024)
von: Chung, Woojin, et al.
Veröffentlicht: (2024)
Towards Effective and Efficient Continual Pre-training of Large Language Models
von: Chen, Jie, et al.
Veröffentlicht: (2024)
von: Chen, Jie, et al.
Veröffentlicht: (2024)
The Scandinavian Embedding Benchmarks: Comprehensive Assessment of Multilingual and Monolingual Text Embedding
von: Enevoldsen, Kenneth, et al.
Veröffentlicht: (2024)
von: Enevoldsen, Kenneth, et al.
Veröffentlicht: (2024)
Meta-rater: A Multi-dimensional Data Selection Method for Pre-training Language Models
von: Zhuang, Xinlin, et al.
Veröffentlicht: (2025)
von: Zhuang, Xinlin, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Improved Few-Shot Jailbreaking Can Circumvent Aligned Language Models and Their Defenses
von: Zheng, Xiaosen, et al.
Veröffentlicht: (2024) -
Sailor: Open Language Models for South-East Asia
von: Dou, Longxu, et al.
Veröffentlicht: (2024) -
Scaling Laws with Vocabulary: Larger Models Deserve Larger Vocabularies
von: Tao, Chaofan, et al.
Veröffentlicht: (2024) -
SailCompass: Towards Reproducible and Robust Evaluation for Southeast Asian Languages
von: Guo, Jia, et al.
Veröffentlicht: (2024) -
Cheating Automatic LLM Benchmarks: Null Models Achieve High Win Rates
von: Zheng, Xiaosen, et al.
Veröffentlicht: (2024)