Training Data for Large Language Model
Fuente:
arXiv
Saved in:
| Main Authors: | Ju, Yiming, Ma, Huanhuan |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
DataDignity: Training Data Attribution for Large Language Models
by: Li, Xiaomin, et al.
Published: (2026)
by: Li, Xiaomin, et al.
Published: (2026)
KLoB: a Benchmark for Assessing Knowledge Locating Methods in Language Models
by: Ju, Yiming, et al.
Published: (2023)
by: Ju, Yiming, et al.
Published: (2023)
Integrating Large Language Model for Improved Causal Discovery
by: Ban, Taiyu, et al.
Published: (2023)
by: Ban, Taiyu, et al.
Published: (2023)
Provable Training Data Identification for Large Language Models
by: Liu, Zhenlong, et al.
Published: (2025)
by: Liu, Zhenlong, et al.
Published: (2025)
Evolving Subnetwork Training for Large Language Models
by: Li, Hanqi, et al.
Published: (2024)
by: Li, Hanqi, et al.
Published: (2024)
Conda: Column-Normalized Adam for Training Large Language Models Faster
by: Wang, Junjie, et al.
Published: (2025)
by: Wang, Junjie, et al.
Published: (2025)
Data Management For Training Large Language Models: A Survey
by: Wang, Zige, et al.
Published: (2023)
by: Wang, Zige, et al.
Published: (2023)
Regurgitative Training: The Value of Real Data in Training Large Language Models
by: Zhang, Jinghui, et al.
Published: (2024)
by: Zhang, Jinghui, et al.
Published: (2024)
Scalable In-Context Learning on Tabular Data via Retrieval-Augmented Large Language Models
by: Wen, Xumeng, et al.
Published: (2025)
by: Wen, Xumeng, et al.
Published: (2025)
Detecting Training Data of Large Language Models via Expectation Maximization
by: Kim, Gyuwan, et al.
Published: (2024)
by: Kim, Gyuwan, et al.
Published: (2024)
Harnessing Diversity for Important Data Selection in Pretraining Large Language Models
by: Zhang, Chi, et al.
Published: (2024)
by: Zhang, Chi, et al.
Published: (2024)
DeepAnalyze: Agentic Large Language Models for Autonomous Data Science
by: Zhang, Shaolei, et al.
Published: (2025)
by: Zhang, Shaolei, et al.
Published: (2025)
Online Training of Large Language Models: Learn while chatting
by: Liang, Juhao, et al.
Published: (2024)
by: Liang, Juhao, et al.
Published: (2024)
MegaFake: A Theory-Driven Dataset of Fake News Generated by Large Language Models
by: Wang, Lionel Z., et al.
Published: (2024)
by: Wang, Lionel Z., et al.
Published: (2024)
Actor-Critic based Online Data Mixing For Language Model Pre-Training
by: Ma, Jing, et al.
Published: (2025)
by: Ma, Jing, et al.
Published: (2025)
Model Merging Scaling Laws in Large Language Models
by: Wang, Yuanyi, et al.
Published: (2025)
by: Wang, Yuanyi, et al.
Published: (2025)
Measuring the Impact of Lexical Training Data Coverage on Hallucination Detection in Large Language Models
by: Zhang, Shuo, et al.
Published: (2025)
by: Zhang, Shuo, et al.
Published: (2025)
Extracting Training Dialogue Data from Large Language Model based Task Bots
by: Zhang, Shuo, et al.
Published: (2026)
by: Zhang, Shuo, et al.
Published: (2026)
Escaping Collapse: The Strength of Weak Data for Large Language Model Training
by: Amin, Kareem, et al.
Published: (2025)
by: Amin, Kareem, et al.
Published: (2025)
The First Place Solution of WSDM Cup 2024: Leveraging Large Language Models for Conversational Multi-Doc QA
by: Li, Yiming, et al.
Published: (2024)
by: Li, Yiming, et al.
Published: (2024)
Imperceptible Jailbreaking against Large Language Models
by: Gao, Kuofeng, et al.
Published: (2025)
by: Gao, Kuofeng, et al.
Published: (2025)
On the Effectiveness of Incremental Training of Large Language Models
by: Li, Miles Q., et al.
Published: (2024)
by: Li, Miles Q., et al.
Published: (2024)
Detecting Data Contamination in Large Language Models
by: Janicki, Juliusz, et al.
Published: (2026)
by: Janicki, Juliusz, et al.
Published: (2026)
ImF: Implicit Fingerprint for Large Language Models
by: Wu, Jiaxuan, et al.
Published: (2025)
by: Wu, Jiaxuan, et al.
Published: (2025)
Polymetis:Large Language Modeling for Multiple Material Domains
by: Huang, Chao, et al.
Published: (2024)
by: Huang, Chao, et al.
Published: (2024)
Special Characters Attack: Toward Scalable Training Data Extraction From Large Language Models
by: Bai, Yang, et al.
Published: (2024)
by: Bai, Yang, et al.
Published: (2024)
Hyperbolic Large Language Models
by: Patil, Sarang, et al.
Published: (2025)
by: Patil, Sarang, et al.
Published: (2025)
Adaptive Optimization for Enhanced Efficiency in Large-Scale Language Model Training
by: Chen, Jiajing, et al.
Published: (2024)
by: Chen, Jiajing, et al.
Published: (2024)
Large Language Models as Data Preprocessors
by: Zhang, Haochen, et al.
Published: (2023)
by: Zhang, Haochen, et al.
Published: (2023)
The KL3M Data Project: Copyright-Clean Training Resources for Large Language Models
by: Bommarito II, Michael J, et al.
Published: (2025)
by: Bommarito II, Michael J, et al.
Published: (2025)
Eurekaverse: Environment Curriculum Generation via Large Language Models
by: Liang, William, et al.
Published: (2024)
by: Liang, William, et al.
Published: (2024)
UniDM: A Unified Framework for Data Manipulation with Large Language Models
by: Qian, Yichen, et al.
Published: (2024)
by: Qian, Yichen, et al.
Published: (2024)
Benchmarking Large Language Models on Homework Assessment in Circuit Analysis
by: Chen, Liangliang, et al.
Published: (2025)
by: Chen, Liangliang, et al.
Published: (2025)
Reconstructing Training Data from Adapter-based Federated Large Language Models
by: Chen, Silong, et al.
Published: (2026)
by: Chen, Silong, et al.
Published: (2026)
DIDS: Domain Impact-aware Data Sampling for Large Language Model Training
by: Shi, Weijie, et al.
Published: (2025)
by: Shi, Weijie, et al.
Published: (2025)
DA-Code: Agent Data Science Code Generation Benchmark for Large Language Models
by: Huang, Yiming, et al.
Published: (2024)
by: Huang, Yiming, et al.
Published: (2024)
scInterpreter: Training Large Language Models to Interpret scRNA-seq Data for Cell Type Annotation
by: Li, Cong, et al.
Published: (2024)
by: Li, Cong, et al.
Published: (2024)
Achieving Olympia-Level Geometry Large Language Model Agent via Complexity Boosting Reinforcement Learning
by: Zhao, Haiteng, et al.
Published: (2025)
by: Zhao, Haiteng, et al.
Published: (2025)
Group-SAE: Efficient Training of Sparse Autoencoders for Large Language Models via Layer Groups
by: Ghilardi, Davide, et al.
Published: (2024)
by: Ghilardi, Davide, et al.
Published: (2024)
Training-Free Activation Sparsity in Large Language Models
by: Liu, James, et al.
Published: (2024)
by: Liu, James, et al.
Published: (2024)
Similar Items
-
DataDignity: Training Data Attribution for Large Language Models
by: Li, Xiaomin, et al.
Published: (2026) -
KLoB: a Benchmark for Assessing Knowledge Locating Methods in Language Models
by: Ju, Yiming, et al.
Published: (2023) -
Integrating Large Language Model for Improved Causal Discovery
by: Ban, Taiyu, et al.
Published: (2023) -
Provable Training Data Identification for Large Language Models
by: Liu, Zhenlong, et al.
Published: (2025) -
Evolving Subnetwork Training for Large Language Models
by: Li, Hanqi, et al.
Published: (2024)