Automated Data Curation for Robust Language Model Fine-Tuning
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, Jiuhai, Mueller, Jonas |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Multi-Objective Linguistic Control of Large Language Models
by: Nguyen, Dang, et al.
Published: (2024)
by: Nguyen, Dang, et al.
Published: (2024)
Selective Reflection-Tuning: Student-Selected Data Recycling for LLM Instruction-Tuning
by: Li, Ming, et al.
Published: (2024)
by: Li, Ming, et al.
Published: (2024)
Can LLMs Speak For Diverse People? Tuning LLMs via Debate to Generate Controllable Controversial Statements
by: Li, Ming, et al.
Published: (2024)
by: Li, Ming, et al.
Published: (2024)
Efficient Fine-Tuning of Large Language Models for Automated Medical Documentation
by: Leong, Hui Yi, et al.
Published: (2024)
by: Leong, Hui Yi, et al.
Published: (2024)
The Role of Data Curation in Image Captioning
by: Li, Wenyan, et al.
Published: (2023)
by: Li, Wenyan, et al.
Published: (2023)
From Quantity to Quality: Boosting LLM Performance with Self-Guided Data Selection for Instruction Tuning
by: Li, Ming, et al.
Published: (2023)
by: Li, Ming, et al.
Published: (2023)
GIFT: Guided Fine-Tuning and Transfer for Enhancing Instruction-Tuned Language Models
by: Ruan, Zhiwen, et al.
Published: (2026)
by: Ruan, Zhiwen, et al.
Published: (2026)
Fine-Tuning Large Language Models to Translate: Will a Touch of Noisy Data in Misaligned Languages Suffice?
by: Zhu, Dawei, et al.
Published: (2024)
by: Zhu, Dawei, et al.
Published: (2024)
LegiLM: A Fine-Tuned Legal Language Model for Data Compliance
by: Zhu, Linkai, et al.
Published: (2024)
by: Zhu, Linkai, et al.
Published: (2024)
SCOUT: A Defense Against Data Poisoning Attacks in Fine-Tuned Language Models
by: Afane, Mohamed, et al.
Published: (2025)
by: Afane, Mohamed, et al.
Published: (2025)
Dual Tuning for Reasoning Efficacy-Driven Data Curation in Multimodal LLM Training
by: Zheng, Ruobing, et al.
Published: (2026)
by: Zheng, Ruobing, et al.
Published: (2026)
Parameter-Efficient Fine-Tuning with Differential Privacy for Robust Instruction Adaptation in Large Language Models
by: Huang, Yulin, et al.
Published: (2025)
by: Huang, Yulin, et al.
Published: (2025)
Unveiling the Impact of Coding Data Instruction Fine-Tuning on Large Language Models Reasoning
by: Zhang, Xinlu, et al.
Published: (2024)
by: Zhang, Xinlu, et al.
Published: (2024)
DELIFT: Data Efficient Language model Instruction Fine Tuning
by: Agarwal, Ishika, et al.
Published: (2024)
by: Agarwal, Ishika, et al.
Published: (2024)
Automating Research Synthesis with Domain-Specific Large Language Model Fine-Tuning
by: Susnjak, Teo, et al.
Published: (2024)
by: Susnjak, Teo, et al.
Published: (2024)
Augmented Fine-Tuned LLMs for Enhanced Recruitment Automation
by: Younes, Mohamed T., et al.
Published: (2025)
by: Younes, Mohamed T., et al.
Published: (2025)
Mixture-of-Skills: Learning to Optimize Data Usage for Fine-Tuning Large Language Models
by: Wu, Minghao, et al.
Published: (2024)
by: Wu, Minghao, et al.
Published: (2024)
Language Model Fine-Tuning on Scaled Survey Data for Predicting Distributions of Public Opinions
by: Suh, Joseph, et al.
Published: (2025)
by: Suh, Joseph, et al.
Published: (2025)
Scaling Data Diversity for Fine-Tuning Language Models in Human Alignment
by: Song, Feifan, et al.
Published: (2024)
by: Song, Feifan, et al.
Published: (2024)
OPTune: Efficient Online Preference Tuning
by: Chen, Lichang, et al.
Published: (2024)
by: Chen, Lichang, et al.
Published: (2024)
Natural Language Fine-Tuning
by: Liu, Jia, et al.
Published: (2024)
by: Liu, Jia, et al.
Published: (2024)
HFT: Half Fine-Tuning for Large Language Models
by: Hui, Tingfeng, et al.
Published: (2024)
by: Hui, Tingfeng, et al.
Published: (2024)
FineWeb-zhtw: Scalable Curation of Traditional Chinese Text Data from the Web
by: Lin, Cheng-Wei, et al.
Published: (2024)
by: Lin, Cheng-Wei, et al.
Published: (2024)
Self-Distillation Bridges Distribution Gap in Language Model Fine-Tuning
by: Yang, Zhaorui, et al.
Published: (2024)
by: Yang, Zhaorui, et al.
Published: (2024)
Mitigating Outlier Activations in Low-Precision Fine-Tuning of Language Models
by: Ghaffari, Alireza, et al.
Published: (2023)
by: Ghaffari, Alireza, et al.
Published: (2023)
Fine-Tuning Language Models with Just Forward Passes
by: Malladi, Sadhika, et al.
Published: (2023)
by: Malladi, Sadhika, et al.
Published: (2023)
Fine-Tuned Language Models for Domain-Specific Summarization and Tagging
by: Wang, Jun, et al.
Published: (2025)
by: Wang, Jun, et al.
Published: (2025)
Enhancing ML Model Interpretability: Leveraging Fine-Tuned Large Language Models for Better Understanding of AI
by: Bokstaller, Jonas, et al.
Published: (2025)
by: Bokstaller, Jonas, et al.
Published: (2025)
Assessing and Mitigating Data Memorization Risks in Fine-Tuned Large Language Models
by: Ramakrishnan, Badrinath, et al.
Published: (2025)
by: Ramakrishnan, Badrinath, et al.
Published: (2025)
LABELING COPILOT: A Deep Research Agent for Automated Data Curation in Computer Vision
by: Ganguly, Debargha, et al.
Published: (2025)
by: Ganguly, Debargha, et al.
Published: (2025)
Real-Time Trustworthiness Scoring for LLM Structured Outputs and Data Extraction
by: Goh, Hui Wen, et al.
Published: (2026)
by: Goh, Hui Wen, et al.
Published: (2026)
Parameter-Efficient Fine-Tuning of Large Language Models using Semantic Knowledge Tuning
by: Prottasha, Nusrat Jahan, et al.
Published: (2024)
by: Prottasha, Nusrat Jahan, et al.
Published: (2024)
FlowerTune: A Cross-Domain Benchmark for Federated Fine-Tuning of Large Language Models
by: Gao, Yan, et al.
Published: (2025)
by: Gao, Yan, et al.
Published: (2025)
RedStone: Curating General, Code, Math, and QA Data for Large Language Models
by: Chang, Yaoyao, et al.
Published: (2024)
by: Chang, Yaoyao, et al.
Published: (2024)
Overtrained Language Models Are Harder to Fine-Tune
by: Springer, Jacob Mitchell, et al.
Published: (2025)
by: Springer, Jacob Mitchell, et al.
Published: (2025)
Memorization in Fine-Tuned Large Language Models
by: Savine, Danil
Published: (2025)
by: Savine, Danil
Published: (2025)
Enhancing Large Language Model Reasoning via Selective Critical Token Fine-Tuning
by: Ruan, Zhiwen, et al.
Published: (2025)
by: Ruan, Zhiwen, et al.
Published: (2025)
Unveiling the Generalization Power of Fine-Tuned Large Language Models
by: Yang, Haoran, et al.
Published: (2024)
by: Yang, Haoran, et al.
Published: (2024)
Dynamics of Instruction Fine-Tuning for Chinese Large Language Models
by: Song, Chiyu, et al.
Published: (2023)
by: Song, Chiyu, et al.
Published: (2023)
Take the essence and discard the dross: A Rethinking on Data Selection for Fine-Tuning Large Language Models
by: Liu, Ziche, et al.
Published: (2024)
by: Liu, Ziche, et al.
Published: (2024)
Similar Items
-
Multi-Objective Linguistic Control of Large Language Models
by: Nguyen, Dang, et al.
Published: (2024) -
Selective Reflection-Tuning: Student-Selected Data Recycling for LLM Instruction-Tuning
by: Li, Ming, et al.
Published: (2024) -
Can LLMs Speak For Diverse People? Tuning LLMs via Debate to Generate Controllable Controversial Statements
by: Li, Ming, et al.
Published: (2024) -
Efficient Fine-Tuning of Large Language Models for Automated Medical Documentation
by: Leong, Hui Yi, et al.
Published: (2024) -
The Role of Data Curation in Image Captioning
by: Li, Wenyan, et al.
Published: (2023)