Take the essence and discard the dross: A Rethinking on Data Selection for Fine-Tuning Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Liu, Ziche, Ke, Rui, Liu, Yajiao, Jiang, Feng, Li, Haizhou |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives
by: Liu, Yajiao, et al.
Published: (2025)
by: Liu, Yajiao, et al.
Published: (2025)
LLM4PM: A case study on using Large Language Models for Process Modeling in Enterprise Organizations
by: Ziche, Clara, et al.
Published: (2024)
by: Ziche, Clara, et al.
Published: (2024)
Rethinking Data Selection for Supervised Fine-Tuning
by: Shen, Ming
Published: (2024)
by: Shen, Ming
Published: (2024)
Enhancing Large Language Model Reasoning via Selective Critical Token Fine-Tuning
by: Ruan, Zhiwen, et al.
Published: (2025)
by: Ruan, Zhiwen, et al.
Published: (2025)
Multimodal Fine-grained Context Interaction Graph Modeling for Conversational Speech Synthesis
by: Jia, Zhenqi, et al.
Published: (2025)
by: Jia, Zhenqi, et al.
Published: (2025)
Humans or LLMs as the Judge? A Study on Judgement Biases
by: Chen, Guiming Hardy, et al.
Published: (2024)
by: Chen, Guiming Hardy, et al.
Published: (2024)
Efficient Tuning and Inference for Large Language Models on Textual Graphs
by: Zhu, Yun, et al.
Published: (2024)
by: Zhu, Yun, et al.
Published: (2024)
TS-Align: A Teacher-Student Collaborative Framework for Scalable Iterative Finetuning of Large Language Models
by: Zhang, Chen, et al.
Published: (2024)
by: Zhang, Chen, et al.
Published: (2024)
Selective Self-to-Supervised Fine-Tuning for Generalization in Large Language Models
by: Gupta, Sonam, et al.
Published: (2025)
by: Gupta, Sonam, et al.
Published: (2025)
Hyperbolic Fine-Tuning for Large Language Models
by: Yang, Menglin, et al.
Published: (2024)
by: Yang, Menglin, et al.
Published: (2024)
Efficient Response Generation Strategy Selection for Fine-Tuning Large Language Models Through Self-Aligned Perplexity
by: Ren, Xuan, et al.
Published: (2025)
by: Ren, Xuan, et al.
Published: (2025)
Rethinking Bottlenecks in Safety Fine-Tuning of Vision Language Models
by: Ding, Yi, et al.
Published: (2025)
by: Ding, Yi, et al.
Published: (2025)
LegiLM: A Fine-Tuned Legal Language Model for Data Compliance
by: Zhu, Linkai, et al.
Published: (2024)
by: Zhu, Linkai, et al.
Published: (2024)
Synthetic Data Generation in Low-Resource Settings via Fine-Tuning of Large Language Models
by: Kaddour, Jean, et al.
Published: (2023)
by: Kaddour, Jean, et al.
Published: (2023)
Enhancing Causal Reasoning in Large Language Models: A Causal Attribution Model for Precision Fine-Tuning
by: Cai, Hengrui, et al.
Published: (2023)
by: Cai, Hengrui, et al.
Published: (2023)
FlowerTune: A Cross-Domain Benchmark for Federated Fine-Tuning of Large Language Models
by: Gao, Yan, et al.
Published: (2025)
by: Gao, Yan, et al.
Published: (2025)
MeTA-LoRA: Data-Efficient Multi-Task Fine-Tuning for Large Language Models
by: Cheng, Bo, et al.
Published: (2025)
by: Cheng, Bo, et al.
Published: (2025)
QLESS: A Quantized Approach for Data Valuation and Selection in Large Language Model Fine-Tuning
by: Ananta, Moses, et al.
Published: (2025)
by: Ananta, Moses, et al.
Published: (2025)
SCOUT: A Defense Against Data Poisoning Attacks in Fine-Tuned Language Models
by: Afane, Mohamed, et al.
Published: (2025)
by: Afane, Mohamed, et al.
Published: (2025)
AceGPT, Localizing Large Language Models in Arabic
by: Huang, Huang, et al.
Published: (2023)
by: Huang, Huang, et al.
Published: (2023)
Privacy-Preserving Parameter-Efficient Fine-Tuning for Large Language Model Services
by: Li, Yansong, et al.
Published: (2023)
by: Li, Yansong, et al.
Published: (2023)
PoliTune: Analyzing the Impact of Data Selection and Fine-Tuning on Economic and Political Biases in Large Language Models
by: Agiza, Ahmed, et al.
Published: (2024)
by: Agiza, Ahmed, et al.
Published: (2024)
TLoRA+: A Low-Rank Parameter-Efficient Fine-Tuning Method for Large Language Models
by: Cao, Yarui, et al.
Published: (2026)
by: Cao, Yarui, et al.
Published: (2026)
Neuron-Aware Data Selection In Instruction Tuning For Large Language Models
by: Chen, Xin, et al.
Published: (2026)
by: Chen, Xin, et al.
Published: (2026)
An Empirical Study on Parameter-Efficient Fine-Tuning for MultiModal Large Language Models
by: Zhou, Xiongtao, et al.
Published: (2024)
by: Zhou, Xiongtao, et al.
Published: (2024)
Agent-FLAN: Designing Data and Methods of Effective Agent Tuning for Large Language Models
by: Chen, Zehui, et al.
Published: (2024)
by: Chen, Zehui, et al.
Published: (2024)
Safety-Aware Fine-Tuning of Large Language Models
by: Choi, Hyeong Kyu, et al.
Published: (2024)
by: Choi, Hyeong Kyu, et al.
Published: (2024)
HFT: Half Fine-Tuning for Large Language Models
by: Hui, Tingfeng, et al.
Published: (2024)
by: Hui, Tingfeng, et al.
Published: (2024)
Supervised Fine-Tuning versus Reinforcement Learning: A Study of Post-Training Methods for Large Language Models
by: Jiang, Haitao, et al.
Published: (2026)
by: Jiang, Haitao, et al.
Published: (2026)
Mixture-of-Skills: Learning to Optimize Data Usage for Fine-Tuning Large Language Models
by: Wu, Minghao, et al.
Published: (2024)
by: Wu, Minghao, et al.
Published: (2024)
Token Cleaning: Fine-Grained Data Selection for LLM Supervised Fine-Tuning
by: Pang, Jinlong, et al.
Published: (2025)
by: Pang, Jinlong, et al.
Published: (2025)
Why Supervised Fine-Tuning Fails to Learn: A Systematic Study of Incomplete Learning in Large Language Models
by: Xue, Chao, et al.
Published: (2026)
by: Xue, Chao, et al.
Published: (2026)
Self-Distillation Bridges Distribution Gap in Language Model Fine-Tuning
by: Yang, Zhaorui, et al.
Published: (2024)
by: Yang, Zhaorui, et al.
Published: (2024)
Beyond Binary: Towards Fine-Grained LLM-Generated Text Detection via Role Recognition and Involvement Measurement
by: Cheng, Zihao, et al.
Published: (2024)
by: Cheng, Zihao, et al.
Published: (2024)
TPP-LLM: Modeling Temporal Point Processes by Efficiently Fine-Tuning Large Language Models
by: Liu, Zefang, et al.
Published: (2024)
by: Liu, Zefang, et al.
Published: (2024)
From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning
by: Li, Haoyu, et al.
Published: (2025)
by: Li, Haoyu, et al.
Published: (2025)
Taiyi: A Bilingual Fine-Tuned Large Language Model for Diverse Biomedical Tasks
by: Luo, Ling, et al.
Published: (2023)
by: Luo, Ling, et al.
Published: (2023)
Memorization in Fine-Tuned Large Language Models
by: Savine, Danil
Published: (2025)
by: Savine, Danil
Published: (2025)
Fine-Tuning Large Language Models to Translate: Will a Touch of Noisy Data in Misaligned Languages Suffice?
by: Zhu, Dawei, et al.
Published: (2024)
by: Zhu, Dawei, et al.
Published: (2024)
CATCH: A Controllable Theme Detection Framework with Contextualized Clustering and Hierarchical Generation
by: Ke, Rui, et al.
Published: (2025)
by: Ke, Rui, et al.
Published: (2025)
Similar Items
-
Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives
by: Liu, Yajiao, et al.
Published: (2025) -
LLM4PM: A case study on using Large Language Models for Process Modeling in Enterprise Organizations
by: Ziche, Clara, et al.
Published: (2024) -
Rethinking Data Selection for Supervised Fine-Tuning
by: Shen, Ming
Published: (2024) -
Enhancing Large Language Model Reasoning via Selective Critical Token Fine-Tuning
by: Ruan, Zhiwen, et al.
Published: (2025) -
Multimodal Fine-grained Context Interaction Graph Modeling for Conversational Speech Synthesis
by: Jia, Zhenqi, et al.
Published: (2025)