A Survey on Data Selection for LLM Instruction Tuning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhang, Bolin, Wang, Jiahao, Du, Qianlong, Zhang, Jiajun, Tu, Zhiying, Chu, Dianhui |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Checkpoint Merging via Bayesian Optimization in LLM Pretraining
von: Liu, Deyuan, et al.
Veröffentlicht: (2024)
von: Liu, Deyuan, et al.
Veröffentlicht: (2024)
Beyond Confidence: The Rhythms of Reasoning in Generative Models
von: Liu, Deyuan, et al.
Veröffentlicht: (2026)
von: Liu, Deyuan, et al.
Veröffentlicht: (2026)
An Efficient and Precise Training Data Construction Framework for Process-supervised Reward Model in Mathematical Reasoning
von: Sun, Wei, et al.
Veröffentlicht: (2025)
von: Sun, Wei, et al.
Veröffentlicht: (2025)
HBot: A Chatbot for Healthcare Applications in Traditional Chinese Medicine Based on Human Body 3D Visualization
von: Zhang, Bolin, et al.
Veröffentlicht: (2024)
von: Zhang, Bolin, et al.
Veröffentlicht: (2024)
Importance-Aware Data Selection for Efficient LLM Instruction Tuning
von: Jiang, Tingyu, et al.
Veröffentlicht: (2025)
von: Jiang, Tingyu, et al.
Veröffentlicht: (2025)
LFTF: Locating First and Then Fine-Tuning for Mitigating Gender Bias in Large Language Models
von: Qin, Zhanyue, et al.
Veröffentlicht: (2025)
von: Qin, Zhanyue, et al.
Veröffentlicht: (2025)
Large-Scale Data Selection for Instruction Tuning
von: Ivison, Hamish, et al.
Veröffentlicht: (2025)
von: Ivison, Hamish, et al.
Veröffentlicht: (2025)
From Quantity to Quality: Boosting LLM Performance with Self-Guided Data Selection for Instruction Tuning
von: Li, Ming, et al.
Veröffentlicht: (2023)
von: Li, Ming, et al.
Veröffentlicht: (2023)
Selective Reflection-Tuning: Student-Selected Data Recycling for LLM Instruction-Tuning
von: Li, Ming, et al.
Veröffentlicht: (2024)
von: Li, Ming, et al.
Veröffentlicht: (2024)
Data Whisperer: Efficient Data Selection for Task-Specific LLM Fine-Tuning via Few-Shot In-Context Learning
von: Wang, Shaobo, et al.
Veröffentlicht: (2025)
von: Wang, Shaobo, et al.
Veröffentlicht: (2025)
Data Selection for Multi-turn Dialogue Instruction Tuning
von: Li, Bo, et al.
Veröffentlicht: (2026)
von: Li, Bo, et al.
Veröffentlicht: (2026)
CoachLM: Automatic Instruction Revisions Improve the Data Quality in LLM Instruction Tuning
von: Liu, Yilun, et al.
Veröffentlicht: (2023)
von: Liu, Yilun, et al.
Veröffentlicht: (2023)
ScEdit: Script-based Assessment of Knowledge Editing
von: Li, Xinye, et al.
Veröffentlicht: (2025)
von: Li, Xinye, et al.
Veröffentlicht: (2025)
ROSE: A Reward-Oriented Data Selection Framework for LLM Task-Specific Instruction Tuning
von: Wu, Yang, et al.
Veröffentlicht: (2024)
von: Wu, Yang, et al.
Veröffentlicht: (2024)
Mitigating Gender Bias in Code Large Language Models via Model Editing
von: Qin, Zhanyue, et al.
Veröffentlicht: (2024)
von: Qin, Zhanyue, et al.
Veröffentlicht: (2024)
From Tags to Trees: Structuring Fine-Grained Knowledge for Controllable Data Selection in LLM Instruction Tuning
von: Niu, Zihan, et al.
Veröffentlicht: (2026)
von: Niu, Zihan, et al.
Veröffentlicht: (2026)
Beyond Similarity: A Gradient-based Graph Method for Instruction Tuning Data Selection
von: Zhao, Yang, et al.
Veröffentlicht: (2025)
von: Zhao, Yang, et al.
Veröffentlicht: (2025)
IterSelectTune: An Iterative Training Framework for Efficient Instruction-Tuning Data Selection
von: Song, Jielin, et al.
Veröffentlicht: (2024)
von: Song, Jielin, et al.
Veröffentlicht: (2024)
From Instance Selection to Fixed-Pool Data Recipe Search for Supervised Fine-Tuning
von: Wu, Haodong, et al.
Veröffentlicht: (2026)
von: Wu, Haodong, et al.
Veröffentlicht: (2026)
RECOST: External Knowledge Guided Data-efficient Instruction Tuning
von: Zhang, Qi, et al.
Veröffentlicht: (2024)
von: Zhang, Qi, et al.
Veröffentlicht: (2024)
Instruction Tuning for Large Language Models: A Survey
von: Zhang, Shengyu, et al.
Veröffentlicht: (2023)
von: Zhang, Shengyu, et al.
Veröffentlicht: (2023)
LangGPS: Language Separability Guided Data Pre-Selection for Joint Multilingual Instruction Tuning
von: Ye, Yangfan, et al.
Veröffentlicht: (2025)
von: Ye, Yangfan, et al.
Veröffentlicht: (2025)
DS$^2$-ABSA: Dual-Stream Data Synthesis with Label Refinement for Few-Shot Aspect-Based Sentiment Analysis
von: Xu, Hongling, et al.
Veröffentlicht: (2024)
von: Xu, Hongling, et al.
Veröffentlicht: (2024)
TAGCOS: Task-agnostic Gradient Clustered Coreset Selection for Instruction Tuning Data
von: Zhang, Jipeng, et al.
Veröffentlicht: (2024)
von: Zhang, Jipeng, et al.
Veröffentlicht: (2024)
Instruction Mining: Instruction Data Selection for Tuning Large Language Models
von: Cao, Yihan, et al.
Veröffentlicht: (2023)
von: Cao, Yihan, et al.
Veröffentlicht: (2023)
UNO Arena for Evaluating Sequential Decision-Making Capability of Large Language Models
von: Qin, Zhanyue, et al.
Veröffentlicht: (2024)
von: Qin, Zhanyue, et al.
Veröffentlicht: (2024)
KTAE: A Model-Free Algorithm to Key-Tokens Advantage Estimation in Mathematical Reasoning
von: Sun, Wei, et al.
Veröffentlicht: (2025)
von: Sun, Wei, et al.
Veröffentlicht: (2025)
SurveyEval: Towards Comprehensive Evaluation of LLM-Generated Academic Surveys
von: Zhao, Jiahao, et al.
Veröffentlicht: (2025)
von: Zhao, Jiahao, et al.
Veröffentlicht: (2025)
Instruction Data Selection via Answer Divergence
von: Li, Bo, et al.
Veröffentlicht: (2026)
von: Li, Bo, et al.
Veröffentlicht: (2026)
EchoReview: Learning Peer Review from the Echoes of Scientific Citations
von: Zhang, Yinuo, et al.
Veröffentlicht: (2026)
von: Zhang, Yinuo, et al.
Veröffentlicht: (2026)
TACOS: Open Tagging and Comparative Scoring for Instruction Fine-Tuning Data Selection
von: He, Xixiang, et al.
Veröffentlicht: (2025)
von: He, Xixiang, et al.
Veröffentlicht: (2025)
A Survey on LLM Mid-Training
von: Tu, Chengying, et al.
Veröffentlicht: (2025)
von: Tu, Chengying, et al.
Veröffentlicht: (2025)
Neuron-Aware Data Selection In Instruction Tuning For Large Language Models
von: Chen, Xin, et al.
Veröffentlicht: (2026)
von: Chen, Xin, et al.
Veröffentlicht: (2026)
RICo: Refined In-Context Contribution for Automatic Instruction-Tuning Data Selection
von: Yang, Yixin, et al.
Veröffentlicht: (2025)
von: Yang, Yixin, et al.
Veröffentlicht: (2025)
BrailleLLM: Braille Instruction Tuning with Large Language Models for Braille Domain Tasks
von: Huang, Tianyuan, et al.
Veröffentlicht: (2025)
von: Huang, Tianyuan, et al.
Veröffentlicht: (2025)
Skill-Aware Data Selection and Fine-Tuning for Data-Efficient Reasoning Distillation
von: Zhang, Lechen, et al.
Veröffentlicht: (2026)
von: Zhang, Lechen, et al.
Veröffentlicht: (2026)
CoreEval: Automatically Building Contamination-Resilient Datasets with Real-World Knowledge toward Reliable LLM Evaluation
von: Zhao, Jingqian, et al.
Veröffentlicht: (2025)
von: Zhao, Jingqian, et al.
Veröffentlicht: (2025)
Unleashing the Power of Data Tsunami: A Comprehensive Survey on Data Assessment and Selection for Instruction Tuning of Language Models
von: Qin, Yulei, et al.
Veröffentlicht: (2024)
von: Qin, Yulei, et al.
Veröffentlicht: (2024)
ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information
von: Zhang, Wanyue, et al.
Veröffentlicht: (2024)
von: Zhang, Wanyue, et al.
Veröffentlicht: (2024)
Star-Agents: Automatic Data Optimization with LLM Agents for Instruction Tuning
von: Zhou, Hang, et al.
Veröffentlicht: (2024)
von: Zhou, Hang, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Checkpoint Merging via Bayesian Optimization in LLM Pretraining
von: Liu, Deyuan, et al.
Veröffentlicht: (2024) -
Beyond Confidence: The Rhythms of Reasoning in Generative Models
von: Liu, Deyuan, et al.
Veröffentlicht: (2026) -
An Efficient and Precise Training Data Construction Framework for Process-supervised Reward Model in Mathematical Reasoning
von: Sun, Wei, et al.
Veröffentlicht: (2025) -
HBot: A Chatbot for Healthcare Applications in Traditional Chinese Medicine Based on Human Body 3D Visualization
von: Zhang, Bolin, et al.
Veröffentlicht: (2024) -
Importance-Aware Data Selection for Efficient LLM Instruction Tuning
von: Jiang, Tingyu, et al.
Veröffentlicht: (2025)