A Survey on Data Selection for LLM Instruction Tuning
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Bolin, Wang, Jiahao, Du, Qianlong, Zhang, Jiajun, Tu, Zhiying, Chu, Dianhui |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Checkpoint Merging via Bayesian Optimization in LLM Pretraining
di: Liu, Deyuan, et al.
Pubblicazione: (2024)
di: Liu, Deyuan, et al.
Pubblicazione: (2024)
Beyond Confidence: The Rhythms of Reasoning in Generative Models
di: Liu, Deyuan, et al.
Pubblicazione: (2026)
di: Liu, Deyuan, et al.
Pubblicazione: (2026)
An Efficient and Precise Training Data Construction Framework for Process-supervised Reward Model in Mathematical Reasoning
di: Sun, Wei, et al.
Pubblicazione: (2025)
di: Sun, Wei, et al.
Pubblicazione: (2025)
HBot: A Chatbot for Healthcare Applications in Traditional Chinese Medicine Based on Human Body 3D Visualization
di: Zhang, Bolin, et al.
Pubblicazione: (2024)
di: Zhang, Bolin, et al.
Pubblicazione: (2024)
Importance-Aware Data Selection for Efficient LLM Instruction Tuning
di: Jiang, Tingyu, et al.
Pubblicazione: (2025)
di: Jiang, Tingyu, et al.
Pubblicazione: (2025)
LFTF: Locating First and Then Fine-Tuning for Mitigating Gender Bias in Large Language Models
di: Qin, Zhanyue, et al.
Pubblicazione: (2025)
di: Qin, Zhanyue, et al.
Pubblicazione: (2025)
Large-Scale Data Selection for Instruction Tuning
di: Ivison, Hamish, et al.
Pubblicazione: (2025)
di: Ivison, Hamish, et al.
Pubblicazione: (2025)
From Quantity to Quality: Boosting LLM Performance with Self-Guided Data Selection for Instruction Tuning
di: Li, Ming, et al.
Pubblicazione: (2023)
di: Li, Ming, et al.
Pubblicazione: (2023)
Selective Reflection-Tuning: Student-Selected Data Recycling for LLM Instruction-Tuning
di: Li, Ming, et al.
Pubblicazione: (2024)
di: Li, Ming, et al.
Pubblicazione: (2024)
Data Whisperer: Efficient Data Selection for Task-Specific LLM Fine-Tuning via Few-Shot In-Context Learning
di: Wang, Shaobo, et al.
Pubblicazione: (2025)
di: Wang, Shaobo, et al.
Pubblicazione: (2025)
Data Selection for Multi-turn Dialogue Instruction Tuning
di: Li, Bo, et al.
Pubblicazione: (2026)
di: Li, Bo, et al.
Pubblicazione: (2026)
CoachLM: Automatic Instruction Revisions Improve the Data Quality in LLM Instruction Tuning
di: Liu, Yilun, et al.
Pubblicazione: (2023)
di: Liu, Yilun, et al.
Pubblicazione: (2023)
ScEdit: Script-based Assessment of Knowledge Editing
di: Li, Xinye, et al.
Pubblicazione: (2025)
di: Li, Xinye, et al.
Pubblicazione: (2025)
Mitigating Gender Bias in Code Large Language Models via Model Editing
di: Qin, Zhanyue, et al.
Pubblicazione: (2024)
di: Qin, Zhanyue, et al.
Pubblicazione: (2024)
ROSE: A Reward-Oriented Data Selection Framework for LLM Task-Specific Instruction Tuning
di: Wu, Yang, et al.
Pubblicazione: (2024)
di: Wu, Yang, et al.
Pubblicazione: (2024)
From Tags to Trees: Structuring Fine-Grained Knowledge for Controllable Data Selection in LLM Instruction Tuning
di: Niu, Zihan, et al.
Pubblicazione: (2026)
di: Niu, Zihan, et al.
Pubblicazione: (2026)
Beyond Similarity: A Gradient-based Graph Method for Instruction Tuning Data Selection
di: Zhao, Yang, et al.
Pubblicazione: (2025)
di: Zhao, Yang, et al.
Pubblicazione: (2025)
IterSelectTune: An Iterative Training Framework for Efficient Instruction-Tuning Data Selection
di: Song, Jielin, et al.
Pubblicazione: (2024)
di: Song, Jielin, et al.
Pubblicazione: (2024)
From Instance Selection to Fixed-Pool Data Recipe Search for Supervised Fine-Tuning
di: Wu, Haodong, et al.
Pubblicazione: (2026)
di: Wu, Haodong, et al.
Pubblicazione: (2026)
RECOST: External Knowledge Guided Data-efficient Instruction Tuning
di: Zhang, Qi, et al.
Pubblicazione: (2024)
di: Zhang, Qi, et al.
Pubblicazione: (2024)
Instruction Tuning for Large Language Models: A Survey
di: Zhang, Shengyu, et al.
Pubblicazione: (2023)
di: Zhang, Shengyu, et al.
Pubblicazione: (2023)
LangGPS: Language Separability Guided Data Pre-Selection for Joint Multilingual Instruction Tuning
di: Ye, Yangfan, et al.
Pubblicazione: (2025)
di: Ye, Yangfan, et al.
Pubblicazione: (2025)
DS$^2$-ABSA: Dual-Stream Data Synthesis with Label Refinement for Few-Shot Aspect-Based Sentiment Analysis
di: Xu, Hongling, et al.
Pubblicazione: (2024)
di: Xu, Hongling, et al.
Pubblicazione: (2024)
UNO Arena for Evaluating Sequential Decision-Making Capability of Large Language Models
di: Qin, Zhanyue, et al.
Pubblicazione: (2024)
di: Qin, Zhanyue, et al.
Pubblicazione: (2024)
TAGCOS: Task-agnostic Gradient Clustered Coreset Selection for Instruction Tuning Data
di: Zhang, Jipeng, et al.
Pubblicazione: (2024)
di: Zhang, Jipeng, et al.
Pubblicazione: (2024)
Instruction Mining: Instruction Data Selection for Tuning Large Language Models
di: Cao, Yihan, et al.
Pubblicazione: (2023)
di: Cao, Yihan, et al.
Pubblicazione: (2023)
KTAE: A Model-Free Algorithm to Key-Tokens Advantage Estimation in Mathematical Reasoning
di: Sun, Wei, et al.
Pubblicazione: (2025)
di: Sun, Wei, et al.
Pubblicazione: (2025)
SurveyEval: Towards Comprehensive Evaluation of LLM-Generated Academic Surveys
di: Zhao, Jiahao, et al.
Pubblicazione: (2025)
di: Zhao, Jiahao, et al.
Pubblicazione: (2025)
Instruction Data Selection via Answer Divergence
di: Li, Bo, et al.
Pubblicazione: (2026)
di: Li, Bo, et al.
Pubblicazione: (2026)
EchoReview: Learning Peer Review from the Echoes of Scientific Citations
di: Zhang, Yinuo, et al.
Pubblicazione: (2026)
di: Zhang, Yinuo, et al.
Pubblicazione: (2026)
TACOS: Open Tagging and Comparative Scoring for Instruction Fine-Tuning Data Selection
di: He, Xixiang, et al.
Pubblicazione: (2025)
di: He, Xixiang, et al.
Pubblicazione: (2025)
A Survey on LLM Mid-Training
di: Tu, Chengying, et al.
Pubblicazione: (2025)
di: Tu, Chengying, et al.
Pubblicazione: (2025)
Neuron-Aware Data Selection In Instruction Tuning For Large Language Models
di: Chen, Xin, et al.
Pubblicazione: (2026)
di: Chen, Xin, et al.
Pubblicazione: (2026)
RICo: Refined In-Context Contribution for Automatic Instruction-Tuning Data Selection
di: Yang, Yixin, et al.
Pubblicazione: (2025)
di: Yang, Yixin, et al.
Pubblicazione: (2025)
BrailleLLM: Braille Instruction Tuning with Large Language Models for Braille Domain Tasks
di: Huang, Tianyuan, et al.
Pubblicazione: (2025)
di: Huang, Tianyuan, et al.
Pubblicazione: (2025)
Skill-Aware Data Selection and Fine-Tuning for Data-Efficient Reasoning Distillation
di: Zhang, Lechen, et al.
Pubblicazione: (2026)
di: Zhang, Lechen, et al.
Pubblicazione: (2026)
CoreEval: Automatically Building Contamination-Resilient Datasets with Real-World Knowledge toward Reliable LLM Evaluation
di: Zhao, Jingqian, et al.
Pubblicazione: (2025)
di: Zhao, Jingqian, et al.
Pubblicazione: (2025)
Unleashing the Power of Data Tsunami: A Comprehensive Survey on Data Assessment and Selection for Instruction Tuning of Language Models
di: Qin, Yulei, et al.
Pubblicazione: (2024)
di: Qin, Yulei, et al.
Pubblicazione: (2024)
ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information
di: Zhang, Wanyue, et al.
Pubblicazione: (2024)
di: Zhang, Wanyue, et al.
Pubblicazione: (2024)
Star-Agents: Automatic Data Optimization with LLM Agents for Instruction Tuning
di: Zhou, Hang, et al.
Pubblicazione: (2024)
di: Zhou, Hang, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Checkpoint Merging via Bayesian Optimization in LLM Pretraining
di: Liu, Deyuan, et al.
Pubblicazione: (2024) -
Beyond Confidence: The Rhythms of Reasoning in Generative Models
di: Liu, Deyuan, et al.
Pubblicazione: (2026) -
An Efficient and Precise Training Data Construction Framework for Process-supervised Reward Model in Mathematical Reasoning
di: Sun, Wei, et al.
Pubblicazione: (2025) -
HBot: A Chatbot for Healthcare Applications in Traditional Chinese Medicine Based on Human Body 3D Visualization
di: Zhang, Bolin, et al.
Pubblicazione: (2024) -
Importance-Aware Data Selection for Efficient LLM Instruction Tuning
di: Jiang, Tingyu, et al.
Pubblicazione: (2025)