From Tags to Trees: Structuring Fine-Grained Knowledge for Controllable Data Selection in LLM Instruction Tuning
Fuente:
arXiv
Guardado en:
| Autores principales: | Niu, Zihan, Hu, Wenping, Chen, Junmin, Wang, Xiyue, Xu, Tong, Tang, Ruiming |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
TACOS: Open Tagging and Comparative Scoring for Instruction Fine-Tuning Data Selection
por: He, Xixiang, et al.
Publicado: (2025)
por: He, Xixiang, et al.
Publicado: (2025)
Token Cleaning: Fine-Grained Data Selection for LLM Supervised Fine-Tuning
por: Pang, Jinlong, et al.
Publicado: (2025)
por: Pang, Jinlong, et al.
Publicado: (2025)
Selective Reflection-Tuning: Student-Selected Data Recycling for LLM Instruction-Tuning
por: Li, Ming, et al.
Publicado: (2024)
por: Li, Ming, et al.
Publicado: (2024)
Importance-Aware Data Selection for Efficient LLM Instruction Tuning
por: Jiang, Tingyu, et al.
Publicado: (2025)
por: Jiang, Tingyu, et al.
Publicado: (2025)
From Quantity to Quality: Boosting LLM Performance with Self-Guided Data Selection for Instruction Tuning
por: Li, Ming, et al.
Publicado: (2023)
por: Li, Ming, et al.
Publicado: (2023)
A Survey on Data Selection for LLM Instruction Tuning
por: Zhang, Bolin, et al.
Publicado: (2024)
por: Zhang, Bolin, et al.
Publicado: (2024)
Selection of LLM Fine-Tuning Data based on Orthogonal Rules
por: Li, Xiaomin, et al.
Publicado: (2024)
por: Li, Xiaomin, et al.
Publicado: (2024)
Enhancing and Assessing Instruction-Following with Fine-Grained Instruction Variants
por: Yang, Jiuding, et al.
Publicado: (2024)
por: Yang, Jiuding, et al.
Publicado: (2024)
Instruction-Tuning Data Synthesis from Scratch via Web Reconstruction
por: Jiang, Yuxin, et al.
Publicado: (2025)
por: Jiang, Yuxin, et al.
Publicado: (2025)
IF-CRITIC: Towards a Fine-Grained LLM Critic for Instruction-Following Evaluation
por: Wen, Bosi, et al.
Publicado: (2025)
por: Wen, Bosi, et al.
Publicado: (2025)
DARL: Encouraging Diverse Answers for General Reasoning without Verifiers
por: Huang, Chongxuan, et al.
Publicado: (2026)
por: Huang, Chongxuan, et al.
Publicado: (2026)
Retrieve-Plan-Generation: An Iterative Planning and Answering Framework for Knowledge-Intensive LLM Generation
por: Lyu, Yuanjie, et al.
Publicado: (2024)
por: Lyu, Yuanjie, et al.
Publicado: (2024)
Fine-Tuned Language Models for Domain-Specific Summarization and Tagging
por: Wang, Jun, et al.
Publicado: (2025)
por: Wang, Jun, et al.
Publicado: (2025)
From Instance Selection to Fixed-Pool Data Recipe Search for Supervised Fine-Tuning
por: Wu, Haodong, et al.
Publicado: (2026)
por: Wu, Haodong, et al.
Publicado: (2026)
DataShield: Safety-degrading Data Filtering for LLM Benign Instruction Fine-Tuning
por: Zhang, Junbo, et al.
Publicado: (2026)
por: Zhang, Junbo, et al.
Publicado: (2026)
SKA-Bench: A Fine-Grained Benchmark for Evaluating Structured Knowledge Understanding of LLMs
por: Liu, Zhiqiang, et al.
Publicado: (2025)
por: Liu, Zhiqiang, et al.
Publicado: (2025)
Skill-Aware Data Selection and Fine-Tuning for Data-Efficient Reasoning Distillation
por: Zhang, Lechen, et al.
Publicado: (2026)
por: Zhang, Lechen, et al.
Publicado: (2026)
Large-Scale Data Selection for Instruction Tuning
por: Ivison, Hamish, et al.
Publicado: (2025)
por: Ivison, Hamish, et al.
Publicado: (2025)
ProcTag: Process Tagging for Assessing the Efficacy of Document Instruction Data
por: Shen, Yufan, et al.
Publicado: (2024)
por: Shen, Yufan, et al.
Publicado: (2024)
InstructDiff: Domain-Adaptive Data Selection via Differential Entropy for Efficient LLM Fine-Tuning
por: Su, Junyou, et al.
Publicado: (2026)
por: Su, Junyou, et al.
Publicado: (2026)
IterSelectTune: An Iterative Training Framework for Efficient Instruction-Tuning Data Selection
por: Song, Jielin, et al.
Publicado: (2024)
por: Song, Jielin, et al.
Publicado: (2024)
MIG: Automatic Data Selection for Instruction Tuning by Maximizing Information Gain in Semantic Space
por: Chen, Yicheng, et al.
Publicado: (2025)
por: Chen, Yicheng, et al.
Publicado: (2025)
Automate Knowledge Concept Tagging on Math Questions with LLMs
por: Li, Hang, et al.
Publicado: (2024)
por: Li, Hang, et al.
Publicado: (2024)
DELIFT: Data Efficient Language model Instruction Fine Tuning
por: Agarwal, Ishika, et al.
Publicado: (2024)
por: Agarwal, Ishika, et al.
Publicado: (2024)
Data Whisperer: Efficient Data Selection for Task-Specific LLM Fine-Tuning via Few-Shot In-Context Learning
por: Wang, Shaobo, et al.
Publicado: (2025)
por: Wang, Shaobo, et al.
Publicado: (2025)
Rethinking Data Selection for Supervised Fine-Tuning
por: Shen, Ming
Publicado: (2024)
por: Shen, Ming
Publicado: (2024)
Filter-then-Weight: Online Data Selection and Reweighting for LLM Fine-Tuning
por: Wang, Fangxin, et al.
Publicado: (2026)
por: Wang, Fangxin, et al.
Publicado: (2026)
TalkTag: Fine-Grained Morphosyntactic Error Annotation for Transcribed Speech
por: Venturini, Shamira, et al.
Publicado: (2026)
por: Venturini, Shamira, et al.
Publicado: (2026)
LESS: Selecting Influential Data for Targeted Instruction Tuning
por: Xia, Mengzhou, et al.
Publicado: (2024)
por: Xia, Mengzhou, et al.
Publicado: (2024)
ROSE: A Reward-Oriented Data Selection Framework for LLM Task-Specific Instruction Tuning
por: Wu, Yang, et al.
Publicado: (2024)
por: Wu, Yang, et al.
Publicado: (2024)
Gradient Surgery for Safe LLM Fine-Tuning
por: Yi, Biao, et al.
Publicado: (2025)
por: Yi, Biao, et al.
Publicado: (2025)
Improving Translation Quality by Selecting Better Data for LLM Fine-Tuning: A Comparative Analysis
por: de Mello, Felipe Ribeiro Fujita, et al.
Publicado: (2025)
por: de Mello, Felipe Ribeiro Fujita, et al.
Publicado: (2025)
Star-Agents: Automatic Data Optimization with LLM Agents for Instruction Tuning
por: Zhou, Hang, et al.
Publicado: (2024)
por: Zhou, Hang, et al.
Publicado: (2024)
TAGCOS: Task-agnostic Gradient Clustered Coreset Selection for Instruction Tuning Data
por: Zhang, Jipeng, et al.
Publicado: (2024)
por: Zhang, Jipeng, et al.
Publicado: (2024)
Dynamic Data Mixing Maximizes Instruction Tuning for Mixture-of-Experts
por: Zhu, Tong, et al.
Publicado: (2024)
por: Zhu, Tong, et al.
Publicado: (2024)
Neuron-Aware Data Selection In Instruction Tuning For Large Language Models
por: Chen, Xin, et al.
Publicado: (2026)
por: Chen, Xin, et al.
Publicado: (2026)
From Single to Multi-Granularity: Toward Long-Term Memory Association and Selection of Conversational Agents
por: Xu, Derong, et al.
Publicado: (2025)
por: Xu, Derong, et al.
Publicado: (2025)
RECOST: External Knowledge Guided Data-efficient Instruction Tuning
por: Zhang, Qi, et al.
Publicado: (2024)
por: Zhang, Qi, et al.
Publicado: (2024)
Know the Unknown: An Uncertainty-Sensitive Method for LLM Instruction Tuning
por: Li, Jiaqi, et al.
Publicado: (2024)
por: Li, Jiaqi, et al.
Publicado: (2024)
GIFT: Guided Fine-Tuning and Transfer for Enhancing Instruction-Tuned Language Models
por: Ruan, Zhiwen, et al.
Publicado: (2026)
por: Ruan, Zhiwen, et al.
Publicado: (2026)
Ejemplares similares
-
TACOS: Open Tagging and Comparative Scoring for Instruction Fine-Tuning Data Selection
por: He, Xixiang, et al.
Publicado: (2025) -
Token Cleaning: Fine-Grained Data Selection for LLM Supervised Fine-Tuning
por: Pang, Jinlong, et al.
Publicado: (2025) -
Selective Reflection-Tuning: Student-Selected Data Recycling for LLM Instruction-Tuning
por: Li, Ming, et al.
Publicado: (2024) -
Importance-Aware Data Selection for Efficient LLM Instruction Tuning
por: Jiang, Tingyu, et al.
Publicado: (2025) -
From Quantity to Quality: Boosting LLM Performance with Self-Guided Data Selection for Instruction Tuning
por: Li, Ming, et al.
Publicado: (2023)