Large-Scale Data Selection for Instruction Tuning
Fuente:
arXiv
Guardado en:
| Autores principales: | Ivison, Hamish, Zhang, Muru, Brahman, Faeze, Koh, Pang Wei, Dasigi, Pradeep |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Meta-Reinforcement Learning with Self-Reflection for Agentic Search
por: Xiao, Teng, et al.
Publicado: (2026)
por: Xiao, Teng, et al.
Publicado: (2026)
Generalizing Verifiable Instruction Following
por: Pyatkin, Valentina, et al.
Publicado: (2025)
por: Pyatkin, Valentina, et al.
Publicado: (2025)
TESS 2: A Large-Scale Generalist Diffusion Language Model
por: Tae, Jaesung, et al.
Publicado: (2025)
por: Tae, Jaesung, et al.
Publicado: (2025)
Hybrid Preferences: Learning to Route Instances for Human vs. AI Feedback
por: Miranda, Lester James V., et al.
Publicado: (2024)
por: Miranda, Lester James V., et al.
Publicado: (2024)
Information-Theoretic Distillation for Reference-less Summarization
por: Jung, Jaehun, et al.
Publicado: (2024)
por: Jung, Jaehun, et al.
Publicado: (2024)
ParaPO: Aligning Language Models to Reduce Verbatim Reproduction of Pre-training Data
por: Chen, Tong, et al.
Publicado: (2025)
por: Chen, Tong, et al.
Publicado: (2025)
HREF: Human Response-Guided Evaluation of Instruction Following in Language Models
por: Lyu, Xinxi, et al.
Publicado: (2024)
por: Lyu, Xinxi, et al.
Publicado: (2024)
Merge to Learn: Efficiently Adding Skills to Language Models with Model Merging
por: Morrison, Jacob, et al.
Publicado: (2024)
por: Morrison, Jacob, et al.
Publicado: (2024)
Trust or Escalate: LLM Judges with Provable Guarantees for Human Agreement
por: Jung, Jaehun, et al.
Publicado: (2024)
por: Jung, Jaehun, et al.
Publicado: (2024)
Reasoning Up the Instruction Ladder for Controllable Language Models
por: Zheng, Zishuo, et al.
Publicado: (2025)
por: Zheng, Zishuo, et al.
Publicado: (2025)
Creativity Support in the Age of Large Language Models: An Empirical Study Involving Emerging Writers
por: Chakrabarty, Tuhin, et al.
Publicado: (2023)
por: Chakrabarty, Tuhin, et al.
Publicado: (2023)
DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research
por: Shao, Rulin, et al.
Publicado: (2025)
por: Shao, Rulin, et al.
Publicado: (2025)
The Curious Case of Factuality Finetuning: Models' Internal Beliefs Can Improve Factuality
por: Newman, Benjamin, et al.
Publicado: (2025)
por: Newman, Benjamin, et al.
Publicado: (2025)
PrefDisco: Benchmarking Proactive Personalized Reasoning
por: Li, Shuyue Stella, et al.
Publicado: (2025)
por: Li, Shuyue Stella, et al.
Publicado: (2025)
Evaluating In-Context Learning of Libraries for Code Generation
por: Patel, Arkil, et al.
Publicado: (2023)
por: Patel, Arkil, et al.
Publicado: (2023)
Data Selection for Multi-turn Dialogue Instruction Tuning
por: Li, Bo, et al.
Publicado: (2026)
por: Li, Bo, et al.
Publicado: (2026)
Tulu 3: Pushing Frontiers in Open Language Model Post-Training
por: Lambert, Nathan, et al.
Publicado: (2024)
por: Lambert, Nathan, et al.
Publicado: (2024)
TRAM: Bridging Trust Regions and Sharpness Aware Minimization
por: Sherborne, Tom, et al.
Publicado: (2023)
por: Sherborne, Tom, et al.
Publicado: (2023)
Train for Truth, Keep the Skills: Binary Retrieval-Augmented Reward Mitigates Hallucinations
por: Chen, Tong, et al.
Publicado: (2025)
por: Chen, Tong, et al.
Publicado: (2025)
A Survey on Data Selection for LLM Instruction Tuning
por: Zhang, Bolin, et al.
Publicado: (2024)
por: Zhang, Bolin, et al.
Publicado: (2024)
Neuron-Aware Data Selection In Instruction Tuning For Large Language Models
por: Chen, Xin, et al.
Publicado: (2026)
por: Chen, Xin, et al.
Publicado: (2026)
On the Sensitivity of Instruction-tuned LLMs to Harmful Sentences in Long Inputs
por: Ghorbanpour, Faeze, et al.
Publicado: (2025)
por: Ghorbanpour, Faeze, et al.
Publicado: (2025)
Phased Instruction Fine-Tuning for Large Language Models
por: Pang, Wei, et al.
Publicado: (2024)
por: Pang, Wei, et al.
Publicado: (2024)
Cold-Start Personalization via Training-Free Priors from Structured World Models
por: Bose, Avinandan, et al.
Publicado: (2026)
por: Bose, Avinandan, et al.
Publicado: (2026)
The Art of Saying No: Contextual Noncompliance in Language Models
por: Brahman, Faeze, et al.
Publicado: (2024)
por: Brahman, Faeze, et al.
Publicado: (2024)
RESTOR: Knowledge Recovery in Machine Unlearning
por: Rezaei, Keivan, et al.
Publicado: (2024)
por: Rezaei, Keivan, et al.
Publicado: (2024)
Small Reward Models via Backward Inference
por: Wang, Yike, et al.
Publicado: (2026)
por: Wang, Yike, et al.
Publicado: (2026)
Instruction Mining: Instruction Data Selection for Tuning Large Language Models
por: Cao, Yihan, et al.
Publicado: (2023)
por: Cao, Yihan, et al.
Publicado: (2023)
Tailoring with Targeted Precision: Edit-Based Agents for Open-Domain Procedure Customization
por: Lal, Yash Kumar, et al.
Publicado: (2023)
por: Lal, Yash Kumar, et al.
Publicado: (2023)
IterSelectTune: An Iterative Training Framework for Efficient Instruction-Tuning Data Selection
por: Song, Jielin, et al.
Publicado: (2024)
por: Song, Jielin, et al.
Publicado: (2024)
Leftover Lunch: Advantage-based Offline Reinforcement Learning for Language Models
por: Baheti, Ashutosh, et al.
Publicado: (2023)
por: Baheti, Ashutosh, et al.
Publicado: (2023)
Importance-Aware Data Selection for Efficient LLM Instruction Tuning
por: Jiang, Tingyu, et al.
Publicado: (2025)
por: Jiang, Tingyu, et al.
Publicado: (2025)
Local Interpretations for Explainable Natural Language Processing: A Survey
por: Luo, Siwen, et al.
Publicado: (2021)
por: Luo, Siwen, et al.
Publicado: (2021)
IssueBench: Millions of Realistic Prompts for Measuring Issue Bias in LLM Writing Assistance
por: Röttger, Paul, et al.
Publicado: (2025)
por: Röttger, Paul, et al.
Publicado: (2025)
MathScale: Scaling Instruction Tuning for Mathematical Reasoning
por: Tang, Zhengyang, et al.
Publicado: (2024)
por: Tang, Zhengyang, et al.
Publicado: (2024)
Instructional Fingerprinting of Large Language Models
por: Xu, Jiashu, et al.
Publicado: (2024)
por: Xu, Jiashu, et al.
Publicado: (2024)
WildTeaming at Scale: From In-the-Wild Jailbreaks to (Adversarially) Safer Language Models
por: Jiang, Liwei, et al.
Publicado: (2024)
por: Jiang, Liwei, et al.
Publicado: (2024)
Selective Reflection-Tuning: Student-Selected Data Recycling for LLM Instruction-Tuning
por: Li, Ming, et al.
Publicado: (2024)
por: Li, Ming, et al.
Publicado: (2024)
Instruction Data Selection via Answer Divergence
por: Li, Bo, et al.
Publicado: (2026)
por: Li, Bo, et al.
Publicado: (2026)
RICo: Refined In-Context Contribution for Automatic Instruction-Tuning Data Selection
por: Yang, Yixin, et al.
Publicado: (2025)
por: Yang, Yixin, et al.
Publicado: (2025)
Ejemplares similares
-
Meta-Reinforcement Learning with Self-Reflection for Agentic Search
por: Xiao, Teng, et al.
Publicado: (2026) -
Generalizing Verifiable Instruction Following
por: Pyatkin, Valentina, et al.
Publicado: (2025) -
TESS 2: A Large-Scale Generalist Diffusion Language Model
por: Tae, Jaesung, et al.
Publicado: (2025) -
Hybrid Preferences: Learning to Route Instances for Human vs. AI Feedback
por: Miranda, Lester James V., et al.
Publicado: (2024) -
Information-Theoretic Distillation for Reference-less Summarization
por: Jung, Jaehun, et al.
Publicado: (2024)