Data Diversity Matters for Robust Instruction Tuning
Fuente:
arXiv
Salvato in:
| Autori principali: | Bukharin, Alexander, Li, Shiyang, Wang, Zhengyang, Yang, Jingfeng, Yin, Bing, Li, Xian, Zhang, Chao, Zhao, Tuo, Jiang, Haoming |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
RNR: Teaching Large Language Models to Follow Roles and Rules
di: Wang, Kuan, et al.
Pubblicazione: (2024)
di: Wang, Kuan, et al.
Pubblicazione: (2024)
Robust Reinforcement Learning from Corrupted Human Feedback
di: Bukharin, Alexander, et al.
Pubblicazione: (2024)
di: Bukharin, Alexander, et al.
Pubblicazione: (2024)
Adaptive Preference Scaling for Reinforcement Learning with Human Feedback
di: Hong, Ilgee, et al.
Pubblicazione: (2024)
di: Hong, Ilgee, et al.
Pubblicazione: (2024)
Self-Rewarding PPO: Aligning Large Language Models with Demonstrations Only
di: Zhang, Qingru, et al.
Pubblicazione: (2025)
di: Zhang, Qingru, et al.
Pubblicazione: (2025)
Can Language Models Follow Multiple Turns of Entangled Instructions?
di: Han, Chi, et al.
Pubblicazione: (2025)
di: Han, Chi, et al.
Pubblicazione: (2025)
MEMORYLLM: Towards Self-Updatable Large Language Models
di: Wang, Yu, et al.
Pubblicazione: (2024)
di: Wang, Yu, et al.
Pubblicazione: (2024)
Deep Reinforcement Learning from Hierarchical Preference Design
di: Bukharin, Alexander, et al.
Pubblicazione: (2023)
di: Bukharin, Alexander, et al.
Pubblicazione: (2023)
MathScale: Scaling Instruction Tuning for Mathematical Reasoning
di: Tang, Zhengyang, et al.
Pubblicazione: (2024)
di: Tang, Zhengyang, et al.
Pubblicazione: (2024)
Training LLMs for Multi-Step Tool Orchestration with Constrained Data Synthesis and Graduated Rewards
di: Jiayang, Cheng, et al.
Pubblicazione: (2026)
di: Jiayang, Cheng, et al.
Pubblicazione: (2026)
IHEval: Evaluating Language Models on Following the Instruction Hierarchy
di: Zhang, Zhihan, et al.
Pubblicazione: (2025)
di: Zhang, Zhihan, et al.
Pubblicazione: (2025)
Backdooring Instruction-Tuned Large Language Models with Virtual Prompt Injection
di: Yan, Jun, et al.
Pubblicazione: (2023)
di: Yan, Jun, et al.
Pubblicazione: (2023)
Diversity Measurement and Subset Selection for Instruction Tuning Datasets
di: Wang, Peiqi, et al.
Pubblicazione: (2024)
di: Wang, Peiqi, et al.
Pubblicazione: (2024)
What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning
di: Zhu, Yuchang, et al.
Pubblicazione: (2025)
di: Zhu, Yuchang, et al.
Pubblicazione: (2025)
HelpSteer3-Preference: Open Human-Annotated Preference Data across Diverse Tasks and Languages
di: Wang, Zhilin, et al.
Pubblicazione: (2025)
di: Wang, Zhilin, et al.
Pubblicazione: (2025)
Hephaestus: Improving Fundamental Agent Capabilities of Large Language Models through Continual Pre-Training
di: Zhuang, Yuchen, et al.
Pubblicazione: (2025)
di: Zhuang, Yuchen, et al.
Pubblicazione: (2025)
Contrastive Instruction Tuning
di: Yan, Tianyi Lorena, et al.
Pubblicazione: (2024)
di: Yan, Tianyi Lorena, et al.
Pubblicazione: (2024)
The Right Time Matters: Data Arrangement Affects Zero-Shot Generalization in Instruction Tuning
di: He, Bingxiang, et al.
Pubblicazione: (2024)
di: He, Bingxiang, et al.
Pubblicazione: (2024)
Position-Aware Parameter Efficient Fine-Tuning Approach for Reducing Positional Bias in LLMs
di: Zhang, Zheng, et al.
Pubblicazione: (2024)
di: Zhang, Zheng, et al.
Pubblicazione: (2024)
Instruction Fine-Tuning: Does Prompt Loss Matter?
di: Huerta-Enochian, Mathew, et al.
Pubblicazione: (2024)
di: Huerta-Enochian, Mathew, et al.
Pubblicazione: (2024)
Situated Natural Language Explanations
di: Zhu, Zining, et al.
Pubblicazione: (2023)
di: Zhu, Zining, et al.
Pubblicazione: (2023)
Selective Reflection-Tuning: Student-Selected Data Recycling for LLM Instruction-Tuning
di: Li, Ming, et al.
Pubblicazione: (2024)
di: Li, Ming, et al.
Pubblicazione: (2024)
Improving Influence-based Instruction Tuning Data Selection for Balanced Learning of Diverse Capabilities
di: Dai, Qirun, et al.
Pubblicazione: (2025)
di: Dai, Qirun, et al.
Pubblicazione: (2025)
The Best Instruction-Tuning Data are Those That Fit
di: Zhang, Dylan, et al.
Pubblicazione: (2025)
di: Zhang, Dylan, et al.
Pubblicazione: (2025)
HeaPA: Difficulty-Aware Heap Sampling and On-Policy Query Augmentation for LLM Reinforcement Learning
di: Wang, Weiqi, et al.
Pubblicazione: (2026)
di: Wang, Weiqi, et al.
Pubblicazione: (2026)
Picky LLMs and Unreliable RMs: An Empirical Study on Safety Alignment after Instruction Tuning
di: Li, Guanlin, et al.
Pubblicazione: (2025)
di: Li, Guanlin, et al.
Pubblicazione: (2025)
Parrot: Multilingual Visual Instruction Tuning
di: Sun, Hai-Long, et al.
Pubblicazione: (2024)
di: Sun, Hai-Long, et al.
Pubblicazione: (2024)
Contextual Text Denoising with Masked Language Models
di: Sun, Yifu, et al.
Pubblicazione: (2019)
di: Sun, Yifu, et al.
Pubblicazione: (2019)
Scaling Laws for Predicting Downstream Performance in LLMs
di: Chen, Yangyi, et al.
Pubblicazione: (2024)
di: Chen, Yangyi, et al.
Pubblicazione: (2024)
Instruction Tuning for Large Language Models: A Survey
di: Zhang, Shengyu, et al.
Pubblicazione: (2023)
di: Zhang, Shengyu, et al.
Pubblicazione: (2023)
Instruction Mining: Instruction Data Selection for Tuning Large Language Models
di: Cao, Yihan, et al.
Pubblicazione: (2023)
di: Cao, Yihan, et al.
Pubblicazione: (2023)
MDIT: A Model-free Data Interpolation Method for Diverse Instruction Tuning
di: Li, Yangning, et al.
Pubblicazione: (2025)
di: Li, Yangning, et al.
Pubblicazione: (2025)
What Makes Good Data for Alignment? A Comprehensive Study of Automatic Data Selection in Instruction Tuning
di: Liu, Wei, et al.
Pubblicazione: (2023)
di: Liu, Wei, et al.
Pubblicazione: (2023)
Measuring Data Diversity for Instruction Tuning: A Systematic Analysis and A Reliable Metric
di: Yang, Yuming, et al.
Pubblicazione: (2025)
di: Yang, Yuming, et al.
Pubblicazione: (2025)
CoMMIT: Coordinated Multimodal Instruction Tuning
di: Li, Xintong, et al.
Pubblicazione: (2024)
di: Li, Xintong, et al.
Pubblicazione: (2024)
Objective Matters: Fine-Tuning Objectives Shape Safety, Robustness, and Persona Drift
di: Vennemeyer, Daniel, et al.
Pubblicazione: (2026)
di: Vennemeyer, Daniel, et al.
Pubblicazione: (2026)
TAGCOS: Task-agnostic Gradient Clustered Coreset Selection for Instruction Tuning Data
di: Zhang, Jipeng, et al.
Pubblicazione: (2024)
di: Zhang, Jipeng, et al.
Pubblicazione: (2024)
Supervised Fine-Tuning Achieve Rapid Task Adaption Via Alternating Attention Head Activation Patterns
di: Zhao, Yang, et al.
Pubblicazione: (2024)
di: Zhao, Yang, et al.
Pubblicazione: (2024)
SMART: Submodular Data Mixture Strategy for Instruction Tuning
di: Renduchintala, H S V N S Kowndinya, et al.
Pubblicazione: (2024)
di: Renduchintala, H S V N S Kowndinya, et al.
Pubblicazione: (2024)
LESS: Selecting Influential Data for Targeted Instruction Tuning
di: Xia, Mengzhou, et al.
Pubblicazione: (2024)
di: Xia, Mengzhou, et al.
Pubblicazione: (2024)
ROSE: A Reward-Oriented Data Selection Framework for LLM Task-Specific Instruction Tuning
di: Wu, Yang, et al.
Pubblicazione: (2024)
di: Wu, Yang, et al.
Pubblicazione: (2024)
Documenti analoghi
-
RNR: Teaching Large Language Models to Follow Roles and Rules
di: Wang, Kuan, et al.
Pubblicazione: (2024) -
Robust Reinforcement Learning from Corrupted Human Feedback
di: Bukharin, Alexander, et al.
Pubblicazione: (2024) -
Adaptive Preference Scaling for Reinforcement Learning with Human Feedback
di: Hong, Ilgee, et al.
Pubblicazione: (2024) -
Self-Rewarding PPO: Aligning Large Language Models with Demonstrations Only
di: Zhang, Qingru, et al.
Pubblicazione: (2025) -
Can Language Models Follow Multiple Turns of Entangled Instructions?
di: Han, Chi, et al.
Pubblicazione: (2025)