Rethinking Data Curation in LLM Training: Online Reweighting Offers Better Generalization than Offline Methods
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhao, Wanru, Chen, Yihong, Tang, Yuzhi, Ma, Wentao, Hu, Shengchao, Hu, Shell Xu, Iacob, Alex, Mehrotra, Abhinav, Lane, Nicholas D. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics
por: Zhao, Wanru, et al.
Publicado: (2025)
por: Zhao, Wanru, et al.
Publicado: (2025)
Photon: Federated LLM Pre-Training
por: Sani, Lorenzo, et al.
Publicado: (2024)
por: Sani, Lorenzo, et al.
Publicado: (2024)
Energy-Based Preference Model Offers Better Offline Alignment than the Bradley-Terry Preference Model
por: Hong, Yuzhong, et al.
Publicado: (2024)
por: Hong, Yuzhong, et al.
Publicado: (2024)
Larger Scale Offers Better Security in the Nakamoto-style Blockchain
por: Hu, Junjie
Publicado: (2025)
por: Hu, Junjie
Publicado: (2025)
LLM Unlearning via Neural Activation Redirection
por: Shen, William F., et al.
Publicado: (2025)
por: Shen, William F., et al.
Publicado: (2025)
SparsyFed: Sparse Adaptive Federated Training
por: Guastella, Adriano, et al.
Publicado: (2025)
por: Guastella, Adriano, et al.
Publicado: (2025)
Worldwide Federated Training of Language Models
por: Iacob, Alex, et al.
Publicado: (2024)
por: Iacob, Alex, et al.
Publicado: (2024)
Locally Estimated Global Perturbations are Better than Local Perturbations for Federated Sharpness-aware Minimization
por: Fan, Ziqing, et al.
Publicado: (2024)
por: Fan, Ziqing, et al.
Publicado: (2024)
Advancing AI-assisted Hardware Design with Hierarchical Decentralized Training and Personalized Inference-Time Optimization
por: Chen, Hao Mark, et al.
Publicado: (2025)
por: Chen, Hao Mark, et al.
Publicado: (2025)
Prompt Tuning with Diffusion for Few-Shot Pre-trained Policy Generalization
por: Hu, Shengchao, et al.
Publicado: (2024)
por: Hu, Shengchao, et al.
Publicado: (2024)
Rethinking the Role of Dynamic Sparse Training for Scalable Deep Reinforcement Learning
por: Ma, Guozheng, et al.
Publicado: (2025)
por: Ma, Guozheng, et al.
Publicado: (2025)
Pollen: High-throughput Federated Learning Simulation via Resource-Aware Client Placement
por: Sani, Lorenzo, et al.
Publicado: (2023)
por: Sani, Lorenzo, et al.
Publicado: (2023)
FedAnchor: Enhancing Federated Semi-Supervised Learning with Label Contrastive Loss for Unlabeled Clients
por: Qiu, Xinchi, et al.
Publicado: (2024)
por: Qiu, Xinchi, et al.
Publicado: (2024)
Breaking Physical and Linguistic Borders: Multilingual Federated Prompt Tuning for Low-Resource Languages
por: Zhao, Wanru, et al.
Publicado: (2025)
por: Zhao, Wanru, et al.
Publicado: (2025)
Steppe productivity
por: Tang, Wanru
Publicado: (2026)
por: Tang, Wanru
Publicado: (2026)
Beyond Scaling: Agents Are Heading to the Edge
por: Tian, Chunlin, et al.
Publicado: (2026)
por: Tian, Chunlin, et al.
Publicado: (2026)
Reward Difference Optimization For Sample Reweighting In Offline RLHF
por: Wang, Shiqi, et al.
Publicado: (2024)
por: Wang, Shiqi, et al.
Publicado: (2024)
Solving Continual Offline RL through Selective Weights Activation on Aligned Spaces
por: Hu, Jifeng, et al.
Publicado: (2024)
por: Hu, Jifeng, et al.
Publicado: (2024)
HarmoDT: Harmony Multi-Task Decision Transformer for Offline Reinforcement Learning
por: Hu, Shengchao, et al.
Publicado: (2024)
por: Hu, Shengchao, et al.
Publicado: (2024)
The Future of Large Language Model Pre-training is Federated
por: Sani, Lorenzo, et al.
Publicado: (2024)
por: Sani, Lorenzo, et al.
Publicado: (2024)
Q-value Regularized Transformer for Offline Reinforcement Learning
por: Hu, Shengchao, et al.
Publicado: (2024)
por: Hu, Shengchao, et al.
Publicado: (2024)
SkillBrew: Multi-Objective Curation of Skill Banks for LLM Agents
por: Hu, Wentao, et al.
Publicado: (2026)
por: Hu, Wentao, et al.
Publicado: (2026)
Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning
por: Hu, Jifeng, et al.
Publicado: (2025)
por: Hu, Jifeng, et al.
Publicado: (2025)
Filter-then-Weight: Online Data Selection and Reweighting for LLM Fine-Tuning
por: Wang, Fangxin, et al.
Publicado: (2026)
por: Wang, Fangxin, et al.
Publicado: (2026)
Noise Consistency Training: A Native Approach for One-Step Generator in Learning Additional Controls
por: Luo, Yihong, et al.
Publicado: (2025)
por: Luo, Yihong, et al.
Publicado: (2025)
China’s Gas Development Strategies
por: Shell Centre
por: Shell Centre
Autoguided Online Data Curation for Diffusion Model Training
por: Pais, Valeria, et al.
Publicado: (2025)
por: Pais, Valeria, et al.
Publicado: (2025)
Online Pre-Training for Offline-to-Online Reinforcement Learning
por: Shin, Yongjae, et al.
Publicado: (2025)
por: Shin, Yongjae, et al.
Publicado: (2025)
Task-Aware Harmony Multi-Task Decision Transformer for Offline Reinforcement Learning
por: Fan, Ziqing, et al.
Publicado: (2024)
por: Fan, Ziqing, et al.
Publicado: (2024)
Response-Conditioned Parallel-to-Sequential Orchestration for Multi-Agent Systems
por: Tastan, Nurbek, et al.
Publicado: (2026)
por: Tastan, Nurbek, et al.
Publicado: (2026)
Conservative Offline Robot Policy Learning via Posterior-Transition Reweighting
por: Zhang, Wanpeng, et al.
Publicado: (2026)
por: Zhang, Wanpeng, et al.
Publicado: (2026)
Demystifying Diffusion Objectives: Reweighted Losses are Better Variational Bounds
por: Shi, Jiaxin, et al.
Publicado: (2025)
por: Shi, Jiaxin, et al.
Publicado: (2025)
Enhancing Data Quality in Federated Fine-Tuning of Foundation Models
por: Zhao, Wanru, et al.
Publicado: (2024)
por: Zhao, Wanru, et al.
Publicado: (2024)
MarcoPolo: A Zero-Permission Attack for Location Type Inference from the Magnetic Field using Mobile Devices
por: Perez, Beatrice, et al.
Publicado: (2026)
por: Perez, Beatrice, et al.
Publicado: (2026)
Robust Online Selection with Uncertain Offer Acceptance
por: Perez-Salazar, Sebastian, et al.
Publicado: (2021)
por: Perez-Salazar, Sebastian, et al.
Publicado: (2021)
Is Mamba Compatible with Trajectory Optimization in Offline Reinforcement Learning?
por: Dai, Yang, et al.
Publicado: (2024)
por: Dai, Yang, et al.
Publicado: (2024)
Combatting Dimensional Collapse in LLM Pre-Training Data via Diversified File Selection
por: Fan, Ziqing, et al.
Publicado: (2025)
por: Fan, Ziqing, et al.
Publicado: (2025)
Quaternionic Reweighted Amplitude Flow for Phase Retrieval in Image Reconstruction
por: Hu, Ren, et al.
Publicado: (2025)
por: Hu, Ren, et al.
Publicado: (2025)
Bayesian Design Principles for Offline-to-Online Reinforcement Learning
por: Hu, Hao, et al.
Publicado: (2024)
por: Hu, Hao, et al.
Publicado: (2024)
Meta Co-Training: Two Views are Better than One
por: Rothenberger, Jay C., et al.
Publicado: (2023)
por: Rothenberger, Jay C., et al.
Publicado: (2023)
Ejemplares similares
-
CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics
por: Zhao, Wanru, et al.
Publicado: (2025) -
Photon: Federated LLM Pre-Training
por: Sani, Lorenzo, et al.
Publicado: (2024) -
Energy-Based Preference Model Offers Better Offline Alignment than the Bradley-Terry Preference Model
por: Hong, Yuzhong, et al.
Publicado: (2024) -
Larger Scale Offers Better Security in the Nakamoto-style Blockchain
por: Hu, Junjie
Publicado: (2025) -
LLM Unlearning via Neural Activation Redirection
por: Shen, William F., et al.
Publicado: (2025)