Data Distribution as a Lever for Guiding Optimizers Toward Superior Generalization in LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gangavarapu, Tushaar, Li, Jiping, Vattheuer, Christopher, Wang, Zhangyang, Mirzasoleiman, Baharan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions
par: Xue, Yihao, et autres
Publié: (2025)
par: Xue, Yihao, et autres
Publié: (2025)
Data-Efficient Contrastive Self-supervised Learning: Most Beneficial Examples for Supervised Learning Contribute the Least
par: Joshi, Siddharth, et autres
Publié: (2023)
par: Joshi, Siddharth, et autres
Publié: (2023)
Tuning the Implicit Regularizer of Masked Diffusion Language Models: Enhancing Generalization via Insights from $k$-Parity
par: Huang, Jianhao, et autres
Publié: (2026)
par: Huang, Jianhao, et autres
Publié: (2026)
GPT-2 Through the Lens of Vector Symbolic Architectures
par: Knittel, Johannes, et autres
Publié: (2024)
par: Knittel, Johannes, et autres
Publié: (2024)
Understanding the Role of Training Data in Test-Time Scaling
par: Javanmard, Adel, et autres
Publié: (2025)
par: Javanmard, Adel, et autres
Publié: (2025)
Theoretical Perspectives on Data Quality and Synergistic Effects in Pre- and Post-Training Reasoning Models
par: Javanmard, Adel, et autres
Publié: (2026)
par: Javanmard, Adel, et autres
Publié: (2026)
Changing the Training Data Distribution to Reduce Simplicity Bias Improves In-distribution Generalization
par: Nguyen, Dang, et autres
Publié: (2024)
par: Nguyen, Dang, et autres
Publié: (2024)
Better Safe than Sorry: Pre-training CLIP against Targeted Data Poisoning and Backdoor Attacks
par: Yang, Wenhan, et autres
Publié: (2023)
par: Yang, Wenhan, et autres
Publié: (2023)
SmallToLarge (S2L): Scalable Data Selection for Fine-tuning Large Language Models by Summarizing Training Trajectories of Small Models
par: Yang, Yu, et autres
Publié: (2024)
par: Yang, Yu, et autres
Publié: (2024)
Mini-batch Coresets for Memory-efficient Language Model Training on Data Mixtures
par: Nguyen, Dang, et autres
Publié: (2024)
par: Nguyen, Dang, et autres
Publié: (2024)
LoRA is All You Need for Safety Alignment of Reasoning LLMs
par: Xue, Yihao, et autres
Publié: (2025)
par: Xue, Yihao, et autres
Publié: (2025)
IMAS: A Comprehensive Agentic Approach to Rural Healthcare Delivery
par: Gangavarapu, Agasthya, et autres
Publié: (2024)
par: Gangavarapu, Agasthya, et autres
Publié: (2024)
Do We Need All the Synthetic Data? Targeted Image Augmentation via Diffusion Models
par: Nguyen, Dang, et autres
Publié: (2025)
par: Nguyen, Dang, et autres
Publié: (2025)
How Transformers Learn to Plan via Multi-Token Prediction
par: Huang, Jianhao, et autres
Publié: (2026)
par: Huang, Jianhao, et autres
Publié: (2026)
Introducing L2M3, A Multilingual Medical Large Language Model to Advance Health Equity in Low-Resource Regions
par: Gangavarapu, Agasthya
Publié: (2024)
par: Gangavarapu, Agasthya
Publié: (2024)
Graph Contrastive Learning under Heterophily via Graph Filters
par: Yang, Wenhan, et autres
Publié: (2023)
par: Yang, Wenhan, et autres
Publié: (2023)
Dataset Distillation via Knowledge Distillation: Towards Efficient Self-Supervised Pre-Training of Deep Networks
par: Joshi, Siddharth, et autres
Publié: (2024)
par: Joshi, Siddharth, et autres
Publié: (2024)
NeWRF: A Deep Learning Framework for Wireless Radiation Field Reconstruction and Channel Prediction
par: Lu, Haofan, et autres
Publié: (2024)
par: Lu, Haofan, et autres
Publié: (2024)
Investigating the Impact of Model Width and Density on Generalization in Presence of Label Noise
par: Xue, Yihao, et autres
Publié: (2022)
par: Xue, Yihao, et autres
Publié: (2022)
Position: Weight Space Should Be a First-Class Generative AI Modality
par: Wang, Zhangyang, et autres
Publié: (2026)
par: Wang, Zhangyang, et autres
Publié: (2026)
Understanding the Robustness of Multi-modal Contrastive Learning to Distribution Shift
par: Xue, Yihao, et autres
Publié: (2023)
par: Xue, Yihao, et autres
Publié: (2023)
MambaByte: Token-free Selective State Space Model
par: Wang, Junxiong, et autres
Publié: (2024)
par: Wang, Junxiong, et autres
Publié: (2024)
Risk Phase Transitions in Spiked Regression: Alignment Driven Benign and Catastrophic Overfitting
par: Li, Jiping, et autres
Publié: (2025)
par: Li, Jiping, et autres
Publié: (2025)
Joint Optimization of Resource Allocation and Data Selection for Fast and Cost-Efficient Federated Edge Learning
par: Jia, Yunjian, et autres
Publié: (2024)
par: Jia, Yunjian, et autres
Publié: (2024)
PIPA: Preference Alignment as Prior-Informed Statistical Estimation
par: Li, Junbo, et autres
Publié: (2025)
par: Li, Junbo, et autres
Publié: (2025)
Junk DNA Hypothesis: Pruning Small Pre-Trained Weights Irreversibly and Monotonically Impairs "Difficult" Downstream Tasks in LLMs
par: Yin, Lu, et autres
Publié: (2023)
par: Yin, Lu, et autres
Publié: (2023)
Throughput Optimization as a Strategic Lever in Large-Scale AI Systems: Evidence from Dataloader and Memory Profiling Innovations
par: Jha, Mayank
Publié: (2026)
par: Jha, Mayank
Publié: (2026)
GRC-Net: Gram Residual Co-attention Net for epilepsy prediction
par: You, Bihao, et autres
Publié: (2025)
par: You, Bihao, et autres
Publié: (2025)
Beyond Semantic Entropy: Boosting LLM Uncertainty Quantification with Pairwise Semantic Similarity
par: Nguyen, Dang, et autres
Publié: (2025)
par: Nguyen, Dang, et autres
Publié: (2025)
Neon: Negative Extrapolation From Self-Training Improves Image Generation
par: Alemohammad, Sina, et autres
Publié: (2025)
par: Alemohammad, Sina, et autres
Publié: (2025)
Collaborative Expert LLMs Guided Multi-Objective Molecular Optimization
par: Yu, Jiajun, et autres
Publié: (2025)
par: Yu, Jiajun, et autres
Publié: (2025)
Not All Synthetic Data Is Yours to Learn From
par: Alemohammad, Sina, et autres
Publié: (2026)
par: Alemohammad, Sina, et autres
Publié: (2026)
Can LLMs Leverage Observational Data? Towards Data-Driven Causal Discovery with LLMs
par: Susanti, Yuni, et autres
Publié: (2025)
par: Susanti, Yuni, et autres
Publié: (2025)
Optimized Feature Generation for Tabular Data via LLMs with Decision Tree Reasoning
par: Nam, Jaehyun, et autres
Publié: (2024)
par: Nam, Jaehyun, et autres
Publié: (2024)
Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap
par: Yang, Wenhan, et autres
Publié: (2025)
par: Yang, Wenhan, et autres
Publié: (2025)
A Practical Guide for Evaluating LLMs and LLM-Reliant Systems
par: Rudd, Ethan M., et autres
Publié: (2025)
par: Rudd, Ethan M., et autres
Publié: (2025)
Data-Efficient Contrastive Language-Image Pretraining: Prioritizing Data Quality over Quantity
par: Joshi, Siddharth, et autres
Publié: (2024)
par: Joshi, Siddharth, et autres
Publié: (2024)
Recurrent Diffusion for Large-Scale Parameter Generation
par: Wang, Kai, et autres
Publié: (2025)
par: Wang, Kai, et autres
Publié: (2025)
Robust Guided Diffusion for Offline Black-Box Optimization
par: Chen, Can Sam, et autres
Publié: (2024)
par: Chen, Can Sam, et autres
Publié: (2024)
Generalizing Few Data to Unseen Domains Flexibly Based on Label Smoothing Integrated with Distributionally Robust Optimization
par: Wang, Yangdi, et autres
Publié: (2024)
par: Wang, Yangdi, et autres
Publié: (2024)
Documents similaires
-
Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions
par: Xue, Yihao, et autres
Publié: (2025) -
Data-Efficient Contrastive Self-supervised Learning: Most Beneficial Examples for Supervised Learning Contribute the Least
par: Joshi, Siddharth, et autres
Publié: (2023) -
Tuning the Implicit Regularizer of Masked Diffusion Language Models: Enhancing Generalization via Insights from $k$-Parity
par: Huang, Jianhao, et autres
Publié: (2026) -
GPT-2 Through the Lens of Vector Symbolic Architectures
par: Knittel, Johannes, et autres
Publié: (2024) -
Understanding the Role of Training Data in Test-Time Scaling
par: Javanmard, Adel, et autres
Publié: (2025)