Majority Kernels: An Approach to Leverage Big Model Dynamics for Efficient Small Model Training
Fuente:
arXiv
Salvato in:
| Autori principali: | Mazzawi, Hanna, Awasthi, Pranjal, Gonzalvo, Xavi, Ramalingam, Srikumar |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Deep Fusion: Efficient Network Training via Pre-trained Initializations
di: Mazzawi, Hanna, et al.
Pubblicazione: (2023)
di: Mazzawi, Hanna, et al.
Pubblicazione: (2023)
Grow, Don't Overwrite: Fine-tuning Without Forgetting
di: Adila, Dyah, et al.
Pubblicazione: (2026)
di: Adila, Dyah, et al.
Pubblicazione: (2026)
On Distributed Larger-Than-Memory Subset Selection With Pairwise Submodular Functions
di: Böther, Maximilian, et al.
Pubblicazione: (2024)
di: Böther, Maximilian, et al.
Pubblicazione: (2024)
Transmuting prompts into weights
di: Mazzawi, Hanna, et al.
Pubblicazione: (2025)
di: Mazzawi, Hanna, et al.
Pubblicazione: (2025)
Learning without training: The implicit dynamics of in-context learning
di: Dherin, Benoit, et al.
Pubblicazione: (2025)
di: Dherin, Benoit, et al.
Pubblicazione: (2025)
How iteration order influences convergence and stability in deep learning
di: Dherin, Benoit, et al.
Pubblicazione: (2025)
di: Dherin, Benoit, et al.
Pubblicazione: (2025)
Learning by solving differential equations
di: Dherin, Benoit, et al.
Pubblicazione: (2025)
di: Dherin, Benoit, et al.
Pubblicazione: (2025)
The Limits of Preference Data for Post-Training
di: Zhao, Eric, et al.
Pubblicazione: (2025)
di: Zhao, Eric, et al.
Pubblicazione: (2025)
Leveraging GANs For Active Appearance Models Optimized Model Fitting
di: Awasthi, Anurag
Pubblicazione: (2025)
di: Awasthi, Anurag
Pubblicazione: (2025)
Sample-Efficient Optimization over Generative Priors via Coarse Learnability
di: Awasthi, Pranjal, et al.
Pubblicazione: (2025)
di: Awasthi, Pranjal, et al.
Pubblicazione: (2025)
Analyzing Similarity Metrics for Data Selection for Language Model Pretraining
di: Sam, Dylan, et al.
Pubblicazione: (2025)
di: Sam, Dylan, et al.
Pubblicazione: (2025)
Sample, Scrutinize and Scale: Effective Inference-Time Search by Scaling Verification
di: Zhao, Eric, et al.
Pubblicazione: (2025)
di: Zhao, Eric, et al.
Pubblicazione: (2025)
From Style to Facts: Mapping the Boundaries of Knowledge Injection with Finetuning
di: Zhao, Eric, et al.
Pubblicazione: (2025)
di: Zhao, Eric, et al.
Pubblicazione: (2025)
Agnostic Learning of General ReLU Activation Using Gradient Descent
di: Awasthi, Pranjal, et al.
Pubblicazione: (2022)
di: Awasthi, Pranjal, et al.
Pubblicazione: (2022)
Stacking as Accelerated Gradient Descent
di: Agarwal, Naman, et al.
Pubblicazione: (2024)
di: Agarwal, Naman, et al.
Pubblicazione: (2024)
Learning Neural Networks with Sparse Activations
di: Awasthi, Pranjal, et al.
Pubblicazione: (2024)
di: Awasthi, Pranjal, et al.
Pubblicazione: (2024)
Uncertainty-Aware Tabular Prediction: Evaluating VBLL-Enhanced TabPFN in Safety-Critical Medical Data
di: Ramalingam, Madhushan
Pubblicazione: (2025)
di: Ramalingam, Madhushan
Pubblicazione: (2025)
GIST: Greedy Independent Set Thresholding for Max-Min Diversification with Submodular Utility
di: Fahrbach, Matthew, et al.
Pubblicazione: (2024)
di: Fahrbach, Matthew, et al.
Pubblicazione: (2024)
Energy Efficient Protein Language Models: Leveraging Small Language Models with LoRA for Controllable Protein Generation
di: Shah, Aayush, et al.
Pubblicazione: (2024)
di: Shah, Aayush, et al.
Pubblicazione: (2024)
Language verY Rare for All
di: Merad, Ibrahim, et al.
Pubblicazione: (2024)
di: Merad, Ibrahim, et al.
Pubblicazione: (2024)
Big2Small: A Unifying Neural Network Framework for Model Compression
di: Liao, Jing-Xiao, et al.
Pubblicazione: (2026)
di: Liao, Jing-Xiao, et al.
Pubblicazione: (2026)
Learnware of Language Models: Specialized Small Language Models Can Do Big
di: Tan, Zhi-Hao, et al.
Pubblicazione: (2025)
di: Tan, Zhi-Hao, et al.
Pubblicazione: (2025)
BigMac: A Communication-Efficient Mixture-of-Experts Model Structure for Fast Training and Inference
di: Jin, Zewen, et al.
Pubblicazione: (2025)
di: Jin, Zewen, et al.
Pubblicazione: (2025)
Training-Free Generative Modeling via Kernelized Stochastic Interpolants
di: Coeurdoux, Florentin, et al.
Pubblicazione: (2026)
di: Coeurdoux, Florentin, et al.
Pubblicazione: (2026)
HQFS: Hybrid Quantum Classical Financial Security with VQC Forecasting, QUBO Annealing, and Audit-Ready Post-Quantum Signing
di: Nayak, Srikumar
Pubblicazione: (2026)
di: Nayak, Srikumar
Pubblicazione: (2026)
Named Entity Recognition for Payment Data Using NLP
di: Nayak, Srikumar
Pubblicazione: (2026)
di: Nayak, Srikumar
Pubblicazione: (2026)
Calibrated Credit Intelligence: Shift-Robust and Fair Risk Scoring with Bayesian Uncertainty and Gradient Boosting
di: Nayak, Srikumar
Pubblicazione: (2026)
di: Nayak, Srikumar
Pubblicazione: (2026)
Fractional Heat Kernel for Semi-Supervised Graph Learning with Small Training Sample Size
di: Bozorgnia, Farid, et al.
Pubblicazione: (2025)
di: Bozorgnia, Farid, et al.
Pubblicazione: (2025)
A Little Help Goes a Long Way: Efficient LLM Training by Leveraging Small LMs
di: Rawat, Ankit Singh, et al.
Pubblicazione: (2024)
di: Rawat, Ankit Singh, et al.
Pubblicazione: (2024)
Winning Big with Small Models: Knowledge Distillation vs. Self-Training for Reducing Hallucination in Product QA Agents
di: Lewis, Ashley, et al.
Pubblicazione: (2025)
di: Lewis, Ashley, et al.
Pubblicazione: (2025)
Efficient Parameter Optimisation for Quantum Kernel Alignment: A Sub-sampling Approach in Variational Training
di: Sahin, M. Emre, et al.
Pubblicazione: (2024)
di: Sahin, M. Emre, et al.
Pubblicazione: (2024)
Position Coupling: Improving Length Generalization of Arithmetic Transformers Using Task Structure
di: Cho, Hanseul, et al.
Pubblicazione: (2024)
di: Cho, Hanseul, et al.
Pubblicazione: (2024)
Leveraging Kernel Symmetry for Joint Compression and Error Mitigation in Edge Model Transfer
di: Hamadouche, Anis, et al.
Pubblicazione: (2026)
di: Hamadouche, Anis, et al.
Pubblicazione: (2026)
L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning
di: Aggarwal, Pranjal, et al.
Pubblicazione: (2025)
di: Aggarwal, Pranjal, et al.
Pubblicazione: (2025)
RLShield: Practical Multi-Agent RL for Financial Cyber Defense with Attack-Surface MDPs and Real-Time Response Orchestration
di: Nayak, Srikumar
Pubblicazione: (2026)
di: Nayak, Srikumar
Pubblicazione: (2026)
A Post-Training Enhanced Optimization Approach for Small Language Models
di: Zhai, Keke
Pubblicazione: (2024)
di: Zhai, Keke
Pubblicazione: (2024)
Jarzynski Reweighting and Sampling Dynamics for Training Energy-Based Models: Theoretical Analysis of Different Transition Kernels
di: Carbone, Davide
Pubblicazione: (2025)
di: Carbone, Davide
Pubblicazione: (2025)
A Machine learning and Empirical Bayesian Approach for Predictive Buying in B2B E-commerce
di: De, Tuhin Subhra, et al.
Pubblicazione: (2024)
di: De, Tuhin Subhra, et al.
Pubblicazione: (2024)
MSfusion: A Dynamic Model Splitting Approach for Resource-Constrained Machines to Collaboratively Train Larger Models
di: Xie, Jin, et al.
Pubblicazione: (2024)
di: Xie, Jin, et al.
Pubblicazione: (2024)
Small Vocabularies, Big Gains: Pretraining and Tokenization in Time Series Models
di: Roger, Alexis, et al.
Pubblicazione: (2025)
di: Roger, Alexis, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Deep Fusion: Efficient Network Training via Pre-trained Initializations
di: Mazzawi, Hanna, et al.
Pubblicazione: (2023) -
Grow, Don't Overwrite: Fine-tuning Without Forgetting
di: Adila, Dyah, et al.
Pubblicazione: (2026) -
On Distributed Larger-Than-Memory Subset Selection With Pairwise Submodular Functions
di: Böther, Maximilian, et al.
Pubblicazione: (2024) -
Transmuting prompts into weights
di: Mazzawi, Hanna, et al.
Pubblicazione: (2025) -
Learning without training: The implicit dynamics of in-context learning
di: Dherin, Benoit, et al.
Pubblicazione: (2025)