Guardado en:
| Autores principales: | Duzgun, Ahmet Cagri, Jelassi, Samy, Li, Yuanzhi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2407.00968 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
How Does Overparameterization Affect Machine Unlearning of Deep Neural Networks?
por: Alon, Gal, et al.
Publicado: (2025)
por: Alon, Gal, et al.
Publicado: (2025)
LoRA Soups: Merging LoRAs for Practical Skill Composition Tasks
por: Prabhakar, Akshara, et al.
Publicado: (2024)
por: Prabhakar, Akshara, et al.
Publicado: (2024)
Matching Features, Not Tokens: Energy-Based Fine-Tuning of Language Models
por: Jelassi, Samy, et al.
Publicado: (2026)
por: Jelassi, Samy, et al.
Publicado: (2026)
Collective Model Intelligence Requires Compatible Specialization
por: Pari, Jyothish, et al.
Publicado: (2024)
por: Pari, Jyothish, et al.
Publicado: (2024)
To Backtrack or Not to Backtrack: When Sequential Search Limits Model Reasoning
por: Qin, Tian, et al.
Publicado: (2025)
por: Qin, Tian, et al.
Publicado: (2025)
How Does Quantization Affect Multilingual LLMs?
por: Marchisio, Kelly, et al.
Publicado: (2024)
por: Marchisio, Kelly, et al.
Publicado: (2024)
Universal Length Generalization with Turing Programs
por: Hou, Kaiying, et al.
Publicado: (2024)
por: Hou, Kaiying, et al.
Publicado: (2024)
Repeat After Me: Transformers are Better than State Space Models at Copying
por: Jelassi, Samy, et al.
Publicado: (2024)
por: Jelassi, Samy, et al.
Publicado: (2024)
Q-Probe: A Lightweight Approach to Reward Maximization for Language Models
por: Li, Kenneth, et al.
Publicado: (2024)
por: Li, Kenneth, et al.
Publicado: (2024)
Mixture of Parrots: Experts improve memorization more than reasoning
por: Jelassi, Samy, et al.
Publicado: (2024)
por: Jelassi, Samy, et al.
Publicado: (2024)
The Recurrent Transformer: Greater Effective Depth and Efficient Decoding
por: Oncescu, Costin-Andrei, et al.
Publicado: (2026)
por: Oncescu, Costin-Andrei, et al.
Publicado: (2026)
Let Me Think! A Long Chain-of-Thought Can Be Worth Exponentially Many Short Ones
por: Mirtaheri, Parsa, et al.
Publicado: (2025)
por: Mirtaheri, Parsa, et al.
Publicado: (2025)
The Role of Sparsity for Length Generalization in Transformers
por: Golowich, Noah, et al.
Publicado: (2025)
por: Golowich, Noah, et al.
Publicado: (2025)
Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining
por: Zhao, Rosie, et al.
Publicado: (2025)
por: Zhao, Rosie, et al.
Publicado: (2025)
Adversarial Training Can Provably Improve Robustness: Theoretical Analysis of Feature Learning Process Under Structured Data
por: Li, Binghui, et al.
Publicado: (2024)
por: Li, Binghui, et al.
Publicado: (2024)
Theoretical Limitations of Ensembles in the Age of Overparameterization
por: Dern, Niclas, et al.
Publicado: (2024)
por: Dern, Niclas, et al.
Publicado: (2024)
The Interpolating Information Criterion for Overparameterized Models
por: Hodgkinson, Liam, et al.
Publicado: (2023)
por: Hodgkinson, Liam, et al.
Publicado: (2023)
Privacy for Free in the Overparameterized Regime
por: Bombari, Simone, et al.
Publicado: (2024)
por: Bombari, Simone, et al.
Publicado: (2024)
Machine Unlearning under Overparameterization
por: Block, Jacob L., et al.
Publicado: (2025)
por: Block, Jacob L., et al.
Publicado: (2025)
How Does Code Pretraining Affect Language Model Task Performance?
por: Petty, Jackson, et al.
Publicado: (2024)
por: Petty, Jackson, et al.
Publicado: (2024)
How Much Training Data is Memorized in Overparameterized Autoencoders? An Inverse Problem Perspective on Memorization Evaluation
por: Abitbul, Koren, et al.
Publicado: (2023)
por: Abitbul, Koren, et al.
Publicado: (2023)
How Does Response Length Affect Long-Form Factuality
por: Zhao, James Xu, et al.
Publicado: (2025)
por: Zhao, James Xu, et al.
Publicado: (2025)
The Role of Symmetry in Optimizing Overparameterized Networks
por: Sareen, Kusha, et al.
Publicado: (2026)
por: Sareen, Kusha, et al.
Publicado: (2026)
Provable Generalization in Overparameterized Neural Nets
por: Dhingra, Aviral
Publicado: (2025)
por: Dhingra, Aviral
Publicado: (2025)
A Note on Generalization in Variational Autoencoders: How Effective Is Synthetic Data & Overparameterization?
por: Xiao, Tim Z., et al.
Publicado: (2023)
por: Xiao, Tim Z., et al.
Publicado: (2023)
On the Clean Generalization and Robust Overfitting in Adversarial Training from Two Theoretical Views: Representation Complexity and Training Dynamics
por: Li, Binghui, et al.
Publicado: (2023)
por: Li, Binghui, et al.
Publicado: (2023)
On the Benefits of Weight Normalization for Overparameterized Matrix Sensing
por: Wei, Yudong, et al.
Publicado: (2025)
por: Wei, Yudong, et al.
Publicado: (2025)
Overparameterized Multiple Linear Regression as Hyper-Curve Fitting
por: Atza, E., et al.
Publicado: (2024)
por: Atza, E., et al.
Publicado: (2024)
Dual Space Preconditioning for Gradient Descent in the Overparameterized Regime
por: Ghane, Reza, et al.
Publicado: (2026)
por: Ghane, Reza, et al.
Publicado: (2026)
An Analytical Model for Overparameterized Learning Under Class Imbalance
por: Mor, Eliav, et al.
Publicado: (2025)
por: Mor, Eliav, et al.
Publicado: (2025)
Feature Impact Analysis on Top Long-Jump Performances with Quantile Random Forest and Explainable AI Techniques
por: Gan, Qi, et al.
Publicado: (2025)
por: Gan, Qi, et al.
Publicado: (2025)
Critical Influence of Overparameterization on Sharpness-aware Minimization
por: Shin, Sungbin, et al.
Publicado: (2023)
por: Shin, Sungbin, et al.
Publicado: (2023)
Bayesian Inference for Consistent Predictions in Overparameterized Nonlinear Regression
por: Wakayama, Tomoya
Publicado: (2024)
por: Wakayama, Tomoya
Publicado: (2024)
How Does Preconditioning Guide Feature Learning in Deep Neural Networks?
por: Yoshida, Kotaro, et al.
Publicado: (2025)
por: Yoshida, Kotaro, et al.
Publicado: (2025)
Local Linear Recovery Guarantee of Deep Neural Networks at Overparameterization
por: Zhang, Yaoyu, et al.
Publicado: (2024)
por: Zhang, Yaoyu, et al.
Publicado: (2024)
Benefits of Early Stopping in Gradient Descent for Overparameterized Logistic Regression
por: Wu, Jingfeng, et al.
Publicado: (2025)
por: Wu, Jingfeng, et al.
Publicado: (2025)
Task Shift: From Classification to Regression in Overparameterized Linear Models
por: LaBonte, Tyler, et al.
Publicado: (2025)
por: LaBonte, Tyler, et al.
Publicado: (2025)
Estimation of Toeplitz Covariance Matrices using Overparameterized Gradient Descent
por: Busbib, Daniel, et al.
Publicado: (2025)
por: Busbib, Daniel, et al.
Publicado: (2025)
Precise Asymptotic Generalization for Multiclass Classification with Overparameterized Linear Models
por: Wu, David X., et al.
Publicado: (2023)
por: Wu, David X., et al.
Publicado: (2023)
Implicit Regularization and Generalization in Overparameterized Neural Networks
por: Johannsen, Zeran
Publicado: (2026)
por: Johannsen, Zeran
Publicado: (2026)
Ejemplares similares
-
How Does Overparameterization Affect Machine Unlearning of Deep Neural Networks?
por: Alon, Gal, et al.
Publicado: (2025) -
LoRA Soups: Merging LoRAs for Practical Skill Composition Tasks
por: Prabhakar, Akshara, et al.
Publicado: (2024) -
Matching Features, Not Tokens: Energy-Based Fine-Tuning of Language Models
por: Jelassi, Samy, et al.
Publicado: (2026) -
Collective Model Intelligence Requires Compatible Specialization
por: Pari, Jyothish, et al.
Publicado: (2024) -
To Backtrack or Not to Backtrack: When Sequential Search Limits Model Reasoning
por: Qin, Tian, et al.
Publicado: (2025)