Sharpness-diversity tradeoff: improving flat ensembles with SharpBalance
Fuente:
arXiv
Guardado en:
| Autores principales: | Lu, Haiquan, Liu, Xiaotian, Zhou, Yefan, Li, Qunli, Keutzer, Kurt, Mahoney, Michael W., Yan, Yujun, Yang, Huanrui, Yang, Yaoqing |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AlphaPruning: Using Heavy-Tailed Self Regularization Theory for Improved Layer-wise Pruning of Large Language Models
por: Lu, Haiquan, et al.
Publicado: (2024)
por: Lu, Haiquan, et al.
Publicado: (2024)
A Three-regime Model of Network Pruning
por: Zhou, Yefan, et al.
Publicado: (2023)
por: Zhou, Yefan, et al.
Publicado: (2023)
RL4RLA: Teaching ML to Discover Randomized Linear Algebra Algorithms Through Curriculum Design and Graph-Based Search
por: Xiong, Jinglong, et al.
Publicado: (2026)
por: Xiong, Jinglong, et al.
Publicado: (2026)
A Model Zoo on Phase Transitions in Neural Networks
por: Schürholt, Konstantin, et al.
Publicado: (2025)
por: Schürholt, Konstantin, et al.
Publicado: (2025)
Model Balancing Helps Low-data Training and Fine-tuning
por: Liu, Zihang, et al.
Publicado: (2024)
por: Liu, Zihang, et al.
Publicado: (2024)
SAFER: Sharpness Aware layer-selective Finetuning for Enhanced Robustness in vision transformers
por: Gopal, Bhavna, et al.
Publicado: (2025)
por: Gopal, Bhavna, et al.
Publicado: (2025)
Unveiling Multi-regime Patterns in SciML: Distinct Failure Modes and Regime-specific Optimization
por: Wang, Yuxin, et al.
Publicado: (2026)
por: Wang, Yuxin, et al.
Publicado: (2026)
Learning to Discover Iterative Spectral Algorithms
por: Liu, Zihang, et al.
Publicado: (2026)
por: Liu, Zihang, et al.
Publicado: (2026)
MD tree: a model-diagnostic tree grown on loss landscape
por: Zhou, Yefan, et al.
Publicado: (2024)
por: Zhou, Yefan, et al.
Publicado: (2024)
Sharp analysis of linear ensemble sampling
por: Akhavan, Arya, et al.
Publicado: (2026)
por: Akhavan, Arya, et al.
Publicado: (2026)
Spectral Insights into Data-Oblivious Critical Layers in Large Language Models
por: Liu, Xuyuan, et al.
Publicado: (2025)
por: Liu, Xuyuan, et al.
Publicado: (2025)
Understanding GUI Agent Localization Biases through Logit Sharpness
por: Tao, Xingjian, et al.
Publicado: (2025)
por: Tao, Xingjian, et al.
Publicado: (2025)
Balanced Sharpness-Aware Minimization for Imbalanced Regression
por: Liu, Yahao, et al.
Publicado: (2025)
por: Liu, Yahao, et al.
Publicado: (2025)
AlphaLoRA: Assigning LoRA Experts Based on Layer Training Quality
por: Qing, Peijun, et al.
Publicado: (2024)
por: Qing, Peijun, et al.
Publicado: (2024)
Non-improvability of Sharp Endpoint Estimates
por: Mihula, Zdeněk, et al.
Publicado: (2025)
por: Mihula, Zdeněk, et al.
Publicado: (2025)
Sharp Fractional Sobolev Embeddings on Closed Manifolds
por: Tan, Hao, et al.
Publicado: (2025)
por: Tan, Hao, et al.
Publicado: (2025)
AI and Memory Wall
por: Gholami, Amir, et al.
Publicado: (2024)
por: Gholami, Amir, et al.
Publicado: (2024)
Sharp upper tail behavior of line ensembles via the tangent method
por: Ganguly, Shirshendu, et al.
Publicado: (2022)
por: Ganguly, Shirshendu, et al.
Publicado: (2022)
Sharp Online Hardness for Large Balanced Independent Sets
por: Dhawan, Abhishek, et al.
Publicado: (2025)
por: Dhawan, Abhishek, et al.
Publicado: (2025)
Iterative Refinement Neural Operators are Learned Fixed-Point Solvers: A Principled Approach to Spectral Bias Mitigation
por: Liu, Xiaotian, et al.
Publicado: (2026)
por: Liu, Xiaotian, et al.
Publicado: (2026)
Rényi Sharpness: A Novel Sharpness that Strongly Correlates with Generalization
por: Zhang, Qiaozhe, et al.
Publicado: (2025)
por: Zhang, Qiaozhe, et al.
Publicado: (2025)
Sharp total variation rates of convergence for fluctuations of linear statistics of $β$-ensembles
por: Angst, Jürgen, et al.
Publicado: (2024)
por: Angst, Jürgen, et al.
Publicado: (2024)
Reward Under Attack: Analyzing the Robustness and Hackability of Process Reward Models
por: Tiwari, Rishabh, et al.
Publicado: (2026)
por: Tiwari, Rishabh, et al.
Publicado: (2026)
FactorLLM: Factorizing Knowledge via Mixture of Experts for Large Language Models
por: Zhao, Zhongyu, et al.
Publicado: (2024)
por: Zhao, Zhongyu, et al.
Publicado: (2024)
Magic-Me: Identity-Specific Video Customized Diffusion
por: Ma, Ze, et al.
Publicado: (2024)
por: Ma, Ze, et al.
Publicado: (2024)
MITRA: A Large-Scale Parallel Corpus and Multilingual Pretrained Language Model for Machine Translation and Semantic Retrieval for Pāli, Sanskrit, Buddhist Chinese, and Tibetan
por: Nehrdich, Sebastian, et al.
Publicado: (2026)
por: Nehrdich, Sebastian, et al.
Publicado: (2026)
SharpZO: Hybrid Sharpness-Aware Vision Language Model Prompt Tuning via Forward-Only Passes
por: Yang, Yifan, et al.
Publicado: (2025)
por: Yang, Yifan, et al.
Publicado: (2025)
Sharpness-Aware Minimization Revisited: Weighted Sharpness as a Regularization Term
por: Yue, Yun, et al.
Publicado: (2023)
por: Yue, Yun, et al.
Publicado: (2023)
Sharp $\ell^q(L^p)$ decoupling for paraboloids
por: Yang, Tongou
Publicado: (2024)
por: Yang, Tongou
Publicado: (2024)
An LLM Compiler for Parallel Function Calling
por: Kim, Sehoon, et al.
Publicado: (2023)
por: Kim, Sehoon, et al.
Publicado: (2023)
Sharp Fourier extension on fractional surfaces
por: Di, Boning, et al.
Publicado: (2022)
por: Di, Boning, et al.
Publicado: (2022)
Tilted Sharpness-Aware Minimization
por: Li, Tian, et al.
Publicado: (2024)
por: Li, Tian, et al.
Publicado: (2024)
Fisher-aware Quantization for DETR Detectors with Critical-category Objectives
por: Yang, Huanrui, et al.
Publicado: (2024)
por: Yang, Huanrui, et al.
Publicado: (2024)
Taming Sensitive Weights : Noise Perturbation Fine-tuning for Robust LLM Quantization
por: Wang, Dongwei, et al.
Publicado: (2024)
por: Wang, Dongwei, et al.
Publicado: (2024)
Friendly Sharpness-Aware Minimization
por: Li, Tao, et al.
Publicado: (2024)
por: Li, Tao, et al.
Publicado: (2024)
Sharp Non-uniqueness in Law for Stochastic Differential Equations on the Whole Space
por: Lü, Huaxiang, et al.
Publicado: (2025)
por: Lü, Huaxiang, et al.
Publicado: (2025)
Sharpness-Aware Minimization Enhances Feature Quality via Balanced Learning
por: Springer, Jacob Mitchell, et al.
Publicado: (2024)
por: Springer, Jacob Mitchell, et al.
Publicado: (2024)
Towards Foundation Models for Scientific Machine Learning: Characterizing Scaling and Transfer Behavior
por: Subramanian, Shashank, et al.
Publicado: (2023)
por: Subramanian, Shashank, et al.
Publicado: (2023)
Double Descent in Portfolio Optimization: Dance between Theoretical Sharpe Ratio and Estimation Accuracy
por: Lu, Yonghe, et al.
Publicado: (2024)
por: Lu, Yonghe, et al.
Publicado: (2024)
KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization
por: Hooper, Coleman, et al.
Publicado: (2024)
por: Hooper, Coleman, et al.
Publicado: (2024)
Ejemplares similares
-
AlphaPruning: Using Heavy-Tailed Self Regularization Theory for Improved Layer-wise Pruning of Large Language Models
por: Lu, Haiquan, et al.
Publicado: (2024) -
A Three-regime Model of Network Pruning
por: Zhou, Yefan, et al.
Publicado: (2023) -
RL4RLA: Teaching ML to Discover Randomized Linear Algebra Algorithms Through Curriculum Design and Graph-Based Search
por: Xiong, Jinglong, et al.
Publicado: (2026) -
A Model Zoo on Phase Transitions in Neural Networks
por: Schürholt, Konstantin, et al.
Publicado: (2025) -
Model Balancing Helps Low-data Training and Fine-tuning
por: Liu, Zihang, et al.
Publicado: (2024)