Switch EMA: A Free Lunch for Better Flatness and Sharpness
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Siyuan, Liu, Zicheng, Tian, Juanxi, Wang, Ge, Wang, Zedong, Jin, Weiyang, Wu, Di, Tan, Cheng, Lin, Tao, Liu, Yang, Sun, Baigui, Li, Stan Z. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
OpenMixup: Open Mixup Toolbox and Benchmark for Visual Representation Learning
di: Li, Siyuan, et al.
Pubblicazione: (2022)
di: Li, Siyuan, et al.
Pubblicazione: (2022)
Unveiling the Backbone-Optimizer Coupling Bias in Visual Representation Learning
di: Li, Siyuan, et al.
Pubblicazione: (2024)
di: Li, Siyuan, et al.
Pubblicazione: (2024)
SemiReward: A General Reward Model for Semi-supervised Learning
di: Li, Siyuan, et al.
Pubblicazione: (2023)
di: Li, Siyuan, et al.
Pubblicazione: (2023)
A Survey on Mixup Augmentations and Beyond
di: Jin, Xin, et al.
Pubblicazione: (2024)
di: Jin, Xin, et al.
Pubblicazione: (2024)
Taming LLMs by Scaling Learning Rates with Gradient Grouping
di: Li, Siyuan, et al.
Pubblicazione: (2025)
di: Li, Siyuan, et al.
Pubblicazione: (2025)
Masked Modeling for Self-supervised Representation Learning on Vision and Beyond
di: Li, Siyuan, et al.
Pubblicazione: (2023)
di: Li, Siyuan, et al.
Pubblicazione: (2023)
Short-Long Convolutions Help Hardware-Efficient Linear Attention to Focus on Long Sequences
di: Liu, Zicheng, et al.
Pubblicazione: (2024)
di: Liu, Zicheng, et al.
Pubblicazione: (2024)
LongVQ: Long Sequence Modeling with Vector Quantization on Structured Memory
di: Liu, Zicheng, et al.
Pubblicazione: (2024)
di: Liu, Zicheng, et al.
Pubblicazione: (2024)
VQDNA: Unleashing the Power of Vector Quantization for Multi-Species Genomic Sequence Modeling
di: Li, Siyuan, et al.
Pubblicazione: (2024)
di: Li, Siyuan, et al.
Pubblicazione: (2024)
MogaNet: Multi-order Gated Aggregation Network
di: Li, Siyuan, et al.
Pubblicazione: (2022)
di: Li, Siyuan, et al.
Pubblicazione: (2022)
MergeVQ: A Unified Framework for Visual Generation and Representation with Disentangled Token Merging and Quantization
di: Li, Siyuan, et al.
Pubblicazione: (2025)
di: Li, Siyuan, et al.
Pubblicazione: (2025)
Envision: Benchmarking Unified Understanding & Generation for Causal World Process Insights
di: Tian, Juanxi, et al.
Pubblicazione: (2025)
di: Tian, Juanxi, et al.
Pubblicazione: (2025)
GenURL: A General Framework for Unsupervised Representation Learning
di: Li, Siyuan, et al.
Pubblicazione: (2021)
di: Li, Siyuan, et al.
Pubblicazione: (2021)
RDesign: Hierarchical Data-efficient Representation Learning for Tertiary Structure-based RNA Design
di: Tan, Cheng, et al.
Pubblicazione: (2023)
di: Tan, Cheng, et al.
Pubblicazione: (2023)
GenBench: A Benchmarking Suite for Systematic Evaluation of Genomic Foundation Models
di: Liu, Zicheng, et al.
Pubblicazione: (2024)
di: Liu, Zicheng, et al.
Pubblicazione: (2024)
SimVPv2: Towards Simple yet Powerful Spatiotemporal Predictive Learning
di: Tan, Cheng, et al.
Pubblicazione: (2022)
di: Tan, Cheng, et al.
Pubblicazione: (2022)
Peer Review as A Multi-Turn and Long-Context Dialogue with Role-Based Interactions
di: Tan, Cheng, et al.
Pubblicazione: (2024)
di: Tan, Cheng, et al.
Pubblicazione: (2024)
USTEP: Spatio-Temporal Predictive Learning under A Unified View
di: Tan, Cheng, et al.
Pubblicazione: (2023)
di: Tan, Cheng, et al.
Pubblicazione: (2023)
Is Factuality Enhancement a Free Lunch For LLMs? Better Factuality Can Lead to Worse Context-Faithfulness
di: Bi, Baolong, et al.
Pubblicazione: (2024)
di: Bi, Baolong, et al.
Pubblicazione: (2024)
FreeBind: Free Lunch in Unified Multimodal Space via Knowledge Fusion
di: Wang, Zehan, et al.
Pubblicazione: (2024)
di: Wang, Zehan, et al.
Pubblicazione: (2024)
An Empirical Study: Extensive Deep Temporal Point Process
di: Lin, Haitao, et al.
Pubblicazione: (2021)
di: Lin, Haitao, et al.
Pubblicazione: (2021)
Rep-MTL: Unleashing the Power of Representation-level Task Saliency for Multi-Task Learning
di: Wang, Zedong, et al.
Pubblicazione: (2025)
di: Wang, Zedong, et al.
Pubblicazione: (2025)
Better NTK Conditioning: A Free Lunch from (ReLU) Nonlinear Activation in Wide Neural Networks
di: Liu, Chaoyue, et al.
Pubblicazione: (2023)
di: Liu, Chaoyue, et al.
Pubblicazione: (2023)
RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution
di: Jian, Siyong, et al.
Pubblicazione: (2026)
di: Jian, Siyong, et al.
Pubblicazione: (2026)
Is Long-to-Short a Free Lunch? Investigating Inconsistency and Reasoning Efficiency in LRMs
di: Yang, Shu, et al.
Pubblicazione: (2025)
di: Yang, Shu, et al.
Pubblicazione: (2025)
Instructor-inspired Machine Learning for Robust Molecular Property Prediction
di: Wu, Fang, et al.
Pubblicazione: (2023)
di: Wu, Fang, et al.
Pubblicazione: (2023)
CBGBench: Fill in the Blank of Protein-Molecule Complex Binding Graph
di: Lin, Haitao, et al.
Pubblicazione: (2024)
di: Lin, Haitao, et al.
Pubblicazione: (2024)
Discovering the Representation Bottleneck of Graph Neural Networks
di: Wu, Fang, et al.
Pubblicazione: (2022)
di: Wu, Fang, et al.
Pubblicazione: (2022)
One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt
di: Liu, Tao, et al.
Pubblicazione: (2025)
di: Liu, Tao, et al.
Pubblicazione: (2025)
Separable Power of Classical and Quantum Learning Protocols Through the Lens of No-Free-Lunch Theorem
di: Wang, Xinbiao, et al.
Pubblicazione: (2024)
di: Wang, Xinbiao, et al.
Pubblicazione: (2024)
No Free Lunch: Rethinking Internal Feedback for LLM Reasoning
di: Zhang, Yanzhi, et al.
Pubblicazione: (2025)
di: Zhang, Yanzhi, et al.
Pubblicazione: (2025)
AlphaFold Database Debiasing for Robust Inverse Folding
di: Tan, Cheng, et al.
Pubblicazione: (2025)
di: Tan, Cheng, et al.
Pubblicazione: (2025)
FreeInv: Free Lunch for Improving DDIM Inversion
di: Bao, Yuxiang, et al.
Pubblicazione: (2025)
di: Bao, Yuxiang, et al.
Pubblicazione: (2025)
FoldToken2: Learning compact, invariant and generative protein structure language
di: Gao, Zhangyang, et al.
Pubblicazione: (2024)
di: Gao, Zhangyang, et al.
Pubblicazione: (2024)
Free Lunch for User Experience: Crowdsourcing Agents for Scalable User Studies
di: Liu, Siyang, et al.
Pubblicazione: (2025)
di: Liu, Siyang, et al.
Pubblicazione: (2025)
FreeV: Free Lunch For Vocoders Through Pseudo Inversed Mel Filter
di: Lv, Yuanjun, et al.
Pubblicazione: (2024)
di: Lv, Yuanjun, et al.
Pubblicazione: (2024)
No Free Lunch with Guardrails
di: Kumar, Divyanshu, et al.
Pubblicazione: (2025)
di: Kumar, Divyanshu, et al.
Pubblicazione: (2025)
FreeStyle: Free Lunch for Text-guided Style Transfer using Diffusion Models
di: He, Feihong, et al.
Pubblicazione: (2024)
di: He, Feihong, et al.
Pubblicazione: (2024)
Free Lunch for Stabilizing Rectified Flow Inversion
di: Wang, Chenru, et al.
Pubblicazione: (2026)
di: Wang, Chenru, et al.
Pubblicazione: (2026)
Free-Lunch Color-Texture Disentanglement for Stylized Image Generation
di: Qin, Jiang, et al.
Pubblicazione: (2025)
di: Qin, Jiang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
OpenMixup: Open Mixup Toolbox and Benchmark for Visual Representation Learning
di: Li, Siyuan, et al.
Pubblicazione: (2022) -
Unveiling the Backbone-Optimizer Coupling Bias in Visual Representation Learning
di: Li, Siyuan, et al.
Pubblicazione: (2024) -
SemiReward: A General Reward Model for Semi-supervised Learning
di: Li, Siyuan, et al.
Pubblicazione: (2023) -
A Survey on Mixup Augmentations and Beyond
di: Jin, Xin, et al.
Pubblicazione: (2024) -
Taming LLMs by Scaling Learning Rates with Gradient Grouping
di: Li, Siyuan, et al.
Pubblicazione: (2025)