Turbo-Muon: Accelerating Orthogonality-Based Optimization with Pre-Conditioning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Boissin, Thibaut, Massena, Thomas, Mamalet, Franck, Serrurier, Mathieu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
An Adaptive Orthogonal Convolution Scheme for Efficient and Flexible CNN Architectures
par: Boissin, Thibaut, et autres
Publié: (2025)
par: Boissin, Thibaut, et autres
Publié: (2025)
Efficient Robust Conformal Prediction via Lipschitz-Bounded Networks
par: Massena, Thomas, et autres
Publié: (2025)
par: Massena, Thomas, et autres
Publié: (2025)
On the explainable properties of 1-Lipschitz Neural Networks: An Optimal Transport Perspective
par: Serrurier, Mathieu, et autres
Publié: (2022)
par: Serrurier, Mathieu, et autres
Publié: (2022)
From SGD to Muon: Adaptive Optimization via Schatten-p Norms
par: Massena, Thomas, et autres
Publié: (2026)
par: Massena, Thomas, et autres
Publié: (2026)
Orthogonium : A Unified, Efficient Library of Orthogonal and 1-Lipschitz Building Blocks
par: Boissin, Thibaut, et autres
Publié: (2026)
par: Boissin, Thibaut, et autres
Publié: (2026)
Fast and Flexible Robustness Certificates for Semantic Segmentation
par: Massena, Thomas, et autres
Publié: (2025)
par: Massena, Thomas, et autres
Publié: (2025)
DP-SGD Without Clipping: The Lipschitz Neural Network Way
par: Bethune, Louis, et autres
Publié: (2023)
par: Bethune, Louis, et autres
Publié: (2023)
HadamRNN: Binary and Sparse Ternary Orthogonal RNNs
par: Foucault, Armand, et autres
Publié: (2025)
par: Foucault, Armand, et autres
Publié: (2025)
Quantized Approximately Orthogonal Recurrent Neural Networks
par: Foucault, Armand, et autres
Publié: (2024)
par: Foucault, Armand, et autres
Publié: (2024)
FedMuon: Accelerating Federated Learning with Matrix Orthogonalization
par: Liu, Junkang, et autres
Publié: (2025)
par: Liu, Junkang, et autres
Publié: (2025)
Generating Heterogeneous Multi-dimensional Data : A Comparative Study
par: Corbeau, Michael, et autres
Publié: (2025)
par: Corbeau, Michael, et autres
Publié: (2025)
Muon Optimizer Accelerates Grokking
par: Tveit, Amund, et autres
Publié: (2025)
par: Tveit, Amund, et autres
Publié: (2025)
TrasMuon: Trust-Region Adaptive Scaling for Orthogonalized Momentum Optimizers
par: Cheng, Peng, et autres
Publié: (2026)
par: Cheng, Peng, et autres
Publié: (2026)
Back to the Baseline: Examining Baseline Effects on Explainability Metrics
par: Picard, Agustin Martin, et autres
Publié: (2025)
par: Picard, Agustin Martin, et autres
Publié: (2025)
Preconditioning Benefits of Spectral Orthogonalization in Muon
par: Ma, Jianhao, et autres
Publié: (2026)
par: Ma, Jianhao, et autres
Publié: (2026)
Turbo-ICL: In-Context Learning-Based Turbo Equalization
par: Song, Zihang, et autres
Publié: (2025)
par: Song, Zihang, et autres
Publié: (2025)
TurboHopp: Accelerated Molecule Scaffold Hopping with Consistency Models
par: Yoo, Kiwoong, et autres
Publié: (2024)
par: Yoo, Kiwoong, et autres
Publié: (2024)
Unlocking Feature Visualization for Deeper Networks with MAgnitude Constrained Optimization
par: Fel, Thomas, et autres
Publié: (2023)
par: Fel, Thomas, et autres
Publié: (2023)
Spectral Flattening Is All Muon Needs: How Orthogonalization Controls Learning Rate and Convergence
par: Nguyen, Tien-Phat, et autres
Publié: (2026)
par: Nguyen, Tien-Phat, et autres
Publié: (2026)
The Newton-Muon Optimizer
par: Du, Zhehang, et autres
Publié: (2026)
par: Du, Zhehang, et autres
Publié: (2026)
MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models
par: Huang, Feihu, et autres
Publié: (2026)
par: Huang, Feihu, et autres
Publié: (2026)
Robust One-Class Classification with Signed Distance Function using 1-Lipschitz Neural Networks
par: Bethune, Louis, et autres
Publié: (2023)
par: Bethune, Louis, et autres
Publié: (2023)
Orthogonalized Policy Optimization:Policy Optimization as Orthogonal Projection in Hilbert Space
par: Zixian, Wang
Publié: (2026)
par: Zixian, Wang
Publié: (2026)
Turbo4DGen: Ultra-Fast Acceleration for 4D Generation
par: Man, Yuanbin, et autres
Publié: (2026)
par: Man, Yuanbin, et autres
Publié: (2026)
TurboSpec: Closed-loop Speculation Control System for Optimizing LLM Serving Goodput
par: Liu, Xiaoxuan, et autres
Publié: (2024)
par: Liu, Xiaoxuan, et autres
Publié: (2024)
TurboDiffusion: Accelerating Video Diffusion Models by 100-200 Times
par: Zhang, Jintao, et autres
Publié: (2025)
par: Zhang, Jintao, et autres
Publié: (2025)
Intrinsic Muon: Spectral Optimization on Riemannian Matrix Manifolds
par: Li, Yibang, et autres
Publié: (2026)
par: Li, Yibang, et autres
Publié: (2026)
Group Orthogonalized Policy Optimization:Group Policy Optimization as Orthogonal Projection in Hilbert Space
par: Zixian, Wang
Publié: (2026)
par: Zixian, Wang
Publié: (2026)
How to design a dataset compliant with an ML-based system ODD?
par: Cappi, Cyril, et autres
Publié: (2024)
par: Cappi, Cyril, et autres
Publié: (2024)
TEON: Tensorized Orthonormalization Beyond Layer-Wise Muon for Large Language Model Pre-Training
par: Zhang, Ruijie, et autres
Publié: (2026)
par: Zhang, Ruijie, et autres
Publié: (2026)
DynMuon: A Dynamic Spectral Shaping View of Muon
par: Wu, Fangzhou, et autres
Publié: (2026)
par: Wu, Fangzhou, et autres
Publié: (2026)
LARD 2.0: Enhanced Datasets and Benchmarking for Autonomous Landing Systems
par: Bougacha, Yassine, et autres
Publié: (2026)
par: Bougacha, Yassine, et autres
Publié: (2026)
ORTHOBO: Orthogonal Bayesian Hyperparameter Optimization
par: Schröder, Maresa, et autres
Publié: (2026)
par: Schröder, Maresa, et autres
Publié: (2026)
DeMuon: A Decentralized Muon for Matrix Optimization over Graphs
par: He, Chuan, et autres
Publié: (2025)
par: He, Chuan, et autres
Publié: (2025)
Advancing Model Refinement: Muon-Optimized Distillation and Quantization for LLM Deployment
par: Sander, Jacob, et autres
Publié: (2026)
par: Sander, Jacob, et autres
Publié: (2026)
Muon$^2$: Boosting Muon via Adaptive Second-Moment Preconditioning
par: Liu, Ziyue, et autres
Publié: (2026)
par: Liu, Ziyue, et autres
Publié: (2026)
AdaFuse: Accelerating Dynamic Adapter Inference via Token-Level Pre-Gating and Fused Kernel Optimization
par: Li, Qiyang, et autres
Publié: (2026)
par: Li, Qiyang, et autres
Publié: (2026)
TurboSAT: Gradient-Guided Boolean Satisfiability Accelerated on GPU-CPU Hybrid System
par: Dai, Steve, et autres
Publié: (2025)
par: Dai, Steve, et autres
Publié: (2025)
MuonRec: Shifting the Optimizer Paradigm Beyond Adam in Scalable Generative Recommendation
par: Shan, Rong, et autres
Publié: (2026)
par: Shan, Rong, et autres
Publié: (2026)
Refine and Purify: Orthogonal Basis Optimization with Null-Space Denoising for Conditional Representation Learning
par: Wang, Jiaquan, et autres
Publié: (2026)
par: Wang, Jiaquan, et autres
Publié: (2026)
Documents similaires
-
An Adaptive Orthogonal Convolution Scheme for Efficient and Flexible CNN Architectures
par: Boissin, Thibaut, et autres
Publié: (2025) -
Efficient Robust Conformal Prediction via Lipschitz-Bounded Networks
par: Massena, Thomas, et autres
Publié: (2025) -
On the explainable properties of 1-Lipschitz Neural Networks: An Optimal Transport Perspective
par: Serrurier, Mathieu, et autres
Publié: (2022) -
From SGD to Muon: Adaptive Optimization via Schatten-p Norms
par: Massena, Thomas, et autres
Publié: (2026) -
Orthogonium : A Unified, Efficient Library of Orthogonal and 1-Lipschitz Building Blocks
par: Boissin, Thibaut, et autres
Publié: (2026)