On Parameter Estimation in Deviated Gaussian Mixture of Experts
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Nguyen, Huy, Nguyen, Khai, Ho, Nhat |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Towards Convergence Rates for Parameter Estimation in Gaussian-gated Mixture of Experts
par: Nguyen, Huy, et autres
Publié: (2023)
par: Nguyen, Huy, et autres
Publié: (2023)
Is Temperature Sample Efficient for Softmax Gaussian Mixture of Experts?
par: Nguyen, Huy, et autres
Publié: (2024)
par: Nguyen, Huy, et autres
Publié: (2024)
On Least Square Estimation in Softmax Gating Mixture of Experts
par: Nguyen, Huy, et autres
Publié: (2024)
par: Nguyen, Huy, et autres
Publié: (2024)
Understanding Expert Structures on Minimax Parameter Estimation in Contaminated Mixture of Experts
par: Yan, Fanqi, et autres
Publié: (2024)
par: Yan, Fanqi, et autres
Publié: (2024)
On Minimax Estimation of Parameters in Softmax-Contaminated Mixture of Experts
par: Yan, Fanqi, et autres
Publié: (2025)
par: Yan, Fanqi, et autres
Publié: (2025)
Convergence Rates for Softmax Gating Mixture of Experts
par: Nguyen, Huy, et autres
Publié: (2025)
par: Nguyen, Huy, et autres
Publié: (2025)
On Expert Estimation in Hierarchical Mixture of Experts: Beyond Softmax Gating Functions
par: Nguyen, Huy, et autres
Publié: (2024)
par: Nguyen, Huy, et autres
Publié: (2024)
Sigmoid Gating is More Sample Efficient than Softmax Gating in Mixture of Experts
par: Nguyen, Huy, et autres
Publié: (2024)
par: Nguyen, Huy, et autres
Publié: (2024)
A General Theory for Softmax Gating Multinomial Logistic Mixture of Experts
par: Nguyen, Huy, et autres
Publié: (2023)
par: Nguyen, Huy, et autres
Publié: (2023)
Fast Estimation of Wasserstein Distances via Regression on Sliced Wasserstein Distances
par: Nguyen, Khai, et autres
Publié: (2025)
par: Nguyen, Khai, et autres
Publié: (2025)
Quadratic Gating Mixture of Experts: Statistical Insights into Self-Attention
par: Akbarian, Pedram, et autres
Publié: (2024)
par: Akbarian, Pedram, et autres
Publié: (2024)
Sliced Wasserstein Estimation with Control Variates
par: Nguyen, Khai, et autres
Publié: (2023)
par: Nguyen, Khai, et autres
Publié: (2023)
Improving Minimax Estimation Rates for Contaminated Mixture of Multinomial Logistic Experts via Expert Heterogeneity
par: Yan, Fanqi, et autres
Publié: (2026)
par: Yan, Fanqi, et autres
Publié: (2026)
Statistical Perspective of Top-K Sparse Softmax Gating Mixture of Experts
par: Nguyen, Huy, et autres
Publié: (2023)
par: Nguyen, Huy, et autres
Publié: (2023)
Statistical Advantages of Perturbing Cosine Router in Mixture of Experts
par: Nguyen, Huy, et autres
Publié: (2024)
par: Nguyen, Huy, et autres
Publié: (2024)
Mixture of Experts Meets Prompt-Based Continual Learning
par: Le, Minh, et autres
Publié: (2024)
par: Le, Minh, et autres
Publié: (2024)
FuseMoE: Mixture-of-Experts Transformers for Fleximodal Fusion
par: Han, Xing, et autres
Publié: (2024)
par: Han, Xing, et autres
Publié: (2024)
Rethinking Multinomial Logistic Mixture of Experts with Sigmoid Gating Function
par: Pham, Tuan Minh, et autres
Publié: (2026)
par: Pham, Tuan Minh, et autres
Publié: (2026)
On Bayesian Softmax-Gated Mixture-of-Experts Models
par: Bariletto, Nicola, et autres
Publié: (2026)
par: Bariletto, Nicola, et autres
Publié: (2026)
RepLoRA: Reparameterizing Low-Rank Adaptation via the Perspective of Mixture of Experts
par: Truong, Tuan, et autres
Publié: (2025)
par: Truong, Tuan, et autres
Publié: (2025)
Towards Marginal Fairness Sliced Wasserstein Barycenter
par: Nguyen, Khai, et autres
Publié: (2024)
par: Nguyen, Khai, et autres
Publié: (2024)
One-Prompt Strikes Back: Sparse Mixture of Experts for Prompt-based Continual Learning
par: Le, Minh, et autres
Publié: (2025)
par: Le, Minh, et autres
Publié: (2025)
Energy-Based Sliced Wasserstein Distance
par: Nguyen, Khai, et autres
Publié: (2023)
par: Nguyen, Khai, et autres
Publié: (2023)
Hierarchical Hybrid Sliced Wasserstein: A Scalable Metric for Heterogeneous Joint Distributions
par: Nguyen, Khai, et autres
Publié: (2024)
par: Nguyen, Khai, et autres
Publié: (2024)
A Statistical Theory of Gated Attention through the Lens of Hierarchical Mixture of Experts
par: Nguyen, Viet, et autres
Publié: (2026)
par: Nguyen, Viet, et autres
Publié: (2026)
Data-Driven DRO and Economic Decision Theory: An Analytical Synthesis With Bayesian Nonparametric Advancements
par: Bariletto, Nicola, et autres
Publié: (2024)
par: Bariletto, Nicola, et autres
Publié: (2024)
Markovian Sliced Wasserstein Distances: Beyond Independent Projections
par: Nguyen, Khai, et autres
Publié: (2023)
par: Nguyen, Khai, et autres
Publié: (2023)
Sigmoid Self-Attention has Lower Sample Complexity than Softmax Self-Attention: A Mixture-of-Experts Perspective
par: Yan, Fanqi, et autres
Publié: (2025)
par: Yan, Fanqi, et autres
Publié: (2025)
Quasi-Monte Carlo for 3D Sliced Wasserstein
par: Nguyen, Khai, et autres
Publié: (2023)
par: Nguyen, Khai, et autres
Publié: (2023)
Summarizing Bayesian Nonparametric Mixture Posterior -- Sliced Optimal Transport Metrics for Gaussian Mixtures
par: Nguyen, Khai, et autres
Publié: (2024)
par: Nguyen, Khai, et autres
Publié: (2024)
Model Selection for Gaussian-gated Gaussian Mixture of Experts Using Dendrograms of Mixing Measures
par: Thai, Tuan, et autres
Publié: (2025)
par: Thai, Tuan, et autres
Publié: (2025)
Dendrograms of Mixing Measures for Softmax-Gated Gaussian Mixture of Experts: Consistency without Model Sweeps
par: Hai, Do Tien, et autres
Publié: (2025)
par: Hai, Do Tien, et autres
Publié: (2025)
Improving Routing in Sparse Mixture of Experts with Graph of Tokens
par: Nguyen, Tam, et autres
Publié: (2025)
par: Nguyen, Tam, et autres
Publié: (2025)
Revisit Visual Prompt Tuning: The Expressiveness of Prompt Experts
par: Le, Minh, et autres
Publié: (2025)
par: Le, Minh, et autres
Publié: (2025)
CompeteSMoE -- Effective Training of Sparse Mixture of Experts via Competition
par: Pham, Quang, et autres
Publié: (2024)
par: Pham, Quang, et autres
Publié: (2024)
Lightspeed Geometric Dataset Distance via Sliced Optimal Transport
par: Nguyen, Khai, et autres
Publié: (2025)
par: Nguyen, Khai, et autres
Publié: (2025)
Sliced Wasserstein with Random-Path Projecting Directions
par: Nguyen, Khai, et autres
Publié: (2024)
par: Nguyen, Khai, et autres
Publié: (2024)
Modeling Expert Interactions in Sparse Mixture of Experts via Graph Structures
par: Nguyen-Nhat, Minh-Khoi, et autres
Publié: (2025)
par: Nguyen-Nhat, Minh-Khoi, et autres
Publié: (2025)
On Zero-Initialized Attention: Optimal Prompt and Gating Factor Estimation
par: Diep, Nghiem T., et autres
Publié: (2025)
par: Diep, Nghiem T., et autres
Publié: (2025)
On DeepSeekMoE: Statistical Benefits of Shared Experts and Normalized Sigmoid Gating
par: Nguyen, Huy, et autres
Publié: (2025)
par: Nguyen, Huy, et autres
Publié: (2025)
Documents similaires
-
Towards Convergence Rates for Parameter Estimation in Gaussian-gated Mixture of Experts
par: Nguyen, Huy, et autres
Publié: (2023) -
Is Temperature Sample Efficient for Softmax Gaussian Mixture of Experts?
par: Nguyen, Huy, et autres
Publié: (2024) -
On Least Square Estimation in Softmax Gating Mixture of Experts
par: Nguyen, Huy, et autres
Publié: (2024) -
Understanding Expert Structures on Minimax Parameter Estimation in Contaminated Mixture of Experts
par: Yan, Fanqi, et autres
Publié: (2024) -
On Minimax Estimation of Parameters in Softmax-Contaminated Mixture of Experts
par: Yan, Fanqi, et autres
Publié: (2025)