Peirce in the Machine: How Mixture of Experts Models Perform Hypothesis Construction
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Rushing, Bruce |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
How Many Experts Are Enough? Towards Optimal Semantic Specialization for Mixture-of-Experts
par: Park, Sumin, et autres
Publié: (2025)
par: Park, Sumin, et autres
Publié: (2025)
MC#: Mixture Compressor for Mixture-of-Experts Large Models
par: Huang, Wei, et autres
Publié: (2025)
par: Huang, Wei, et autres
Publié: (2025)
Efficiently Editing Mixture-of-Experts Models with Compressed Experts
par: He, Yifei, et autres
Publié: (2025)
par: He, Yifei, et autres
Publié: (2025)
Explorations of Self-Repair in Language Models
par: Rushing, Cody, et autres
Publié: (2024)
par: Rushing, Cody, et autres
Publié: (2024)
Mixture of Experts in Large Language Models
par: Zhang, Danyang, et autres
Publié: (2025)
par: Zhang, Danyang, et autres
Publié: (2025)
AnyExperts: On-Demand Expert Allocation for Multimodal Language Models with Mixture of Expert
par: Gao, Yuting, et autres
Publié: (2025)
par: Gao, Yuting, et autres
Publié: (2025)
Retrieval-Augmented Mixture of LoRA Experts for Uploadable Machine Learning
par: Zhao, Ziyu, et autres
Publié: (2024)
par: Zhao, Ziyu, et autres
Publié: (2024)
Modeling Expert Interactions in Sparse Mixture of Experts via Graph Structures
par: Nguyen-Nhat, Minh-Khoi, et autres
Publié: (2025)
par: Nguyen-Nhat, Minh-Khoi, et autres
Publié: (2025)
Mixture of Raytraced Experts
par: Perin, Andrea, et autres
Publié: (2025)
par: Perin, Andrea, et autres
Publié: (2025)
An Operator-Consistent Graph Neural Network for Learning Diffusion Dynamics on Irregular Meshes
par: Li, Yuelian, et autres
Publié: (2025)
par: Li, Yuelian, et autres
Publié: (2025)
SMILE: Zero-Shot Sparse Mixture of Low-Rank Experts Construction From Pre-Trained Foundation Models
par: Tang, Anke, et autres
Publié: (2024)
par: Tang, Anke, et autres
Publié: (2024)
Mixture of Experts in a Mixture of RL settings
par: Willi, Timon, et autres
Publié: (2024)
par: Willi, Timon, et autres
Publié: (2024)
Speculating Experts Accelerates Inference for Mixture-of-Experts
par: Madan, Vivan, et autres
Publié: (2026)
par: Madan, Vivan, et autres
Publié: (2026)
Not All Models Suit Expert Offloading: On Local Routing Consistency of Mixture-of-Expert Models
par: Liang, Jingcong, et autres
Publié: (2025)
par: Liang, Jingcong, et autres
Publié: (2025)
MoDE: A Mixture-of-Experts Model with Mutual Distillation among the Experts
par: Xie, Zhitian, et autres
Publié: (2024)
par: Xie, Zhitian, et autres
Publié: (2024)
Mixture of Diverse Size Experts
par: Sun, Manxi, et autres
Publié: (2024)
par: Sun, Manxi, et autres
Publié: (2024)
Mixture of A Million Experts
par: He, Xu Owen
Publié: (2024)
par: He, Xu Owen
Publié: (2024)
Sparsity and Superposition in Mixture of Experts
par: Chaudhari, Marmik, et autres
Publié: (2025)
par: Chaudhari, Marmik, et autres
Publié: (2025)
Mixture of Concept Bottleneck Experts
par: De Santis, Francesco, et autres
Publié: (2026)
par: De Santis, Francesco, et autres
Publié: (2026)
MixtureKit: A General Framework for Composing, Training, and Visualizing Mixture-of-Experts Models
par: Chamma, Ahmad, et autres
Publié: (2025)
par: Chamma, Ahmad, et autres
Publié: (2025)
GRIP: Algorithm-Agnostic Machine Unlearning for Mixture-of-Experts via Geometric Router Constraints
par: Zhu, Andy, et autres
Publié: (2026)
par: Zhu, Andy, et autres
Publié: (2026)
Accelerating Mixture-of-Expert Inference with Adaptive Expert Split Mechanism
par: Yan, Jiaming, et autres
Publié: (2025)
par: Yan, Jiaming, et autres
Publié: (2025)
Expert Upcycling: Shifting the Compute-Efficient Frontier of Mixture-of-Experts
par: Dwivedi, Chaitanya, et autres
Publié: (2026)
par: Dwivedi, Chaitanya, et autres
Publié: (2026)
EAC-MoE: Expert-Selection Aware Compressor for Mixture-of-Experts Large Language Models
par: Chen, Yuanteng, et autres
Publié: (2025)
par: Chen, Yuanteng, et autres
Publié: (2025)
HELLoRA: Hot Experts Layer-Level Low-Rank Adaptation for Mixture-of-Experts Models
par: Wei, Jia, et autres
Publié: (2026)
par: Wei, Jia, et autres
Publié: (2026)
Optimal Expert-Attention Allocation in Mixture-of-Experts: A Scalable Law for Dynamic Model Design
par: Li, Junzhuo, et autres
Publié: (2026)
par: Li, Junzhuo, et autres
Publié: (2026)
Graph Knowledge Distillation to Mixture of Experts
par: Rumiantsev, Pavel, et autres
Publié: (2024)
par: Rumiantsev, Pavel, et autres
Publié: (2024)
Theory on Mixture-of-Experts in Continual Learning
par: Li, Hongbo, et autres
Publié: (2024)
par: Li, Hongbo, et autres
Publié: (2024)
Mixture of Weak & Strong Experts on Graphs
par: Zeng, Hanqing, et autres
Publié: (2023)
par: Zeng, Hanqing, et autres
Publié: (2023)
Understanding Expert Structures on Minimax Parameter Estimation in Contaminated Mixture of Experts
par: Yan, Fanqi, et autres
Publié: (2024)
par: Yan, Fanqi, et autres
Publié: (2024)
MoE++: Accelerating Mixture-of-Experts Methods with Zero-Computation Experts
par: Jin, Peng, et autres
Publié: (2024)
par: Jin, Peng, et autres
Publié: (2024)
UniPool: A Globally Shared Expert Pool for Mixture-of-Experts
par: Huang, Minbin, et autres
Publié: (2026)
par: Huang, Minbin, et autres
Publié: (2026)
Exploring Expert Specialization through Unsupervised Training in Sparse Mixture of Experts
par: Nikolic, Strahinja, et autres
Publié: (2025)
par: Nikolic, Strahinja, et autres
Publié: (2025)
Least-Loaded Expert Parallelism: Load Balancing An Imbalanced Mixture-of-Experts
par: Nguyen, Xuan-Phi, et autres
Publié: (2026)
par: Nguyen, Xuan-Phi, et autres
Publié: (2026)
Soft-to-Hard Routing in Sparse Mixture-of-Experts Models
par: Rastegar, Reza
Publié: (2026)
par: Rastegar, Reza
Publié: (2026)
Dynamic Mixture of Experts: An Auto-Tuning Approach for Efficient Transformer Models
par: Guo, Yongxin, et autres
Publié: (2024)
par: Guo, Yongxin, et autres
Publié: (2024)
PERFT: Parameter-Efficient Routed Fine-Tuning for Mixture-of-Expert Model
par: Liu, Yilun, et autres
Publié: (2024)
par: Liu, Yilun, et autres
Publié: (2024)
Dynamic Expert Quantization for Scalable Mixture-of-Experts Inference
par: Chu, Kexin, et autres
Publié: (2025)
par: Chu, Kexin, et autres
Publié: (2025)
Unveiling Hidden Collaboration within Mixture-of-Experts in Large Language Models
par: Tang, Yuanbo, et autres
Publié: (2025)
par: Tang, Yuanbo, et autres
Publié: (2025)
Routing Mamba: Scaling State Space Models with Mixture-of-Experts Projection
par: Zhan, Zheng, et autres
Publié: (2025)
par: Zhan, Zheng, et autres
Publié: (2025)
Documents similaires
-
How Many Experts Are Enough? Towards Optimal Semantic Specialization for Mixture-of-Experts
par: Park, Sumin, et autres
Publié: (2025) -
MC#: Mixture Compressor for Mixture-of-Experts Large Models
par: Huang, Wei, et autres
Publié: (2025) -
Efficiently Editing Mixture-of-Experts Models with Compressed Experts
par: He, Yifei, et autres
Publié: (2025) -
Explorations of Self-Repair in Language Models
par: Rushing, Cody, et autres
Publié: (2024) -
Mixture of Experts in Large Language Models
par: Zhang, Danyang, et autres
Publié: (2025)