XShare: Collaborative in-Batch Expert Sharing for Faster MoE Inference
Fuente:
arXiv
Salvato in:
| Autori principali: | Vankov, Daniil, Ivkin, Nikita, Ulrich, Kyle, Song, Xiang, Khetan, Ashish, Karypis, George |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Advancing Expert Specialization for Better MoE
di: Guo, Hongcan, et al.
Pubblicazione: (2025)
di: Guo, Hongcan, et al.
Pubblicazione: (2025)
Steer-MoE: Efficient Audio-Language Alignment with a Mixture-of-Experts Steering Module
di: Feng, Ruitao, et al.
Pubblicazione: (2025)
di: Feng, Ruitao, et al.
Pubblicazione: (2025)
REAP the Experts: Why Pruning Prevails for One-Shot MoE compression
di: Lasby, Mike, et al.
Pubblicazione: (2025)
di: Lasby, Mike, et al.
Pubblicazione: (2025)
GMoE: Empowering LLMs Fine-Tuning via MoE Graph Collaboration
di: Bai, Ting, et al.
Pubblicazione: (2024)
di: Bai, Ting, et al.
Pubblicazione: (2024)
U2++ MoE: Scaling 4.7x parameters with minimal impact on RTF
di: Song, Xingchen, et al.
Pubblicazione: (2024)
di: Song, Xingchen, et al.
Pubblicazione: (2024)
Chain of Draft: Thinking Faster by Writing Less
di: Xu, Silei, et al.
Pubblicazione: (2025)
di: Xu, Silei, et al.
Pubblicazione: (2025)
Aspect-Based Sentiment Analysis for Future Tourism Experiences: A BERT-MoE Framework for Persian User Reviews
di: Taskooh, Hamidreza Kazemi, et al.
Pubblicazione: (2026)
di: Taskooh, Hamidreza Kazemi, et al.
Pubblicazione: (2026)
Qwerty AI: Explainable Automated Age Rating and Content Safety Assessment for Russian-Language Screenplays
di: Zmanovskii, Nikita
Pubblicazione: (2025)
di: Zmanovskii, Nikita
Pubblicazione: (2025)
CRISP: Persistent Concept Unlearning via Sparse Autoencoders
di: Ashuach, Tomer, et al.
Pubblicazione: (2025)
di: Ashuach, Tomer, et al.
Pubblicazione: (2025)
POD-Attention: Unlocking Full Prefill-Decode Overlap for Faster LLM Inference
di: Kamath, Aditya K, et al.
Pubblicazione: (2024)
di: Kamath, Aditya K, et al.
Pubblicazione: (2024)
CoE: Collaborative Entropy for Uncertainty Quantification in Agentic Multi-LLM Systems
di: Sun, Kangkang, et al.
Pubblicazione: (2026)
di: Sun, Kangkang, et al.
Pubblicazione: (2026)
RouteScan: A Non-Intrusive Approach to Auditing MoE LLMs Safety via Expert Routing Telemetry
di: Lv, Bo, et al.
Pubblicazione: (2026)
di: Lv, Bo, et al.
Pubblicazione: (2026)
RAID: A Shared Benchmark for Robust Evaluation of Machine-Generated Text Detectors
di: Dugan, Liam, et al.
Pubblicazione: (2024)
di: Dugan, Liam, et al.
Pubblicazione: (2024)
Towards Greater Leverage: Scaling Laws for Efficient Mixture-of-Experts Language Models
di: Tian, Changxin, et al.
Pubblicazione: (2025)
di: Tian, Changxin, et al.
Pubblicazione: (2025)
RomanLens: The Role Of Latent Romanization In Multilinguality In LLMs
di: Saji, Alan, et al.
Pubblicazione: (2025)
di: Saji, Alan, et al.
Pubblicazione: (2025)
Text-Based Approaches to Item Difficulty Modeling in Large-Scale Assessments: A Systematic Review
di: Peters, Sydney, et al.
Pubblicazione: (2025)
di: Peters, Sydney, et al.
Pubblicazione: (2025)
Atomic Inference for NLI with Generated Facts as Atoms
di: Stacey, Joe, et al.
Pubblicazione: (2023)
di: Stacey, Joe, et al.
Pubblicazione: (2023)
SciEx: Benchmarking Large Language Models on Scientific Exams with Human Expert Grading and Automatic Grading
di: Dinh, Tu Anh, et al.
Pubblicazione: (2024)
di: Dinh, Tu Anh, et al.
Pubblicazione: (2024)
Cross-Lingual Generalization and Compression: From Language-Specific to Shared Neurons
di: Riemenschneider, Frederick, et al.
Pubblicazione: (2025)
di: Riemenschneider, Frederick, et al.
Pubblicazione: (2025)
Reducing Information Overload: Because Even Security Experts Need to Blink
di: Kuehn, Philipp, et al.
Pubblicazione: (2022)
di: Kuehn, Philipp, et al.
Pubblicazione: (2022)
Guided Speculative Inference for Efficient Test-Time Alignment of LLMs
di: Geuter, Jonathan, et al.
Pubblicazione: (2025)
di: Geuter, Jonathan, et al.
Pubblicazione: (2025)
Efficient Reasoning via Thought-Training and Thought-Free Inference
di: Wu, Canhui, et al.
Pubblicazione: (2025)
di: Wu, Canhui, et al.
Pubblicazione: (2025)
Heidelberg-Boston @ SIGTYP 2024 Shared Task: Enhancing Low-Resource Language Analysis With Character-Aware Hierarchical Transformers
di: Riemenschneider, Frederick, et al.
Pubblicazione: (2024)
di: Riemenschneider, Frederick, et al.
Pubblicazione: (2024)
ToolWeaver: Weaving Collaborative Semantics for Scalable Tool Use in Large Language Models
di: Fang, Bowen, et al.
Pubblicazione: (2026)
di: Fang, Bowen, et al.
Pubblicazione: (2026)
Towards Fundamental Language Models: Does Linguistic Competence Scale with Model Size?
di: Collado-Montañez, Jaime, et al.
Pubblicazione: (2025)
di: Collado-Montañez, Jaime, et al.
Pubblicazione: (2025)
SeLeRoSa: Sentence-Level Romanian Satire Detection Dataset
di: Smădu, Răzvan-Alexandru, et al.
Pubblicazione: (2025)
di: Smădu, Răzvan-Alexandru, et al.
Pubblicazione: (2025)
Automated Bug Triaging using Instruction-Tuned Large Language Models
di: Kiashemshaki, Kiana, et al.
Pubblicazione: (2025)
di: Kiashemshaki, Kiana, et al.
Pubblicazione: (2025)
Toward Architecture-Aware Evaluation Metrics for LLM Agents
di: Souza, Débora, et al.
Pubblicazione: (2026)
di: Souza, Débora, et al.
Pubblicazione: (2026)
Merge-Bench: Resolve Merge Conflicts with Large Language Models
di: Schesch, Benedikt, et al.
Pubblicazione: (2026)
di: Schesch, Benedikt, et al.
Pubblicazione: (2026)
AsyncTLS: Efficient Generative LLM Inference with Asynchronous Two-level Sparse Attention
di: Hu, Yuxuan, et al.
Pubblicazione: (2026)
di: Hu, Yuxuan, et al.
Pubblicazione: (2026)
Universal Adversarial Attack on Aligned Multimodal LLMs
di: Rahmatullaev, Temurbek, et al.
Pubblicazione: (2025)
di: Rahmatullaev, Temurbek, et al.
Pubblicazione: (2025)
Graphemic Normalization of the Perso-Arabic Script
di: Doctor, Raiomond, et al.
Pubblicazione: (2022)
di: Doctor, Raiomond, et al.
Pubblicazione: (2022)
Beyond Arabic: Software for Perso-Arabic Script Manipulation
di: Gutkin, Alexander, et al.
Pubblicazione: (2023)
di: Gutkin, Alexander, et al.
Pubblicazione: (2023)
Evaluating the Efficacy of Hybrid Deep Learning Models in Distinguishing AI-Generated Text
di: Oketunji, Abiodun Finbarrs
Pubblicazione: (2023)
di: Oketunji, Abiodun Finbarrs
Pubblicazione: (2023)
The Arrival of AGI? When Expert Personas Exceed Expert Benchmarks
di: Mullens, Drake, et al.
Pubblicazione: (2026)
di: Mullens, Drake, et al.
Pubblicazione: (2026)
Evaluating Large Language Models for Zero-Shot Disease Labeling in CT Radiology Reports Across Organ Systems
di: Garcia-Alcoser, Michael E., et al.
Pubblicazione: (2025)
di: Garcia-Alcoser, Michael E., et al.
Pubblicazione: (2025)
Mixture of Experts Approaches in Dense Retrieval Tasks
di: Sokli, Effrosyni, et al.
Pubblicazione: (2025)
di: Sokli, Effrosyni, et al.
Pubblicazione: (2025)
Leveraging Natural Language Processing and Machine Learning for Evidence-Based Food Security Policy Decision-Making in Data-Scarce Making
di: Singh, Karan Kumar, et al.
Pubblicazione: (2026)
di: Singh, Karan Kumar, et al.
Pubblicazione: (2026)
Task-Conditioned Routing Signatures in Sparse Mixture-of-Experts Transformers
di: Avinash, Mynampati Sri Ranganadha
Pubblicazione: (2026)
di: Avinash, Mynampati Sri Ranganadha
Pubblicazione: (2026)
CauESC: A Causal Aware Model for Emotional Support Conversation
di: Chen, Wei, et al.
Pubblicazione: (2024)
di: Chen, Wei, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Advancing Expert Specialization for Better MoE
di: Guo, Hongcan, et al.
Pubblicazione: (2025) -
Steer-MoE: Efficient Audio-Language Alignment with a Mixture-of-Experts Steering Module
di: Feng, Ruitao, et al.
Pubblicazione: (2025) -
REAP the Experts: Why Pruning Prevails for One-Shot MoE compression
di: Lasby, Mike, et al.
Pubblicazione: (2025) -
GMoE: Empowering LLMs Fine-Tuning via MoE Graph Collaboration
di: Bai, Ting, et al.
Pubblicazione: (2024) -
U2++ MoE: Scaling 4.7x parameters with minimal impact on RTF
di: Song, Xingchen, et al.
Pubblicazione: (2024)