FactorLLM: Factorizing Knowledge via Mixture of Experts for Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhao, Zhongyu, Dong, Menghang, Zhang, Rongyu, Zheng, Wenzhao, Zhang, Yunpeng, Yang, Huanrui, Du, Dalong, Keutzer, Kurt, Zhang, Shanghang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
T-REX: Mixture-of-Rank-One-Experts with Semantic-aware Intuition for Multi-task Large Language Model Finetuning
von: Zhang, Rongyu, et al.
Veröffentlicht: (2024)
von: Zhang, Rongyu, et al.
Veröffentlicht: (2024)
Instruct Large Language Models to Drive like Humans
von: Zhang, Ruijun, et al.
Veröffentlicht: (2024)
von: Zhang, Ruijun, et al.
Veröffentlicht: (2024)
PAT: Pruning-Aware Tuning for Large Language Models
von: Liu, Yijiang, et al.
Veröffentlicht: (2024)
von: Liu, Yijiang, et al.
Veröffentlicht: (2024)
MoLe-VLA: Dynamic Layer-skipping Vision Language Action Model via Mixture-of-Layers for Efficient Robot Manipulation
von: Zhang, Rongyu, et al.
Veröffentlicht: (2025)
von: Zhang, Rongyu, et al.
Veröffentlicht: (2025)
DrivingRecon: Large 4D Gaussian Reconstruction Model For Autonomous Driving
von: Lu, Hao, et al.
Veröffentlicht: (2024)
von: Lu, Hao, et al.
Veröffentlicht: (2024)
Decomposing the Neurons: Activation Sparsity via Mixture of Experts for Continual Test Time Adaptation
von: Zhang, Rongyu, et al.
Veröffentlicht: (2024)
von: Zhang, Rongyu, et al.
Veröffentlicht: (2024)
MITRA: A Large-Scale Parallel Corpus and Multilingual Pretrained Language Model for Machine Translation and Semantic Retrieval for Pāli, Sanskrit, Buddhist Chinese, and Tibetan
von: Nehrdich, Sebastian, et al.
Veröffentlicht: (2026)
von: Nehrdich, Sebastian, et al.
Veröffentlicht: (2026)
SpikeGen: Decoupled "Rods and Cones" Visual Representation Processing with Latent Generative Framework
von: Dai, Gaole, et al.
Veröffentlicht: (2025)
von: Dai, Gaole, et al.
Veröffentlicht: (2025)
Cluster-Driven Expert Pruning for Mixture-of-Experts Large Language Models
von: Guo, Hongcheng, et al.
Veröffentlicht: (2025)
von: Guo, Hongcheng, et al.
Veröffentlicht: (2025)
GPD-1: Generative Pre-training for Driving
von: Xie, Zixun, et al.
Veröffentlicht: (2024)
von: Xie, Zixun, et al.
Veröffentlicht: (2024)
VeCAF: Vision-language Collaborative Active Finetuning with Training Objective Awareness
von: Zhang, Rongyu, et al.
Veröffentlicht: (2024)
von: Zhang, Rongyu, et al.
Veröffentlicht: (2024)
Unveiling Super Experts in Mixture-of-Experts Large Language Models
von: Su, Zunhai, et al.
Veröffentlicht: (2025)
von: Su, Zunhai, et al.
Veröffentlicht: (2025)
Knowledge Graph Large Language Model (KG-LLM) for Link Prediction
von: Shu, Dong, et al.
Veröffentlicht: (2024)
von: Shu, Dong, et al.
Veröffentlicht: (2024)
Bayesian Mixture of Experts For Large Language Models
von: Dialameh, Maryam, et al.
Veröffentlicht: (2025)
von: Dialameh, Maryam, et al.
Veröffentlicht: (2025)
Segment Any Motion in Videos
von: Huang, Nan, et al.
Veröffentlicht: (2025)
von: Huang, Nan, et al.
Veröffentlicht: (2025)
EvoMoE: Expert Evolution in Mixture of Experts for Multimodal Large Language Models
von: Jing, Linglin, et al.
Veröffentlicht: (2025)
von: Jing, Linglin, et al.
Veröffentlicht: (2025)
Diversifying the Expert Knowledge for Task-Agnostic Pruning in Sparse Mixture-of-Experts
von: Zhang, Zeliang, et al.
Veröffentlicht: (2024)
von: Zhang, Zeliang, et al.
Veröffentlicht: (2024)
GaussianFormer-2: Probabilistic Gaussian Superposition for Efficient 3D Occupancy Prediction
von: Huang, Yuanhui, et al.
Veröffentlicht: (2024)
von: Huang, Yuanhui, et al.
Veröffentlicht: (2024)
FBQuant: FeedBack Quantization for Large Language Models
von: Liu, Yijiang, et al.
Veröffentlicht: (2025)
von: Liu, Yijiang, et al.
Veröffentlicht: (2025)
Fisher-aware Quantization for DETR Detectors with Critical-category Objectives
von: Yang, Huanrui, et al.
Veröffentlicht: (2024)
von: Yang, Huanrui, et al.
Veröffentlicht: (2024)
MoDES: Accelerating Mixture-of-Experts Multimodal Large Language Models via Dynamic Expert Skipping
von: Huang, Yushi, et al.
Veröffentlicht: (2025)
von: Huang, Yushi, et al.
Veröffentlicht: (2025)
GeoDrive: 3D Geometry-Informed Driving World Model with Precise Action Control
von: Chen, Anthony, et al.
Veröffentlicht: (2025)
von: Chen, Anthony, et al.
Veröffentlicht: (2025)
SEED: Targeted Data Selection by Weighted Independent Set
von: Zhang, Yuan, et al.
Veröffentlicht: (2026)
von: Zhang, Yuan, et al.
Veröffentlicht: (2026)
Scalable Multi-Stage Influence Function for Large Language Models via Eigenvalue-Corrected Kronecker-Factored Parameterization
von: Bao, Yuntai, et al.
Veröffentlicht: (2025)
von: Bao, Yuntai, et al.
Veröffentlicht: (2025)
Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models
von: Lu, Xudong, et al.
Veröffentlicht: (2024)
von: Lu, Xudong, et al.
Veröffentlicht: (2024)
S'MoRE: Structural Mixture of Residual Experts for Parameter-Efficient LLM Fine-tuning
von: Zeng, Hanqing, et al.
Veröffentlicht: (2025)
von: Zeng, Hanqing, et al.
Veröffentlicht: (2025)
Lifelong Knowledge Editing for Vision Language Models with Low-Rank Mixture-of-Experts
von: Chen, Qizhou, et al.
Veröffentlicht: (2024)
von: Chen, Qizhou, et al.
Veröffentlicht: (2024)
Knowledge-to-SQL: Enhancing SQL Generation with Data Expert LLM
von: Hong, Zijin, et al.
Veröffentlicht: (2024)
von: Hong, Zijin, et al.
Veröffentlicht: (2024)
LLM as Dataset Analyst: Subpopulation Structure Discovery with Large Language Model
von: Luo, Yulin, et al.
Veröffentlicht: (2024)
von: Luo, Yulin, et al.
Veröffentlicht: (2024)
Routing Distilled Knowledge via Mixture of LoRA Experts for Large Language Model based Bundle Generation
von: Feng, Kaidong, et al.
Veröffentlicht: (2025)
von: Feng, Kaidong, et al.
Veröffentlicht: (2025)
Efficiently Democratizing Medical LLMs for 50 Languages via a Mixture of Language Family Experts
von: Zheng, Guorui, et al.
Veröffentlicht: (2024)
von: Zheng, Guorui, et al.
Veröffentlicht: (2024)
Taming Sensitive Weights : Noise Perturbation Fine-tuning for Robust LLM Quantization
von: Wang, Dongwei, et al.
Veröffentlicht: (2024)
von: Wang, Dongwei, et al.
Veröffentlicht: (2024)
BASE-Q: Bias and Asymmetric Scaling Enhanced Rotational Quantization for Large Language Models
von: He, Liulu, et al.
Veröffentlicht: (2025)
von: He, Liulu, et al.
Veröffentlicht: (2025)
Router Upcycling: Leveraging Mixture-of-Routers in Mixture-of-Experts Upcycling
von: Ran, Junfeng, et al.
Veröffentlicht: (2025)
von: Ran, Junfeng, et al.
Veröffentlicht: (2025)
Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts
von: Wang, Haoxiang, et al.
Veröffentlicht: (2024)
von: Wang, Haoxiang, et al.
Veröffentlicht: (2024)
DIVE into MoE: Diversity-Enhanced Reconstruction of Large Language Models from Dense into Mixture-of-Experts
von: Feng, Yuchen, et al.
Veröffentlicht: (2025)
von: Feng, Yuchen, et al.
Veröffentlicht: (2025)
Split-Ensemble: Efficient OOD-aware Ensemble via Task and Model Splitting
von: Chen, Anthony, et al.
Veröffentlicht: (2023)
von: Chen, Anthony, et al.
Veröffentlicht: (2023)
MoASE++: Mixture of Activation Sparsity Experts with Domain-Adaptive On-policy Distillation for Continual Test Time Adaptation
von: Zhang, Ronyu, et al.
Veröffentlicht: (2026)
von: Zhang, Ronyu, et al.
Veröffentlicht: (2026)
One Model is All You Need: ByT5-Sanskrit, a Unified Model for Sanskrit NLP Tasks
von: Nehrdich, Sebastian, et al.
Veröffentlicht: (2024)
von: Nehrdich, Sebastian, et al.
Veröffentlicht: (2024)
Simple and Effective Input Reformulations for Translation
von: Yu, Brian, et al.
Veröffentlicht: (2023)
von: Yu, Brian, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
T-REX: Mixture-of-Rank-One-Experts with Semantic-aware Intuition for Multi-task Large Language Model Finetuning
von: Zhang, Rongyu, et al.
Veröffentlicht: (2024) -
Instruct Large Language Models to Drive like Humans
von: Zhang, Ruijun, et al.
Veröffentlicht: (2024) -
PAT: Pruning-Aware Tuning for Large Language Models
von: Liu, Yijiang, et al.
Veröffentlicht: (2024) -
MoLe-VLA: Dynamic Layer-skipping Vision Language Action Model via Mixture-of-Layers for Efficient Robot Manipulation
von: Zhang, Rongyu, et al.
Veröffentlicht: (2025) -
DrivingRecon: Large 4D Gaussian Reconstruction Model For Autonomous Driving
von: Lu, Hao, et al.
Veröffentlicht: (2024)