Parameter-Efficient Fine-Tuning of LLMs with Mixture of Space Experts
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Buze, Tao, Jinkai, Zeng, Zilang, He, Neil, Maatouk, Ali, Yang, Menglin, Ying, Rex |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Hyperbolic Fine-Tuning for Large Language Models
di: Yang, Menglin, et al.
Pubblicazione: (2024)
di: Yang, Menglin, et al.
Pubblicazione: (2024)
SwitchHead: Accelerating Transformers with Mixture-of-Experts Attention
di: Csordás, Róbert, et al.
Pubblicazione: (2023)
di: Csordás, Róbert, et al.
Pubblicazione: (2023)
Bio-Inspired Mamba: Temporal Locality and Bioplausible Learning in Selective State Space Models
di: Qin, Jiahao
Pubblicazione: (2024)
di: Qin, Jiahao
Pubblicazione: (2024)
GRASP: GRouped Activation Shared Parameterization for Parameter-Efficient Fine-Tuning and Robust Inference of Transformers
di: Bal, Malyaban, et al.
Pubblicazione: (2025)
di: Bal, Malyaban, et al.
Pubblicazione: (2025)
Learning Mixture-of-Experts for General-Purpose Black-Box Discrete Optimization
di: Liu, Shengcai, et al.
Pubblicazione: (2024)
di: Liu, Shengcai, et al.
Pubblicazione: (2024)
Projection-Free Evolution Strategies for Continuous Prompt Search
di: Cai, Yu, et al.
Pubblicazione: (2026)
di: Cai, Yu, et al.
Pubblicazione: (2026)
Fine-Tuning Language Models to Know What They Know
di: Park, Sangjun, et al.
Pubblicazione: (2026)
di: Park, Sangjun, et al.
Pubblicazione: (2026)
Why Fine-Tuning Encourages Hallucinations and How to Fix It
di: Kaplan, Guy, et al.
Pubblicazione: (2026)
di: Kaplan, Guy, et al.
Pubblicazione: (2026)
Children's Acquisition of Tail-recursion Sequences: A Review of Locative Recursion and Possessive Recursion as Examples
di: Wang, Xiaoyi, et al.
Pubblicazione: (2024)
di: Wang, Xiaoyi, et al.
Pubblicazione: (2024)
Parallel Spiking Unit for Efficient Training of Spiking Neural Networks
di: Li, Yang, et al.
Pubblicazione: (2024)
di: Li, Yang, et al.
Pubblicazione: (2024)
Fine-Tuning and Evaluating Open-Source Large Language Models for the Army Domain
di: Ruiz, Daniel C., et al.
Pubblicazione: (2024)
di: Ruiz, Daniel C., et al.
Pubblicazione: (2024)
Large Language Models for Tuning Evolution Strategies
di: Kramer, Oliver
Pubblicazione: (2024)
di: Kramer, Oliver
Pubblicazione: (2024)
Fine-Tuning Surrogate Gradient Learning for Optimal Hardware Performance in Spiking Neural Networks
di: Aliyev, Ilkin, et al.
Pubblicazione: (2024)
di: Aliyev, Ilkin, et al.
Pubblicazione: (2024)
Hierarchical Frequency Tagging Probe (HFTP): A Unified Approach to Investigate Syntactic Structure Representations in Large Language Models and the Human Brain
di: An, Jingmin, et al.
Pubblicazione: (2025)
di: An, Jingmin, et al.
Pubblicazione: (2025)
Decomposing Evolutionary Mixture-of-LoRA Architectures: The Routing Lever, the Lifecycle Penalty, and a Substrate-Conditional Boundary
di: Kumaresan, Ramchand
Pubblicazione: (2026)
di: Kumaresan, Ramchand
Pubblicazione: (2026)
Mixture of Experts with Soft Nearest Neighbor Loss: Resolving Expert Collapse via Representation Disentanglement
di: Agarap, Abien Fred, et al.
Pubblicazione: (2026)
di: Agarap, Abien Fred, et al.
Pubblicazione: (2026)
Multi-objective Binary Differential Approach with Parameter Tuning for Discovering Business Process Models: MoD-ProM
di: Deshmukh, Sonia, et al.
Pubblicazione: (2024)
di: Deshmukh, Sonia, et al.
Pubblicazione: (2024)
What Makes an LLM a Good Optimizer? A Trajectory Analysis of LLM-Guided Evolutionary Search
di: Zhang, Xinhao, et al.
Pubblicazione: (2026)
di: Zhang, Xinhao, et al.
Pubblicazione: (2026)
A Comprehensive Empirical Evaluation of Existing Word Embedding Approaches
di: Zaland, Obaidullah, et al.
Pubblicazione: (2023)
di: Zaland, Obaidullah, et al.
Pubblicazione: (2023)
Generalization and Completeness of Stochastic Local Search Algorithms
di: Loscos, Daniel, et al.
Pubblicazione: (2026)
di: Loscos, Daniel, et al.
Pubblicazione: (2026)
Spiking Convolutional Neural Networks for Text Classification
di: Lv, Changze, et al.
Pubblicazione: (2024)
di: Lv, Changze, et al.
Pubblicazione: (2024)
Personalized Language Models via Privacy-Preserving Evolutionary Model Merging
di: Kim, Kyuyoung, et al.
Pubblicazione: (2025)
di: Kim, Kyuyoung, et al.
Pubblicazione: (2025)
A survey on learning models of spiking neural membrane systems and spiking neural networks
di: Paul, Prithwineel, et al.
Pubblicazione: (2024)
di: Paul, Prithwineel, et al.
Pubblicazione: (2024)
Simulated Language Acquisition in a Biologically Realistic Model of the Brain
di: Mitropolsky, Daniel, et al.
Pubblicazione: (2025)
di: Mitropolsky, Daniel, et al.
Pubblicazione: (2025)
Towards Faster k-Nearest-Neighbor Machine Translation
di: Shi, Xiangyu, et al.
Pubblicazione: (2023)
di: Shi, Xiangyu, et al.
Pubblicazione: (2023)
VietNormalizer: An Open-Source, Dependency-Free Python Library for Vietnamese Text Normalization in TTS and NLP Applications
di: Nguyen, Hung Vu, et al.
Pubblicazione: (2026)
di: Nguyen, Hung Vu, et al.
Pubblicazione: (2026)
SeaEvo: Advancing Algorithm Discovery with Strategy Space Evolution
di: Luo, Sichun, et al.
Pubblicazione: (2026)
di: Luo, Sichun, et al.
Pubblicazione: (2026)
PaceLLM: Brain-Inspired Large Language Models for Long-Context Understanding
di: Li, Kangcong, et al.
Pubblicazione: (2025)
di: Li, Kangcong, et al.
Pubblicazione: (2025)
Affinity Is Not Enough: Recovering the Free Energy Principle in Mixture-of-Experts
di: Wong, Man Yung
Pubblicazione: (2026)
di: Wong, Man Yung
Pubblicazione: (2026)
A Gated Residual Kolmogorov-Arnold Networks for Mixtures of Experts
di: Inzirillo, Hugo, et al.
Pubblicazione: (2024)
di: Inzirillo, Hugo, et al.
Pubblicazione: (2024)
Spiking Neural Networks with Consistent Mapping Relations Allow High-Accuracy Inference
di: Li, Yang, et al.
Pubblicazione: (2024)
di: Li, Yang, et al.
Pubblicazione: (2024)
Semantic Mirror Jailbreak: Genetic Algorithm Based Jailbreak Prompts Against Open-source LLMs
di: Li, Xiaoxia, et al.
Pubblicazione: (2024)
di: Li, Xiaoxia, et al.
Pubblicazione: (2024)
SpikingSSMs: Learning Long Sequences with Sparse and Parallel Spiking State Space Models
di: Shen, Shuaijie, et al.
Pubblicazione: (2024)
di: Shen, Shuaijie, et al.
Pubblicazione: (2024)
B'MOJO: Hybrid State Space Realizations of Foundation Models with Eidetic and Fading Memory
di: Zancato, Luca, et al.
Pubblicazione: (2024)
di: Zancato, Luca, et al.
Pubblicazione: (2024)
Hysteresis Activation Function for Efficient Inference
di: Kimhi, Moshe, et al.
Pubblicazione: (2024)
di: Kimhi, Moshe, et al.
Pubblicazione: (2024)
Neuronal Group Communication for Efficient Neural representation
di: Pei, Zhengqi, et al.
Pubblicazione: (2025)
di: Pei, Zhengqi, et al.
Pubblicazione: (2025)
Efficient Fireworks Algorithm Equipped with an Explosion Mechanism based on Student's T-distribution
di: Shipeng, Cen, et al.
Pubblicazione: (2025)
di: Shipeng, Cen, et al.
Pubblicazione: (2025)
Efficiently Tackling Million-Dimensional Multiobjective Problems: A Direction Sampling and Fine-Tuning Approach
di: Hong, Haokai, et al.
Pubblicazione: (2023)
di: Hong, Haokai, et al.
Pubblicazione: (2023)
AP-BMM: Approximating Capability-Cost Pareto Sets of LLMs via Asynchronous Prior-Guided Bayesian Model Merging
di: Chen, Kesheng, et al.
Pubblicazione: (2025)
di: Chen, Kesheng, et al.
Pubblicazione: (2025)
HAT: Hardware-Aware Transformers for Efficient Natural Language Processing
di: Wang, Hanrui, et al.
Pubblicazione: (2020)
di: Wang, Hanrui, et al.
Pubblicazione: (2020)
Documenti analoghi
-
Hyperbolic Fine-Tuning for Large Language Models
di: Yang, Menglin, et al.
Pubblicazione: (2024) -
SwitchHead: Accelerating Transformers with Mixture-of-Experts Attention
di: Csordás, Róbert, et al.
Pubblicazione: (2023) -
Bio-Inspired Mamba: Temporal Locality and Bioplausible Learning in Selective State Space Models
di: Qin, Jiahao
Pubblicazione: (2024) -
GRASP: GRouped Activation Shared Parameterization for Parameter-Efficient Fine-Tuning and Robust Inference of Transformers
di: Bal, Malyaban, et al.
Pubblicazione: (2025) -
Learning Mixture-of-Experts for General-Purpose Black-Box Discrete Optimization
di: Liu, Shengcai, et al.
Pubblicazione: (2024)