Merging Feed-Forward Sublayers for Compressed Transformers
Fuente:
arXiv
Salvato in:
| Autori principali: | Verma, Neha, Murray, Kenton, Duh, Kevin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DOTResize: Reducing LLM Width via Discrete Optimal Transport-based Neuron Merging
di: Verma, Neha, et al.
Pubblicazione: (2025)
di: Verma, Neha, et al.
Pubblicazione: (2025)
Exploring Representational Disparities Between Multilingual and Bilingual Translation Models
di: Verma, Neha, et al.
Pubblicazione: (2023)
di: Verma, Neha, et al.
Pubblicazione: (2023)
Merging Text Transformer Models from Different Initializations
di: Verma, Neha, et al.
Pubblicazione: (2024)
di: Verma, Neha, et al.
Pubblicazione: (2024)
Rethinking Attention: Exploring Shallow Feed-Forward Neural Networks as an Alternative to Attention Layers in Transformers
di: Bozic, Vukasin, et al.
Pubblicazione: (2023)
di: Bozic, Vukasin, et al.
Pubblicazione: (2023)
Uncertainty Distillation: Teaching Language Models to Express Semantic Confidence
di: Hager, Sophia, et al.
Pubblicazione: (2025)
di: Hager, Sophia, et al.
Pubblicazione: (2025)
Supernodes and Halos: Loss-Critical Hubs in LLM Feed-Forward Layers
di: Cherilyn, Audrey, et al.
Pubblicazione: (2026)
di: Cherilyn, Audrey, et al.
Pubblicazione: (2026)
Upsample or Upweight? Balanced Training on Heavily Imbalanced Datasets
di: Li, Tianjian, et al.
Pubblicazione: (2024)
di: Li, Tianjian, et al.
Pubblicazione: (2024)
Data Kernel Perspective Space Performance Guarantees for Synthetic Data from Transformer Models
di: Browder, Michael, et al.
Pubblicazione: (2026)
di: Browder, Michael, et al.
Pubblicazione: (2026)
FFN-SkipLLM: A Hidden Gem for Autoregressive Decoding with Adaptive Feed Forward Skipping
di: Jaiswal, Ajay, et al.
Pubblicazione: (2024)
di: Jaiswal, Ajay, et al.
Pubblicazione: (2024)
SELAUR: Self Evolving LLM Agent via Uncertainty-aware Rewards
di: Zhang, Dengjia, et al.
Pubblicazione: (2026)
di: Zhang, Dengjia, et al.
Pubblicazione: (2026)
ORBIT: Preserving Foundational Language Capabilities in GenRetrieval via Origin-Regulated Merging
di: Verma, Neha, et al.
Pubblicazione: (2026)
di: Verma, Neha, et al.
Pubblicazione: (2026)
Flash Multi-Head Feed-Forward Network
di: Zhang, Minshen, et al.
Pubblicazione: (2025)
di: Zhang, Minshen, et al.
Pubblicazione: (2025)
ALTA: Compiler-Based Analysis of Transformers
di: Shaw, Peter, et al.
Pubblicazione: (2024)
di: Shaw, Peter, et al.
Pubblicazione: (2024)
Tiny Transformers Excel at Sentence Compression
di: Belcak, Peter, et al.
Pubblicazione: (2024)
di: Belcak, Peter, et al.
Pubblicazione: (2024)
Merge to Learn: Efficiently Adding Skills to Language Models with Model Merging
di: Morrison, Jacob, et al.
Pubblicazione: (2024)
di: Morrison, Jacob, et al.
Pubblicazione: (2024)
Merge, Then Compress: Demystify Efficient SMoE with Hints from Its Routing Policy
di: Li, Pingzhi, et al.
Pubblicazione: (2023)
di: Li, Pingzhi, et al.
Pubblicazione: (2023)
HMT: Hierarchical Memory Transformer for Efficient Long Context Language Processing
di: He, Zifan, et al.
Pubblicazione: (2024)
di: He, Zifan, et al.
Pubblicazione: (2024)
Compress, Gather, and Recompute: REFORMing Long-Context Processing in Transformers
di: Song, Woomin, et al.
Pubblicazione: (2025)
di: Song, Woomin, et al.
Pubblicazione: (2025)
ProcrustesGPT: Compressing LLMs with Structured Matrices and Orthogonal Transformations
di: Grishina, Ekaterina, et al.
Pubblicazione: (2025)
di: Grishina, Ekaterina, et al.
Pubblicazione: (2025)
Projected Compression: Trainable Projection for Efficient Transformer Compression
di: Stefaniak, Maciej, et al.
Pubblicazione: (2025)
di: Stefaniak, Maciej, et al.
Pubblicazione: (2025)
Communication Compression for Tensor Parallel LLM Inference
di: Hansen-Palmus, Jan, et al.
Pubblicazione: (2024)
di: Hansen-Palmus, Jan, et al.
Pubblicazione: (2024)
ComMer: a Framework for Compressing and Merging User Data for Personalization
di: Zeldes, Yoel, et al.
Pubblicazione: (2025)
di: Zeldes, Yoel, et al.
Pubblicazione: (2025)
Channel Merging: Preserving Specialization for Merged Experts
di: Zhang, Mingyang, et al.
Pubblicazione: (2024)
di: Zhang, Mingyang, et al.
Pubblicazione: (2024)
Grow Up and Merge: Scaling Strategies for Efficient Language Adaptation
di: Glocker, Kevin, et al.
Pubblicazione: (2025)
di: Glocker, Kevin, et al.
Pubblicazione: (2025)
Fast Forwarding Low-Rank Training
di: Rahamim, Adir, et al.
Pubblicazione: (2024)
di: Rahamim, Adir, et al.
Pubblicazione: (2024)
Strategic Fusion Optimizes Transformer Compression
di: Rahman, Md Shoaibur
Pubblicazione: (2025)
di: Rahman, Md Shoaibur
Pubblicazione: (2025)
A Survey on Transformer Compression
di: Tang, Yehui, et al.
Pubblicazione: (2024)
di: Tang, Yehui, et al.
Pubblicazione: (2024)
Merging by Matching Models in Task Parameter Subspaces
di: Tam, Derek, et al.
Pubblicazione: (2023)
di: Tam, Derek, et al.
Pubblicazione: (2023)
Merge to Mix: Mixing Datasets via Model Merging
di: Tao, Zhixu Silvia, et al.
Pubblicazione: (2025)
di: Tao, Zhixu Silvia, et al.
Pubblicazione: (2025)
When Does Removing LayerNorm Help? Activation Bounding as a Regime-Dependent Implicit Regularizer
di: Verma, Lucky
Pubblicazione: (2026)
di: Verma, Lucky
Pubblicazione: (2026)
Optimal Brain Iterative Merging: Mitigating Interference in LLM Merging
di: Wang, Zhixiang, et al.
Pubblicazione: (2025)
di: Wang, Zhixiang, et al.
Pubblicazione: (2025)
Twin-Merging: Dynamic Integration of Modular Expertise in Model Merging
di: Lu, Zhenyi, et al.
Pubblicazione: (2024)
di: Lu, Zhenyi, et al.
Pubblicazione: (2024)
Model Merging in Pre-training of Large Language Models
di: Li, Yunshui, et al.
Pubblicazione: (2025)
di: Li, Yunshui, et al.
Pubblicazione: (2025)
Functionality-Oriented LLM Merging on the Fisher--Rao Manifold
di: Wang, Jiayu, et al.
Pubblicazione: (2026)
di: Wang, Jiayu, et al.
Pubblicazione: (2026)
Dataless Knowledge Fusion by Merging Weights of Language Models
di: Jin, Xisen, et al.
Pubblicazione: (2022)
di: Jin, Xisen, et al.
Pubblicazione: (2022)
Fine-Tuning Language Models with Just Forward Passes
di: Malladi, Sadhika, et al.
Pubblicazione: (2023)
di: Malladi, Sadhika, et al.
Pubblicazione: (2023)
Arcee's MergeKit: A Toolkit for Merging Large Language Models
di: Goddard, Charles, et al.
Pubblicazione: (2024)
di: Goddard, Charles, et al.
Pubblicazione: (2024)
Online Merging Optimizers for Boosting Rewards and Mitigating Tax in Alignment
di: Lu, Keming, et al.
Pubblicazione: (2024)
di: Lu, Keming, et al.
Pubblicazione: (2024)
Tracking Universal Features Through Fine-Tuning and Model Merging
di: Horn, Niels, et al.
Pubblicazione: (2024)
di: Horn, Niels, et al.
Pubblicazione: (2024)
Circuit Fingerprints: How Answer Tokens Encode Their Geometrical Path
di: Saurez, Andres, et al.
Pubblicazione: (2026)
di: Saurez, Andres, et al.
Pubblicazione: (2026)
Documenti analoghi
-
DOTResize: Reducing LLM Width via Discrete Optimal Transport-based Neuron Merging
di: Verma, Neha, et al.
Pubblicazione: (2025) -
Exploring Representational Disparities Between Multilingual and Bilingual Translation Models
di: Verma, Neha, et al.
Pubblicazione: (2023) -
Merging Text Transformer Models from Different Initializations
di: Verma, Neha, et al.
Pubblicazione: (2024) -
Rethinking Attention: Exploring Shallow Feed-Forward Neural Networks as an Alternative to Attention Layers in Transformers
di: Bozic, Vukasin, et al.
Pubblicazione: (2023) -
Uncertainty Distillation: Teaching Language Models to Express Semantic Confidence
di: Hager, Sophia, et al.
Pubblicazione: (2025)