MASS: MoErging through Adaptive Subspace Selection
Fuente:
arXiv
Salvato in:
| Autori principali: | Crisostomi, Donato, Zirilli, Alessandro, Gargiulo, Antonio Andrea, Bucarelli, Maria Sofia, Scardapane, Simone, Silvestri, Fabrizio, Masi, Iacopo, Rodolà, Emanuele |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Task Singular Vectors: Reducing Task Interference in Model Merging
di: Gargiulo, Antonio Andrea, et al.
Pubblicazione: (2024)
di: Gargiulo, Antonio Andrea, et al.
Pubblicazione: (2024)
ATM: Improving Model Merging by Alternating Tuning and Merging
di: Zhou, Luca, et al.
Pubblicazione: (2024)
di: Zhou, Luca, et al.
Pubblicazione: (2024)
On Task Vectors and Gradients
di: Zhou, Luca, et al.
Pubblicazione: (2025)
di: Zhou, Luca, et al.
Pubblicazione: (2025)
A Survey on Model MoErging: Recycling and Routing Among Specialized Experts for Collaborative Learning
di: Yadav, Prateek, et al.
Pubblicazione: (2024)
di: Yadav, Prateek, et al.
Pubblicazione: (2024)
Implicit Inversion turns CLIP into a Decoder
di: D'Orazio, Antonio, et al.
Pubblicazione: (2025)
di: D'Orazio, Antonio, et al.
Pubblicazione: (2025)
Multi-objective Evolutionary Merging Enables Efficient Reasoning Models
di: Iacobelli, Mario, et al.
Pubblicazione: (2026)
di: Iacobelli, Mario, et al.
Pubblicazione: (2026)
Two-Scale Latent Dynamics for Recurrent-Depth Transformers
di: Pappone, Francesco, et al.
Pubblicazione: (2025)
di: Pappone, Francesco, et al.
Pubblicazione: (2025)
Zero-Shot Quantization via Weight-Space Arithmetic
di: Solombrino, Daniele, et al.
Pubblicazione: (2026)
di: Solombrino, Daniele, et al.
Pubblicazione: (2026)
Select, Label, Evaluate: Active Testing in NLP
di: Purificato, Antonio, et al.
Pubblicazione: (2026)
di: Purificato, Antonio, et al.
Pubblicazione: (2026)
Model Merging Improves Zero-Shot Generalization in Bioacoustic Foundation Models
di: Marincione, Davide, et al.
Pubblicazione: (2025)
di: Marincione, Davide, et al.
Pubblicazione: (2025)
Learning with Noisy Labels through Learnable Weighting and Centroid Similarity
di: Wani, Farooq Ahmad, et al.
Pubblicazione: (2023)
di: Wani, Farooq Ahmad, et al.
Pubblicazione: (2023)
Mergenetic: a Simple Evolutionary Model Merging Library
di: Minut, Adrian Robert, et al.
Pubblicazione: (2025)
di: Minut, Adrian Robert, et al.
Pubblicazione: (2025)
MERGE$^3$: Efficient Evolutionary Merging on Consumer-grade GPUs
di: Mencattini, Tommaso, et al.
Pubblicazione: (2025)
di: Mencattini, Tommaso, et al.
Pubblicazione: (2025)
STAGE: Stemmed Accompaniment Generation through Prefix-Based Conditioning
di: Strano, Giorgio, et al.
Pubblicazione: (2025)
di: Strano, Giorgio, et al.
Pubblicazione: (2025)
Metric Based Few-Shot Graph Classification
di: Crisostomi, Donato, et al.
Pubblicazione: (2022)
di: Crisostomi, Donato, et al.
Pubblicazione: (2022)
LoopGen: Training-Free Loopable Music Generation
di: Marincione, Davide, et al.
Pubblicazione: (2025)
di: Marincione, Davide, et al.
Pubblicazione: (2025)
Efficient Generation of Multimodal Fluid Simulation Data
di: Baieri, Daniele, et al.
Pubblicazione: (2023)
di: Baieri, Daniele, et al.
Pubblicazione: (2023)
$C^2M^3$: Cycle-Consistent Multi-Model Merging
di: Crisostomi, Donato, et al.
Pubblicazione: (2024)
di: Crisostomi, Donato, et al.
Pubblicazione: (2024)
Language Models are Injective and Hence Invertible
di: Nikolaou, Giorgos, et al.
Pubblicazione: (2025)
di: Nikolaou, Giorgos, et al.
Pubblicazione: (2025)
Activation Patching for Interpretable Steering in Music Generation
di: Facchiano, Simone, et al.
Pubblicazione: (2025)
di: Facchiano, Simone, et al.
Pubblicazione: (2025)
Hypergraph Neural Networks through the Lens of Message Passing: A Common Perspective to Homophily and Architecture Design
di: Telyatnikov, Lev, et al.
Pubblicazione: (2023)
di: Telyatnikov, Lev, et al.
Pubblicazione: (2023)
Multimodal Neural Databases
di: Trappolini, Giovanni, et al.
Pubblicazione: (2023)
di: Trappolini, Giovanni, et al.
Pubblicazione: (2023)
Link Prediction with Physics-Inspired Graph Neural Networks
di: Di Francesco, Andrea Giuseppe, et al.
Pubblicazione: (2024)
di: Di Francesco, Andrea Giuseppe, et al.
Pubblicazione: (2024)
Model Merging: Foundations and Algorithms
di: Crisostomi, Donato
Pubblicazione: (2026)
di: Crisostomi, Donato
Pubblicazione: (2026)
PISA: Prioritized Invariant Subgraph Aggregation
di: Ghasemi, Ali, et al.
Pubblicazione: (2025)
di: Ghasemi, Ali, et al.
Pubblicazione: (2025)
Subtract the Corruption: Training-Data-Free Corrective Machine Unlearning using Task Arithmetic
di: Mozafari, Mostafa, et al.
Pubblicazione: (2025)
di: Mozafari, Mostafa, et al.
Pubblicazione: (2025)
The Majority Vote Paradigm Shift: When Popular Meets Optimal
di: Purificato, Antonio, et al.
Pubblicazione: (2025)
di: Purificato, Antonio, et al.
Pubblicazione: (2025)
$\nabla τ$: Gradient-based and Task-Agnostic machine Unlearning
di: Trippa, Daniel, et al.
Pubblicazione: (2024)
di: Trippa, Daniel, et al.
Pubblicazione: (2024)
Adaptive Point Transformer
di: Baiocchi, Alessandro, et al.
Pubblicazione: (2024)
di: Baiocchi, Alessandro, et al.
Pubblicazione: (2024)
Update Your Transformer to the Latest Release: Re-Basin of Task Vectors
di: Rinaldi, Filippo, et al.
Pubblicazione: (2025)
di: Rinaldi, Filippo, et al.
Pubblicazione: (2025)
Energy Guided smoothness to improve Robustness in Graph Classification
di: Wani, Farooq Ahmad, et al.
Pubblicazione: (2024)
di: Wani, Farooq Ahmad, et al.
Pubblicazione: (2024)
Membership and Dataset Inference Attacks on Large Audio Generative Models
di: Proboszcz, Jakub, et al.
Pubblicazione: (2025)
di: Proboszcz, Jakub, et al.
Pubblicazione: (2025)
Inverse Language Modeling towards Robust and Grounded LLMs
di: Gabrielli, Davide, et al.
Pubblicazione: (2025)
di: Gabrielli, Davide, et al.
Pubblicazione: (2025)
Compositional Generalization in Autoregressive Models via Logit Composition
di: Kumar, Aakash, et al.
Pubblicazione: (2026)
di: Kumar, Aakash, et al.
Pubblicazione: (2026)
A topological description of loss surfaces based on Betti Numbers
di: Bucarelli, Maria Sofia, et al.
Pubblicazione: (2024)
di: Bucarelli, Maria Sofia, et al.
Pubblicazione: (2024)
Attention Sinks in Diffusion Language Models
di: Rulli, Maximo Eduardo, et al.
Pubblicazione: (2025)
di: Rulli, Maximo Eduardo, et al.
Pubblicazione: (2025)
Multi-Way Representation Alignment
di: Achara, Akshit, et al.
Pubblicazione: (2026)
di: Achara, Akshit, et al.
Pubblicazione: (2026)
Alice's Adventures in a Differentiable Wonderland -- Volume I, A Tour of the Land
di: Scardapane, Simone
Pubblicazione: (2024)
di: Scardapane, Simone
Pubblicazione: (2024)
Early-Exit Graph Neural Networks
di: Di Francesco, Andrea Giuseppe, et al.
Pubblicazione: (2025)
di: Di Francesco, Andrea Giuseppe, et al.
Pubblicazione: (2025)
Communicating Sound Through Natural Language
di: Rossi, Emanuele, et al.
Pubblicazione: (2026)
di: Rossi, Emanuele, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Task Singular Vectors: Reducing Task Interference in Model Merging
di: Gargiulo, Antonio Andrea, et al.
Pubblicazione: (2024) -
ATM: Improving Model Merging by Alternating Tuning and Merging
di: Zhou, Luca, et al.
Pubblicazione: (2024) -
On Task Vectors and Gradients
di: Zhou, Luca, et al.
Pubblicazione: (2025) -
A Survey on Model MoErging: Recycling and Routing Among Specialized Experts for Collaborative Learning
di: Yadav, Prateek, et al.
Pubblicazione: (2024) -
Implicit Inversion turns CLIP into a Decoder
di: D'Orazio, Antonio, et al.
Pubblicazione: (2025)