Update Your Transformer to the Latest Release: Re-Basin of Task Vectors
Fuente:
arXiv
Salvato in:
| Autori principali: | Rinaldi, Filippo, Capitani, Giacomo, Bonicelli, Lorenzo, Crisostomi, Donato, Bolelli, Federico, Ficarra, Elisa, Rodolà, Emanuele, Calderara, Simone, Porrello, Angelo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Transporting Task Vectors across Different Architectures without Training
di: Rinaldi, Filippo, et al.
Pubblicazione: (2026)
di: Rinaldi, Filippo, et al.
Pubblicazione: (2026)
An Attention-based Representation Distillation Baseline for Multi-Label Continual Learning
di: Menabue, Martin, et al.
Pubblicazione: (2024)
di: Menabue, Martin, et al.
Pubblicazione: (2024)
Modular Embedding Recomposition for Incremental Learning
di: Panariello, Aniello, et al.
Pubblicazione: (2025)
di: Panariello, Aniello, et al.
Pubblicazione: (2025)
CLIP with Generative Latent Replay: a Strong Baseline for Incremental Learning
di: Frascaroli, Emanuele, et al.
Pubblicazione: (2024)
di: Frascaroli, Emanuele, et al.
Pubblicazione: (2024)
Gradient-Sign Masking for Task Vector Transport Across Pre-Trained Models
di: Rinaldi, Filippo, et al.
Pubblicazione: (2025)
di: Rinaldi, Filippo, et al.
Pubblicazione: (2025)
How to Train Your Metamorphic Deep Neural Network
di: Sommariva, Thomas, et al.
Pubblicazione: (2025)
di: Sommariva, Thomas, et al.
Pubblicazione: (2025)
Semantic Residual Prompts for Continual Learning
di: Menabue, Martin, et al.
Pubblicazione: (2024)
di: Menabue, Martin, et al.
Pubblicazione: (2024)
A Second-Order Perspective on Model Compositionality and Incremental Learning
di: Porrello, Angelo, et al.
Pubblicazione: (2024)
di: Porrello, Angelo, et al.
Pubblicazione: (2024)
Two-Scale Latent Dynamics for Recurrent-Depth Transformers
di: Pappone, Francesco, et al.
Pubblicazione: (2025)
di: Pappone, Francesco, et al.
Pubblicazione: (2025)
May the Forgetting Be with You: Alternate Replay for Learning with Noisy Labels
di: Millunzi, Monica, et al.
Pubblicazione: (2024)
di: Millunzi, Monica, et al.
Pubblicazione: (2024)
Dataless Weight Disentanglement in Task Arithmetic via Kronecker-Factored Approximate Curvature
di: Porrello, Angelo, et al.
Pubblicazione: (2026)
di: Porrello, Angelo, et al.
Pubblicazione: (2026)
Efficient Generation of Multimodal Fluid Simulation Data
di: Baieri, Daniele, et al.
Pubblicazione: (2023)
di: Baieri, Daniele, et al.
Pubblicazione: (2023)
Task Singular Vectors: Reducing Task Interference in Model Merging
di: Gargiulo, Antonio Andrea, et al.
Pubblicazione: (2024)
di: Gargiulo, Antonio Andrea, et al.
Pubblicazione: (2024)
Model Merging Improves Zero-Shot Generalization in Bioacoustic Foundation Models
di: Marincione, Davide, et al.
Pubblicazione: (2025)
di: Marincione, Davide, et al.
Pubblicazione: (2025)
Rethinking Layer-wise Model Merging through Chain of Merges
di: Buzzega, Pietro, et al.
Pubblicazione: (2025)
di: Buzzega, Pietro, et al.
Pubblicazione: (2025)
Distilling Linearized Behavior into Non-Linear Fine-Tuning for Effective Task Arithmetic
di: Sommariva, Thomas, et al.
Pubblicazione: (2026)
di: Sommariva, Thomas, et al.
Pubblicazione: (2026)
Metric Based Few-Shot Graph Classification
di: Crisostomi, Donato, et al.
Pubblicazione: (2022)
di: Crisostomi, Donato, et al.
Pubblicazione: (2022)
LoopGen: Training-Free Loopable Music Generation
di: Marincione, Davide, et al.
Pubblicazione: (2025)
di: Marincione, Davide, et al.
Pubblicazione: (2025)
$C^2M^3$: Cycle-Consistent Multi-Model Merging
di: Crisostomi, Donato, et al.
Pubblicazione: (2024)
di: Crisostomi, Donato, et al.
Pubblicazione: (2024)
Self-Labeling the Job Shop Scheduling Problem
di: Corsini, Andrea, et al.
Pubblicazione: (2024)
di: Corsini, Andrea, et al.
Pubblicazione: (2024)
On Task Vectors and Gradients
di: Zhou, Luca, et al.
Pubblicazione: (2025)
di: Zhou, Luca, et al.
Pubblicazione: (2025)
ReMatching: Low-Resolution Representations for Scalable Shape Correspondence
di: Maggioli, Filippo, et al.
Pubblicazione: (2023)
di: Maggioli, Filippo, et al.
Pubblicazione: (2023)
Mergenetic: a Simple Evolutionary Model Merging Library
di: Minut, Adrian Robert, et al.
Pubblicazione: (2025)
di: Minut, Adrian Robert, et al.
Pubblicazione: (2025)
MERGE$^3$: Efficient Evolutionary Merging on Consumer-grade GPUs
di: Mencattini, Tommaso, et al.
Pubblicazione: (2025)
di: Mencattini, Tommaso, et al.
Pubblicazione: (2025)
Trajectory Forecasting through Low-Rank Adaptation of Discrete Latent Codes
di: Benaglia, Riccardo, et al.
Pubblicazione: (2024)
di: Benaglia, Riccardo, et al.
Pubblicazione: (2024)
Activation Patching for Interpretable Steering in Music Generation
di: Facchiano, Simone, et al.
Pubblicazione: (2025)
di: Facchiano, Simone, et al.
Pubblicazione: (2025)
Language Models are Injective and Hence Invertible
di: Nikolaou, Giorgos, et al.
Pubblicazione: (2025)
di: Nikolaou, Giorgos, et al.
Pubblicazione: (2025)
STAGE: Stemmed Accompaniment Generation through Prefix-Based Conditioning
di: Strano, Giorgio, et al.
Pubblicazione: (2025)
di: Strano, Giorgio, et al.
Pubblicazione: (2025)
Model Merging: Foundations and Algorithms
di: Crisostomi, Donato
Pubblicazione: (2026)
di: Crisostomi, Donato
Pubblicazione: (2026)
ATM: Improving Model Merging by Alternating Tuning and Merging
di: Zhou, Luca, et al.
Pubblicazione: (2024)
di: Zhou, Luca, et al.
Pubblicazione: (2024)
ABRA: Teleporting Fine-Tuned Knowledge Across Domains for Open-Vocabulary Object Detection
di: Bernardi, Mattia, et al.
Pubblicazione: (2026)
di: Bernardi, Mattia, et al.
Pubblicazione: (2026)
Is Multiple Object Tracking a Matter of Specialization?
di: Mancusi, Gianluca, et al.
Pubblicazione: (2024)
di: Mancusi, Gianluca, et al.
Pubblicazione: (2024)
DitHub: A Modular Framework for Incremental Open-Vocabulary Object Detection
di: Cappellino, Chiara, et al.
Pubblicazione: (2025)
di: Cappellino, Chiara, et al.
Pubblicazione: (2025)
Implicit Inversion turns CLIP into a Decoder
di: D'Orazio, Antonio, et al.
Pubblicazione: (2025)
di: D'Orazio, Antonio, et al.
Pubblicazione: (2025)
Latent Spectral Regularization for Continual Learning
di: Frascaroli, Emanuele, et al.
Pubblicazione: (2023)
di: Frascaroli, Emanuele, et al.
Pubblicazione: (2023)
Taming Mambas for Voxel Level 3D Medical Image Segmentation
di: Lumetti, Luca, et al.
Pubblicazione: (2024)
di: Lumetti, Luca, et al.
Pubblicazione: (2024)
Monocular Per-Object Distance Estimation with Masked Object Modeling
di: Panariello, Aniello, et al.
Pubblicazione: (2024)
di: Panariello, Aniello, et al.
Pubblicazione: (2024)
Multi-objective Evolutionary Merging Enables Efficient Reasoning Models
di: Iacobelli, Mario, et al.
Pubblicazione: (2026)
di: Iacobelli, Mario, et al.
Pubblicazione: (2026)
MASS: MoErging through Adaptive Subspace Selection
di: Crisostomi, Donato, et al.
Pubblicazione: (2025)
di: Crisostomi, Donato, et al.
Pubblicazione: (2025)
Membership and Dataset Inference Attacks on Large Audio Generative Models
di: Proboszcz, Jakub, et al.
Pubblicazione: (2025)
di: Proboszcz, Jakub, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Transporting Task Vectors across Different Architectures without Training
di: Rinaldi, Filippo, et al.
Pubblicazione: (2026) -
An Attention-based Representation Distillation Baseline for Multi-Label Continual Learning
di: Menabue, Martin, et al.
Pubblicazione: (2024) -
Modular Embedding Recomposition for Incremental Learning
di: Panariello, Aniello, et al.
Pubblicazione: (2025) -
CLIP with Generative Latent Replay: a Strong Baseline for Incremental Learning
di: Frascaroli, Emanuele, et al.
Pubblicazione: (2024) -
Gradient-Sign Masking for Task Vector Transport Across Pre-Trained Models
di: Rinaldi, Filippo, et al.
Pubblicazione: (2025)