Fine-tuning Multimodal Transformers on Edge: A Parallel Split Learning Approach

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Fudala, Timo, Tsouvalas, Vasileios, Meratnia, Nirvana
Natura: Preprint
Pubblicazione: 2025
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
_version_ 1866912472509710336
author Fudala, Timo
Tsouvalas, Vasileios
Meratnia, Nirvana
author_facet Fudala, Timo
Tsouvalas, Vasileios
Meratnia, Nirvana
contents Multimodal transformers integrate diverse data types like images, audio, and text, advancing tasks such as audio-visual understanding and image-text retrieval; yet their high parameterization limits deployment on resource-constrained edge devices. Split Learning (SL), which partitions models at a designated cut-layer to offload compute-intensive operations to the server, offers a promising approach for distributed training of multimodal transformers, though its application remains underexplored. We present MPSL, a parallel SL approach for computational efficient fine-tuning of multimodal transformers in a distributed manner, while eliminating label sharing, client synchronization, and per-client sub-model management. MPSL employs lightweight client-side tokenizers and a unified modality-agnostic encoder, allowing flexible adaptation to task-specific needs. Our evaluation across 7 multimodal datasets demonstrates that MPSL matches or outperforms Federated Learning, reduces client-side computations by 250x, and achieves superior scalability in communication cost with model growth. Through extensive analysis, we highlight task suitability, trade-offs, and scenarios where MPSL excels, inspiring further exploration.
format Preprint
id arxiv_https___arxiv_org_abs_2502_06355
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle Fine-tuning Multimodal Transformers on Edge: A Parallel Split Learning Approach
Fudala, Timo
Tsouvalas, Vasileios
Meratnia, Nirvana
Distributed, Parallel, and Cluster Computing
Machine Learning
Multimodal transformers integrate diverse data types like images, audio, and text, advancing tasks such as audio-visual understanding and image-text retrieval; yet their high parameterization limits deployment on resource-constrained edge devices. Split Learning (SL), which partitions models at a designated cut-layer to offload compute-intensive operations to the server, offers a promising approach for distributed training of multimodal transformers, though its application remains underexplored. We present MPSL, a parallel SL approach for computational efficient fine-tuning of multimodal transformers in a distributed manner, while eliminating label sharing, client synchronization, and per-client sub-model management. MPSL employs lightweight client-side tokenizers and a unified modality-agnostic encoder, allowing flexible adaptation to task-specific needs. Our evaluation across 7 multimodal datasets demonstrates that MPSL matches or outperforms Federated Learning, reduces client-side computations by 250x, and achieves superior scalability in communication cost with model growth. Through extensive analysis, we highlight task suitability, trade-offs, and scenarios where MPSL excels, inspiring further exploration.
title Fine-tuning Multimodal Transformers on Edge: A Parallel Split Learning Approach
topic Distributed, Parallel, and Cluster Computing
Machine Learning
url https://arxiv.org/abs/2502.06355