Speech-FT: Merging Pre-trained And Fine-Tuned Speech Representation Models For Cross-Task Generalization
Fuente:
arXiv
Salvato in:
| Autori principali: | Lin, Tzu-Quan, Huang, Wei-Ping, Tang, Hao, Lee, Hung-yi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Property Neurons in Self-Supervised Speech Transformers
di: Lin, Tzu-Quan, et al.
Pubblicazione: (2024)
di: Lin, Tzu-Quan, et al.
Pubblicazione: (2024)
Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers
di: Lin, Tzu-Quan, et al.
Pubblicazione: (2025)
di: Lin, Tzu-Quan, et al.
Pubblicazione: (2025)
DAISY: Data Adaptive Self-Supervised Early Exit for Speech Representation Models
di: Lin, Tzu-Quan, et al.
Pubblicazione: (2024)
di: Lin, Tzu-Quan, et al.
Pubblicazione: (2024)
CLiFT-ASR: A Cross-Lingual Fine-Tuning Framework for Low-Resource Taiwanese Hokkien Speech Recognition
di: Sung, Hung-Yang, et al.
Pubblicazione: (2025)
di: Sung, Hung-Yang, et al.
Pubblicazione: (2025)
Speech-Copilot: Leveraging Large Language Models for Speech Processing via Task Decomposition, Modularization, and Program Generation
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2024)
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2024)
PEFT for Speech: Unveiling Optimal Placement, Merging Strategies, and Ensemble Techniques
di: Lin, Tzu-Han, et al.
Pubblicazione: (2024)
di: Lin, Tzu-Han, et al.
Pubblicazione: (2024)
How Contrastive Decoding Enhances Large Audio Language Models?
di: Lin, Tzu-Quan, et al.
Pubblicazione: (2026)
di: Lin, Tzu-Quan, et al.
Pubblicazione: (2026)
MelHuBERT: A simplified HuBERT on Mel spectrograms
di: Lin, Tzu-Quan, et al.
Pubblicazione: (2022)
di: Lin, Tzu-Quan, et al.
Pubblicazione: (2022)
SMILE: Speech Meta In-Context Learning for Low-Resource Language Automatic Speech Recognition
di: Hsu, Ming-Hao, et al.
Pubblicazione: (2024)
di: Hsu, Ming-Hao, et al.
Pubblicazione: (2024)
Is Smaller Always Faster? Tradeoffs in Compressing Self-Supervised Speech Transformers
di: Lin, Tzu-Quan, et al.
Pubblicazione: (2022)
di: Lin, Tzu-Quan, et al.
Pubblicazione: (2022)
TASTE-Streaming: Towards Streamable Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
di: Tseng, Liang-Hsuan, et al.
Pubblicazione: (2026)
di: Tseng, Liang-Hsuan, et al.
Pubblicazione: (2026)
Improving Speech Emotion Recognition in Under-Resourced Languages via Speech-to-Speech Translation with Bootstrapping Data Selection
di: Lin, Hsi-Che, et al.
Pubblicazione: (2024)
di: Lin, Hsi-Che, et al.
Pubblicazione: (2024)
When Silence Matters: The Impact of Irrelevant Audio on Text Reasoning in Large Audio-Language Models
di: Li, Chen-An, et al.
Pubblicazione: (2025)
di: Li, Chen-An, et al.
Pubblicazione: (2025)
Continual Test-time Adaptation for End-to-end Speech Recognition on Noisy Speech
di: Lin, Guan-Ting, et al.
Pubblicazione: (2024)
di: Lin, Guan-Ting, et al.
Pubblicazione: (2024)
Mitigating Subgroup Disparities in Multi-Label Speech Emotion Recognition: A Pseudo-Labeling and Unsupervised Learning Approach
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2025)
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2025)
DeSTA2: Developing Instruction-Following Speech Language Model Without Speech Instruction-Tuning Data
di: Lu, Ke-Han, et al.
Pubblicazione: (2024)
di: Lu, Ke-Han, et al.
Pubblicazione: (2024)
UniWav: Towards Unified Pre-training for Speech Representation Learning and Generation
di: Liu, Alexander H., et al.
Pubblicazione: (2025)
di: Liu, Alexander H., et al.
Pubblicazione: (2025)
VIBE: Voice-Induced open-ended Bias Evaluation for Large Audio-Language Models via Real-World Speech
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2026)
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2026)
Attentive Merging of Hidden Embeddings from Pre-trained Speech Model for Anti-spoofing Detection
di: Pan, Zihan, et al.
Pubblicazione: (2024)
di: Pan, Zihan, et al.
Pubblicazione: (2024)
Zero Resource Code-switched Speech Benchmark Using Speech Utterance Pairs For Multiple Spoken Languages
di: Huang, Kuan-Po, et al.
Pubblicazione: (2023)
di: Huang, Kuan-Po, et al.
Pubblicazione: (2023)
Generative Pre-training for Speech with Flow Matching
di: Liu, Alexander H., et al.
Pubblicazione: (2023)
di: Liu, Alexander H., et al.
Pubblicazione: (2023)
MoVE: Translating Laughter and Tears via Mixture of Vocalization Experts in Speech-to-Speech Translation
di: Chen, Szu-Chi, et al.
Pubblicazione: (2026)
di: Chen, Szu-Chi, et al.
Pubblicazione: (2026)
SUTA-LM: Bridging Test-Time Adaptation and Language Model Rescoring for Robust ASR
di: Huang, Wei-Ping, et al.
Pubblicazione: (2025)
di: Huang, Wei-Ping, et al.
Pubblicazione: (2025)
Generative Pre-trained Speech Language Model with Efficient Hierarchical Transformer
di: Zhu, Yongxin, et al.
Pubblicazione: (2024)
di: Zhu, Yongxin, et al.
Pubblicazione: (2024)
Efficient Training of Self-Supervised Speech Foundation Models on a Compute Budget
di: Liu, Andy T., et al.
Pubblicazione: (2024)
di: Liu, Andy T., et al.
Pubblicazione: (2024)
TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
di: Tseng, Liang-Hsuan, et al.
Pubblicazione: (2025)
di: Tseng, Liang-Hsuan, et al.
Pubblicazione: (2025)
SAKURA: On the Multi-hop Reasoning of Large Audio-Language Models Based on Speech and Audio Information
di: Yang, Chih-Kai, et al.
Pubblicazione: (2025)
di: Yang, Chih-Kai, et al.
Pubblicazione: (2025)
How to Estimate Model Transferability of Pre-Trained Speech Models?
di: Chen, Zih-Ching, et al.
Pubblicazione: (2023)
di: Chen, Zih-Ching, et al.
Pubblicazione: (2023)
Task-Agnostic Structured Pruning of Speech Representation Models
di: Wang, Haoyu, et al.
Pubblicazione: (2023)
di: Wang, Haoyu, et al.
Pubblicazione: (2023)
Causal Tracing of Audio-Text Fusion in Large Audio Language Models
di: Chen, Wei-Chih, et al.
Pubblicazione: (2026)
di: Chen, Wei-Chih, et al.
Pubblicazione: (2026)
Scaling Speech-Text Pre-training with Synthetic Interleaved Data
di: Zeng, Aohan, et al.
Pubblicazione: (2024)
di: Zeng, Aohan, et al.
Pubblicazione: (2024)
Chunk Based Speech Pre-training with High Resolution Finite Scalar Quantization
di: Tang, Yun, et al.
Pubblicazione: (2025)
di: Tang, Yun, et al.
Pubblicazione: (2025)
Conversational Speech Recognition by Learning Audio-textual Cross-modal Contextual Representation
di: Wei, Kun, et al.
Pubblicazione: (2023)
di: Wei, Kun, et al.
Pubblicazione: (2023)
Braille-to-Speech Generator: Audio Generation Based on Joint Fine-Tuning of CLIP and Fastspeech2
di: Xu, Chun, et al.
Pubblicazione: (2024)
di: Xu, Chun, et al.
Pubblicazione: (2024)
Investigating the Effects of Large-Scale Pseudo-Stereo Data and Different Speech Foundation Model on Dialogue Generative Spoken Language Model
di: Fu, Yu-Kuan, et al.
Pubblicazione: (2024)
di: Fu, Yu-Kuan, et al.
Pubblicazione: (2024)
Task Arithmetic can Mitigate Synthetic-to-Real Gap in Automatic Speech Recognition
di: Su, Hsuan, et al.
Pubblicazione: (2024)
di: Su, Hsuan, et al.
Pubblicazione: (2024)
Position-invariant Fine-tuning of Speech Enhancement Models with Self-supervised Speech Representations
di: Meghanani, Amit, et al.
Pubblicazione: (2026)
di: Meghanani, Amit, et al.
Pubblicazione: (2026)
ML-SUPERB: Multilingual Speech Universal PERformance Benchmark
di: Shi, Jiatong, et al.
Pubblicazione: (2023)
di: Shi, Jiatong, et al.
Pubblicazione: (2023)
Can Large Audio-Language Models Truly Hear? Tackling Hallucinations with Multi-Task Assessment and Stepwise Audio Reasoning
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2024)
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2024)
Understanding Sounds, Missing the Questions: The Challenge of Object Hallucination in Large Audio-Language Models
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2024)
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Property Neurons in Self-Supervised Speech Transformers
di: Lin, Tzu-Quan, et al.
Pubblicazione: (2024) -
Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers
di: Lin, Tzu-Quan, et al.
Pubblicazione: (2025) -
DAISY: Data Adaptive Self-Supervised Early Exit for Speech Representation Models
di: Lin, Tzu-Quan, et al.
Pubblicazione: (2024) -
CLiFT-ASR: A Cross-Lingual Fine-Tuning Framework for Low-Resource Taiwanese Hokkien Speech Recognition
di: Sung, Hung-Yang, et al.
Pubblicazione: (2025) -
Speech-Copilot: Leveraging Large Language Models for Speech Processing via Task Decomposition, Modularization, and Program Generation
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2024)