A correlation-permutation approach for speech-music encoders model merging
Fuente:
arXiv
Guardado en:
| Autores principales: | Ritter-Gutierrez, Fabian, Lin, Yi-Cheng, Wong, Jeremy H. M, Lee, Hung-yi, Chng, Eng Siong, Chen, Nancy F. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Distilling a speech and music encoder with task arithmetic
por: Ritter-Gutierrez, Fabian, et al.
Publicado: (2025)
por: Ritter-Gutierrez, Fabian, et al.
Publicado: (2025)
Dataset-Distillation Generative Model for Speech Emotion Recognition
por: Ritter-Gutierrez, Fabian, et al.
Publicado: (2024)
por: Ritter-Gutierrez, Fabian, et al.
Publicado: (2024)
ASTAR-NTU solution to AudioMOS Challenge 2025 Track1
por: Ritter-Gutierrez, Fabian, et al.
Publicado: (2025)
por: Ritter-Gutierrez, Fabian, et al.
Publicado: (2025)
EASY: Emotion-aware Speaker Anonymization via Factorized Distillation
por: Yao, Jixun, et al.
Publicado: (2025)
por: Yao, Jixun, et al.
Publicado: (2025)
Analysis of Speaker Verification Performance Trade-offs with Neural Audio Codec Transmission
por: Thakur, Nirmalya Mallick, et al.
Publicado: (2025)
por: Thakur, Nirmalya Mallick, et al.
Publicado: (2025)
Room Impulse Responses help attackers to evade Deep Fake Detection
por: Luong, Hieu-Thi, et al.
Publicado: (2024)
por: Luong, Hieu-Thi, et al.
Publicado: (2024)
Noise-Aware Speech Separation with Contrastive Learning
por: Zhang, Zizheng, et al.
Publicado: (2023)
por: Zhang, Zizheng, et al.
Publicado: (2023)
UniArray: Unified Spectral-Spatial Modeling for Array-Geometry-Agnostic Speech Separation
por: Chen, Weiguang, et al.
Publicado: (2025)
por: Chen, Weiguang, et al.
Publicado: (2025)
Robust Localization of Partially Fake Speech: Metrics and Out-of-Domain Evaluation
por: Luong, Hieu-Thi, et al.
Publicado: (2025)
por: Luong, Hieu-Thi, et al.
Publicado: (2025)
LlamaPartialSpoof: An LLM-Driven Fake Speech Dataset Simulating Disinformation Generation
por: Luong, Hieu-Thi, et al.
Publicado: (2024)
por: Luong, Hieu-Thi, et al.
Publicado: (2024)
Robust fine-tuning of speech recognition models via model merging: application to disordered speech
por: Ducorroy, Alexandre, et al.
Publicado: (2025)
por: Ducorroy, Alexandre, et al.
Publicado: (2025)
SPGM: Prioritizing Local Features for enhanced speech separation performance
por: Yip, Jia Qi, et al.
Publicado: (2023)
por: Yip, Jia Qi, et al.
Publicado: (2023)
Multi-band Frequency Reconstruction for Neural Psychoacoustic Coding
por: Ng, Dianwen, et al.
Publicado: (2025)
por: Ng, Dianwen, et al.
Publicado: (2025)
Emphasized Non-Target Speaker Knowledge in Knowledge Distillation for Automatic Speaker Verification
por: Truong, Duc-Tuan, et al.
Publicado: (2023)
por: Truong, Duc-Tuan, et al.
Publicado: (2023)
GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling
por: Yao, Jixun, et al.
Publicado: (2025)
por: Yao, Jixun, et al.
Publicado: (2025)
Wav2code: Restore Clean Speech Representations via Codebook Lookup for Noise-Robust ASR
por: Hu, Yuchen, et al.
Publicado: (2023)
por: Hu, Yuchen, et al.
Publicado: (2023)
Continual Learning Optimizations for Auto-regressive Decoder of Multilingual ASR systems
por: Kwok, Chin Yuen, et al.
Publicado: (2024)
por: Kwok, Chin Yuen, et al.
Publicado: (2024)
Bridging Speech and Text: Enhancing ASR with Pinyin-to-Character Pre-training in LLMs
por: Yuhang, Yang, et al.
Publicado: (2024)
por: Yuhang, Yang, et al.
Publicado: (2024)
Hierarchical Self-Supervised Representation Learning for Depression Detection from Speech
por: Li, Yuxin, et al.
Publicado: (2025)
por: Li, Yuxin, et al.
Publicado: (2025)
Noise-aware Speech Enhancement using Diffusion Probabilistic Model
por: Hu, Yuchen, et al.
Publicado: (2023)
por: Hu, Yuchen, et al.
Publicado: (2023)
Robust Zero-Shot Text-to-Speech Synthesis with Reverse Inference Optimization
por: Hu, Yuchen, et al.
Publicado: (2024)
por: Hu, Yuchen, et al.
Publicado: (2024)
Towards Audio Codec-based Speech Separation
por: Yip, Jia Qi, et al.
Publicado: (2024)
por: Yip, Jia Qi, et al.
Publicado: (2024)
Enhancing Zero-shot Text-to-Speech Synthesis with Human Feedback
por: Chen, Chen, et al.
Publicado: (2024)
por: Chen, Chen, et al.
Publicado: (2024)
Training-Free Intelligibility-Guided Observation Addition for Noisy ASR
por: Li, Haoyang, et al.
Publicado: (2026)
por: Li, Haoyang, et al.
Publicado: (2026)
Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Model
por: Ma, Ziyang, et al.
Publicado: (2025)
por: Ma, Ziyang, et al.
Publicado: (2025)
CodecFake: Enhancing Anti-Spoofing Models Against Deepfake Audios from Codec-Based Speech Synthesis Systems
por: Wu, Haibin, et al.
Publicado: (2024)
por: Wu, Haibin, et al.
Publicado: (2024)
Mitigating Subgroup Disparities in Multi-Label Speech Emotion Recognition: A Pseudo-Labeling and Unsupervised Learning Approach
por: Lin, Yi-Cheng, et al.
Publicado: (2025)
por: Lin, Yi-Cheng, et al.
Publicado: (2025)
Temporal-Channel Modeling in Multi-head Self-Attention for Synthetic Speech Detection
por: Truong, Duc-Tuan, et al.
Publicado: (2024)
por: Truong, Duc-Tuan, et al.
Publicado: (2024)
Speech Enhancement Using Continuous Embeddings of Neural Audio Codec
por: Li, Haoyang, et al.
Publicado: (2025)
por: Li, Haoyang, et al.
Publicado: (2025)
Towards audio language modeling -- an overview
por: Wu, Haibin, et al.
Publicado: (2024)
por: Wu, Haibin, et al.
Publicado: (2024)
Can Large Audio-Language Models Truly Hear? Tackling Hallucinations with Multi-Task Assessment and Stepwise Audio Reasoning
por: Kuan, Chun-Yi, et al.
Publicado: (2024)
por: Kuan, Chun-Yi, et al.
Publicado: (2024)
Teaching Audio-Aware Large Language Models What Does Not Hear: Mitigating Hallucinations through Synthesized Negative Samples
por: Kuan, Chun-Yi, et al.
Publicado: (2025)
por: Kuan, Chun-Yi, et al.
Publicado: (2025)
SpeechCLIP+: Self-supervised multi-task representation learning for speech via CLIP and speech-image data
por: Wang, Hsuan-Fu, et al.
Publicado: (2024)
por: Wang, Hsuan-Fu, et al.
Publicado: (2024)
MI-Fuse: Label Fusion for Unsupervised Domain Adaptation with Closed-Source Large-Audio Language Model
por: Huang, Hsiao-Ying, et al.
Publicado: (2025)
por: Huang, Hsiao-Ying, et al.
Publicado: (2025)
Summary on The Multilingual Conversational Speech Language Model Challenge: Datasets, Tasks, Baselines, and Methods
por: Mu, Bingshen, et al.
Publicado: (2025)
por: Mu, Bingshen, et al.
Publicado: (2025)
EMO-Codec: An In-Depth Look at Emotion Preservation capacity of Legacy and Neural Codec Models With Subjective and Objective Evaluations
por: Ren, Wenze, et al.
Publicado: (2024)
por: Ren, Wenze, et al.
Publicado: (2024)
Continual Test-time Adaptation for End-to-end Speech Recognition on Noisy Speech
por: Lin, Guan-Ting, et al.
Publicado: (2024)
por: Lin, Guan-Ting, et al.
Publicado: (2024)
Word-Level Emotional Expression Control in Zero-Shot Text-to-Speech Synthesis
por: Wang, Tianrui, et al.
Publicado: (2025)
por: Wang, Tianrui, et al.
Publicado: (2025)
Toward Fair Speech Technologies: A Comprehensive Survey of Bias and Fairness in Speech AI
por: Lin, Yi-Cheng, et al.
Publicado: (2026)
por: Lin, Yi-Cheng, et al.
Publicado: (2026)
Determined blind source separation via modeling adjacent frequency band correlations in speech signals
por: Wang, Jianyu, et al.
Publicado: (2025)
por: Wang, Jianyu, et al.
Publicado: (2025)
Ejemplares similares
-
Distilling a speech and music encoder with task arithmetic
por: Ritter-Gutierrez, Fabian, et al.
Publicado: (2025) -
Dataset-Distillation Generative Model for Speech Emotion Recognition
por: Ritter-Gutierrez, Fabian, et al.
Publicado: (2024) -
ASTAR-NTU solution to AudioMOS Challenge 2025 Track1
por: Ritter-Gutierrez, Fabian, et al.
Publicado: (2025) -
EASY: Emotion-aware Speaker Anonymization via Factorized Distillation
por: Yao, Jixun, et al.
Publicado: (2025) -
Analysis of Speaker Verification Performance Trade-offs with Neural Audio Codec Transmission
por: Thakur, Nirmalya Mallick, et al.
Publicado: (2025)