UniWav: Towards Unified Pre-training for Speech Representation Learning and Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Alexander H., Lee, Sang-gil, Yang, Chao-Han Huck, Gong, Yuan, Wang, Yu-Chiang Frank, Glass, James R., Valle, Rafael, Catanzaro, Bryan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ETTA: Elucidating the Design Space of Text-to-Audio Models
par: Lee, Sang-gil, et autres
Publié: (2024)
par: Lee, Sang-gil, et autres
Publié: (2024)
UniPET-SPK: A Unified Framework for Parameter-Efficient Tuning of Pre-trained Speech Models for Robust Speaker Verification
par: Sang, Mufan, et autres
Publié: (2025)
par: Sang, Mufan, et autres
Publié: (2025)
A2SB: Audio-to-Audio Schrodinger Bridges
par: Kong, Zhifeng, et autres
Publié: (2025)
par: Kong, Zhifeng, et autres
Publié: (2025)
Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models
par: Goel, Arushi, et autres
Publié: (2025)
par: Goel, Arushi, et autres
Publié: (2025)
Improving Text-To-Audio Models with Synthetic Captions
par: Kong, Zhifeng, et autres
Publié: (2024)
par: Kong, Zhifeng, et autres
Publié: (2024)
VoiceTailor: Lightweight Plug-In Adapter for Diffusion-Based Personalized Text-to-Speech
par: Kim, Heeseung, et autres
Publié: (2024)
par: Kim, Heeseung, et autres
Publié: (2024)
Progressive Residual Extraction based Pre-training for Speech Representation Learning
par: Wang, Tianrui, et autres
Publié: (2024)
par: Wang, Tianrui, et autres
Publié: (2024)
Audio Dialogues: Dialogues dataset for audio and music understanding
par: Goel, Arushi, et autres
Publié: (2024)
par: Goel, Arushi, et autres
Publié: (2024)
Wav2Small: Distilling Wav2Vec2 to 72K parameters for Low-Resource Speech emotion recognition
par: Kounadis-Bastian, Dionyssos, et autres
Publié: (2024)
par: Kounadis-Bastian, Dionyssos, et autres
Publié: (2024)
Uni-VERSA: Versatile Speech Assessment with a Unified Network
par: Shi, Jiatong, et autres
Publié: (2025)
par: Shi, Jiatong, et autres
Publié: (2025)
SONAR: Self-Distilled Continual Pre-training for Domain Adaptive Audio Representation
par: Zhang, Yizhou, et autres
Publié: (2025)
par: Zhang, Yizhou, et autres
Publié: (2025)
Scaling NVIDIA's Multi-speaker Multi-lingual TTS Systems with Zero-Shot TTS to Indic Languages
par: Arora, Akshit, et autres
Publié: (2024)
par: Arora, Akshit, et autres
Publié: (2024)
Temporal Adaptation of Pre-trained Foundation Models for Music Structure Analysis
par: Zhang, Yixiao, et autres
Publié: (2025)
par: Zhang, Yixiao, et autres
Publié: (2025)
UniArray: Unified Spectral-Spatial Modeling for Array-Geometry-Agnostic Speech Separation
par: Chen, Weiguang, et autres
Publié: (2025)
par: Chen, Weiguang, et autres
Publié: (2025)
Adapting WavLM for Speech Emotion Recognition
par: Diatlova, Daria, et autres
Publié: (2024)
par: Diatlova, Daria, et autres
Publié: (2024)
Speaker Disentanglement of Speech Pre-trained Model Based on Interpretability
par: Zhu, Xiaoxu, et autres
Publié: (2025)
par: Zhu, Xiaoxu, et autres
Publié: (2025)
Efficient Adapter Tuning of Pre-trained Speech Models for Automatic Speaker Verification
par: Sang, Mufan, et autres
Publié: (2024)
par: Sang, Mufan, et autres
Publié: (2024)
UniSRM: A Unified Speech Reward Model for Reasoning-Based Fine-grained Assessment
par: Wang, Yuanyuan, et autres
Publié: (2026)
par: Wang, Yuanyuan, et autres
Publié: (2026)
WavShape: Information-Theoretic Speech Representation Learning for Fair and Privacy-Aware Audio Processing
par: Baser, Oguzhan, et autres
Publié: (2025)
par: Baser, Oguzhan, et autres
Publié: (2025)
Target Speech Extraction with Pre-trained Self-supervised Learning Models
par: Peng, Junyi, et autres
Publié: (2024)
par: Peng, Junyi, et autres
Publié: (2024)
UniCATS: A Unified Context-Aware Text-to-Speech Framework with Contextual VQ-Diffusion and Vocoding
par: Du, Chenpeng, et autres
Publié: (2023)
par: Du, Chenpeng, et autres
Publié: (2023)
Universal Speech Enhancement with Regression and Generative Mamba
par: Chao, Rong, et autres
Publié: (2025)
par: Chao, Rong, et autres
Publié: (2025)
Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities
par: Kong, Zhifeng, et autres
Publié: (2024)
par: Kong, Zhifeng, et autres
Publié: (2024)
Wav2Prompt: End-to-End Speech Prompt Generation and Tuning For LLM in Zero and Few-shot Learning
par: Deng, Keqi, et autres
Publié: (2024)
par: Deng, Keqi, et autres
Publié: (2024)
Frame-Aligned Fusion of Canary and WavLM for Non-Intrusive Intelligibility Prediction of Hearing-Aid-Processed Speech
par: Nakazawa, Kazushi
Publié: (2026)
par: Nakazawa, Kazushi
Publié: (2026)
Wav2code: Restore Clean Speech Representations via Codebook Lookup for Noise-Robust ASR
par: Hu, Yuchen, et autres
Publié: (2023)
par: Hu, Yuchen, et autres
Publié: (2023)
Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders
par: Sun, Xingwei, et autres
Publié: (2025)
par: Sun, Xingwei, et autres
Publié: (2025)
Low Frame-rate Speech Codec: a Codec Designed for Fast High-quality Speech LLM Training and Inference
par: Casanova, Edresson, et autres
Publié: (2024)
par: Casanova, Edresson, et autres
Publié: (2024)
Analysing the Masked predictive coding training criterion for pre-training a Speech Representation Model
par: Yadav, Hemant, et autres
Publié: (2023)
par: Yadav, Hemant, et autres
Publié: (2023)
Quality of Automatic Speech Recognition -- Polish Language case study -- from Wav2Vec to Scribe ElevenLabs
par: Pietroń, Marcin, et autres
Publié: (2026)
par: Pietroń, Marcin, et autres
Publié: (2026)
A Study of Data Selection Strategies for Pre-training Self-Supervised Speech Models
par: Whetten, Ryan, et autres
Publié: (2026)
par: Whetten, Ryan, et autres
Publié: (2026)
Target Speech Extraction with Pre-trained AV-HuBERT and Mask-And-Recover Strategy
par: Wu, Wenxuan, et autres
Publié: (2024)
par: Wu, Wenxuan, et autres
Publié: (2024)
Towards Robust Overlapping Speech Detection: A Speaker-Aware Progressive Approach Using WavLM
par: Sun, Zhaokai, et autres
Publié: (2025)
par: Sun, Zhaokai, et autres
Publié: (2025)
DeSTA2: Developing Instruction-Following Speech Language Model Without Speech Instruction-Tuning Data
par: Lu, Ke-Han, et autres
Publié: (2024)
par: Lu, Ke-Han, et autres
Publié: (2024)
Source Tracing of Synthetic Speech Systems Through Paralinguistic Pre-Trained Representations
par: Girish, et autres
Publié: (2025)
par: Girish, et autres
Publié: (2025)
Audio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Music
par: Ghosh, Sreyan, et autres
Publié: (2026)
par: Ghosh, Sreyan, et autres
Publié: (2026)
USAD: Universal Speech and Audio Representation via Distillation
par: Chang, Heng-Jui, et autres
Publié: (2025)
par: Chang, Heng-Jui, et autres
Publié: (2025)
PEFT-SER: On the Use of Parameter Efficient Transfer Learning Approaches For Speech Emotion Recognition Using Pre-trained Speech Models
par: Feng, Tiantian, et autres
Publié: (2023)
par: Feng, Tiantian, et autres
Publié: (2023)
Generating Speakers by Prompting Listener Impressions for Pre-trained Multi-Speaker Text-to-Speech Systems
par: Chen, Zhengyang, et autres
Publié: (2024)
par: Chen, Zhengyang, et autres
Publié: (2024)
Exploring WavLM Back-ends for Speech Spoofing and Deepfake Detection
par: Stourbe, Theophile, et autres
Publié: (2024)
par: Stourbe, Theophile, et autres
Publié: (2024)
Documents similaires
-
ETTA: Elucidating the Design Space of Text-to-Audio Models
par: Lee, Sang-gil, et autres
Publié: (2024) -
UniPET-SPK: A Unified Framework for Parameter-Efficient Tuning of Pre-trained Speech Models for Robust Speaker Verification
par: Sang, Mufan, et autres
Publié: (2025) -
A2SB: Audio-to-Audio Schrodinger Bridges
par: Kong, Zhifeng, et autres
Publié: (2025) -
Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models
par: Goel, Arushi, et autres
Publié: (2025) -
Improving Text-To-Audio Models with Synthetic Captions
par: Kong, Zhifeng, et autres
Publié: (2024)