LAFMA: A Latent Flow Matching Model for Text-to-Audio Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Guan, Wenhao, Wang, Kaidi, Zhou, Wangjin, Wang, Yang, Deng, Feng, Wang, Hui, Li, Lin, Hong, Qingyang, Qin, Yong |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization
par: Ren, Pengyu, et autres
Publié: (2025)
par: Ren, Pengyu, et autres
Publié: (2025)
UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models
par: Guan, Wenhao, et autres
Publié: (2025)
par: Guan, Wenhao, et autres
Publié: (2025)
ReFlow-TTS: A Rectified Flow Model for High-fidelity Text-to-Speech
par: Guan, Wenhao, et autres
Publié: (2023)
par: Guan, Wenhao, et autres
Publié: (2023)
DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec
par: Chen, Peijie, et autres
Publié: (2025)
par: Chen, Peijie, et autres
Publié: (2025)
XMUspeech Systems for the ASVspoof 5 Challenge
par: Li, Wangjie, et autres
Publié: (2025)
par: Li, Wangjie, et autres
Publié: (2025)
AudioLCM: Text-to-Audio Generation with Latent Consistency Models
par: Liu, Huadai, et autres
Publié: (2024)
par: Liu, Huadai, et autres
Publié: (2024)
AudioEval: Automatic Dual-Perspective and Multi-Dimensional Evaluation of Text-to-Audio-Generation
par: Wang, Hui, et autres
Publié: (2025)
par: Wang, Hui, et autres
Publié: (2025)
MM-TTS: Multi-modal Prompt based Style Transfer for Expressive Text-to-Speech Synthesis
par: Guan, Wenhao, et autres
Publié: (2023)
par: Guan, Wenhao, et autres
Publié: (2023)
Phoenix-VAD: Streaming Semantic Endpoint Detection for Full-Duplex Speech Interaction
par: Wu, Weijie, et autres
Publié: (2025)
par: Wu, Weijie, et autres
Publié: (2025)
Enhancing Code-Switching Speech Recognition with LID-Based Collaborative Mixture of Experts Model
par: Huang, Hukai, et autres
Publié: (2024)
par: Huang, Hukai, et autres
Publié: (2024)
Zero-Shot Sing Voice Conversion: built upon clustering-based phoneme representations
par: Zhou, Wangjin, et autres
Publié: (2024)
par: Zhou, Wangjin, et autres
Publié: (2024)
FlashAudio: Rectified Flows for Fast and High-Fidelity Text-to-Audio Generation
par: Liu, Huadai, et autres
Publié: (2024)
par: Liu, Huadai, et autres
Publié: (2024)
TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models
par: Wang, Hui, et autres
Publié: (2025)
par: Wang, Hui, et autres
Publié: (2025)
SONAR: Self-Distilled Continual Pre-training for Domain Adaptive Audio Representation
par: Zhang, Yizhou, et autres
Publié: (2025)
par: Zhang, Yizhou, et autres
Publié: (2025)
Discl-VC: Disentangled Discrete Tokens and In-Context Learning for Controllable Zero-Shot Voice Conversion
par: Wang, Kaidi, et autres
Publié: (2025)
par: Wang, Kaidi, et autres
Publié: (2025)
EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer
par: Hai, Jiarui, et autres
Publié: (2024)
par: Hai, Jiarui, et autres
Publié: (2024)
Flow-TSVAD: Target-Speaker Voice Activity Detection via Latent Flow Matching
par: Chen, Zhengyang, et autres
Publié: (2024)
par: Chen, Zhengyang, et autres
Publié: (2024)
Interpretable Audio Editing Evaluation via Chain-of-Thought Difference-Commonality Reasoning with Multimodal LLMs
par: Jia, Yuhang, et autres
Publié: (2025)
par: Jia, Yuhang, et autres
Publié: (2025)
CosyEdit: Unlocking End-to-End Speech Editing Capability from Zero-Shot Text-to-Speech Models
par: Chen, Junyang, et autres
Publié: (2026)
par: Chen, Junyang, et autres
Publié: (2026)
MusicEval: A Generative Music Dataset with Expert Ratings for Automatic Text-to-Music Evaluation
par: Liu, Cheng, et autres
Publié: (2025)
par: Liu, Cheng, et autres
Publié: (2025)
DFADD: The Diffusion and Flow-Matching Based Audio Deepfake Dataset
par: Du, Jiawei, et autres
Publié: (2024)
par: Du, Jiawei, et autres
Publié: (2024)
PPPR: Portable Plug-in Prompt Refiner for Text to Audio Generation
par: Shi, Shuchen, et autres
Publié: (2024)
par: Shi, Shuchen, et autres
Publié: (2024)
A Two-Stage Hierarchical Deep Filtering Framework for Real-Time Speech Enhancement
par: Lu, Shenghui, et autres
Publié: (2025)
par: Lu, Shenghui, et autres
Publié: (2025)
Exploring Text-Queried Sound Event Detection with Audio Source Separation
par: Yin, Han, et autres
Publié: (2024)
par: Yin, Han, et autres
Publié: (2024)
MATS: An Audio Language Model under Text-only Supervision
par: Wang, Wen, et autres
Publié: (2025)
par: Wang, Wen, et autres
Publié: (2025)
Latent Watermarking of Audio Generative Models
par: Roman, Robin San, et autres
Publié: (2024)
par: Roman, Robin San, et autres
Publié: (2024)
FlowAVSE: Efficient Audio-Visual Speech Enhancement with Conditional Flow Matching
par: Jung, Chaeyoung, et autres
Publié: (2024)
par: Jung, Chaeyoung, et autres
Publié: (2024)
Generalized Audio Deepfake Detection Using Frame-level Latent Information Entropy
par: Zhao, Botao, et autres
Publié: (2025)
par: Zhao, Botao, et autres
Publié: (2025)
LatentVoiceGrad: Nonparallel Voice Conversion with Latent Diffusion/Flow-Matching Models
par: Kameoka, Hirokazu, et autres
Publié: (2025)
par: Kameoka, Hirokazu, et autres
Publié: (2025)
Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling
par: Zheng, Qixi, et autres
Publié: (2025)
par: Zheng, Qixi, et autres
Publié: (2025)
The AudioMOS Challenge 2025
par: Huang, Wen-Chin, et autres
Publié: (2025)
par: Huang, Wen-Chin, et autres
Publié: (2025)
SuPseudo: A Pseudo-supervised Learning Method for Neural Speech Enhancement in Far-field Speech Recognition
par: Luo, Longjie, et autres
Publié: (2025)
par: Luo, Longjie, et autres
Publié: (2025)
DialoSpeech: Dual-Speaker Dialogue Generation with LLM and Flow Matching
par: Xie, Hanke, et autres
Publié: (2025)
par: Xie, Hanke, et autres
Publié: (2025)
MusFlow: Multimodal Music Generation via Conditional Flow Matching
par: Song, Jiahao, et autres
Publié: (2025)
par: Song, Jiahao, et autres
Publié: (2025)
Latent-Level Enhancement with Flow Matching for Robust Automatic Speech Recognition
par: Yang, Da-Hee, et autres
Publié: (2026)
par: Yang, Da-Hee, et autres
Publié: (2026)
SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text
par: Liu, Haohe, et autres
Publié: (2024)
par: Liu, Haohe, et autres
Publié: (2024)
Generalizable Audio Deepfake Detection via Latent Space Refinement and Augmentation
par: Huang, Wen, et autres
Publié: (2025)
par: Huang, Wen, et autres
Publié: (2025)
T2A-Feedback: Improving Basic Capabilities of Text-to-Audio Generation via Fine-grained AI Feedback
par: Wang, Zehan, et autres
Publié: (2025)
par: Wang, Zehan, et autres
Publié: (2025)
F5R-TTS: Improving Flow-Matching based Text-to-Speech with Group Relative Policy Optimization
par: Sun, Xiaohui, et autres
Publié: (2025)
par: Sun, Xiaohui, et autres
Publié: (2025)
CosyAudio: Improving Audio Generation with Confidence Scores and Synthetic Captions
par: Zhu, Xinfa, et autres
Publié: (2025)
par: Zhu, Xinfa, et autres
Publié: (2025)
Documents similaires
-
ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization
par: Ren, Pengyu, et autres
Publié: (2025) -
UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models
par: Guan, Wenhao, et autres
Publié: (2025) -
ReFlow-TTS: A Rectified Flow Model for High-fidelity Text-to-Speech
par: Guan, Wenhao, et autres
Publié: (2023) -
DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec
par: Chen, Peijie, et autres
Publié: (2025) -
XMUspeech Systems for the ASVspoof 5 Challenge
par: Li, Wangjie, et autres
Publié: (2025)