MamTra: A Hybrid Mamba-Transformer Backbone for Speech Synthesis
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Nguyen, Tan Dat, Bae, Sangmin, Chung, Joon Son, Kim, Ji-Hoon |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis
par: Jung, Jaemin, et autres
Publié: (2024)
par: Jung, Jaemin, et autres
Publié: (2024)
XLSR-MamBo: Scaling the Hybrid Mamba-Attention Backbone for Audio Deepfake Detection
par: Ng, Kwok-Ho, et autres
Publié: (2026)
par: Ng, Kwok-Ho, et autres
Publié: (2026)
Accelerating Codec-based Speech Synthesis with Multi-Token Prediction and Speculative Decoding
par: Nguyen, Tan Dat, et autres
Publié: (2024)
par: Nguyen, Tan Dat, et autres
Publié: (2024)
SPADE: Structured Pruning and Adaptive Distillation for Efficient LLM-TTS
par: Nguyen, Tan Dat, et autres
Publié: (2025)
par: Nguyen, Tan Dat, et autres
Publié: (2025)
FreGrad: Lightweight and Fast Frequency-aware Diffusion Vocoder
par: Nguyen, Tan Dat, et autres
Publié: (2024)
par: Nguyen, Tan Dat, et autres
Publié: (2024)
MAGE: A Coarse-to-Fine Speech Enhancer with Masked Generative Model
par: Pham, The Hieu, et autres
Publié: (2025)
par: Pham, The Hieu, et autres
Publié: (2025)
FlowAVSE: Efficient Audio-Visual Speech Enhancement with Conditional Flow Matching
par: Jung, Chaeyoung, et autres
Publié: (2024)
par: Jung, Chaeyoung, et autres
Publié: (2024)
EDNet: A Versatile Speech Enhancement Framework with Gating Mamba Mechanism and Phase Shift-Invariant Training
par: Kwak, Doyeop, et autres
Publié: (2025)
par: Kwak, Doyeop, et autres
Publié: (2025)
AdaptVC: High Quality Voice Conversion with Adaptive Learning
par: Kim, Jaehun, et autres
Publié: (2025)
par: Kim, Jaehun, et autres
Publié: (2025)
Let There Be Sound: Reconstructing High Quality Speech from Silent Videos
par: Kim, Ji-Hoon, et autres
Publié: (2023)
par: Kim, Ji-Hoon, et autres
Publié: (2023)
InfiniteAudio: Infinite-Length Audio Generation with Consistency
par: Jung, Chaeyoung, et autres
Publié: (2025)
par: Jung, Chaeyoung, et autres
Publié: (2025)
Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment
par: Choi, Jeongsoo, et autres
Publié: (2025)
par: Choi, Jeongsoo, et autres
Publié: (2025)
CrossSpeech++: Cross-lingual Speech Synthesis with Decoupled Language and Speaker Generation
par: Kim, Ji-Hoon, et autres
Publié: (2024)
par: Kim, Ji-Hoon, et autres
Publié: (2024)
LP-CFM: Perceptual Invariance-Aware Conditional Flow Matching for Speech Modeling
par: Kwak, Doyeop, et autres
Publié: (2025)
par: Kwak, Doyeop, et autres
Publié: (2025)
Probing Cross-modal Information Hubs in Audio-Visual LLMs
par: Jung, Jihoo, et autres
Publié: (2026)
par: Jung, Jihoo, et autres
Publié: (2026)
VoxSim: A perceptual voice similarity dataset
par: Ahn, Junseok, et autres
Publié: (2024)
par: Ahn, Junseok, et autres
Publié: (2024)
Dub-S2ST: Textless Speech-to-Speech Translation for Seamless Dubbing
par: Choi, Jeongsoo, et autres
Publié: (2025)
par: Choi, Jeongsoo, et autres
Publié: (2025)
V2SFlow: Video-to-Speech Generation with Speech Decomposition and Rectified Flow
par: Choi, Jeongsoo, et autres
Publié: (2024)
par: Choi, Jeongsoo, et autres
Publié: (2024)
Latent Filling: Latent Space Data Augmentation for Zero-shot Speech Synthesis
par: Bae, Jae-Sung, et autres
Publié: (2023)
par: Bae, Jae-Sung, et autres
Publié: (2023)
UNMIXX: Untangling Highly Correlated Singing Voices Mixtures
par: Jung, Jihoo, et autres
Publié: (2026)
par: Jung, Jihoo, et autres
Publié: (2026)
Text-To-Speech Synthesis In The Wild
par: Jung, Jee-weon, et autres
Publié: (2024)
par: Jung, Jee-weon, et autres
Publié: (2024)
Lightweight Audio Segmentation for Long-form Speech Translation
par: Lee, Jaesong, et autres
Publié: (2024)
par: Lee, Jaesong, et autres
Publié: (2024)
SCORE: Scaling audio generation using Standardized COmposite REwards
par: Jung, Jaemin, et autres
Publié: (2025)
par: Jung, Jaemin, et autres
Publié: (2025)
From Faces to Voices: Learning Hierarchical Representations for High-quality Video-to-Speech
par: Kim, Ji-Hoon, et autres
Publié: (2025)
par: Kim, Ji-Hoon, et autres
Publié: (2025)
Bridging the Gap between Audio and Text using Parallel-attention for User-defined Keyword Spotting
par: Kim, Youkyum, et autres
Publié: (2024)
par: Kim, Youkyum, et autres
Publié: (2024)
Audio Mamba: Bidirectional State Space Model for Audio Representation Learning
par: Erol, Mehmet Hamza, et autres
Publié: (2024)
par: Erol, Mehmet Hamza, et autres
Publié: (2024)
PhoWhisper: Automatic Speech Recognition for Vietnamese
par: Le, Thanh-Thien, et autres
Publié: (2024)
par: Le, Thanh-Thien, et autres
Publié: (2024)
Wanna hear your voice? A sample is all we need!
par: Pham, The Hieu, et autres
Publié: (2024)
par: Pham, The Hieu, et autres
Publié: (2024)
Seeing Speech and Sound: Distinguishing and Locating Audios in Visual Scenes
par: Ryu, Hyeonggon, et autres
Publié: (2025)
par: Ryu, Hyeonggon, et autres
Publié: (2025)
Zero-Shot Text-to-Speech for Vietnamese
par: Vu, Thi, et autres
Publié: (2025)
par: Vu, Thi, et autres
Publié: (2025)
AsyncSwitch: Asynchronous Text-Speech Adaptation for Code-Switched ASR
par: Nguyen, Tuan, et autres
Publié: (2025)
par: Nguyen, Tuan, et autres
Publié: (2025)
Plug-and-Steer: Decoupling Separation and Selection in Audio-Visual Target Speaker Extraction
par: Kwak, Doyeop, et autres
Publié: (2026)
par: Kwak, Doyeop, et autres
Publié: (2026)
High Fidelity Text-to-Speech Via Discrete Tokens Using Token Transducer and Group Masked Language Model
par: Lee, Joun Yeop, et autres
Publié: (2024)
par: Lee, Joun Yeop, et autres
Publié: (2024)
Emotion-Coherent Speech Data Augmentation and Self-Supervised Contrastive Style Training for Enhancing Kids's Story Speech Synthesis
par: Chung, Raymond
Publié: (2026)
par: Chung, Raymond
Publié: (2026)
Rethinking Mamba in Speech Processing by Self-Supervised Models
par: Zhang, Xiangyu, et autres
Publié: (2024)
par: Zhang, Xiangyu, et autres
Publié: (2024)
UniCoM: A Universal Code-Switching Speech Generator
par: Lee, Sangmin, et autres
Publié: (2025)
par: Lee, Sangmin, et autres
Publié: (2025)
OZSpeech: One-step Zero-shot Speech Synthesis with Learned-Prior-Conditioned Flow Matching
par: Huynh-Nguyen, Hieu-Nghia, et autres
Publié: (2025)
par: Huynh-Nguyen, Hieu-Nghia, et autres
Publié: (2025)
ElasticAST: An Audio Spectrogram Transformer for All Length and Resolutions
par: Feng, Jiu, et autres
Publié: (2024)
par: Feng, Jiu, et autres
Publié: (2024)
From Coarse to Fine: Efficient Training for Audio Spectrogram Transformers
par: Feng, Jiu, et autres
Publié: (2024)
par: Feng, Jiu, et autres
Publié: (2024)
ToneUnit: A Speech Discretization Approach for Tonal Language Speech Synthesis
par: Tao, Dehua, et autres
Publié: (2024)
par: Tao, Dehua, et autres
Publié: (2024)
Documents similaires
-
VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis
par: Jung, Jaemin, et autres
Publié: (2024) -
XLSR-MamBo: Scaling the Hybrid Mamba-Attention Backbone for Audio Deepfake Detection
par: Ng, Kwok-Ho, et autres
Publié: (2026) -
Accelerating Codec-based Speech Synthesis with Multi-Token Prediction and Speculative Decoding
par: Nguyen, Tan Dat, et autres
Publié: (2024) -
SPADE: Structured Pruning and Adaptive Distillation for Efficient LLM-TTS
par: Nguyen, Tan Dat, et autres
Publié: (2025) -
FreGrad: Lightweight and Fast Frequency-aware Diffusion Vocoder
par: Nguyen, Tan Dat, et autres
Publié: (2024)