Enregistré dans:
| Auteurs principaux: | Gu, Yuzhe, Diao, Enmao |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2404.19441 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Variable Bitrate Residual Vector Quantization for Audio Coding
par: Chae, Yunkee, et autres
Publié: (2024)
par: Chae, Yunkee, et autres
Publié: (2024)
Vector Quantized Diffusion Model Based Speech Bandwidth Extension
par: Fang, Yuan, et autres
Publié: (2024)
par: Fang, Yuan, et autres
Publié: (2024)
SAC: Neural Speech Codec with Semantic-Acoustic Dual-Stream Quantization
par: Chen, Wenxi, et autres
Publié: (2025)
par: Chen, Wenxi, et autres
Publié: (2025)
Autoregressive Speech Synthesis without Vector Quantization
par: Meng, Lingwei, et autres
Publié: (2024)
par: Meng, Lingwei, et autres
Publié: (2024)
Neural Speech Coding for Real-time Communications using Constant Bitrate Scalar Quantization
par: Brendel, Andreas, et autres
Publié: (2024)
par: Brendel, Andreas, et autres
Publié: (2024)
Scale This, Not That: Investigating Key Dataset Attributes for Efficient Speech Enhancement Scaling
par: Zhang, Leying, et autres
Publié: (2024)
par: Zhang, Leying, et autres
Publié: (2024)
SpeechFake: A Large-Scale Multilingual Speech Deepfake Dataset Incorporating Cutting-Edge Generation Methods
par: Huang, Wen, et autres
Publié: (2025)
par: Huang, Wen, et autres
Publié: (2025)
Efficient Sparse Coding with the Adaptive Locally Competitive Algorithm for Speech Classification
par: Bahadi, Soufiyan, et autres
Publié: (2024)
par: Bahadi, Soufiyan, et autres
Publié: (2024)
SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models
par: Yang, Dongchao, et autres
Publié: (2024)
par: Yang, Dongchao, et autres
Publié: (2024)
AUV: Teaching Audio Universal Vector Quantization with Single Nested Codebook
par: Chen, Yushen, et autres
Publié: (2025)
par: Chen, Yushen, et autres
Publié: (2025)
Towards Bitrate-Efficient and Noise-Robust Speech Coding with Variable Bitrate RVQ
par: Chae, Yunkee, et autres
Publié: (2025)
par: Chae, Yunkee, et autres
Publié: (2025)
CAMEL: Cross-Attention Enhanced Mixture-of-Experts and Language Bias for Code-Switching Speech Recognition
par: Wang, He, et autres
Publié: (2024)
par: Wang, He, et autres
Publié: (2024)
FLASepformer: Efficient Speech Separation with Gated Focused Linear Attention Transformer
par: Wang, Haoxu, et autres
Publié: (2025)
par: Wang, Haoxu, et autres
Publié: (2025)
USM-Lite: Quantization and Sparsity Aware Fine-tuning for Speech Recognition with Universal Speech Models
par: Ding, Shaojin, et autres
Publié: (2023)
par: Ding, Shaojin, et autres
Publié: (2023)
GALD-SE: Guided Anisotropic Lightweight Diffusion for Efficient Speech Enhancement
par: Wang, Chengzhong, et autres
Publié: (2024)
par: Wang, Chengzhong, et autres
Publié: (2024)
NDVQ: Robust Neural Audio Codec with Normal Distribution-Based Vector Quantization
par: Niu, Zhikang, et autres
Publié: (2024)
par: Niu, Zhikang, et autres
Publié: (2024)
Progressive Residual Extraction based Pre-training for Speech Representation Learning
par: Wang, Tianrui, et autres
Publié: (2024)
par: Wang, Tianrui, et autres
Publié: (2024)
PURE Codec: Progressive Unfolding of Residual Entropy for Speech Codec Learning
par: Shi, Jiatong, et autres
Publié: (2025)
par: Shi, Jiatong, et autres
Publié: (2025)
A Neural Speech Codec for Noise Robust Speech Coding
par: Huang, Jiayi, et autres
Publié: (2023)
par: Huang, Jiayi, et autres
Publié: (2023)
Post-Training Quantization for Audio Diffusion Transformers
par: Khandelwal, Tanmay, et autres
Publié: (2025)
par: Khandelwal, Tanmay, et autres
Publié: (2025)
SpatialCodec: Neural Spatial Speech Coding
par: Xu, Zhongweiyang, et autres
Publié: (2023)
par: Xu, Zhongweiyang, et autres
Publié: (2023)
Effective and Efficient Mixed Precision Quantization of Speech Foundation Models
par: Xu, Haoning, et autres
Publié: (2025)
par: Xu, Haoning, et autres
Publié: (2025)
ED-TTS: Multi-Scale Emotion Modeling using Cross-Domain Emotion Diarization for Emotional Speech Synthesis
par: Tang, Haobin, et autres
Publié: (2024)
par: Tang, Haobin, et autres
Publié: (2024)
Speaking from Coarse to Fine: Improving Neural Codec Language Model via Multi-Scale Speech Coding and Generation
par: Guo, Haohan, et autres
Publié: (2024)
par: Guo, Haohan, et autres
Publié: (2024)
Causal Speech Enhancement with Predicting Semantics based on Quantized Self-supervised Learning Features
par: Tsunoo, Emiru, et autres
Publié: (2024)
par: Tsunoo, Emiru, et autres
Publié: (2024)
Cross-Talk Speech Reduction, by Separation, for Separation
par: Wang, Zhong-Qiu, et autres
Publié: (2026)
par: Wang, Zhong-Qiu, et autres
Publié: (2026)
Attention-Guided Adaptation for Code-Switching Speech Recognition
par: Aditya, Bobbi, et autres
Publié: (2023)
par: Aditya, Bobbi, et autres
Publié: (2023)
Vision-Integrated High-Quality Neural Speech Coding
par: Guo, Yao, et autres
Publié: (2025)
par: Guo, Yao, et autres
Publié: (2025)
ShiftySpeech: A Large-Scale Synthetic Speech Dataset with Distribution Shifts
par: Garg, Ashi, et autres
Publié: (2025)
par: Garg, Ashi, et autres
Publié: (2025)
DQ-Whisper: Joint Distillation and Quantization for Efficient Multilingual Speech Recognition
par: Shao, Hang, et autres
Publié: (2023)
par: Shao, Hang, et autres
Publié: (2023)
Rethinking Mean Opinion Scores in Speech Quality Assessment: Aggregation through Quantized Distribution Fitting
par: Kondo, Yuto, et autres
Publié: (2025)
par: Kondo, Yuto, et autres
Publié: (2025)
Accelerating Diffusion Transformer-Based Text-to-Speech with Transformer Layer Caching
par: Sakpiboonchit, Siratish
Publié: (2025)
par: Sakpiboonchit, Siratish
Publié: (2025)
Ideal-LLM: Integrating Dual Encoders and Language-Adapted LLM for Multilingual Speech-to-Text
par: Xue, Hongfei, et autres
Publié: (2024)
par: Xue, Hongfei, et autres
Publié: (2024)
Efficient Long-Form Speech Recognition for General Speech In-Context Learning
par: Yen, Hao, et autres
Publié: (2024)
par: Yen, Hao, et autres
Publié: (2024)
Speaker-agnostic Emotion Vector for Cross-speaker Emotion Intensity Control
par: Murata, Masato, et autres
Publié: (2025)
par: Murata, Masato, et autres
Publié: (2025)
Rare Word Recognition and Translation Without Fine-Tuning via Task Vector in Speech Models
par: Jing, Ruihao, et autres
Publié: (2025)
par: Jing, Ruihao, et autres
Publié: (2025)
UBGAN: Enhancing Coded Speech with Blind and Guided Bandwidth Extension
par: Gupta, Kishan, et autres
Publié: (2025)
par: Gupta, Kishan, et autres
Publié: (2025)
Fewer-token Neural Speech Codec with Time-invariant Codes
par: Ren, Yong, et autres
Publié: (2023)
par: Ren, Yong, et autres
Publié: (2023)
Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning
par: Wan, Zixiang, et autres
Publié: (2024)
par: Wan, Zixiang, et autres
Publié: (2024)
LiveSpeech: Low-Latency Zero-shot Text-to-Speech via Autoregressive Modeling of Audio Discrete Codes
par: Dang, Trung, et autres
Publié: (2024)
par: Dang, Trung, et autres
Publié: (2024)
Documents similaires
-
Variable Bitrate Residual Vector Quantization for Audio Coding
par: Chae, Yunkee, et autres
Publié: (2024) -
Vector Quantized Diffusion Model Based Speech Bandwidth Extension
par: Fang, Yuan, et autres
Publié: (2024) -
SAC: Neural Speech Codec with Semantic-Acoustic Dual-Stream Quantization
par: Chen, Wenxi, et autres
Publié: (2025) -
Autoregressive Speech Synthesis without Vector Quantization
par: Meng, Lingwei, et autres
Publié: (2024) -
Neural Speech Coding for Real-time Communications using Constant Bitrate Scalar Quantization
par: Brendel, Andreas, et autres
Publié: (2024)