Salvato in:
| Autori principali: | Wang, ShiMing, Du, ZhiHao, Xiang, Yang, Zhao, TianYu, Zhao, Han, Chen, Qian, Li, XianGang, Guo, HanJie, Ling, ZhenHua |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2509.19852 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Neural Speech Separation with Parallel Amplitude and Phase Spectrum Estimation
di: Liu, Fei, et al.
Pubblicazione: (2025)
di: Liu, Fei, et al.
Pubblicazione: (2025)
UniVocal: Unified Speech-Singing Code-Switching Synthesis
di: Shi, Yufei, et al.
Pubblicazione: (2026)
di: Shi, Yufei, et al.
Pubblicazione: (2026)
LatentFlowSR: High-Fidelity Audio Super-Resolution via Noise-Robust Latent Flow Matching
di: Liu, Fei, et al.
Pubblicazione: (2026)
di: Liu, Fei, et al.
Pubblicazione: (2026)
Multiscale Matching Driven by Cross-Modal Similarity Consistency for Audio-Text Retrieval
di: Wang, Qian, et al.
Pubblicazione: (2024)
di: Wang, Qian, et al.
Pubblicazione: (2024)
Low-Latency Neural Speech Phase Prediction based on Parallel Estimation Architecture and Anti-Wrapping Losses for Speech Generation Tasks
di: Ai, Yang, et al.
Pubblicazione: (2024)
di: Ai, Yang, et al.
Pubblicazione: (2024)
BiVocoder: A Bidirectional Neural Vocoder Integrating Feature Extraction and Waveform Generation
di: Du, Hui-Peng, et al.
Pubblicazione: (2024)
di: Du, Hui-Peng, et al.
Pubblicazione: (2024)
APCodec+: A Spectrum-Coding-Based High-Fidelity and High-Compression-Rate Neural Audio Codec with Staged Training Paradigm
di: Du, Hui-Peng, et al.
Pubblicazione: (2024)
di: Du, Hui-Peng, et al.
Pubblicazione: (2024)
Universal Discrete-Domain Speech Enhancement
di: Liu, Fei, et al.
Pubblicazione: (2025)
di: Liu, Fei, et al.
Pubblicazione: (2025)
Resnet-conformer network with shared weights and attention mechanism for sound event localization, detection, and distance estimation
di: Vo, Quoc Thinh, et al.
Pubblicazione: (2025)
di: Vo, Quoc Thinh, et al.
Pubblicazione: (2025)
Omni-directional attention mechanism based on Mamba for speech separation
di: Xue, Ke, et al.
Pubblicazione: (2026)
di: Xue, Ke, et al.
Pubblicazione: (2026)
A Streamable Neural Audio Codec with Residual Scalar-Vector Quantization for Real-Time Communication
di: Jiang, Xiao-Hang, et al.
Pubblicazione: (2025)
di: Jiang, Xiao-Hang, et al.
Pubblicazione: (2025)
Improving Noise Robustness of LLM-based Zero-shot TTS via Discrete Acoustic Token Denoising
di: Lu, Ye-Xin, et al.
Pubblicazione: (2025)
di: Lu, Ye-Xin, et al.
Pubblicazione: (2025)
Towards High-Quality and Efficient Speech Bandwidth Extension with Parallel Amplitude and Phase Prediction
di: Lu, Ye-Xin, et al.
Pubblicazione: (2024)
di: Lu, Ye-Xin, et al.
Pubblicazione: (2024)
Unispeaker: A Unified Approach for Multimodality-driven Speaker Generation
di: Sheng, Zhengyan, et al.
Pubblicazione: (2025)
di: Sheng, Zhengyan, et al.
Pubblicazione: (2025)
EnchantDance: Unveiling the Potential of Music-Driven Dance Movement
di: Han, Bo, et al.
Pubblicazione: (2023)
di: Han, Bo, et al.
Pubblicazione: (2023)
Explicit Estimation of Magnitude and Phase Spectra in Parallel for High-Quality Speech Enhancement
di: Lu, Ye-Xin, et al.
Pubblicazione: (2023)
di: Lu, Ye-Xin, et al.
Pubblicazione: (2023)
Universal Preference-Score-based Pairwise Speech Quality Assessment
di: Shi, Yu-Fei, et al.
Pubblicazione: (2025)
di: Shi, Yu-Fei, et al.
Pubblicazione: (2025)
SAMOS: A Neural MOS Prediction Model Leveraging Semantic Representations and Acoustic Features
di: Shi, Yu-Fei, et al.
Pubblicazione: (2024)
di: Shi, Yu-Fei, et al.
Pubblicazione: (2024)
ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram
di: Jiang, Xiao-Hang, et al.
Pubblicazione: (2024)
di: Jiang, Xiao-Hang, et al.
Pubblicazione: (2024)
Pitch-and-Spectrum-Aware Singing Quality Assessment with Bias Correction and Model Fusion
di: Shi, Yu-Fei, et al.
Pubblicazione: (2024)
di: Shi, Yu-Fei, et al.
Pubblicazione: (2024)
APCodec: A Neural Audio Codec with Parallel Amplitude and Phase Spectrum Encoding and Decoding
di: Ai, Yang, et al.
Pubblicazione: (2024)
di: Ai, Yang, et al.
Pubblicazione: (2024)
Cross-attention and Self-attention for Audio-visual Speaker Diarization in MISP-Meeting Challenge
di: Li, Zhaoyang, et al.
Pubblicazione: (2025)
di: Li, Zhaoyang, et al.
Pubblicazione: (2025)
RRPO: Robust Reward Policy Optimization for LLM-based Emotional TTS
di: Wang, Cong, et al.
Pubblicazione: (2025)
di: Wang, Cong, et al.
Pubblicazione: (2025)
Say More with Less: Variable-Frame-Rate Speech Tokenization via Adaptive Clustering and Implicit Duration Coding
di: Zheng, Rui-Chen, et al.
Pubblicazione: (2025)
di: Zheng, Rui-Chen, et al.
Pubblicazione: (2025)
DAIEN-TTS: Disentangled Audio Infilling for Environment-Aware Text-to-Speech Synthesis
di: Lu, Ye-Xin, et al.
Pubblicazione: (2025)
di: Lu, Ye-Xin, et al.
Pubblicazione: (2025)
We Can Hear You with mmWave Radar! An End-to-End Eavesdropping System
di: Han, Dachao, et al.
Pubblicazione: (2025)
di: Han, Dachao, et al.
Pubblicazione: (2025)
Vision-Integrated High-Quality Neural Speech Coding
di: Guo, Yao, et al.
Pubblicazione: (2025)
di: Guo, Yao, et al.
Pubblicazione: (2025)
Audio-Visual Representation Learning via Knowledge Distillation from Speech Foundation Models
di: Zhang, Jing-Xuan, et al.
Pubblicazione: (2025)
di: Zhang, Jing-Xuan, et al.
Pubblicazione: (2025)
Decoding Speaker-Normalized Pitch from EEG for Mandarin Perception
di: Chen, Jiaxin, et al.
Pubblicazione: (2025)
di: Chen, Jiaxin, et al.
Pubblicazione: (2025)
MDCTCodec: A Lightweight MDCT-based Neural Audio Codec towards High Sampling Rate and Low Bitrate Scenarios
di: Jiang, Xiao-Hang, et al.
Pubblicazione: (2024)
di: Jiang, Xiao-Hang, et al.
Pubblicazione: (2024)
The First Voice Timbre Attribute Detection Challenge
di: Chen, Liping, et al.
Pubblicazione: (2025)
di: Chen, Liping, et al.
Pubblicazione: (2025)
Lightweight Front-end Enhancement for Robust ASR via Frame Resampling and Sub-Band Pruning
di: Zhao, Siyi, et al.
Pubblicazione: (2025)
di: Zhao, Siyi, et al.
Pubblicazione: (2025)
WTFormer: A Wavelet Conformer Network for MIMO Speech Enhancement with Spatial Cues Peservation
di: Han, Lu, et al.
Pubblicazione: (2025)
di: Han, Lu, et al.
Pubblicazione: (2025)
Leveraging Prompt Learning and Pause Encoding for Alzheimer's Disease Detection
di: Liu, Yin-Long, et al.
Pubblicazione: (2024)
di: Liu, Yin-Long, et al.
Pubblicazione: (2024)
Multi-Stage Speech Bandwidth Extension with Flexible Sampling Rate Control
di: Lu, Ye-Xin, et al.
Pubblicazione: (2024)
di: Lu, Ye-Xin, et al.
Pubblicazione: (2024)
From Coarse to Fine: Recursive Audio-Visual Semantic Enhancement for Speech Separation
di: Xue, Ke, et al.
Pubblicazione: (2025)
di: Xue, Ke, et al.
Pubblicazione: (2025)
Knowledge-Decoupled Functionally Invariant Path with Synthetic Personal Data for Personalized ASR
di: Gu, Yue, et al.
Pubblicazione: (2025)
di: Gu, Yue, et al.
Pubblicazione: (2025)
Stage-Wise and Prior-Aware Neural Speech Phase Prediction
di: Liu, Fei, et al.
Pubblicazione: (2024)
di: Liu, Fei, et al.
Pubblicazione: (2024)
AudioFab: Building A General and Intelligent Audio Factory through Tool Learning
di: Zhu, Cheng, et al.
Pubblicazione: (2025)
di: Zhu, Cheng, et al.
Pubblicazione: (2025)
GDiffuSE: Diffusion-based speech enhancement with noise model guidance
di: Yanir, Efrayim, et al.
Pubblicazione: (2025)
di: Yanir, Efrayim, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Neural Speech Separation with Parallel Amplitude and Phase Spectrum Estimation
di: Liu, Fei, et al.
Pubblicazione: (2025) -
UniVocal: Unified Speech-Singing Code-Switching Synthesis
di: Shi, Yufei, et al.
Pubblicazione: (2026) -
LatentFlowSR: High-Fidelity Audio Super-Resolution via Noise-Robust Latent Flow Matching
di: Liu, Fei, et al.
Pubblicazione: (2026) -
Multiscale Matching Driven by Cross-Modal Similarity Consistency for Audio-Text Retrieval
di: Wang, Qian, et al.
Pubblicazione: (2024) -
Low-Latency Neural Speech Phase Prediction based on Parallel Estimation Architecture and Anti-Wrapping Losses for Speech Generation Tasks
di: Ai, Yang, et al.
Pubblicazione: (2024)