STSR: High-Fidelity Speech Super-Resolution via Spectral-Transient Context Modeling
Fuente:
arXiv
Salvato in:
| Autori principali: | Yuan, Jiajun, Wang, Xiaochen, Xiao, Yuhang, Wu, Yulin, Hu, Chenhao, Lv, Xueyang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
HiFi-SR: A Unified Generative Transformer-Convolutional Adversarial Network for High-Fidelity Speech Super-Resolution
di: Zhao, Shengkui, et al.
Pubblicazione: (2025)
di: Zhao, Shengkui, et al.
Pubblicazione: (2025)
DiTSE: High-Fidelity Generative Speech Enhancement via Latent Diffusion Transformers
di: Guimarães, Heitor R., et al.
Pubblicazione: (2025)
di: Guimarães, Heitor R., et al.
Pubblicazione: (2025)
Transient Noise Removal via Diffusion-based Speech Inpainting
di: Moradi, Mordehay, et al.
Pubblicazione: (2025)
di: Moradi, Mordehay, et al.
Pubblicazione: (2025)
A High-Fidelity Speech Super Resolution Network using a Complex Global Attention Module with Spectro-Temporal Loss
di: Tamiti, Tarikul Islam, et al.
Pubblicazione: (2025)
di: Tamiti, Tarikul Islam, et al.
Pubblicazione: (2025)
LongCat-AudioDiT: High-Fidelity Diffusion Text-to-Speech in the Waveform Latent Space
di: Xin, Detai, et al.
Pubblicazione: (2026)
di: Xin, Detai, et al.
Pubblicazione: (2026)
MobileSpeech: A Fast and High-Fidelity Framework for Mobile Zero-Shot Text-to-Speech
di: Ji, Shengpeng, et al.
Pubblicazione: (2024)
di: Ji, Shengpeng, et al.
Pubblicazione: (2024)
Conditioning and Sampling in Variational Diffusion Models for Speech Super-Resolution
di: Yu, Chin-Yun, et al.
Pubblicazione: (2022)
di: Yu, Chin-Yun, et al.
Pubblicazione: (2022)
Seeing the Context: Rich Visual Context-Aware Speech Recognition via Multimodal Reasoning
di: Tian, Wenjie, et al.
Pubblicazione: (2026)
di: Tian, Wenjie, et al.
Pubblicazione: (2026)
Long-Context Speech Synthesis with Context-Aware Memory
di: Li, Zhipeng, et al.
Pubblicazione: (2025)
di: Li, Zhipeng, et al.
Pubblicazione: (2025)
VQTTS: High-Fidelity Text-to-Speech Synthesis with Self-Supervised VQ Acoustic Feature
di: Du, Chenpeng, et al.
Pubblicazione: (2022)
di: Du, Chenpeng, et al.
Pubblicazione: (2022)
ConSinger: Efficient High-Fidelity Singing Voice Generation with Minimal Steps
di: Song, Yulin, et al.
Pubblicazione: (2024)
di: Song, Yulin, et al.
Pubblicazione: (2024)
SuperCodec: A Neural Speech Codec with Selective Back-Projection Network
di: Zheng, Youqiang, et al.
Pubblicazione: (2024)
di: Zheng, Youqiang, et al.
Pubblicazione: (2024)
Spectral Masking with Explicit Time-Context Windowing for Neural Network-Based Monaural Speech Enhancement
di: Fiorio, Luan Vinícius, et al.
Pubblicazione: (2024)
di: Fiorio, Luan Vinícius, et al.
Pubblicazione: (2024)
Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition
di: Bai, Ye, et al.
Pubblicazione: (2024)
di: Bai, Ye, et al.
Pubblicazione: (2024)
High-Fidelity Simultaneous Speech-To-Speech Translation
di: Labiausse, Tom, et al.
Pubblicazione: (2025)
di: Labiausse, Tom, et al.
Pubblicazione: (2025)
Leveraging Joint Spectral and Spatial Learning with MAMBA for Multichannel Speech Enhancement
di: Ren, Wenze, et al.
Pubblicazione: (2024)
di: Ren, Wenze, et al.
Pubblicazione: (2024)
High-Fidelity Speech Enhancement via Discrete Audio Tokens
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025)
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025)
Combined Generative and Predictive Modeling for Speech Super-resolution
di: Wang, Heming, et al.
Pubblicazione: (2024)
di: Wang, Heming, et al.
Pubblicazione: (2024)
High-Fidelity Generative Audio Compression at 0.275kbps
di: Ma, Hao, et al.
Pubblicazione: (2026)
di: Ma, Hao, et al.
Pubblicazione: (2026)
Wave-U-Mamba: An End-To-End Framework For High-Quality And Efficient Speech Super Resolution
di: Lee, Yongjoon, et al.
Pubblicazione: (2024)
di: Lee, Yongjoon, et al.
Pubblicazione: (2024)
Towards High-Fidelity and Controllable Bioacoustic Generation via Enhanced Diffusion Learning
di: Song, Tianyu, et al.
Pubblicazione: (2025)
di: Song, Tianyu, et al.
Pubblicazione: (2025)
InstructSing: High-Fidelity Singing Voice Generation via Instructing Yourself
di: Zeng, Chang, et al.
Pubblicazione: (2024)
di: Zeng, Chang, et al.
Pubblicazione: (2024)
High-Fidelity Neural Phonetic Posteriorgrams
di: Churchwell, Cameron, et al.
Pubblicazione: (2024)
di: Churchwell, Cameron, et al.
Pubblicazione: (2024)
Efficient Long-Form Speech Recognition for General Speech In-Context Learning
di: Yen, Hao, et al.
Pubblicazione: (2024)
di: Yen, Hao, et al.
Pubblicazione: (2024)
FLY-TTS: Fast, Lightweight and High-Quality End-to-End Text-to-Speech Synthesis
di: Guo, Yinlin, et al.
Pubblicazione: (2024)
di: Guo, Yinlin, et al.
Pubblicazione: (2024)
Ambisonics Super-Resolution Using A Waveform-Domain Neural Network
di: Nawfal, Ismael, et al.
Pubblicazione: (2025)
di: Nawfal, Ismael, et al.
Pubblicazione: (2025)
Speech-Mamba: Long-Context Speech Recognition with Selective State Spaces Models
di: Gao, Xiaoxue, et al.
Pubblicazione: (2024)
di: Gao, Xiaoxue, et al.
Pubblicazione: (2024)
High Fidelity Text-Guided Music Editing via Single-Stage Flow Matching
di: Lan, Gael Le, et al.
Pubblicazione: (2024)
di: Lan, Gael Le, et al.
Pubblicazione: (2024)
CogSR: Semantic-Aware Speech Super-Resolution via Chain-of-Thought Guided Flow Matching
di: Yuan, Jiajun, et al.
Pubblicazione: (2025)
di: Yuan, Jiajun, et al.
Pubblicazione: (2025)
Advancing Electrolaryngeal Speech Enhancement Through Speech-Text Representation Learning
di: Ma, Ding, et al.
Pubblicazione: (2026)
di: Ma, Ding, et al.
Pubblicazione: (2026)
Phone-purity Guided Discrete Tokens for Dysarthric Speech Recognition
di: Wang, Huimeng, et al.
Pubblicazione: (2025)
di: Wang, Huimeng, et al.
Pubblicazione: (2025)
Phase Repair for Time-Domain Convolutional Neural Networks in Music Super-Resolution
di: Zhang, Yenan, et al.
Pubblicazione: (2023)
di: Zhang, Yenan, et al.
Pubblicazione: (2023)
DENSE: Dynamic Embedding Causal Target Speech Extraction
di: Wang, Yiwen, et al.
Pubblicazione: (2024)
di: Wang, Yiwen, et al.
Pubblicazione: (2024)
DualSpeech: Enhancing Speaker-Fidelity and Text-Intelligibility Through Dual Classifier-Free Guidance
di: Yang, Jinhyeok, et al.
Pubblicazione: (2024)
di: Yang, Jinhyeok, et al.
Pubblicazione: (2024)
DualSpeechLM: Towards Unified Speech Understanding and Generation via Dual Speech Token Modeling with Large Language Models
di: Wang, Yuanyuan, et al.
Pubblicazione: (2025)
di: Wang, Yuanyuan, et al.
Pubblicazione: (2025)
CosyEdit: Unlocking End-to-End Speech Editing Capability from Zero-Shot Text-to-Speech Models
di: Chen, Junyang, et al.
Pubblicazione: (2026)
di: Chen, Junyang, et al.
Pubblicazione: (2026)
HILCodec: High-Fidelity and Lightweight Neural Audio Codec
di: Ahn, Sunghwan, et al.
Pubblicazione: (2024)
di: Ahn, Sunghwan, et al.
Pubblicazione: (2024)
Vision-Integrated High-Quality Neural Speech Coding
di: Guo, Yao, et al.
Pubblicazione: (2025)
di: Guo, Yao, et al.
Pubblicazione: (2025)
Hierarchical Decoding for Discrete Speech Synthesis with Multi-Resolution Spoof Detection
di: Zhao, Junchuan, et al.
Pubblicazione: (2026)
di: Zhao, Junchuan, et al.
Pubblicazione: (2026)
HiFi-Glot: High-Fidelity Neural Formant Synthesis with Differentiable Resonant Filters
di: Gu, Yicheng, et al.
Pubblicazione: (2024)
di: Gu, Yicheng, et al.
Pubblicazione: (2024)
Documenti analoghi
-
HiFi-SR: A Unified Generative Transformer-Convolutional Adversarial Network for High-Fidelity Speech Super-Resolution
di: Zhao, Shengkui, et al.
Pubblicazione: (2025) -
DiTSE: High-Fidelity Generative Speech Enhancement via Latent Diffusion Transformers
di: Guimarães, Heitor R., et al.
Pubblicazione: (2025) -
Transient Noise Removal via Diffusion-based Speech Inpainting
di: Moradi, Mordehay, et al.
Pubblicazione: (2025) -
A High-Fidelity Speech Super Resolution Network using a Complex Global Attention Module with Spectro-Temporal Loss
di: Tamiti, Tarikul Islam, et al.
Pubblicazione: (2025) -
LongCat-AudioDiT: High-Fidelity Diffusion Text-to-Speech in the Waveform Latent Space
di: Xin, Detai, et al.
Pubblicazione: (2026)