STSR: High-Fidelity Speech Super-Resolution via Spectral-Transient Context Modeling
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yuan, Jiajun, Wang, Xiaochen, Xiao, Yuhang, Wu, Yulin, Hu, Chenhao, Lv, Xueyang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
HiFi-SR: A Unified Generative Transformer-Convolutional Adversarial Network for High-Fidelity Speech Super-Resolution
par: Zhao, Shengkui, et autres
Publié: (2025)
par: Zhao, Shengkui, et autres
Publié: (2025)
DiTSE: High-Fidelity Generative Speech Enhancement via Latent Diffusion Transformers
par: Guimarães, Heitor R., et autres
Publié: (2025)
par: Guimarães, Heitor R., et autres
Publié: (2025)
Transient Noise Removal via Diffusion-based Speech Inpainting
par: Moradi, Mordehay, et autres
Publié: (2025)
par: Moradi, Mordehay, et autres
Publié: (2025)
A High-Fidelity Speech Super Resolution Network using a Complex Global Attention Module with Spectro-Temporal Loss
par: Tamiti, Tarikul Islam, et autres
Publié: (2025)
par: Tamiti, Tarikul Islam, et autres
Publié: (2025)
LongCat-AudioDiT: High-Fidelity Diffusion Text-to-Speech in the Waveform Latent Space
par: Xin, Detai, et autres
Publié: (2026)
par: Xin, Detai, et autres
Publié: (2026)
MobileSpeech: A Fast and High-Fidelity Framework for Mobile Zero-Shot Text-to-Speech
par: Ji, Shengpeng, et autres
Publié: (2024)
par: Ji, Shengpeng, et autres
Publié: (2024)
Conditioning and Sampling in Variational Diffusion Models for Speech Super-Resolution
par: Yu, Chin-Yun, et autres
Publié: (2022)
par: Yu, Chin-Yun, et autres
Publié: (2022)
Seeing the Context: Rich Visual Context-Aware Speech Recognition via Multimodal Reasoning
par: Tian, Wenjie, et autres
Publié: (2026)
par: Tian, Wenjie, et autres
Publié: (2026)
Long-Context Speech Synthesis with Context-Aware Memory
par: Li, Zhipeng, et autres
Publié: (2025)
par: Li, Zhipeng, et autres
Publié: (2025)
VQTTS: High-Fidelity Text-to-Speech Synthesis with Self-Supervised VQ Acoustic Feature
par: Du, Chenpeng, et autres
Publié: (2022)
par: Du, Chenpeng, et autres
Publié: (2022)
ConSinger: Efficient High-Fidelity Singing Voice Generation with Minimal Steps
par: Song, Yulin, et autres
Publié: (2024)
par: Song, Yulin, et autres
Publié: (2024)
SuperCodec: A Neural Speech Codec with Selective Back-Projection Network
par: Zheng, Youqiang, et autres
Publié: (2024)
par: Zheng, Youqiang, et autres
Publié: (2024)
Spectral Masking with Explicit Time-Context Windowing for Neural Network-Based Monaural Speech Enhancement
par: Fiorio, Luan Vinícius, et autres
Publié: (2024)
par: Fiorio, Luan Vinícius, et autres
Publié: (2024)
Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition
par: Bai, Ye, et autres
Publié: (2024)
par: Bai, Ye, et autres
Publié: (2024)
High-Fidelity Simultaneous Speech-To-Speech Translation
par: Labiausse, Tom, et autres
Publié: (2025)
par: Labiausse, Tom, et autres
Publié: (2025)
Leveraging Joint Spectral and Spatial Learning with MAMBA for Multichannel Speech Enhancement
par: Ren, Wenze, et autres
Publié: (2024)
par: Ren, Wenze, et autres
Publié: (2024)
High-Fidelity Speech Enhancement via Discrete Audio Tokens
par: Lanzendörfer, Luca A., et autres
Publié: (2025)
par: Lanzendörfer, Luca A., et autres
Publié: (2025)
Combined Generative and Predictive Modeling for Speech Super-resolution
par: Wang, Heming, et autres
Publié: (2024)
par: Wang, Heming, et autres
Publié: (2024)
High-Fidelity Generative Audio Compression at 0.275kbps
par: Ma, Hao, et autres
Publié: (2026)
par: Ma, Hao, et autres
Publié: (2026)
Wave-U-Mamba: An End-To-End Framework For High-Quality And Efficient Speech Super Resolution
par: Lee, Yongjoon, et autres
Publié: (2024)
par: Lee, Yongjoon, et autres
Publié: (2024)
Towards High-Fidelity and Controllable Bioacoustic Generation via Enhanced Diffusion Learning
par: Song, Tianyu, et autres
Publié: (2025)
par: Song, Tianyu, et autres
Publié: (2025)
InstructSing: High-Fidelity Singing Voice Generation via Instructing Yourself
par: Zeng, Chang, et autres
Publié: (2024)
par: Zeng, Chang, et autres
Publié: (2024)
High-Fidelity Neural Phonetic Posteriorgrams
par: Churchwell, Cameron, et autres
Publié: (2024)
par: Churchwell, Cameron, et autres
Publié: (2024)
Efficient Long-Form Speech Recognition for General Speech In-Context Learning
par: Yen, Hao, et autres
Publié: (2024)
par: Yen, Hao, et autres
Publié: (2024)
FLY-TTS: Fast, Lightweight and High-Quality End-to-End Text-to-Speech Synthesis
par: Guo, Yinlin, et autres
Publié: (2024)
par: Guo, Yinlin, et autres
Publié: (2024)
Ambisonics Super-Resolution Using A Waveform-Domain Neural Network
par: Nawfal, Ismael, et autres
Publié: (2025)
par: Nawfal, Ismael, et autres
Publié: (2025)
Speech-Mamba: Long-Context Speech Recognition with Selective State Spaces Models
par: Gao, Xiaoxue, et autres
Publié: (2024)
par: Gao, Xiaoxue, et autres
Publié: (2024)
High Fidelity Text-Guided Music Editing via Single-Stage Flow Matching
par: Lan, Gael Le, et autres
Publié: (2024)
par: Lan, Gael Le, et autres
Publié: (2024)
CogSR: Semantic-Aware Speech Super-Resolution via Chain-of-Thought Guided Flow Matching
par: Yuan, Jiajun, et autres
Publié: (2025)
par: Yuan, Jiajun, et autres
Publié: (2025)
Advancing Electrolaryngeal Speech Enhancement Through Speech-Text Representation Learning
par: Ma, Ding, et autres
Publié: (2026)
par: Ma, Ding, et autres
Publié: (2026)
Phone-purity Guided Discrete Tokens for Dysarthric Speech Recognition
par: Wang, Huimeng, et autres
Publié: (2025)
par: Wang, Huimeng, et autres
Publié: (2025)
Phase Repair for Time-Domain Convolutional Neural Networks in Music Super-Resolution
par: Zhang, Yenan, et autres
Publié: (2023)
par: Zhang, Yenan, et autres
Publié: (2023)
DENSE: Dynamic Embedding Causal Target Speech Extraction
par: Wang, Yiwen, et autres
Publié: (2024)
par: Wang, Yiwen, et autres
Publié: (2024)
DualSpeech: Enhancing Speaker-Fidelity and Text-Intelligibility Through Dual Classifier-Free Guidance
par: Yang, Jinhyeok, et autres
Publié: (2024)
par: Yang, Jinhyeok, et autres
Publié: (2024)
DualSpeechLM: Towards Unified Speech Understanding and Generation via Dual Speech Token Modeling with Large Language Models
par: Wang, Yuanyuan, et autres
Publié: (2025)
par: Wang, Yuanyuan, et autres
Publié: (2025)
CosyEdit: Unlocking End-to-End Speech Editing Capability from Zero-Shot Text-to-Speech Models
par: Chen, Junyang, et autres
Publié: (2026)
par: Chen, Junyang, et autres
Publié: (2026)
HILCodec: High-Fidelity and Lightweight Neural Audio Codec
par: Ahn, Sunghwan, et autres
Publié: (2024)
par: Ahn, Sunghwan, et autres
Publié: (2024)
Vision-Integrated High-Quality Neural Speech Coding
par: Guo, Yao, et autres
Publié: (2025)
par: Guo, Yao, et autres
Publié: (2025)
Hierarchical Decoding for Discrete Speech Synthesis with Multi-Resolution Spoof Detection
par: Zhao, Junchuan, et autres
Publié: (2026)
par: Zhao, Junchuan, et autres
Publié: (2026)
HiFi-Glot: High-Fidelity Neural Formant Synthesis with Differentiable Resonant Filters
par: Gu, Yicheng, et autres
Publié: (2024)
par: Gu, Yicheng, et autres
Publié: (2024)
Documents similaires
-
HiFi-SR: A Unified Generative Transformer-Convolutional Adversarial Network for High-Fidelity Speech Super-Resolution
par: Zhao, Shengkui, et autres
Publié: (2025) -
DiTSE: High-Fidelity Generative Speech Enhancement via Latent Diffusion Transformers
par: Guimarães, Heitor R., et autres
Publié: (2025) -
Transient Noise Removal via Diffusion-based Speech Inpainting
par: Moradi, Mordehay, et autres
Publié: (2025) -
A High-Fidelity Speech Super Resolution Network using a Complex Global Attention Module with Spectro-Temporal Loss
par: Tamiti, Tarikul Islam, et autres
Publié: (2025) -
LongCat-AudioDiT: High-Fidelity Diffusion Text-to-Speech in the Waveform Latent Space
par: Xin, Detai, et autres
Publié: (2026)