STSR: High-Fidelity Speech Super-Resolution via Spectral-Transient Context Modeling
Fuente:
arXiv
Guardado en:
| Autores principales: | Yuan, Jiajun, Wang, Xiaochen, Xiao, Yuhang, Wu, Yulin, Hu, Chenhao, Lv, Xueyang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
HiFi-SR: A Unified Generative Transformer-Convolutional Adversarial Network for High-Fidelity Speech Super-Resolution
por: Zhao, Shengkui, et al.
Publicado: (2025)
por: Zhao, Shengkui, et al.
Publicado: (2025)
DiTSE: High-Fidelity Generative Speech Enhancement via Latent Diffusion Transformers
por: Guimarães, Heitor R., et al.
Publicado: (2025)
por: Guimarães, Heitor R., et al.
Publicado: (2025)
Transient Noise Removal via Diffusion-based Speech Inpainting
por: Moradi, Mordehay, et al.
Publicado: (2025)
por: Moradi, Mordehay, et al.
Publicado: (2025)
A High-Fidelity Speech Super Resolution Network using a Complex Global Attention Module with Spectro-Temporal Loss
por: Tamiti, Tarikul Islam, et al.
Publicado: (2025)
por: Tamiti, Tarikul Islam, et al.
Publicado: (2025)
LongCat-AudioDiT: High-Fidelity Diffusion Text-to-Speech in the Waveform Latent Space
por: Xin, Detai, et al.
Publicado: (2026)
por: Xin, Detai, et al.
Publicado: (2026)
MobileSpeech: A Fast and High-Fidelity Framework for Mobile Zero-Shot Text-to-Speech
por: Ji, Shengpeng, et al.
Publicado: (2024)
por: Ji, Shengpeng, et al.
Publicado: (2024)
Conditioning and Sampling in Variational Diffusion Models for Speech Super-Resolution
por: Yu, Chin-Yun, et al.
Publicado: (2022)
por: Yu, Chin-Yun, et al.
Publicado: (2022)
Seeing the Context: Rich Visual Context-Aware Speech Recognition via Multimodal Reasoning
por: Tian, Wenjie, et al.
Publicado: (2026)
por: Tian, Wenjie, et al.
Publicado: (2026)
Long-Context Speech Synthesis with Context-Aware Memory
por: Li, Zhipeng, et al.
Publicado: (2025)
por: Li, Zhipeng, et al.
Publicado: (2025)
VQTTS: High-Fidelity Text-to-Speech Synthesis with Self-Supervised VQ Acoustic Feature
por: Du, Chenpeng, et al.
Publicado: (2022)
por: Du, Chenpeng, et al.
Publicado: (2022)
ConSinger: Efficient High-Fidelity Singing Voice Generation with Minimal Steps
por: Song, Yulin, et al.
Publicado: (2024)
por: Song, Yulin, et al.
Publicado: (2024)
SuperCodec: A Neural Speech Codec with Selective Back-Projection Network
por: Zheng, Youqiang, et al.
Publicado: (2024)
por: Zheng, Youqiang, et al.
Publicado: (2024)
Spectral Masking with Explicit Time-Context Windowing for Neural Network-Based Monaural Speech Enhancement
por: Fiorio, Luan Vinícius, et al.
Publicado: (2024)
por: Fiorio, Luan Vinícius, et al.
Publicado: (2024)
Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition
por: Bai, Ye, et al.
Publicado: (2024)
por: Bai, Ye, et al.
Publicado: (2024)
High-Fidelity Simultaneous Speech-To-Speech Translation
por: Labiausse, Tom, et al.
Publicado: (2025)
por: Labiausse, Tom, et al.
Publicado: (2025)
Leveraging Joint Spectral and Spatial Learning with MAMBA for Multichannel Speech Enhancement
por: Ren, Wenze, et al.
Publicado: (2024)
por: Ren, Wenze, et al.
Publicado: (2024)
High-Fidelity Speech Enhancement via Discrete Audio Tokens
por: Lanzendörfer, Luca A., et al.
Publicado: (2025)
por: Lanzendörfer, Luca A., et al.
Publicado: (2025)
Combined Generative and Predictive Modeling for Speech Super-resolution
por: Wang, Heming, et al.
Publicado: (2024)
por: Wang, Heming, et al.
Publicado: (2024)
High-Fidelity Generative Audio Compression at 0.275kbps
por: Ma, Hao, et al.
Publicado: (2026)
por: Ma, Hao, et al.
Publicado: (2026)
Wave-U-Mamba: An End-To-End Framework For High-Quality And Efficient Speech Super Resolution
por: Lee, Yongjoon, et al.
Publicado: (2024)
por: Lee, Yongjoon, et al.
Publicado: (2024)
Towards High-Fidelity and Controllable Bioacoustic Generation via Enhanced Diffusion Learning
por: Song, Tianyu, et al.
Publicado: (2025)
por: Song, Tianyu, et al.
Publicado: (2025)
InstructSing: High-Fidelity Singing Voice Generation via Instructing Yourself
por: Zeng, Chang, et al.
Publicado: (2024)
por: Zeng, Chang, et al.
Publicado: (2024)
High-Fidelity Neural Phonetic Posteriorgrams
por: Churchwell, Cameron, et al.
Publicado: (2024)
por: Churchwell, Cameron, et al.
Publicado: (2024)
Efficient Long-Form Speech Recognition for General Speech In-Context Learning
por: Yen, Hao, et al.
Publicado: (2024)
por: Yen, Hao, et al.
Publicado: (2024)
FLY-TTS: Fast, Lightweight and High-Quality End-to-End Text-to-Speech Synthesis
por: Guo, Yinlin, et al.
Publicado: (2024)
por: Guo, Yinlin, et al.
Publicado: (2024)
Ambisonics Super-Resolution Using A Waveform-Domain Neural Network
por: Nawfal, Ismael, et al.
Publicado: (2025)
por: Nawfal, Ismael, et al.
Publicado: (2025)
Speech-Mamba: Long-Context Speech Recognition with Selective State Spaces Models
por: Gao, Xiaoxue, et al.
Publicado: (2024)
por: Gao, Xiaoxue, et al.
Publicado: (2024)
High Fidelity Text-Guided Music Editing via Single-Stage Flow Matching
por: Lan, Gael Le, et al.
Publicado: (2024)
por: Lan, Gael Le, et al.
Publicado: (2024)
CogSR: Semantic-Aware Speech Super-Resolution via Chain-of-Thought Guided Flow Matching
por: Yuan, Jiajun, et al.
Publicado: (2025)
por: Yuan, Jiajun, et al.
Publicado: (2025)
Advancing Electrolaryngeal Speech Enhancement Through Speech-Text Representation Learning
por: Ma, Ding, et al.
Publicado: (2026)
por: Ma, Ding, et al.
Publicado: (2026)
Phone-purity Guided Discrete Tokens for Dysarthric Speech Recognition
por: Wang, Huimeng, et al.
Publicado: (2025)
por: Wang, Huimeng, et al.
Publicado: (2025)
Phase Repair for Time-Domain Convolutional Neural Networks in Music Super-Resolution
por: Zhang, Yenan, et al.
Publicado: (2023)
por: Zhang, Yenan, et al.
Publicado: (2023)
DENSE: Dynamic Embedding Causal Target Speech Extraction
por: Wang, Yiwen, et al.
Publicado: (2024)
por: Wang, Yiwen, et al.
Publicado: (2024)
DualSpeech: Enhancing Speaker-Fidelity and Text-Intelligibility Through Dual Classifier-Free Guidance
por: Yang, Jinhyeok, et al.
Publicado: (2024)
por: Yang, Jinhyeok, et al.
Publicado: (2024)
DualSpeechLM: Towards Unified Speech Understanding and Generation via Dual Speech Token Modeling with Large Language Models
por: Wang, Yuanyuan, et al.
Publicado: (2025)
por: Wang, Yuanyuan, et al.
Publicado: (2025)
CosyEdit: Unlocking End-to-End Speech Editing Capability from Zero-Shot Text-to-Speech Models
por: Chen, Junyang, et al.
Publicado: (2026)
por: Chen, Junyang, et al.
Publicado: (2026)
HILCodec: High-Fidelity and Lightweight Neural Audio Codec
por: Ahn, Sunghwan, et al.
Publicado: (2024)
por: Ahn, Sunghwan, et al.
Publicado: (2024)
Vision-Integrated High-Quality Neural Speech Coding
por: Guo, Yao, et al.
Publicado: (2025)
por: Guo, Yao, et al.
Publicado: (2025)
Hierarchical Decoding for Discrete Speech Synthesis with Multi-Resolution Spoof Detection
por: Zhao, Junchuan, et al.
Publicado: (2026)
por: Zhao, Junchuan, et al.
Publicado: (2026)
HiFi-Glot: High-Fidelity Neural Formant Synthesis with Differentiable Resonant Filters
por: Gu, Yicheng, et al.
Publicado: (2024)
por: Gu, Yicheng, et al.
Publicado: (2024)
Ejemplares similares
-
HiFi-SR: A Unified Generative Transformer-Convolutional Adversarial Network for High-Fidelity Speech Super-Resolution
por: Zhao, Shengkui, et al.
Publicado: (2025) -
DiTSE: High-Fidelity Generative Speech Enhancement via Latent Diffusion Transformers
por: Guimarães, Heitor R., et al.
Publicado: (2025) -
Transient Noise Removal via Diffusion-based Speech Inpainting
por: Moradi, Mordehay, et al.
Publicado: (2025) -
A High-Fidelity Speech Super Resolution Network using a Complex Global Attention Module with Spectro-Temporal Loss
por: Tamiti, Tarikul Islam, et al.
Publicado: (2025) -
LongCat-AudioDiT: High-Fidelity Diffusion Text-to-Speech in the Waveform Latent Space
por: Xin, Detai, et al.
Publicado: (2026)