GOMPSNR: Reflourish the Signal-to-Noise Ratio Metric for Audio Generation Tasks
Fuente:
arXiv
Salvato in:
| Autori principali: | Dai, Lingling, Li, Andong, Chi, Cheng, Liang, Yifan, Li, Xiaodong, Zheng, Chengshi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
NaturalL2S: End-to-End High-quality Multispeaker Lip-to-Speech Synthesis with Differential Digital Signal Processing
di: Liang, Yifan, et al.
Pubblicazione: (2025)
di: Liang, Yifan, et al.
Pubblicazione: (2025)
Neural Vocoders as Speech Enhancers
di: Li, Andong, et al.
Pubblicazione: (2025)
di: Li, Andong, et al.
Pubblicazione: (2025)
Scalable Neural Vocoder from Range-Null Space Decomposition
di: Li, Andong, et al.
Pubblicazione: (2026)
di: Li, Andong, et al.
Pubblicazione: (2026)
Learning Neural Vocoder from Range-Null Space Decomposition
di: Li, Andong, et al.
Pubblicazione: (2025)
di: Li, Andong, et al.
Pubblicazione: (2025)
BridgeVoC: Revitalizing Neural Vocoder from a Restoration Perspective
di: Li, Andong, et al.
Pubblicazione: (2025)
di: Li, Andong, et al.
Pubblicazione: (2025)
End-to-end multi-channel speaker extraction and binaural speech synthesis
di: Chi, Cheng, et al.
Pubblicazione: (2024)
di: Chi, Cheng, et al.
Pubblicazione: (2024)
BSDB-Net: Band-Split Dual-Branch Network with Selective State Spaces Mechanism for Monaural Speech Enhancement
di: Fan, Cunhang, et al.
Pubblicazione: (2024)
di: Fan, Cunhang, et al.
Pubblicazione: (2024)
LTA-L2S: Lexical Tone-Aware Lip-to-Speech Synthesis for Mandarin with Cross-Lingual Transfer Learning
di: Yang, Kang, et al.
Pubblicazione: (2025)
di: Yang, Kang, et al.
Pubblicazione: (2025)
SEE: Signal Embedding Energy for Quantifying Noise Interference in Large Audio Language Models
di: Zhang, Yuanhe, et al.
Pubblicazione: (2026)
di: Zhang, Yuanhe, et al.
Pubblicazione: (2026)
Gradient weighting for speaker verification in extremely low Signal-to-Noise Ratio
di: Ma, Yi, et al.
Pubblicazione: (2024)
di: Ma, Yi, et al.
Pubblicazione: (2024)
Improved Remixing Process for Domain Adaptation-Based Speech Enhancement by Mitigating Data Imbalance in Signal-to-Noise Ratio
di: Li, Li, et al.
Pubblicazione: (2024)
di: Li, Li, et al.
Pubblicazione: (2024)
Noise-to-mask Ratio Loss for Deep Neural Network based Audio Watermarking
di: Moritz, Martin, et al.
Pubblicazione: (2024)
di: Moritz, Martin, et al.
Pubblicazione: (2024)
Deep Learning for Personalized Binaural Audio Reproduction
di: Lu, Xikun, et al.
Pubblicazione: (2025)
di: Lu, Xikun, et al.
Pubblicazione: (2025)
FoleySpace: Vision-Aligned Binaural Spatial Audio Generation
di: Zhao, Lei, et al.
Pubblicazione: (2025)
di: Zhao, Lei, et al.
Pubblicazione: (2025)
Rethinking the joint estimation of magnitude and phase for time-frequency domain neural vocoders
di: Dai, Lingling, et al.
Pubblicazione: (2025)
di: Dai, Lingling, et al.
Pubblicazione: (2025)
SLD-L2S: Hierarchical Subspace Latent Diffusion for High-Fidelity Lip to Speech Synthesis
di: Liang, Yifan, et al.
Pubblicazione: (2026)
di: Liang, Yifan, et al.
Pubblicazione: (2026)
Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text
di: Mei, Jiahao, et al.
Pubblicazione: (2026)
di: Mei, Jiahao, et al.
Pubblicazione: (2026)
Global Rotation Equivariant Phase Modeling for Speech Enhancement with Deep Magnitude-Phase Interaction
di: Wang, Chengzhong, et al.
Pubblicazione: (2026)
di: Wang, Chengzhong, et al.
Pubblicazione: (2026)
SemanticAudio: Audio Generation and Editing in Semantic Space
di: Dai, Zheqi, et al.
Pubblicazione: (2026)
di: Dai, Zheqi, et al.
Pubblicazione: (2026)
UniTok-Audio: A Unified Audio Generation Framework via Generative Modeling on Discrete Codec Tokens
di: Liu, Chengwei, et al.
Pubblicazione: (2025)
di: Liu, Chengwei, et al.
Pubblicazione: (2025)
Synaspot: A Lightweight, Streaming Multi-modal Framework for Keyword Spotting with Audio-Text Synergy
di: Li, Kewei, et al.
Pubblicazione: (2025)
di: Li, Kewei, et al.
Pubblicazione: (2025)
MeanAudio: Fast and Faithful Text-to-Audio Generation with Mean Flows
di: Li, Xiquan, et al.
Pubblicazione: (2025)
di: Li, Xiquan, et al.
Pubblicazione: (2025)
High-Fidelity Generative Audio Compression at 0.275kbps
di: Ma, Hao, et al.
Pubblicazione: (2026)
di: Ma, Hao, et al.
Pubblicazione: (2026)
AudioMoG: Guiding Audio Generation with Mixture-of-Guidance
di: Wang, Junyou, et al.
Pubblicazione: (2025)
di: Wang, Junyou, et al.
Pubblicazione: (2025)
AudioRAG+: Feedback-driven Retrieval-augmented Audio Generation with Large Audio Language Models
di: Zhao, Junqi, et al.
Pubblicazione: (2025)
di: Zhao, Junqi, et al.
Pubblicazione: (2025)
AudioGS: Spectrogram-Based Audio Gaussian Splatting for Sound Field Reconstruction
di: Bi, Chunhao, et al.
Pubblicazione: (2026)
di: Bi, Chunhao, et al.
Pubblicazione: (2026)
Evaluating Objective Speech Quality Metrics for Neural Audio Codecs
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025)
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025)
SMRU: Split-and-Merge Recurrent-based UNet for Acoustic Echo Cancellation and Noise Suppression
di: Sun, Zhihang, et al.
Pubblicazione: (2024)
di: Sun, Zhihang, et al.
Pubblicazione: (2024)
Focus Then Listen: Exploring Plug-and-Play Audio Enhancer for Noise-Robust Large Audio Language Models
di: Yin, Han, et al.
Pubblicazione: (2026)
di: Yin, Han, et al.
Pubblicazione: (2026)
A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook
di: Luo, Kaiwen, et al.
Pubblicazione: (2026)
di: Luo, Kaiwen, et al.
Pubblicazione: (2026)
AudioFab: Building A General and Intelligent Audio Factory through Tool Learning
di: Zhu, Cheng, et al.
Pubblicazione: (2025)
di: Zhu, Cheng, et al.
Pubblicazione: (2025)
Noisereduce: Domain General Noise Reduction for Time Series Signals
di: Sainburg, Tim, et al.
Pubblicazione: (2024)
di: Sainburg, Tim, et al.
Pubblicazione: (2024)
AudioLCM: Text-to-Audio Generation with Latent Consistency Models
di: Liu, Huadai, et al.
Pubblicazione: (2024)
di: Liu, Huadai, et al.
Pubblicazione: (2024)
ChronosAudio: A Comprehensive Long-Audio Benchmark for Evaluating Audio-Large Language Models
di: Luo, Kaiwen, et al.
Pubblicazione: (2026)
di: Luo, Kaiwen, et al.
Pubblicazione: (2026)
When Audio Generators Become Good Listeners: Generative Features for Understanding Tasks
di: Xie, Zeyu, et al.
Pubblicazione: (2025)
di: Xie, Zeyu, et al.
Pubblicazione: (2025)
Resonate: Reinforcing Text-to-Audio Generation via Online Feedback from Large Audio Language Models
di: Li, Xiquan, et al.
Pubblicazione: (2026)
di: Li, Xiquan, et al.
Pubblicazione: (2026)
UniFlow-Audio: Unified Flow Matching for Audio Generation from Omni-Modalities
di: Xu, Xuenan, et al.
Pubblicazione: (2025)
di: Xu, Xuenan, et al.
Pubblicazione: (2025)
The Rarity of Musical Audio Signals Within the Space of Possible Audio Generation
di: Collins, Nick
Pubblicazione: (2024)
di: Collins, Nick
Pubblicazione: (2024)
Pengi: An Audio Language Model for Audio Tasks
di: Deshmukh, Soham, et al.
Pubblicazione: (2023)
di: Deshmukh, Soham, et al.
Pubblicazione: (2023)
Ti-Audio: The First Multi-Dialectal End-to-End Speech LLM for Tibetan
di: Wang, Jialing, et al.
Pubblicazione: (2026)
di: Wang, Jialing, et al.
Pubblicazione: (2026)
Documenti analoghi
-
NaturalL2S: End-to-End High-quality Multispeaker Lip-to-Speech Synthesis with Differential Digital Signal Processing
di: Liang, Yifan, et al.
Pubblicazione: (2025) -
Neural Vocoders as Speech Enhancers
di: Li, Andong, et al.
Pubblicazione: (2025) -
Scalable Neural Vocoder from Range-Null Space Decomposition
di: Li, Andong, et al.
Pubblicazione: (2026) -
Learning Neural Vocoder from Range-Null Space Decomposition
di: Li, Andong, et al.
Pubblicazione: (2025) -
BridgeVoC: Revitalizing Neural Vocoder from a Restoration Perspective
di: Li, Andong, et al.
Pubblicazione: (2025)