STFTCodec: High-Fidelity Audio Compression through Time-Frequency Domain Representation
Fuente:
arXiv
Guardado en:
| Autores principales: | Feng, Tao, Zhao, Zhiyuan, Xie, Yifan, Ye, Yuqi, Luo, Xiangyang, Guan, Xun, Li, Yu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
High-Fidelity Generative Audio Compression at 0.275kbps
por: Ma, Hao, et al.
Publicado: (2026)
por: Ma, Hao, et al.
Publicado: (2026)
Audio Inpainting in Time-Frequency Domain with Phase-Aware Prior
por: Balušík, Peter, et al.
Publicado: (2026)
por: Balušík, Peter, et al.
Publicado: (2026)
An Investigation of Time-Frequency Representation Discriminators for High-Fidelity Vocoder
por: Gu, Yicheng, et al.
Publicado: (2024)
por: Gu, Yicheng, et al.
Publicado: (2024)
FlashAudio: Rectified Flows for Fast and High-Fidelity Text-to-Audio Generation
por: Liu, Huadai, et al.
Publicado: (2024)
por: Liu, Huadai, et al.
Publicado: (2024)
AudioGAN: A Compact and Efficient Framework for Real-Time High-Fidelity Text-to-Audio Generation
por: Chung, HaeChun
Publicado: (2025)
por: Chung, HaeChun
Publicado: (2025)
MelTok: 2D Tokenization for Single-Codebook Audio Compression
por: Li, Jingyi, et al.
Publicado: (2025)
por: Li, Jingyi, et al.
Publicado: (2025)
APCodec+: A Spectrum-Coding-Based High-Fidelity and High-Compression-Rate Neural Audio Codec with Staged Training Paradigm
por: Du, Hui-Peng, et al.
Publicado: (2024)
por: Du, Hui-Peng, et al.
Publicado: (2024)
HILCodec: High-Fidelity and Lightweight Neural Audio Codec
por: Ahn, Sunghwan, et al.
Publicado: (2024)
por: Ahn, Sunghwan, et al.
Publicado: (2024)
LEMAS: Large A 150K-Hour Large-scale Extensible Multilingual Audio Suite with Generative Speech Models
por: Zhao, Zhiyuan, et al.
Publicado: (2026)
por: Zhao, Zhiyuan, et al.
Publicado: (2026)
UniSync: A Unified Framework for Audio-Visual Synchronization
por: Feng, Tao, et al.
Publicado: (2025)
por: Feng, Tao, et al.
Publicado: (2025)
SwitchCodec: A High-Fidelity Nerual Audio Codec With Sparse Quantization
por: Wang, Jin, et al.
Publicado: (2025)
por: Wang, Jin, et al.
Publicado: (2025)
SONAR: Self-Distilled Continual Pre-training for Domain Adaptive Audio Representation
por: Zhang, Yizhou, et al.
Publicado: (2025)
por: Zhang, Yizhou, et al.
Publicado: (2025)
Janssen 2.0: Audio Inpainting in the Time-frequency Domain
por: Mokrý, Ondřej, et al.
Publicado: (2024)
por: Mokrý, Ondřej, et al.
Publicado: (2024)
LongCat-AudioDiT: High-Fidelity Diffusion Text-to-Speech in the Waveform Latent Space
por: Xin, Detai, et al.
Publicado: (2026)
por: Xin, Detai, et al.
Publicado: (2026)
Audio Signal Processing Using Time Domain Mel-Frequency Wavelet Coefficient
por: Sebastian, Rinku, et al.
Publicado: (2025)
por: Sebastian, Rinku, et al.
Publicado: (2025)
Discrete Audio Representations for Automated Audio Captioning
por: Tian, Jingguang, et al.
Publicado: (2025)
por: Tian, Jingguang, et al.
Publicado: (2025)
Robust Lossy Audio Compression Identification
por: Koops, Hendrik Vincent, et al.
Publicado: (2024)
por: Koops, Hendrik Vincent, et al.
Publicado: (2024)
ASAudio: A Survey of Advanced Spatial Audio Research
por: Zhu, Zhiyuan, et al.
Publicado: (2025)
por: Zhu, Zhiyuan, et al.
Publicado: (2025)
As Good as It KAN Get: High-Fidelity Audio Representation
por: Marszałek, Patryk, et al.
Publicado: (2025)
por: Marszałek, Patryk, et al.
Publicado: (2025)
MART: Learning Hierarchical Music Audio Representations with Part-Whole Transformer
por: Yao, Dong, et al.
Publicado: (2023)
por: Yao, Dong, et al.
Publicado: (2023)
Compositional Audio Representation Learning
por: Sridhar, Sripathi, et al.
Publicado: (2024)
por: Sridhar, Sripathi, et al.
Publicado: (2024)
Audio Fingerprinting with Holographic Reduced Representations
por: Fujita, Yusuke, et al.
Publicado: (2024)
por: Fujita, Yusuke, et al.
Publicado: (2024)
VQTTS: High-Fidelity Text-to-Speech Synthesis with Self-Supervised VQ Acoustic Feature
por: Du, Chenpeng, et al.
Publicado: (2022)
por: Du, Chenpeng, et al.
Publicado: (2022)
Representation-Regularized Convolutional Audio Transformer for Audio Understanding
por: Han, Bing, et al.
Publicado: (2026)
por: Han, Bing, et al.
Publicado: (2026)
Audios Don't Lie: Multi-Frequency Channel Attention Mechanism for Audio Deepfake Detection
por: Feng, Yangguang
Publicado: (2024)
por: Feng, Yangguang
Publicado: (2024)
Robust Audio Tagging under Class-wise Supervision Unreliability
por: Hou, Yuanbo, et al.
Publicado: (2026)
por: Hou, Yuanbo, et al.
Publicado: (2026)
Domain Adaptation for Contrastive Audio-Language Models
por: Deshmukh, Soham, et al.
Publicado: (2024)
por: Deshmukh, Soham, et al.
Publicado: (2024)
CosyAudio: Improving Audio Generation with Confidence Scores and Synthetic Captions
por: Zhu, Xinfa, et al.
Publicado: (2025)
por: Zhu, Xinfa, et al.
Publicado: (2025)
High-Fidelity Speech Enhancement via Discrete Audio Tokens
por: Lanzendörfer, Luca A., et al.
Publicado: (2025)
por: Lanzendörfer, Luca A., et al.
Publicado: (2025)
Model-Guided Dual-Role Alignment for High-Fidelity Open-Domain Video-to-Audio Generation
por: Zhang, Kang, et al.
Publicado: (2025)
por: Zhang, Kang, et al.
Publicado: (2025)
High-Fidelity Neural Phonetic Posteriorgrams
por: Churchwell, Cameron, et al.
Publicado: (2024)
por: Churchwell, Cameron, et al.
Publicado: (2024)
ComplexDec: A Domain-robust High-fidelity Neural Audio Codec with Complex Spectrum Modeling
por: Wu, Yi-Chiao, et al.
Publicado: (2025)
por: Wu, Yi-Chiao, et al.
Publicado: (2025)
PointTalk: Audio-Driven Dynamic Lip Point Cloud for 3D Gaussian-based Talking Head Synthesis
por: Xie, Yifan, et al.
Publicado: (2024)
por: Xie, Yifan, et al.
Publicado: (2024)
FRCRN: Boosting Feature Representation using Frequency Recurrence for Monaural Speech Enhancement
por: Zhao, Shengkui, et al.
Publicado: (2022)
por: Zhao, Shengkui, et al.
Publicado: (2022)
Natural Language Supervision for General-Purpose Audio Representations
por: Elizalde, Benjamin, et al.
Publicado: (2023)
por: Elizalde, Benjamin, et al.
Publicado: (2023)
Assessing the Alignment of Audio Representations with Timbre Similarity Ratings
por: Tian, Haokun, et al.
Publicado: (2025)
por: Tian, Haokun, et al.
Publicado: (2025)
InstructSing: High-Fidelity Singing Voice Generation via Instructing Yourself
por: Zeng, Chang, et al.
Publicado: (2024)
por: Zeng, Chang, et al.
Publicado: (2024)
A Frequency-aware Augmentation Network for Mental Disorders Assessment from Audio
por: Li, Shuanglin, et al.
Publicado: (2025)
por: Li, Shuanglin, et al.
Publicado: (2025)
LongCat-Audio-Codec: An Audio Tokenizer and Detokenizer Solution Designed for Speech Large Language Models
por: Zhao, Xiaohan, et al.
Publicado: (2025)
por: Zhao, Xiaohan, et al.
Publicado: (2025)
HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation
por: Shan, Sizhe, et al.
Publicado: (2025)
por: Shan, Sizhe, et al.
Publicado: (2025)
Ejemplares similares
-
High-Fidelity Generative Audio Compression at 0.275kbps
por: Ma, Hao, et al.
Publicado: (2026) -
Audio Inpainting in Time-Frequency Domain with Phase-Aware Prior
por: Balušík, Peter, et al.
Publicado: (2026) -
An Investigation of Time-Frequency Representation Discriminators for High-Fidelity Vocoder
por: Gu, Yicheng, et al.
Publicado: (2024) -
FlashAudio: Rectified Flows for Fast and High-Fidelity Text-to-Audio Generation
por: Liu, Huadai, et al.
Publicado: (2024) -
AudioGAN: A Compact and Efficient Framework for Real-Time High-Fidelity Text-to-Audio Generation
por: Chung, HaeChun
Publicado: (2025)