RFWave: Multi-band Rectified Flow for Audio Waveform Reconstruction
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Peng, Dai, Dongyang, Wu, Zhiyong |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion
par: Zhao, Junqi, et autres
Publié: (2025)
par: Zhao, Junqi, et autres
Publié: (2025)
learning discriminative features from spectrograms using center loss for speech emotion recognition
par: Dai, Dongyang, et autres
Publié: (2025)
par: Dai, Dongyang, et autres
Publié: (2025)
Robust Audio Anti-Spoofing with Fusion-Reconstruction Learning on Multi-Order Spectrograms
par: Wen, Penghui, et autres
Publié: (2023)
par: Wen, Penghui, et autres
Publié: (2023)
Disambiguation of Chinese Polyphones in an End-to-End Framework with Semantic Features Extracted by Pre-trained BERT
par: Dai, Dongyang, et autres
Publié: (2025)
par: Dai, Dongyang, et autres
Publié: (2025)
LoSATok: Low-dimensional Semantic-Acoustic Tokenizer for Cross-Domain Audio Understanding and Generation
par: Zhang, Zhisheng, et autres
Publié: (2026)
par: Zhang, Zhisheng, et autres
Publié: (2026)
FlashAudio: Rectified Flows for Fast and High-Fidelity Text-to-Audio Generation
par: Liu, Huadai, et autres
Publié: (2024)
par: Liu, Huadai, et autres
Publié: (2024)
SLAP: Scalable Language-Audio Pretraining with Variable-Duration Audio and Multi-Objective Training
par: Mei, Xinhao, et autres
Publié: (2026)
par: Mei, Xinhao, et autres
Publié: (2026)
Does Current Deepfake Audio Detection Model Effectively Detect ALM-based Deepfake Audio?
par: Xie, Yuankun, et autres
Publié: (2024)
par: Xie, Yuankun, et autres
Publié: (2024)
Codecfake: An Initial Dataset for Detecting LLM-based Deepfake Audio
par: Lu, Yi, et autres
Publié: (2024)
par: Lu, Yi, et autres
Publié: (2024)
MD-ViSCo: A Unified Model for Multi-Directional Vital Sign Waveform Conversion
par: Meyer, Franck, et autres
Publié: (2025)
par: Meyer, Franck, et autres
Publié: (2025)
Prior-agnostic Multi-scale Contrastive Text-Audio Pre-training for Parallelized TTS Frontend Modeling
par: Wang, Quanxiu, et autres
Publié: (2024)
par: Wang, Quanxiu, et autres
Publié: (2024)
The Codecfake Dataset and Countermeasures for the Universally Detection of Deepfake Audio
par: Xie, Yuankun, et autres
Publié: (2024)
par: Xie, Yuankun, et autres
Publié: (2024)
Go witheFlow: Real-time Emotion Driven Audio Effects Modulation
par: Dervakos, Edmund, et autres
Publié: (2025)
par: Dervakos, Edmund, et autres
Publié: (2025)
DreamAudio: Customized Text-to-Audio Generation with Diffusion Models
par: Yuan, Yi, et autres
Publié: (2025)
par: Yuan, Yi, et autres
Publié: (2025)
In-the-wild Audio Spatialization with Flexible Text-guided Localization
par: Pan, Tianrui, et autres
Publié: (2025)
par: Pan, Tianrui, et autres
Publié: (2025)
Generalized Source Tracing: Detecting Novel Audio Deepfake Algorithm with Real Emphasis and Fake Dispersion Strategy
par: Xie, Yuankun, et autres
Publié: (2024)
par: Xie, Yuankun, et autres
Publié: (2024)
Exploiting Audio-Visual Features with Pretrained AV-HuBERT for Multi-Modal Dysarthric Speech Reconstruction
par: Chen, Xueyuan, et autres
Publié: (2024)
par: Chen, Xueyuan, et autres
Publié: (2024)
Retrieval-Augmented Audio Deepfake Detection
par: Kang, Zuheng, et autres
Publié: (2024)
par: Kang, Zuheng, et autres
Publié: (2024)
SongBench: A Fine-Grained Multi-Aspect Benchmark for Song Quality Assessment
par: Wu, Dapeng, et autres
Publié: (2026)
par: Wu, Dapeng, et autres
Publié: (2026)
Spatial-Aware Conditioned Fusion for Audio-Visual Navigation
par: Wu, Shaohang, et autres
Publié: (2026)
par: Wu, Shaohang, et autres
Publié: (2026)
Audio Mamba: Pretrained Audio State Space Model For Audio Tagging
par: Lin, Jiaju, et autres
Publié: (2024)
par: Lin, Jiaju, et autres
Publié: (2024)
UltraEval-Audio: A Unified Framework for Comprehensive Evaluation of Audio Foundation Models
par: Shi, Qundong, et autres
Publié: (2026)
par: Shi, Qundong, et autres
Publié: (2026)
MAT-SED: A Masked Audio Transformer with Masked-Reconstruction Based Pre-training for Sound Event Detection
par: Cai, Pengfei, et autres
Publié: (2024)
par: Cai, Pengfei, et autres
Publié: (2024)
MFAAN: Unveiling Audio Deepfakes with a Multi-Feature Authenticity Network
par: Krishnan, Karthik Sivarama, et autres
Publié: (2023)
par: Krishnan, Karthik Sivarama, et autres
Publié: (2023)
Multi-Speaker Conversational Audio Deepfake: Taxonomy, Dataset and Pilot Study
par: Ahmed, Alabi, et autres
Publié: (2026)
par: Ahmed, Alabi, et autres
Publié: (2026)
Audio Atlas: Visualizing and Exploring Audio Datasets
par: Lanzendörfer, Luca A., et autres
Publié: (2024)
par: Lanzendörfer, Luca A., et autres
Publié: (2024)
Representation-Regularized Convolutional Audio Transformer for Audio Understanding
par: Han, Bing, et autres
Publié: (2026)
par: Han, Bing, et autres
Publié: (2026)
Audio Spatially-Guided Fusion for Audio-Visual Navigation
par: Zhou, Xinyu, et autres
Publié: (2026)
par: Zhou, Xinyu, et autres
Publié: (2026)
AND: Audio Network Dissection for Interpreting Deep Acoustic Models
par: Wu, Tung-Yu, et autres
Publié: (2024)
par: Wu, Tung-Yu, et autres
Publié: (2024)
EnCLAP: Combining Neural Audio Codec and Audio-Text Joint Embedding for Automated Audio Captioning
par: Kim, Jaeyeon, et autres
Publié: (2024)
par: Kim, Jaeyeon, et autres
Publié: (2024)
Multi-view MidiVAE: Fusing Track- and Bar-view Representations for Long Multi-track Symbolic Music Generation
par: Lin, Zhiwei, et autres
Publié: (2024)
par: Lin, Zhiwei, et autres
Publié: (2024)
DSFlow: Dual Supervision and Step-Aware Architecture for One-Step Flow Matching Speech Synthesis
par: Lin, Bin, et autres
Publié: (2026)
par: Lin, Bin, et autres
Publié: (2026)
Reliability-Aware Geometric Fusion for Robust Audio-Visual Navigation
par: Liu, Teng, et autres
Publié: (2026)
par: Liu, Teng, et autres
Publié: (2026)
Audio Mamba: Bidirectional State Space Model for Audio Representation Learning
par: Erol, Mehmet Hamza, et autres
Publié: (2024)
par: Erol, Mehmet Hamza, et autres
Publié: (2024)
Audio Mamba: Selective State Spaces for Self-Supervised Audio Representations
par: Yadav, Sarthak, et autres
Publié: (2024)
par: Yadav, Sarthak, et autres
Publié: (2024)
When Scaling Fails: Mitigating Audio Perception Decay of LALMs via Multi-Step Perception-Aware Reasoning
par: Mao, Ruixiang, et autres
Publié: (2026)
par: Mao, Ruixiang, et autres
Publié: (2026)
AudioScene: Integrating Object-Event Audio into 3D Scenes
par: Yuan, Shuaihang, et autres
Publié: (2025)
par: Yuan, Shuaihang, et autres
Publié: (2025)
PeriodWave: Multi-Period Flow Matching for High-Fidelity Waveform Generation
par: Lee, Sang-Hoon, et autres
Publié: (2024)
par: Lee, Sang-Hoon, et autres
Publié: (2024)
HyperPotter: Spell the Charm of High-Order Interactions in Audio Deepfake Detection
par: Wen, Qing, et autres
Publié: (2026)
par: Wen, Qing, et autres
Publié: (2026)
MLCA-AVSR: Multi-Layer Cross Attention Fusion based Audio-Visual Speech Recognition
par: Wang, He, et autres
Publié: (2024)
par: Wang, He, et autres
Publié: (2024)
Documents similaires
-
AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion
par: Zhao, Junqi, et autres
Publié: (2025) -
learning discriminative features from spectrograms using center loss for speech emotion recognition
par: Dai, Dongyang, et autres
Publié: (2025) -
Robust Audio Anti-Spoofing with Fusion-Reconstruction Learning on Multi-Order Spectrograms
par: Wen, Penghui, et autres
Publié: (2023) -
Disambiguation of Chinese Polyphones in an End-to-End Framework with Semantic Features Extracted by Pre-trained BERT
par: Dai, Dongyang, et autres
Publié: (2025) -
LoSATok: Low-dimensional Semantic-Acoustic Tokenizer for Cross-Domain Audio Understanding and Generation
par: Zhang, Zhisheng, et autres
Publié: (2026)