ImmersiveFlow: Stereo-to-7.1.4 spatial audio generation with flow matching
Fuente:
arXiv
Guardado en:
| Autores principales: | Liang, Zining, Wang, Runbang, Ye, Xuzhou, Kong, Qiuqiang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ARCHI-TTS: A flow-matching-based Text-to-Speech Model with Self-supervised Semantic Aligner and Accelerated Inference
por: Wu, Chunyat, et al.
Publicado: (2026)
por: Wu, Chunyat, et al.
Publicado: (2026)
STASE: A spatialized text-to-audio synthesis engine for music generation
por: Chi, Tutti, et al.
Publicado: (2025)
por: Chi, Tutti, et al.
Publicado: (2025)
Visual-based spatial audio generation system for multi-speaker environments
por: Liu, Xiaojing, et al.
Publicado: (2025)
por: Liu, Xiaojing, et al.
Publicado: (2025)
Towards Out-of-Distribution Detection in Vocoder Recognition via Latent Feature Reconstruction
por: Du, Renmingyue, et al.
Publicado: (2024)
por: Du, Renmingyue, et al.
Publicado: (2024)
SCORE: Scaling audio generation using Standardized COmposite REwards
por: Jung, Jaemin, et al.
Publicado: (2025)
por: Jung, Jaemin, et al.
Publicado: (2025)
Voice Timbre Attribute Detection with Compact and Interpretable Training-Free Acoustic Parameters
por: Chiu, Aemon Yat Fei, et al.
Publicado: (2026)
por: Chiu, Aemon Yat Fei, et al.
Publicado: (2026)
CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis
por: Wu, Chun Yat, et al.
Publicado: (2025)
por: Wu, Chun Yat, et al.
Publicado: (2025)
SF-Flow: Sound field magnitude estimation via flow matching guided by sparse measurements
por: Erdem, Ege, et al.
Publicado: (2026)
por: Erdem, Ege, et al.
Publicado: (2026)
Deep learning based spatial aliasing reduction in beamforming for audio capture
por: Guzik, Mateusz, et al.
Publicado: (2025)
por: Guzik, Mateusz, et al.
Publicado: (2025)
AudioMorphix: Training-free audio editing with diffusion probabilistic models
por: Liang, Jinhua, et al.
Publicado: (2025)
por: Liang, Jinhua, et al.
Publicado: (2025)
MusicScore: A Dataset for Music Score Modeling and Generation
por: Lin, Yuheng, et al.
Publicado: (2024)
por: Lin, Yuheng, et al.
Publicado: (2024)
Online incremental learning for audio classification using a pretrained audio model
por: Mulimani, Manjunath, et al.
Publicado: (2025)
por: Mulimani, Manjunath, et al.
Publicado: (2025)
Scaling up masked audio encoder learning for general audio classification
por: Dinkel, Heinrich, et al.
Publicado: (2024)
por: Dinkel, Heinrich, et al.
Publicado: (2024)
Voices of Civilizations: A Multilingual QA Benchmark for Global Music Understanding
por: Wu, Shangda, et al.
Publicado: (2026)
por: Wu, Shangda, et al.
Publicado: (2026)
DashengTokenizer: One layer is enough for unified audio understanding and generation
por: Dinkel, Heinrich, et al.
Publicado: (2026)
por: Dinkel, Heinrich, et al.
Publicado: (2026)
WavCraft: Audio Editing and Generation with Large Language Models
por: Liang, Jinhua, et al.
Publicado: (2024)
por: Liang, Jinhua, et al.
Publicado: (2024)
Multi-level Temporal-channel Speaker Retrieval for Zero-shot Voice Conversion
por: Wang, Zhichao, et al.
Publicado: (2023)
por: Wang, Zhichao, et al.
Publicado: (2023)
Measuring Audio's Impact on Correctness: Audio-Contribution-Aware Post-Training of Large Audio Language Models
por: He, Haolin, et al.
Publicado: (2025)
por: He, Haolin, et al.
Publicado: (2025)
MelTok: 2D Tokenization for Single-Codebook Audio Compression
por: Li, Jingyi, et al.
Publicado: (2025)
por: Li, Jingyi, et al.
Publicado: (2025)
WavLM model ensemble for audio deepfake detection
por: Combei, David, et al.
Publicado: (2024)
por: Combei, David, et al.
Publicado: (2024)
Cryfish: On deep audio analysis with Large Language Models
por: Mitrofanov, Anton, et al.
Publicado: (2025)
por: Mitrofanov, Anton, et al.
Publicado: (2025)
Multiple Hankel matrix rank minimization for audio inpainting
por: Záviška, Pavel, et al.
Publicado: (2023)
por: Záviška, Pavel, et al.
Publicado: (2023)
Positive and negative sampling strategies for self-supervised learning on audio-video data
por: Wang, Shanshan, et al.
Publicado: (2024)
por: Wang, Shanshan, et al.
Publicado: (2024)
Language-Queried Target Sound Extraction Without Parallel Training Data
por: Ma, Hao, et al.
Publicado: (2024)
por: Ma, Hao, et al.
Publicado: (2024)
AEROMamba: An efficient architecture for audio super-resolution using generative adversarial networks and state space models
por: Abreu, Wallace, et al.
Publicado: (2024)
por: Abreu, Wallace, et al.
Publicado: (2024)
Synthetic training set generation using text-to-audio models for environmental sound classification
por: Ronchini, Francesca, et al.
Publicado: (2024)
por: Ronchini, Francesca, et al.
Publicado: (2024)
Selective-Memory Meta-Learning with Environment Representations for Sound Event Localization and Detection
por: Hu, Jinbo, et al.
Publicado: (2023)
por: Hu, Jinbo, et al.
Publicado: (2023)
Improving Stereo 3D Sound Event Localization and Detection: Perceptual Features, Stereo-specific Data Augmentation, and Distance Normalization
por: Yeow, Jun-Wei, et al.
Publicado: (2025)
por: Yeow, Jun-Wei, et al.
Publicado: (2025)
Understanding the strengths and weaknesses of SSL models for audio deepfake model attribution
por: Pîrlogeanu, Gabriel, et al.
Publicado: (2026)
por: Pîrlogeanu, Gabriel, et al.
Publicado: (2026)
Towards predicting binaural audio quality in listeners with normal and impaired hearing
por: Biberger, Thomas, et al.
Publicado: (2025)
por: Biberger, Thomas, et al.
Publicado: (2025)
Sound event detection with audio-text models and heterogeneous temporal annotations
por: Harju, Manu, et al.
Publicado: (2025)
por: Harju, Manu, et al.
Publicado: (2025)
Multi-label audio classification with a noisy zero-shot teacher
por: Braun, Sebastian, et al.
Publicado: (2024)
por: Braun, Sebastian, et al.
Publicado: (2024)
Unmasking real-world audio deepfakes: A data-centric approach
por: Combei, David, et al.
Publicado: (2025)
por: Combei, David, et al.
Publicado: (2025)
A SOUND APPROACH: Using Large Language Models to generate audio descriptions for egocentric text-audio retrieval
por: Oncescu, Andreea-Maria, et al.
Publicado: (2024)
por: Oncescu, Andreea-Maria, et al.
Publicado: (2024)
PitchFlower: A flow-based neural audio codec with pitch controllability
por: Torres, Diego, et al.
Publicado: (2025)
por: Torres, Diego, et al.
Publicado: (2025)
Performance improvement of spatial semantic segmentation with enriched audio features and agent-based error correction for DCASE 2025 Challenge Task 4
por: Park, Jongyeon, et al.
Publicado: (2025)
por: Park, Jongyeon, et al.
Publicado: (2025)
Human perception of audio deepfakes: the role of language and speaking style
por: Segundo, Eugenia San, et al.
Publicado: (2025)
por: Segundo, Eugenia San, et al.
Publicado: (2025)
Training-Free Multi-Step Audio Source Separation
por: Zang, Yongyi, et al.
Publicado: (2025)
por: Zang, Yongyi, et al.
Publicado: (2025)
Piano Transcription by Hierarchical Language Modeling with Pretrained Roll-based Encoders
por: Li, Dichucheng, et al.
Publicado: (2025)
por: Li, Dichucheng, et al.
Publicado: (2025)
Towards audio language modeling -- an overview
por: Wu, Haibin, et al.
Publicado: (2024)
por: Wu, Haibin, et al.
Publicado: (2024)
Ejemplares similares
-
ARCHI-TTS: A flow-matching-based Text-to-Speech Model with Self-supervised Semantic Aligner and Accelerated Inference
por: Wu, Chunyat, et al.
Publicado: (2026) -
STASE: A spatialized text-to-audio synthesis engine for music generation
por: Chi, Tutti, et al.
Publicado: (2025) -
Visual-based spatial audio generation system for multi-speaker environments
por: Liu, Xiaojing, et al.
Publicado: (2025) -
Towards Out-of-Distribution Detection in Vocoder Recognition via Latent Feature Reconstruction
por: Du, Renmingyue, et al.
Publicado: (2024) -
SCORE: Scaling audio generation using Standardized COmposite REwards
por: Jung, Jaemin, et al.
Publicado: (2025)