DynFOA: Generating First-Order Ambisonics with Conditional Diffusion for Dynamic and Acoustically Complex 360-Degree Videos
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Luo, Ziyu, Chen, Lin, Qu, Qiang, Chen, Xiaoming, Shen, Yiran |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DynFOA: Generating First-Order Ambisonics with Conditional Diffusion for Dynamic and Acoustically Complex 360-Degree Videos
par: Luo, Ziyu, et autres
Publié: (2026)
par: Luo, Ziyu, et autres
Publié: (2026)
FOA Tokenizer: Low-bitrate Neural Codec for First Order Ambisonics with Spatial Consistency Loss
par: Sudarsanam, Parthasaarathy, et autres
Publié: (2025)
par: Sudarsanam, Parthasaarathy, et autres
Publié: (2025)
OmniAudio: Generating Spatial Audio from 360-Degree Video
par: Liu, Huadai, et autres
Publié: (2025)
par: Liu, Huadai, et autres
Publié: (2025)
SHroom: A Python Framework for Ambisonics Room Acoustics Simulation and Binaural Rendering
par: Gayer, Yhonatan
Publié: (2026)
par: Gayer, Yhonatan
Publié: (2026)
Compression of Higher Order Ambisonics with Multichannel RVQGAN
par: Hirvonen, Toni, et autres
Publié: (2024)
par: Hirvonen, Toni, et autres
Publié: (2024)
DiffAU: Diffusion-Based Ambisonics Upscaling
par: Milstein, Amit, et autres
Publié: (2025)
par: Milstein, Amit, et autres
Publié: (2025)
Ambisonizer: Neural Upmixing as Spherical Harmonics Generation
par: Zang, Yongyi, et autres
Publié: (2024)
par: Zang, Yongyi, et autres
Publié: (2024)
HiFi-HARP: A High-Fidelity 7th-Order Ambisonic Room Impulse Response Dataset
par: Saini, Shivam, et autres
Publié: (2025)
par: Saini, Shivam, et autres
Publié: (2025)
Residual Learning for Neural Ambisonics Encoders
par: Deppisch, Thomas, et autres
Publié: (2026)
par: Deppisch, Thomas, et autres
Publié: (2026)
Improving Acoustic Scene Classification in Low-Resource Conditions
par: Chen, Zhi, et autres
Publié: (2024)
par: Chen, Zhi, et autres
Publié: (2024)
Ambisonics Networks -- The Effect Of Radial Functions Regularization
par: Shaybet, Bar, et autres
Publié: (2024)
par: Shaybet, Bar, et autres
Publié: (2024)
SoundSculpt: Direction and Semantics Driven Ambisonic Target Sound Extraction
par: Chen, Tuochao, et autres
Publié: (2025)
par: Chen, Tuochao, et autres
Publié: (2025)
Neural Ambisonics encoding for compact irregular microphone arrays
par: Heikkinen, Mikko, et autres
Publié: (2024)
par: Heikkinen, Mikko, et autres
Publié: (2024)
Gen-A: Generalizing Ambisonics Neural Encoding to Unseen Microphone Arrays
par: Heikkinen, Mikko, et autres
Publié: (2025)
par: Heikkinen, Mikko, et autres
Publié: (2025)
Acoustic BPE for Speech Generation with Discrete Tokens
par: Shen, Feiyu, et autres
Publié: (2023)
par: Shen, Feiyu, et autres
Publié: (2023)
Ambisonics Binaural Rendering via Masked Magnitude Least Squares
par: Berebi, Or, et autres
Publié: (2025)
par: Berebi, Or, et autres
Publié: (2025)
Diffusion Reconstruction towards Generalizable Audio Deepfake Detection
par: Cheng, Bo, et autres
Publié: (2026)
par: Cheng, Bo, et autres
Publié: (2026)
Blind Estimation of Sub-band Acoustic Parameters from Ambisonics Recordings using Spectro-Spatial Covariance Features
par: Meng, Hanyu, et autres
Publié: (2024)
par: Meng, Hanyu, et autres
Publié: (2024)
HARP: A Large-Scale Higher-Order Ambisonic Room Impulse Response Dataset
par: Saini, Shivam, et autres
Publié: (2024)
par: Saini, Shivam, et autres
Publié: (2024)
GSound-SIR: A Spatial Impulse Response Ray-Tracing and High-order Ambisonic Auralization Python Toolkit
par: Zang, Yongyi, et autres
Publié: (2025)
par: Zang, Yongyi, et autres
Publié: (2025)
Direction-Aware Neural Acoustic Fields for Few-Shot Interpolation of Ambisonic Impulse Responses
par: Ick, Christopher, et autres
Publié: (2025)
par: Ick, Christopher, et autres
Publié: (2025)
Ambisonics Super-Resolution Using A Waveform-Domain Neural Network
par: Nawfal, Ismael, et autres
Publié: (2025)
par: Nawfal, Ismael, et autres
Publié: (2025)
Room Impulse Response Generation Conditioned on Acoustic Parameters
par: Arellano, Silvia, et autres
Publié: (2025)
par: Arellano, Silvia, et autres
Publié: (2025)
Tri-Ergon: Fine-grained Video-to-Audio Generation with Multi-modal Conditions and LUFS Control
par: Li, Bingliang, et autres
Publié: (2024)
par: Li, Bingliang, et autres
Publié: (2024)
Can We Hear from Events? Generating Speech from Event Camera
par: Fang, Jingping, et autres
Publié: (2026)
par: Fang, Jingping, et autres
Publié: (2026)
Video Echoed in Music: Semantic, Temporal, and Rhythmic Alignment for Video-to-Music Generation
par: Tong, Xinyi, et autres
Publié: (2025)
par: Tong, Xinyi, et autres
Publié: (2025)
Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency
par: Wang, Haoran, et autres
Publié: (2025)
par: Wang, Haoran, et autres
Publié: (2025)
Data-Efficient Low-Complexity Acoustic Scene Classification via Distilling and Progressive Pruning
par: Han, Bing, et autres
Publié: (2024)
par: Han, Bing, et autres
Publié: (2024)
RSA-Bench: Benchmarking Audio Large Models in Real-World Acoustic Scenarios
par: Zhang, Yibo, et autres
Publié: (2026)
par: Zhang, Yibo, et autres
Publié: (2026)
LaDA-Band: Language Diffusion Models for Vocal-to-Accompaniment Generation
par: Wang, Qi, et autres
Publié: (2026)
par: Wang, Qi, et autres
Publié: (2026)
Array-Aware Ambisonics and HRTF Encoding for Binaural Reproduction With Wearable Arrays
par: Gayer, Yhonatan, et autres
Publié: (2025)
par: Gayer, Yhonatan, et autres
Publié: (2025)
Velocity Potential Neural Field for Efficient Ambisonics Impulse Response Modeling
par: Masuyama, Yoshiki, et autres
Publié: (2026)
par: Masuyama, Yoshiki, et autres
Publié: (2026)
Apollo: Unified Multi-Task Audio-Video Joint Generation
par: Wang, Jun, et autres
Publié: (2026)
par: Wang, Jun, et autres
Publié: (2026)
Low-Complexity Acoustic Scene Classification Using Parallel Attention-Convolution Network
par: Li, Yanxiong, et autres
Publié: (2024)
par: Li, Yanxiong, et autres
Publié: (2024)
ViTex: Visual Texture Control for Multi-Track Symbolic Music Generation via Discrete Diffusion Models
par: Yi, Xiaoyu, et autres
Publié: (2026)
par: Yi, Xiaoyu, et autres
Publié: (2026)
Before the Mic: Physical-Layer Voiceprint Anonymization with Acoustic Metamaterials
par: Ning, Zhiyuan, et autres
Publié: (2026)
par: Ning, Zhiyuan, et autres
Publié: (2026)
MSF-SER: Enriching Acoustic Modeling with Multi-Granularity Semantics for Speech Emotion Recognition
par: Li, Haoxun, et autres
Publié: (2025)
par: Li, Haoxun, et autres
Publié: (2025)
LipDiffuser: Lip-to-Speech Generation with Conditional Diffusion Models
par: Richter, Julius, et autres
Publié: (2025)
par: Richter, Julius, et autres
Publié: (2025)
Neural Scoring: A Refreshed End-to-End Approach for Speaker Recognition in Complex Conditions
par: Lin, Wan, et autres
Publié: (2024)
par: Lin, Wan, et autres
Publié: (2024)
Kling-Foley: Multimodal Diffusion Transformer for High-Quality Video-to-Audio Generation
par: Wang, Jun, et autres
Publié: (2025)
par: Wang, Jun, et autres
Publié: (2025)
Documents similaires
-
DynFOA: Generating First-Order Ambisonics with Conditional Diffusion for Dynamic and Acoustically Complex 360-Degree Videos
par: Luo, Ziyu, et autres
Publié: (2026) -
FOA Tokenizer: Low-bitrate Neural Codec for First Order Ambisonics with Spatial Consistency Loss
par: Sudarsanam, Parthasaarathy, et autres
Publié: (2025) -
OmniAudio: Generating Spatial Audio from 360-Degree Video
par: Liu, Huadai, et autres
Publié: (2025) -
SHroom: A Python Framework for Ambisonics Room Acoustics Simulation and Binaural Rendering
par: Gayer, Yhonatan
Publié: (2026) -
Compression of Higher Order Ambisonics with Multichannel RVQGAN
par: Hirvonen, Toni, et autres
Publié: (2024)