DynFOA: Generating First-Order Ambisonics with Conditional Diffusion for Dynamic and Acoustically Complex 360-Degree Videos
Fuente:
arXiv
Guardado en:
| Autores principales: | Luo, Ziyu, Chen, Lin, Qu, Qiang, Chen, Xiaoming, Shen, Yiran |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DynFOA: Generating First-Order Ambisonics with Conditional Diffusion for Dynamic and Acoustically Complex 360-Degree Videos
por: Luo, Ziyu, et al.
Publicado: (2026)
por: Luo, Ziyu, et al.
Publicado: (2026)
FOA Tokenizer: Low-bitrate Neural Codec for First Order Ambisonics with Spatial Consistency Loss
por: Sudarsanam, Parthasaarathy, et al.
Publicado: (2025)
por: Sudarsanam, Parthasaarathy, et al.
Publicado: (2025)
OmniAudio: Generating Spatial Audio from 360-Degree Video
por: Liu, Huadai, et al.
Publicado: (2025)
por: Liu, Huadai, et al.
Publicado: (2025)
SHroom: A Python Framework for Ambisonics Room Acoustics Simulation and Binaural Rendering
por: Gayer, Yhonatan
Publicado: (2026)
por: Gayer, Yhonatan
Publicado: (2026)
Compression of Higher Order Ambisonics with Multichannel RVQGAN
por: Hirvonen, Toni, et al.
Publicado: (2024)
por: Hirvonen, Toni, et al.
Publicado: (2024)
DiffAU: Diffusion-Based Ambisonics Upscaling
por: Milstein, Amit, et al.
Publicado: (2025)
por: Milstein, Amit, et al.
Publicado: (2025)
Ambisonizer: Neural Upmixing as Spherical Harmonics Generation
por: Zang, Yongyi, et al.
Publicado: (2024)
por: Zang, Yongyi, et al.
Publicado: (2024)
HiFi-HARP: A High-Fidelity 7th-Order Ambisonic Room Impulse Response Dataset
por: Saini, Shivam, et al.
Publicado: (2025)
por: Saini, Shivam, et al.
Publicado: (2025)
Residual Learning for Neural Ambisonics Encoders
por: Deppisch, Thomas, et al.
Publicado: (2026)
por: Deppisch, Thomas, et al.
Publicado: (2026)
Improving Acoustic Scene Classification in Low-Resource Conditions
por: Chen, Zhi, et al.
Publicado: (2024)
por: Chen, Zhi, et al.
Publicado: (2024)
Ambisonics Networks -- The Effect Of Radial Functions Regularization
por: Shaybet, Bar, et al.
Publicado: (2024)
por: Shaybet, Bar, et al.
Publicado: (2024)
SoundSculpt: Direction and Semantics Driven Ambisonic Target Sound Extraction
por: Chen, Tuochao, et al.
Publicado: (2025)
por: Chen, Tuochao, et al.
Publicado: (2025)
Neural Ambisonics encoding for compact irregular microphone arrays
por: Heikkinen, Mikko, et al.
Publicado: (2024)
por: Heikkinen, Mikko, et al.
Publicado: (2024)
Gen-A: Generalizing Ambisonics Neural Encoding to Unseen Microphone Arrays
por: Heikkinen, Mikko, et al.
Publicado: (2025)
por: Heikkinen, Mikko, et al.
Publicado: (2025)
Acoustic BPE for Speech Generation with Discrete Tokens
por: Shen, Feiyu, et al.
Publicado: (2023)
por: Shen, Feiyu, et al.
Publicado: (2023)
Ambisonics Binaural Rendering via Masked Magnitude Least Squares
por: Berebi, Or, et al.
Publicado: (2025)
por: Berebi, Or, et al.
Publicado: (2025)
Diffusion Reconstruction towards Generalizable Audio Deepfake Detection
por: Cheng, Bo, et al.
Publicado: (2026)
por: Cheng, Bo, et al.
Publicado: (2026)
Blind Estimation of Sub-band Acoustic Parameters from Ambisonics Recordings using Spectro-Spatial Covariance Features
por: Meng, Hanyu, et al.
Publicado: (2024)
por: Meng, Hanyu, et al.
Publicado: (2024)
HARP: A Large-Scale Higher-Order Ambisonic Room Impulse Response Dataset
por: Saini, Shivam, et al.
Publicado: (2024)
por: Saini, Shivam, et al.
Publicado: (2024)
Direction-Aware Neural Acoustic Fields for Few-Shot Interpolation of Ambisonic Impulse Responses
por: Ick, Christopher, et al.
Publicado: (2025)
por: Ick, Christopher, et al.
Publicado: (2025)
GSound-SIR: A Spatial Impulse Response Ray-Tracing and High-order Ambisonic Auralization Python Toolkit
por: Zang, Yongyi, et al.
Publicado: (2025)
por: Zang, Yongyi, et al.
Publicado: (2025)
Ambisonics Super-Resolution Using A Waveform-Domain Neural Network
por: Nawfal, Ismael, et al.
Publicado: (2025)
por: Nawfal, Ismael, et al.
Publicado: (2025)
Room Impulse Response Generation Conditioned on Acoustic Parameters
por: Arellano, Silvia, et al.
Publicado: (2025)
por: Arellano, Silvia, et al.
Publicado: (2025)
Tri-Ergon: Fine-grained Video-to-Audio Generation with Multi-modal Conditions and LUFS Control
por: Li, Bingliang, et al.
Publicado: (2024)
por: Li, Bingliang, et al.
Publicado: (2024)
Can We Hear from Events? Generating Speech from Event Camera
por: Fang, Jingping, et al.
Publicado: (2026)
por: Fang, Jingping, et al.
Publicado: (2026)
Video Echoed in Music: Semantic, Temporal, and Rhythmic Alignment for Video-to-Music Generation
por: Tong, Xinyi, et al.
Publicado: (2025)
por: Tong, Xinyi, et al.
Publicado: (2025)
Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency
por: Wang, Haoran, et al.
Publicado: (2025)
por: Wang, Haoran, et al.
Publicado: (2025)
Data-Efficient Low-Complexity Acoustic Scene Classification via Distilling and Progressive Pruning
por: Han, Bing, et al.
Publicado: (2024)
por: Han, Bing, et al.
Publicado: (2024)
RSA-Bench: Benchmarking Audio Large Models in Real-World Acoustic Scenarios
por: Zhang, Yibo, et al.
Publicado: (2026)
por: Zhang, Yibo, et al.
Publicado: (2026)
Array-Aware Ambisonics and HRTF Encoding for Binaural Reproduction With Wearable Arrays
por: Gayer, Yhonatan, et al.
Publicado: (2025)
por: Gayer, Yhonatan, et al.
Publicado: (2025)
Velocity Potential Neural Field for Efficient Ambisonics Impulse Response Modeling
por: Masuyama, Yoshiki, et al.
Publicado: (2026)
por: Masuyama, Yoshiki, et al.
Publicado: (2026)
LaDA-Band: Language Diffusion Models for Vocal-to-Accompaniment Generation
por: Wang, Qi, et al.
Publicado: (2026)
por: Wang, Qi, et al.
Publicado: (2026)
Apollo: Unified Multi-Task Audio-Video Joint Generation
por: Wang, Jun, et al.
Publicado: (2026)
por: Wang, Jun, et al.
Publicado: (2026)
Low-Complexity Acoustic Scene Classification Using Parallel Attention-Convolution Network
por: Li, Yanxiong, et al.
Publicado: (2024)
por: Li, Yanxiong, et al.
Publicado: (2024)
ViTex: Visual Texture Control for Multi-Track Symbolic Music Generation via Discrete Diffusion Models
por: Yi, Xiaoyu, et al.
Publicado: (2026)
por: Yi, Xiaoyu, et al.
Publicado: (2026)
Before the Mic: Physical-Layer Voiceprint Anonymization with Acoustic Metamaterials
por: Ning, Zhiyuan, et al.
Publicado: (2026)
por: Ning, Zhiyuan, et al.
Publicado: (2026)
MSF-SER: Enriching Acoustic Modeling with Multi-Granularity Semantics for Speech Emotion Recognition
por: Li, Haoxun, et al.
Publicado: (2025)
por: Li, Haoxun, et al.
Publicado: (2025)
LipDiffuser: Lip-to-Speech Generation with Conditional Diffusion Models
por: Richter, Julius, et al.
Publicado: (2025)
por: Richter, Julius, et al.
Publicado: (2025)
Neural Scoring: A Refreshed End-to-End Approach for Speaker Recognition in Complex Conditions
por: Lin, Wan, et al.
Publicado: (2024)
por: Lin, Wan, et al.
Publicado: (2024)
Kling-Foley: Multimodal Diffusion Transformer for High-Quality Video-to-Audio Generation
por: Wang, Jun, et al.
Publicado: (2025)
por: Wang, Jun, et al.
Publicado: (2025)
Ejemplares similares
-
DynFOA: Generating First-Order Ambisonics with Conditional Diffusion for Dynamic and Acoustically Complex 360-Degree Videos
por: Luo, Ziyu, et al.
Publicado: (2026) -
FOA Tokenizer: Low-bitrate Neural Codec for First Order Ambisonics with Spatial Consistency Loss
por: Sudarsanam, Parthasaarathy, et al.
Publicado: (2025) -
OmniAudio: Generating Spatial Audio from 360-Degree Video
por: Liu, Huadai, et al.
Publicado: (2025) -
SHroom: A Python Framework for Ambisonics Room Acoustics Simulation and Binaural Rendering
por: Gayer, Yhonatan
Publicado: (2026) -
Compression of Higher Order Ambisonics with Multichannel RVQGAN
por: Hirvonen, Toni, et al.
Publicado: (2024)