How Would It Sound? Material-Controlled Multimodal Acoustic Profile Generation for Indoor Scenes
Fuente:
arXiv
Salvato in:
| Autori principali: | Saad, Mahnoor Fatima, Al-Halah, Ziad |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Learning Spatial Features from Audio-Visual Correspondence in Egocentric Videos
di: Majumder, Sagnik, et al.
Pubblicazione: (2023)
di: Majumder, Sagnik, et al.
Pubblicazione: (2023)
Improving Acoustic Scene Classification with City Features
di: Cai, Yiqiang, et al.
Pubblicazione: (2025)
di: Cai, Yiqiang, et al.
Pubblicazione: (2025)
Video-Guided Foley Sound Generation with Multimodal Controls
di: Chen, Ziyang, et al.
Pubblicazione: (2024)
di: Chen, Ziyang, et al.
Pubblicazione: (2024)
SOAF: Scene Occlusion-aware Neural Acoustic Field
di: Gao, Huiyu, et al.
Pubblicazione: (2024)
di: Gao, Huiyu, et al.
Pubblicazione: (2024)
SoundCam: A Dataset for Finding Humans Using Room Acoustics
di: Wang, Mason, et al.
Pubblicazione: (2023)
di: Wang, Mason, et al.
Pubblicazione: (2023)
Seeing Speech and Sound: Distinguishing and Locating Audios in Visual Scenes
di: Ryu, Hyeonggon, et al.
Pubblicazione: (2025)
di: Ryu, Hyeonggon, et al.
Pubblicazione: (2025)
NeRAF: 3D Scene Infused Neural Radiance and Acoustic Fields
di: Brunetto, Amandine, et al.
Pubblicazione: (2024)
di: Brunetto, Amandine, et al.
Pubblicazione: (2024)
Few-shot Acoustic Synthesis with Multimodal Flow Matching
di: Brunetto, Amandine
Pubblicazione: (2026)
di: Brunetto, Amandine
Pubblicazione: (2026)
SoundLoc3D: Invisible 3D Sound Source Localization and Classification Using a Multimodal RGB-D Acoustic Camera
di: He, Yuhang, et al.
Pubblicazione: (2024)
di: He, Yuhang, et al.
Pubblicazione: (2024)
ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models for Audio Generation and Editing
di: Liu, Huadai, et al.
Pubblicazione: (2025)
di: Liu, Huadai, et al.
Pubblicazione: (2025)
Estimating Indoor Scene Depth Maps from Ultrasonic Echoes
di: Honma, Junpei, et al.
Pubblicazione: (2024)
di: Honma, Junpei, et al.
Pubblicazione: (2024)
YingSound: Video-Guided Sound Effects Generation with Multi-modal Chain-of-Thought Controls
di: Chen, Zihao, et al.
Pubblicazione: (2024)
di: Chen, Zihao, et al.
Pubblicazione: (2024)
SoundingActions: Learning How Actions Sound from Narrated Egocentric Videos
di: Chen, Changan, et al.
Pubblicazione: (2024)
di: Chen, Changan, et al.
Pubblicazione: (2024)
Prosody-Enhanced Acoustic Pre-training and Acoustic-Disentangled Prosody Adapting for Movie Dubbing
di: Zhang, Zhedong, et al.
Pubblicazione: (2025)
di: Zhang, Zhedong, et al.
Pubblicazione: (2025)
SoundBrush: Sound as a Brush for Visual Scene Editing
di: Sung-Bin, Kim, et al.
Pubblicazione: (2024)
di: Sung-Bin, Kim, et al.
Pubblicazione: (2024)
Acoustic Scene Classification: A Competition Review
di: Gharib, Shayan, et al.
Pubblicazione: (2018)
di: Gharib, Shayan, et al.
Pubblicazione: (2018)
Urban Sound Propagation: a Benchmark for 1-Step Generative Modeling of Complex Physical Systems
di: Spitznagel, Martin, et al.
Pubblicazione: (2024)
di: Spitznagel, Martin, et al.
Pubblicazione: (2024)
DeepSound-V1: Start to Think Step-by-Step in the Audio Generation from Videos
di: Liang, Yunming, et al.
Pubblicazione: (2025)
di: Liang, Yunming, et al.
Pubblicazione: (2025)
MDSGen: Fast and Efficient Masked Diffusion Temporal-Aware Transformers for Open-Domain Sound Generation
di: Pham, Trung X., et al.
Pubblicazione: (2024)
di: Pham, Trung X., et al.
Pubblicazione: (2024)
Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation
di: Petermann, Darius, et al.
Pubblicazione: (2025)
di: Petermann, Darius, et al.
Pubblicazione: (2025)
Modeling and Driving Human Body Soundfields through Acoustic Primitives
di: Huang, Chao, et al.
Pubblicazione: (2024)
di: Huang, Chao, et al.
Pubblicazione: (2024)
Segmenting Collision Sound Sources in Egocentric Videos
di: Parida, Kranti Kumar, et al.
Pubblicazione: (2025)
di: Parida, Kranti Kumar, et al.
Pubblicazione: (2025)
Novel-View Acoustic Synthesis from 3D Reconstructed Rooms
di: Ahn, Byeongjoo, et al.
Pubblicazione: (2023)
di: Ahn, Byeongjoo, et al.
Pubblicazione: (2023)
NBM: an Open Dataset for the Acoustic Monitoring of Nocturnal Migratory Birds in Europe
di: Airale, Louis, et al.
Pubblicazione: (2024)
di: Airale, Louis, et al.
Pubblicazione: (2024)
Decoding Emotions: Unveiling Facial Expressions through Acoustic Sensing with Contrastive Attention
di: Wang, Guangjing, et al.
Pubblicazione: (2024)
di: Wang, Guangjing, et al.
Pubblicazione: (2024)
Multi-View Spectrogram Transformer for Respiratory Sound Classification
di: He, Wentao, et al.
Pubblicazione: (2023)
di: He, Wentao, et al.
Pubblicazione: (2023)
RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling
di: Pham, Long-Khanh, et al.
Pubblicazione: (2025)
di: Pham, Long-Khanh, et al.
Pubblicazione: (2025)
Mutual Learning for Acoustic Matching and Dereverberation via Visual Scene-driven Diffusion
di: Ma, Jian, et al.
Pubblicazione: (2024)
di: Ma, Jian, et al.
Pubblicazione: (2024)
T-VSL: Text-Guided Visual Sound Source Localization in Mixtures
di: Mahmud, Tanvir, et al.
Pubblicazione: (2024)
di: Mahmud, Tanvir, et al.
Pubblicazione: (2024)
Audio-Visual Talker Localization in Video for Spatial Sound Reproduction
di: Berghi, Davide, et al.
Pubblicazione: (2024)
di: Berghi, Davide, et al.
Pubblicazione: (2024)
Sound Source Localization for Spatial Mapping of Surgical Actions in Dynamic Scenes
di: Hein, Jonas, et al.
Pubblicazione: (2025)
di: Hein, Jonas, et al.
Pubblicazione: (2025)
Sonicmesh: Enhancing 3D Human Mesh Reconstruction in Vision-Impaired Environments With Acoustic Signals
di: Liang, Xiaoxuan, et al.
Pubblicazione: (2024)
di: Liang, Xiaoxuan, et al.
Pubblicazione: (2024)
HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation
di: Shan, Sizhe, et al.
Pubblicazione: (2025)
di: Shan, Sizhe, et al.
Pubblicazione: (2025)
Real Acoustic Fields: An Audio-Visual Room Acoustics Dataset and Benchmark
di: Chen, Ziyang, et al.
Pubblicazione: (2024)
di: Chen, Ziyang, et al.
Pubblicazione: (2024)
SoundWeaver: Semantic Warm-Starting for Text-to-Audio Diffusion Serving
di: Barik, Ayush, et al.
Pubblicazione: (2026)
di: Barik, Ayush, et al.
Pubblicazione: (2026)
High-Quality Visually-Guided Sound Separation from Diverse Categories
di: Huang, Chao, et al.
Pubblicazione: (2023)
di: Huang, Chao, et al.
Pubblicazione: (2023)
FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds
di: Zhang, Yiming, et al.
Pubblicazione: (2024)
di: Zhang, Yiming, et al.
Pubblicazione: (2024)
ECHO: Environmental Sound Classification with Hierarchical Ontology-guided Semi-Supervised Learning
di: Gupta, Pranav, et al.
Pubblicazione: (2024)
di: Gupta, Pranav, et al.
Pubblicazione: (2024)
Read, Watch and Scream! Sound Generation from Text and Video
di: Jeong, Yujin, et al.
Pubblicazione: (2024)
di: Jeong, Yujin, et al.
Pubblicazione: (2024)
Exploring Multi-Modal Control in Music-Driven Dance Generation
di: Li, Ronghui, et al.
Pubblicazione: (2024)
di: Li, Ronghui, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Learning Spatial Features from Audio-Visual Correspondence in Egocentric Videos
di: Majumder, Sagnik, et al.
Pubblicazione: (2023) -
Improving Acoustic Scene Classification with City Features
di: Cai, Yiqiang, et al.
Pubblicazione: (2025) -
Video-Guided Foley Sound Generation with Multimodal Controls
di: Chen, Ziyang, et al.
Pubblicazione: (2024) -
SOAF: Scene Occlusion-aware Neural Acoustic Field
di: Gao, Huiyu, et al.
Pubblicazione: (2024) -
SoundCam: A Dataset for Finding Humans Using Room Acoustics
di: Wang, Mason, et al.
Pubblicazione: (2023)