Salvato in:
| Autori principali: | Gao, Huiyu, Ma, Jiahao, Ahmedt-Aristizabal, David, Nguyen, Chuong, Liu, Miaomiao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2407.02264 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
NeRAF: 3D Scene Infused Neural Radiance and Acoustic Fields
di: Brunetto, Amandine, et al.
Pubblicazione: (2024)
di: Brunetto, Amandine, et al.
Pubblicazione: (2024)
Improving Acoustic Scene Classification with City Features
di: Cai, Yiqiang, et al.
Pubblicazione: (2025)
di: Cai, Yiqiang, et al.
Pubblicazione: (2025)
How Would It Sound? Material-Controlled Multimodal Acoustic Profile Generation for Indoor Scenes
di: Saad, Mahnoor Fatima, et al.
Pubblicazione: (2025)
di: Saad, Mahnoor Fatima, et al.
Pubblicazione: (2025)
Real Acoustic Fields: An Audio-Visual Room Acoustics Dataset and Benchmark
di: Chen, Ziyang, et al.
Pubblicazione: (2024)
di: Chen, Ziyang, et al.
Pubblicazione: (2024)
Mutual Learning for Acoustic Matching and Dereverberation via Visual Scene-driven Diffusion
di: Ma, Jian, et al.
Pubblicazione: (2024)
di: Ma, Jian, et al.
Pubblicazione: (2024)
Prosody-Enhanced Acoustic Pre-training and Acoustic-Disentangled Prosody Adapting for Movie Dubbing
di: Zhang, Zhedong, et al.
Pubblicazione: (2025)
di: Zhang, Zhedong, et al.
Pubblicazione: (2025)
RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling
di: Pham, Long-Khanh, et al.
Pubblicazione: (2025)
di: Pham, Long-Khanh, et al.
Pubblicazione: (2025)
Acoustic Scene Classification: A Competition Review
di: Gharib, Shayan, et al.
Pubblicazione: (2018)
di: Gharib, Shayan, et al.
Pubblicazione: (2018)
SoundCam: A Dataset for Finding Humans Using Room Acoustics
di: Wang, Mason, et al.
Pubblicazione: (2023)
di: Wang, Mason, et al.
Pubblicazione: (2023)
MIDGET: Music Conditioned 3D Dance Generation
di: Wang, Jinwu, et al.
Pubblicazione: (2024)
di: Wang, Jinwu, et al.
Pubblicazione: (2024)
Few-shot Acoustic Synthesis with Multimodal Flow Matching
di: Brunetto, Amandine
Pubblicazione: (2026)
di: Brunetto, Amandine
Pubblicazione: (2026)
Modeling and Driving Human Body Soundfields through Acoustic Primitives
di: Huang, Chao, et al.
Pubblicazione: (2024)
di: Huang, Chao, et al.
Pubblicazione: (2024)
Novel-View Acoustic Synthesis from 3D Reconstructed Rooms
di: Ahn, Byeongjoo, et al.
Pubblicazione: (2023)
di: Ahn, Byeongjoo, et al.
Pubblicazione: (2023)
NBM: an Open Dataset for the Acoustic Monitoring of Nocturnal Migratory Birds in Europe
di: Airale, Louis, et al.
Pubblicazione: (2024)
di: Airale, Louis, et al.
Pubblicazione: (2024)
SAV-SE: Scene-aware Audio-Visual Speech Enhancement with Selective State Space Model
di: Qian, Xinyuan, et al.
Pubblicazione: (2024)
di: Qian, Xinyuan, et al.
Pubblicazione: (2024)
Decoding Emotions: Unveiling Facial Expressions through Acoustic Sensing with Contrastive Attention
di: Wang, Guangjing, et al.
Pubblicazione: (2024)
di: Wang, Guangjing, et al.
Pubblicazione: (2024)
Seeing Speech and Sound: Distinguishing and Locating Audios in Visual Scenes
di: Ryu, Hyeonggon, et al.
Pubblicazione: (2025)
di: Ryu, Hyeonggon, et al.
Pubblicazione: (2025)
Sonicmesh: Enhancing 3D Human Mesh Reconstruction in Vision-Impaired Environments With Acoustic Signals
di: Liang, Xiaoxuan, et al.
Pubblicazione: (2024)
di: Liang, Xiaoxuan, et al.
Pubblicazione: (2024)
Data Augmentation Using Neural Acoustic Fields With Retrieval-Augmented Pre-training
di: Ick, Christopher, et al.
Pubblicazione: (2025)
di: Ick, Christopher, et al.
Pubblicazione: (2025)
ActiveRIR: Active Audio-Visual Exploration for Acoustic Environment Modeling
di: Somayazulu, Arjun, et al.
Pubblicazione: (2024)
di: Somayazulu, Arjun, et al.
Pubblicazione: (2024)
Statistics-aware Audio-visual Deepfake Detector
di: Astrid, Marcella, et al.
Pubblicazione: (2024)
di: Astrid, Marcella, et al.
Pubblicazione: (2024)
AV-Surf: Surface-Enhanced Geometry-Aware Novel-View Acoustic Synthesis
di: Baek, Hadam, et al.
Pubblicazione: (2025)
di: Baek, Hadam, et al.
Pubblicazione: (2025)
Direction-Aware Neural Acoustic Fields for Few-Shot Interpolation of Ambisonic Impulse Responses
di: Ick, Christopher, et al.
Pubblicazione: (2025)
di: Ick, Christopher, et al.
Pubblicazione: (2025)
Omni-AVSR: Towards Unified Multimodal Speech Recognition with Large Language Models
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2025)
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2025)
Estimating Indoor Scene Depth Maps from Ultrasonic Echoes
di: Honma, Junpei, et al.
Pubblicazione: (2024)
di: Honma, Junpei, et al.
Pubblicazione: (2024)
MoME: Mixture of Matryoshka Experts for Audio-Visual Speech Recognition
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2025)
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2025)
UniSync: A Unified Framework for Audio-Visual Synchronization
di: Feng, Tao, et al.
Pubblicazione: (2025)
di: Feng, Tao, et al.
Pubblicazione: (2025)
NeRF-3DTalker: Neural Radiance Field with 3D Prior Aided Audio Disentanglement for Talking Head Synthesis
di: Liu, Xiaoxing, et al.
Pubblicazione: (2025)
di: Liu, Xiaoxing, et al.
Pubblicazione: (2025)
VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction
di: Fu, Chaoyou, et al.
Pubblicazione: (2025)
di: Fu, Chaoyou, et al.
Pubblicazione: (2025)
Listen2Scene: Interactive material-aware binaural sound propagation for reconstructed 3D scenes
di: Ratnarajah, Anton, et al.
Pubblicazione: (2023)
di: Ratnarajah, Anton, et al.
Pubblicazione: (2023)
Oceanship: A Large-Scale Dataset for Underwater Audio Target Recognition
di: Li, Zeyu, et al.
Pubblicazione: (2024)
di: Li, Zeyu, et al.
Pubblicazione: (2024)
CoLM-DSR: Leveraging Neural Codec Language Modeling for Multi-Modal Dysarthric Speech Reconstruction
di: Chen, Xueyuan, et al.
Pubblicazione: (2024)
di: Chen, Xueyuan, et al.
Pubblicazione: (2024)
Emotional Vietnamese Speech-Based Depression Diagnosis Using Dynamic Attention Mechanism
di: D., Quang-Anh N., et al.
Pubblicazione: (2024)
di: D., Quang-Anh N., et al.
Pubblicazione: (2024)
ZeroSep: Separate Anything in Audio with Zero Training
di: Huang, Chao, et al.
Pubblicazione: (2025)
di: Huang, Chao, et al.
Pubblicazione: (2025)
CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization
di: Bai, Detao, et al.
Pubblicazione: (2025)
di: Bai, Detao, et al.
Pubblicazione: (2025)
Benchmarking Machine Learning Methods for Distributed Acoustic Sensing
di: Shi, Shuaikai, et al.
Pubblicazione: (2025)
di: Shi, Shuaikai, et al.
Pubblicazione: (2025)
SoundLoc3D: Invisible 3D Sound Source Localization and Classification Using a Multimodal RGB-D Acoustic Camera
di: He, Yuhang, et al.
Pubblicazione: (2024)
di: He, Yuhang, et al.
Pubblicazione: (2024)
FlowDubber: Movie Dubbing with LLM-based Semantic-aware Learning and Flow Matching based Voice Enhancing
di: Cong, Gaoxiang, et al.
Pubblicazione: (2025)
di: Cong, Gaoxiang, et al.
Pubblicazione: (2025)
Multitask frame-level learning for few-shot sound event detection
di: Zou, Liang, et al.
Pubblicazione: (2024)
di: Zou, Liang, et al.
Pubblicazione: (2024)
Computation and Parameter Efficient Multi-Modal Fusion Transformer for Cued Speech Recognition
di: Liu, Lei, et al.
Pubblicazione: (2024)
di: Liu, Lei, et al.
Pubblicazione: (2024)
Documenti analoghi
-
NeRAF: 3D Scene Infused Neural Radiance and Acoustic Fields
di: Brunetto, Amandine, et al.
Pubblicazione: (2024) -
Improving Acoustic Scene Classification with City Features
di: Cai, Yiqiang, et al.
Pubblicazione: (2025) -
How Would It Sound? Material-Controlled Multimodal Acoustic Profile Generation for Indoor Scenes
di: Saad, Mahnoor Fatima, et al.
Pubblicazione: (2025) -
Real Acoustic Fields: An Audio-Visual Room Acoustics Dataset and Benchmark
di: Chen, Ziyang, et al.
Pubblicazione: (2024) -
Mutual Learning for Acoustic Matching and Dereverberation via Visual Scene-driven Diffusion
di: Ma, Jian, et al.
Pubblicazione: (2024)