Modeling and Driving Human Body Soundfields through Acoustic Primitives
Fuente:
arXiv
Salvato in:
| Autori principali: | Huang, Chao, Markovic, Dejan, Xu, Chenliang, Richard, Alexander |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
High-Quality Visually-Guided Sound Separation from Diverse Categories
di: Huang, Chao, et al.
Pubblicazione: (2023)
di: Huang, Chao, et al.
Pubblicazione: (2023)
ZeroSep: Separate Anything in Audio with Zero Training
di: Huang, Chao, et al.
Pubblicazione: (2025)
di: Huang, Chao, et al.
Pubblicazione: (2025)
Learning to Highlight Audio by Watching Movies
di: Huang, Chao, et al.
Pubblicazione: (2025)
di: Huang, Chao, et al.
Pubblicazione: (2025)
SoundCam: A Dataset for Finding Humans Using Room Acoustics
di: Wang, Mason, et al.
Pubblicazione: (2023)
di: Wang, Mason, et al.
Pubblicazione: (2023)
Real Acoustic Fields: An Audio-Visual Room Acoustics Dataset and Benchmark
di: Chen, Ziyang, et al.
Pubblicazione: (2024)
di: Chen, Ziyang, et al.
Pubblicazione: (2024)
Decoding Emotions: Unveiling Facial Expressions through Acoustic Sensing with Contrastive Attention
di: Wang, Guangjing, et al.
Pubblicazione: (2024)
di: Wang, Guangjing, et al.
Pubblicazione: (2024)
Sonicmesh: Enhancing 3D Human Mesh Reconstruction in Vision-Impaired Environments With Acoustic Signals
di: Liang, Xiaoxuan, et al.
Pubblicazione: (2024)
di: Liang, Xiaoxuan, et al.
Pubblicazione: (2024)
Prosody-Enhanced Acoustic Pre-training and Acoustic-Disentangled Prosody Adapting for Movie Dubbing
di: Zhang, Zhedong, et al.
Pubblicazione: (2025)
di: Zhang, Zhedong, et al.
Pubblicazione: (2025)
RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling
di: Pham, Long-Khanh, et al.
Pubblicazione: (2025)
di: Pham, Long-Khanh, et al.
Pubblicazione: (2025)
Improving Acoustic Scene Classification with City Features
di: Cai, Yiqiang, et al.
Pubblicazione: (2025)
di: Cai, Yiqiang, et al.
Pubblicazione: (2025)
SOAF: Scene Occlusion-aware Neural Acoustic Field
di: Gao, Huiyu, et al.
Pubblicazione: (2024)
di: Gao, Huiyu, et al.
Pubblicazione: (2024)
Few-shot Acoustic Synthesis with Multimodal Flow Matching
di: Brunetto, Amandine
Pubblicazione: (2026)
di: Brunetto, Amandine
Pubblicazione: (2026)
NBM: an Open Dataset for the Acoustic Monitoring of Nocturnal Migratory Birds in Europe
di: Airale, Louis, et al.
Pubblicazione: (2024)
di: Airale, Louis, et al.
Pubblicazione: (2024)
Novel-View Acoustic Synthesis from 3D Reconstructed Rooms
di: Ahn, Byeongjoo, et al.
Pubblicazione: (2023)
di: Ahn, Byeongjoo, et al.
Pubblicazione: (2023)
NeRAF: 3D Scene Infused Neural Radiance and Acoustic Fields
di: Brunetto, Amandine, et al.
Pubblicazione: (2024)
di: Brunetto, Amandine, et al.
Pubblicazione: (2024)
How Would It Sound? Material-Controlled Multimodal Acoustic Profile Generation for Indoor Scenes
di: Saad, Mahnoor Fatima, et al.
Pubblicazione: (2025)
di: Saad, Mahnoor Fatima, et al.
Pubblicazione: (2025)
RapVerse: Coherent Vocals and Whole-Body Motions Generations from Text
di: Chen, Jiaben, et al.
Pubblicazione: (2024)
di: Chen, Jiaben, et al.
Pubblicazione: (2024)
ActiveRIR: Active Audio-Visual Exploration for Acoustic Environment Modeling
di: Somayazulu, Arjun, et al.
Pubblicazione: (2024)
di: Somayazulu, Arjun, et al.
Pubblicazione: (2024)
Lodge: A Coarse to Fine Diffusion Network for Long Dance Generation Guided by the Characteristic Dance Primitives
di: Li, Ronghui, et al.
Pubblicazione: (2024)
di: Li, Ronghui, et al.
Pubblicazione: (2024)
Separate to Collaborate: Dual-Stream Diffusion Model for Coordinated Piano Hand Motion Synthesis
di: Liu, Zihao, et al.
Pubblicazione: (2025)
di: Liu, Zihao, et al.
Pubblicazione: (2025)
Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction
di: Yang, Shu-wen, et al.
Pubblicazione: (2025)
di: Yang, Shu-wen, et al.
Pubblicazione: (2025)
Synchronized Video-to-Audio Generation via Mel Quantization-Continuum Decomposition
di: Wang, Juncheng, et al.
Pubblicazione: (2025)
di: Wang, Juncheng, et al.
Pubblicazione: (2025)
Spiking Structured State Space Model for Monaural Speech Enhancement
di: Du, Yu, et al.
Pubblicazione: (2023)
di: Du, Yu, et al.
Pubblicazione: (2023)
GCDance: Genre-Controlled Music-Driven 3D Full Body Dance Generation
di: Liu, Xinran, et al.
Pubblicazione: (2025)
di: Liu, Xinran, et al.
Pubblicazione: (2025)
AV-Surf: Surface-Enhanced Geometry-Aware Novel-View Acoustic Synthesis
di: Baek, Hadam, et al.
Pubblicazione: (2025)
di: Baek, Hadam, et al.
Pubblicazione: (2025)
ExpGest: Expressive Speaker Generation Using Diffusion Model and Hybrid Audio-Text Guidance
di: Cheng, Yongkang, et al.
Pubblicazione: (2024)
di: Cheng, Yongkang, et al.
Pubblicazione: (2024)
Accuracy enhancement method for speech emotion recognition from spectrogram using temporal frequency correlation and positional information learning through knowledge transfer
di: Kim, Jeong-Yoon, et al.
Pubblicazione: (2024)
di: Kim, Jeong-Yoon, et al.
Pubblicazione: (2024)
A-JEPA: Joint-Embedding Predictive Architecture Can Listen
di: Fei, Zhengcong, et al.
Pubblicazione: (2023)
di: Fei, Zhengcong, et al.
Pubblicazione: (2023)
FLUX that Plays Music
di: Fei, Zhengcong, et al.
Pubblicazione: (2024)
di: Fei, Zhengcong, et al.
Pubblicazione: (2024)
Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing
di: Liu, Zehua, et al.
Pubblicazione: (2025)
di: Liu, Zehua, et al.
Pubblicazione: (2025)
Bidirectional Autoregressive Diffusion Model for Dance Generation
di: Zhang, Canyu, et al.
Pubblicazione: (2024)
di: Zhang, Canyu, et al.
Pubblicazione: (2024)
MMAudioReverbs: Video-Guided Acoustic Modeling for Dereverberation and Room Impulse Response Estimation
di: Takahashi, Akira, et al.
Pubblicazione: (2026)
di: Takahashi, Akira, et al.
Pubblicazione: (2026)
SoundLoc3D: Invisible 3D Sound Source Localization and Classification Using a Multimodal RGB-D Acoustic Camera
di: He, Yuhang, et al.
Pubblicazione: (2024)
di: He, Yuhang, et al.
Pubblicazione: (2024)
Music Genre Classification using Large Language Models
di: Meguenani, Mohamed El Amine, et al.
Pubblicazione: (2024)
di: Meguenani, Mohamed El Amine, et al.
Pubblicazione: (2024)
Input Conditioned Layer Dropping in Speech Foundation Models
di: Hannan, Abdul, et al.
Pubblicazione: (2025)
di: Hannan, Abdul, et al.
Pubblicazione: (2025)
Acoustic Scene Classification: A Competition Review
di: Gharib, Shayan, et al.
Pubblicazione: (2018)
di: Gharib, Shayan, et al.
Pubblicazione: (2018)
EmoTalker: Emotionally Editable Talking Face Generation via Diffusion Model
di: Zhang, Bingyuan, et al.
Pubblicazione: (2024)
di: Zhang, Bingyuan, et al.
Pubblicazione: (2024)
Enhancing Dance-to-Music Generation via Negative Conditioning Latent Diffusion Model
di: Sun, Changchang, et al.
Pubblicazione: (2025)
di: Sun, Changchang, et al.
Pubblicazione: (2025)
Omni-AVSR: Towards Unified Multimodal Speech Recognition with Large Language Models
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2025)
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2025)
SSAVSV: Towards Unified Model for Self-Supervised Audio-Visual Speaker Verification
di: Rajasekhar, Gnana Praveen, et al.
Pubblicazione: (2025)
di: Rajasekhar, Gnana Praveen, et al.
Pubblicazione: (2025)
Documenti analoghi
-
High-Quality Visually-Guided Sound Separation from Diverse Categories
di: Huang, Chao, et al.
Pubblicazione: (2023) -
ZeroSep: Separate Anything in Audio with Zero Training
di: Huang, Chao, et al.
Pubblicazione: (2025) -
Learning to Highlight Audio by Watching Movies
di: Huang, Chao, et al.
Pubblicazione: (2025) -
SoundCam: A Dataset for Finding Humans Using Room Acoustics
di: Wang, Mason, et al.
Pubblicazione: (2023) -
Real Acoustic Fields: An Audio-Visual Room Acoustics Dataset and Benchmark
di: Chen, Ziyang, et al.
Pubblicazione: (2024)