Audio-Visual Talker Localization in Video for Spatial Sound Reproduction
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Berghi, Davide, Jackson, Philip J. B. |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Reverberation-based Features for Sound Event Localization and Detection with Distance Estimation
par: Berghi, Davide, et autres
Publié: (2025)
par: Berghi, Davide, et autres
Publié: (2025)
Learning Spatial Features from Audio-Visual Correspondence in Egocentric Videos
par: Majumder, Sagnik, et autres
Publié: (2023)
par: Majumder, Sagnik, et autres
Publié: (2023)
A Critical Assessment of Visual Sound Source Localization Models Including Negative Audio
par: Juanola, Xavier, et autres
Publié: (2024)
par: Juanola, Xavier, et autres
Publié: (2024)
Aligning Sight and Sound: Advanced Sound Source Localization Through Audio-Visual Alignment
par: Senocak, Arda, et autres
Publié: (2024)
par: Senocak, Arda, et autres
Publié: (2024)
ToS: A Team of Specialists ensemble framework for Stereo Sound Event Localization and Detection with distance estimation in Video
par: Berghi, Davide, et autres
Publié: (2026)
par: Berghi, Davide, et autres
Publié: (2026)
OmniAudio: Generating Spatial Audio from 360-Degree Video
par: Liu, Huadai, et autres
Publié: (2025)
par: Liu, Huadai, et autres
Publié: (2025)
Seeing Speech and Sound: Distinguishing and Locating Audios in Visual Scenes
par: Ryu, Hyeonggon, et autres
Publié: (2025)
par: Ryu, Hyeonggon, et autres
Publié: (2025)
Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation
par: Petermann, Darius, et autres
Publié: (2025)
par: Petermann, Darius, et autres
Publié: (2025)
Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling
par: Ye, Zhen, et autres
Publié: (2026)
par: Ye, Zhen, et autres
Publié: (2026)
What's Making That Sound Right Now? Video-centric Audio-Visual Localization
par: Choi, Hahyeon, et autres
Publié: (2025)
par: Choi, Hahyeon, et autres
Publié: (2025)
T-VSL: Text-Guided Visual Sound Source Localization in Mixtures
par: Mahmud, Tanvir, et autres
Publié: (2024)
par: Mahmud, Tanvir, et autres
Publié: (2024)
DeepSound-V1: Start to Think Step-by-Step in the Audio Generation from Videos
par: Liang, Yunming, et autres
Publié: (2025)
par: Liang, Yunming, et autres
Publié: (2025)
UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing
par: Lai, Yung-Hsuan, et autres
Publié: (2025)
par: Lai, Yung-Hsuan, et autres
Publié: (2025)
UniAV: Unified Audio-Visual Perception for Multi-Task Video Event Localization
par: Geng, Tiantian, et autres
Publié: (2024)
par: Geng, Tiantian, et autres
Publié: (2024)
Learning Self-Supervised Audio-Visual Representations for Sound Recommendations
par: Krishnamurthy, Sudha
Publié: (2024)
par: Krishnamurthy, Sudha
Publié: (2024)
Pindrop it! Audio and Visual Deepfake Countermeasures for Robust Detection and Fine Grained-Localization
par: Klein, Nicholas, et autres
Publié: (2025)
par: Klein, Nicholas, et autres
Publié: (2025)
EmoTalker: Emotionally Editable Talking Face Generation via Diffusion Model
par: Zhang, Bingyuan, et autres
Publié: (2024)
par: Zhang, Bingyuan, et autres
Publié: (2024)
Global-Local Distillation Network-Based Audio-Visual Speaker Tracking with Incomplete Modalities
par: Li, Yidi, et autres
Publié: (2024)
par: Li, Yidi, et autres
Publié: (2024)
Bootstrapping Audio-Visual Segmentation by Strengthening Audio Cues
par: Chen, Tianxiang, et autres
Publié: (2024)
par: Chen, Tianxiang, et autres
Publié: (2024)
Region-Specific Audio Tagging for Spatial Sound
par: Zhao, Jinzheng, et autres
Publié: (2025)
par: Zhao, Jinzheng, et autres
Publié: (2025)
Prompting Segmentation with Sound Is Generalizable Audio-Visual Source Localizer
par: Wang, Yaoting, et autres
Publié: (2023)
par: Wang, Yaoting, et autres
Publié: (2023)
SoundWeaver: Semantic Warm-Starting for Text-to-Audio Diffusion Serving
par: Barik, Ayush, et autres
Publié: (2026)
par: Barik, Ayush, et autres
Publié: (2026)
Sounding Highlights: Dual-Pathway Audio Encoders for Audio-Visual Video Highlight Detection
par: Joo, Seohyun, et autres
Publié: (2026)
par: Joo, Seohyun, et autres
Publié: (2026)
CCStereo: Audio-Visual Contextual and Contrastive Learning for Binaural Audio Generation
par: Chen, Yuanhong, et autres
Publié: (2025)
par: Chen, Yuanhong, et autres
Publié: (2025)
Dynamic Derivation and Elimination: Audio Visual Segmentation with Enhanced Audio Semantics
par: Liu, Chen, et autres
Publié: (2025)
par: Liu, Chen, et autres
Publié: (2025)
DDAVS: Disentangled Audio Semantics and Delayed Bidirectional Alignment for Audio-Visual Segmentation
par: Tian, Jingqi, et autres
Publié: (2025)
par: Tian, Jingqi, et autres
Publié: (2025)
AVFF: Audio-Visual Feature Fusion for Video Deepfake Detection
par: Oorloff, Trevine, et autres
Publié: (2024)
par: Oorloff, Trevine, et autres
Publié: (2024)
Segmenting Collision Sound Sources in Egocentric Videos
par: Parida, Kranti Kumar, et autres
Publié: (2025)
par: Parida, Kranti Kumar, et autres
Publié: (2025)
Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization
par: Yu, Fei, et autres
Publié: (2024)
par: Yu, Fei, et autres
Publié: (2024)
Cross Pseudo-Labeling for Semi-Supervised Audio-Visual Source Localization
par: Guo, Yuxin, et autres
Publié: (2024)
par: Guo, Yuxin, et autres
Publié: (2024)
Sound2Vision: Generating Diverse Visuals from Audio through Cross-Modal Latent Alignment
par: Sung-Bin, Kim, et autres
Publié: (2024)
par: Sung-Bin, Kim, et autres
Publié: (2024)
ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models for Audio Generation and Editing
par: Liu, Huadai, et autres
Publié: (2025)
par: Liu, Huadai, et autres
Publié: (2025)
Whisper-Flamingo: Integrating Visual Features into Whisper for Audio-Visual Speech Recognition and Translation
par: Rouditchenko, Andrew, et autres
Publié: (2024)
par: Rouditchenko, Andrew, et autres
Publié: (2024)
Look, Listen and Recognise: Character-Aware Audio-Visual Subtitling
par: Korbar, Bruno, et autres
Publié: (2024)
par: Korbar, Bruno, et autres
Publié: (2024)
UniSync: A Unified Framework for Audio-Visual Synchronization
par: Feng, Tao, et autres
Publié: (2025)
par: Feng, Tao, et autres
Publié: (2025)
Continual Audio-Visual Sound Separation
par: Pian, Weiguo, et autres
Publié: (2024)
par: Pian, Weiguo, et autres
Publié: (2024)
Both Ears Wide Open: Towards Language-Driven Spatial Audio Generation
par: Sun, Peiwen, et autres
Publié: (2024)
par: Sun, Peiwen, et autres
Publié: (2024)
DeepAudio-V1:Towards Multi-Modal Multi-Stage End-to-End Video to Speech and Audio Generation
par: Zhang, Haomin, et autres
Publié: (2025)
par: Zhang, Haomin, et autres
Publié: (2025)
Synchronized Video-to-Audio Generation via Mel Quantization-Continuum Decomposition
par: Wang, Juncheng, et autres
Publié: (2025)
par: Wang, Juncheng, et autres
Publié: (2025)
FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds
par: Zhang, Yiming, et autres
Publié: (2024)
par: Zhang, Yiming, et autres
Publié: (2024)
Documents similaires
-
Reverberation-based Features for Sound Event Localization and Detection with Distance Estimation
par: Berghi, Davide, et autres
Publié: (2025) -
Learning Spatial Features from Audio-Visual Correspondence in Egocentric Videos
par: Majumder, Sagnik, et autres
Publié: (2023) -
A Critical Assessment of Visual Sound Source Localization Models Including Negative Audio
par: Juanola, Xavier, et autres
Publié: (2024) -
Aligning Sight and Sound: Advanced Sound Source Localization Through Audio-Visual Alignment
par: Senocak, Arda, et autres
Publié: (2024) -
ToS: A Team of Specialists ensemble framework for Stereo Sound Event Localization and Detection with distance estimation in Video
par: Berghi, Davide, et autres
Publié: (2026)