Robust Active Speaker Detection in Noisy Environments
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Vasireddy, Siva Sai Nagender, Zhang, Chenxu, Guo, Xiaohu, Tian, Yapeng |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation
par: Kushwaha, Saksham Singh, et autres
Publié: (2024)
par: Kushwaha, Saksham Singh, et autres
Publié: (2024)
MA-AVT: Modality Alignment for Parameter-Efficient Audio-Visual Transformers
par: Mahmud, Tanvir, et autres
Publié: (2024)
par: Mahmud, Tanvir, et autres
Publié: (2024)
Semantic Grouping Network for Audio Source Separation
par: Mo, Shentong, et autres
Publié: (2024)
par: Mo, Shentong, et autres
Publié: (2024)
MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues
par: Li, Junjie, et autres
Publié: (2024)
par: Li, Junjie, et autres
Publié: (2024)
Continual Audio-Visual Sound Separation
par: Pian, Weiguo, et autres
Publié: (2024)
par: Pian, Weiguo, et autres
Publié: (2024)
Multifaceted Evaluation of Audio-Visual Capability for MLLMs: Effectiveness, Efficiency, Generalizability and Robustness
par: Zhao, Yusheng, et autres
Publié: (2025)
par: Zhao, Yusheng, et autres
Publié: (2025)
Benchmarking Cross-Domain Audio-Visual Deception Detection
par: Guo, Xiaobao, et autres
Publié: (2024)
par: Guo, Xiaobao, et autres
Publié: (2024)
AD-AVSR: Asymmetric Dual-stream Enhancement for Robust Audio-Visual Speech Recognition
par: Xue, Junxiao, et autres
Publié: (2025)
par: Xue, Junxiao, et autres
Publié: (2025)
Detecting Audio-Visual Deepfakes with Fine-Grained Inconsistencies
par: Astrid, Marcella, et autres
Publié: (2024)
par: Astrid, Marcella, et autres
Publié: (2024)
Getting More for Less: Using Weak Labels and AV-Mixup for Robust Audio-Visual Speaker Verification
par: Selvakumar, Anith, et autres
Publié: (2023)
par: Selvakumar, Anith, et autres
Publié: (2023)
AVFF: Audio-Visual Feature Fusion for Video Deepfake Detection
par: Oorloff, Trevine, et autres
Publié: (2024)
par: Oorloff, Trevine, et autres
Publié: (2024)
VAInpaint: Zero-Shot Video-Audio inpainting framework with LLMs-driven Module
par: Wu, Kam Man, et autres
Publié: (2025)
par: Wu, Kam Man, et autres
Publié: (2025)
MMTrail: A Multimodal Trailer Video Dataset with Language and Music Descriptions
par: Chi, Xiaowei, et autres
Publié: (2024)
par: Chi, Xiaowei, et autres
Publié: (2024)
A Unit-based System and Dataset for Expressive Direct Speech-to-Speech Translation
par: Min, Anna, et autres
Publié: (2025)
par: Min, Anna, et autres
Publié: (2025)
Seeing and Hearing: Open-domain Visual-Audio Generation with Diffusion Latent Aligners
par: Xing, Yazhou, et autres
Publié: (2024)
par: Xing, Yazhou, et autres
Publié: (2024)
VMAS: Video-to-Music Generation via Semantic Alignment in Web Music Videos
par: Lin, Yan-Bo, et autres
Publié: (2024)
par: Lin, Yan-Bo, et autres
Publié: (2024)
Gotta Hear Them All: Towards Sound Source Aware Audio Generation
par: Guo, Wei, et autres
Publié: (2024)
par: Guo, Wei, et autres
Publié: (2024)
Straight Through Gumbel Softmax Estimator based Bimodal Neural Architecture Search for Audio-Visual Deepfake Detection
par: PN, Aravinda Reddy, et autres
Publié: (2024)
par: PN, Aravinda Reddy, et autres
Publié: (2024)
YingSound: Video-Guided Sound Effects Generation with Multi-modal Chain-of-Thought Controls
par: Chen, Zihao, et autres
Publié: (2024)
par: Chen, Zihao, et autres
Publié: (2024)
Cross Pseudo-Labeling for Semi-Supervised Audio-Visual Source Localization
par: Guo, Yuxin, et autres
Publié: (2024)
par: Guo, Yuxin, et autres
Publié: (2024)
AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition
par: Liu, Zehua, et autres
Publié: (2024)
par: Liu, Zehua, et autres
Publié: (2024)
Weakly-supervised Audio Temporal Forgery Localization via Progressive Audio-language Co-learning Network
par: Wu, Junyan, et autres
Publié: (2025)
par: Wu, Junyan, et autres
Publié: (2025)
Frieren: Efficient Video-to-Audio Generation Network with Rectified Flow Matching
par: Wang, Yongqi, et autres
Publié: (2024)
par: Wang, Yongqi, et autres
Publié: (2024)
Draw an Audio: Leveraging Multi-Instruction for Video-to-Audio Synthesis
par: Yang, Qi, et autres
Publié: (2024)
par: Yang, Qi, et autres
Publié: (2024)
Aligned Better, Listen Better for Audio-Visual Large Language Models
par: Guo, Yuxin, et autres
Publié: (2025)
par: Guo, Yuxin, et autres
Publié: (2025)
AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation
par: Wang, Le, et autres
Publié: (2025)
par: Wang, Le, et autres
Publié: (2025)
Bridging Paintings and Music -- Exploring Emotion based Music Generation through Paintings
par: Hisariya, Tanisha, et autres
Publié: (2024)
par: Hisariya, Tanisha, et autres
Publié: (2024)
Nexus: An Omni-Perceptive And -Interactive Model for Language, Audio, And Vision
par: Liu, Che, et autres
Publié: (2025)
par: Liu, Che, et autres
Publié: (2025)
Text-to-Audio Generation Synchronized with Videos
par: Mo, Shentong, et autres
Publié: (2024)
par: Mo, Shentong, et autres
Publié: (2024)
Audio-Assisted Face Video Restoration with Temporal and Identity Complementary Learning
par: Cao, Yuqin, et autres
Publié: (2025)
par: Cao, Yuqin, et autres
Publié: (2025)
Learning Sparsity for Effective and Efficient Music Performance Question Answering
par: Diao, Xingjian, et autres
Publié: (2025)
par: Diao, Xingjian, et autres
Publié: (2025)
MuVi: Video-to-Music Generation with Semantic Alignment and Rhythmic Synchronization
par: Li, Ruiqi, et autres
Publié: (2024)
par: Li, Ruiqi, et autres
Publié: (2024)
UniAV: Unified Audio-Visual Perception for Multi-Task Video Event Localization
par: Geng, Tiantian, et autres
Publié: (2024)
par: Geng, Tiantian, et autres
Publié: (2024)
Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization
par: Yu, Fei, et autres
Publié: (2024)
par: Yu, Fei, et autres
Publié: (2024)
Learning Musical Representations for Music Performance Question Answering
par: Diao, Xingjian, et autres
Publié: (2025)
par: Diao, Xingjian, et autres
Publié: (2025)
Contrastive Conditional Latent Diffusion for Audio-visual Segmentation
par: Mao, Yuxin, et autres
Publié: (2023)
par: Mao, Yuxin, et autres
Publié: (2023)
Temporal Working Memory: Query-Guided Segment Refinement for Enhanced Multimodal Understanding
par: Diao, Xingjian, et autres
Publié: (2025)
par: Diao, Xingjian, et autres
Publié: (2025)
FlowDubber: Movie Dubbing with LLM-based Semantic-aware Learning and Flow Matching based Voice Enhancing
par: Cong, Gaoxiang, et autres
Publié: (2025)
par: Cong, Gaoxiang, et autres
Publié: (2025)
AMuSE: Adaptive Multimodal Analysis for Speaker Emotion Recognition in Group Conversations
par: Devulapally, Naresh Kumar, et autres
Publié: (2024)
par: Devulapally, Naresh Kumar, et autres
Publié: (2024)
OmniSep: Unified Omni-Modality Sound Separation with Query-Mixup
par: Cheng, Xize, et autres
Publié: (2024)
par: Cheng, Xize, et autres
Publié: (2024)
Documents similaires
-
VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation
par: Kushwaha, Saksham Singh, et autres
Publié: (2024) -
MA-AVT: Modality Alignment for Parameter-Efficient Audio-Visual Transformers
par: Mahmud, Tanvir, et autres
Publié: (2024) -
Semantic Grouping Network for Audio Source Separation
par: Mo, Shentong, et autres
Publié: (2024) -
MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues
par: Li, Junjie, et autres
Publié: (2024) -
Continual Audio-Visual Sound Separation
par: Pian, Weiguo, et autres
Publié: (2024)