Efficient Face Detection with Audio-Based Region Proposals for Human-Robot Interactions
Fuente:
arXiv
Guardado en:
| Autores principales: | Aris, William, Grondin, François |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Towards Language-Independent Face-Voice Association with Multimodal Foundation Models
por: Farhadipour, Aref, et al.
Publicado: (2025)
por: Farhadipour, Aref, et al.
Publicado: (2025)
UNQA: Unified No-Reference Quality Assessment for Audio, Image, Video, and Audio-Visual Content
por: Cao, Yuqin, et al.
Publicado: (2024)
por: Cao, Yuqin, et al.
Publicado: (2024)
Audio-Visual Speaker Diarization: Current Databases, Approaches and Challenges
por: Mingote, Victoria, et al.
Publicado: (2024)
por: Mingote, Victoria, et al.
Publicado: (2024)
CoAVT: A Cognition-Inspired Unified Audio-Visual-Text Pre-Training Model for Multimodal Processing
por: Yue, Xianghu, et al.
Publicado: (2024)
por: Yue, Xianghu, et al.
Publicado: (2024)
KunquDB: An Attempt for Speaker Verification in the Chinese Opera Scenario
por: Zhou, Huali, et al.
Publicado: (2024)
por: Zhou, Huali, et al.
Publicado: (2024)
Interpretable Modeling of Articulatory Temporal Dynamics from real-time MRI for Phoneme Recognition
por: Park, Jay, et al.
Publicado: (2025)
por: Park, Jay, et al.
Publicado: (2025)
Improvement Of Audiovisual Quality Estimation Using A Nonlinear Autoregressive Exogenous Neural Network And Bitstream Parameters
por: Kossi, Koffi, et al.
Publicado: (2024)
por: Kossi, Koffi, et al.
Publicado: (2024)
The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models
por: Wang, Yi, et al.
Publicado: (2025)
por: Wang, Yi, et al.
Publicado: (2025)
Beyond Correlation: Evaluating Multimedia Quality Models with the Constrained Concordance Index
por: Ragano, Alessandro, et al.
Publicado: (2024)
por: Ragano, Alessandro, et al.
Publicado: (2024)
Multimodal Marvels of Deep Learning in Medical Diagnosis: A Comprehensive Review of COVID-19 Detection
por: Islam, Md Shofiqul, et al.
Publicado: (2025)
por: Islam, Md Shofiqul, et al.
Publicado: (2025)
PrismAudio: Decomposed Chain-of-Thoughts and Multi-dimensional Rewards for Video-to-Audio Generation
por: Liu, Huadai, et al.
Publicado: (2025)
por: Liu, Huadai, et al.
Publicado: (2025)
Localizing Audio-Visual Deepfakes via Hierarchical Boundary Modeling
por: Chen, Xuanjun, et al.
Publicado: (2025)
por: Chen, Xuanjun, et al.
Publicado: (2025)
Cross Attentional Audio-Visual Fusion for Dimensional Emotion Recognition
por: Praveen, R. Gnana, et al.
Publicado: (2021)
por: Praveen, R. Gnana, et al.
Publicado: (2021)
Audio-Visual Approach For Multimodal Concurrent Speaker Detection
por: Eliav, Amit, et al.
Publicado: (2024)
por: Eliav, Amit, et al.
Publicado: (2024)
End-to-end audio-visual learning for cochlear implant sound coding simulations in noisy environments
por: Lin, Meng-Ping, et al.
Publicado: (2025)
por: Lin, Meng-Ping, et al.
Publicado: (2025)
A multi-modal approach for identifying schizophrenia using cross-modal attention
por: Premananth, Gowtham, et al.
Publicado: (2023)
por: Premananth, Gowtham, et al.
Publicado: (2023)
SoundSil-DS: Deep Denoising and Segmentation of Sound-field Images with Silhouettes
por: Tanigawa, Risako, et al.
Publicado: (2024)
por: Tanigawa, Risako, et al.
Publicado: (2024)
Out-Of-Distribution Detection for Audio-visual Generalized Zero-Shot Learning: A General Framework
por: Wen, Liuyuan
Publicado: (2024)
por: Wen, Liuyuan
Publicado: (2024)
ToS: A Team of Specialists ensemble framework for Stereo Sound Event Localization and Detection with distance estimation in Video
por: Berghi, Davide, et al.
Publicado: (2026)
por: Berghi, Davide, et al.
Publicado: (2026)
PlumberNet: Fixing interference leakage after GEV beamforming
por: Grondin, François, et al.
Publicado: (2023)
por: Grondin, François, et al.
Publicado: (2023)
Faces that Speak: Jointly Synthesising Talking Face and Speech from Text
por: Jang, Youngjoon, et al.
Publicado: (2024)
por: Jang, Youngjoon, et al.
Publicado: (2024)
Livestock feeding behaviour: A review on automated systems for ruminant monitoring
por: Chelotti, José, et al.
Publicado: (2023)
por: Chelotti, José, et al.
Publicado: (2023)
Unsupervised Improved MVDR Beamforming for Sound Enhancement
por: Kealey, Jacob, et al.
Publicado: (2024)
por: Kealey, Jacob, et al.
Publicado: (2024)
Exploring Phonetic Context-Aware Lip-Sync For Talking Face Generation
por: Park, Se Jin, et al.
Publicado: (2023)
por: Park, Se Jin, et al.
Publicado: (2023)
Cross-modal Cognitive Consensus guided Audio-Visual Segmentation
por: Shi, Zhaofeng, et al.
Publicado: (2023)
por: Shi, Zhaofeng, et al.
Publicado: (2023)
Stereo Sound Event Localization and Detection with Onscreen/offscreen Classification
por: Shimada, Kazuki, et al.
Publicado: (2025)
por: Shimada, Kazuki, et al.
Publicado: (2025)
Machine Perceptual Quality: Evaluating the Impact of Severe Lossy Compression on Audio and Image Models
por: Jacobellis, Dan, et al.
Publicado: (2024)
por: Jacobellis, Dan, et al.
Publicado: (2024)
SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet
por: Zhong, Zhi, et al.
Publicado: (2025)
por: Zhong, Zhi, et al.
Publicado: (2025)
Adaptive Multimodal Person Recognition: A Robust Framework for Handling Missing Modalities
por: Farhadipour, Aref, et al.
Publicado: (2025)
por: Farhadipour, Aref, et al.
Publicado: (2025)
Sound Source Localization for Spatial Mapping of Surgical Actions in Dynamic Scenes
por: Hein, Jonas, et al.
Publicado: (2025)
por: Hein, Jonas, et al.
Publicado: (2025)
Speech2rtMRI: Speech-Guided Diffusion Model for Real-time MRI Video of the Vocal Tract during Speech
por: Nguyen, Hong, et al.
Publicado: (2024)
por: Nguyen, Hong, et al.
Publicado: (2024)
DLIOS: An LLM-Augmented Real-Time Multi-Modal Interactive Enhancement Overlay System for Douyin Live Streaming
por: Wen, Shuide, et al.
Publicado: (2026)
por: Wen, Shuide, et al.
Publicado: (2026)
Enhancing Real-World Active Speaker Detection with Multi-Modal Extraction Pre-Training
por: Tao, Ruijie, et al.
Publicado: (2024)
por: Tao, Ruijie, et al.
Publicado: (2024)
Attentive AV-FusionNet: Audio-Visual Quality Prediction with Hybrid Attention
por: Salaj, Ina, et al.
Publicado: (2025)
por: Salaj, Ina, et al.
Publicado: (2025)
Multi-Speaker DOA Estimation in Binaural Hearing Aids using Deep Learning and Speaker Count Fusion
por: Jazaeri, Farnaz, et al.
Publicado: (2025)
por: Jazaeri, Farnaz, et al.
Publicado: (2025)
Reacting like Humans: Incorporating Intrinsic Human Behaviors into NAO through Sound-Based Reactions to Fearful and Shocking Events for Enhanced Sociability
por: Ghadami, Ali, et al.
Publicado: (2023)
por: Ghadami, Ali, et al.
Publicado: (2023)
Speech motion anomaly detection via cross-modal translation of 4D motion fields from tagged MRI
por: Liu, Xiaofeng, et al.
Publicado: (2024)
por: Liu, Xiaofeng, et al.
Publicado: (2024)
Two Web Toolkits for Multimodal Piano Performance Dataset Acquisition and Fingering Annotation
por: Park, Junhyung, et al.
Publicado: (2025)
por: Park, Junhyung, et al.
Publicado: (2025)
Video Soundtrack Generation by Aligning Emotions and Temporal Boundaries
por: Sulun, Serkan, et al.
Publicado: (2025)
por: Sulun, Serkan, et al.
Publicado: (2025)
Detection of Auditory Brainstem Response Peaks Using Image Processing Techniques in Infants with Normal Hearing Sensitivity
por: Majidpour, Amir, et al.
Publicado: (2024)
por: Majidpour, Amir, et al.
Publicado: (2024)
Ejemplares similares
-
Towards Language-Independent Face-Voice Association with Multimodal Foundation Models
por: Farhadipour, Aref, et al.
Publicado: (2025) -
UNQA: Unified No-Reference Quality Assessment for Audio, Image, Video, and Audio-Visual Content
por: Cao, Yuqin, et al.
Publicado: (2024) -
Audio-Visual Speaker Diarization: Current Databases, Approaches and Challenges
por: Mingote, Victoria, et al.
Publicado: (2024) -
CoAVT: A Cognition-Inspired Unified Audio-Visual-Text Pre-Training Model for Multimodal Processing
por: Yue, Xianghu, et al.
Publicado: (2024) -
KunquDB: An Attempt for Speaker Verification in the Chinese Opera Scenario
por: Zhou, Huali, et al.
Publicado: (2024)