Salvato in:
| Autori principali: | Clarke, Jason, Gotoh, Yoshihiko, Goetze, Stefan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2502.06012 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings
di: Clarke, Jason, et al.
Pubblicazione: (2025)
di: Clarke, Jason, et al.
Pubblicazione: (2025)
Ensembling Synchronisation-based and Face-Voice Association Paradigms for Robust Active Speaker Detection in Egocentric Recordings
di: Clarke, Jason, et al.
Pubblicazione: (2025)
di: Clarke, Jason, et al.
Pubblicazione: (2025)
EgoAdapt: Enhancing Robustness in Egocentric Interactive Speaker Detection Under Missing Modalities
di: Qian, Xinyuan, et al.
Pubblicazione: (2026)
di: Qian, Xinyuan, et al.
Pubblicazione: (2026)
Robust Active Speaker Detection in Noisy Environments
di: Vasireddy, Siva Sai Nagender, et al.
Pubblicazione: (2024)
di: Vasireddy, Siva Sai Nagender, et al.
Pubblicazione: (2024)
A Toolkit for Joint Speaker Diarization and Identification with Application to Speaker-Attributed ASR
di: Morrone, Giovanni, et al.
Pubblicazione: (2024)
di: Morrone, Giovanni, et al.
Pubblicazione: (2024)
SpeakerLLM: A Speaker-Specialized Audio-LLM for Speaker Understanding and Verification Reasoning
di: Nam, KiHyun, et al.
Pubblicazione: (2026)
di: Nam, KiHyun, et al.
Pubblicazione: (2026)
Dual-Stream Decoupled Learning for Temporal Consistency and Speaker Interaction in AVSD
di: Xiao, Junhao, et al.
Pubblicazione: (2025)
di: Xiao, Junhao, et al.
Pubblicazione: (2025)
Who is Authentic Speaker
di: Huang, Qiang
Pubblicazione: (2024)
di: Huang, Qiang
Pubblicazione: (2024)
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction
di: Wang, Jiadong, et al.
Pubblicazione: (2026)
di: Wang, Jiadong, et al.
Pubblicazione: (2026)
StyleSpeaker: Audio-Enhanced Fine-Grained Style Modeling for Speech-Driven 3D Facial Animation
di: Yang, An, et al.
Pubblicazione: (2025)
di: Yang, An, et al.
Pubblicazione: (2025)
Noise-Conditioned Mixture-of-Experts Framework for Robust Speaker Verification
di: Gu, Bin, et al.
Pubblicazione: (2025)
di: Gu, Bin, et al.
Pubblicazione: (2025)
Audio-Visual Speaker Tracking: Progress, Challenges, and Future Directions
di: Zhao, Jinzheng, et al.
Pubblicazione: (2023)
di: Zhao, Jinzheng, et al.
Pubblicazione: (2023)
AFL-Net: Integrating Audio, Facial, and Lip Modalities with a Two-step Cross-attention for Robust Speaker Diarization in the Wild
di: Yin, Yongkang, et al.
Pubblicazione: (2023)
di: Yin, Yongkang, et al.
Pubblicazione: (2023)
Quality-Aware End-to-End Audio-Visual Neural Speaker Diarization
di: He, Mao-Kui, et al.
Pubblicazione: (2024)
di: He, Mao-Kui, et al.
Pubblicazione: (2024)
MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions
di: Li, Junjie, et al.
Pubblicazione: (2025)
di: Li, Junjie, et al.
Pubblicazione: (2025)
Plug-and-Steer: Decoupling Separation and Selection in Audio-Visual Target Speaker Extraction
di: Kwak, Doyeop, et al.
Pubblicazione: (2026)
di: Kwak, Doyeop, et al.
Pubblicazione: (2026)
pTSE-T: Presentation Target Speaker Extraction using Unaligned Text Cues
di: Jiang, Ziyang, et al.
Pubblicazione: (2024)
di: Jiang, Ziyang, et al.
Pubblicazione: (2024)
Referee: Reference-aware Audiovisual Deepfake Detection
di: Boo, Hyemin, et al.
Pubblicazione: (2025)
di: Boo, Hyemin, et al.
Pubblicazione: (2025)
LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention
di: Menon, Aditya Srinivas, et al.
Pubblicazione: (2025)
di: Menon, Aditya Srinivas, et al.
Pubblicazione: (2025)
M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset
di: Wu, Shilong
Pubblicazione: (2025)
di: Wu, Shilong
Pubblicazione: (2025)
REWIND: Speech Time Reversal for Enhancing Speaker Representations in Diffusion-based Voice Conversion
di: Biyani, Ishan D., et al.
Pubblicazione: (2025)
di: Biyani, Ishan D., et al.
Pubblicazione: (2025)
Zero-Shot Character Identification and Speaker Prediction in Comics via Iterative Multimodal Fusion
di: Li, Yingxuan, et al.
Pubblicazione: (2024)
di: Li, Yingxuan, et al.
Pubblicazione: (2024)
Preserving Speaker Information in Direct Speech-to-Speech Translation with Non-Autoregressive Generation and Pretraining
di: Zhou, Rui, et al.
Pubblicazione: (2024)
di: Zhou, Rui, et al.
Pubblicazione: (2024)
Spectron: Target Speaker Extraction using Conditional Transformer with Adversarial Refinement
di: Bandyopadhyay, Tathagata
Pubblicazione: (2024)
di: Bandyopadhyay, Tathagata
Pubblicazione: (2024)
Landmark-Guided Cross-Speaker Lip Reading with Mutual Information Regularization
di: Wu, Linzhi, et al.
Pubblicazione: (2024)
di: Wu, Linzhi, et al.
Pubblicazione: (2024)
Audio-Visual Speaker Diarization: Current Databases, Approaches and Challenges
di: Mingote, Victoria, et al.
Pubblicazione: (2024)
di: Mingote, Victoria, et al.
Pubblicazione: (2024)
RAVSS: Robust Audio-Visual Speech Separation in Multi-Speaker Scenarios with Missing Visual Cues
di: Pan, Tianrui, et al.
Pubblicazione: (2024)
di: Pan, Tianrui, et al.
Pubblicazione: (2024)
GaussianTalker: Speaker-specific Talking Head Synthesis via 3D Gaussian Splatting
di: Yu, Hongyun, et al.
Pubblicazione: (2024)
di: Yu, Hongyun, et al.
Pubblicazione: (2024)
"The Intangible Victory", Interactive Audiovisual Installation
di: Tsioutas, Konstantinos, et al.
Pubblicazione: (2026)
di: Tsioutas, Konstantinos, et al.
Pubblicazione: (2026)
InaGVAD : a Challenging French TV and Radio Corpus Annotated for Speech Activity Detection and Speaker Gender Segmentation
di: Doukhan, David, et al.
Pubblicazione: (2024)
di: Doukhan, David, et al.
Pubblicazione: (2024)
FLARE: Full-Modality Long-Video Audiovisual Retrieval Benchmark with User-Simulated Queries
di: You, Qijie, et al.
Pubblicazione: (2026)
di: You, Qijie, et al.
Pubblicazione: (2026)
$C^2$AV-TSE: Context and Confidence-aware Audio Visual Target Speaker Extraction
di: Wu, Wenxuan, et al.
Pubblicazione: (2025)
di: Wu, Wenxuan, et al.
Pubblicazione: (2025)
G-STAR: End-to-End Global Speaker-Tracking Attributed Recognition
di: Peng, Jing, et al.
Pubblicazione: (2026)
di: Peng, Jing, et al.
Pubblicazione: (2026)
CLAIP-Emo: Parameter-Efficient Adaptation of Language-supervised models for In-the-Wild Audiovisual Emotion Recognition
di: Chen, Yin, et al.
Pubblicazione: (2025)
di: Chen, Yin, et al.
Pubblicazione: (2025)
ReactMotion: Generating Reactive Listener Motions from Speaker Utterance
di: Luo, Cheng, et al.
Pubblicazione: (2026)
di: Luo, Cheng, et al.
Pubblicazione: (2026)
Information Need in Metaverse Recordings -- A Field Study
di: Steinert, Patrick, et al.
Pubblicazione: (2024)
di: Steinert, Patrick, et al.
Pubblicazione: (2024)
VoxAging: Continuously Tracking Speaker Aging with a Large-Scale Longitudinal Dataset in English and Mandarin
di: Ai, Zhiqi, et al.
Pubblicazione: (2025)
di: Ai, Zhiqi, et al.
Pubblicazione: (2025)
AMuSE: Adaptive Multimodal Analysis for Speaker Emotion Recognition in Group Conversations
di: Devulapally, Naresh Kumar, et al.
Pubblicazione: (2024)
di: Devulapally, Naresh Kumar, et al.
Pubblicazione: (2024)
TopoCode: Topologically Informed Error Detection and Correction in Communication Systems
di: Guo, Hongzhi
Pubblicazione: (2024)
di: Guo, Hongzhi
Pubblicazione: (2024)
MOMENTA: Mixture-of-Experts Over Multimodal Embeddings with Neural Temporal Aggregation for Misinformation Detection
di: Abdollahinejad, Yeganeh, et al.
Pubblicazione: (2026)
di: Abdollahinejad, Yeganeh, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings
di: Clarke, Jason, et al.
Pubblicazione: (2025) -
Ensembling Synchronisation-based and Face-Voice Association Paradigms for Robust Active Speaker Detection in Egocentric Recordings
di: Clarke, Jason, et al.
Pubblicazione: (2025) -
EgoAdapt: Enhancing Robustness in Egocentric Interactive Speaker Detection Under Missing Modalities
di: Qian, Xinyuan, et al.
Pubblicazione: (2026) -
Robust Active Speaker Detection in Noisy Environments
di: Vasireddy, Siva Sai Nagender, et al.
Pubblicazione: (2024) -
A Toolkit for Joint Speaker Diarization and Identification with Application to Speaker-Attributed ASR
di: Morrone, Giovanni, et al.
Pubblicazione: (2024)