CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Jiadong, Zhang, Ke, Qian, Xinyuan, Tao, Ruijie, Li, Haizhou, Schuller, Björn |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
pTSE-T: Presentation Target Speaker Extraction using Unaligned Text Cues
por: Jiang, Ziyang, et al.
Publicado: (2024)
por: Jiang, Ziyang, et al.
Publicado: (2024)
MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues
por: Li, Junjie, et al.
Publicado: (2024)
por: Li, Junjie, et al.
Publicado: (2024)
RAVSS: Robust Audio-Visual Speech Separation in Multi-Speaker Scenarios with Missing Visual Cues
por: Pan, Tianrui, et al.
Publicado: (2024)
por: Pan, Tianrui, et al.
Publicado: (2024)
$C^2$AV-TSE: Context and Confidence-aware Audio Visual Target Speaker Extraction
por: Wu, Wenxuan, et al.
Publicado: (2025)
por: Wu, Wenxuan, et al.
Publicado: (2025)
Cinematic Audio Source Separation Using Visual Cues
por: Zhang, Kang, et al.
Publicado: (2026)
por: Zhang, Kang, et al.
Publicado: (2026)
AFL-Net: Integrating Audio, Facial, and Lip Modalities with a Two-step Cross-attention for Robust Speaker Diarization in the Wild
por: Yin, Yongkang, et al.
Publicado: (2023)
por: Yin, Yongkang, et al.
Publicado: (2023)
Audio-Visual Target Speaker Extraction with Reverse Selective Auditory Attention
por: Tao, Ruijie, et al.
Publicado: (2024)
por: Tao, Ruijie, et al.
Publicado: (2024)
MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions
por: Li, Junjie, et al.
Publicado: (2025)
por: Li, Junjie, et al.
Publicado: (2025)
Human-Inspired Computing for Robust and Efficient Audio-Visual Speech Recognition
por: Liu, Qianhui, et al.
Publicado: (2024)
por: Liu, Qianhui, et al.
Publicado: (2024)
Enhancing Vision-Language Tracking by Effectively Converting Textual Cues into Visual Cues
por: Feng, X., et al.
Publicado: (2024)
por: Feng, X., et al.
Publicado: (2024)
EgoAdapt: Enhancing Robustness in Egocentric Interactive Speaker Detection Under Missing Modalities
por: Qian, Xinyuan, et al.
Publicado: (2026)
por: Qian, Xinyuan, et al.
Publicado: (2026)
Emotional Cues Extraction and Fusion for Multi-modal Emotion Prediction and Recognition in Conversation
por: Shi, Haoxiang, et al.
Publicado: (2024)
por: Shi, Haoxiang, et al.
Publicado: (2024)
Beyond Isolated Utterances: Cue-Guided Interaction for Context-Dependent Conversational Multimodal Understanding
por: Pan, Zhaoyan, et al.
Publicado: (2026)
por: Pan, Zhaoyan, et al.
Publicado: (2026)
Boosting Audio Visual Question Answering via Key Semantic-Aware Cues
por: Li, Guangyao, et al.
Publicado: (2024)
por: Li, Guangyao, et al.
Publicado: (2024)
PerformSinger: Multimodal Singing Voice Synthesis Leveraging Synchronized Lip Cues from Singing Performance Videos
por: Gu, Ke, et al.
Publicado: (2025)
por: Gu, Ke, et al.
Publicado: (2025)
Audio-Visual Speaker Tracking: Progress, Challenges, and Future Directions
por: Zhao, Jinzheng, et al.
Publicado: (2023)
por: Zhao, Jinzheng, et al.
Publicado: (2023)
Cross-Modality and Within-Modality Regularization for Audio-Visual DeepFake Detection
por: Zou, Heqing, et al.
Publicado: (2024)
por: Zou, Heqing, et al.
Publicado: (2024)
AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues
por: Zhou, Dingkun, et al.
Publicado: (2025)
por: Zhou, Dingkun, et al.
Publicado: (2025)
Audio-Visual Cross-Modal Compression for Generative Face Video Coding
por: Xu, Youmin, et al.
Publicado: (2025)
por: Xu, Youmin, et al.
Publicado: (2025)
Target Speech Diarization with Multimodal Prompts
por: Jiang, Yidi, et al.
Publicado: (2024)
por: Jiang, Yidi, et al.
Publicado: (2024)
ELEGANCE: Efficient LLM Guidance for Audio-Visual Target Speech Extraction
por: Wu, Wenxuan, et al.
Publicado: (2025)
por: Wu, Wenxuan, et al.
Publicado: (2025)
Enhancing Real-World Active Speaker Detection with Multi-Modal Extraction Pre-Training
por: Tao, Ruijie, et al.
Publicado: (2024)
por: Tao, Ruijie, et al.
Publicado: (2024)
Plug-and-Steer: Decoupling Separation and Selection in Audio-Visual Target Speaker Extraction
por: Kwak, Doyeop, et al.
Publicado: (2026)
por: Kwak, Doyeop, et al.
Publicado: (2026)
CineSRD: Leveraging Visual, Acoustic, and Linguistic Cues for Open-World Visual Media Speaker Diarization
por: Huang, Liangbin, et al.
Publicado: (2026)
por: Huang, Liangbin, et al.
Publicado: (2026)
Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction
por: Wu, Wenxuan, et al.
Publicado: (2025)
por: Wu, Wenxuan, et al.
Publicado: (2025)
Robust Wake Word Spotting With Frame-Level Cross-Modal Attention Based Audio-Visual Conformer
por: Wang, Haoxu, et al.
Publicado: (2024)
por: Wang, Haoxu, et al.
Publicado: (2024)
AVID: A Benchmark for Omni-Modal Audio-Visual Inconsistency Understanding via Agent-Driven Construction
por: Chen, Zixuan, et al.
Publicado: (2026)
por: Chen, Zixuan, et al.
Publicado: (2026)
EMID: An Emotional Aligned Dataset in Audio-Visual Modality
por: Zou, Jialing, et al.
Publicado: (2023)
por: Zou, Jialing, et al.
Publicado: (2023)
Beyond Lips: Integrating Gesture and Lip Cues for Robust Audio-visual Speaker Extraction
por: Pan, Zexu, et al.
Publicado: (2026)
por: Pan, Zexu, et al.
Publicado: (2026)
SAV-SE: Scene-aware Audio-Visual Speech Enhancement with Selective State Space Model
por: Qian, Xinyuan, et al.
Publicado: (2024)
por: Qian, Xinyuan, et al.
Publicado: (2024)
Listening and Seeing Again: Generative Error Correction for Audio-Visual Speech Recognition
por: Liu, Rui, et al.
Publicado: (2025)
por: Liu, Rui, et al.
Publicado: (2025)
Robust LLM-based Audio-Visual Speech Recognition with Sparse Modality Alignment and Visual Unit-Guided Refinement
por: Su, Fei, et al.
Publicado: (2026)
por: Su, Fei, et al.
Publicado: (2026)
Teacher-Guided Pseudo Supervision and Cross-Modal Alignment for Audio-Visual Video Parsing
por: Chen, Yaru, et al.
Publicado: (2025)
por: Chen, Yaru, et al.
Publicado: (2025)
Separate in the Speech Chain: Cross-Modal Conditional Audio-Visual Target Speech Extraction
por: Mu, Zhaoxi, et al.
Publicado: (2024)
por: Mu, Zhaoxi, et al.
Publicado: (2024)
BRIDGE: Bridging Gaps in Image Captioning Evaluation with Stronger Visual Cues
por: Sarto, Sara, et al.
Publicado: (2024)
por: Sarto, Sara, et al.
Publicado: (2024)
AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition
por: Liu, Zehua, et al.
Publicado: (2024)
por: Liu, Zehua, et al.
Publicado: (2024)
Taming Modality Entanglement in Continual Audio-Visual Segmentation
por: Hong, Yuyang, et al.
Publicado: (2025)
por: Hong, Yuyang, et al.
Publicado: (2025)
AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers
por: Araujo, Edson, et al.
Publicado: (2026)
por: Araujo, Edson, et al.
Publicado: (2026)
Quality-Aware End-to-End Audio-Visual Neural Speaker Diarization
por: He, Mao-Kui, et al.
Publicado: (2024)
por: He, Mao-Kui, et al.
Publicado: (2024)
HDA-SELD: Hierarchical Cross-Modal Distillation with Multi-Level Data Augmentation for Low-Resource Audio-Visual Sound Event Localization and Detection
por: Wang, Qing, et al.
Publicado: (2025)
por: Wang, Qing, et al.
Publicado: (2025)
Ejemplares similares
-
pTSE-T: Presentation Target Speaker Extraction using Unaligned Text Cues
por: Jiang, Ziyang, et al.
Publicado: (2024) -
MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues
por: Li, Junjie, et al.
Publicado: (2024) -
RAVSS: Robust Audio-Visual Speech Separation in Multi-Speaker Scenarios with Missing Visual Cues
por: Pan, Tianrui, et al.
Publicado: (2024) -
$C^2$AV-TSE: Context and Confidence-aware Audio Visual Target Speaker Extraction
por: Wu, Wenxuan, et al.
Publicado: (2025) -
Cinematic Audio Source Separation Using Visual Cues
por: Zhang, Kang, et al.
Publicado: (2026)