Plug-and-Play Co-Occurring Face Attention for Robust Audio-Visual Speaker Extraction
Fuente:
arXiv
Salvato in:
| Autori principali: | Pan, Zexu, Zhao, Shengkui, Wang, Tingting, Zhou, Kun, Ma, Yukun, Zhang, Chong, Ma, Bin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Online Audio-Visual Autoregressive Speaker Extraction
di: Pan, Zexu, et al.
Pubblicazione: (2025)
di: Pan, Zexu, et al.
Pubblicazione: (2025)
HiFi-SR: A Unified Generative Transformer-Convolutional Adversarial Network for High-Fidelity Speech Super-Resolution
di: Zhao, Shengkui, et al.
Pubblicazione: (2025)
di: Zhao, Shengkui, et al.
Pubblicazione: (2025)
Conditional Latent Diffusion-Based Speech Enhancement Via Dual Context Learning
di: Zhao, Shengkui, et al.
Pubblicazione: (2025)
di: Zhao, Shengkui, et al.
Pubblicazione: (2025)
ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment
di: Zhao, Shengkui, et al.
Pubblicazione: (2025)
di: Zhao, Shengkui, et al.
Pubblicazione: (2025)
Beyond Lips: Integrating Gesture and Lip Cues for Robust Audio-visual Speaker Extraction
di: Pan, Zexu, et al.
Pubblicazione: (2026)
di: Pan, Zexu, et al.
Pubblicazione: (2026)
Plug-and-Steer: Decoupling Separation and Selection in Audio-Visual Target Speaker Extraction
di: Kwak, Doyeop, et al.
Pubblicazione: (2026)
di: Kwak, Doyeop, et al.
Pubblicazione: (2026)
Audio-Visual Target Speaker Extraction with Reverse Selective Auditory Attention
di: Tao, Ruijie, et al.
Pubblicazione: (2024)
di: Tao, Ruijie, et al.
Pubblicazione: (2024)
Improved Feature Extraction Network for Neuro-Oriented Target Speaker Extraction
di: Fan, Cunhang, et al.
Pubblicazione: (2025)
di: Fan, Cunhang, et al.
Pubblicazione: (2025)
MossFormer2: Combining Transformer and RNN-Free Recurrent Network for Enhanced Time-Domain Monaural Speech Separation
di: Zhao, Shengkui, et al.
Pubblicazione: (2023)
di: Zhao, Shengkui, et al.
Pubblicazione: (2023)
Robust Audio-Visual Target Speaker Extraction with Emotion-Aware Multiple Enrollment Fusion
di: Jin, Zhan, et al.
Pubblicazione: (2025)
di: Jin, Zhan, et al.
Pubblicazione: (2025)
Monaural Speech Enhancement with Complex Convolutional Block Attention Module and Joint Time Frequency Losses
di: Zhao, Shengkui, et al.
Pubblicazione: (2021)
di: Zhao, Shengkui, et al.
Pubblicazione: (2021)
Two-stage Audio-Visual Target Speaker Extraction System for Real-Time Processing On Edge Device
di: Li, Zixuan, et al.
Pubblicazione: (2025)
di: Li, Zixuan, et al.
Pubblicazione: (2025)
SPGM: Prioritizing Local Features for enhanced speech separation performance
di: Yip, Jia Qi, et al.
Pubblicazione: (2023)
di: Yip, Jia Qi, et al.
Pubblicazione: (2023)
M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction
di: Fan, Cunhang, et al.
Pubblicazione: (2025)
di: Fan, Cunhang, et al.
Pubblicazione: (2025)
Towards Audio Codec-based Speech Separation
di: Yip, Jia Qi, et al.
Pubblicazione: (2024)
di: Yip, Jia Qi, et al.
Pubblicazione: (2024)
Mel-Refine: A Plug-and-Play Approach to Refine Mel-Spectrogram in Audio Generation
di: Guo, Hongming, et al.
Pubblicazione: (2024)
di: Guo, Hongming, et al.
Pubblicazione: (2024)
FRCRN: Boosting Feature Representation using Frequency Recurrence for Monaural Speech Enhancement
di: Zhao, Shengkui, et al.
Pubblicazione: (2022)
di: Zhao, Shengkui, et al.
Pubblicazione: (2022)
Phonetic Enhanced Language Modeling for Text-to-Speech Synthesis
di: Zhou, Kun, et al.
Pubblicazione: (2024)
di: Zhou, Kun, et al.
Pubblicazione: (2024)
LuSeeL: Language-queried Binaural Universal Sound Event Extraction and Localization
di: Pan, Zexu, et al.
Pubblicazione: (2026)
di: Pan, Zexu, et al.
Pubblicazione: (2026)
RAVSS: Robust Audio-Visual Speech Separation in Multi-Speaker Scenarios with Missing Visual Cues
di: Pan, Tianrui, et al.
Pubblicazione: (2024)
di: Pan, Tianrui, et al.
Pubblicazione: (2024)
pTSE-T: Presentation Target Speaker Extraction using Unaligned Text Cues
di: Jiang, Ziyang, et al.
Pubblicazione: (2024)
di: Jiang, Ziyang, et al.
Pubblicazione: (2024)
Emotional Dimension Control in Language Model-Based Text-to-Speech: Spanning a Broad Spectrum of Human Emotions
di: Zhou, Kun, et al.
Pubblicazione: (2024)
di: Zhou, Kun, et al.
Pubblicazione: (2024)
An Investigation on Speaker Augmentation for End-to-End Speaker Extraction
di: You, Zhenghai, et al.
Pubblicazione: (2025)
di: You, Zhenghai, et al.
Pubblicazione: (2025)
PPPR: Portable Plug-in Prompt Refiner for Text to Audio Generation
di: Shi, Shuchen, et al.
Pubblicazione: (2024)
di: Shi, Shuchen, et al.
Pubblicazione: (2024)
InspireMusic: Integrating Super Resolution and Large Language Model for High-Fidelity Long-Form Music Generation
di: Zhang, Chong, et al.
Pubblicazione: (2025)
di: Zhang, Chong, et al.
Pubblicazione: (2025)
E2E-AEC: Implementing an end-to-end neural network learning approach for acoustic echo cancellation
di: Jiang, Yiheng, et al.
Pubblicazione: (2026)
di: Jiang, Yiheng, et al.
Pubblicazione: (2026)
CoPlay: Audio-agnostic Cognitive Scaling for Acoustic Sensing
di: Li, Yin, et al.
Pubblicazione: (2024)
di: Li, Yin, et al.
Pubblicazione: (2024)
Audio-Visual Speaker Tracking: Progress, Challenges, and Future Directions
di: Zhao, Jinzheng, et al.
Pubblicazione: (2023)
di: Zhao, Jinzheng, et al.
Pubblicazione: (2023)
Multi-Level Speaker Representation for Target Speaker Extraction
di: Zhang, Ke, et al.
Pubblicazione: (2024)
di: Zhang, Ke, et al.
Pubblicazione: (2024)
Robust Training for Speaker Verification against Noisy Labels
di: Fang, Zhihua, et al.
Pubblicazione: (2022)
di: Fang, Zhihua, et al.
Pubblicazione: (2022)
Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling
di: Wu, Shu, et al.
Pubblicazione: (2025)
di: Wu, Shu, et al.
Pubblicazione: (2025)
Speaker Recognition Using Isomorphic Graph Attention Network Based Pooling on Self-Supervised Representation
di: Ge, Zirui, et al.
Pubblicazione: (2023)
di: Ge, Zirui, et al.
Pubblicazione: (2023)
Array Geometry-Robust Attention-Based Neural Beamformer for Moving Speakers
di: Tammen, Marvin, et al.
Pubblicazione: (2024)
di: Tammen, Marvin, et al.
Pubblicazione: (2024)
Review of MEMS Speakers for Audio Applications
di: Wittek, Nils, et al.
Pubblicazione: (2025)
di: Wittek, Nils, et al.
Pubblicazione: (2025)
Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR
di: Ma, Hao, et al.
Pubblicazione: (2025)
di: Ma, Hao, et al.
Pubblicazione: (2025)
A Stage-Wise Learning Strategy with Fixed Anchors for Robust Speaker Verification
di: Gu, Bin, et al.
Pubblicazione: (2025)
di: Gu, Bin, et al.
Pubblicazione: (2025)
Noise-Conditioned Mixture-of-Experts Framework for Robust Speaker Verification
di: Gu, Bin, et al.
Pubblicazione: (2025)
di: Gu, Bin, et al.
Pubblicazione: (2025)
USEF-TSE: Universal Speaker Embedding Free Target Speaker Extraction
di: Zeng, Bang, et al.
Pubblicazione: (2024)
di: Zeng, Bang, et al.
Pubblicazione: (2024)
Leveraging Mamba with Full-Face Vision for Audio-Visual Speech Enhancement
di: Chao, Rong, et al.
Pubblicazione: (2025)
di: Chao, Rong, et al.
Pubblicazione: (2025)
Target Speaker Extraction with Curriculum Learning
di: Liu, Yun, et al.
Pubblicazione: (2024)
di: Liu, Yun, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Online Audio-Visual Autoregressive Speaker Extraction
di: Pan, Zexu, et al.
Pubblicazione: (2025) -
HiFi-SR: A Unified Generative Transformer-Convolutional Adversarial Network for High-Fidelity Speech Super-Resolution
di: Zhao, Shengkui, et al.
Pubblicazione: (2025) -
Conditional Latent Diffusion-Based Speech Enhancement Via Dual Context Learning
di: Zhao, Shengkui, et al.
Pubblicazione: (2025) -
ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment
di: Zhao, Shengkui, et al.
Pubblicazione: (2025) -
Beyond Lips: Integrating Gesture and Lip Cues for Robust Audio-visual Speaker Extraction
di: Pan, Zexu, et al.
Pubblicazione: (2026)