AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Daning, Wei, Ying |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
RAVSS: Robust Audio-Visual Speech Separation in Multi-Speaker Scenarios with Missing Visual Cues
par: Pan, Tianrui, et autres
Publié: (2024)
par: Pan, Tianrui, et autres
Publié: (2024)
Joint Speaker Features Learning for Audio-visual Multichannel Speech Separation and Recognition
par: Li, Guinan, et autres
Publié: (2024)
par: Li, Guinan, et autres
Publié: (2024)
Jointly Recognizing Speech and Singing Voices Based on Multi-Task Audio Source Separation
par: Bai, Ye, et autres
Publié: (2024)
par: Bai, Ye, et autres
Publié: (2024)
Attractor-Based Speech Separation of Multiple Utterances by Unknown Number of Speakers
par: Wang, Yuzhu, et autres
Publié: (2025)
par: Wang, Yuzhu, et autres
Publié: (2025)
Multi-Scale Accent Modeling and Disentangling for Multi-Speaker Multi-Accent Text-to-Speech Synthesis
par: Zhou, Xuehao, et autres
Publié: (2024)
par: Zhou, Xuehao, et autres
Publié: (2024)
Elevating Robust Multi-Talker ASR by Decoupling Speaker Separation and Speech Recognition
par: Yang, Yufeng, et autres
Publié: (2025)
par: Yang, Yufeng, et autres
Publié: (2025)
Online Audio-Visual Autoregressive Speaker Extraction
par: Pan, Zexu, et autres
Publié: (2025)
par: Pan, Zexu, et autres
Publié: (2025)
A Fast and Lightweight Model for Causal Audio-Visual Speech Separation
par: Sang, Wendi, et autres
Publié: (2025)
par: Sang, Wendi, et autres
Publié: (2025)
AISHELL-5: The First Open-Source In-Car Multi-Channel Multi-Speaker Speech Dataset for Automatic Speech Diarization and Recognition
par: Dai, Yuhang, et autres
Publié: (2025)
par: Dai, Yuhang, et autres
Publié: (2025)
Audio-Visual Speech Separation via Bottleneck Iterative Network
par: Zhang, Sidong, et autres
Publié: (2025)
par: Zhang, Sidong, et autres
Publié: (2025)
Plug-and-Steer: Decoupling Separation and Selection in Audio-Visual Target Speaker Extraction
par: Kwak, Doyeop, et autres
Publié: (2026)
par: Kwak, Doyeop, et autres
Publié: (2026)
Boosting Multi-Speaker Expressive Speech Synthesis with Semi-supervised Contrastive Learning
par: Zhu, Xinfa, et autres
Publié: (2023)
par: Zhu, Xinfa, et autres
Publié: (2023)
Multi-Level Speaker Representation for Target Speaker Extraction
par: Zhang, Ke, et autres
Publié: (2024)
par: Zhang, Ke, et autres
Publié: (2024)
Generating Speakers by Prompting Listener Impressions for Pre-trained Multi-Speaker Text-to-Speech Systems
par: Chen, Zhengyang, et autres
Publié: (2024)
par: Chen, Zhengyang, et autres
Publié: (2024)
FlexIO: Flexible Single- and Multi-Channel Speech Separation and Enhancement
par: Masuyama, Yoshiki, et autres
Publié: (2025)
par: Masuyama, Yoshiki, et autres
Publié: (2025)
Two-stage Audio-Visual Target Speaker Extraction System for Real-Time Processing On Edge Device
par: Li, Zixuan, et autres
Publié: (2025)
par: Li, Zixuan, et autres
Publié: (2025)
Resource-Efficient Adaptation of Speech Foundation Models for Multi-Speaker ASR
par: Wang, Weiqing, et autres
Publié: (2024)
par: Wang, Weiqing, et autres
Publié: (2024)
Multi-Task Corrupted Prediction for Learning Robust Audio-Visual Speech Representation
par: Kim, Sungnyun, et autres
Publié: (2025)
par: Kim, Sungnyun, et autres
Publié: (2025)
Serialized Speech Information Guidance with Overlapped Encoding Separation for Multi-Speaker Automatic Speech Recognition
par: Shi, Hao, et autres
Publié: (2024)
par: Shi, Hao, et autres
Publié: (2024)
MT2KD: Towards A General-Purpose Encoder for Speech, Speaker, and Audio Events
par: Yang, Xiaoyu, et autres
Publié: (2024)
par: Yang, Xiaoyu, et autres
Publié: (2024)
Robust Audio-Visual Target Speaker Extraction with Emotion-Aware Multiple Enrollment Fusion
par: Jin, Zhan, et autres
Publié: (2025)
par: Jin, Zhan, et autres
Publié: (2025)
Scaling Multi-Talker ASR with Speaker-Agnostic Activity Streams
par: He, Xiluo, et autres
Publié: (2025)
par: He, Xiluo, et autres
Publié: (2025)
The DKU System for Multi-Speaker Automatic Speech Recognition in MLC-SLM Challenge
par: Lin, Yuke, et autres
Publié: (2025)
par: Lin, Yuke, et autres
Publié: (2025)
In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion
par: Jin, Jiawei, et autres
Publié: (2025)
par: Jin, Jiawei, et autres
Publié: (2025)
Exploiting Audio-Visual Features with Pretrained AV-HuBERT for Multi-Modal Dysarthric Speech Reconstruction
par: Chen, Xueyuan, et autres
Publié: (2024)
par: Chen, Xueyuan, et autres
Publié: (2024)
Audio-Visual Target Speaker Extraction with Reverse Selective Auditory Attention
par: Tao, Ruijie, et autres
Publié: (2024)
par: Tao, Ruijie, et autres
Publié: (2024)
Uncovering the Visual Contribution in Audio-Visual Speech Recognition
par: Lin, Zhaofeng, et autres
Publié: (2024)
par: Lin, Zhaofeng, et autres
Publié: (2024)
ASRRL-TTS: Agile Speaker Representation Reinforcement Learning for Text-to-Speech Speaker Adaptation
par: Fu, Ruibo, et autres
Publié: (2024)
par: Fu, Ruibo, et autres
Publié: (2024)
Multi-Utterance Speech Separation and Association Trained on Short Segments
par: Wang, Yuzhu, et autres
Publié: (2025)
par: Wang, Yuzhu, et autres
Publié: (2025)
Pretraining Multi-Speaker Identification for Neural Speaker Diarization
par: Horiguchi, Shota, et autres
Publié: (2025)
par: Horiguchi, Shota, et autres
Publié: (2025)
Audio-Visual Representation Learning via Knowledge Distillation from Speech Foundation Models
par: Zhang, Jing-Xuan, et autres
Publié: (2025)
par: Zhang, Jing-Xuan, et autres
Publié: (2025)
Transcription-Free Fine-Tuning of Speech Separation Models for Noisy and Reverberant Multi-Speaker Automatic Speech Recognition
par: Ravenscroft, William, et autres
Publié: (2024)
par: Ravenscroft, William, et autres
Publié: (2024)
Unsupervised Single-Channel Speech Separation with a Diffusion Prior under Speaker-Embedding Guidance
par: Shi, Runwu, et autres
Publié: (2025)
par: Shi, Runwu, et autres
Publié: (2025)
Utilizing Speaker Profiles for Impersonation Audio Detection
par: Gu, Hao, et autres
Publié: (2024)
par: Gu, Hao, et autres
Publié: (2024)
Multiple Choice Learning for Efficient Speech Separation with Many Speakers
par: Perera, David, et autres
Publié: (2024)
par: Perera, David, et autres
Publié: (2024)
Review of MEMS Speakers for Audio Applications
par: Wittek, Nils, et autres
Publié: (2025)
par: Wittek, Nils, et autres
Publié: (2025)
Whisper-PMFA: Partial Multi-Scale Feature Aggregation for Speaker Verification using Whisper Models
par: Zhao, Yiyang, et autres
Publié: (2024)
par: Zhao, Yiyang, et autres
Publié: (2024)
Leveraging Mamba with Full-Face Vision for Audio-Visual Speech Enhancement
par: Chao, Rong, et autres
Publié: (2025)
par: Chao, Rong, et autres
Publié: (2025)
Multi-Stage Speech Bandwidth Extension with Flexible Sampling Rate Control
par: Lu, Ye-Xin, et autres
Publié: (2024)
par: Lu, Ye-Xin, et autres
Publié: (2024)
M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction
par: Fan, Cunhang, et autres
Publié: (2025)
par: Fan, Cunhang, et autres
Publié: (2025)
Documents similaires
-
RAVSS: Robust Audio-Visual Speech Separation in Multi-Speaker Scenarios with Missing Visual Cues
par: Pan, Tianrui, et autres
Publié: (2024) -
Joint Speaker Features Learning for Audio-visual Multichannel Speech Separation and Recognition
par: Li, Guinan, et autres
Publié: (2024) -
Jointly Recognizing Speech and Singing Voices Based on Multi-Task Audio Source Separation
par: Bai, Ye, et autres
Publié: (2024) -
Attractor-Based Speech Separation of Multiple Utterances by Unknown Number of Speakers
par: Wang, Yuzhu, et autres
Publié: (2025) -
Multi-Scale Accent Modeling and Disentangling for Multi-Speaker Multi-Accent Text-to-Speech Synthesis
par: Zhou, Xuehao, et autres
Publié: (2024)