Enregistré dans:
| Auteurs principaux: | Ravizza, Gabriele, Villegas, Julián, Volk, Christer P., Stegenborg-Andersen, Tore, Pei, Yan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2512.08313 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Adaptive Deterministic Flow Matching for Target Speaker Extraction
par: Hsieh, Tsun-An, et autres
Publié: (2025)
par: Hsieh, Tsun-An, et autres
Publié: (2025)
Spatial-Filter-Bank-Based Neural Method for Multichannel Speech Enhancement
par: Zheng, Tianqin, et autres
Publié: (2025)
par: Zheng, Tianqin, et autres
Publié: (2025)
Target Speaker Selection for Neural Network Beamforming in Multi-Speaker Scenarios
par: Fiorio, Luan Vinícius, et autres
Publié: (2025)
par: Fiorio, Luan Vinícius, et autres
Publié: (2025)
A Unified Neural Codec Language Model for Selective Editable Text to Speech Generation
par: Pei, Hanchen, et autres
Publié: (2026)
par: Pei, Hanchen, et autres
Publié: (2026)
Flexible Multi-Channel Target Speaker Extraction Using Geometry-Conditioned Spatially Selective Non-linear Filters
par: Li, Jiatong, et autres
Publié: (2026)
par: Li, Jiatong, et autres
Publié: (2026)
Audio-Visual Target Speaker Extraction with Reverse Selective Auditory Attention
par: Tao, Ruijie, et autres
Publié: (2024)
par: Tao, Ruijie, et autres
Publié: (2024)
Binaural Selective Attention Model for Target Speaker Extraction
par: Meng, Hanyu, et autres
Publié: (2024)
par: Meng, Hanyu, et autres
Publié: (2024)
DITTO: Data-efficient and Fair Targeted Subset Selection for ASR Accent Adaptation
par: Kothawade, Suraj, et autres
Publié: (2021)
par: Kothawade, Suraj, et autres
Publié: (2021)
Cross-attention Inspired Selective State Space Models for Target Sound Extraction
par: Wu, Donghang, et autres
Publié: (2024)
par: Wu, Donghang, et autres
Publié: (2024)
GAN-Based Multi-Microphone Spatial Target Speaker Extraction
par: Shetu, Shrishti Saha, et autres
Publié: (2025)
par: Shetu, Shrishti Saha, et autres
Publié: (2025)
Adaptive Federated Fine-Tuning of Self-Supervised Speech Representations
par: Guo, Xin, et autres
Publié: (2026)
par: Guo, Xin, et autres
Publié: (2026)
An End-To-End Stuttering Detection Method Based On Conformer And BILSTM
par: Liu, Xiaokang, et autres
Publié: (2024)
par: Liu, Xiaokang, et autres
Publié: (2024)
Room Impulse Response Prediction with Neural Networks: From Energy Decay Curves to Perceptual Validation
par: Muhammad, Imran, et autres
Publié: (2025)
par: Muhammad, Imran, et autres
Publié: (2025)
Deep Learning-Based Prediction of Energy Decay Curves from Room Geometry and Material Properties
par: Muhammad, Imran, et autres
Publié: (2025)
par: Muhammad, Imran, et autres
Publié: (2025)
Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction
par: Korse, Srikanth, et autres
Publié: (2025)
par: Korse, Srikanth, et autres
Publié: (2025)
Curved Worlds, Clear Boundaries: Generalizing Speech Deepfake Detection using Hyperbolic and Spherical Geometry Spaces
par: Sheth, Farhan, et autres
Publié: (2025)
par: Sheth, Farhan, et autres
Publié: (2025)
Adaptive Learning via a Negative Selection Strategy for Few-Shot Bioacoustic Event Detection
par: Chen, Yaxiong, et autres
Publié: (2024)
par: Chen, Yaxiong, et autres
Publié: (2024)
Text-Queried Target Sound Event Localization
par: Zhao, Jinzheng, et autres
Publié: (2024)
par: Zhao, Jinzheng, et autres
Publié: (2024)
EvoTSE: Evolving Enrollment for Target Speaker Extraction
par: Liu, Zikai, et autres
Publié: (2026)
par: Liu, Zikai, et autres
Publié: (2026)
Plug-and-Steer: Decoupling Separation and Selection in Audio-Visual Target Speaker Extraction
par: Kwak, Doyeop, et autres
Publié: (2026)
par: Kwak, Doyeop, et autres
Publié: (2026)
TGIF: Talker Group-Informed Familiarization of Target Speaker Extraction
par: Hsieh, Tsun-An, et autres
Publié: (2025)
par: Hsieh, Tsun-An, et autres
Publié: (2025)
Detect, Attend and Extract: Keyword Guided Target Speaker Extraction
par: Li, Haoyu, et autres
Publié: (2026)
par: Li, Haoyu, et autres
Publié: (2026)
Multi-View Based Audio Visual Target Speaker Extraction
par: Yang, Peijun, et autres
Publié: (2026)
par: Yang, Peijun, et autres
Publié: (2026)
Adaptive high-precision sound source localization at low frequencies based on convolutional neural network
par: Ma, Wenbo, et autres
Publié: (2024)
par: Ma, Wenbo, et autres
Publié: (2024)
AS-Speech: Adaptive Style For Speech Synthesis
par: Li, Zhipeng, et autres
Publié: (2024)
par: Li, Zhipeng, et autres
Publié: (2024)
Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings
par: Herreilers, Julian, et autres
Publié: (2025)
par: Herreilers, Julian, et autres
Publié: (2025)
Analysis and Extension of Noisy-target Training for Unsupervised Target Signal Enhancement
par: Fujimura, Takuya, et autres
Publié: (2025)
par: Fujimura, Takuya, et autres
Publié: (2025)
ARTT: Augmented Reverberant-Target Training for Unsupervised Monaural Speech Dereverberation
par: Song, Siqi, et autres
Publié: (2026)
par: Song, Siqi, et autres
Publié: (2026)
EEND-SAA: Enrollment-Less Main Speaker Voice Activity Detection Using Self-Attention Attractors
par: Wu, Wen-Yung, et autres
Publié: (2025)
par: Wu, Wen-Yung, et autres
Publié: (2025)
Two-stage Audio-Visual Target Speaker Extraction System for Real-Time Processing On Edge Device
par: Li, Zixuan, et autres
Publié: (2025)
par: Li, Zixuan, et autres
Publié: (2025)
Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation
par: Zhang, Jing-Xuan, et autres
Publié: (2025)
par: Zhang, Jing-Xuan, et autres
Publié: (2025)
Multi-Channel Multi-Speaker ASR Using Target Speaker's Solo Segment
par: Shao, Yiwen, et autres
Publié: (2024)
par: Shao, Yiwen, et autres
Publié: (2024)
Target Speaker Extraction by Directly Exploiting Contextual Information in the Time-Frequency Domain
par: Yang, Xue, et autres
Publié: (2024)
par: Yang, Xue, et autres
Publié: (2024)
Prompt-driven Target Speech Diarization
par: Jiang, Yidi, et autres
Publié: (2023)
par: Jiang, Yidi, et autres
Publié: (2023)
Trainable Adaptive Score Normalization for Automatic Speaker Verification
par: Choi, Jeong-Hwan, et autres
Publié: (2025)
par: Choi, Jeong-Hwan, et autres
Publié: (2025)
TripleC Learning and Lightweight Speech Enhancement for Multi-Condition Target Speech Extraction
par: Huang, Ziling
Publié: (2025)
par: Huang, Ziling
Publié: (2025)
MeanFlow-TSE: One-Step Generative Target Speaker Extraction with Mean Flow
par: Shimizu, Riki, et autres
Publié: (2025)
par: Shimizu, Riki, et autres
Publié: (2025)
Inter-Speaker Relative Cues for Two-Stage Text-Guided Target Speech Extraction
par: Dai, Wang, et autres
Publié: (2026)
par: Dai, Wang, et autres
Publié: (2026)
Subspace Track-before-Detect for Passive Multi-Target Tracking with Unknown Emitted Signals
par: Ito, Nobutaka, et autres
Publié: (2026)
par: Ito, Nobutaka, et autres
Publié: (2026)
Exploiting Noise Inseparability for Weakly-Supervised Discriminative Speech Denoising Using Noisy Targets
par: Maciejewski, Matthew, et autres
Publié: (2026)
par: Maciejewski, Matthew, et autres
Publié: (2026)
Documents similaires
-
Adaptive Deterministic Flow Matching for Target Speaker Extraction
par: Hsieh, Tsun-An, et autres
Publié: (2025) -
Spatial-Filter-Bank-Based Neural Method for Multichannel Speech Enhancement
par: Zheng, Tianqin, et autres
Publié: (2025) -
Target Speaker Selection for Neural Network Beamforming in Multi-Speaker Scenarios
par: Fiorio, Luan Vinícius, et autres
Publié: (2025) -
A Unified Neural Codec Language Model for Selective Editable Text to Speech Generation
par: Pei, Hanchen, et autres
Publié: (2026) -
Flexible Multi-Channel Target Speaker Extraction Using Geometry-Conditioned Spatially Selective Non-linear Filters
par: Li, Jiatong, et autres
Publié: (2026)