Resource-Efficient Separation Transformer
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Della Libera, Luca, Subakan, Cem, Ravanelli, Mirco, Cornell, Samuele, Lepoutre, Frédéric, Grondin, François |
|---|---|
| Format: | Preprint |
| Publié: |
2022
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Listenable Maps for Zero-Shot Audio Classifiers
par: Paissan, Francesco, et autres
Publié: (2024)
par: Paissan, Francesco, et autres
Publié: (2024)
Autoregressive Speech Enhancement via Acoustic Tokens
par: Della Libera, Luca, et autres
Publié: (2025)
par: Della Libera, Luca, et autres
Publié: (2025)
Focal Modulation Networks for Interpretable Sound Classification
par: Della Libera, Luca, et autres
Publié: (2024)
par: Della Libera, Luca, et autres
Publié: (2024)
FocalCodec-Stream: Streaming Low-Bitrate Speech Coding via Causal Distillation
par: Della Libera, Luca, et autres
Publié: (2025)
par: Della Libera, Luca, et autres
Publié: (2025)
Listenable Maps for Audio Classifiers
par: Paissan, Francesco, et autres
Publié: (2024)
par: Paissan, Francesco, et autres
Publié: (2024)
FocalCodec: Low-Bitrate Speech Coding via Focal Modulation Networks
par: Della Libera, Luca, et autres
Publié: (2025)
par: Della Libera, Luca, et autres
Publié: (2025)
LL-SDR: Low-Latency Speech enhancement through Discrete Representations
par: Li, Jingyi, et autres
Publié: (2026)
par: Li, Jingyi, et autres
Publié: (2026)
LMAC-TD: Producing Time Domain Explanations for Audio Classifiers
par: Mancini, Eleonora, et autres
Publié: (2024)
par: Mancini, Eleonora, et autres
Publié: (2024)
Audio Editing with Non-Rigid Text Prompts
par: Paissan, Francesco, et autres
Publié: (2023)
par: Paissan, Francesco, et autres
Publié: (2023)
Phoneme Discretized Saliency Maps for Explainable Detection of AI-Generated Voice
par: Gupta, Shubham, et autres
Publié: (2024)
par: Gupta, Shubham, et autres
Publié: (2024)
LiSTEN: Learning Soft Token Embeddings for Neural Audio LLMs
par: Mousavi, Pooneh, et autres
Publié: (2025)
par: Mousavi, Pooneh, et autres
Publié: (2025)
Toward Faithful Explanations in Acoustic Anomaly Detection
par: Elrashid, Maab, et autres
Publié: (2026)
par: Elrashid, Maab, et autres
Publié: (2026)
Listen First, Then Answer: Timestamp-Grounded Speech Reasoning
par: Jeong, Jihoon, et autres
Publié: (2026)
par: Jeong, Jihoon, et autres
Publié: (2026)
Speech Self-Supervised Representations Benchmarking: a Case for Larger Probing Heads
par: Zaiem, Salah, et autres
Publié: (2023)
par: Zaiem, Salah, et autres
Publié: (2023)
Investigating the Effectiveness of Explainability Methods in Parkinson's Detection from Speech
par: Mancini, Eleonora, et autres
Publié: (2024)
par: Mancini, Eleonora, et autres
Publié: (2024)
DASB - Discrete Audio and Speech Benchmark
par: Mousavi, Pooneh, et autres
Publié: (2024)
par: Mousavi, Pooneh, et autres
Publié: (2024)
ALAS: Measuring Latent Speech-Text Alignment For Spoken Language Understanding In Multimodal LLMs
par: Mousavi, Pooneh, et autres
Publié: (2025)
par: Mousavi, Pooneh, et autres
Publié: (2025)
How Should We Extract Discrete Audio Tokens from Self-Supervised Models?
par: Mousavi, Pooneh, et autres
Publié: (2024)
par: Mousavi, Pooneh, et autres
Publié: (2024)
Dynamic HumTrans: Humming Transcription Using CNNs and Dynamic Programming
par: Gupta, Shubham, et autres
Publié: (2024)
par: Gupta, Shubham, et autres
Publié: (2024)
Room Transfer Function Reconstruction Using Complex-valued Neural Networks and Irregularly Distributed Microphones
par: Ronchini, Francesca, et autres
Publié: (2024)
par: Ronchini, Francesca, et autres
Publié: (2024)
Reconstruction of Sound Field through Diffusion Models
par: Miotello, Federico, et autres
Publié: (2023)
par: Miotello, Federico, et autres
Publié: (2023)
Investigating Faithfulness in Large Audio Language Models
par: Mousavi, Pooneh, et autres
Publié: (2025)
par: Mousavi, Pooneh, et autres
Publié: (2025)
Implicit neural representation with physics-informed neural networks for the reconstruction of the early part of room impulse responses
par: Pezzoli, Mirco, et autres
Publié: (2023)
par: Pezzoli, Mirco, et autres
Publié: (2023)
End-to-End Integration of Speech Separation and Voice Activity Detection for Low-Latency Diarization of Telephone Conversations
par: Morrone, Giovanni, et autres
Publié: (2023)
par: Morrone, Giovanni, et autres
Publié: (2023)
A Physics-Informed Neural Network-Based Approach for the Spatial Upsampling of Spherical Microphone Arrays
par: Miotello, Federico, et autres
Publié: (2024)
par: Miotello, Federico, et autres
Publié: (2024)
Cross-Talk Speech Reduction, by Separation, for Separation
par: Wang, Zhong-Qiu, et autres
Publié: (2026)
par: Wang, Zhong-Qiu, et autres
Publié: (2026)
A Generalized Bandsplit Neural Network for Cinematic Audio Source Separation
par: Watcharasupat, Karn N., et autres
Publié: (2023)
par: Watcharasupat, Karn N., et autres
Publié: (2023)
The Inverse Drum Machine: Source Separation Through Joint Transcription and Analysis-by-Synthesis
par: Torres, Bernardo, et autres
Publié: (2025)
par: Torres, Bernardo, et autres
Publié: (2025)
Remixing Music for Hearing Aids Using Ensemble of Fine-Tuned Source Separators
par: Daly, Matthew
Publié: (2024)
par: Daly, Matthew
Publié: (2024)
AI-Assisted Music Production: A User Study on Text-to-Music Models
par: Ronchini, Francesca, et autres
Publié: (2025)
par: Ronchini, Francesca, et autres
Publié: (2025)
Mitigating data replication in text-to-audio generative diffusion models through anti-memorization guidance
par: Messina, Francisco, et autres
Publié: (2025)
par: Messina, Francisco, et autres
Publié: (2025)
Learnable Adaptive Time-Frequency Representation via Differentiable Short-Time Fourier Transform
par: Leiber, Maxime, et autres
Publié: (2025)
par: Leiber, Maxime, et autres
Publié: (2025)
MAPSS: Manifold-based Assessment of Perceptual Source Separation
par: Ivry, Amir, et autres
Publié: (2025)
par: Ivry, Amir, et autres
Publié: (2025)
The impact of non-target events in synthetic soundscapes for sound event detection
par: Ronchini, Francesca, et autres
Publié: (2021)
par: Ronchini, Francesca, et autres
Publié: (2021)
ArrayDPS: Unsupervised Blind Speech Separation with a Diffusion Prior
par: Xu, Zhongweiyang, et autres
Publié: (2025)
par: Xu, Zhongweiyang, et autres
Publié: (2025)
SKILL: Similarity-aware Knowledge distILLation for Speech Self-Supervised Learning
par: Zampierin, Luca, et autres
Publié: (2024)
par: Zampierin, Luca, et autres
Publié: (2024)
Lessons Learned from the URGENT 2024 Speech Enhancement Challenge
par: Zhang, Wangyou, et autres
Publié: (2025)
par: Zhang, Wangyou, et autres
Publié: (2025)
FasTUSS: Faster Task-Aware Unified Source Separation
par: Paissan, Francesco, et autres
Publié: (2025)
par: Paissan, Francesco, et autres
Publié: (2025)
FlexIO: Flexible Single- and Multi-Channel Speech Separation and Enhancement
par: Masuyama, Yoshiki, et autres
Publié: (2025)
par: Masuyama, Yoshiki, et autres
Publié: (2025)
A DNN Based Post-Filter to Enhance the Quality of Coded Speech in MDCT Domain
par: Gupta, Kishan, et autres
Publié: (2022)
par: Gupta, Kishan, et autres
Publié: (2022)
Documents similaires
-
Listenable Maps for Zero-Shot Audio Classifiers
par: Paissan, Francesco, et autres
Publié: (2024) -
Autoregressive Speech Enhancement via Acoustic Tokens
par: Della Libera, Luca, et autres
Publié: (2025) -
Focal Modulation Networks for Interpretable Sound Classification
par: Della Libera, Luca, et autres
Publié: (2024) -
FocalCodec-Stream: Streaming Low-Bitrate Speech Coding via Causal Distillation
par: Della Libera, Luca, et autres
Publié: (2025) -
Listenable Maps for Audio Classifiers
par: Paissan, Francesco, et autres
Publié: (2024)