DASB - Discrete Audio and Speech Benchmark
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Mousavi, Pooneh, Duret, Jarod, Petermann, Darius, Ploujnikov, Artem, Della Libera, Luca, Kuznetsova, Anastasia, Subakan, Cem, Ravanelli, Mirco |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
How Should We Extract Discrete Audio Tokens from Self-Supervised Models?
par: Mousavi, Pooneh, et autres
Publié: (2024)
par: Mousavi, Pooneh, et autres
Publié: (2024)
What Are They Doing? Joint Audio-Speech Co-Reasoning
par: Wang, Yingzhi, et autres
Publié: (2024)
par: Wang, Yingzhi, et autres
Publié: (2024)
LL-SDR: Low-Latency Speech enhancement through Discrete Representations
par: Li, Jingyi, et autres
Publié: (2026)
par: Li, Jingyi, et autres
Publié: (2026)
Autoregressive Speech Enhancement via Acoustic Tokens
par: Della Libera, Luca, et autres
Publié: (2025)
par: Della Libera, Luca, et autres
Publié: (2025)
Listen First, Then Answer: Timestamp-Grounded Speech Reasoning
par: Jeong, Jihoon, et autres
Publié: (2026)
par: Jeong, Jihoon, et autres
Publié: (2026)
FocalCodec-Stream: Streaming Low-Bitrate Speech Coding via Causal Distillation
par: Della Libera, Luca, et autres
Publié: (2025)
par: Della Libera, Luca, et autres
Publié: (2025)
Focal Modulation Networks for Interpretable Sound Classification
par: Della Libera, Luca, et autres
Publié: (2024)
par: Della Libera, Luca, et autres
Publié: (2024)
ALAS: Measuring Latent Speech-Text Alignment For Spoken Language Understanding In Multimodal LLMs
par: Mousavi, Pooneh, et autres
Publié: (2025)
par: Mousavi, Pooneh, et autres
Publié: (2025)
LiSTEN: Learning Soft Token Embeddings for Neural Audio LLMs
par: Mousavi, Pooneh, et autres
Publié: (2025)
par: Mousavi, Pooneh, et autres
Publié: (2025)
Listenable Maps for Zero-Shot Audio Classifiers
par: Paissan, Francesco, et autres
Publié: (2024)
par: Paissan, Francesco, et autres
Publié: (2024)
FocalCodec: Low-Bitrate Speech Coding via Focal Modulation Networks
par: Della Libera, Luca, et autres
Publié: (2025)
par: Della Libera, Luca, et autres
Publié: (2025)
Audio Editing with Non-Rigid Text Prompts
par: Paissan, Francesco, et autres
Publié: (2023)
par: Paissan, Francesco, et autres
Publié: (2023)
Discrete Audio Tokens: More Than a Survey!
par: Mousavi, Pooneh, et autres
Publié: (2025)
par: Mousavi, Pooneh, et autres
Publié: (2025)
Listenable Maps for Audio Classifiers
par: Paissan, Francesco, et autres
Publié: (2024)
par: Paissan, Francesco, et autres
Publié: (2024)
Investigating Faithfulness in Large Audio Language Models
par: Mousavi, Pooneh, et autres
Publié: (2025)
par: Mousavi, Pooneh, et autres
Publié: (2025)
Phoneme Discretized Saliency Maps for Explainable Detection of AI-Generated Voice
par: Gupta, Shubham, et autres
Publié: (2024)
par: Gupta, Shubham, et autres
Publié: (2024)
Resource-Efficient Separation Transformer
par: Della Libera, Luca, et autres
Publié: (2022)
par: Della Libera, Luca, et autres
Publié: (2022)
LMAC-TD: Producing Time Domain Explanations for Audio Classifiers
par: Mancini, Eleonora, et autres
Publié: (2024)
par: Mancini, Eleonora, et autres
Publié: (2024)
Investigating the Effectiveness of Explainability Methods in Parkinson's Detection from Speech
par: Mancini, Eleonora, et autres
Publié: (2024)
par: Mancini, Eleonora, et autres
Publié: (2024)
Hyperbolic Distance-Based Speech Separation
par: Petermann, Darius, et autres
Publié: (2024)
par: Petermann, Darius, et autres
Publié: (2024)
Toward Faithful Explanations in Acoustic Anomaly Detection
par: Elrashid, Maab, et autres
Publié: (2026)
par: Elrashid, Maab, et autres
Publié: (2026)
Beyond Fixed Frames: Dynamic Character-Aligned Speech Tokenization
par: Della Libera, Luca, et autres
Publié: (2026)
par: Della Libera, Luca, et autres
Publié: (2026)
WavSLM: Single-Stream Speech Language Modeling via WavLM Distillation
par: Della Libera, Luca, et autres
Publié: (2026)
par: Della Libera, Luca, et autres
Publié: (2026)
MSP-Podcast SER Challenge 2024: L'antenne du Ventoux Multimodal Self-Supervised Learning for Speech Emotion Recognition
par: Duret, Jarod, et autres
Publié: (2024)
par: Duret, Jarod, et autres
Publié: (2024)
Analyzing Speech Unit Selection for Textless Speech-to-Speech Translation
par: Duret, Jarod, et autres
Publié: (2024)
par: Duret, Jarod, et autres
Publié: (2024)
Dynamic HumTrans: Humming Transcription Using CNNs and Dynamic Programming
par: Gupta, Shubham, et autres
Publié: (2024)
par: Gupta, Shubham, et autres
Publié: (2024)
Exploring Token-Space Manipulation in Latent Audio Tokenizers
par: Paissan, Francesco, et autres
Publié: (2026)
par: Paissan, Francesco, et autres
Publié: (2026)
Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation
par: Petermann, Darius, et autres
Publié: (2025)
par: Petermann, Darius, et autres
Publié: (2025)
SKILL: Similarity-aware Knowledge distILLation for Speech Self-Supervised Learning
par: Zampierin, Luca, et autres
Publié: (2024)
par: Zampierin, Luca, et autres
Publié: (2024)
Speech Self-Supervised Representations Benchmarking: a Case for Larger Probing Heads
par: Zaiem, Salah, et autres
Publié: (2023)
par: Zaiem, Salah, et autres
Publié: (2023)
ProGRes: Prompted Generative Rescoring on ASR n-Best
par: Tur, Ada Defne, et autres
Publié: (2024)
par: Tur, Ada Defne, et autres
Publié: (2024)
VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music
par: Shi, Jiatong, et autres
Publié: (2024)
par: Shi, Jiatong, et autres
Publié: (2024)
Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine
par: Kuznetsova, Anastasia, et autres
Publié: (2025)
par: Kuznetsova, Anastasia, et autres
Publié: (2025)
High-Fidelity Speech Enhancement via Discrete Audio Tokens
par: Lanzendörfer, Luca A., et autres
Publié: (2025)
par: Lanzendörfer, Luca A., et autres
Publié: (2025)
Comparison of Speech Tasks in Human Expert and Machine Detection of Parkinson's Disease
par: Plantinga, Peter, et autres
Publié: (2025)
par: Plantinga, Peter, et autres
Publié: (2025)
Audio Prototypical Network For Controllable Music Recommendation
par: Öncel, Fırat, et autres
Publié: (2025)
par: Öncel, Fırat, et autres
Publié: (2025)
LiveSpeech: Low-Latency Zero-shot Text-to-Speech via Autoregressive Modeling of Audio Discrete Codes
par: Dang, Trung, et autres
Publié: (2024)
par: Dang, Trung, et autres
Publié: (2024)
Discrete Audio Representations for Automated Audio Captioning
par: Tian, Jingguang, et autres
Publié: (2025)
par: Tian, Jingguang, et autres
Publié: (2025)
Planing It by Ear: Convolutional Neural Networks for Acoustic Anomaly Detection in Industrial Wood Planers
par: Deschênes, Anthony, et autres
Publié: (2025)
par: Deschênes, Anthony, et autres
Publié: (2025)
VR-PTOLEMAIC: A Virtual Environment for the Perceptual Testing of Spatial Audio Algorithms
par: Ostan, Paolo, et autres
Publié: (2025)
par: Ostan, Paolo, et autres
Publié: (2025)
Documents similaires
-
How Should We Extract Discrete Audio Tokens from Self-Supervised Models?
par: Mousavi, Pooneh, et autres
Publié: (2024) -
What Are They Doing? Joint Audio-Speech Co-Reasoning
par: Wang, Yingzhi, et autres
Publié: (2024) -
LL-SDR: Low-Latency Speech enhancement through Discrete Representations
par: Li, Jingyi, et autres
Publié: (2026) -
Autoregressive Speech Enhancement via Acoustic Tokens
par: Della Libera, Luca, et autres
Publié: (2025) -
Listen First, Then Answer: Timestamp-Grounded Speech Reasoning
par: Jeong, Jihoon, et autres
Publié: (2026)