How Should We Extract Discrete Audio Tokens from Self-Supervised Models?
Fuente:
arXiv
Salvato in:
| Autori principali: | Mousavi, Pooneh, Duret, Jarod, Zaiem, Salah, Della Libera, Luca, Ploujnikov, Artem, Subakan, Cem, Ravanelli, Mirco |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DASB - Discrete Audio and Speech Benchmark
di: Mousavi, Pooneh, et al.
Pubblicazione: (2024)
di: Mousavi, Pooneh, et al.
Pubblicazione: (2024)
Autoregressive Speech Enhancement via Acoustic Tokens
di: Della Libera, Luca, et al.
Pubblicazione: (2025)
di: Della Libera, Luca, et al.
Pubblicazione: (2025)
What Are They Doing? Joint Audio-Speech Co-Reasoning
di: Wang, Yingzhi, et al.
Pubblicazione: (2024)
di: Wang, Yingzhi, et al.
Pubblicazione: (2024)
LL-SDR: Low-Latency Speech enhancement through Discrete Representations
di: Li, Jingyi, et al.
Pubblicazione: (2026)
di: Li, Jingyi, et al.
Pubblicazione: (2026)
LiSTEN: Learning Soft Token Embeddings for Neural Audio LLMs
di: Mousavi, Pooneh, et al.
Pubblicazione: (2025)
di: Mousavi, Pooneh, et al.
Pubblicazione: (2025)
Focal Modulation Networks for Interpretable Sound Classification
di: Della Libera, Luca, et al.
Pubblicazione: (2024)
di: Della Libera, Luca, et al.
Pubblicazione: (2024)
Listen First, Then Answer: Timestamp-Grounded Speech Reasoning
di: Jeong, Jihoon, et al.
Pubblicazione: (2026)
di: Jeong, Jihoon, et al.
Pubblicazione: (2026)
FocalCodec-Stream: Streaming Low-Bitrate Speech Coding via Causal Distillation
di: Della Libera, Luca, et al.
Pubblicazione: (2025)
di: Della Libera, Luca, et al.
Pubblicazione: (2025)
Listenable Maps for Zero-Shot Audio Classifiers
di: Paissan, Francesco, et al.
Pubblicazione: (2024)
di: Paissan, Francesco, et al.
Pubblicazione: (2024)
ALAS: Measuring Latent Speech-Text Alignment For Spoken Language Understanding In Multimodal LLMs
di: Mousavi, Pooneh, et al.
Pubblicazione: (2025)
di: Mousavi, Pooneh, et al.
Pubblicazione: (2025)
Audio Editing with Non-Rigid Text Prompts
di: Paissan, Francesco, et al.
Pubblicazione: (2023)
di: Paissan, Francesco, et al.
Pubblicazione: (2023)
FocalCodec: Low-Bitrate Speech Coding via Focal Modulation Networks
di: Della Libera, Luca, et al.
Pubblicazione: (2025)
di: Della Libera, Luca, et al.
Pubblicazione: (2025)
Listenable Maps for Audio Classifiers
di: Paissan, Francesco, et al.
Pubblicazione: (2024)
di: Paissan, Francesco, et al.
Pubblicazione: (2024)
Investigating Faithfulness in Large Audio Language Models
di: Mousavi, Pooneh, et al.
Pubblicazione: (2025)
di: Mousavi, Pooneh, et al.
Pubblicazione: (2025)
Phoneme Discretized Saliency Maps for Explainable Detection of AI-Generated Voice
di: Gupta, Shubham, et al.
Pubblicazione: (2024)
di: Gupta, Shubham, et al.
Pubblicazione: (2024)
Resource-Efficient Separation Transformer
di: Della Libera, Luca, et al.
Pubblicazione: (2022)
di: Della Libera, Luca, et al.
Pubblicazione: (2022)
Discrete Audio Tokens: More Than a Survey!
di: Mousavi, Pooneh, et al.
Pubblicazione: (2025)
di: Mousavi, Pooneh, et al.
Pubblicazione: (2025)
Speech Self-Supervised Representations Benchmarking: a Case for Larger Probing Heads
di: Zaiem, Salah, et al.
Pubblicazione: (2023)
di: Zaiem, Salah, et al.
Pubblicazione: (2023)
LMAC-TD: Producing Time Domain Explanations for Audio Classifiers
di: Mancini, Eleonora, et al.
Pubblicazione: (2024)
di: Mancini, Eleonora, et al.
Pubblicazione: (2024)
Exploring Token-Space Manipulation in Latent Audio Tokenizers
di: Paissan, Francesco, et al.
Pubblicazione: (2026)
di: Paissan, Francesco, et al.
Pubblicazione: (2026)
Toward Faithful Explanations in Acoustic Anomaly Detection
di: Elrashid, Maab, et al.
Pubblicazione: (2026)
di: Elrashid, Maab, et al.
Pubblicazione: (2026)
Investigating the Effectiveness of Explainability Methods in Parkinson's Detection from Speech
di: Mancini, Eleonora, et al.
Pubblicazione: (2024)
di: Mancini, Eleonora, et al.
Pubblicazione: (2024)
Beyond Fixed Frames: Dynamic Character-Aligned Speech Tokenization
di: Della Libera, Luca, et al.
Pubblicazione: (2026)
di: Della Libera, Luca, et al.
Pubblicazione: (2026)
Less Forgetting for Better Generalization: Exploring Continual-learning Fine-tuning Methods for Speech Self-supervised Representations
di: Zaiem, Salah, et al.
Pubblicazione: (2024)
di: Zaiem, Salah, et al.
Pubblicazione: (2024)
MSP-Podcast SER Challenge 2024: L'antenne du Ventoux Multimodal Self-Supervised Learning for Speech Emotion Recognition
di: Duret, Jarod, et al.
Pubblicazione: (2024)
di: Duret, Jarod, et al.
Pubblicazione: (2024)
Dynamic HumTrans: Humming Transcription Using CNNs and Dynamic Programming
di: Gupta, Shubham, et al.
Pubblicazione: (2024)
di: Gupta, Shubham, et al.
Pubblicazione: (2024)
WavSLM: Single-Stream Speech Language Modeling via WavLM Distillation
di: Della Libera, Luca, et al.
Pubblicazione: (2026)
di: Della Libera, Luca, et al.
Pubblicazione: (2026)
SKILL: Similarity-aware Knowledge distILLation for Speech Self-Supervised Learning
di: Zampierin, Luca, et al.
Pubblicazione: (2024)
di: Zampierin, Luca, et al.
Pubblicazione: (2024)
Analyzing Speech Unit Selection for Textless Speech-to-Speech Translation
di: Duret, Jarod, et al.
Pubblicazione: (2024)
di: Duret, Jarod, et al.
Pubblicazione: (2024)
ProGRes: Prompted Generative Rescoring on ASR n-Best
di: Tur, Ada Defne, et al.
Pubblicazione: (2024)
di: Tur, Ada Defne, et al.
Pubblicazione: (2024)
High-Fidelity Speech Enhancement via Discrete Audio Tokens
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025)
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025)
Analyzing and Mitigating Inconsistency in Discrete Audio Tokens for Neural Codec Language Models
di: Liu, Wenrui, et al.
Pubblicazione: (2024)
di: Liu, Wenrui, et al.
Pubblicazione: (2024)
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
di: Gong, Yitian, et al.
Pubblicazione: (2026)
di: Gong, Yitian, et al.
Pubblicazione: (2026)
Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data
di: Bai, Qibing, et al.
Pubblicazione: (2025)
di: Bai, Qibing, et al.
Pubblicazione: (2025)
Audio Prototypical Network For Controllable Music Recommendation
di: Öncel, Fırat, et al.
Pubblicazione: (2025)
di: Öncel, Fırat, et al.
Pubblicazione: (2025)
Discrete Audio Representations for Automated Audio Captioning
di: Tian, Jingguang, et al.
Pubblicazione: (2025)
di: Tian, Jingguang, et al.
Pubblicazione: (2025)
Should Audio Front-ends be Adaptive? Comparing Learnable and Adaptive Front-ends
di: Zhang, Qiquan, et al.
Pubblicazione: (2025)
di: Zhang, Qiquan, et al.
Pubblicazione: (2025)
Planing It by Ear: Convolutional Neural Networks for Acoustic Anomaly Detection in Industrial Wood Planers
di: Deschênes, Anthony, et al.
Pubblicazione: (2025)
di: Deschênes, Anthony, et al.
Pubblicazione: (2025)
Acoustic BPE for Speech Generation with Discrete Tokens
di: Shen, Feiyu, et al.
Pubblicazione: (2023)
di: Shen, Feiyu, et al.
Pubblicazione: (2023)
VR-PTOLEMAIC: A Virtual Environment for the Perceptual Testing of Spatial Audio Algorithms
di: Ostan, Paolo, et al.
Pubblicazione: (2025)
di: Ostan, Paolo, et al.
Pubblicazione: (2025)
Documenti analoghi
-
DASB - Discrete Audio and Speech Benchmark
di: Mousavi, Pooneh, et al.
Pubblicazione: (2024) -
Autoregressive Speech Enhancement via Acoustic Tokens
di: Della Libera, Luca, et al.
Pubblicazione: (2025) -
What Are They Doing? Joint Audio-Speech Co-Reasoning
di: Wang, Yingzhi, et al.
Pubblicazione: (2024) -
LL-SDR: Low-Latency Speech enhancement through Discrete Representations
di: Li, Jingyi, et al.
Pubblicazione: (2026) -
LiSTEN: Learning Soft Token Embeddings for Neural Audio LLMs
di: Mousavi, Pooneh, et al.
Pubblicazione: (2025)