Salvato in:
| Autori principali: | Paissan, Francesco, Della Libera, Luca, Ravanelli, Mirco, Subakan, Cem |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2605.11192 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Beyond Fixed Frames: Dynamic Character-Aligned Speech Tokenization
di: Della Libera, Luca, et al.
Pubblicazione: (2026)
di: Della Libera, Luca, et al.
Pubblicazione: (2026)
FocalCodec: Low-Bitrate Speech Coding via Focal Modulation Networks
di: Della Libera, Luca, et al.
Pubblicazione: (2025)
di: Della Libera, Luca, et al.
Pubblicazione: (2025)
Listenable Maps for Zero-Shot Audio Classifiers
di: Paissan, Francesco, et al.
Pubblicazione: (2024)
di: Paissan, Francesco, et al.
Pubblicazione: (2024)
WavSLM: Single-Stream Speech Language Modeling via WavLM Distillation
di: Della Libera, Luca, et al.
Pubblicazione: (2026)
di: Della Libera, Luca, et al.
Pubblicazione: (2026)
Autoregressive Speech Enhancement via Acoustic Tokens
di: Della Libera, Luca, et al.
Pubblicazione: (2025)
di: Della Libera, Luca, et al.
Pubblicazione: (2025)
FocalCodec-Stream: Streaming Low-Bitrate Speech Coding via Causal Distillation
di: Della Libera, Luca, et al.
Pubblicazione: (2025)
di: Della Libera, Luca, et al.
Pubblicazione: (2025)
LMAC-TD: Producing Time Domain Explanations for Audio Classifiers
di: Mancini, Eleonora, et al.
Pubblicazione: (2024)
di: Mancini, Eleonora, et al.
Pubblicazione: (2024)
Audio Editing with Non-Rigid Text Prompts
di: Paissan, Francesco, et al.
Pubblicazione: (2023)
di: Paissan, Francesco, et al.
Pubblicazione: (2023)
Listenable Maps for Audio Classifiers
di: Paissan, Francesco, et al.
Pubblicazione: (2024)
di: Paissan, Francesco, et al.
Pubblicazione: (2024)
LiSTEN: Learning Soft Token Embeddings for Neural Audio LLMs
di: Mousavi, Pooneh, et al.
Pubblicazione: (2025)
di: Mousavi, Pooneh, et al.
Pubblicazione: (2025)
Virtual Consistency for Audio Editing
di: Cervera, Matthieu, et al.
Pubblicazione: (2025)
di: Cervera, Matthieu, et al.
Pubblicazione: (2025)
Focal Modulation Networks for Interpretable Sound Classification
di: Della Libera, Luca, et al.
Pubblicazione: (2024)
di: Della Libera, Luca, et al.
Pubblicazione: (2024)
Investigating the Effectiveness of Explainability Methods in Parkinson's Detection from Speech
di: Mancini, Eleonora, et al.
Pubblicazione: (2024)
di: Mancini, Eleonora, et al.
Pubblicazione: (2024)
How Should We Extract Discrete Audio Tokens from Self-Supervised Models?
di: Mousavi, Pooneh, et al.
Pubblicazione: (2024)
di: Mousavi, Pooneh, et al.
Pubblicazione: (2024)
DASB - Discrete Audio and Speech Benchmark
di: Mousavi, Pooneh, et al.
Pubblicazione: (2024)
di: Mousavi, Pooneh, et al.
Pubblicazione: (2024)
Resource-Efficient Separation Transformer
di: Della Libera, Luca, et al.
Pubblicazione: (2022)
di: Della Libera, Luca, et al.
Pubblicazione: (2022)
LL-SDR: Low-Latency Speech enhancement through Discrete Representations
di: Li, Jingyi, et al.
Pubblicazione: (2026)
di: Li, Jingyi, et al.
Pubblicazione: (2026)
Dynamic HumTrans: Humming Transcription Using CNNs and Dynamic Programming
di: Gupta, Shubham, et al.
Pubblicazione: (2024)
di: Gupta, Shubham, et al.
Pubblicazione: (2024)
Toward Faithful Explanations in Acoustic Anomaly Detection
di: Elrashid, Maab, et al.
Pubblicazione: (2026)
di: Elrashid, Maab, et al.
Pubblicazione: (2026)
ALAS: Measuring Latent Speech-Text Alignment For Spoken Language Understanding In Multimodal LLMs
di: Mousavi, Pooneh, et al.
Pubblicazione: (2025)
di: Mousavi, Pooneh, et al.
Pubblicazione: (2025)
Discrete Audio Tokens: More Than a Survey!
di: Mousavi, Pooneh, et al.
Pubblicazione: (2025)
di: Mousavi, Pooneh, et al.
Pubblicazione: (2025)
Adaptation Odyssey in LLMs: Why Does Additional Pretraining Sometimes Fail to Improve?
di: Öncel, Fırat, et al.
Pubblicazione: (2024)
di: Öncel, Fırat, et al.
Pubblicazione: (2024)
Listen First, Then Answer: Timestamp-Grounded Speech Reasoning
di: Jeong, Jihoon, et al.
Pubblicazione: (2026)
di: Jeong, Jihoon, et al.
Pubblicazione: (2026)
Investigating Faithfulness in Large Audio Language Models
di: Mousavi, Pooneh, et al.
Pubblicazione: (2025)
di: Mousavi, Pooneh, et al.
Pubblicazione: (2025)
Phoneme Discretized Saliency Maps for Explainable Detection of AI-Generated Voice
di: Gupta, Shubham, et al.
Pubblicazione: (2024)
di: Gupta, Shubham, et al.
Pubblicazione: (2024)
Sparse Tokens Suffice: Jailbreaking Audio Language Models via Token-Aware Gradient Optimization
di: Fang, Zheng, et al.
Pubblicazione: (2026)
di: Fang, Zheng, et al.
Pubblicazione: (2026)
Token-Based Audio Inpainting via Discrete Diffusion
di: Dror, Tali, et al.
Pubblicazione: (2025)
di: Dror, Tali, et al.
Pubblicazione: (2025)
Low-Resource Guidance for Controllable Latent Audio Diffusion
di: Novack, Zachary, et al.
Pubblicazione: (2026)
di: Novack, Zachary, et al.
Pubblicazione: (2026)
tinyCLAP: Distilling Constrastive Language-Audio Pretrained Models
di: Paissan, Francesco, et al.
Pubblicazione: (2023)
di: Paissan, Francesco, et al.
Pubblicazione: (2023)
Scaling Speech Tokenizers with Diffusion Autoencoders
di: Wang, Yuancheng, et al.
Pubblicazione: (2026)
di: Wang, Yuancheng, et al.
Pubblicazione: (2026)
TokenChain: A Discrete Speech Chain via Semantic Token Modeling
di: Wang, Mingxuan, et al.
Pubblicazione: (2025)
di: Wang, Mingxuan, et al.
Pubblicazione: (2025)
Knowing When to Answer: Adaptive Confidence Refinement for Reliable Audio-Visual Question Answering
di: Tran, Dinh Phu, et al.
Pubblicazione: (2026)
di: Tran, Dinh Phu, et al.
Pubblicazione: (2026)
AudioMosaic: Contrastive Masked Audio Representation Learning
di: Huang, Hanxun, et al.
Pubblicazione: (2026)
di: Huang, Hanxun, et al.
Pubblicazione: (2026)
AudioCodecBench: A Comprehensive Benchmark for Audio Codec Evaluation
di: Wang, Lu, et al.
Pubblicazione: (2025)
di: Wang, Lu, et al.
Pubblicazione: (2025)
Learning Audio-Visual Embeddings with Inferred Latent Interaction Graphs
di: Zeng, Donghuo, et al.
Pubblicazione: (2026)
di: Zeng, Donghuo, et al.
Pubblicazione: (2026)
FastAST: Accelerating Audio Spectrogram Transformer via Token Merging and Cross-Model Knowledge Distillation
di: Behera, Swarup Ranjan, et al.
Pubblicazione: (2024)
di: Behera, Swarup Ranjan, et al.
Pubblicazione: (2024)
Evaluation of Deep Audio Representations for Hearables
di: Gröger, Fabian, et al.
Pubblicazione: (2025)
di: Gröger, Fabian, et al.
Pubblicazione: (2025)
Music2Latent2: Audio Compression with Summary Embeddings and Autoregressive Decoding
di: Pasini, Marco, et al.
Pubblicazione: (2025)
di: Pasini, Marco, et al.
Pubblicazione: (2025)
Exploring and Applying Audio-Based Sentiment Analysis in Music
di: Jhanji, Etash
Pubblicazione: (2024)
di: Jhanji, Etash
Pubblicazione: (2024)
SKILL: Similarity-aware Knowledge distILLation for Speech Self-Supervised Learning
di: Zampierin, Luca, et al.
Pubblicazione: (2024)
di: Zampierin, Luca, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Beyond Fixed Frames: Dynamic Character-Aligned Speech Tokenization
di: Della Libera, Luca, et al.
Pubblicazione: (2026) -
FocalCodec: Low-Bitrate Speech Coding via Focal Modulation Networks
di: Della Libera, Luca, et al.
Pubblicazione: (2025) -
Listenable Maps for Zero-Shot Audio Classifiers
di: Paissan, Francesco, et al.
Pubblicazione: (2024) -
WavSLM: Single-Stream Speech Language Modeling via WavLM Distillation
di: Della Libera, Luca, et al.
Pubblicazione: (2026) -
Autoregressive Speech Enhancement via Acoustic Tokens
di: Della Libera, Luca, et al.
Pubblicazione: (2025)