Salvato in:
| Autori principali: | Mousavi, Pooneh, Maimon, Gallil, Moumen, Adel, Petermann, Darius, Shi, Jiatong, Wu, Haibin, Yang, Haici, Kuznetsova, Anastasia, Ploujnikov, Artem, Marxer, Ricard, Ramabhadran, Bhuvana, Elizalde, Benjamin, Lugosch, Loren, Li, Jinyu, Subakan, Cem, Woodland, Phil, Kim, Minje, Lee, Hung-yi, Watanabe, Shinji, Adi, Yossi, Ravanelli, Mirco |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2506.10274 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DASB - Discrete Audio and Speech Benchmark
di: Mousavi, Pooneh, et al.
Pubblicazione: (2024)
di: Mousavi, Pooneh, et al.
Pubblicazione: (2024)
Listen First, Then Answer: Timestamp-Grounded Speech Reasoning
di: Jeong, Jihoon, et al.
Pubblicazione: (2026)
di: Jeong, Jihoon, et al.
Pubblicazione: (2026)
Investigating Faithfulness in Large Audio Language Models
di: Mousavi, Pooneh, et al.
Pubblicazione: (2025)
di: Mousavi, Pooneh, et al.
Pubblicazione: (2025)
LiSTEN: Learning Soft Token Embeddings for Neural Audio LLMs
di: Mousavi, Pooneh, et al.
Pubblicazione: (2025)
di: Mousavi, Pooneh, et al.
Pubblicazione: (2025)
ALAS: Measuring Latent Speech-Text Alignment For Spoken Language Understanding In Multimodal LLMs
di: Mousavi, Pooneh, et al.
Pubblicazione: (2025)
di: Mousavi, Pooneh, et al.
Pubblicazione: (2025)
How Should We Extract Discrete Audio Tokens from Self-Supervised Models?
di: Mousavi, Pooneh, et al.
Pubblicazione: (2024)
di: Mousavi, Pooneh, et al.
Pubblicazione: (2024)
What Are They Doing? Joint Audio-Speech Co-Reasoning
di: Wang, Yingzhi, et al.
Pubblicazione: (2024)
di: Wang, Yingzhi, et al.
Pubblicazione: (2024)
Listenable Maps for Audio Classifiers
di: Paissan, Francesco, et al.
Pubblicazione: (2024)
di: Paissan, Francesco, et al.
Pubblicazione: (2024)
Beyond Fixed Frames: Dynamic Character-Aligned Speech Tokenization
di: Della Libera, Luca, et al.
Pubblicazione: (2026)
di: Della Libera, Luca, et al.
Pubblicazione: (2026)
Autoregressive Speech Enhancement via Acoustic Tokens
di: Della Libera, Luca, et al.
Pubblicazione: (2025)
di: Della Libera, Luca, et al.
Pubblicazione: (2025)
FocalCodec-Stream: Streaming Low-Bitrate Speech Coding via Causal Distillation
di: Della Libera, Luca, et al.
Pubblicazione: (2025)
di: Della Libera, Luca, et al.
Pubblicazione: (2025)
WavSLM: Single-Stream Speech Language Modeling via WavLM Distillation
di: Della Libera, Luca, et al.
Pubblicazione: (2026)
di: Della Libera, Luca, et al.
Pubblicazione: (2026)
Focal Modulation Networks for Interpretable Sound Classification
di: Della Libera, Luca, et al.
Pubblicazione: (2024)
di: Della Libera, Luca, et al.
Pubblicazione: (2024)
Salmon: A Suite for Acoustic Language Model Evaluation
di: Maimon, Gallil, et al.
Pubblicazione: (2024)
di: Maimon, Gallil, et al.
Pubblicazione: (2024)
StressTest: Can YOUR Speech LM Handle the Stress?
di: Yosha, Iddo, et al.
Pubblicazione: (2025)
di: Yosha, Iddo, et al.
Pubblicazione: (2025)
Slamming: Training a Speech Language Model on One GPU in a Day
di: Maimon, Gallil, et al.
Pubblicazione: (2025)
di: Maimon, Gallil, et al.
Pubblicazione: (2025)
Virtual Consistency for Audio Editing
di: Cervera, Matthieu, et al.
Pubblicazione: (2025)
di: Cervera, Matthieu, et al.
Pubblicazione: (2025)
Phoneme Discretized Saliency Maps for Explainable Detection of AI-Generated Voice
di: Gupta, Shubham, et al.
Pubblicazione: (2024)
di: Gupta, Shubham, et al.
Pubblicazione: (2024)
LMAC-TD: Producing Time Domain Explanations for Audio Classifiers
di: Mancini, Eleonora, et al.
Pubblicazione: (2024)
di: Mancini, Eleonora, et al.
Pubblicazione: (2024)
Hyperbolic Distance-Based Speech Separation
di: Petermann, Darius, et al.
Pubblicazione: (2024)
di: Petermann, Darius, et al.
Pubblicazione: (2024)
FocalCodec: Low-Bitrate Speech Coding via Focal Modulation Networks
di: Della Libera, Luca, et al.
Pubblicazione: (2025)
di: Della Libera, Luca, et al.
Pubblicazione: (2025)
Listenable Maps for Zero-Shot Audio Classifiers
di: Paissan, Francesco, et al.
Pubblicazione: (2024)
di: Paissan, Francesco, et al.
Pubblicazione: (2024)
Exploring Token-Space Manipulation in Latent Audio Tokenizers
di: Paissan, Francesco, et al.
Pubblicazione: (2026)
di: Paissan, Francesco, et al.
Pubblicazione: (2026)
LL-SDR: Low-Latency Speech enhancement through Discrete Representations
di: Li, Jingyi, et al.
Pubblicazione: (2026)
di: Li, Jingyi, et al.
Pubblicazione: (2026)
Scaling Analysis of Interleaved Speech-Text Language Models
di: Maimon, Gallil, et al.
Pubblicazione: (2025)
di: Maimon, Gallil, et al.
Pubblicazione: (2025)
Investigating the Effectiveness of Explainability Methods in Parkinson's Detection from Speech
di: Mancini, Eleonora, et al.
Pubblicazione: (2024)
di: Mancini, Eleonora, et al.
Pubblicazione: (2024)
ProGRes: Prompted Generative Rescoring on ASR n-Best
di: Tur, Ada Defne, et al.
Pubblicazione: (2024)
di: Tur, Ada Defne, et al.
Pubblicazione: (2024)
Adaptation Odyssey in LLMs: Why Does Additional Pretraining Sometimes Fail to Improve?
di: Öncel, Fırat, et al.
Pubblicazione: (2024)
di: Öncel, Fırat, et al.
Pubblicazione: (2024)
Toward Faithful Explanations in Acoustic Anomaly Detection
di: Elrashid, Maab, et al.
Pubblicazione: (2026)
di: Elrashid, Maab, et al.
Pubblicazione: (2026)
Late Fusion and Multi-Level Fission Amplify Cross-Modal Transfer in Text-Speech LMs
di: Cuervo, Santiago, et al.
Pubblicazione: (2025)
di: Cuervo, Santiago, et al.
Pubblicazione: (2025)
Resource-Efficient Separation Transformer
di: Della Libera, Luca, et al.
Pubblicazione: (2022)
di: Della Libera, Luca, et al.
Pubblicazione: (2022)
Audio Editing with Non-Rigid Text Prompts
di: Paissan, Francesco, et al.
Pubblicazione: (2023)
di: Paissan, Francesco, et al.
Pubblicazione: (2023)
Dynamic HumTrans: Humming Transcription Using CNNs and Dynamic Programming
di: Gupta, Shubham, et al.
Pubblicazione: (2024)
di: Gupta, Shubham, et al.
Pubblicazione: (2024)
Audio Prototypical Network For Controllable Music Recommendation
di: Öncel, Fırat, et al.
Pubblicazione: (2025)
di: Öncel, Fırat, et al.
Pubblicazione: (2025)
Self-Execution Simulation Improves Coding Models
di: Maimon, Gallil, et al.
Pubblicazione: (2026)
di: Maimon, Gallil, et al.
Pubblicazione: (2026)
LegoSLM: Connecting LLM with Speech Encoder using CTC Posteriors
di: Ma, Rao, et al.
Pubblicazione: (2025)
di: Ma, Rao, et al.
Pubblicazione: (2025)
Speculative Speech Recognition by Audio-Prefixed Low-Rank Adaptation of Language Models
di: Yusuf, Bolaji, et al.
Pubblicazione: (2024)
di: Yusuf, Bolaji, et al.
Pubblicazione: (2024)
Cross-Lingual Interleaving for Speech Language Models
di: Moumen, Adel, et al.
Pubblicazione: (2025)
di: Moumen, Adel, et al.
Pubblicazione: (2025)
Measuring the Redundancy of Decoder Layers in SpeechLLMs
di: Moumen, Adel, et al.
Pubblicazione: (2026)
di: Moumen, Adel, et al.
Pubblicazione: (2026)
Speech foundation models on intelligibility prediction for hearing-impaired listeners
di: Cuervo, Santiago, et al.
Pubblicazione: (2024)
di: Cuervo, Santiago, et al.
Pubblicazione: (2024)
Documenti analoghi
-
DASB - Discrete Audio and Speech Benchmark
di: Mousavi, Pooneh, et al.
Pubblicazione: (2024) -
Listen First, Then Answer: Timestamp-Grounded Speech Reasoning
di: Jeong, Jihoon, et al.
Pubblicazione: (2026) -
Investigating Faithfulness in Large Audio Language Models
di: Mousavi, Pooneh, et al.
Pubblicazione: (2025) -
LiSTEN: Learning Soft Token Embeddings for Neural Audio LLMs
di: Mousavi, Pooneh, et al.
Pubblicazione: (2025) -
ALAS: Measuring Latent Speech-Text Alignment For Spoken Language Understanding In Multimodal LLMs
di: Mousavi, Pooneh, et al.
Pubblicazione: (2025)