Salmon: A Suite for Acoustic Language Model Evaluation
Fuente:
arXiv
Salvato in:
| Autori principali: | Maimon, Gallil, Roth, Amit, Adi, Yossi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Scaling Analysis of Interleaved Speech-Text Language Models
di: Maimon, Gallil, et al.
Pubblicazione: (2025)
di: Maimon, Gallil, et al.
Pubblicazione: (2025)
StressTest: Can YOUR Speech LM Handle the Stress?
di: Yosha, Iddo, et al.
Pubblicazione: (2025)
di: Yosha, Iddo, et al.
Pubblicazione: (2025)
Slamming: Training a Speech Language Model on One GPU in a Day
di: Maimon, Gallil, et al.
Pubblicazione: (2025)
di: Maimon, Gallil, et al.
Pubblicazione: (2025)
A Language Modeling Approach to Diacritic-Free Hebrew TTS
di: Roth, Amit, et al.
Pubblicazione: (2024)
di: Roth, Amit, et al.
Pubblicazione: (2024)
LAST: Language Model Aware Speech Tokenization
di: Turetzky, Arnon, et al.
Pubblicazione: (2024)
di: Turetzky, Arnon, et al.
Pubblicazione: (2024)
PAST: Phonetic-Acoustic Speech Tokenizer
di: Har-Tuv, Nadav, et al.
Pubblicazione: (2025)
di: Har-Tuv, Nadav, et al.
Pubblicazione: (2025)
WHISTRESS: Enriching Transcriptions with Sentence Stress Detection
di: Yosha, Iddo, et al.
Pubblicazione: (2025)
di: Yosha, Iddo, et al.
Pubblicazione: (2025)
NAST: Noise Aware Speech Tokenization for Speech Language Models
di: Messica, Shoval, et al.
Pubblicazione: (2024)
di: Messica, Shoval, et al.
Pubblicazione: (2024)
On The Landscape of Spoken Language Models: A Comprehensive Survey
di: Arora, Siddhant, et al.
Pubblicazione: (2025)
di: Arora, Siddhant, et al.
Pubblicazione: (2025)
HebDB: a Weakly Supervised Dataset for Hebrew Speech Processing
di: Turetzky, Arnon, et al.
Pubblicazione: (2024)
di: Turetzky, Arnon, et al.
Pubblicazione: (2024)
Unsupervised Speech Segmentation: A General Approach Using Speech Language Models
di: Elmakies, Avishai, et al.
Pubblicazione: (2025)
di: Elmakies, Avishai, et al.
Pubblicazione: (2025)
Improving Acoustic Word Embeddings through Correspondence Training of Self-supervised Speech Representations
di: Meghanani, Amit, et al.
Pubblicazione: (2024)
di: Meghanani, Amit, et al.
Pubblicazione: (2024)
Discrete Audio Tokens: More Than a Survey!
di: Mousavi, Pooneh, et al.
Pubblicazione: (2025)
di: Mousavi, Pooneh, et al.
Pubblicazione: (2025)
Enhancing TTS Stability in Hebrew using Discrete Semantic Units
di: Zeldes, Ella, et al.
Pubblicazione: (2024)
di: Zeldes, Ella, et al.
Pubblicazione: (2024)
Audio Enhancement from Multiple Crowdsourced Recordings: A Simple and Effective Baseline
di: Aziz, Shiran, et al.
Pubblicazione: (2024)
di: Aziz, Shiran, et al.
Pubblicazione: (2024)
Muting Whisper: A Universal Acoustic Adversarial Attack on Speech Foundation Models
di: Raina, Vyas, et al.
Pubblicazione: (2024)
di: Raina, Vyas, et al.
Pubblicazione: (2024)
Textually Pretrained Speech Language Models
di: Hassid, Michael, et al.
Pubblicazione: (2023)
di: Hassid, Michael, et al.
Pubblicazione: (2023)
A Theoretical Framework for Acoustic Neighbor Embeddings
di: Jeon, Woojay
Pubblicazione: (2024)
di: Jeon, Woojay
Pubblicazione: (2024)
Acoustic Model Optimization over Multiple Data Sources: Merging and Valuation
di: Wei, Victor Junqiu, et al.
Pubblicazione: (2024)
di: Wei, Victor Junqiu, et al.
Pubblicazione: (2024)
Position-invariant Fine-tuning of Speech Enhancement Models with Self-supervised Speech Representations
di: Meghanani, Amit, et al.
Pubblicazione: (2026)
di: Meghanani, Amit, et al.
Pubblicazione: (2026)
On the Evaluation of Speech Foundation Models for Spoken Language Understanding
di: Arora, Siddhant, et al.
Pubblicazione: (2024)
di: Arora, Siddhant, et al.
Pubblicazione: (2024)
Controlling Whisper: Universal Acoustic Adversarial Attacks to Control Speech Foundation Models
di: Raina, Vyas, et al.
Pubblicazione: (2024)
di: Raina, Vyas, et al.
Pubblicazione: (2024)
CALM: Joint Contextual Acoustic-Linguistic Modeling for Personalization of Multi-Speaker ASR
di: Shakeel, Muhammad, et al.
Pubblicazione: (2026)
di: Shakeel, Muhammad, et al.
Pubblicazione: (2026)
Revisiting Acoustic Features for Robust ASR
di: Shah, Muhammad A., et al.
Pubblicazione: (2024)
di: Shah, Muhammad A., et al.
Pubblicazione: (2024)
Phonetic Error Analysis of Raw Waveform Acoustic Models with Parametric and Non-Parametric CNNs
di: Loweimi, Erfan, et al.
Pubblicazione: (2024)
di: Loweimi, Erfan, et al.
Pubblicazione: (2024)
Scaling Open Discrete Audio Foundation Models with Interleaved Semantic, Acoustic, and Text Tokens
di: Manakul, Potsawee, et al.
Pubblicazione: (2026)
di: Manakul, Potsawee, et al.
Pubblicazione: (2026)
Exploring the Benefits of Tokenization of Discrete Acoustic Units
di: Dekel, Avihu, et al.
Pubblicazione: (2024)
di: Dekel, Avihu, et al.
Pubblicazione: (2024)
Textless Acoustic Model with Self-Supervised Distillation for Noise-Robust Expressive Speech-to-Speech Translation
di: Hwang, Min-Jae, et al.
Pubblicazione: (2024)
di: Hwang, Min-Jae, et al.
Pubblicazione: (2024)
Multilingual Zero Resource Speech Recognition Base on Self-Supervise Pre-Trained Acoustic Models
di: Wang, Haoyu, et al.
Pubblicazione: (2022)
di: Wang, Haoyu, et al.
Pubblicazione: (2022)
Enabling Auditory Large Language Models for Automatic Speech Quality Evaluation
di: Wang, Siyin, et al.
Pubblicazione: (2024)
di: Wang, Siyin, et al.
Pubblicazione: (2024)
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators
di: Chen, Chen, et al.
Pubblicazione: (2025)
di: Chen, Chen, et al.
Pubblicazione: (2025)
How Auditory Knowledge in LLM Backbones Shapes Audio Language Models: A Holistic Evaluation
di: Lu, Ke-Han, et al.
Pubblicazione: (2026)
di: Lu, Ke-Han, et al.
Pubblicazione: (2026)
Boosting Hybrid Autoregressive Transducer-based ASR with Internal Acoustic Model Training and Dual Blank Thresholding
di: Moriya, Takafumi, et al.
Pubblicazione: (2024)
di: Moriya, Takafumi, et al.
Pubblicazione: (2024)
FluentEditor2: Text-based Speech Editing by Modeling Multi-Scale Acoustic and Prosody Consistency
di: Liu, Rui, et al.
Pubblicazione: (2024)
di: Liu, Rui, et al.
Pubblicazione: (2024)
Joint Transcription of Acoustic Guitar Strumming Directions and Chords
di: Murgul, Sebastian, et al.
Pubblicazione: (2025)
di: Murgul, Sebastian, et al.
Pubblicazione: (2025)
Infusing Acoustic Pause Context into Text-Based Dementia Assessment
di: Braun, Franziska, et al.
Pubblicazione: (2024)
di: Braun, Franziska, et al.
Pubblicazione: (2024)
ASR-EC Benchmark: Evaluating Large Language Models on Chinese ASR Error Correction
di: Wei, Victor Junqiu, et al.
Pubblicazione: (2024)
di: Wei, Victor Junqiu, et al.
Pubblicazione: (2024)
Universal Acoustic Adversarial Attacks for Flexible Control of Speech-LLMs
di: Ma, Rao, et al.
Pubblicazione: (2025)
di: Ma, Rao, et al.
Pubblicazione: (2025)
Latent Watermarking of Audio Generative Models
di: Roman, Robin San, et al.
Pubblicazione: (2024)
di: Roman, Robin San, et al.
Pubblicazione: (2024)
Toward Corpus Size Requirements for Training and Evaluating Depression Risk Models Using Spoken Language
di: Rutowski, Tomek, et al.
Pubblicazione: (2024)
di: Rutowski, Tomek, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Scaling Analysis of Interleaved Speech-Text Language Models
di: Maimon, Gallil, et al.
Pubblicazione: (2025) -
StressTest: Can YOUR Speech LM Handle the Stress?
di: Yosha, Iddo, et al.
Pubblicazione: (2025) -
Slamming: Training a Speech Language Model on One GPU in a Day
di: Maimon, Gallil, et al.
Pubblicazione: (2025) -
A Language Modeling Approach to Diacritic-Free Hebrew TTS
di: Roth, Amit, et al.
Pubblicazione: (2024) -
LAST: Language Model Aware Speech Tokenization
di: Turetzky, Arnon, et al.
Pubblicazione: (2024)