Salvato in:
| Autori principali: | Yeh, Sung-Lin, Tang, Hao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2409.06109 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Learning Speech Representations with Variational Predictive Coding
di: Yeh, Sung-Lin, et al.
Pubblicazione: (2025)
di: Yeh, Sung-Lin, et al.
Pubblicazione: (2025)
MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables
di: Yeh, Sung-Lin, et al.
Pubblicazione: (2026)
di: Yeh, Sung-Lin, et al.
Pubblicazione: (2026)
Whisper Has an Internal Word Aligner
di: Yeh, Sung-Lin, et al.
Pubblicazione: (2025)
di: Yeh, Sung-Lin, et al.
Pubblicazione: (2025)
Revisiting Self-supervised Learning of Speech Representation from a Mutual Information Perspective
di: Liu, Alexander H., et al.
Pubblicazione: (2024)
di: Liu, Alexander H., et al.
Pubblicazione: (2024)
Compact Speech Translation Models via Discrete Speech Units Pretraining
di: Lam, Tsz Kin, et al.
Pubblicazione: (2024)
di: Lam, Tsz Kin, et al.
Pubblicazione: (2024)
Crossmodal ASR Error Correction with Discrete Speech Units
di: Li, Yuanchao, et al.
Pubblicazione: (2024)
di: Li, Yuanchao, et al.
Pubblicazione: (2024)
DiscoPhon: Benchmarking the Unsupervised Discovery of Phoneme Inventories With Discrete Speech Units
di: Poli, Maxime, et al.
Pubblicazione: (2026)
di: Poli, Maxime, et al.
Pubblicazione: (2026)
DiscreteSLU: A Large Language Model with Self-Supervised Discrete Speech Units for Spoken Language Understanding
di: Shon, Suwon, et al.
Pubblicazione: (2024)
di: Shon, Suwon, et al.
Pubblicazione: (2024)
Textless Unit-to-Unit training for Many-to-Many Multilingual Speech-to-Speech Translation
di: Kim, Minsu, et al.
Pubblicazione: (2023)
di: Kim, Minsu, et al.
Pubblicazione: (2023)
An Empirical Analysis of Discrete Unit Representations in Speech Language Modeling Pre-training
di: Labrak, Yanis, et al.
Pubblicazione: (2025)
di: Labrak, Yanis, et al.
Pubblicazione: (2025)
Exploring the Benefits of Tokenization of Discrete Acoustic Units
di: Dekel, Avihu, et al.
Pubblicazione: (2024)
di: Dekel, Avihu, et al.
Pubblicazione: (2024)
Meta-PerSER: Few-Shot Listener Personalized Speech Emotion Recognition via Meta-learning
di: Shen, Liang-Yeh, et al.
Pubblicazione: (2025)
di: Shen, Liang-Yeh, et al.
Pubblicazione: (2025)
UNIT-DSR: Dysarthric Speech Reconstruction System Using Speech Unit Normalization
di: Wang, Yuejiao, et al.
Pubblicazione: (2024)
di: Wang, Yuejiao, et al.
Pubblicazione: (2024)
Effective Context in Neural Speech Models
di: Meng, Yen, et al.
Pubblicazione: (2025)
di: Meng, Yen, et al.
Pubblicazione: (2025)
Benchmarking Prosody Encoding in Discrete Speech Tokens
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers
di: Lin, Tzu-Quan, et al.
Pubblicazione: (2025)
di: Lin, Tzu-Quan, et al.
Pubblicazione: (2025)
Children's Speech Recognition through Discrete Token Enhancement
di: Sukhadia, Vrunda N., et al.
Pubblicazione: (2024)
di: Sukhadia, Vrunda N., et al.
Pubblicazione: (2024)
Rethinking Discrete Speech Representation Tokens for Accent Generation
di: Zhong, Jinzuomu, et al.
Pubblicazione: (2026)
di: Zhong, Jinzuomu, et al.
Pubblicazione: (2026)
Conditioning and Sampling in Variational Diffusion Models for Speech Super-Resolution
di: Yu, Chin-Yun, et al.
Pubblicazione: (2022)
di: Yu, Chin-Yun, et al.
Pubblicazione: (2022)
Analyzing Speech Unit Selection for Textless Speech-to-Speech Translation
di: Duret, Jarod, et al.
Pubblicazione: (2024)
di: Duret, Jarod, et al.
Pubblicazione: (2024)
Transducer Consistency Regularization for Speech to Text Applications
di: Tseng, Cindy, et al.
Pubblicazione: (2024)
di: Tseng, Cindy, et al.
Pubblicazione: (2024)
Exploring SSL Discrete Speech Features for Zipformer-based Contextual ASR
di: Cui, Mingyu, et al.
Pubblicazione: (2024)
di: Cui, Mingyu, et al.
Pubblicazione: (2024)
Do Discrete Self-Supervised Representations of Speech Capture Tone Distinctions?
di: Osakuade, Opeyemi, et al.
Pubblicazione: (2024)
di: Osakuade, Opeyemi, et al.
Pubblicazione: (2024)
VIBE: Voice-Induced open-ended Bias Evaluation for Large Audio-Language Models via Real-World Speech
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2026)
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2026)
Property Neurons in Self-Supervised Speech Transformers
di: Lin, Tzu-Quan, et al.
Pubblicazione: (2024)
di: Lin, Tzu-Quan, et al.
Pubblicazione: (2024)
Linguistic Knowledge Transfer Learning for Speech Enhancement
di: Hung, Kuo-Hsuan, et al.
Pubblicazione: (2025)
di: Hung, Kuo-Hsuan, et al.
Pubblicazione: (2025)
Codec-ASR: Training Performant Automatic Speech Recognition Systems with Discrete Speech Representations
di: Dhawan, Kunal, et al.
Pubblicazione: (2024)
di: Dhawan, Kunal, et al.
Pubblicazione: (2024)
Full-text Error Correction for Chinese Speech Recognition with Large Language Model
di: Tang, Zhiyuan, et al.
Pubblicazione: (2024)
di: Tang, Zhiyuan, et al.
Pubblicazione: (2024)
Improving Speech Emotion Recognition in Under-Resourced Languages via Speech-to-Speech Translation with Bootstrapping Data Selection
di: Lin, Hsi-Che, et al.
Pubblicazione: (2024)
di: Lin, Hsi-Che, et al.
Pubblicazione: (2024)
Data Augmentation for End-to-end Code-switching Speech Recognition
di: Du, Chenpeng, et al.
Pubblicazione: (2020)
di: Du, Chenpeng, et al.
Pubblicazione: (2020)
Continual Speech Learning with Fused Speech Features
di: Wang, Guitao, et al.
Pubblicazione: (2025)
di: Wang, Guitao, et al.
Pubblicazione: (2025)
Leveraging Unit Language Guidance to Advance Speech Modeling in Textless Speech-to-Speech Translation
di: Zhang, Yuhao, et al.
Pubblicazione: (2025)
di: Zhang, Yuhao, et al.
Pubblicazione: (2025)
SyllableLM: Learning Coarse Semantic Units for Speech Language Models
di: Baade, Alan, et al.
Pubblicazione: (2024)
di: Baade, Alan, et al.
Pubblicazione: (2024)
A Comparative Study of Discrete Speech Tokens for Semantic-Related Tasks with Large Language Models
di: Wang, Dingdong, et al.
Pubblicazione: (2024)
di: Wang, Dingdong, et al.
Pubblicazione: (2024)
SMILE: Speech Meta In-Context Learning for Low-Resource Language Automatic Speech Recognition
di: Hsu, Ming-Hao, et al.
Pubblicazione: (2024)
di: Hsu, Ming-Hao, et al.
Pubblicazione: (2024)
Chain of Correction for Full-text Speech Recognition with Large Language Models
di: Tang, Zhiyuan, et al.
Pubblicazione: (2025)
di: Tang, Zhiyuan, et al.
Pubblicazione: (2025)
MAD Speech: Measures of Acoustic Diversity of Speech
di: Futeral, Matthieu, et al.
Pubblicazione: (2024)
di: Futeral, Matthieu, et al.
Pubblicazione: (2024)
Streaming Speech-to-Confusion Network Speech Recognition
di: Filimonov, Denis, et al.
Pubblicazione: (2023)
di: Filimonov, Denis, et al.
Pubblicazione: (2023)
Anatomy of the Modality Gap: Dissecting the Internal States of End-to-End Speech LLMs
di: Hsu, Ming-Hao, et al.
Pubblicazione: (2026)
di: Hsu, Ming-Hao, et al.
Pubblicazione: (2026)
Textless Speech-to-Speech Translation With Limited Parallel Data
di: Diwan, Anuj, et al.
Pubblicazione: (2023)
di: Diwan, Anuj, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Learning Speech Representations with Variational Predictive Coding
di: Yeh, Sung-Lin, et al.
Pubblicazione: (2025) -
MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables
di: Yeh, Sung-Lin, et al.
Pubblicazione: (2026) -
Whisper Has an Internal Word Aligner
di: Yeh, Sung-Lin, et al.
Pubblicazione: (2025) -
Revisiting Self-supervised Learning of Speech Representation from a Mutual Information Perspective
di: Liu, Alexander H., et al.
Pubblicazione: (2024) -
Compact Speech Translation Models via Discrete Speech Units Pretraining
di: Lam, Tsz Kin, et al.
Pubblicazione: (2024)