Identifying Primary Stress Across Related Languages and Dialects with Transformer-based Speech Encoder Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Ljubešić, Nikola, Porupski, Ivan, Rupnik, Peter |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
The ParlaSpeech Collection of Automatically Generated Speech and Text Datasets from Parliamentary Proceedings
por: Ljubešić, Nikola, et al.
Publicado: (2024)
por: Ljubešić, Nikola, et al.
Publicado: (2024)
Mići Princ -- A Little Boy Teaching Speech Technologies the Chakavian Dialect
por: Ljubešić, Nikola, et al.
Publicado: (2026)
por: Ljubešić, Nikola, et al.
Publicado: (2026)
Performance Analysis of Speech Encoders for Low-Resource SLU and ASR in Tunisian Dialect
por: Mdhaffar, Salima, et al.
Publicado: (2024)
por: Mdhaffar, Salima, et al.
Publicado: (2024)
Cross-Dialect Text-To-Speech in Pitch-Accent Language Incorporating Multi-Dialect Phoneme-Level BERT
por: Yamauchi, Kazuki, et al.
Publicado: (2024)
por: Yamauchi, Kazuki, et al.
Publicado: (2024)
Voxlect: A Speech Foundation Model Benchmark for Modeling Dialects and Regional Languages Around the Globe
por: Feng, Tiantian, et al.
Publicado: (2025)
por: Feng, Tiantian, et al.
Publicado: (2025)
Dialectal Coverage And Generalization in Arabic Speech Recognition
por: Djanibekov, Amirbek, et al.
Publicado: (2024)
por: Djanibekov, Amirbek, et al.
Publicado: (2024)
OWSM-CTC: An Open Encoder-Only Speech Foundation Model for Speech Recognition, Translation, and Language Identification
por: Peng, Yifan, et al.
Publicado: (2024)
por: Peng, Yifan, et al.
Publicado: (2024)
Towards Zero-Shot Text-To-Speech for Arabic Dialects
por: Doan, Khai Duy, et al.
Publicado: (2024)
por: Doan, Khai Duy, et al.
Publicado: (2024)
Attention or Convolution: Transformer Encoders in Audio Language Models for Inference Efficiency
por: Jeon, Sungho, et al.
Publicado: (2023)
por: Jeon, Sungho, et al.
Publicado: (2023)
Hybrid Attention-based Encoder-decoder Model for Efficient Language Model Adaptation
por: Ling, Shaoshi, et al.
Publicado: (2023)
por: Ling, Shaoshi, et al.
Publicado: (2023)
Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis
por: Xu, Tianyi, et al.
Publicado: (2025)
por: Xu, Tianyi, et al.
Publicado: (2025)
RoDia: A New Dataset for Romanian Dialect Identification from Speech
por: Rotaru, Codrut, et al.
Publicado: (2023)
por: Rotaru, Codrut, et al.
Publicado: (2023)
Habibi: Laying the Open-Source Foundation of Unified-Dialectal Arabic Speech Synthesis
por: Chen, Yushen, et al.
Publicado: (2026)
por: Chen, Yushen, et al.
Publicado: (2026)
Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers
por: Lin, Tzu-Quan, et al.
Publicado: (2025)
por: Lin, Tzu-Quan, et al.
Publicado: (2025)
Rapid Language Adaptation for Multilingual E2E Speech Recognition Using Encoder Prompting
por: Kashiwagi, Yosuke, et al.
Publicado: (2024)
por: Kashiwagi, Yosuke, et al.
Publicado: (2024)
Bailing-TTS: Chinese Dialectal Speech Synthesis Towards Human-like Spontaneous Representation
por: Di, Xinhan, et al.
Publicado: (2024)
por: Di, Xinhan, et al.
Publicado: (2024)
ML-SUPERB 2.0: Benchmarking Multilingual Speech Models Across Modeling Constraints, Languages, and Datasets
por: Shi, Jiatong, et al.
Publicado: (2024)
por: Shi, Jiatong, et al.
Publicado: (2024)
Rethinking Entropy Allocation in LLM-based ASR: Understanding the Dynamics between Speech Encoders and LLMs
por: Xie, Yuan, et al.
Publicado: (2026)
por: Xie, Yuan, et al.
Publicado: (2026)
UniEnc-CASSNAT: An Encoder-only Non-autoregressive ASR for Speech SSL Models
por: Fan, Ruchao, et al.
Publicado: (2024)
por: Fan, Ruchao, et al.
Publicado: (2024)
Generative Pre-trained Speech Language Model with Efficient Hierarchical Transformer
por: Zhu, Yongxin, et al.
Publicado: (2024)
por: Zhu, Yongxin, et al.
Publicado: (2024)
LinTO Audio and Textual Datasets to Train and Evaluate Automatic Speech Recognition in Tunisian Arabic Dialect
por: Naouara, Hedi, et al.
Publicado: (2025)
por: Naouara, Hedi, et al.
Publicado: (2025)
StressTest: Can YOUR Speech LM Handle the Stress?
por: Yosha, Iddo, et al.
Publicado: (2025)
por: Yosha, Iddo, et al.
Publicado: (2025)
Attempt Towards Stress Transfer in Speech-to-Speech Machine Translation
por: Akarsh, Sai, et al.
Publicado: (2024)
por: Akarsh, Sai, et al.
Publicado: (2024)
LegoSLM: Connecting LLM with Speech Encoder using CTC Posteriors
por: Ma, Rao, et al.
Publicado: (2025)
por: Ma, Rao, et al.
Publicado: (2025)
Hallucinations in Neural Automatic Speech Recognition: Identifying Errors and Hallucinatory Models
por: Frieske, Rita, et al.
Publicado: (2024)
por: Frieske, Rita, et al.
Publicado: (2024)
SimpleSpeech 2: Towards Simple and Efficient Text-to-Speech with Flow-based Scalar Latent Transformer Diffusion Models
por: Yang, Dongchao, et al.
Publicado: (2024)
por: Yang, Dongchao, et al.
Publicado: (2024)
MultiMed: Multilingual Medical Speech Recognition via Attention Encoder Decoder
por: Le-Duc, Khai, et al.
Publicado: (2024)
por: Le-Duc, Khai, et al.
Publicado: (2024)
A Comparative Study of Discrete Speech Tokens for Semantic-Related Tasks with Large Language Models
por: Wang, Dingdong, et al.
Publicado: (2024)
por: Wang, Dingdong, et al.
Publicado: (2024)
SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models
por: Zhang, Xin, et al.
Publicado: (2023)
por: Zhang, Xin, et al.
Publicado: (2023)
Benchmarking Automatic Speech Recognition Models for African Languages
por: Nahabwe, Alvin, et al.
Publicado: (2025)
por: Nahabwe, Alvin, et al.
Publicado: (2025)
Speech Separation based on Contrastive Learning and Deep Modularization
por: Ochieng, Peter
Publicado: (2023)
por: Ochieng, Peter
Publicado: (2023)
ESPnet-SpeechLM: An Open Speech Language Model Toolkit
por: Tian, Jinchuan, et al.
Publicado: (2025)
por: Tian, Jinchuan, et al.
Publicado: (2025)
STaR: Distilling Speech Temporal Relation for Lightweight Speech Self-Supervised Learning Models
por: Jang, Kangwook, et al.
Publicado: (2023)
por: Jang, Kangwook, et al.
Publicado: (2023)
SALM-Duplex: Efficient and Direct Duplex Modeling for Speech-to-Speech Language Model
por: Hu, Ke, et al.
Publicado: (2025)
por: Hu, Ke, et al.
Publicado: (2025)
Speech Recognition Rescoring with Large Speech-Text Foundation Models
por: Shivakumar, Prashanth Gurunath, et al.
Publicado: (2024)
por: Shivakumar, Prashanth Gurunath, et al.
Publicado: (2024)
AdaST: Dynamically Adapting Encoder States in the Decoder for End-to-End Speech-to-Text Translation
por: Huang, Wuwei, et al.
Publicado: (2025)
por: Huang, Wuwei, et al.
Publicado: (2025)
Spiralformer: Low Latency Encoder for Streaming Speech Recognition with Circular Layer Skipping and Early Exiting
por: Tsunoo, Emiru, et al.
Publicado: (2025)
por: Tsunoo, Emiru, et al.
Publicado: (2025)
An Empirical Study of Speech Language Models for Prompt-Conditioned Speech Synthesis
por: Peng, Yifan, et al.
Publicado: (2024)
por: Peng, Yifan, et al.
Publicado: (2024)
Spatial Speech Translation: Translating Across Space With Binaural Hearables
por: Chen, Tuochao, et al.
Publicado: (2025)
por: Chen, Tuochao, et al.
Publicado: (2025)
Enhancing Large Language Model-based Speech Recognition by Contextualization for Rare and Ambiguous Words
por: Nozawa, Kento, et al.
Publicado: (2024)
por: Nozawa, Kento, et al.
Publicado: (2024)
Ejemplares similares
-
The ParlaSpeech Collection of Automatically Generated Speech and Text Datasets from Parliamentary Proceedings
por: Ljubešić, Nikola, et al.
Publicado: (2024) -
Mići Princ -- A Little Boy Teaching Speech Technologies the Chakavian Dialect
por: Ljubešić, Nikola, et al.
Publicado: (2026) -
Performance Analysis of Speech Encoders for Low-Resource SLU and ASR in Tunisian Dialect
por: Mdhaffar, Salima, et al.
Publicado: (2024) -
Cross-Dialect Text-To-Speech in Pitch-Accent Language Incorporating Multi-Dialect Phoneme-Level BERT
por: Yamauchi, Kazuki, et al.
Publicado: (2024) -
Voxlect: A Speech Foundation Model Benchmark for Modeling Dialects and Regional Languages Around the Globe
por: Feng, Tiantian, et al.
Publicado: (2025)