PolySpeech-100: A Large-Scale Benchmark for Speech Understanding Across 100+ Languages and Dialects
Fuente:
arXiv
Salvato in:
| Autori principali: | Yang, Sicheng, Ruan, Shulan, Wu, Shiwei, Liu, Yu, Fan, Lu, Li, Zhi, He, You |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PolySpeech: Exploring Unified Multitask Speech Models for Competitiveness with Single-task Models
di: Yang, Runyan, et al.
Pubblicazione: (2024)
di: Yang, Runyan, et al.
Pubblicazione: (2024)
A Survey on Speech Large Language Models for Understanding
di: Peng, Jing, et al.
Pubblicazione: (2024)
di: Peng, Jing, et al.
Pubblicazione: (2024)
Extending Multilingual Speech Synthesis to 100+ Languages without Transcribed Data
di: Saeki, Takaaki, et al.
Pubblicazione: (2024)
di: Saeki, Takaaki, et al.
Pubblicazione: (2024)
WenetSpeech-Wu: Datasets, Benchmarks, and Models for a Unified Chinese Wu Dialect Speech Processing Ecosystem
di: Wang, Chengyou, et al.
Pubblicazione: (2026)
di: Wang, Chengyou, et al.
Pubblicazione: (2026)
DualSpeechLM: Towards Unified Speech Understanding and Generation via Dual Speech Token Modeling with Large Language Models
di: Wang, Yuanyuan, et al.
Pubblicazione: (2025)
di: Wang, Yuanyuan, et al.
Pubblicazione: (2025)
ParaS2S: Benchmarking and Aligning Spoken Language Models for Paralinguistic-aware Speech-to-Speech Interaction
di: Yang, Shu-wen, et al.
Pubblicazione: (2025)
di: Yang, Shu-wen, et al.
Pubblicazione: (2025)
PAC: Pronunciation-Aware Contextualized Large Language Model-based Automatic Speech Recognition
di: Fu, Li, et al.
Pubblicazione: (2025)
di: Fu, Li, et al.
Pubblicazione: (2025)
UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition
di: Fu, Li, et al.
Pubblicazione: (2024)
di: Fu, Li, et al.
Pubblicazione: (2024)
Benchmarking Humans and Machines on Complex Multilingual Speech Understanding Tasks
di: Kankanala, Sai Samrat, et al.
Pubblicazione: (2025)
di: Kankanala, Sai Samrat, et al.
Pubblicazione: (2025)
A Multi-Dialectal Dataset for German Dialect ASR and Dialect-to-Standard Speech Translation
di: Blaschke, Verena, et al.
Pubblicazione: (2025)
di: Blaschke, Verena, et al.
Pubblicazione: (2025)
Identifying Primary Stress Across Related Languages and Dialects with Transformer-based Speech Encoder Models
di: Ljubešić, Nikola, et al.
Pubblicazione: (2025)
di: Ljubešić, Nikola, et al.
Pubblicazione: (2025)
TASU: Text-Only Alignment for Speech Understanding
di: Peng, Jing, et al.
Pubblicazione: (2025)
di: Peng, Jing, et al.
Pubblicazione: (2025)
Adapting Speech Foundation Models for Unified Multimodal Speech Recognition with Large Language Models
di: Zhang, Jing-Xuan, et al.
Pubblicazione: (2025)
di: Zhang, Jing-Xuan, et al.
Pubblicazione: (2025)
Interleaved Speech-Text Language Models for Simple Streaming Text-to-Speech Synthesis
di: Yang, Yifan, et al.
Pubblicazione: (2024)
di: Yang, Yifan, et al.
Pubblicazione: (2024)
Voxlect: A Speech Foundation Model Benchmark for Modeling Dialects and Regional Languages Around the Globe
di: Feng, Tiantian, et al.
Pubblicazione: (2025)
di: Feng, Tiantian, et al.
Pubblicazione: (2025)
RLBR: Reinforcement Learning with Biasing Rewards for Contextual Speech Large Language Models
di: Ren, Bo, et al.
Pubblicazione: (2026)
di: Ren, Bo, et al.
Pubblicazione: (2026)
Balancing Speech Understanding and Generation Using Continual Pre-training for Codec-based Speech LLM
di: Shi, Jiatong, et al.
Pubblicazione: (2025)
di: Shi, Jiatong, et al.
Pubblicazione: (2025)
Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation
di: He, Haorui, et al.
Pubblicazione: (2024)
di: He, Haorui, et al.
Pubblicazione: (2024)
ShiftySpeech: A Large-Scale Synthetic Speech Dataset with Distribution Shifts
di: Garg, Ashi, et al.
Pubblicazione: (2025)
di: Garg, Ashi, et al.
Pubblicazione: (2025)
Multi-Scale Temporal Transformer For Speech Emotion Recognition
di: Li, Zhipeng, et al.
Pubblicazione: (2024)
di: Li, Zhipeng, et al.
Pubblicazione: (2024)
S2ST-Omni: Hierarchical Language-Aware SpeechLLM Adaptation for Multilingual Speech-to-Speech Translation
di: Pan, Yu, et al.
Pubblicazione: (2025)
di: Pan, Yu, et al.
Pubblicazione: (2025)
Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages
di: Shao, Mingchen, et al.
Pubblicazione: (2025)
di: Shao, Mingchen, et al.
Pubblicazione: (2025)
Just ASR + LLM? A Study on Speech Large Language Models' Ability to Identify and Understand Speaker in Spoken Dialogue
di: Wu, Junkai, et al.
Pubblicazione: (2024)
di: Wu, Junkai, et al.
Pubblicazione: (2024)
Evaluating Multichannel Speech Enhancement Algorithms at the Phoneme Scale Across Genders
di: Monir, Nasser-Eddine, et al.
Pubblicazione: (2025)
di: Monir, Nasser-Eddine, et al.
Pubblicazione: (2025)
Benchmarking Large Pretrained Multilingual Models on Québec French Speech Recognition
di: Serrand, Coralie, et al.
Pubblicazione: (2025)
di: Serrand, Coralie, et al.
Pubblicazione: (2025)
Towards Fine-Grained Multi-Dimensional Speech Understanding: Data Pipeline, Benchmark, and Model
di: Li, Guojian, et al.
Pubblicazione: (2026)
di: Li, Guojian, et al.
Pubblicazione: (2026)
Emo-bias: A Large Scale Evaluation of Social Bias on Speech Emotion Recognition
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2024)
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2024)
WenetSpeech4TTS: A 12,800-hour Mandarin TTS Corpus for Large Speech Generation Model Benchmark
di: Ma, Linhan, et al.
Pubblicazione: (2024)
di: Ma, Linhan, et al.
Pubblicazione: (2024)
Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition
di: Bai, Ye, et al.
Pubblicazione: (2024)
di: Bai, Ye, et al.
Pubblicazione: (2024)
Cross-Dialect Text-To-Speech in Pitch-Accent Language Incorporating Multi-Dialect Phoneme-Level BERT
di: Yamauchi, Kazuki, et al.
Pubblicazione: (2024)
di: Yamauchi, Kazuki, et al.
Pubblicazione: (2024)
Aligning Speech to Languages to Enhance Code-switching Speech Recognition
di: Liu, Hexin, et al.
Pubblicazione: (2024)
di: Liu, Hexin, et al.
Pubblicazione: (2024)
Towards Efficient Speech-Text Jointly Decoding within One Speech Language Model
di: Wu, Haibin, et al.
Pubblicazione: (2025)
di: Wu, Haibin, et al.
Pubblicazione: (2025)
AS-Speech: Adaptive Style For Speech Synthesis
di: Li, Zhipeng, et al.
Pubblicazione: (2024)
di: Li, Zhipeng, et al.
Pubblicazione: (2024)
Auden-Voice: General-Purpose Voice Encoder for Speech and Language Understanding
di: Huo, Mingyue, et al.
Pubblicazione: (2025)
di: Huo, Mingyue, et al.
Pubblicazione: (2025)
Dialectal Coverage And Generalization in Arabic Speech Recognition
di: Djanibekov, Amirbek, et al.
Pubblicazione: (2024)
di: Djanibekov, Amirbek, et al.
Pubblicazione: (2024)
Exploring Speech Foundation Models for Speaker Diarization Across Lifespan
di: Xu, Anfeng, et al.
Pubblicazione: (2026)
di: Xu, Anfeng, et al.
Pubblicazione: (2026)
Benchmarking Neural Speech Codec Intelligibility with SITool
di: Leschanowsky, Anna, et al.
Pubblicazione: (2025)
di: Leschanowsky, Anna, et al.
Pubblicazione: (2025)
FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech
di: Ma, Linhan, et al.
Pubblicazione: (2025)
di: Ma, Linhan, et al.
Pubblicazione: (2025)
Speech-Omni-Lite: Portable Speech Interfaces for Vision-Language Models
di: Tao, Dehua, et al.
Pubblicazione: (2026)
di: Tao, Dehua, et al.
Pubblicazione: (2026)
Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis
di: Liao, Shijia, et al.
Pubblicazione: (2024)
di: Liao, Shijia, et al.
Pubblicazione: (2024)
Documenti analoghi
-
PolySpeech: Exploring Unified Multitask Speech Models for Competitiveness with Single-task Models
di: Yang, Runyan, et al.
Pubblicazione: (2024) -
A Survey on Speech Large Language Models for Understanding
di: Peng, Jing, et al.
Pubblicazione: (2024) -
Extending Multilingual Speech Synthesis to 100+ Languages without Transcribed Data
di: Saeki, Takaaki, et al.
Pubblicazione: (2024) -
WenetSpeech-Wu: Datasets, Benchmarks, and Models for a Unified Chinese Wu Dialect Speech Processing Ecosystem
di: Wang, Chengyou, et al.
Pubblicazione: (2026) -
DualSpeechLM: Towards Unified Speech Understanding and Generation via Dual Speech Token Modeling with Large Language Models
di: Wang, Yuanyuan, et al.
Pubblicazione: (2025)