SpokeN-100: A Cross-Lingual Benchmarking Dataset for The Classification of Spoken Numbers in Different Languages
Fuente:
arXiv
Salvato in:
| Autori principali: | Groh, René, Goes, Nina, Kist, Andreas M. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning
di: Xu, Rixi, et al.
Pubblicazione: (2026)
di: Xu, Rixi, et al.
Pubblicazione: (2026)
Enhancing Neural Spoken Language Recognition: An Exploration with Multilingual Datasets
di: Anidjar, Or Haim, et al.
Pubblicazione: (2025)
di: Anidjar, Or Haim, et al.
Pubblicazione: (2025)
BirdSet: A Large-Scale Dataset for Audio Classification in Avian Bioacoustics
di: Rauch, Lukas, et al.
Pubblicazione: (2024)
di: Rauch, Lukas, et al.
Pubblicazione: (2024)
UniSLU: Unified Spoken Language Understanding from Heterogeneous Cross-Task Datasets
di: Sheng, Zhichao, et al.
Pubblicazione: (2025)
di: Sheng, Zhichao, et al.
Pubblicazione: (2025)
HH-Codec: High Compression High-fidelity Discrete Neural Codec for Spoken Language Modeling
di: Xue, Rongkun, et al.
Pubblicazione: (2025)
di: Xue, Rongkun, et al.
Pubblicazione: (2025)
IndieFake Dataset: A Benchmark Dataset for Audio Deepfake Detection
di: Kumar, Abhay, et al.
Pubblicazione: (2025)
di: Kumar, Abhay, et al.
Pubblicazione: (2025)
TELEVAL: A Dynamic Benchmark Designed for Spoken Language Models in Chinese Interactive Scenarios
di: Li, Zehan, et al.
Pubblicazione: (2025)
di: Li, Zehan, et al.
Pubblicazione: (2025)
WavRAG: Audio-Integrated Retrieval Augmented Generation for Spoken Dialogue Models
di: Chen, Yifu, et al.
Pubblicazione: (2025)
di: Chen, Yifu, et al.
Pubblicazione: (2025)
Towards Quantifying and Reducing Language Mismatch Effects in Cross-Lingual Speech Anti-Spoofing
di: Liu, Tianchi, et al.
Pubblicazione: (2024)
di: Liu, Tianchi, et al.
Pubblicazione: (2024)
Cross-Domain Audio Deepfake Detection: Dataset and Analysis
di: Li, Yuang, et al.
Pubblicazione: (2024)
di: Li, Yuang, et al.
Pubblicazione: (2024)
Towards Unified Neural Decoding of Perceived, Spoken and Imagined Speech from EEG Signals
di: Lee, Jung-Sun, et al.
Pubblicazione: (2024)
di: Lee, Jung-Sun, et al.
Pubblicazione: (2024)
VStyle: A Benchmark for Voice Style Adaptation with Spoken Instructions
di: Zhan, Jun, et al.
Pubblicazione: (2025)
di: Zhan, Jun, et al.
Pubblicazione: (2025)
Evaluating Hallucinations in Audio-Visual Multimodal LLMs with Spoken Queries under Diverse Acoustic Conditions
di: Park, Hansol, et al.
Pubblicazione: (2025)
di: Park, Hansol, et al.
Pubblicazione: (2025)
MOSA: Music Motion with Semantic Annotation Dataset for Cross-Modal Music Processing
di: Huang, Yu-Fen, et al.
Pubblicazione: (2024)
di: Huang, Yu-Fen, et al.
Pubblicazione: (2024)
Evaluating and Improving Continual Learning in Spoken Language Understanding
di: Yang, Muqiao, et al.
Pubblicazione: (2024)
di: Yang, Muqiao, et al.
Pubblicazione: (2024)
DEAF: A Benchmark for Diagnostic Evaluation of Acoustic Faithfulness in Audio Language Models
di: Xiong, Jiaqi, et al.
Pubblicazione: (2026)
di: Xiong, Jiaqi, et al.
Pubblicazione: (2026)
VoxPrivacy: A Benchmark for Evaluating Interactional Privacy of Speech Language Models
di: Wang, Yuxiang, et al.
Pubblicazione: (2026)
di: Wang, Yuxiang, et al.
Pubblicazione: (2026)
Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models
di: Song, Zirui, et al.
Pubblicazione: (2025)
di: Song, Zirui, et al.
Pubblicazione: (2025)
MixAssist: An Audio-Language Dataset for Co-Creative AI Assistance in Music Mixing
di: Clemens, Michael, et al.
Pubblicazione: (2025)
di: Clemens, Michael, et al.
Pubblicazione: (2025)
GOAT-SLM: A Spoken Language Model with Paralinguistic and Speaker Characteristic Awareness
di: Chen, Hongjie, et al.
Pubblicazione: (2025)
di: Chen, Hongjie, et al.
Pubblicazione: (2025)
Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models
di: Yang, Wanqi, et al.
Pubblicazione: (2024)
di: Yang, Wanqi, et al.
Pubblicazione: (2024)
The Music Maestro or The Musically Challenged, A Massive Music Evaluation Benchmark for Large Language Models
di: Li, Jiajia, et al.
Pubblicazione: (2024)
di: Li, Jiajia, et al.
Pubblicazione: (2024)
MULTI-Bench: A Multi-Turn Interactive Benchmark for Assessing Emotional Intelligence ability of Spoken Dialogue Models
di: Deng, Yayue, et al.
Pubblicazione: (2025)
di: Deng, Yayue, et al.
Pubblicazione: (2025)
Cross-Lingual Query-by-Example Spoken Term Detection: A Transformer-Based Approach
di: Fatemeh, Allahdadi, et al.
Pubblicazione: (2024)
di: Fatemeh, Allahdadi, et al.
Pubblicazione: (2024)
Data Augmentation for Spoken Grammatical Error Correction
di: Karanasou, Penny, et al.
Pubblicazione: (2025)
di: Karanasou, Penny, et al.
Pubblicazione: (2025)
Sound Classification of Four Insect Classes
di: Wang, Yinxuan, et al.
Pubblicazione: (2024)
di: Wang, Yinxuan, et al.
Pubblicazione: (2024)
Harder or Different? Understanding Generalization of Audio Deepfake Detection
di: Müller, Nicolas M., et al.
Pubblicazione: (2024)
di: Müller, Nicolas M., et al.
Pubblicazione: (2024)
Audio Atlas: Visualizing and Exploring Audio Datasets
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2024)
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2024)
Audio Deepfake Attribution: An Initial Dataset and Investigation
di: Yan, Xinrui, et al.
Pubblicazione: (2022)
di: Yan, Xinrui, et al.
Pubblicazione: (2022)
DASB - Discrete Audio and Speech Benchmark
di: Mousavi, Pooneh, et al.
Pubblicazione: (2024)
di: Mousavi, Pooneh, et al.
Pubblicazione: (2024)
Fundamental Survey on Neuromorphic Based Audio Classification
di: Basu, Amlan, et al.
Pubblicazione: (2025)
di: Basu, Amlan, et al.
Pubblicazione: (2025)
Retrieval Augmented End-to-End Spoken Dialog Models
di: Wang, Mingqiu, et al.
Pubblicazione: (2024)
di: Wang, Mingqiu, et al.
Pubblicazione: (2024)
The Codecfake Dataset and Countermeasures for the Universally Detection of Deepfake Audio
di: Xie, Yuankun, et al.
Pubblicazione: (2024)
di: Xie, Yuankun, et al.
Pubblicazione: (2024)
Heterogeneous sound classification with the Broad Sound Taxonomy and Dataset
di: Anastasopoulou, Panagiota, et al.
Pubblicazione: (2024)
di: Anastasopoulou, Panagiota, et al.
Pubblicazione: (2024)
CrossSpeech++: Cross-lingual Speech Synthesis with Decoupled Language and Speaker Generation
di: Kim, Ji-Hoon, et al.
Pubblicazione: (2024)
di: Kim, Ji-Hoon, et al.
Pubblicazione: (2024)
NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction
di: Wang, Qichao, et al.
Pubblicazione: (2025)
di: Wang, Qichao, et al.
Pubblicazione: (2025)
Arabic Music Classification and Generation using Deep Learning
di: Elshaarawy, Mohamed, et al.
Pubblicazione: (2024)
di: Elshaarawy, Mohamed, et al.
Pubblicazione: (2024)
Self-supervised Learning for Acoustic Few-Shot Classification
di: Liang, Jingyong, et al.
Pubblicazione: (2024)
di: Liang, Jingyong, et al.
Pubblicazione: (2024)
Towards Enhanced Classification of Abnormal Lung sound in Multi-breath: A Light Weight Multi-label and Multi-head Attention Classification Method
di: Chua, Yi-Wei, et al.
Pubblicazione: (2024)
di: Chua, Yi-Wei, et al.
Pubblicazione: (2024)
Codecfake: An Initial Dataset for Detecting LLM-based Deepfake Audio
di: Lu, Yi, et al.
Pubblicazione: (2024)
di: Lu, Yi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning
di: Xu, Rixi, et al.
Pubblicazione: (2026) -
Enhancing Neural Spoken Language Recognition: An Exploration with Multilingual Datasets
di: Anidjar, Or Haim, et al.
Pubblicazione: (2025) -
BirdSet: A Large-Scale Dataset for Audio Classification in Avian Bioacoustics
di: Rauch, Lukas, et al.
Pubblicazione: (2024) -
UniSLU: Unified Spoken Language Understanding from Heterogeneous Cross-Task Datasets
di: Sheng, Zhichao, et al.
Pubblicazione: (2025) -
HH-Codec: High Compression High-fidelity Discrete Neural Codec for Spoken Language Modeling
di: Xue, Rongkun, et al.
Pubblicazione: (2025)