Guardado en:
| Autores principales: | Groh, René, Goes, Nina, Kist, Andreas M. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2403.09753 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning
por: Xu, Rixi, et al.
Publicado: (2026)
por: Xu, Rixi, et al.
Publicado: (2026)
Enhancing Neural Spoken Language Recognition: An Exploration with Multilingual Datasets
por: Anidjar, Or Haim, et al.
Publicado: (2025)
por: Anidjar, Or Haim, et al.
Publicado: (2025)
UniSLU: Unified Spoken Language Understanding from Heterogeneous Cross-Task Datasets
por: Sheng, Zhichao, et al.
Publicado: (2025)
por: Sheng, Zhichao, et al.
Publicado: (2025)
BirdSet: A Large-Scale Dataset for Audio Classification in Avian Bioacoustics
por: Rauch, Lukas, et al.
Publicado: (2024)
por: Rauch, Lukas, et al.
Publicado: (2024)
HH-Codec: High Compression High-fidelity Discrete Neural Codec for Spoken Language Modeling
por: Xue, Rongkun, et al.
Publicado: (2025)
por: Xue, Rongkun, et al.
Publicado: (2025)
TELEVAL: A Dynamic Benchmark Designed for Spoken Language Models in Chinese Interactive Scenarios
por: Li, Zehan, et al.
Publicado: (2025)
por: Li, Zehan, et al.
Publicado: (2025)
Towards Quantifying and Reducing Language Mismatch Effects in Cross-Lingual Speech Anti-Spoofing
por: Liu, Tianchi, et al.
Publicado: (2024)
por: Liu, Tianchi, et al.
Publicado: (2024)
IndieFake Dataset: A Benchmark Dataset for Audio Deepfake Detection
por: Kumar, Abhay, et al.
Publicado: (2025)
por: Kumar, Abhay, et al.
Publicado: (2025)
VStyle: A Benchmark for Voice Style Adaptation with Spoken Instructions
por: Zhan, Jun, et al.
Publicado: (2025)
por: Zhan, Jun, et al.
Publicado: (2025)
WavRAG: Audio-Integrated Retrieval Augmented Generation for Spoken Dialogue Models
por: Chen, Yifu, et al.
Publicado: (2025)
por: Chen, Yifu, et al.
Publicado: (2025)
Cross-Domain Audio Deepfake Detection: Dataset and Analysis
por: Li, Yuang, et al.
Publicado: (2024)
por: Li, Yuang, et al.
Publicado: (2024)
Towards Unified Neural Decoding of Perceived, Spoken and Imagined Speech from EEG Signals
por: Lee, Jung-Sun, et al.
Publicado: (2024)
por: Lee, Jung-Sun, et al.
Publicado: (2024)
Evaluating and Improving Continual Learning in Spoken Language Understanding
por: Yang, Muqiao, et al.
Publicado: (2024)
por: Yang, Muqiao, et al.
Publicado: (2024)
Evaluating Hallucinations in Audio-Visual Multimodal LLMs with Spoken Queries under Diverse Acoustic Conditions
por: Park, Hansol, et al.
Publicado: (2025)
por: Park, Hansol, et al.
Publicado: (2025)
MOSA: Music Motion with Semantic Annotation Dataset for Cross-Modal Music Processing
por: Huang, Yu-Fen, et al.
Publicado: (2024)
por: Huang, Yu-Fen, et al.
Publicado: (2024)
GOAT-SLM: A Spoken Language Model with Paralinguistic and Speaker Characteristic Awareness
por: Chen, Hongjie, et al.
Publicado: (2025)
por: Chen, Hongjie, et al.
Publicado: (2025)
MULTI-Bench: A Multi-Turn Interactive Benchmark for Assessing Emotional Intelligence ability of Spoken Dialogue Models
por: Deng, Yayue, et al.
Publicado: (2025)
por: Deng, Yayue, et al.
Publicado: (2025)
Data Augmentation for Spoken Grammatical Error Correction
por: Karanasou, Penny, et al.
Publicado: (2025)
por: Karanasou, Penny, et al.
Publicado: (2025)
DEAF: A Benchmark for Diagnostic Evaluation of Acoustic Faithfulness in Audio Language Models
por: Xiong, Jiaqi, et al.
Publicado: (2026)
por: Xiong, Jiaqi, et al.
Publicado: (2026)
VoxPrivacy: A Benchmark for Evaluating Interactional Privacy of Speech Language Models
por: Wang, Yuxiang, et al.
Publicado: (2026)
por: Wang, Yuxiang, et al.
Publicado: (2026)
Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models
por: Song, Zirui, et al.
Publicado: (2025)
por: Song, Zirui, et al.
Publicado: (2025)
MixAssist: An Audio-Language Dataset for Co-Creative AI Assistance in Music Mixing
por: Clemens, Michael, et al.
Publicado: (2025)
por: Clemens, Michael, et al.
Publicado: (2025)
Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models
por: Yang, Wanqi, et al.
Publicado: (2024)
por: Yang, Wanqi, et al.
Publicado: (2024)
The Music Maestro or The Musically Challenged, A Massive Music Evaluation Benchmark for Large Language Models
por: Li, Jiajia, et al.
Publicado: (2024)
por: Li, Jiajia, et al.
Publicado: (2024)
Retrieval Augmented End-to-End Spoken Dialog Models
por: Wang, Mingqiu, et al.
Publicado: (2024)
por: Wang, Mingqiu, et al.
Publicado: (2024)
Cross-Lingual Query-by-Example Spoken Term Detection: A Transformer-Based Approach
por: Fatemeh, Allahdadi, et al.
Publicado: (2024)
por: Fatemeh, Allahdadi, et al.
Publicado: (2024)
NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction
por: Wang, Qichao, et al.
Publicado: (2025)
por: Wang, Qichao, et al.
Publicado: (2025)
Vocal Tract Length Warped Features for Spoken Keyword Spotting
por: Sarkar, Achintya kr., et al.
Publicado: (2025)
por: Sarkar, Achintya kr., et al.
Publicado: (2025)
An Efficient Self-Learning Framework For Interactive Spoken Dialog Systems
por: Tulsiani, Hitesh, et al.
Publicado: (2024)
por: Tulsiani, Hitesh, et al.
Publicado: (2024)
CrossSpeech++: Cross-lingual Speech Synthesis with Decoupled Language and Speaker Generation
por: Kim, Ji-Hoon, et al.
Publicado: (2024)
por: Kim, Ji-Hoon, et al.
Publicado: (2024)
Spoken Language Intelligence of Large Language Models for Language Learning
por: Peng, Linkai, et al.
Publicado: (2023)
por: Peng, Linkai, et al.
Publicado: (2023)
Harder or Different? Understanding Generalization of Audio Deepfake Detection
por: Müller, Nicolas M., et al.
Publicado: (2024)
por: Müller, Nicolas M., et al.
Publicado: (2024)
Sound Classification of Four Insect Classes
por: Wang, Yinxuan, et al.
Publicado: (2024)
por: Wang, Yinxuan, et al.
Publicado: (2024)
Audio Atlas: Visualizing and Exploring Audio Datasets
por: Lanzendörfer, Luca A., et al.
Publicado: (2024)
por: Lanzendörfer, Luca A., et al.
Publicado: (2024)
Audio Deepfake Attribution: An Initial Dataset and Investigation
por: Yan, Xinrui, et al.
Publicado: (2022)
por: Yan, Xinrui, et al.
Publicado: (2022)
DASB - Discrete Audio and Speech Benchmark
por: Mousavi, Pooneh, et al.
Publicado: (2024)
por: Mousavi, Pooneh, et al.
Publicado: (2024)
Fundamental Survey on Neuromorphic Based Audio Classification
por: Basu, Amlan, et al.
Publicado: (2025)
por: Basu, Amlan, et al.
Publicado: (2025)
Task-Lens: Cross-Task Utility Based Speech Dataset Profiling for Low-Resource Indian Languages
por: Sharma, Swati, et al.
Publicado: (2026)
por: Sharma, Swati, et al.
Publicado: (2026)
Data-Centric Improvements for Enhancing Multi-Modal Understanding in Spoken Conversation Modeling
por: Chen, Maximillian, et al.
Publicado: (2024)
por: Chen, Maximillian, et al.
Publicado: (2024)
The Codecfake Dataset and Countermeasures for the Universally Detection of Deepfake Audio
por: Xie, Yuankun, et al.
Publicado: (2024)
por: Xie, Yuankun, et al.
Publicado: (2024)
Ejemplares similares
-
X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning
por: Xu, Rixi, et al.
Publicado: (2026) -
Enhancing Neural Spoken Language Recognition: An Exploration with Multilingual Datasets
por: Anidjar, Or Haim, et al.
Publicado: (2025) -
UniSLU: Unified Spoken Language Understanding from Heterogeneous Cross-Task Datasets
por: Sheng, Zhichao, et al.
Publicado: (2025) -
BirdSet: A Large-Scale Dataset for Audio Classification in Avian Bioacoustics
por: Rauch, Lukas, et al.
Publicado: (2024) -
HH-Codec: High Compression High-fidelity Discrete Neural Codec for Spoken Language Modeling
por: Xue, Rongkun, et al.
Publicado: (2025)