HPSU: A Benchmark for Human-Level Perception in Real-World Spoken Speech Understanding
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Chen, Yang, Peiji, Zhong, Yicheng, Yu, Jianxing, Wang, Zhisheng, Gou, Zihao, Chen, Wenqing, Yin, Jian |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Multi-Reward GRPO for Stable and Prosodic Single-Codebook TTS LLMs at Scale
por: Zhong, Yicheng, et al.
Publicado: (2025)
por: Zhong, Yicheng, et al.
Publicado: (2025)
Optimizing Neural Speech Codec for Low-Bitrate Compression via Multi-Scale Encoding
por: Yang, Peiji, et al.
Publicado: (2024)
por: Yang, Peiji, et al.
Publicado: (2024)
Spontaneous Style Text-to-Speech Synthesis with Controllable Spontaneous Behaviors Based on Language Models
por: Li, Weiqin, et al.
Publicado: (2024)
por: Li, Weiqin, et al.
Publicado: (2024)
Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs
por: Wang, Dingdong, et al.
Publicado: (2025)
por: Wang, Dingdong, et al.
Publicado: (2025)
On the Evaluation of Speech Foundation Models for Spoken Language Understanding
por: Arora, Siddhant, et al.
Publicado: (2024)
por: Arora, Siddhant, et al.
Publicado: (2024)
MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark
por: Wang, Dingdong, et al.
Publicado: (2025)
por: Wang, Dingdong, et al.
Publicado: (2025)
LongSpeech: A Scalable Benchmark for Transcription, Translation and Understanding in Long Speech
por: Yang, Fei, et al.
Publicado: (2026)
por: Yang, Fei, et al.
Publicado: (2026)
Can Large Audio Language Models Understand Audio Well? Speech, Scene and Events Understanding Benchmark for LALMs
por: Yin, Han, et al.
Publicado: (2025)
por: Yin, Han, et al.
Publicado: (2025)
Zero Resource Code-switched Speech Benchmark Using Speech Utterance Pairs For Multiple Spoken Languages
por: Huang, Kuan-Po, et al.
Publicado: (2023)
por: Huang, Kuan-Po, et al.
Publicado: (2023)
WHISMA: A Speech-LLM to Perform Zero-shot Spoken Language Understanding
por: Li, Mohan, et al.
Publicado: (2024)
por: Li, Mohan, et al.
Publicado: (2024)
SpeechJudge: Towards Human-Level Judgment for Speech Naturalness
por: Zhang, Xueyao, et al.
Publicado: (2025)
por: Zhang, Xueyao, et al.
Publicado: (2025)
OSUM-EChat: Enhancing End-to-End Empathetic Spoken Chatbot via Understanding-Driven Spoken Dialogue
por: Geng, Xuelong, et al.
Publicado: (2025)
por: Geng, Xuelong, et al.
Publicado: (2025)
SD-Eval: A Benchmark Dataset for Spoken Dialogue Understanding Beyond Words
por: Ao, Junyi, et al.
Publicado: (2024)
por: Ao, Junyi, et al.
Publicado: (2024)
A Unified Spoken Language Model with Injected Emotional-Attribution Thinking for Human-like Interaction
por: Wang, Qing, et al.
Publicado: (2026)
por: Wang, Qing, et al.
Publicado: (2026)
Interventional Speech Noise Injection for ASR Generalizable Spoken Language Understanding
por: Jung, Yeonjoon, et al.
Publicado: (2024)
por: Jung, Yeonjoon, et al.
Publicado: (2024)
RSA-Bench: Benchmarking Audio Large Models in Real-World Acoustic Scenarios
por: Zhang, Yibo, et al.
Publicado: (2026)
por: Zhang, Yibo, et al.
Publicado: (2026)
On the Distillation Loss Functions of Speech VAE for Unified Reconstruction, Understanding, and Generation
por: Cheng, Changhao, et al.
Publicado: (2026)
por: Cheng, Changhao, et al.
Publicado: (2026)
VoxMind: An End-to-End Agentic Spoken Dialogue System
por: Liang, Tianle, et al.
Publicado: (2026)
por: Liang, Tianle, et al.
Publicado: (2026)
ALAS: Measuring Latent Speech-Text Alignment For Spoken Language Understanding In Multimodal LLMs
por: Mousavi, Pooneh, et al.
Publicado: (2025)
por: Mousavi, Pooneh, et al.
Publicado: (2025)
EmoBox: Multilingual Multi-corpus Speech Emotion Recognition Toolkit and Benchmark
por: Ma, Ziyang, et al.
Publicado: (2024)
por: Ma, Ziyang, et al.
Publicado: (2024)
How Well Do Current Speech Deepfake Detection Methods Generalize to the Real World?
por: Li, Daixian, et al.
Publicado: (2026)
por: Li, Daixian, et al.
Publicado: (2026)
R2-SVC: Towards Real-World Robust and Expressive Zero-shot Singing Voice Conversion
por: Zheng, Junjie, et al.
Publicado: (2025)
por: Zheng, Junjie, et al.
Publicado: (2025)
TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
por: Tseng, Liang-Hsuan, et al.
Publicado: (2025)
por: Tseng, Liang-Hsuan, et al.
Publicado: (2025)
"Alexa, can you forget me?" Machine Unlearning Benchmark in Spoken Language Understanding
por: Koudounas, Alkis, et al.
Publicado: (2025)
por: Koudounas, Alkis, et al.
Publicado: (2025)
VoxEval: Benchmarking the Knowledge Understanding Capabilities of End-to-End Spoken Language Models
por: Cui, Wenqian, et al.
Publicado: (2025)
por: Cui, Wenqian, et al.
Publicado: (2025)
End-to-end Contrastive Language-Speech Pretraining Model For Long-form Spoken Question Answering
por: Hu, Jiliang, et al.
Publicado: (2025)
por: Hu, Jiliang, et al.
Publicado: (2025)
TurnGuide: Enhancing Meaningful Full Duplex Spoken Interactions via Dynamic Turn-Level Text-Speech Interleaving
por: Cui, Wenqian, et al.
Publicado: (2025)
por: Cui, Wenqian, et al.
Publicado: (2025)
Evaluating and Improving Continual Learning in Spoken Language Understanding
por: Yang, Muqiao, et al.
Publicado: (2024)
por: Yang, Muqiao, et al.
Publicado: (2024)
Voice of India: A Large-Scale Benchmark for Real-World Speech Recognition in India
por: Bhogale, Kaushal, et al.
Publicado: (2026)
por: Bhogale, Kaushal, et al.
Publicado: (2026)
Exploring Effective Distillation of Self-Supervised Speech Models for Automatic Speech Recognition
por: Wang, Yujin, et al.
Publicado: (2022)
por: Wang, Yujin, et al.
Publicado: (2022)
MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix
por: Ma, Ziyang, et al.
Publicado: (2025)
por: Ma, Ziyang, et al.
Publicado: (2025)
TELEVAL: A Dynamic Benchmark Designed for Spoken Language Models in Chinese Interactive Scenarios
por: Li, Zehan, et al.
Publicado: (2025)
por: Li, Zehan, et al.
Publicado: (2025)
Long-Form Speech Generation with Spoken Language Models
por: Park, Se Jin, et al.
Publicado: (2024)
por: Park, Se Jin, et al.
Publicado: (2024)
RTCFake: Speech Deepfake Detection in Real-Time Communication
por: Xue, Jun, et al.
Publicado: (2026)
por: Xue, Jun, et al.
Publicado: (2026)
LLaMA-Omni2: LLM-based Real-time Spoken Chatbot with Autoregressive Streaming Speech Synthesis
por: Fang, Qingkai, et al.
Publicado: (2025)
por: Fang, Qingkai, et al.
Publicado: (2025)
SpeechDPR: End-to-End Spoken Passage Retrieval for Open-Domain Spoken Question Answering
por: Lin, Chyi-Jiunn, et al.
Publicado: (2024)
por: Lin, Chyi-Jiunn, et al.
Publicado: (2024)
DiscreteSLU: A Large Language Model with Self-Supervised Discrete Speech Units for Spoken Language Understanding
por: Shon, Suwon, et al.
Publicado: (2024)
por: Shon, Suwon, et al.
Publicado: (2024)
DisCo-Speech: Controllable Zero-Shot Speech Generation with A Disentangled Speech Codec
por: Li, Tao, et al.
Publicado: (2025)
por: Li, Tao, et al.
Publicado: (2025)
DiffuSpeech: Silent Thought, Spoken Answer via Unified Speech-Text Diffusion
por: Lou, Yuxuan, et al.
Publicado: (2026)
por: Lou, Yuxuan, et al.
Publicado: (2026)
Leveraging Speech PTM, Text LLM, and Emotional TTS for Speech Emotion Recognition
por: Ma, Ziyang, et al.
Publicado: (2023)
por: Ma, Ziyang, et al.
Publicado: (2023)
Ejemplares similares
-
Multi-Reward GRPO for Stable and Prosodic Single-Codebook TTS LLMs at Scale
por: Zhong, Yicheng, et al.
Publicado: (2025) -
Optimizing Neural Speech Codec for Low-Bitrate Compression via Multi-Scale Encoding
por: Yang, Peiji, et al.
Publicado: (2024) -
Spontaneous Style Text-to-Speech Synthesis with Controllable Spontaneous Behaviors Based on Language Models
por: Li, Weiqin, et al.
Publicado: (2024) -
Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs
por: Wang, Dingdong, et al.
Publicado: (2025) -
On the Evaluation of Speech Foundation Models for Spoken Language Understanding
por: Arora, Siddhant, et al.
Publicado: (2024)