The ICASSP 2026 HumDial Challenge: Benchmarking Human-like Spoken Dialogue Systems in the LLM Era
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhao, Zhixian, Wang, Shuiyuan, Li, Guojian, Xue, Hongfei, Wang, Chengyou, Wang, Shuai, Xiao, Longshuai, Zhang, Zihan, Bu, Hui, Xu, Xin, Wang, Xinsheng, Liu, Hexin, Chng, Eng Siong, Lee, Hung-yi, Xie, Lei |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Full-Duplex Interaction in Spoken Dialogue Systems: A Comprehensive Study from the ICASSP 2026 HumDial Challenge
von: Wang, Chengyou, et al.
Veröffentlicht: (2026)
von: Wang, Chengyou, et al.
Veröffentlicht: (2026)
HumDial-EIBench: A Human-Recorded Multi-Turn Emotional Intelligence Benchmark for Audio Language Models
von: Wang, Shuiyuan, et al.
Veröffentlicht: (2026)
von: Wang, Shuiyuan, et al.
Veröffentlicht: (2026)
Easy Turn: Integrating Acoustic and Linguistic Modalities for Robust Turn-Taking in Full-Duplex Spoken Dialogue Systems
von: Li, Guojian, et al.
Veröffentlicht: (2025)
von: Li, Guojian, et al.
Veröffentlicht: (2025)
Bi-directional Context-Enhanced Speech Large Language Models for Multilingual Conversational ASR
von: Peng, Yizhou, et al.
Veröffentlicht: (2025)
von: Peng, Yizhou, et al.
Veröffentlicht: (2025)
Chronological Thinking in Full-Duplex Spoken Dialogue Language Models
von: Wu, Donghang, et al.
Veröffentlicht: (2025)
von: Wu, Donghang, et al.
Veröffentlicht: (2025)
OSUM-EChat: Enhancing End-to-End Empathetic Spoken Chatbot via Understanding-Driven Spoken Dialogue
von: Geng, Xuelong, et al.
Veröffentlicht: (2025)
von: Geng, Xuelong, et al.
Veröffentlicht: (2025)
Punctuation Restoration for Singaporean Spoken Languages: English, Malay, and Mandarin
von: Rao, Abhinav, et al.
Veröffentlicht: (2022)
von: Rao, Abhinav, et al.
Veröffentlicht: (2022)
EASY: Emotion-aware Speaker Anonymization via Factorized Distillation
von: Yao, Jixun, et al.
Veröffentlicht: (2025)
von: Yao, Jixun, et al.
Veröffentlicht: (2025)
The ICASSP 2026 Automatic Song Aesthetics Evaluation Challenge
von: Ma, Guobin, et al.
Veröffentlicht: (2026)
von: Ma, Guobin, et al.
Veröffentlicht: (2026)
Proactive for Uncertainty: Cause-Aware Error Diagnosis and Interactive Clarification for Spoken Dialogue Systems
von: Peng, Yizhou, et al.
Veröffentlicht: (2026)
von: Peng, Yizhou, et al.
Veröffentlicht: (2026)
Summary on The Multilingual Conversational Speech Language Model Challenge: Datasets, Tasks, Baselines, and Methods
von: Mu, Bingshen, et al.
Veröffentlicht: (2025)
von: Mu, Bingshen, et al.
Veröffentlicht: (2025)
ICMC-ASR: The ICASSP 2024 In-Car Multi-Channel Automatic Speech Recognition Challenge
von: Wang, He, et al.
Veröffentlicht: (2024)
von: Wang, He, et al.
Veröffentlicht: (2024)
DiaSynth: Synthetic Dialogue Generation Framework for Low Resource Dialogue Applications
von: Suresh, Sathya Krishnan, et al.
Veröffentlicht: (2024)
von: Suresh, Sathya Krishnan, et al.
Veröffentlicht: (2024)
FD-Bench: A Full-Duplex Benchmarking Pipeline Designed for Full Duplex Spoken Dialogue Systems
von: Peng, Yizhou, et al.
Veröffentlicht: (2025)
von: Peng, Yizhou, et al.
Veröffentlicht: (2025)
Serial-Parallel Dual-Path Architecture for Speaking Style Recognition
von: Li, Guojian, et al.
Veröffentlicht: (2025)
von: Li, Guojian, et al.
Veröffentlicht: (2025)
Steering Language Model to Stable Speech Emotion Recognition via Contextual Perception and Chain of Thought
von: Zhao, Zhixian, et al.
Veröffentlicht: (2025)
von: Zhao, Zhixian, et al.
Veröffentlicht: (2025)
MULTI-Bench: A Multi-Turn Interactive Benchmark for Assessing Emotional Intelligence ability of Spoken Dialogue Models
von: Deng, Yayue, et al.
Veröffentlicht: (2025)
von: Deng, Yayue, et al.
Veröffentlicht: (2025)
GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling
von: Yao, Jixun, et al.
Veröffentlicht: (2025)
von: Yao, Jixun, et al.
Veröffentlicht: (2025)
CS-Sum: A Benchmark for Code-Switching Dialogue Summarization and the Limits of Large Language Models
von: Suresh, Sathya Krishnan, et al.
Veröffentlicht: (2025)
von: Suresh, Sathya Krishnan, et al.
Veröffentlicht: (2025)
Mind-Paced Speaking: A Dual-Brain Approach to Real-Time Reasoning in Spoken Language Models
von: Wu, Donghang, et al.
Veröffentlicht: (2025)
von: Wu, Donghang, et al.
Veröffentlicht: (2025)
Explainable Disentanglement on Discrete Speech Representations for Noise-Robust ASR
von: Gopal, Shreyas, et al.
Veröffentlicht: (2025)
von: Gopal, Shreyas, et al.
Veröffentlicht: (2025)
Improving Code-Switching Speech Recognition with TTS Data Augmentation
von: Yeo, Yue Heng, et al.
Veröffentlicht: (2026)
von: Yeo, Yue Heng, et al.
Veröffentlicht: (2026)
ICASSP 2026 URGENT Speech Enhancement Challenge
von: Li, Chenda, et al.
Veröffentlicht: (2026)
von: Li, Chenda, et al.
Veröffentlicht: (2026)
Zero-shot Context Biasing with Trie-based Decoding using Synthetic Multi-Pronunciation
von: Liu, Changsong, et al.
Veröffentlicht: (2025)
von: Liu, Changsong, et al.
Veröffentlicht: (2025)
Hierarchical Self-Supervised Representation Learning for Depression Detection from Speech
von: Li, Yuxin, et al.
Veröffentlicht: (2025)
von: Li, Yuxin, et al.
Veröffentlicht: (2025)
Evaluating Bias in Spoken Dialogue LLMs for Real-World Decisions and Recommendations
von: Wu, Yihao, et al.
Veröffentlicht: (2025)
von: Wu, Yihao, et al.
Veröffentlicht: (2025)
NTU Speechlab LLM-Based Multilingual ASR System for Interspeech MLC-SLM Challenge 2025
von: Peng, Yizhou, et al.
Veröffentlicht: (2025)
von: Peng, Yizhou, et al.
Veröffentlicht: (2025)
TiCo: Time-Controllable Spoken Dialogue Model
von: Chang, Kai-Wei, et al.
Veröffentlicht: (2026)
von: Chang, Kai-Wei, et al.
Veröffentlicht: (2026)
Code-switching Speech Recognition Under the Lens: Model- and Data-Centric Perspectives
von: Liu, Hexin, et al.
Veröffentlicht: (2025)
von: Liu, Hexin, et al.
Veröffentlicht: (2025)
Investigating the Effects of Large-Scale Pseudo-Stereo Data and Different Speech Foundation Model on Dialogue Generative Spoken Language Model
von: Fu, Yu-Kuan, et al.
Veröffentlicht: (2024)
von: Fu, Yu-Kuan, et al.
Veröffentlicht: (2024)
Prosodic Boundary-Aware Streaming Generation for LLM-Based TTS with Streaming Text Input
von: Liu, Changsong, et al.
Veröffentlicht: (2026)
von: Liu, Changsong, et al.
Veröffentlicht: (2026)
VocalParse: Towards Unified and Scalable Singing Voice Transcription with Large Audio Language Models
von: Chen, Yukun, et al.
Veröffentlicht: (2026)
von: Chen, Yukun, et al.
Veröffentlicht: (2026)
Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Model
von: Ma, Ziyang, et al.
Veröffentlicht: (2025)
von: Ma, Ziyang, et al.
Veröffentlicht: (2025)
Text-based Talking Video Editing with Cascaded Conditional Diffusion
von: Han, Bo, et al.
Veröffentlicht: (2024)
von: Han, Bo, et al.
Veröffentlicht: (2024)
Robust Zero-Shot Text-to-Speech Synthesis with Reverse Inference Optimization
von: Hu, Yuchen, et al.
Veröffentlicht: (2024)
von: Hu, Yuchen, et al.
Veröffentlicht: (2024)
Dial HEALTHDIAL for Advice: A Multilingual and Multi-Parallel Spoken Dialogue Dataset for Knowledge-Grounded Information Seeking
von: Hu, Songbo, et al.
Veröffentlicht: (2026)
von: Hu, Songbo, et al.
Veröffentlicht: (2026)
StreamVoiceAnon+: Emotion-Preserving Streaming Speaker Anonymization via Frame-Level Acoustic Distillation
von: Kuzmin, Nikita, et al.
Veröffentlicht: (2026)
von: Kuzmin, Nikita, et al.
Veröffentlicht: (2026)
Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities
von: Lin, Guan-Ting, et al.
Veröffentlicht: (2025)
von: Lin, Guan-Ting, et al.
Veröffentlicht: (2025)
Wav2code: Restore Clean Speech Representations via Codebook Lookup for Noise-Robust ASR
von: Hu, Yuchen, et al.
Veröffentlicht: (2023)
von: Hu, Yuchen, et al.
Veröffentlicht: (2023)
Continual Learning Optimizations for Auto-regressive Decoder of Multilingual ASR systems
von: Kwok, Chin Yuen, et al.
Veröffentlicht: (2024)
von: Kwok, Chin Yuen, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Full-Duplex Interaction in Spoken Dialogue Systems: A Comprehensive Study from the ICASSP 2026 HumDial Challenge
von: Wang, Chengyou, et al.
Veröffentlicht: (2026) -
HumDial-EIBench: A Human-Recorded Multi-Turn Emotional Intelligence Benchmark for Audio Language Models
von: Wang, Shuiyuan, et al.
Veröffentlicht: (2026) -
Easy Turn: Integrating Acoustic and Linguistic Modalities for Robust Turn-Taking in Full-Duplex Spoken Dialogue Systems
von: Li, Guojian, et al.
Veröffentlicht: (2025) -
Bi-directional Context-Enhanced Speech Large Language Models for Multilingual Conversational ASR
von: Peng, Yizhou, et al.
Veröffentlicht: (2025) -
Chronological Thinking in Full-Duplex Spoken Dialogue Language Models
von: Wu, Donghang, et al.
Veröffentlicht: (2025)