Enregistré dans:
| Auteurs principaux: | Wu, Donghang, Zhang, Haoyang, Chen, Jun, Xiangyu, Zhang, Liu, Hexin, Chng, Eng Siong, Tian, Fei, Yang, Xuerui, Zhang, Xiangyu, Jiang, Daxin, Yu, Gang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2510.09592 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Chronological Thinking in Full-Duplex Spoken Dialogue Language Models
par: Wu, Donghang, et autres
Publié: (2025)
par: Wu, Donghang, et autres
Publié: (2025)
MULTI-Bench: A Multi-Turn Interactive Benchmark for Assessing Emotional Intelligence ability of Spoken Dialogue Models
par: Deng, Yayue, et autres
Publié: (2025)
par: Deng, Yayue, et autres
Publié: (2025)
Step-Audio-R1 Technical Report
par: Tian, Fei, et autres
Publié: (2025)
par: Tian, Fei, et autres
Publié: (2025)
DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action
par: Zhang, Haoyang, et autres
Publié: (2026)
par: Zhang, Haoyang, et autres
Publié: (2026)
Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English
par: Zhang, Haoyang, et autres
Publié: (2025)
par: Zhang, Haoyang, et autres
Publié: (2025)
Code-switching Speech Recognition Under the Lens: Model- and Data-Centric Perspectives
par: Liu, Hexin, et autres
Publié: (2025)
par: Liu, Hexin, et autres
Publié: (2025)
Speaking in Wavelet Domain: A Simple and Efficient Approach to Speed up Speech Diffusion Model
par: Zhang, Xiangyu, et autres
Publié: (2024)
par: Zhang, Xiangyu, et autres
Publié: (2024)
Step-Audio-R1.5 Technical Report
par: Zhang, Yuxin, et autres
Publié: (2026)
par: Zhang, Yuxin, et autres
Publié: (2026)
Aligning Speech to Languages to Enhance Code-switching Speech Recognition
par: Liu, Hexin, et autres
Publié: (2024)
par: Liu, Hexin, et autres
Publié: (2024)
Bi-directional Context-Enhanced Speech Large Language Models for Multilingual Conversational ASR
par: Peng, Yizhou, et autres
Publié: (2025)
par: Peng, Yizhou, et autres
Publié: (2025)
Language-Aware Distillation for Multilingual Instruction-Following Speech LLMs with ASR-Only Supervision
par: Gopal, Shreyas, et autres
Publié: (2026)
par: Gopal, Shreyas, et autres
Publié: (2026)
DepFlow: Disentangled Speech Generation to Mitigate Semantic Bias in Depression Detection
par: Li, Yuxin, et autres
Publié: (2026)
par: Li, Yuxin, et autres
Publié: (2026)
EASY: Emotion-aware Speaker Anonymization via Factorized Distillation
par: Yao, Jixun, et autres
Publié: (2025)
par: Yao, Jixun, et autres
Publié: (2025)
Punctuation Restoration for Singaporean Spoken Languages: English, Malay, and Mandarin
par: Rao, Abhinav, et autres
Publié: (2022)
par: Rao, Abhinav, et autres
Publié: (2022)
Explainable Disentanglement on Discrete Speech Representations for Noise-Robust ASR
par: Gopal, Shreyas, et autres
Publié: (2025)
par: Gopal, Shreyas, et autres
Publié: (2025)
NTU Speechlab LLM-Based Multilingual ASR System for Interspeech MLC-SLM Challenge 2025
par: Peng, Yizhou, et autres
Publié: (2025)
par: Peng, Yizhou, et autres
Publié: (2025)
Speech Enhancement Using Continuous Embeddings of Neural Audio Codec
par: Li, Haoyang, et autres
Publié: (2025)
par: Li, Haoyang, et autres
Publié: (2025)
GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling
par: Yao, Jixun, et autres
Publié: (2025)
par: Yao, Jixun, et autres
Publié: (2025)
Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation
par: Liu, Che, et autres
Publié: (2026)
par: Liu, Che, et autres
Publié: (2026)
LlamaPartialSpoof: An LLM-Driven Fake Speech Dataset Simulating Disinformation Generation
par: Luong, Hieu-Thi, et autres
Publié: (2024)
par: Luong, Hieu-Thi, et autres
Publié: (2024)
Stream-Voice-Anon: Enhancing Utility of Real-Time Speaker Anonymization via Neural Audio Codec and Language Models
par: Kuzmin, Nikita, et autres
Publié: (2026)
par: Kuzmin, Nikita, et autres
Publié: (2026)
Text-based Talking Video Editing with Cascaded Conditional Diffusion
par: Han, Bo, et autres
Publié: (2024)
par: Han, Bo, et autres
Publié: (2024)
Improving Code-Switching Speech Recognition with TTS Data Augmentation
par: Yeo, Yue Heng, et autres
Publié: (2026)
par: Yeo, Yue Heng, et autres
Publié: (2026)
Step-Audio-EditX Technical Report
par: Yan, Chao, et autres
Publié: (2025)
par: Yan, Chao, et autres
Publié: (2025)
Proactive for Uncertainty: Cause-Aware Error Diagnosis and Interactive Clarification for Spoken Dialogue Systems
par: Peng, Yizhou, et autres
Publié: (2026)
par: Peng, Yizhou, et autres
Publié: (2026)
Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model
par: Hu, Jingcheng, et autres
Publié: (2025)
par: Hu, Jingcheng, et autres
Publié: (2025)
Zero-shot Context Biasing with Trie-based Decoding using Synthetic Multi-Pronunciation
par: Liu, Changsong, et autres
Publié: (2025)
par: Liu, Changsong, et autres
Publié: (2025)
Hierarchical Self-Supervised Representation Learning for Depression Detection from Speech
par: Li, Yuxin, et autres
Publié: (2025)
par: Li, Yuxin, et autres
Publié: (2025)
Training-Free Intelligibility-Guided Observation Addition for Noisy ASR
par: Li, Haoyang, et autres
Publié: (2026)
par: Li, Haoyang, et autres
Publié: (2026)
StreamVoiceAnon+: Emotion-Preserving Streaming Speaker Anonymization via Frame-Level Acoustic Distillation
par: Kuzmin, Nikita, et autres
Publié: (2026)
par: Kuzmin, Nikita, et autres
Publié: (2026)
Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Model
par: Ma, Ziyang, et autres
Publié: (2025)
par: Ma, Ziyang, et autres
Publié: (2025)
FD-Bench: A Full-Duplex Benchmarking Pipeline Designed for Full Duplex Spoken Dialogue Systems
par: Peng, Yizhou, et autres
Publié: (2025)
par: Peng, Yizhou, et autres
Publié: (2025)
SpeechT-RAG: Reliable Depression Detection in LLMs with Retrieval-Augmented Generation Using Speech Timing Information
par: Zhang, Xiangyu, et autres
Publié: (2025)
par: Zhang, Xiangyu, et autres
Publié: (2025)
The ICASSP 2026 HumDial Challenge: Benchmarking Human-like Spoken Dialogue Systems in the LLM Era
par: Zhao, Zhixian, et autres
Publié: (2026)
par: Zhao, Zhixian, et autres
Publié: (2026)
UniArray: Unified Spectral-Spatial Modeling for Array-Geometry-Agnostic Speech Separation
par: Chen, Weiguang, et autres
Publié: (2025)
par: Chen, Weiguang, et autres
Publié: (2025)
Robust Zero-Shot Text-to-Speech Synthesis with Reverse Inference Optimization
par: Hu, Yuchen, et autres
Publié: (2024)
par: Hu, Yuchen, et autres
Publié: (2024)
From KAN to GR-KAN: Advancing Speech Enhancement with KAN-Based Methodology
par: Li, Haoyang, et autres
Publié: (2024)
par: Li, Haoyang, et autres
Publié: (2024)
Wav2code: Restore Clean Speech Representations via Codebook Lookup for Noise-Robust ASR
par: Hu, Yuchen, et autres
Publié: (2023)
par: Hu, Yuchen, et autres
Publié: (2023)
Continual Learning Optimizations for Auto-regressive Decoder of Multilingual ASR systems
par: Kwok, Chin Yuen, et autres
Publié: (2024)
par: Kwok, Chin Yuen, et autres
Publié: (2024)
Analysis of Speaker Verification Performance Trade-offs with Neural Audio Codec Transmission
par: Thakur, Nirmalya Mallick, et autres
Publié: (2025)
par: Thakur, Nirmalya Mallick, et autres
Publié: (2025)
Documents similaires
-
Chronological Thinking in Full-Duplex Spoken Dialogue Language Models
par: Wu, Donghang, et autres
Publié: (2025) -
MULTI-Bench: A Multi-Turn Interactive Benchmark for Assessing Emotional Intelligence ability of Spoken Dialogue Models
par: Deng, Yayue, et autres
Publié: (2025) -
Step-Audio-R1 Technical Report
par: Tian, Fei, et autres
Publié: (2025) -
DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action
par: Zhang, Haoyang, et autres
Publié: (2026) -
Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English
par: Zhang, Haoyang, et autres
Publié: (2025)