Enregistré dans:
| Auteurs principaux: | Liu, Hexin, Zhang, Haoyang, Zhang, Qiquan, Zhang, Xiangyu, Shi, Dongyuan, Chng, Eng Siong, Li, Haizhou |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2509.24310 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Aligning Speech to Languages to Enhance Code-switching Speech Recognition
par: Liu, Hexin, et autres
Publié: (2024)
par: Liu, Hexin, et autres
Publié: (2024)
Speaking in Wavelet Domain: A Simple and Efficient Approach to Speed up Speech Diffusion Model
par: Zhang, Xiangyu, et autres
Publié: (2024)
par: Zhang, Xiangyu, et autres
Publié: (2024)
Bi-directional Context-Enhanced Speech Large Language Models for Multilingual Conversational ASR
par: Peng, Yizhou, et autres
Publié: (2025)
par: Peng, Yizhou, et autres
Publié: (2025)
Improving Code-Switching Speech Recognition with TTS Data Augmentation
par: Yeo, Yue Heng, et autres
Publié: (2026)
par: Yeo, Yue Heng, et autres
Publié: (2026)
Long-Context Modeling Networks for Monaural Speech Enhancement: A Comparative Study
par: Zhang, Qiquan, et autres
Publié: (2025)
par: Zhang, Qiquan, et autres
Publié: (2025)
SpeechT-RAG: Reliable Depression Detection in LLMs with Retrieval-Augmented Generation Using Speech Timing Information
par: Zhang, Xiangyu, et autres
Publié: (2025)
par: Zhang, Xiangyu, et autres
Publié: (2025)
GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling
par: Yao, Jixun, et autres
Publié: (2025)
par: Yao, Jixun, et autres
Publié: (2025)
EASY: Emotion-aware Speaker Anonymization via Factorized Distillation
par: Yao, Jixun, et autres
Publié: (2025)
par: Yao, Jixun, et autres
Publié: (2025)
Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English
par: Zhang, Haoyang, et autres
Publié: (2025)
par: Zhang, Haoyang, et autres
Publié: (2025)
Selective State Space Model for Monaural Speech Enhancement
par: Chen, Moran, et autres
Publié: (2024)
par: Chen, Moran, et autres
Publié: (2024)
Mamba in Speech: Towards an Alternative to Self-Attention
par: Zhang, Xiangyu, et autres
Publié: (2024)
par: Zhang, Xiangyu, et autres
Publié: (2024)
LlamaPartialSpoof: An LLM-Driven Fake Speech Dataset Simulating Disinformation Generation
par: Luong, Hieu-Thi, et autres
Publié: (2024)
par: Luong, Hieu-Thi, et autres
Publié: (2024)
DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action
par: Zhang, Haoyang, et autres
Publié: (2026)
par: Zhang, Haoyang, et autres
Publié: (2026)
UniArray: Unified Spectral-Spatial Modeling for Array-Geometry-Agnostic Speech Separation
par: Chen, Weiguang, et autres
Publié: (2025)
par: Chen, Weiguang, et autres
Publié: (2025)
NTU Speechlab LLM-Based Multilingual ASR System for Interspeech MLC-SLM Challenge 2025
par: Peng, Yizhou, et autres
Publié: (2025)
par: Peng, Yizhou, et autres
Publié: (2025)
Speech Enhancement Using Continuous Embeddings of Neural Audio Codec
par: Li, Haoyang, et autres
Publié: (2025)
par: Li, Haoyang, et autres
Publié: (2025)
When LLMs Meets Acoustic Landmarks: An Efficient Approach to Integrate Speech into Large Language Models for Depression Detection
par: Zhang, Xiangyu, et autres
Publié: (2024)
par: Zhang, Xiangyu, et autres
Publié: (2024)
Speech Separation using Neural Audio Codecs with Embedding Loss
par: Yip, Jia Qi, et autres
Publié: (2024)
par: Yip, Jia Qi, et autres
Publié: (2024)
Noise-Aware Speech Separation with Contrastive Learning
par: Zhang, Zizheng, et autres
Publié: (2023)
par: Zhang, Zizheng, et autres
Publié: (2023)
Multi-Stage Face-Voice Association Learning with Keynote Speaker Diarization
par: Tao, Ruijie, et autres
Publié: (2024)
par: Tao, Ruijie, et autres
Publié: (2024)
Exploring Length Generalization For Transformer-based Speech Enhancement
par: Zhang, Qiquan, et autres
Publié: (2025)
par: Zhang, Qiquan, et autres
Publié: (2025)
An Exploration of Length Generalization in Transformer-Based Speech Enhancement
par: Zhang, Qiquan, et autres
Publié: (2024)
par: Zhang, Qiquan, et autres
Publié: (2024)
Robust Zero-Shot Text-to-Speech Synthesis with Reverse Inference Optimization
par: Hu, Yuchen, et autres
Publié: (2024)
par: Hu, Yuchen, et autres
Publié: (2024)
Zero-shot Context Biasing with Trie-based Decoding using Synthetic Multi-Pronunciation
par: Liu, Changsong, et autres
Publié: (2025)
par: Liu, Changsong, et autres
Publié: (2025)
Summary on The Multilingual Conversational Speech Language Model Challenge: Datasets, Tasks, Baselines, and Methods
par: Mu, Bingshen, et autres
Publié: (2025)
par: Mu, Bingshen, et autres
Publié: (2025)
Dataset-Distillation Generative Model for Speech Emotion Recognition
par: Ritter-Gutierrez, Fabian, et autres
Publié: (2024)
par: Ritter-Gutierrez, Fabian, et autres
Publié: (2024)
Hierarchical Self-Supervised Representation Learning for Depression Detection from Speech
par: Li, Yuxin, et autres
Publié: (2025)
par: Li, Yuxin, et autres
Publié: (2025)
Training-Free Intelligibility-Guided Observation Addition for Noisy ASR
par: Li, Haoyang, et autres
Publié: (2026)
par: Li, Haoyang, et autres
Publié: (2026)
From KAN to GR-KAN: Advancing Speech Enhancement with KAN-Based Methodology
par: Li, Haoyang, et autres
Publié: (2024)
par: Li, Haoyang, et autres
Publié: (2024)
Bridging Speech and Text: Enhancing ASR with Pinyin-to-Character Pre-training in LLMs
par: Yuhang, Yang, et autres
Publié: (2024)
par: Yuhang, Yang, et autres
Publié: (2024)
Noise-aware Speech Enhancement using Diffusion Probabilistic Model
par: Hu, Yuchen, et autres
Publié: (2023)
par: Hu, Yuchen, et autres
Publié: (2023)
Wav2code: Restore Clean Speech Representations via Codebook Lookup for Noise-Robust ASR
par: Hu, Yuchen, et autres
Publié: (2023)
par: Hu, Yuchen, et autres
Publié: (2023)
Step-Audio-R1.5 Technical Report
par: Zhang, Yuxin, et autres
Publié: (2026)
par: Zhang, Yuxin, et autres
Publié: (2026)
Enhancing Zero-shot Text-to-Speech Synthesis with Human Feedback
par: Chen, Chen, et autres
Publié: (2024)
par: Chen, Chen, et autres
Publié: (2024)
Robust Localization of Partially Fake Speech: Metrics and Out-of-Domain Evaluation
par: Luong, Hieu-Thi, et autres
Publié: (2025)
par: Luong, Hieu-Thi, et autres
Publié: (2025)
Analysis of Speaker Verification Performance Trade-offs with Neural Audio Codec Transmission
par: Thakur, Nirmalya Mallick, et autres
Publié: (2025)
par: Thakur, Nirmalya Mallick, et autres
Publié: (2025)
Stream-Voice-Anon: Enhancing Utility of Real-Time Speaker Anonymization via Neural Audio Codec and Language Models
par: Kuzmin, Nikita, et autres
Publié: (2026)
par: Kuzmin, Nikita, et autres
Publié: (2026)
SAV-SE: Scene-aware Audio-Visual Speech Enhancement with Selective State Space Model
par: Qian, Xinyuan, et autres
Publié: (2024)
par: Qian, Xinyuan, et autres
Publié: (2024)
Multi-band Frequency Reconstruction for Neural Psychoacoustic Coding
par: Ng, Dianwen, et autres
Publié: (2025)
par: Ng, Dianwen, et autres
Publié: (2025)
StreamVoiceAnon+: Emotion-Preserving Streaming Speaker Anonymization via Frame-Level Acoustic Distillation
par: Kuzmin, Nikita, et autres
Publié: (2026)
par: Kuzmin, Nikita, et autres
Publié: (2026)
Documents similaires
-
Aligning Speech to Languages to Enhance Code-switching Speech Recognition
par: Liu, Hexin, et autres
Publié: (2024) -
Speaking in Wavelet Domain: A Simple and Efficient Approach to Speed up Speech Diffusion Model
par: Zhang, Xiangyu, et autres
Publié: (2024) -
Bi-directional Context-Enhanced Speech Large Language Models for Multilingual Conversational ASR
par: Peng, Yizhou, et autres
Publié: (2025) -
Improving Code-Switching Speech Recognition with TTS Data Augmentation
par: Yeo, Yue Heng, et autres
Publié: (2026) -
Long-Context Modeling Networks for Monaural Speech Enhancement: A Comparative Study
par: Zhang, Qiquan, et autres
Publié: (2025)