Enregistré dans:
| Auteurs principaux: | Songyi, Li, Linze, Zheng, Jinghua, Liang, Zifeng, Zhang |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2603.02255 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MEBM-Phoneme: Multi-scale Enhanced BrainMagic for End-to-End MEG Phoneme Classification
par: Jinghua, Liang, et autres
Publié: (2026)
par: Jinghua, Liang, et autres
Publié: (2026)
GMP-TL: Gender-augmented Multi-scale Pseudo-label Enhanced Transfer Learning for Speech Emotion Recognition
par: Pan, Yu, et autres
Publié: (2024)
par: Pan, Yu, et autres
Publié: (2024)
HoliTok:A Coutinuous Holistic Tokenization with Robust Dual Capabilities of Speech Generation and Understanding
par: Li, Bohan, et autres
Publié: (2026)
par: Li, Bohan, et autres
Publié: (2026)
Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens
par: Wang, Xinsheng, et autres
Publié: (2025)
par: Wang, Xinsheng, et autres
Publié: (2025)
Speech Recognition-based Feature Extraction for Enhanced Automatic Severity Classification in Dysarthric Speech
par: Choi, Yerin, et autres
Publié: (2024)
par: Choi, Yerin, et autres
Publié: (2024)
SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline
par: Wang, Helin, et autres
Publié: (2025)
par: Wang, Helin, et autres
Publié: (2025)
ECTSpeech: Enhancing Efficient Speech Synthesis via Easy Consistency Tuning
par: Zhu, Tao, et autres
Publié: (2025)
par: Zhu, Tao, et autres
Publié: (2025)
Improving Pretrained YAMNet for Enhanced Speech Command Detection via Transfer Learning
par: Lachenani, Sidahmed, et autres
Publié: (2025)
par: Lachenani, Sidahmed, et autres
Publié: (2025)
Analysis and Evaluation of Synthetic Data Generation in Speech Dysfluency Detection
par: Zhang, Jinming, et autres
Publié: (2025)
par: Zhang, Jinming, et autres
Publié: (2025)
Imagined Speech State Classification for Robust Brain-Computer Interface
par: Ko, Byung-Kwan, et autres
Publié: (2024)
par: Ko, Byung-Kwan, et autres
Publié: (2024)
Temporal-Channel Modeling in Multi-head Self-Attention for Synthetic Speech Detection
par: Truong, Duc-Tuan, et autres
Publié: (2024)
par: Truong, Duc-Tuan, et autres
Publié: (2024)
Clustering and Mining Accented Speech for Inclusive and Fair Speech Recognition
par: Kim, Jaeyoung, et autres
Publié: (2024)
par: Kim, Jaeyoung, et autres
Publié: (2024)
Speech-to-Speech Translation with Discrete-Unit-Based Style Transfer
par: Wang, Yongqi, et autres
Publié: (2023)
par: Wang, Yongqi, et autres
Publié: (2023)
Serialized Speech Information Guidance with Overlapped Encoding Separation for Multi-Speaker Automatic Speech Recognition
par: Shi, Hao, et autres
Publié: (2024)
par: Shi, Hao, et autres
Publié: (2024)
StreamSpeech: Simultaneous Speech-to-Speech Translation with Multi-task Learning
par: Zhang, Shaolei, et autres
Publié: (2024)
par: Zhang, Shaolei, et autres
Publié: (2024)
AMNet: An Acoustic Model Network for Enhanced Mandarin Speech Synthesis
par: Cao, Yubing, et autres
Publié: (2025)
par: Cao, Yubing, et autres
Publié: (2025)
Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding
par: Lin, Zijian, et autres
Publié: (2025)
par: Lin, Zijian, et autres
Publié: (2025)
Improving Robustness of LLM-based Speech Synthesis by Learning Monotonic Alignment
par: Neekhara, Paarth, et autres
Publié: (2024)
par: Neekhara, Paarth, et autres
Publié: (2024)
SpoofCeleb: Speech Deepfake Detection and SASV In The Wild
par: Jung, Jee-weon, et autres
Publié: (2024)
par: Jung, Jee-weon, et autres
Publié: (2024)
EmoSpeech: A Corpus of Emotionally Rich and Contextually Detailed Speech Annotations
par: Bian, Weizhen, et autres
Publié: (2024)
par: Bian, Weizhen, et autres
Publié: (2024)
Audio Codec Augmentation for Robust Collaborative Watermarking of Speech Synthesis
par: Juvela, Lauri, et autres
Publié: (2024)
par: Juvela, Lauri, et autres
Publié: (2024)
MambAttention: Mamba with Multi-Head Attention for Generalizable Single-Channel Speech Enhancement
par: Kühne, Nikolai Lund, et autres
Publié: (2025)
par: Kühne, Nikolai Lund, et autres
Publié: (2025)
Time and Tokens: Benchmarking End-to-End Speech Dysfluency Detection
par: Zhou, Xuanru, et autres
Publié: (2024)
par: Zhou, Xuanru, et autres
Publié: (2024)
Lina-Speech: Gated Linear Attention and Initial-State Tuning for Multi-Sample Prompting Text-To-Speech Synthesis
par: Lemerle, Théodor, et autres
Publié: (2024)
par: Lemerle, Théodor, et autres
Publié: (2024)
Adaptive Knowledge Distillation for Device-Directed Speech Detection
par: Chi, Hyung Gun, et autres
Publié: (2025)
par: Chi, Hyung Gun, et autres
Publié: (2025)
Temporal-Aware Iterative Speech Model for Dementia Detection
par: Ugwu, Chukwuemeka, et autres
Publié: (2025)
par: Ugwu, Chukwuemeka, et autres
Publié: (2025)
Leveraging Mixture of Experts for Improved Speech Deepfake Detection
par: Negroni, Viola, et autres
Publié: (2024)
par: Negroni, Viola, et autres
Publié: (2024)
Phoneme-Level Feature Discrepancies: A Key to Detecting Sophisticated Speech Deepfakes
par: Zhang, Kuiyuan, et autres
Publié: (2024)
par: Zhang, Kuiyuan, et autres
Publié: (2024)
MFHCA: Enhancing Speech Emotion Recognition Via Multi-Spatial Fusion and Hierarchical Cooperative Attention
par: Jiao, Xinxin, et autres
Publié: (2024)
par: Jiao, Xinxin, et autres
Publié: (2024)
Purification Before Fusion: Toward Mask-Free Speech Enhancement for Robust Audio-Visual Speech Recognition
par: Wu, Linzhi, et autres
Publié: (2026)
par: Wu, Linzhi, et autres
Publié: (2026)
HuBERT-VIC: Improving Noise-Robust Automatic Speech Recognition of Speech Foundation Model via Variance-Invariance-Covariance Regularization
par: Ahn, Hyebin, et autres
Publié: (2025)
par: Ahn, Hyebin, et autres
Publié: (2025)
EchoFake: A Replay-Aware Dataset for Practical Speech Deepfake Detection
par: Zhang, Tong, et autres
Publié: (2025)
par: Zhang, Tong, et autres
Publié: (2025)
ICMC-ASR: The ICASSP 2024 In-Car Multi-Channel Automatic Speech Recognition Challenge
par: Wang, He, et autres
Publié: (2024)
par: Wang, He, et autres
Publié: (2024)
VoiceBridge: General Speech Restoration with One-step Latent Bridge Models
par: Zhang, Chi, et autres
Publié: (2025)
par: Zhang, Chi, et autres
Publié: (2025)
Boosting Code-Switching ASR with Mixture of Experts Enhanced Speech-Conditioned LLM
par: Zhang, Fengrun, et autres
Publié: (2024)
par: Zhang, Fengrun, et autres
Publié: (2024)
Enhancing Speech Quality through the Integration of BGRU and Transformer Architectures
par: Alghnam, Souliman, et autres
Publié: (2025)
par: Alghnam, Souliman, et autres
Publié: (2025)
Speech-based Clinical Depression Screening: An Empirical Study
par: Chen, Yangbin, et autres
Publié: (2024)
par: Chen, Yangbin, et autres
Publié: (2024)
Audio Deepfake Detection in the Age of Advanced Text-to-Speech models
par: Singh, Robin, et autres
Publié: (2026)
par: Singh, Robin, et autres
Publié: (2026)
Meta-Learning Approaches for Improving Detection of Unseen Speech Deepfakes
par: Kukanov, Ivan, et autres
Publié: (2024)
par: Kukanov, Ivan, et autres
Publié: (2024)
HASS: Hierarchical Simulation of Logopenic Aphasic Speech for Scalable PPA Detection
par: Li, Harrison, et autres
Publié: (2026)
par: Li, Harrison, et autres
Publié: (2026)
Documents similaires
-
MEBM-Phoneme: Multi-scale Enhanced BrainMagic for End-to-End MEG Phoneme Classification
par: Jinghua, Liang, et autres
Publié: (2026) -
GMP-TL: Gender-augmented Multi-scale Pseudo-label Enhanced Transfer Learning for Speech Emotion Recognition
par: Pan, Yu, et autres
Publié: (2024) -
HoliTok:A Coutinuous Holistic Tokenization with Robust Dual Capabilities of Speech Generation and Understanding
par: Li, Bohan, et autres
Publié: (2026) -
Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens
par: Wang, Xinsheng, et autres
Publié: (2025) -
Speech Recognition-based Feature Extraction for Enhanced Automatic Severity Classification in Dysarthric Speech
par: Choi, Yerin, et autres
Publié: (2024)