Guardado en:
| Autores principales: | Songyi, Li, Linze, Zheng, Jinghua, Liang, Zifeng, Zhang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2603.02255 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MEBM-Phoneme: Multi-scale Enhanced BrainMagic for End-to-End MEG Phoneme Classification
por: Jinghua, Liang, et al.
Publicado: (2026)
por: Jinghua, Liang, et al.
Publicado: (2026)
GMP-TL: Gender-augmented Multi-scale Pseudo-label Enhanced Transfer Learning for Speech Emotion Recognition
por: Pan, Yu, et al.
Publicado: (2024)
por: Pan, Yu, et al.
Publicado: (2024)
HoliTok:A Coutinuous Holistic Tokenization with Robust Dual Capabilities of Speech Generation and Understanding
por: Li, Bohan, et al.
Publicado: (2026)
por: Li, Bohan, et al.
Publicado: (2026)
Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens
por: Wang, Xinsheng, et al.
Publicado: (2025)
por: Wang, Xinsheng, et al.
Publicado: (2025)
Speech Recognition-based Feature Extraction for Enhanced Automatic Severity Classification in Dysarthric Speech
por: Choi, Yerin, et al.
Publicado: (2024)
por: Choi, Yerin, et al.
Publicado: (2024)
SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline
por: Wang, Helin, et al.
Publicado: (2025)
por: Wang, Helin, et al.
Publicado: (2025)
ECTSpeech: Enhancing Efficient Speech Synthesis via Easy Consistency Tuning
por: Zhu, Tao, et al.
Publicado: (2025)
por: Zhu, Tao, et al.
Publicado: (2025)
Improving Pretrained YAMNet for Enhanced Speech Command Detection via Transfer Learning
por: Lachenani, Sidahmed, et al.
Publicado: (2025)
por: Lachenani, Sidahmed, et al.
Publicado: (2025)
Analysis and Evaluation of Synthetic Data Generation in Speech Dysfluency Detection
por: Zhang, Jinming, et al.
Publicado: (2025)
por: Zhang, Jinming, et al.
Publicado: (2025)
Imagined Speech State Classification for Robust Brain-Computer Interface
por: Ko, Byung-Kwan, et al.
Publicado: (2024)
por: Ko, Byung-Kwan, et al.
Publicado: (2024)
Temporal-Channel Modeling in Multi-head Self-Attention for Synthetic Speech Detection
por: Truong, Duc-Tuan, et al.
Publicado: (2024)
por: Truong, Duc-Tuan, et al.
Publicado: (2024)
Clustering and Mining Accented Speech for Inclusive and Fair Speech Recognition
por: Kim, Jaeyoung, et al.
Publicado: (2024)
por: Kim, Jaeyoung, et al.
Publicado: (2024)
Speech-to-Speech Translation with Discrete-Unit-Based Style Transfer
por: Wang, Yongqi, et al.
Publicado: (2023)
por: Wang, Yongqi, et al.
Publicado: (2023)
Serialized Speech Information Guidance with Overlapped Encoding Separation for Multi-Speaker Automatic Speech Recognition
por: Shi, Hao, et al.
Publicado: (2024)
por: Shi, Hao, et al.
Publicado: (2024)
StreamSpeech: Simultaneous Speech-to-Speech Translation with Multi-task Learning
por: Zhang, Shaolei, et al.
Publicado: (2024)
por: Zhang, Shaolei, et al.
Publicado: (2024)
AMNet: An Acoustic Model Network for Enhanced Mandarin Speech Synthesis
por: Cao, Yubing, et al.
Publicado: (2025)
por: Cao, Yubing, et al.
Publicado: (2025)
Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding
por: Lin, Zijian, et al.
Publicado: (2025)
por: Lin, Zijian, et al.
Publicado: (2025)
Improving Robustness of LLM-based Speech Synthesis by Learning Monotonic Alignment
por: Neekhara, Paarth, et al.
Publicado: (2024)
por: Neekhara, Paarth, et al.
Publicado: (2024)
SpoofCeleb: Speech Deepfake Detection and SASV In The Wild
por: Jung, Jee-weon, et al.
Publicado: (2024)
por: Jung, Jee-weon, et al.
Publicado: (2024)
EmoSpeech: A Corpus of Emotionally Rich and Contextually Detailed Speech Annotations
por: Bian, Weizhen, et al.
Publicado: (2024)
por: Bian, Weizhen, et al.
Publicado: (2024)
Audio Codec Augmentation for Robust Collaborative Watermarking of Speech Synthesis
por: Juvela, Lauri, et al.
Publicado: (2024)
por: Juvela, Lauri, et al.
Publicado: (2024)
MambAttention: Mamba with Multi-Head Attention for Generalizable Single-Channel Speech Enhancement
por: Kühne, Nikolai Lund, et al.
Publicado: (2025)
por: Kühne, Nikolai Lund, et al.
Publicado: (2025)
Time and Tokens: Benchmarking End-to-End Speech Dysfluency Detection
por: Zhou, Xuanru, et al.
Publicado: (2024)
por: Zhou, Xuanru, et al.
Publicado: (2024)
Lina-Speech: Gated Linear Attention and Initial-State Tuning for Multi-Sample Prompting Text-To-Speech Synthesis
por: Lemerle, Théodor, et al.
Publicado: (2024)
por: Lemerle, Théodor, et al.
Publicado: (2024)
Adaptive Knowledge Distillation for Device-Directed Speech Detection
por: Chi, Hyung Gun, et al.
Publicado: (2025)
por: Chi, Hyung Gun, et al.
Publicado: (2025)
Temporal-Aware Iterative Speech Model for Dementia Detection
por: Ugwu, Chukwuemeka, et al.
Publicado: (2025)
por: Ugwu, Chukwuemeka, et al.
Publicado: (2025)
Leveraging Mixture of Experts for Improved Speech Deepfake Detection
por: Negroni, Viola, et al.
Publicado: (2024)
por: Negroni, Viola, et al.
Publicado: (2024)
Phoneme-Level Feature Discrepancies: A Key to Detecting Sophisticated Speech Deepfakes
por: Zhang, Kuiyuan, et al.
Publicado: (2024)
por: Zhang, Kuiyuan, et al.
Publicado: (2024)
MFHCA: Enhancing Speech Emotion Recognition Via Multi-Spatial Fusion and Hierarchical Cooperative Attention
por: Jiao, Xinxin, et al.
Publicado: (2024)
por: Jiao, Xinxin, et al.
Publicado: (2024)
Purification Before Fusion: Toward Mask-Free Speech Enhancement for Robust Audio-Visual Speech Recognition
por: Wu, Linzhi, et al.
Publicado: (2026)
por: Wu, Linzhi, et al.
Publicado: (2026)
HuBERT-VIC: Improving Noise-Robust Automatic Speech Recognition of Speech Foundation Model via Variance-Invariance-Covariance Regularization
por: Ahn, Hyebin, et al.
Publicado: (2025)
por: Ahn, Hyebin, et al.
Publicado: (2025)
EchoFake: A Replay-Aware Dataset for Practical Speech Deepfake Detection
por: Zhang, Tong, et al.
Publicado: (2025)
por: Zhang, Tong, et al.
Publicado: (2025)
ICMC-ASR: The ICASSP 2024 In-Car Multi-Channel Automatic Speech Recognition Challenge
por: Wang, He, et al.
Publicado: (2024)
por: Wang, He, et al.
Publicado: (2024)
VoiceBridge: General Speech Restoration with One-step Latent Bridge Models
por: Zhang, Chi, et al.
Publicado: (2025)
por: Zhang, Chi, et al.
Publicado: (2025)
Boosting Code-Switching ASR with Mixture of Experts Enhanced Speech-Conditioned LLM
por: Zhang, Fengrun, et al.
Publicado: (2024)
por: Zhang, Fengrun, et al.
Publicado: (2024)
Enhancing Speech Quality through the Integration of BGRU and Transformer Architectures
por: Alghnam, Souliman, et al.
Publicado: (2025)
por: Alghnam, Souliman, et al.
Publicado: (2025)
Speech-based Clinical Depression Screening: An Empirical Study
por: Chen, Yangbin, et al.
Publicado: (2024)
por: Chen, Yangbin, et al.
Publicado: (2024)
Audio Deepfake Detection in the Age of Advanced Text-to-Speech models
por: Singh, Robin, et al.
Publicado: (2026)
por: Singh, Robin, et al.
Publicado: (2026)
Meta-Learning Approaches for Improving Detection of Unseen Speech Deepfakes
por: Kukanov, Ivan, et al.
Publicado: (2024)
por: Kukanov, Ivan, et al.
Publicado: (2024)
HASS: Hierarchical Simulation of Logopenic Aphasic Speech for Scalable PPA Detection
por: Li, Harrison, et al.
Publicado: (2026)
por: Li, Harrison, et al.
Publicado: (2026)
Ejemplares similares
-
MEBM-Phoneme: Multi-scale Enhanced BrainMagic for End-to-End MEG Phoneme Classification
por: Jinghua, Liang, et al.
Publicado: (2026) -
GMP-TL: Gender-augmented Multi-scale Pseudo-label Enhanced Transfer Learning for Speech Emotion Recognition
por: Pan, Yu, et al.
Publicado: (2024) -
HoliTok:A Coutinuous Holistic Tokenization with Robust Dual Capabilities of Speech Generation and Understanding
por: Li, Bohan, et al.
Publicado: (2026) -
Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens
por: Wang, Xinsheng, et al.
Publicado: (2025) -
Speech Recognition-based Feature Extraction for Enhanced Automatic Severity Classification in Dysarthric Speech
por: Choi, Yerin, et al.
Publicado: (2024)