Enregistré dans:
| Auteurs principaux: | Xie, Yudong, Han, Zhifeng, Xiao, Qinfan, Liang, Liwei, Tao, Lu-Qi, Ren, Tian-Ling |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2502.17829 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Cross-Modal Approach to Silent Speech with LLM-Enhanced Recognition
par: Benster, Tyler, et autres
Publié: (2024)
par: Benster, Tyler, et autres
Publié: (2024)
Poster: Recognizing Hidden-in-the-Ear Private Key for Reliable Silent Speech Interface Using Multi-Task Learning
par: Dong, Xuefu, et autres
Publié: (2025)
par: Dong, Xuefu, et autres
Publié: (2025)
AVE Speech: A Comprehensive Multi-Modal Dataset for Speech Recognition Integrating Audio, Visual, and Electromyographic Signals
par: Zhou, Dongliang, et autres
Publié: (2025)
par: Zhou, Dongliang, et autres
Publié: (2025)
CTC Blank Triggered Dynamic Layer-Skipping for Efficient CTC-based Speech Recognition
par: Hou, Junfeng, et autres
Publié: (2024)
par: Hou, Junfeng, et autres
Publié: (2024)
Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition
par: Chen, Youjun, et autres
Publié: (2025)
par: Chen, Youjun, et autres
Publié: (2025)
Unimodal Aggregation for CTC-based Speech Recognition
par: Fang, Ying, et autres
Publié: (2023)
par: Fang, Ying, et autres
Publié: (2023)
Directional Source Separation for Robust Speech Recognition on Smart Glasses
par: Feng, Tiantian, et autres
Publié: (2023)
par: Feng, Tiantian, et autres
Publié: (2023)
Automatic Speech Recognition with BERT and CTC Transformers: A Review
par: Djeffal, Noussaiba, et autres
Publié: (2024)
par: Djeffal, Noussaiba, et autres
Publié: (2024)
Speaker-Distinguishable CTC: Learning Speaker Distinction Using CTC for Multi-Talker Speech Recognition
par: Sakuma, Asahi, et autres
Publié: (2025)
par: Sakuma, Asahi, et autres
Publié: (2025)
Using Confidence Scores to Improve Eyes-free Detection of Speech Recognition Errors
par: Nowrin, Sadia, et autres
Publié: (2024)
par: Nowrin, Sadia, et autres
Publié: (2024)
Adapting Whisper for Lightweight and Efficient Automatic Speech Recognition of Children for On-device Edge Applications
par: Dutta, Satwik, et autres
Publié: (2025)
par: Dutta, Satwik, et autres
Publié: (2025)
Decoder-only Architecture for Speech Recognition with CTC Prompts and Text Data Augmentation
par: Tsunoo, Emiru, et autres
Publié: (2023)
par: Tsunoo, Emiru, et autres
Publié: (2023)
STAA-Net: A Sparse and Transferable Adversarial Attack for Speech Emotion Recognition
par: Chang, Yi, et autres
Publié: (2024)
par: Chang, Yi, et autres
Publié: (2024)
Enhancing CTC-Based Visual Speech Recognition
par: Laux, Hendrik, et autres
Publié: (2024)
par: Laux, Hendrik, et autres
Publié: (2024)
Real-Time Word-Level Temporal Segmentation in Streaming Speech Recognition
par: Nishida, Naoto, et autres
Publié: (2025)
par: Nishida, Naoto, et autres
Publié: (2025)
AdaMER-CTC: Connectionist Temporal Classification with Adaptive Maximum Entropy Regularization for Automatic Speech Recognition
par: Eom, SooHwan, et autres
Publié: (2024)
par: Eom, SooHwan, et autres
Publié: (2024)
Personalized Speech Emotion Recognition in Human-Robot Interaction using Vision Transformers
par: Mishra, Ruchik, et autres
Publié: (2024)
par: Mishra, Ruchik, et autres
Publié: (2024)
Timbre-Aware LLM-based Direct Speech-to-Speech Translation Extendable to Multiple Language Pairs
par: Arya, Lalaram, et autres
Publié: (2026)
par: Arya, Lalaram, et autres
Publié: (2026)
Psychophysiology-aided Perceptually Fluent Speech Analysis of Children Who Stutter
par: Xiao, Yi, et autres
Publié: (2022)
par: Xiao, Yi, et autres
Publié: (2022)
Human Feedback Driven Dynamic Speech Emotion Recognition
par: Fedorov, Ilya, et autres
Publié: (2025)
par: Fedorov, Ilya, et autres
Publié: (2025)
Improving Multimodal Emotion Recognition by Leveraging Acoustic Adaptation and Visual Alignment
par: Zhao, Zhixian, et autres
Publié: (2024)
par: Zhao, Zhixian, et autres
Publié: (2024)
Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems
par: Cui, Mingyu, et autres
Publié: (2025)
par: Cui, Mingyu, et autres
Publié: (2025)
SegAug: CTC-Aligned Segmented Augmentation For Robust RNN-Transducer Based Speech Recognition
par: Le, Khanh, et autres
Publié: (2025)
par: Le, Khanh, et autres
Publié: (2025)
Disentangling Speakers in Multi-Talker Speech Recognition with Speaker-Aware CTC
par: Kang, Jiawen, et autres
Publié: (2024)
par: Kang, Jiawen, et autres
Publié: (2024)
Multilingual Audio-Visual Speech Recognition with Hybrid CTC/RNN-T Fast Conformer
par: Burchi, Maxime, et autres
Publié: (2024)
par: Burchi, Maxime, et autres
Publié: (2024)
Cluster-to-Predict Affect Contours from Speech
par: Kuşçu, Gökhan, et autres
Publié: (2024)
par: Kuşçu, Gökhan, et autres
Publié: (2024)
USpeech: Ultrasound-Enhanced Speech with Minimal Human Effort via Cross-Modal Synthesis
par: Yu, Luca Jiang-Tao, et autres
Publié: (2024)
par: Yu, Luca Jiang-Tao, et autres
Publié: (2024)
Toward using Speech to Sense Student Emotion in Remote Learning Environments
par: Vyas, Sargam, et autres
Publié: (2026)
par: Vyas, Sargam, et autres
Publié: (2026)
Sound-Based Recognition of Touch Gestures and Emotions for Enhanced Human-Robot Interaction
par: Hou, Yuanbo, et autres
Publié: (2024)
par: Hou, Yuanbo, et autres
Publié: (2024)
Recreating Neural Activity During Speech Production with Language and Speech Model Embeddings
par: Khanday, Owais Mujtaba, et autres
Publié: (2025)
par: Khanday, Owais Mujtaba, et autres
Publié: (2025)
SiamCTC: Learning Speech Representations through Monotonic Temporal Alignment
par: Eom, SooHwan, et autres
Publié: (2026)
par: Eom, SooHwan, et autres
Publié: (2026)
CTC-DRO: Robust Optimization for Reducing Language Disparities in Speech Recognition
par: Bartelds, Martijn, et autres
Publié: (2025)
par: Bartelds, Martijn, et autres
Publié: (2025)
OWSM-CTC: An Open Encoder-Only Speech Foundation Model for Speech Recognition, Translation, and Language Identification
par: Peng, Yifan, et autres
Publié: (2024)
par: Peng, Yifan, et autres
Publié: (2024)
LV-CTC: Non-autoregressive ASR with CTC and latent variable models
par: Fujita, Yuya, et autres
Publié: (2024)
par: Fujita, Yuya, et autres
Publié: (2024)
IR-UWB Radar-Based Contactless Silent Speech Recognition with Attention-Enhanced Temporal Convolutional Networks
par: Lee, Sunghwa, et autres
Publié: (2025)
par: Lee, Sunghwa, et autres
Publié: (2025)
A Near-Real-Time Processing Ego Speech Filtering Pipeline Designed for Speech Interruption During Human-Robot Interaction
par: Li, Yue, et autres
Publié: (2024)
par: Li, Yue, et autres
Publié: (2024)
Towards Temporally Explainable Dysarthric Speech Clarity Assessment
par: Park, Seohyun, et autres
Publié: (2025)
par: Park, Seohyun, et autres
Publié: (2025)
SACM: SEEG-Audio Contrastive Matching for Chinese Speech Decoding
par: Wang, Hongbin, et autres
Publié: (2025)
par: Wang, Hongbin, et autres
Publié: (2025)
VoiceX: A Text-To-Speech Framework for Custom Voices
par: Mertes, Silvan, et autres
Publié: (2024)
par: Mertes, Silvan, et autres
Publié: (2024)
VoiceFlow: Efficient Text-to-Speech with Rectified Flow Matching
par: Guo, Yiwei, et autres
Publié: (2023)
par: Guo, Yiwei, et autres
Publié: (2023)
Documents similaires
-
A Cross-Modal Approach to Silent Speech with LLM-Enhanced Recognition
par: Benster, Tyler, et autres
Publié: (2024) -
Poster: Recognizing Hidden-in-the-Ear Private Key for Reliable Silent Speech Interface Using Multi-Task Learning
par: Dong, Xuefu, et autres
Publié: (2025) -
AVE Speech: A Comprehensive Multi-Modal Dataset for Speech Recognition Integrating Audio, Visual, and Electromyographic Signals
par: Zhou, Dongliang, et autres
Publié: (2025) -
CTC Blank Triggered Dynamic Layer-Skipping for Efficient CTC-based Speech Recognition
par: Hou, Junfeng, et autres
Publié: (2024) -
Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition
par: Chen, Youjun, et autres
Publié: (2025)