Enregistré dans:
| Auteurs principaux: | Lin, Yuanxi, Zhou, Tonglin, Xiao, Yang |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2406.18313 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Advancing Topic Segmentation of Broadcasted Speech with Multilingual Semantic Embeddings
par: Shukla, Sakshi Deo, et autres
Publié: (2024)
par: Shukla, Sakshi Deo, et autres
Publié: (2024)
Moonshine: Speech Recognition for Live Transcription and Voice Commands
par: Jeffries, Nat, et autres
Publié: (2024)
par: Jeffries, Nat, et autres
Publié: (2024)
Scalable Offline ASR for Command-Style Dictation in Courtrooms
par: Nethil, Kumarmanas, et autres
Publié: (2025)
par: Nethil, Kumarmanas, et autres
Publié: (2025)
Exploring Spoken Language Identification Strategies for Automatic Transcription of Multilingual Broadcast and Institutional Speech
par: Valente, Martina, et autres
Publié: (2024)
par: Valente, Martina, et autres
Publié: (2024)
Continual Adaptation for Pacific Indigenous Speech Recognition
par: Xiao, Yang, et autres
Publié: (2026)
par: Xiao, Yang, et autres
Publié: (2026)
Adapting Where It Matters: Depth-Aware Adaptation for Efficient Multilingual Speech Recognition in Low-Resource Languages
par: Xiao, Yang, et autres
Publié: (2026)
par: Xiao, Yang, et autres
Publié: (2026)
Contextualized Automatic Speech Recognition with Dynamic Vocabulary Prediction and Activation
par: Lin, Zhennan, et autres
Publié: (2025)
par: Lin, Zhennan, et autres
Publié: (2025)
SqueezeComposer: Temporal Speed-up is A Simple Trick for Long-form Music Composing
par: Chen, Jianyi, et autres
Publié: (2026)
par: Chen, Jianyi, et autres
Publié: (2026)
Mitigating Subgroup Disparities in Multi-Label Speech Emotion Recognition: A Pseudo-Labeling and Unsupervised Learning Approach
par: Lin, Yi-Cheng, et autres
Publié: (2025)
par: Lin, Yi-Cheng, et autres
Publié: (2025)
Exploring the Integration of Large Language Models into Automatic Speech Recognition Systems: An Empirical Study
par: Min, Zeping, et autres
Publié: (2023)
par: Min, Zeping, et autres
Publié: (2023)
Advancing African-Accented Speech Recognition: Epistemic Uncertainty-Driven Data Selection for Generalizable ASR Models
par: Dossou, Bonaventure F. P.
Publié: (2023)
par: Dossou, Bonaventure F. P.
Publié: (2023)
Analyzing Multimodal Features of Spontaneous Voice Assistant Commands for Mild Cognitive Impairment Detection
par: Lin, Nana, et autres
Publié: (2024)
par: Lin, Nana, et autres
Publié: (2024)
CS-Dialogue: A 104-Hour Dataset of Spontaneous Mandarin-English Code-Switching Dialogues for Speech Recognition
par: Zhou, Jiaming, et autres
Publié: (2025)
par: Zhou, Jiaming, et autres
Publié: (2025)
Weight Factorization and Centralization for Continual Learning in Speech Recognition
par: Ugan, Enes Yavuz, et autres
Publié: (2025)
par: Ugan, Enes Yavuz, et autres
Publié: (2025)
CIF-T: A Novel CIF-based Transducer Architecture for Automatic Speech Recognition
par: Zhang, Tian-Hao, et autres
Publié: (2023)
par: Zhang, Tian-Hao, et autres
Publié: (2023)
Frequency & Channel Attention Network for Small Footprint Noisy Spoken Keyword Spotting
par: Lin, Yuanxi, et autres
Publié: (2024)
par: Lin, Yuanxi, et autres
Publié: (2024)
Enhancing Code-Switching Speech Recognition with LID-Based Collaborative Mixture of Experts Model
par: Huang, Hukai, et autres
Publié: (2024)
par: Huang, Hukai, et autres
Publié: (2024)
Dynamic Data Pruning for Automatic Speech Recognition
par: Xiao, Qiao, et autres
Publié: (2024)
par: Xiao, Qiao, et autres
Publié: (2024)
Emotion-Anchored Contrastive Learning Framework for Emotion Recognition in Conversation
par: Yu, Fangxu, et autres
Publié: (2024)
par: Yu, Fangxu, et autres
Publié: (2024)
Advancing Automated Speaking Assessment Leveraging Multifaceted Relevance and Grammar Information
par: Lu, Hao-Chien, et autres
Publié: (2025)
par: Lu, Hao-Chien, et autres
Publié: (2025)
Improving Speech Emotion Recognition in Under-Resourced Languages via Speech-to-Speech Translation with Bootstrapping Data Selection
par: Lin, Hsi-Che, et autres
Publié: (2024)
par: Lin, Hsi-Che, et autres
Publié: (2024)
Multitask Learning for Grapheme-to-Phoneme Conversion of Anglicisms in German Speech Recognition
par: Pritzen, Julia, et autres
Publié: (2021)
par: Pritzen, Julia, et autres
Publié: (2021)
A Deep Learning Automatic Speech Recognition Model for Shona Language
par: Sirora, Leslie Wellington, et autres
Publié: (2025)
par: Sirora, Leslie Wellington, et autres
Publié: (2025)
Joint Automatic Speech Recognition And Structure Learning For Better Speech Understanding
par: Hu, Jiliang, et autres
Publié: (2025)
par: Hu, Jiliang, et autres
Publié: (2025)
DYNAC: Dynamic Vocabulary based Non-Autoregressive Contextualization for Speech Recognition
par: Sudo, Yui, et autres
Publié: (2025)
par: Sudo, Yui, et autres
Publié: (2025)
ContextASR-Bench: A Massive Contextual Speech Recognition Benchmark
par: Wang, He, et autres
Publié: (2025)
par: Wang, He, et autres
Publié: (2025)
Enhancing Dysarthric Speech Recognition for Unseen Speakers via Prototype-Based Adaptation
par: Wang, Shiyao, et autres
Publié: (2024)
par: Wang, Shiyao, et autres
Publié: (2024)
Conversational Speech Recognition by Learning Audio-textual Cross-modal Contextual Representation
par: Wei, Kun, et autres
Publié: (2023)
par: Wei, Kun, et autres
Publié: (2023)
DyPCL: Dynamic Phoneme-level Contrastive Learning for Dysarthric Speech Recognition
par: Lee, Wonjun, et autres
Publié: (2025)
par: Lee, Wonjun, et autres
Publié: (2025)
RWKVTTS: Yet another TTS based on RWKV-7
par: yueyu, Lin, et autres
Publié: (2025)
par: yueyu, Lin, et autres
Publié: (2025)
Enhancing Multimodal Emotion Recognition through Multi-Granularity Cross-Modal Alignment
par: Wang, Xuechen, et autres
Publié: (2024)
par: Wang, Xuechen, et autres
Publié: (2024)
Towards Unsupervised Speech Recognition Without Pronunciation Models
par: Ni, Junrui, et autres
Publié: (2024)
par: Ni, Junrui, et autres
Publié: (2024)
A Cross-Corpus Speech Emotion Recognition Method Based on Supervised Contrastive Learning
par: minjie, Xiang
Publié: (2024)
par: minjie, Xiang
Publié: (2024)
Enhancing Dialogue Speech Recognition with Robust Contextual Awareness via Noise Representation Learning
par: Lee, Wonjun, et autres
Publié: (2024)
par: Lee, Wonjun, et autres
Publié: (2024)
SMILE: Speech Meta In-Context Learning for Low-Resource Language Automatic Speech Recognition
par: Hsu, Ming-Hao, et autres
Publié: (2024)
par: Hsu, Ming-Hao, et autres
Publié: (2024)
Speaker-Distinguishable CTC: Learning Speaker Distinction Using CTC for Multi-Talker Speech Recognition
par: Sakuma, Asahi, et autres
Publié: (2025)
par: Sakuma, Asahi, et autres
Publié: (2025)
In-Context Learning Boosts Speech Recognition via Human-like Adaptation to Speakers and Language Varieties
par: Roll, Nathan, et autres
Publié: (2025)
par: Roll, Nathan, et autres
Publié: (2025)
Automatic Speech Recognition for Hindi
par: Saha, Anish, et autres
Publié: (2024)
par: Saha, Anish, et autres
Publié: (2024)
Cross-lingual Embedding Clustering for Hierarchical Softmax in Low-Resource Multilingual Speech Recognition
par: Yang, Zhengdong, et autres
Publié: (2025)
par: Yang, Zhengdong, et autres
Publié: (2025)
UCorrect: An Unsupervised Framework for Automatic Speech Recognition Error Correction
par: Guo, Jiaxin, et autres
Publié: (2024)
par: Guo, Jiaxin, et autres
Publié: (2024)
Documents similaires
-
Advancing Topic Segmentation of Broadcasted Speech with Multilingual Semantic Embeddings
par: Shukla, Sakshi Deo, et autres
Publié: (2024) -
Moonshine: Speech Recognition for Live Transcription and Voice Commands
par: Jeffries, Nat, et autres
Publié: (2024) -
Scalable Offline ASR for Command-Style Dictation in Courtrooms
par: Nethil, Kumarmanas, et autres
Publié: (2025) -
Exploring Spoken Language Identification Strategies for Automatic Transcription of Multilingual Broadcast and Institutional Speech
par: Valente, Martina, et autres
Publié: (2024) -
Continual Adaptation for Pacific Indigenous Speech Recognition
par: Xiao, Yang, et autres
Publié: (2026)