In-Materia Speech Recognition
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zolfagharinejad, Mohamadreza, Büchel, Julian, Cassola, Lorenzo, Kinge, Sachin, Syed, Ghazi Sarwat, Sebastian, Abu, van der Wiel, Wilfred G. |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Robust Speech Recognition with Schrödinger Bridge-Based Speech Enhancement
par: Nasretdinov, Rauf, et autres
Publié: (2025)
par: Nasretdinov, Rauf, et autres
Publié: (2025)
Speech Emotion Recognition with ASR Integration
par: Li, Yuanchao
Publié: (2026)
par: Li, Yuanchao
Publié: (2026)
Zero-Shot Recognition of Dysarthric Speech Using Commercial Automatic Speech Recognition and Multimodal Large Language Models
par: Alsayegh, Ali, et autres
Publié: (2025)
par: Alsayegh, Ali, et autres
Publié: (2025)
The RoyalFlush Automatic Speech Diarization and Recognition System for In-Car Multi-Channel Automatic Speech Recognition Challenge
par: Tian, Jingguang, et autres
Publié: (2024)
par: Tian, Jingguang, et autres
Publié: (2024)
Efficient Long-Form Speech Recognition for General Speech In-Context Learning
par: Yen, Hao, et autres
Publié: (2024)
par: Yen, Hao, et autres
Publié: (2024)
Cross-Corpus Validation of Speech Emotion Recognition in Urdu using Domain-Knowledge Acoustic Features
par: Talpur, Unzela, et autres
Publié: (2025)
par: Talpur, Unzela, et autres
Publié: (2025)
Crab: Multi Layer Contrastive Supervision to Improve Speech Emotion Recognition Under Both Acted and Natural Speech Condition
par: Ueda, Lucas H., et autres
Publié: (2026)
par: Ueda, Lucas H., et autres
Publié: (2026)
Zero Shot Text to Speech Augmentation for Automatic Speech Recognition on Low-Resource Accented Speech Corpora
par: Nespoli, Francesco, et autres
Publié: (2024)
par: Nespoli, Francesco, et autres
Publié: (2024)
Continual Test-time Adaptation for End-to-end Speech Recognition on Noisy Speech
par: Lin, Guan-Ting, et autres
Publié: (2024)
par: Lin, Guan-Ting, et autres
Publié: (2024)
Mamba-based Decoder-Only Approach with Bidirectional Speech Modeling for Speech Recognition
par: Masuyama, Yoshiki, et autres
Publié: (2024)
par: Masuyama, Yoshiki, et autres
Publié: (2024)
Speech-Mamba: Long-Context Speech Recognition with Selective State Spaces Models
par: Gao, Xiaoxue, et autres
Publié: (2024)
par: Gao, Xiaoxue, et autres
Publié: (2024)
Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition
par: Bai, Ye, et autres
Publié: (2024)
par: Bai, Ye, et autres
Publié: (2024)
Speech Recognition for Analysis of Police Radio Communication
par: Srivastava, Tejes, et autres
Publié: (2024)
par: Srivastava, Tejes, et autres
Publié: (2024)
Two-pass Endpoint Detection for Speech Recognition
par: Raju, Anirudh, et autres
Publié: (2024)
par: Raju, Anirudh, et autres
Publié: (2024)
Training Data Augmentation for Dysarthric Automatic Speech Recognition by Text-to-Dysarthric-Speech Synthesis
par: Leung, Wing-Zin, et autres
Publié: (2024)
par: Leung, Wing-Zin, et autres
Publié: (2024)
Rethinking Processing Distortions: Disentangling the Impact of Speech Enhancement Errors on Speech Recognition Performance
par: Ochiai, Tsubasa, et autres
Publié: (2024)
par: Ochiai, Tsubasa, et autres
Publié: (2024)
Efficient Long Speech Sequence Modelling for Time-Domain Depression Level Estimation
par: Li, Shuanglin, et autres
Publié: (2025)
par: Li, Shuanglin, et autres
Publié: (2025)
Uncovering the Visual Contribution in Audio-Visual Speech Recognition
par: Lin, Zhaofeng, et autres
Publié: (2024)
par: Lin, Zhaofeng, et autres
Publié: (2024)
Attention-Guided Adaptation for Code-Switching Speech Recognition
par: Aditya, Bobbi, et autres
Publié: (2023)
par: Aditya, Bobbi, et autres
Publié: (2023)
EMO-SUPERB: An In-depth Look at Speech Emotion Recognition
par: Wu, Haibin, et autres
Publié: (2024)
par: Wu, Haibin, et autres
Publié: (2024)
Dataset-Distillation Generative Model for Speech Emotion Recognition
par: Ritter-Gutierrez, Fabian, et autres
Publié: (2024)
par: Ritter-Gutierrez, Fabian, et autres
Publié: (2024)
THAI Speech Emotion Recognition (THAI-SER) corpus
par: Wongpithayadisai, Jilamika, et autres
Publié: (2025)
par: Wongpithayadisai, Jilamika, et autres
Publié: (2025)
Iterative Prototype Refinement for Ambiguous Speech Emotion Recognition
par: Sun, Haoqin, et autres
Publié: (2024)
par: Sun, Haoqin, et autres
Publié: (2024)
Streaming Decoder-Only Automatic Speech Recognition with Discrete Speech Units: A Pilot Study
par: Chen, Peikun, et autres
Publié: (2024)
par: Chen, Peikun, et autres
Publié: (2024)
USM-Lite: Quantization and Sparsity Aware Fine-tuning for Speech Recognition with Universal Speech Models
par: Ding, Shaojin, et autres
Publié: (2023)
par: Ding, Shaojin, et autres
Publié: (2023)
Sagalee: an Open Source Automatic Speech Recognition Dataset for Oromo Language
par: Abu, Turi, et autres
Publié: (2025)
par: Abu, Turi, et autres
Publié: (2025)
Personalized Fine-Tuning with Controllable Synthetic Speech from LLM-Generated Transcripts for Dysarthric Speech Recognition
par: Wagner, Dominik, et autres
Publié: (2025)
par: Wagner, Dominik, et autres
Publié: (2025)
Fine-Tuning Automatic Speech Recognition for People with Parkinson's: An Effective Strategy for Enhancing Speech Technology Accessibility
par: Zheng, Xiuwen, et autres
Publié: (2024)
par: Zheng, Xiuwen, et autres
Publié: (2024)
The TEA-ASLP System for Multilingual Conversational Speech Recognition and Speech Diarization in MLC-SLM 2025 Challenge
par: Xue, Hongfei, et autres
Publié: (2025)
par: Xue, Hongfei, et autres
Publié: (2025)
EmoQ: Speech Emotion Recognition via Speech-Aware Q-Former and Large Language Model
par: Yang, Yiqing, et autres
Publié: (2025)
par: Yang, Yiqing, et autres
Publié: (2025)
From Human Speech to Ocean Signals: Transferring Speech Large Models for Underwater Acoustic Target Recognition
par: Huang, Mengcheng, et autres
Publié: (2026)
par: Huang, Mengcheng, et autres
Publié: (2026)
Sparsely Shared LoRA on Whisper for Child Speech Recognition
par: Liu, Wei, et autres
Publié: (2023)
par: Liu, Wei, et autres
Publié: (2023)
PCQ: Emotion Recognition in Speech via Progressive Channel Querying
par: Wang, Xincheng, et autres
Publié: (2024)
par: Wang, Xincheng, et autres
Publié: (2024)
Augmenting Polish Automatic Speech Recognition System With Synthetic Data
par: Bondaruk, Łukasz, et autres
Publié: (2024)
par: Bondaruk, Łukasz, et autres
Publié: (2024)
Testing Correctness, Fairness, and Robustness of Speech Emotion Recognition Models
par: Derington, Anna, et autres
Publié: (2023)
par: Derington, Anna, et autres
Publié: (2023)
Leveraging Self-Supervised Models for Automatic Whispered Speech Recognition
par: Farhadipour, Aref, et autres
Publié: (2024)
par: Farhadipour, Aref, et autres
Publié: (2024)
Phone-purity Guided Discrete Tokens for Dysarthric Speech Recognition
par: Wang, Huimeng, et autres
Publié: (2025)
par: Wang, Huimeng, et autres
Publié: (2025)
Rehearsal-Free Online Continual Learning for Automatic Speech Recognition
par: Eeckt, Steven Vander, et autres
Publié: (2023)
par: Eeckt, Steven Vander, et autres
Publié: (2023)
GigaAM: Efficient Self-Supervised Learner for Speech Recognition
par: Kutsakov, Aleksandr, et autres
Publié: (2025)
par: Kutsakov, Aleksandr, et autres
Publié: (2025)
Retrieval Augmented Correction of Named Entity Speech Recognition Errors
par: Pusateri, Ernest, et autres
Publié: (2024)
par: Pusateri, Ernest, et autres
Publié: (2024)
Documents similaires
-
Robust Speech Recognition with Schrödinger Bridge-Based Speech Enhancement
par: Nasretdinov, Rauf, et autres
Publié: (2025) -
Speech Emotion Recognition with ASR Integration
par: Li, Yuanchao
Publié: (2026) -
Zero-Shot Recognition of Dysarthric Speech Using Commercial Automatic Speech Recognition and Multimodal Large Language Models
par: Alsayegh, Ali, et autres
Publié: (2025) -
The RoyalFlush Automatic Speech Diarization and Recognition System for In-Car Multi-Channel Automatic Speech Recognition Challenge
par: Tian, Jingguang, et autres
Publié: (2024) -
Efficient Long-Form Speech Recognition for General Speech In-Context Learning
par: Yen, Hao, et autres
Publié: (2024)