Enregistré dans:
| Auteurs principaux: | Tan, Frank Lihui, Do, Youngah |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2407.18501 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Automatic Speech Recognition (ASR) for the Diagnosis of pronunciation of Speech Sound Disorders in Korean children
par: Ahn, Taekyung, et autres
Publié: (2024)
par: Ahn, Taekyung, et autres
Publié: (2024)
Suicide Risk Assessment Using Multimodal Speech Features: A Study on the SW1 Challenge Dataset
par: Marie, Ambre, et autres
Publié: (2025)
par: Marie, Ambre, et autres
Publié: (2025)
Framework for Curating Speech Datasets and Evaluating ASR Systems: A Case Study for Polish
par: Junczyk, Michał
Publié: (2024)
par: Junczyk, Michał
Publié: (2024)
SW-ASR: A Context-Aware Hybrid ASR Pipeline for Robust Single Word Speech Recognition
par: Sharma, Manali, et autres
Publié: (2026)
par: Sharma, Manali, et autres
Publié: (2026)
MuTox: Universal MUltilingual Audio-based TOXicity Dataset and Zero-shot Detector
par: Costa-jussà, Marta R., et autres
Publié: (2024)
par: Costa-jussà, Marta R., et autres
Publié: (2024)
Measuring the Accuracy of Automatic Speech Recognition Solutions
par: Kuhn, Korbinian, et autres
Publié: (2024)
par: Kuhn, Korbinian, et autres
Publié: (2024)
Everyday Speech in the Indian Subcontinent
par: P, Utkarsh
Publié: (2024)
par: P, Utkarsh
Publié: (2024)
Empathy Omni: Enabling Empathetic Speech Response Generation through Large Language Models
par: Wang, Haoyu, et autres
Publié: (2025)
par: Wang, Haoyu, et autres
Publié: (2025)
Bigger is not Always Better: The Effect of Context Size on Speech Pre-Training
par: Robertson, Sean, et autres
Publié: (2023)
par: Robertson, Sean, et autres
Publié: (2023)
Beyond Levenshtein: Leveraging Multiple Algorithms for Robust Word Error Rate Computations And Granular Error Classifications
par: Kuhn, Korbinian, et autres
Publié: (2024)
par: Kuhn, Korbinian, et autres
Publié: (2024)
Predicting Upcoming Stuttering Events from Three-Second Audio: Stratified Evaluation Reveals Severity-Selective Precursors, and the Model Deploys Fully On-Device
par: Kozak, Nazar
Publié: (2026)
par: Kozak, Nazar
Publié: (2026)
Are Music Foundation Models Better at Singing Voice Deepfake Detection? Far-Better Fuse them with Speech Foundation Models
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
SpeechWeave: Diverse Multilingual Synthetic Text & Audio Data Generation Pipeline for Training Text to Speech Models
par: Dua, Karan, et autres
Publié: (2025)
par: Dua, Karan, et autres
Publié: (2025)
AQUALLM: Audio Question Answering Data Generation Using Large Language Models
par: Behera, Swarup Ranjan, et autres
Publié: (2023)
par: Behera, Swarup Ranjan, et autres
Publié: (2023)
SoccerNet-Echoes: A Soccer Game Audio Commentary Dataset
par: Gautam, Sushant, et autres
Publié: (2024)
par: Gautam, Sushant, et autres
Publié: (2024)
SpeechAccentLLM: A Unified Framework for Foreign Accent Conversion and Text to Speech
par: Cheng, Zhuangfei, et autres
Publié: (2025)
par: Cheng, Zhuangfei, et autres
Publié: (2025)
Quantifying the effect of speech pathology on automatic and human speaker verification
par: Halpern, Bence Mark, et autres
Publié: (2024)
par: Halpern, Bence Mark, et autres
Publié: (2024)
NAAQA: A Neural Architecture for Acoustic Question Answering
par: Abdelnour, Jerome, et autres
Publié: (2021)
par: Abdelnour, Jerome, et autres
Publié: (2021)
Enhancing Speech Emotion Recognition Leveraging Aligning Timestamps of ASR Transcripts and Speaker Diarization
par: Wang, Hsuan-Yu, et autres
Publié: (2025)
par: Wang, Hsuan-Yu, et autres
Publié: (2025)
Less Stress, More Privacy: Stress Detection on Anonymized Speech of Air Traffic Controllers
par: Viswanathan, Janaki, et autres
Publié: (2025)
par: Viswanathan, Janaki, et autres
Publié: (2025)
Thaka at KSAA-2026 Task 2: Regularized Fine-Tuning for Arabic Speech Diacritization
par: Alamr, Meshal, et autres
Publié: (2026)
par: Alamr, Meshal, et autres
Publié: (2026)
Improving Speech Recognition Accuracy Using Custom Language Models with the Vosk Toolkit
par: Soni, Aniket Abhishek
Publié: (2025)
par: Soni, Aniket Abhishek
Publié: (2025)
A Unified Model For Voice and Accent Conversion In Speech and Singing using Self-Supervised Learning and Feature Extraction
par: Cheripally, Sowmya
Publié: (2024)
par: Cheripally, Sowmya
Publié: (2024)
Taming Audio VAEs via Target-KL Regularization
par: Seetharaman, Prem, et autres
Publié: (2026)
par: Seetharaman, Prem, et autres
Publié: (2026)
Can We Achieve High-quality Direct Speech-to-Speech Translation without Parallel Speech Data?
par: Fang, Qingkai, et autres
Publié: (2024)
par: Fang, Qingkai, et autres
Publié: (2024)
CTC-based Non-autoregressive Textless Speech-to-Speech Translation
par: Fang, Qingkai, et autres
Publié: (2024)
par: Fang, Qingkai, et autres
Publié: (2024)
Syllable based DNN-HMM Cantonese Speech to Text System
par: Wong, Timothy, et autres
Publié: (2024)
par: Wong, Timothy, et autres
Publié: (2024)
MGSC: A Multi-granularity Consistency Framework for Robust End-to-end Asr
par: Yang, Xuwen
Publié: (2025)
par: Yang, Xuwen
Publié: (2025)
LLaMA-Omni: Seamless Speech Interaction with Large Language Models
par: Fang, Qingkai, et autres
Publié: (2024)
par: Fang, Qingkai, et autres
Publié: (2024)
Effectiveness of Text, Acoustic, and Lattice-based representations in Spoken Language Understanding tasks
par: Villatoro-Tello, Esaú, et autres
Publié: (2022)
par: Villatoro-Tello, Esaú, et autres
Publié: (2022)
An End-to-End Approach for Korean Wakeword Systems with Speaker Authentication
par: Seo, Geonwoo
Publié: (2025)
par: Seo, Geonwoo
Publié: (2025)
Splitformer: An improved early-exit architecture for automatic speech recognition on edge devices
par: Lasbordes, Maxence, et autres
Publié: (2025)
par: Lasbordes, Maxence, et autres
Publié: (2025)
CUPE: Contextless Universal Phoneme Encoder for Language-Agnostic Speech Processing
par: Rehman, Abdul, et autres
Publié: (2025)
par: Rehman, Abdul, et autres
Publié: (2025)
Evaluating ASR Confidence Scores for Automated Error Detection in User-Assisted Correction Interfaces
par: Kuhn, Korbinian, et autres
Publié: (2025)
par: Kuhn, Korbinian, et autres
Publié: (2025)
Investigating Prosodic Signatures via Speech Pre-Trained Models for Audio Deepfake Source Attribution
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
Strong Alone, Stronger Together: Synergizing Modality-Binding Foundation Models with Optimal Transport for Non-Verbal Emotion Recognition
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
Multi-View Multi-Task Modeling with Speech Foundation Models for Speech Forensic Tasks
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
Avengers Assemble: Amalgamation of Non-Semantic Features for Depression Detection
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
SeQuiFi: Mitigating Catastrophic Forgetting in Speech Emotion Recognition with Sequential Class-Finetuning
par: Jain, Sarthak, et autres
Publié: (2024)
par: Jain, Sarthak, et autres
Publié: (2024)
Representation Loss Minimization with Randomized Selection Strategy for Efficient Environmental Fake Audio Detection
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
Documents similaires
-
Automatic Speech Recognition (ASR) for the Diagnosis of pronunciation of Speech Sound Disorders in Korean children
par: Ahn, Taekyung, et autres
Publié: (2024) -
Suicide Risk Assessment Using Multimodal Speech Features: A Study on the SW1 Challenge Dataset
par: Marie, Ambre, et autres
Publié: (2025) -
Framework for Curating Speech Datasets and Evaluating ASR Systems: A Case Study for Polish
par: Junczyk, Michał
Publié: (2024) -
SW-ASR: A Context-Aware Hybrid ASR Pipeline for Robust Single Word Speech Recognition
par: Sharma, Manali, et autres
Publié: (2026) -
MuTox: Universal MUltilingual Audio-based TOXicity Dataset and Zero-shot Detector
par: Costa-jussà, Marta R., et autres
Publié: (2024)