Developing Acoustic Models for Automatic Speech Recognition in Swedish
Fuente:
arXiv
Salvato in:
| Autore principale: | Salvi, Giampiero |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
NAAQA: A Neural Architecture for Acoustic Question Answering
di: Abdelnour, Jerome, et al.
Pubblicazione: (2021)
di: Abdelnour, Jerome, et al.
Pubblicazione: (2021)
Dynamic Behaviour of Connectionist Speech Recognition with Strong Latency Constraints
di: Salvi, Giampiero
Pubblicazione: (2024)
di: Salvi, Giampiero
Pubblicazione: (2024)
Segment Boundary Detection via Class Entropy Measurements in Connectionist Phoneme Recognition
di: Salvi, Giampiero
Pubblicazione: (2024)
di: Salvi, Giampiero
Pubblicazione: (2024)
Beyond Deep Learning: Speech Segmentation and Phone Classification with Neural Assemblies
di: Adelson, Trevor, et al.
Pubblicazione: (2026)
di: Adelson, Trevor, et al.
Pubblicazione: (2026)
AI-based Drone Assisted Human Rescue in Disaster Environments: Challenges and Opportunities
di: Papyan, Narek, et al.
Pubblicazione: (2024)
di: Papyan, Narek, et al.
Pubblicazione: (2024)
SigWavNet: Learning Multiresolution Signal Wavelet Network for Speech Emotion Recognition
di: Nfissi, Alaa, et al.
Pubblicazione: (2025)
di: Nfissi, Alaa, et al.
Pubblicazione: (2025)
Impact of Phonetics on Speaker Identity in Adversarial Voice Attack
di: Dar, Daniyal Kabir, et al.
Pubblicazione: (2025)
di: Dar, Daniyal Kabir, et al.
Pubblicazione: (2025)
Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition
di: Hori, Takaaki, et al.
Pubblicazione: (2025)
di: Hori, Takaaki, et al.
Pubblicazione: (2025)
Deep Feed-Forward Neural Network for Bangla Isolated Speech Recognition
di: Bhadra, Dipayan, et al.
Pubblicazione: (2025)
di: Bhadra, Dipayan, et al.
Pubblicazione: (2025)
Prevailing Research Areas for Music AI in the Era of Foundation Models
di: Wei, Megan, et al.
Pubblicazione: (2024)
di: Wei, Megan, et al.
Pubblicazione: (2024)
AURA: Agent for Understanding, Reasoning, and Automated Tool Use in Voice-Driven Tasks
di: Maben, Leander Melroy, et al.
Pubblicazione: (2025)
di: Maben, Leander Melroy, et al.
Pubblicazione: (2025)
SpecWav-Attack: Leveraging Spectrogram Resizing and Wav2Vec 2.0 for Attacking Anonymized Speech
di: Li, Yuqi, et al.
Pubblicazione: (2025)
di: Li, Yuqi, et al.
Pubblicazione: (2025)
Splitformer: An improved early-exit architecture for automatic speech recognition on edge devices
di: Lasbordes, Maxence, et al.
Pubblicazione: (2025)
di: Lasbordes, Maxence, et al.
Pubblicazione: (2025)
Community-Informed AI Models for Police Accountability
di: Graham, Benjamin A. T., et al.
Pubblicazione: (2024)
di: Graham, Benjamin A. T., et al.
Pubblicazione: (2024)
Reference-Guided Verdict: LLMs-as-Judges in Automatic Evaluation of Free-Form QA
di: Badshah, Sher, et al.
Pubblicazione: (2024)
di: Badshah, Sher, et al.
Pubblicazione: (2024)
Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English
di: Zhang, Haoyang, et al.
Pubblicazione: (2025)
di: Zhang, Haoyang, et al.
Pubblicazione: (2025)
SeQuiFi: Mitigating Catastrophic Forgetting in Speech Emotion Recognition with Sequential Class-Finetuning
di: Jain, Sarthak, et al.
Pubblicazione: (2024)
di: Jain, Sarthak, et al.
Pubblicazione: (2024)
Multi-View Multi-Task Modeling with Speech Foundation Models for Speech Forensic Tasks
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
Make Some Noise: Towards LLM audio reasoning and generation using sound tokens
di: Mehta, Shivam, et al.
Pubblicazione: (2025)
di: Mehta, Shivam, et al.
Pubblicazione: (2025)
Can phones, syllables, and words emerge as side-products of cross-situational audiovisual learning? -- A computational investigation
di: Khorrami, Khazar, et al.
Pubblicazione: (2021)
di: Khorrami, Khazar, et al.
Pubblicazione: (2021)
Chatbots put to the test in math and logic problems: A preliminary comparison and assessment of ChatGPT-3.5, ChatGPT-4, and Google Bard
di: Plevris, Vagelis, et al.
Pubblicazione: (2023)
di: Plevris, Vagelis, et al.
Pubblicazione: (2023)
Prompt Tuned Embedding Classification for Multi-Label Industry Sector Allocation
di: Buchner, Valentin Leonhard, et al.
Pubblicazione: (2023)
di: Buchner, Valentin Leonhard, et al.
Pubblicazione: (2023)
A Unified Model For Voice and Accent Conversion In Speech and Singing using Self-Supervised Learning and Feature Extraction
di: Cheripally, Sowmya
Pubblicazione: (2024)
di: Cheripally, Sowmya
Pubblicazione: (2024)
Quantization for OpenAI's Whisper Models: A Comparative Analysis
di: Andreyev, Allison
Pubblicazione: (2025)
di: Andreyev, Allison
Pubblicazione: (2025)
Investigating Prosodic Signatures via Speech Pre-Trained Models for Audio Deepfake Source Attribution
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
Large Language Models Report Subjective Experience Under Self-Referential Processing
di: Berg, Cameron, et al.
Pubblicazione: (2025)
di: Berg, Cameron, et al.
Pubblicazione: (2025)
UniTAF: A Modular Framework for Joint Text-to-Speech and Audio-to-Face Modeling
di: Zhou, Qiangong, et al.
Pubblicazione: (2026)
di: Zhou, Qiangong, et al.
Pubblicazione: (2026)
Strong Alone, Stronger Together: Synergizing Modality-Binding Foundation Models with Optimal Transport for Non-Verbal Emotion Recognition
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
Graph Connectionist Temporal Classification for Phoneme Recognition
di: Grafé, Henry, et al.
Pubblicazione: (2025)
di: Grafé, Henry, et al.
Pubblicazione: (2025)
The OCON model: an old but gold solution for distributable supervised classification
di: Giacomelli, Stefano, et al.
Pubblicazione: (2024)
di: Giacomelli, Stefano, et al.
Pubblicazione: (2024)
SeamlessEdit: Background Noise Aware Zero-Shot Speech Editing with in-Context Enhancement
di: Chen, Kuan-Yu, et al.
Pubblicazione: (2025)
di: Chen, Kuan-Yu, et al.
Pubblicazione: (2025)
Enhancing Speech Emotion Recognition Leveraging Aligning Timestamps of ASR Transcripts and Speaker Diarization
di: Wang, Hsuan-Yu, et al.
Pubblicazione: (2025)
di: Wang, Hsuan-Yu, et al.
Pubblicazione: (2025)
The Sound of Risk: A Multimodal Physics-Informed Acoustic Model for Forecasting Market Volatility and Enhancing Market Interpretability
di: Chen, Xiaoliang, et al.
Pubblicazione: (2025)
di: Chen, Xiaoliang, et al.
Pubblicazione: (2025)
From Black Box to Glass Box: Cross-Model ASR Disagreement to Prioto Review in Ambient AI Scribe Documentation
di: Karbalaie, Abdolamir, et al.
Pubblicazione: (2026)
di: Karbalaie, Abdolamir, et al.
Pubblicazione: (2026)
SFMS-ALR: Script-First Multilingual Speech Synthesis with Adaptive Locale Resolution
di: Donepudi, Dharma Teja
Pubblicazione: (2025)
di: Donepudi, Dharma Teja
Pubblicazione: (2025)
Pictures Of MIDI: Controlled Music Generation via Graphical Prompts for Image-Based Diffusion Inpainting
di: Hawley, Scott H.
Pubblicazione: (2024)
di: Hawley, Scott H.
Pubblicazione: (2024)
Less Stress, More Privacy: Stress Detection on Anonymized Speech of Air Traffic Controllers
di: Viswanathan, Janaki, et al.
Pubblicazione: (2025)
di: Viswanathan, Janaki, et al.
Pubblicazione: (2025)
Causal Dimensionality of Transformer Representations: Measurement, Scaling, and Layer Structure
di: Sarkar, Nilesh, et al.
Pubblicazione: (2026)
di: Sarkar, Nilesh, et al.
Pubblicazione: (2026)
Vibe-Creation: The Epistemology of Human-AI Emergent Cognition
di: Levin, Ilya
Pubblicazione: (2026)
di: Levin, Ilya
Pubblicazione: (2026)
MENASpeechBank: A Reference Voice Bank with Persona-Conditioned Multi-Turn Conversations for AudioLLMs
di: Ali, Zien Sheikh, et al.
Pubblicazione: (2026)
di: Ali, Zien Sheikh, et al.
Pubblicazione: (2026)
Documenti analoghi
-
NAAQA: A Neural Architecture for Acoustic Question Answering
di: Abdelnour, Jerome, et al.
Pubblicazione: (2021) -
Dynamic Behaviour of Connectionist Speech Recognition with Strong Latency Constraints
di: Salvi, Giampiero
Pubblicazione: (2024) -
Segment Boundary Detection via Class Entropy Measurements in Connectionist Phoneme Recognition
di: Salvi, Giampiero
Pubblicazione: (2024) -
Beyond Deep Learning: Speech Segmentation and Phone Classification with Neural Assemblies
di: Adelson, Trevor, et al.
Pubblicazione: (2026) -
AI-based Drone Assisted Human Rescue in Disaster Environments: Challenges and Opportunities
di: Papyan, Narek, et al.
Pubblicazione: (2024)