Learnable Pulse Accumulation for On-Device Speech Recognition: How Much Attention Do You Need?
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Shkolnikov, Yakov Pyotr |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
How Much Context Does My Attention-Based ASR System Need?
par: Flynn, Robert, et autres
Publié: (2023)
par: Flynn, Robert, et autres
Publié: (2023)
Reverse Attention for Lightweight Speech Enhancement on Edge Devices
par: Ojha, Shuubham, et autres
Publié: (2025)
par: Ojha, Shuubham, et autres
Publié: (2025)
Attention-Guided Adaptation for Code-Switching Speech Recognition
par: Aditya, Bobbi, et autres
Publié: (2023)
par: Aditya, Bobbi, et autres
Publié: (2023)
Byte Pair Encoding Is All You Need For Automatic Bengali Speech Recognition
par: Samin, Ahnaf Mozib
Publié: (2024)
par: Samin, Ahnaf Mozib
Publié: (2024)
MiniMax-Speech: Intrinsic Zero-Shot Text-to-Speech with a Learnable Speaker Encoder
par: Zhang, Bowen, et autres
Publié: (2025)
par: Zhang, Bowen, et autres
Publié: (2025)
Omni-R1: Do You Really Need Audio to Fine-Tune Your Audio LLM?
par: Rouditchenko, Andrew, et autres
Publié: (2025)
par: Rouditchenko, Andrew, et autres
Publié: (2025)
Do we really need Self-Attention for Streaming Automatic Speech Recognition?
par: Dkhissi, Youness, et autres
Publié: (2026)
par: Dkhissi, Youness, et autres
Publié: (2026)
How Much Does Machine Identity Matter in Anomalous Sound Detection at Test Time?
par: Wilkinghoff, Kevin, et autres
Publié: (2026)
par: Wilkinghoff, Kevin, et autres
Publié: (2026)
Double Multi-Head Attention Multimodal System for Odyssey 2024 Speech Emotion Recognition Challenge
par: Costa, Federico, et autres
Publié: (2024)
par: Costa, Federico, et autres
Publié: (2024)
Improving Speech Emotion Recognition Through Cross Modal Attention Alignment and Balanced Stacking Model
par: Ueda, Lucas, et autres
Publié: (2025)
par: Ueda, Lucas, et autres
Publié: (2025)
CAMEL: Cross-Attention Enhanced Mixture-of-Experts and Language Bias for Code-Switching Speech Recognition
par: Wang, He, et autres
Publié: (2024)
par: Wang, He, et autres
Publié: (2024)
Improving Streaming Speech Recognition With Time-Shifted Contextual Attention And Dynamic Right Context Masking
par: Le, Khanh, et autres
Publié: (2025)
par: Le, Khanh, et autres
Publié: (2025)
Do We Need EMA for Diffusion-Based Speech Enhancement? Toward a Magnitude-Preserving Network Architecture
par: Richter, Julius, et autres
Publié: (2025)
par: Richter, Julius, et autres
Publié: (2025)
In-Materia Speech Recognition
par: Zolfagharinejad, Mohamadreza, et autres
Publié: (2024)
par: Zolfagharinejad, Mohamadreza, et autres
Publié: (2024)
EfficientASR: Speech Recognition Network Compression via Attention Redundancy and Chunk-Level FFN Optimization
par: Wang, Jianzong, et autres
Publié: (2024)
par: Wang, Jianzong, et autres
Publié: (2024)
End-to-End Target Speaker Speech Recognition Using Context-Aware Attention Mechanisms for Challenging Enrollment Scenario
par: Ghane, Mohsen, et autres
Publié: (2025)
par: Ghane, Mohsen, et autres
Publié: (2025)
Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning
par: Wan, Zixiang, et autres
Publié: (2024)
par: Wan, Zixiang, et autres
Publié: (2024)
Robust Speech Recognition with Schrödinger Bridge-Based Speech Enhancement
par: Nasretdinov, Rauf, et autres
Publié: (2025)
par: Nasretdinov, Rauf, et autres
Publié: (2025)
Attention-weighted Centered Kernel Alignment for Knowledge Distillation in Large Audio-Language Models Applied to Speech Emotion Recognition
par: Yang, Qingran, et autres
Publié: (2026)
par: Yang, Qingran, et autres
Publié: (2026)
Speech Emotion Recognition with ASR Integration
par: Li, Yuanchao
Publié: (2026)
par: Li, Yuanchao
Publié: (2026)
Zero-Shot Recognition of Dysarthric Speech Using Commercial Automatic Speech Recognition and Multimodal Large Language Models
par: Alsayegh, Ali, et autres
Publié: (2025)
par: Alsayegh, Ali, et autres
Publié: (2025)
The RoyalFlush Automatic Speech Diarization and Recognition System for In-Car Multi-Channel Automatic Speech Recognition Challenge
par: Tian, Jingguang, et autres
Publié: (2024)
par: Tian, Jingguang, et autres
Publié: (2024)
Efficient Long-Form Speech Recognition for General Speech In-Context Learning
par: Yen, Hao, et autres
Publié: (2024)
par: Yen, Hao, et autres
Publié: (2024)
Zero Shot Text to Speech Augmentation for Automatic Speech Recognition on Low-Resource Accented Speech Corpora
par: Nespoli, Francesco, et autres
Publié: (2024)
par: Nespoli, Francesco, et autres
Publié: (2024)
Continual Test-time Adaptation for End-to-end Speech Recognition on Noisy Speech
par: Lin, Guan-Ting, et autres
Publié: (2024)
par: Lin, Guan-Ting, et autres
Publié: (2024)
Mamba-based Decoder-Only Approach with Bidirectional Speech Modeling for Speech Recognition
par: Masuyama, Yoshiki, et autres
Publié: (2024)
par: Masuyama, Yoshiki, et autres
Publié: (2024)
Speech-Mamba: Long-Context Speech Recognition with Selective State Spaces Models
par: Gao, Xiaoxue, et autres
Publié: (2024)
par: Gao, Xiaoxue, et autres
Publié: (2024)
Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition
par: Bai, Ye, et autres
Publié: (2024)
par: Bai, Ye, et autres
Publié: (2024)
Speech Recognition for Analysis of Police Radio Communication
par: Srivastava, Tejes, et autres
Publié: (2024)
par: Srivastava, Tejes, et autres
Publié: (2024)
Two-pass Endpoint Detection for Speech Recognition
par: Raju, Anirudh, et autres
Publié: (2024)
par: Raju, Anirudh, et autres
Publié: (2024)
Mamba in Speech: Towards an Alternative to Self-Attention
par: Zhang, Xiangyu, et autres
Publié: (2024)
par: Zhang, Xiangyu, et autres
Publié: (2024)
Golden Gemini is All You Need: Finding the Sweet Spots for Speaker Verification
par: Liu, Tianchi, et autres
Publié: (2023)
par: Liu, Tianchi, et autres
Publié: (2023)
Training Data Augmentation for Dysarthric Automatic Speech Recognition by Text-to-Dysarthric-Speech Synthesis
par: Leung, Wing-Zin, et autres
Publié: (2024)
par: Leung, Wing-Zin, et autres
Publié: (2024)
Rethinking Processing Distortions: Disentangling the Impact of Speech Enhancement Errors on Speech Recognition Performance
par: Ochiai, Tsubasa, et autres
Publié: (2024)
par: Ochiai, Tsubasa, et autres
Publié: (2024)
PARROT: Synergizing Mamba and Attention-based SSL Pre-Trained Models via Parallel Branch Hadamard Optimal Transport for Speech Emotion Recognition
par: Phukan, Orchid Chetia, et autres
Publié: (2025)
par: Phukan, Orchid Chetia, et autres
Publié: (2025)
Uncovering the Visual Contribution in Audio-Visual Speech Recognition
par: Lin, Zhaofeng, et autres
Publié: (2024)
par: Lin, Zhaofeng, et autres
Publié: (2024)
EMO-SUPERB: An In-depth Look at Speech Emotion Recognition
par: Wu, Haibin, et autres
Publié: (2024)
par: Wu, Haibin, et autres
Publié: (2024)
Dataset-Distillation Generative Model for Speech Emotion Recognition
par: Ritter-Gutierrez, Fabian, et autres
Publié: (2024)
par: Ritter-Gutierrez, Fabian, et autres
Publié: (2024)
THAI Speech Emotion Recognition (THAI-SER) corpus
par: Wongpithayadisai, Jilamika, et autres
Publié: (2025)
par: Wongpithayadisai, Jilamika, et autres
Publié: (2025)
Iterative Prototype Refinement for Ambiguous Speech Emotion Recognition
par: Sun, Haoqin, et autres
Publié: (2024)
par: Sun, Haoqin, et autres
Publié: (2024)
Documents similaires
-
How Much Context Does My Attention-Based ASR System Need?
par: Flynn, Robert, et autres
Publié: (2023) -
Reverse Attention for Lightweight Speech Enhancement on Edge Devices
par: Ojha, Shuubham, et autres
Publié: (2025) -
Attention-Guided Adaptation for Code-Switching Speech Recognition
par: Aditya, Bobbi, et autres
Publié: (2023) -
Byte Pair Encoding Is All You Need For Automatic Bengali Speech Recognition
par: Samin, Ahnaf Mozib
Publié: (2024) -
MiniMax-Speech: Intrinsic Zero-Shot Text-to-Speech with a Learnable Speaker Encoder
par: Zhang, Bowen, et autres
Publié: (2025)