Beyond Transcription: Mechanistic Interpretability in ASR
Fuente:
arXiv
Salvato in:
| Autori principali: | Glazer, Neta, Segal-Feldman, Yael, Segev, Hilit, Shamsian, Aviv, Buchnick, Asaf, Hetz, Gill, Fetaya, Ethan, Keshet, Joseph, Navon, Aviv |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
UmbraTTS: Adapting Text-to-Speech to Environmental Contexts with Flow Matching
di: Glazer, Neta, et al.
Pubblicazione: (2025)
di: Glazer, Neta, et al.
Pubblicazione: (2025)
Drax: Speech Recognition with Discrete Flow Matching
di: Navon, Aviv, et al.
Pubblicazione: (2025)
di: Navon, Aviv, et al.
Pubblicazione: (2025)
Whisper in Medusa's Ear: Multi-head Efficient Decoding for Transformer-based ASR
di: Segal-Feldman, Yael, et al.
Pubblicazione: (2024)
di: Segal-Feldman, Yael, et al.
Pubblicazione: (2024)
FlowTSE: Target Speaker Extraction with Flow Matching
di: Navon, Aviv, et al.
Pubblicazione: (2025)
di: Navon, Aviv, et al.
Pubblicazione: (2025)
Keyword-Guided Adaptation of Automatic Speech Recognition
di: Shamsian, Aviv, et al.
Pubblicazione: (2024)
di: Shamsian, Aviv, et al.
Pubblicazione: (2024)
LipVoicer: Generating Speech from Silent Videos Guided by Lip Reading
di: Yemini, Yochai, et al.
Pubblicazione: (2023)
di: Yemini, Yochai, et al.
Pubblicazione: (2023)
PromptEvolver: Prompt Inversion through Evolutionary Optimization in Natural-Language Space
di: Buchnick, Asaf, et al.
Pubblicazione: (2026)
di: Buchnick, Asaf, et al.
Pubblicazione: (2026)
Few-Shot Speech Deepfake Detection Adaptation with Gaussian Processes
di: Glazer, Neta, et al.
Pubblicazione: (2025)
di: Glazer, Neta, et al.
Pubblicazione: (2025)
Multi Task Inverse Reinforcement Learning for Common Sense Reward
di: Glazer, Neta, et al.
Pubblicazione: (2024)
di: Glazer, Neta, et al.
Pubblicazione: (2024)
Keyword Spotting with Hyper-Matched Filters for Small Footprint Devices
di: Segal-Feldman, Yael, et al.
Pubblicazione: (2025)
di: Segal-Feldman, Yael, et al.
Pubblicazione: (2025)
Lightweight Target-Speaker-Based Overlap Transcription for Practical Streaming ASR
di: Pražák, Aleš, et al.
Pubblicazione: (2025)
di: Pražák, Aleš, et al.
Pubblicazione: (2025)
HebDB: a Weakly Supervised Dataset for Hebrew Speech Processing
di: Turetzky, Arnon, et al.
Pubblicazione: (2024)
di: Turetzky, Arnon, et al.
Pubblicazione: (2024)
SSNAPS: Audio-Visual Separation of Speech and Background Noise with Diffusion Inverse Sampling
di: Yemini, Yochai, et al.
Pubblicazione: (2026)
di: Yemini, Yochai, et al.
Pubblicazione: (2026)
Mind the Gap: Entity-Preserved Context-Aware ASR Structured Transcriptions
di: Altinok, Duygu
Pubblicazione: (2025)
di: Altinok, Duygu
Pubblicazione: (2025)
Enhanced ASR Robustness to Packet Loss with a Front-End Adaptation Network
di: Dissen, Yehoshua, et al.
Pubblicazione: (2024)
di: Dissen, Yehoshua, et al.
Pubblicazione: (2024)
Towards Robust Dysarthric Speech Recognition: LLM-Agent Post-ASR Correction Beyond WER
di: Zheng, Xiuwen, et al.
Pubblicazione: (2026)
di: Zheng, Xiuwen, et al.
Pubblicazione: (2026)
The Sound of Healthcare: Improving Medical Transcription ASR Accuracy with Large Language Models
di: Adedeji, Ayo, et al.
Pubblicazione: (2024)
di: Adedeji, Ayo, et al.
Pubblicazione: (2024)
Target Speaker ASR with Whisper
di: Polok, Alexander, et al.
Pubblicazione: (2024)
di: Polok, Alexander, et al.
Pubblicazione: (2024)
Index-ASR Technical Report
di: Song, Zheshu, et al.
Pubblicazione: (2025)
di: Song, Zheshu, et al.
Pubblicazione: (2025)
Breaking the Transcription Bottleneck: Fine-tuning ASR Models for Extremely Low-Resource Fieldwork Languages
di: Liang, Siyu, et al.
Pubblicazione: (2025)
di: Liang, Siyu, et al.
Pubblicazione: (2025)
Speech Emotion Recognition with ASR Integration
di: Li, Yuanchao
Pubblicazione: (2026)
di: Li, Yuanchao
Pubblicazione: (2026)
Efficient Scaling for LLM-based ASR
di: Mu, Bingshen, et al.
Pubblicazione: (2025)
di: Mu, Bingshen, et al.
Pubblicazione: (2025)
The USTC-NERCSLIP Systems for The ICMC-ASR Challenge
di: Wu, Minghui, et al.
Pubblicazione: (2024)
di: Wu, Minghui, et al.
Pubblicazione: (2024)
Is Transfer Learning Necessary for Violin Transcription?
di: Peng, Yueh-Po, et al.
Pubblicazione: (2025)
di: Peng, Yueh-Po, et al.
Pubblicazione: (2025)
LUPET: Incorporating Hierarchical Information Path into Multilingual ASR
di: Liu, Wei, et al.
Pubblicazione: (2024)
di: Liu, Wei, et al.
Pubblicazione: (2024)
persoDA: Personalized Data Augmentation for Personalized ASR
di: Parada, Pablo Peso, et al.
Pubblicazione: (2025)
di: Parada, Pablo Peso, et al.
Pubblicazione: (2025)
Speaker Adaptation for Quantised End-to-End ASR Models
di: Zhao, Qiuming, et al.
Pubblicazione: (2024)
di: Zhao, Qiuming, et al.
Pubblicazione: (2024)
Comparative Analysis of ASR Methods for Speech Deepfake Detection
di: Salvi, Davide, et al.
Pubblicazione: (2024)
di: Salvi, Davide, et al.
Pubblicazione: (2024)
Consistency Based Unsupervised Self-training For ASR Personalisation
di: Zhang, Jisi, et al.
Pubblicazione: (2024)
di: Zhang, Jisi, et al.
Pubblicazione: (2024)
Joint ASR and Speaker Role Tagging with Serialized Output Training
di: Xu, Anfeng, et al.
Pubblicazione: (2025)
di: Xu, Anfeng, et al.
Pubblicazione: (2025)
Learning When to Trust Which Teacher for Weakly Supervised ASR
di: Agrawal, Aakriti, et al.
Pubblicazione: (2023)
di: Agrawal, Aakriti, et al.
Pubblicazione: (2023)
Scaling Multi-Talker ASR with Speaker-Agnostic Activity Streams
di: He, Xiluo, et al.
Pubblicazione: (2025)
di: He, Xiluo, et al.
Pubblicazione: (2025)
Technical Report: A Practical Guide to Kaldi ASR Optimization
di: Hong, Mengze, et al.
Pubblicazione: (2025)
di: Hong, Mengze, et al.
Pubblicazione: (2025)
Prompting Whisper for Joint Speech Transcription and Diarization
di: Zamyrova, Mariia, et al.
Pubblicazione: (2026)
di: Zamyrova, Mariia, et al.
Pubblicazione: (2026)
Robust Singing Voice Transcription Serves Synthesis
di: Li, Ruiqi, et al.
Pubblicazione: (2024)
di: Li, Ruiqi, et al.
Pubblicazione: (2024)
DiffAR: Denoising Diffusion Autoregressive Model for Raw Speech Waveform Generation
di: Benita, Roi, et al.
Pubblicazione: (2023)
di: Benita, Roi, et al.
Pubblicazione: (2023)
Fine-Tuning ASR for Stuttered Speech: Personalized vs. Generalized Approaches
di: Mujtaba, Dena, et al.
Pubblicazione: (2025)
di: Mujtaba, Dena, et al.
Pubblicazione: (2025)
Towards Decoupling Frontend Enhancement and Backend Recognition in Monaural Robust ASR
di: Yang, Yufeng, et al.
Pubblicazione: (2024)
di: Yang, Yufeng, et al.
Pubblicazione: (2024)
Complexity boosted adaptive training for better low resource ASR performance
di: Lu, Hongxuan, et al.
Pubblicazione: (2024)
di: Lu, Hongxuan, et al.
Pubblicazione: (2024)
Resource-Efficient Adaptation of Speech Foundation Models for Multi-Speaker ASR
di: Wang, Weiqing, et al.
Pubblicazione: (2024)
di: Wang, Weiqing, et al.
Pubblicazione: (2024)
Documenti analoghi
-
UmbraTTS: Adapting Text-to-Speech to Environmental Contexts with Flow Matching
di: Glazer, Neta, et al.
Pubblicazione: (2025) -
Drax: Speech Recognition with Discrete Flow Matching
di: Navon, Aviv, et al.
Pubblicazione: (2025) -
Whisper in Medusa's Ear: Multi-head Efficient Decoding for Transformer-based ASR
di: Segal-Feldman, Yael, et al.
Pubblicazione: (2024) -
FlowTSE: Target Speaker Extraction with Flow Matching
di: Navon, Aviv, et al.
Pubblicazione: (2025) -
Keyword-Guided Adaptation of Automatic Speech Recognition
di: Shamsian, Aviv, et al.
Pubblicazione: (2024)