Enregistré dans:
| Auteurs principaux: | Haider, Adnan, Na, Xingyu, McDermott, Erik, Ng, Tim, Huang, Zhen, Zhuang, Xiaodan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2408.13008 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition
par: Hori, Takaaki, et autres
Publié: (2025)
par: Hori, Takaaki, et autres
Publié: (2025)
ACES: Automatic Cohort Extraction System for Event-Stream Datasets
par: Xu, Justin, et autres
Publié: (2024)
par: Xu, Justin, et autres
Publié: (2024)
Embedding Compression for Efficient Re-Identification
par: McDermott, Luke
Publié: (2024)
par: McDermott, Luke
Publié: (2024)
Finding Stable Subnetworks at Initialization with Dataset Distillation
par: McDermott, Luke, et autres
Publié: (2025)
par: McDermott, Luke, et autres
Publié: (2025)
Text Conditioned Symbolic Drumbeat Generation using Latent Diffusion Models
par: Jajoria, Pushkar, et autres
Publié: (2024)
par: Jajoria, Pushkar, et autres
Publié: (2024)
Linear Mode Connectivity in Sparse Neural Networks
par: McDermott, Luke, et autres
Publié: (2023)
par: McDermott, Luke, et autres
Publié: (2023)
Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition
par: Lee, Hyeonseung, et autres
Publié: (2024)
par: Lee, Hyeonseung, et autres
Publié: (2024)
CJST: CTC Compressor based Joint Speech and Text Training for Decoder-Only ASR
par: Zhou, Wei, et autres
Publié: (2024)
par: Zhou, Wei, et autres
Publié: (2024)
Higher-Order Singular-Value Derivatives of Rectangular Real Matrices
par: Luo, Róisín, et autres
Publié: (2025)
par: Luo, Róisín, et autres
Publié: (2025)
Joint Unsupervised and Supervised Training for Automatic Speech Recognition via Bilevel Optimization
par: Saif, A F M, et autres
Publié: (2024)
par: Saif, A F M, et autres
Publié: (2024)
Supplementary Resources and Analysis for Automatic Speech Recognition Systems Trained on the Loquacious Dataset
par: Rossenbach, Nick, et autres
Publié: (2025)
par: Rossenbach, Nick, et autres
Publié: (2025)
Codec-ASR: Training Performant Automatic Speech Recognition Systems with Discrete Speech Representations
par: Dhawan, Kunal, et autres
Publié: (2024)
par: Dhawan, Kunal, et autres
Publié: (2024)
Revisiting ASR Error Correction with Specialized Models
par: Gu, Zijin, et autres
Publié: (2024)
par: Gu, Zijin, et autres
Publié: (2024)
CTC-DRO: Robust Optimization for Reducing Language Disparities in Speech Recognition
par: Bartelds, Martijn, et autres
Publié: (2025)
par: Bartelds, Martijn, et autres
Publié: (2025)
Towards End-to-End Training of Automatic Speech Recognition for Nigerian Pidgin
par: Rufai, Amina Mardiyyah, et autres
Publié: (2020)
par: Rufai, Amina Mardiyyah, et autres
Publié: (2020)
On the Effect of Purely Synthetic Training Data for Different Automatic Speech Recognition Architectures
par: Hilmes, Benedikt, et autres
Publié: (2024)
par: Hilmes, Benedikt, et autres
Publié: (2024)
LoLA: Low-Rank Linear Attention With Sparse Caching
par: McDermott, Luke, et autres
Publié: (2025)
par: McDermott, Luke, et autres
Publié: (2025)
Conformer-Based Speech Recognition On Extreme Edge-Computing Devices
par: Xu, Mingbin, et autres
Publié: (2023)
par: Xu, Mingbin, et autres
Publié: (2023)
Pre-Trained Policy Discriminators are General Reward Models
par: Dou, Shihan, et autres
Publié: (2025)
par: Dou, Shihan, et autres
Publié: (2025)
Optimizing Byte-level Representation for End-to-end ASR
par: Hsiao, Roger, et autres
Publié: (2024)
par: Hsiao, Roger, et autres
Publié: (2024)
Training for Speech Recognition on Coprocessors
par: Baunsgaard, Sebastian, et autres
Publié: (2020)
par: Baunsgaard, Sebastian, et autres
Publié: (2020)
ADAPTive Input Training for Many-to-One Pre-Training on Time-Series Classification
par: Quinlan, Paul, et autres
Publié: (2026)
par: Quinlan, Paul, et autres
Publié: (2026)
Integrating Pre-Trained Speech and Language Models for End-to-End Speech Recognition
par: Hono, Yukiya, et autres
Publié: (2023)
par: Hono, Yukiya, et autres
Publié: (2023)
Optimization-Induced Dynamics of Lipschitz Continuity in Neural Networks
par: Luo, Róisín, et autres
Publié: (2025)
par: Luo, Róisín, et autres
Publié: (2025)
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models
par: Ngo, Huong, et autres
Publié: (2025)
par: Ngo, Huong, et autres
Publié: (2025)
Enhancing Speech Emotion Recognition via Fine-Tuning Pre-Trained Models and Hyper-Parameter Optimisation
par: Golbaghi, Aryan, et autres
Publié: (2025)
par: Golbaghi, Aryan, et autres
Publié: (2025)
A Closer Look at AUROC and AUPRC under Class Imbalance
par: McDermott, Matthew B. A., et autres
Publié: (2024)
par: McDermott, Matthew B. A., et autres
Publié: (2024)
Trustworthy Text-to-Image Diffusion Models: A Timely and Focused Survey
par: Zhang, Yi, et autres
Publié: (2024)
par: Zhang, Yi, et autres
Publié: (2024)
Enhancing Corrosion Resistance of Aluminum Alloys Through AI and ML Modeling
par: Kaboudvand, Farnaz, et autres
Publié: (2025)
par: Kaboudvand, Farnaz, et autres
Publié: (2025)
MOSS: Efficient and Accurate FP8 LLM Training with Microscaling and Automatic Scaling
par: Zhang, Yu, et autres
Publié: (2025)
par: Zhang, Yu, et autres
Publié: (2025)
CR-CTC: Consistency regularization on CTC for improved speech recognition
par: Yao, Zengwei, et autres
Publié: (2024)
par: Yao, Zengwei, et autres
Publié: (2024)
Continuously Learning New Words in Automatic Speech Recognition
par: Huber, Christian, et autres
Publié: (2024)
par: Huber, Christian, et autres
Publié: (2024)
Keyword-Guided Adaptation of Automatic Speech Recognition
par: Shamsian, Aviv, et autres
Publié: (2024)
par: Shamsian, Aviv, et autres
Publié: (2024)
Sequence-Level Unsupervised Training in Speech Recognition: A Theoretical Study
par: Yang, Zijian, et autres
Publié: (2026)
par: Yang, Zijian, et autres
Publié: (2026)
Neural Architecture Codesign for Fast Physics Applications
par: Weitz, Jason, et autres
Publié: (2025)
par: Weitz, Jason, et autres
Publié: (2025)
Efficient Generative Prediction for EHR Foundation Models: The SCOPE and REACH Estimators
par: Solo, Luke, et autres
Publié: (2026)
par: Solo, Luke, et autres
Publié: (2026)
Empowering Distributed Training with Sparsity-driven Data Synchronization
par: Wang, Zhuang, et autres
Publié: (2023)
par: Wang, Zhuang, et autres
Publié: (2023)
Accelerating Recommender Model Training by Dynamically Skipping Stale Embeddings
par: Maboud, Yassaman Ebrahimzadeh, et autres
Publié: (2024)
par: Maboud, Yassaman Ebrahimzadeh, et autres
Publié: (2024)
Chunked Attention-based Encoder-Decoder Model for Streaming Speech Recognition
par: Zeineldeen, Mohammad, et autres
Publié: (2023)
par: Zeineldeen, Mohammad, et autres
Publié: (2023)
Internet Instruction: Spreading the Web.
par: McDermott, Irene E.
Publié: (2000)
par: McDermott, Irene E.
Publié: (2000)
Documents similaires
-
Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition
par: Hori, Takaaki, et autres
Publié: (2025) -
ACES: Automatic Cohort Extraction System for Event-Stream Datasets
par: Xu, Justin, et autres
Publié: (2024) -
Embedding Compression for Efficient Re-Identification
par: McDermott, Luke
Publié: (2024) -
Finding Stable Subnetworks at Initialization with Dataset Distillation
par: McDermott, Luke, et autres
Publié: (2025) -
Text Conditioned Symbolic Drumbeat Generation using Latent Diffusion Models
par: Jajoria, Pushkar, et autres
Publié: (2024)