Canary-1B-v2 & Parakeet-TDT-0.6B-v3: Efficient and High-Performance Models for Multilingual ASR and AST
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sekoyan, Monica, Koluguri, Nithin Rao, Tadevosyan, Nune, Zelasko, Piotr, Bartley, Travis, Karpov, Nikolay, Balam, Jagadeesh, Ginsburg, Boris |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Longer is (Not Necessarily) Stronger: Punctuated Long-Sequence Training for Enhanced Speech Recognition and Translation
par: Koluguri, Nithin Rao, et autres
Publié: (2024)
par: Koluguri, Nithin Rao, et autres
Publié: (2024)
Codec-ASR: Training Performant Automatic Speech Recognition Systems with Discrete Speech Representations
par: Dhawan, Kunal, et autres
Publié: (2024)
par: Dhawan, Kunal, et autres
Publié: (2024)
BESTOW: Efficient and Streamable Speech Language Model with the Best of Two Worlds in GPT and T5
par: Chen, Zhehuai, et autres
Publié: (2024)
par: Chen, Zhehuai, et autres
Publié: (2024)
Speaker Targeting via Self-Speaker Adaptation for Multi-talker ASR
par: Wang, Weiqing, et autres
Publié: (2025)
par: Wang, Weiqing, et autres
Publié: (2025)
Training and Inference Efficiency of Encoder-Decoder Speech Models
par: Żelasko, Piotr, et autres
Publié: (2025)
par: Żelasko, Piotr, et autres
Publié: (2025)
Granary: Speech Recognition and Translation Dataset in 25 European Languages
par: Koluguri, Nithin Rao, et autres
Publié: (2025)
par: Koluguri, Nithin Rao, et autres
Publié: (2025)
Open ASR Leaderboard: Towards Reproducible and Transparent Multilingual and Long-Form Speech Recognition Evaluation
par: Srivastav, Vaibhav, et autres
Publié: (2025)
par: Srivastav, Vaibhav, et autres
Publié: (2025)
META-CAT: Speaker-Informed Speech Embeddings via Meta Information Concatenation for Multi-talker ASR
par: Wang, Jinhan, et autres
Publié: (2024)
par: Wang, Jinhan, et autres
Publié: (2024)
Less is More: Accurate Speech Recognition & Translation without Web-Scale Data
par: Puvvada, Krishna C., et autres
Publié: (2024)
par: Puvvada, Krishna C., et autres
Publié: (2024)
Reducing the Offline-Streaming Gap for Unified ASR Transducer with Consistency Regularization
par: Andrusenko, Andrei, et autres
Publié: (2026)
par: Andrusenko, Andrei, et autres
Publié: (2026)
Methods to Increase the Amount of Data for Speech Recognition for Low Resource Languages
par: Ayrapetyan, Alexan, et autres
Publié: (2025)
par: Ayrapetyan, Alexan, et autres
Publié: (2025)
HAINAN: Fast and Accurate Transducer for Hybrid-Autoregressive ASR
par: Xu, Hainan, et autres
Publié: (2024)
par: Xu, Hainan, et autres
Publié: (2024)
Flexible Multichannel Speech Enhancement for Noise-Robust Frontend
par: Jukić, Ante, et autres
Publié: (2024)
par: Jukić, Ante, et autres
Publié: (2024)
Sortformer: A Novel Approach for Permutation-Resolved Speaker Supervision in Speech-to-Text Systems
par: Park, Taejin, et autres
Publié: (2024)
par: Park, Taejin, et autres
Publié: (2024)
NEST: Self-supervised Fast Conformer as All-purpose Seasoning to Speech Processing Tasks
par: Huang, He, et autres
Publié: (2024)
par: Huang, He, et autres
Publié: (2024)
Unified Semi-Supervised Pipeline for Automatic Speech Recognition
par: Tadevosyan, Nune, et autres
Publié: (2025)
par: Tadevosyan, Nune, et autres
Publié: (2025)
Chunk-wise Attention Transducers for Fast and Accurate Streaming Speech-to-Text
par: Xu, Hainan, et autres
Publié: (2026)
par: Xu, Hainan, et autres
Publié: (2026)
Multilingual Audio-Visual Speech Recognition with Hybrid CTC/RNN-T Fast Conformer
par: Burchi, Maxime, et autres
Publié: (2024)
par: Burchi, Maxime, et autres
Publié: (2024)
Chain-of-Thought Prompting for Speech Translation
par: Hu, Ke, et autres
Publié: (2024)
par: Hu, Ke, et autres
Publié: (2024)
Schrödinger Bridge for Generative Speech Enhancement
par: Jukić, Ante, et autres
Publié: (2024)
par: Jukić, Ante, et autres
Publié: (2024)
EMMeTT: Efficient Multimodal Machine Translation Training
par: Żelasko, Piotr, et autres
Publié: (2024)
par: Żelasko, Piotr, et autres
Publié: (2024)
VoiceTextBlender: Augmenting Large Language Models with Speech Capabilities via Single-Stage Joint Speech-Text Supervised Fine-Tuning
par: Peng, Yifan, et autres
Publié: (2024)
par: Peng, Yifan, et autres
Publié: (2024)
SALM-Duplex: Efficient and Direct Duplex Modeling for Speech-to-Speech Language Model
par: Hu, Ke, et autres
Publié: (2025)
par: Hu, Ke, et autres
Publié: (2025)
Stateful Conformer with Cache-based Inference for Streaming Automatic Speech Recognition
par: Noroozi, Vahid, et autres
Publié: (2023)
par: Noroozi, Vahid, et autres
Publié: (2023)
Resource-Efficient Adaptation of Speech Foundation Models for Multi-Speaker ASR
par: Wang, Weiqing, et autres
Publié: (2024)
par: Wang, Weiqing, et autres
Publié: (2024)
Romanization Encoding For Multilingual ASR
par: Ding, Wen, et autres
Publié: (2024)
par: Ding, Wen, et autres
Publié: (2024)
Instruction Data Generation and Unsupervised Adaptation for Speech Language Models
par: Noroozi, Vahid, et autres
Publié: (2024)
par: Noroozi, Vahid, et autres
Publié: (2024)
Enabling ASR for Low-Resource Languages: A Comprehensive Dataset Creation Approach
par: Yeroyan, Ara, et autres
Publié: (2024)
par: Yeroyan, Ara, et autres
Publié: (2024)
Open Automatic Speech Recognition Models for Classical and Modern Standard Arabic
par: Grigoryan, Lilit, et autres
Publié: (2025)
par: Grigoryan, Lilit, et autres
Publié: (2025)
Anticipating Future with Large Language Model for Simultaneous Machine Translation
par: Ouyang, Siqi, et autres
Publié: (2024)
par: Ouyang, Siqi, et autres
Publié: (2024)
Spectral Codecs: Improving Non-Autoregressive Speech Synthesis with Spectrogram-Based Audio Codecs
par: Langman, Ryan, et autres
Publié: (2024)
par: Langman, Ryan, et autres
Publié: (2024)
Breeding Season and Productivity of Monk Parakeets in Cordoba, Argentina
par: Navarro, Joaquín L, et autres
Publié: (1992)
par: Navarro, Joaquín L, et autres
Publié: (1992)
Streaming Sortformer: Speaker Cache-Based Online Speaker Diarization with Arrival-Time Ordering
par: Medennikov, Ivan, et autres
Publié: (2025)
par: Medennikov, Ivan, et autres
Publié: (2025)
FlexCTC: GPU-powered CTC Beam Decoding With Advanced Contextual Abilities
par: Grigoryan, Lilit, et autres
Publié: (2025)
par: Grigoryan, Lilit, et autres
Publié: (2025)
A Chat About Boring Problems: Studying GPT-based text normalization
par: Zhang, Yang, et autres
Publié: (2023)
par: Zhang, Yang, et autres
Publié: (2023)
How I Built ASR for Endangered Languages with a Spoken Dictionary
par: Bartley, Christopher, et autres
Publié: (2025)
par: Bartley, Christopher, et autres
Publié: (2025)
GetBatch: Distributed Multi-Object Retrieval for ML Data Loading
par: Aizman, Alex, et autres
Publié: (2026)
par: Aizman, Alex, et autres
Publié: (2026)
SPGISpeech 2.0: Transcribed multi-speaker financial audio for speaker-tagged transcription
par: Grossman, Raymond, et autres
Publié: (2025)
par: Grossman, Raymond, et autres
Publié: (2025)
ESBMC v7.6: Enhanced Model Checking of C++ Programs with Clang AST
par: Li, Xianzhiyu, et autres
Publié: (2024)
par: Li, Xianzhiyu, et autres
Publié: (2024)
Genetic Instruct: Scaling up Synthetic Generation of Coding Instructions for Large Language Models
par: Majumdar, Somshubra, et autres
Publié: (2024)
par: Majumdar, Somshubra, et autres
Publié: (2024)
Documents similaires
-
Longer is (Not Necessarily) Stronger: Punctuated Long-Sequence Training for Enhanced Speech Recognition and Translation
par: Koluguri, Nithin Rao, et autres
Publié: (2024) -
Codec-ASR: Training Performant Automatic Speech Recognition Systems with Discrete Speech Representations
par: Dhawan, Kunal, et autres
Publié: (2024) -
BESTOW: Efficient and Streamable Speech Language Model with the Best of Two Worlds in GPT and T5
par: Chen, Zhehuai, et autres
Publié: (2024) -
Speaker Targeting via Self-Speaker Adaptation for Multi-talker ASR
par: Wang, Weiqing, et autres
Publié: (2025) -
Training and Inference Efficiency of Encoder-Decoder Speech Models
par: Żelasko, Piotr, et autres
Publié: (2025)