Guiding Frame-Level CTC Alignments Using Self-knowledge Distillation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kim, Eungbeom, Kim, Hantae, Lee, Kyogu |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Label-Context-Dependent Internal Language Model Estimation for CTC
par: Yang, Zijian, et autres
Publié: (2025)
par: Yang, Zijian, et autres
Publié: (2025)
MGE-LDM: Joint Latent Diffusion for Simultaneous Music Generation and Source Extraction
par: Chae, Yunkee, et autres
Publié: (2025)
par: Chae, Yunkee, et autres
Publié: (2025)
Align With Purpose: Optimize Desired Properties in CTC Models with a General Plug-and-Play Framework
par: Segev, Eliya, et autres
Publié: (2023)
par: Segev, Eliya, et autres
Publié: (2023)
Analyzing the Importance of Blank for CTC-Based Knowledge Distillation
par: Hilmes, Benedikt, et autres
Publié: (2025)
par: Hilmes, Benedikt, et autres
Publié: (2025)
Enhancing Code-Switching ASR Leveraging Non-Peaky CTC Loss and Deep Language Posterior Injection
par: Yang, Tzu-Ting, et autres
Publié: (2024)
par: Yang, Tzu-Ting, et autres
Publié: (2024)
FlexCTC: GPU-powered CTC Beam Decoding With Advanced Contextual Abilities
par: Grigoryan, Lilit, et autres
Publié: (2025)
par: Grigoryan, Lilit, et autres
Publié: (2025)
Fast Context-Biasing for CTC and Transducer ASR models with CTC-based Word Spotter
par: Andrusenko, Andrei, et autres
Publié: (2024)
par: Andrusenko, Andrei, et autres
Publié: (2024)
AlignAtt: Using Attention-based Audio-Translation Alignments as a Guide for Simultaneous Speech Translation
par: Papi, Sara, et autres
Publié: (2023)
par: Papi, Sara, et autres
Publié: (2023)
Speaker-Distinguishable CTC: Learning Speaker Distinction Using CTC for Multi-Talker Speech Recognition
par: Sakuma, Asahi, et autres
Publié: (2025)
par: Sakuma, Asahi, et autres
Publié: (2025)
FLToP CTC: Frame-Level Token Pruning via Relative Threshold for Efficient and Memory-Saving Decoding on Diverse Platforms
par: Shree, Atul, et autres
Publié: (2025)
par: Shree, Atul, et autres
Publié: (2025)
CR-CTC: Consistency regularization on CTC for improved speech recognition
par: Yao, Zengwei, et autres
Publié: (2024)
par: Yao, Zengwei, et autres
Publié: (2024)
Utilizing Neural Transducers for Two-Stage Text-to-Speech via Semantic Token Prediction
par: Kim, Minchan, et autres
Publié: (2024)
par: Kim, Minchan, et autres
Publié: (2024)
STaR: Distilling Speech Temporal Relation for Lightweight Speech Self-Supervised Learning Models
par: Jang, Kangwook, et autres
Publié: (2023)
par: Jang, Kangwook, et autres
Publié: (2023)
AVCap: Leveraging Audio-Visual Features as Text Tokens for Captioning
par: Kim, Jongsuk, et autres
Publié: (2024)
par: Kim, Jongsuk, et autres
Publié: (2024)
Exploring Fine-Tuning of Large Audio Language Models for Spoken Language Understanding under Limited Speech Data
par: Choi, Youngwon, et autres
Publié: (2025)
par: Choi, Youngwon, et autres
Publié: (2025)
Boosting CTC-Based ASR Using LLM-Based Intermediate Loss Regularization
par: Altinok, Duygu
Publié: (2025)
par: Altinok, Duygu
Publié: (2025)
Unimodal Aggregation for CTC-based Speech Recognition
par: Fang, Ying, et autres
Publié: (2023)
par: Fang, Ying, et autres
Publié: (2023)
Property Neurons in Self-Supervised Speech Transformers
par: Lin, Tzu-Quan, et autres
Publié: (2024)
par: Lin, Tzu-Quan, et autres
Publié: (2024)
ETTA: Elucidating the Design Space of Text-to-Audio Models
par: Lee, Sang-gil, et autres
Publié: (2024)
par: Lee, Sang-gil, et autres
Publié: (2024)
tinyCLAP: Distilling Constrastive Language-Audio Pretrained Models
par: Paissan, Francesco, et autres
Publié: (2023)
par: Paissan, Francesco, et autres
Publié: (2023)
Towards General-Purpose Text-Instruction-Guided Voice Conversion
par: Kuan, Chun-Yi, et autres
Publié: (2023)
par: Kuan, Chun-Yi, et autres
Publié: (2023)
Efficient Training of Self-Supervised Speech Foundation Models on a Compute Budget
par: Liu, Andy T., et autres
Publié: (2024)
par: Liu, Andy T., et autres
Publié: (2024)
Joint Beam Search Integrating CTC, Attention, and Transducer Decoders
par: Sudo, Yui, et autres
Publié: (2024)
par: Sudo, Yui, et autres
Publié: (2024)
TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment
par: Kim, Taesoo, et autres
Publié: (2025)
par: Kim, Taesoo, et autres
Publié: (2025)
Is Smaller Always Faster? Tradeoffs in Compressing Self-Supervised Speech Transformers
par: Lin, Tzu-Quan, et autres
Publié: (2022)
par: Lin, Tzu-Quan, et autres
Publié: (2022)
Lightweight Transducer Based on Frame-Level Criterion
par: Wan, Genshun, et autres
Publié: (2024)
par: Wan, Genshun, et autres
Publié: (2024)
LegoSLM: Connecting LLM with Speech Encoder using CTC Posteriors
par: Ma, Rao, et autres
Publié: (2025)
par: Ma, Rao, et autres
Publié: (2025)
ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs
par: Eren, Eray, et autres
Publié: (2025)
par: Eren, Eray, et autres
Publié: (2025)
Wavespace: A Highly Explorable Wavetable Generator
par: Lee, Hazounne, et autres
Publié: (2024)
par: Lee, Hazounne, et autres
Publié: (2024)
RUMAA: Repeat-Aware Unified Music Audio Analysis for Score-Performance Alignment, Transcription, and Mistake Detection
par: Chang, Sungkyun, et autres
Publié: (2025)
par: Chang, Sungkyun, et autres
Publié: (2025)
RoVo: Robust Voice Protection Against Unauthorized Speech Synthesis with Embedding-Level Perturbations
par: Kim, Seungmin, et autres
Publié: (2025)
par: Kim, Seungmin, et autres
Publié: (2025)
Activity-Guided Industrial Anomalous Sound Detection against Interferences
par: Lee, Yunjoo, et autres
Publié: (2024)
par: Lee, Yunjoo, et autres
Publié: (2024)
Breathing and Semantic Pause Detection and Exertion-Level Classification in Post-Exercise Speech
par: Wang, Yuyu, et autres
Publié: (2025)
par: Wang, Yuyu, et autres
Publié: (2025)
Self-Train Before You Transcribe
par: Flynn, Robert, et autres
Publié: (2024)
par: Flynn, Robert, et autres
Publié: (2024)
In-Sync: Adaptation of Speech Aware Large Language Models for ASR with Word Level Timestamp Predictions
par: Fan, Xulin, et autres
Publié: (2026)
par: Fan, Xulin, et autres
Publié: (2026)
From Alignment to Advancement: Bootstrapping Audio-Language Alignment with Synthetic Data
par: Kuan, Chun-Yi, et autres
Publié: (2025)
par: Kuan, Chun-Yi, et autres
Publié: (2025)
Towards Early Prediction of Self-Supervised Speech Model Performance
par: Whetten, Ryan, et autres
Publié: (2025)
par: Whetten, Ryan, et autres
Publié: (2025)
Self-supervised learning of speech representations with Dutch archival data
par: Vaessen, Nik, et autres
Publié: (2025)
par: Vaessen, Nik, et autres
Publié: (2025)
Do Captioning Metrics Reflect Music Semantic Alignment?
par: Lee, Jinwoo, et autres
Publié: (2024)
par: Lee, Jinwoo, et autres
Publié: (2024)
How Does a Deep Neural Network Look at Lexical Stress in English Words?
par: Allouche, Itai, et autres
Publié: (2025)
par: Allouche, Itai, et autres
Publié: (2025)
Documents similaires
-
Label-Context-Dependent Internal Language Model Estimation for CTC
par: Yang, Zijian, et autres
Publié: (2025) -
MGE-LDM: Joint Latent Diffusion for Simultaneous Music Generation and Source Extraction
par: Chae, Yunkee, et autres
Publié: (2025) -
Align With Purpose: Optimize Desired Properties in CTC Models with a General Plug-and-Play Framework
par: Segev, Eliya, et autres
Publié: (2023) -
Analyzing the Importance of Blank for CTC-Based Knowledge Distillation
par: Hilmes, Benedikt, et autres
Publié: (2025) -
Enhancing Code-Switching ASR Leveraging Non-Peaky CTC Loss and Deep Language Posterior Injection
par: Yang, Tzu-Ting, et autres
Publié: (2024)