WhisTLE: Deeply Supervised, Text-Only Domain Adaptation for Pretrained Speech Recognition Transformers
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Pandey, Akshat, Kumar, Karun, Tang, Raphael |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
On The Adaptation of Unlimiformer for Decoder-Only Transformers
par: Ahrabian, Kian, et autres
Publié: (2024)
par: Ahrabian, Kian, et autres
Publié: (2024)
Universal Robust Speech Adaptation for Cross-Domain Speech Recognition and Enhancement
par: Wang, Chien-Chun, et autres
Publié: (2026)
par: Wang, Chien-Chun, et autres
Publié: (2026)
Discrete Multimodal Transformers with a Pretrained Large Language Model for Mixed-Supervision Speech Processing
par: Trinh, Viet Anh, et autres
Publié: (2024)
par: Trinh, Viet Anh, et autres
Publié: (2024)
Huntington Disease Automatic Speech Recognition with Biomarker Supervision
par: Wang, Charles L., et autres
Publié: (2026)
par: Wang, Charles L., et autres
Publié: (2026)
FAAST: Forward-Only Associative Learning via Closed-Form Fast Weights for Test-Time Supervised Adaptation
par: Bao, Guangsheng, et autres
Publié: (2026)
par: Bao, Guangsheng, et autres
Publié: (2026)
Joint Unsupervised and Supervised Training for Automatic Speech Recognition via Bilevel Optimization
par: Saif, A F M, et autres
Publié: (2024)
par: Saif, A F M, et autres
Publié: (2024)
Property Neurons in Self-Supervised Speech Transformers
par: Lin, Tzu-Quan, et autres
Publié: (2024)
par: Lin, Tzu-Quan, et autres
Publié: (2024)
DNT: a Deeply Normalized Transformer that can be trained by Momentum SGD
par: Qi, Xianbiao, et autres
Publié: (2025)
par: Qi, Xianbiao, et autres
Publié: (2025)
How Powerful are Decoder-Only Transformer Neural Models?
par: Roberts, Jesse
Publié: (2023)
par: Roberts, Jesse
Publié: (2023)
Mortgage Language Model: Domain-Adaptive Pretraining with Residual Instruction, Alignment Tuning, and Task-Specific Routing
par: Jain, Manish, et autres
Publié: (2025)
par: Jain, Manish, et autres
Publié: (2025)
TPTT: Transforming Pretrained Transformers into Titans
par: Furfaro, Fabien
Publié: (2025)
par: Furfaro, Fabien
Publié: (2025)
NoteContrast: Contrastive Language-Diagnostic Pretraining for Medical Text
par: Kailas, Prajwal, et autres
Publié: (2024)
par: Kailas, Prajwal, et autres
Publié: (2024)
Is Smaller Always Faster? Tradeoffs in Compressing Self-Supervised Speech Transformers
par: Lin, Tzu-Quan, et autres
Publié: (2022)
par: Lin, Tzu-Quan, et autres
Publié: (2022)
Born a Transformer -- Always a Transformer? On the Effect of Pretraining on Architectural Abilities
par: Jobanputra, Mayank, et autres
Publié: (2025)
par: Jobanputra, Mayank, et autres
Publié: (2025)
Improving Speech Decoding from ECoG with Self-Supervised Pretraining
par: Yuan, Brian A., et autres
Publié: (2024)
par: Yuan, Brian A., et autres
Publié: (2024)
Examining Test-Time Adaptation for Personalized Child Speech Recognition
par: Shi, Zhonghao, et autres
Publié: (2024)
par: Shi, Zhonghao, et autres
Publié: (2024)
Latent Speech-Text Transformer
par: Lu, Yen-Ju, et autres
Publié: (2025)
par: Lu, Yen-Ju, et autres
Publié: (2025)
Transformers as Decision Makers: Provable In-Context Reinforcement Learning via Supervised Pretraining
par: Lin, Licong, et autres
Publié: (2023)
par: Lin, Licong, et autres
Publié: (2023)
HATFormer: Historic Handwritten Arabic Text Recognition with Transformers
par: Chan, Adrian, et autres
Publié: (2024)
par: Chan, Adrian, et autres
Publié: (2024)
Generative or Discriminative? Revisiting Text Classification in the Era of Transformers
par: Kasa, Siva Rajesh, et autres
Publié: (2025)
par: Kasa, Siva Rajesh, et autres
Publié: (2025)
STEP: Scientific Time-Series Encoder Pretraining via Cross-Domain Distillation
par: Zhang, Chen, et autres
Publié: (2026)
par: Zhang, Chen, et autres
Publié: (2026)
Unseen Speaker and Language Adaptation for Lightweight Text-To-Speech with Adapters
par: Falai, Alessio, et autres
Publié: (2025)
par: Falai, Alessio, et autres
Publié: (2025)
On the Problem of Text-To-Speech Model Selection for Synthetic Data Generation in Automatic Speech Recognition
par: Rossenbach, Nick, et autres
Publié: (2024)
par: Rossenbach, Nick, et autres
Publié: (2024)
Pretrained Multilingual Transformers Reveal Quantitative Distance Between Human Languages
par: Zhao, Yue, et autres
Publié: (2026)
par: Zhao, Yue, et autres
Publié: (2026)
Continuously Learning New Words in Automatic Speech Recognition
par: Huber, Christian, et autres
Publié: (2024)
par: Huber, Christian, et autres
Publié: (2024)
HyperTTS: Parameter Efficient Adaptation in Text to Speech using Hypernetworks
par: Li, Yingting, et autres
Publié: (2024)
par: Li, Yingting, et autres
Publié: (2024)
Beyond a Single Extractor: Re-thinking HTML-to-Text Extraction for LLM Pretraining
par: Li, Jeffrey, et autres
Publié: (2026)
par: Li, Jeffrey, et autres
Publié: (2026)
PolyNorm: Few-Shot LLM-Based Text Normalization for Text-to-Speech
par: Wong, Michel, et autres
Publié: (2025)
par: Wong, Michel, et autres
Publié: (2025)
TRN-R1-Zero: Text-rich Network Reasoning via LLMs with Reinforcement Learning Only
par: Liu, Yilun, et autres
Publié: (2026)
par: Liu, Yilun, et autres
Publié: (2026)
Textually Pretrained Speech Language Models
par: Hassid, Michael, et autres
Publié: (2023)
par: Hassid, Michael, et autres
Publié: (2023)
Task Oriented Dialogue as a Catalyst for Self-Supervised Automatic Speech Recognition
par: Chan, David M., et autres
Publié: (2024)
par: Chan, David M., et autres
Publié: (2024)
Context Biasing for Pronunciation-Orthography Mismatch in Automatic Speech Recognition
par: Huber, Christian, et autres
Publié: (2025)
par: Huber, Christian, et autres
Publié: (2025)
MSNER: A Multilingual Speech Dataset for Named Entity Recognition
par: Meeus, Quentin, et autres
Publié: (2024)
par: Meeus, Quentin, et autres
Publié: (2024)
Skipformer: A Skip-and-Recover Strategy for Efficient Speech Recognition
par: Zhu, Wenjing, et autres
Publié: (2024)
par: Zhu, Wenjing, et autres
Publié: (2024)
WhisperNER: Unified Open Named Entity and Speech Recognition
par: Ayache, Gil, et autres
Publié: (2024)
par: Ayache, Gil, et autres
Publié: (2024)
How to Train Text Summarization Model with Weak Supervisions
par: Wang, Yanbo, et autres
Publié: (2024)
par: Wang, Yanbo, et autres
Publié: (2024)
Cross-Platform Hate Speech Detection with Weakly Supervised Causal Disentanglement
par: Sheth, Paras, et autres
Publié: (2024)
par: Sheth, Paras, et autres
Publié: (2024)
Mining Hidden Thoughts from Texts: Evaluating Continual Pretraining with Synthetic Data for LLM Reasoning
par: Ishibashi, Yoichi, et autres
Publié: (2025)
par: Ishibashi, Yoichi, et autres
Publié: (2025)
DiTTo-TTS: Diffusion Transformers for Scalable Text-to-Speech without Domain-Specific Factors
par: Lee, Keon, et autres
Publié: (2024)
par: Lee, Keon, et autres
Publié: (2024)
Efficient Stagewise Pretraining via Progressive Subnetworks
par: Panigrahi, Abhishek, et autres
Publié: (2024)
par: Panigrahi, Abhishek, et autres
Publié: (2024)
Documents similaires
-
On The Adaptation of Unlimiformer for Decoder-Only Transformers
par: Ahrabian, Kian, et autres
Publié: (2024) -
Universal Robust Speech Adaptation for Cross-Domain Speech Recognition and Enhancement
par: Wang, Chien-Chun, et autres
Publié: (2026) -
Discrete Multimodal Transformers with a Pretrained Large Language Model for Mixed-Supervision Speech Processing
par: Trinh, Viet Anh, et autres
Publié: (2024) -
Huntington Disease Automatic Speech Recognition with Biomarker Supervision
par: Wang, Charles L., et autres
Publié: (2026) -
FAAST: Forward-Only Associative Learning via Closed-Form Fast Weights for Test-Time Supervised Adaptation
par: Bao, Guangsheng, et autres
Publié: (2026)