Better Semi-supervised Learning for Multi-domain ASR Through Incremental Retraining and Data Filtering
Fuente:
arXiv
Salvato in:
| Autori principali: | Carofilis, Andres, Rangappa, Pradeep, Madikeri, Srikanth, Kumar, Shashi, Burdisso, Sergio, Prakash, Jeena, Villatoro-Tello, Esau, Motlicek, Petr, Sharma, Bidisha, Hacioglu, Kadri, Venkatesan, Shankar, Vyas, Saurabh, Stolcke, Andreas |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Efficient Data Selection for Domain Adaptation of ASR Using Pseudo-Labels and Multi-Stage Filtering
di: Rangappa, Pradeep, et al.
Pubblicazione: (2025)
di: Rangappa, Pradeep, et al.
Pubblicazione: (2025)
Text-only adaptation in LLM-based ASR through text denoising
di: Carofilis, Andrés, et al.
Pubblicazione: (2026)
di: Carofilis, Andrés, et al.
Pubblicazione: (2026)
TokenVerse++: Towards Flexible Multitask Learning with Dynamic Task Activation
di: Kumar, Shashi, et al.
Pubblicazione: (2025)
di: Kumar, Shashi, et al.
Pubblicazione: (2025)
Reducing Prompt Sensitivity in LLM-based Speech Recognition Through Learnable Projection
di: Burdisso, Sergio, et al.
Pubblicazione: (2026)
di: Burdisso, Sergio, et al.
Pubblicazione: (2026)
Unifying Global and Near-Context Biasing in a Single Trie Pass
di: Thorbecke, Iuliia, et al.
Pubblicazione: (2024)
di: Thorbecke, Iuliia, et al.
Pubblicazione: (2024)
Performance evaluation of SLAM-ASR: The Good, the Bad, the Ugly, and the Way Forward
di: Kumar, Shashi, et al.
Pubblicazione: (2024)
di: Kumar, Shashi, et al.
Pubblicazione: (2024)
Node-weighted Graph Convolutional Network for Depression Detection in Transcribed Clinical Interviews
di: Burdisso, Sergio, et al.
Pubblicazione: (2023)
di: Burdisso, Sergio, et al.
Pubblicazione: (2023)
Distilling Conversations: Abstract Compression of Conversational Audio Context for LLM-based ASR
di: Kumar, Shashi, et al.
Pubblicazione: (2026)
di: Kumar, Shashi, et al.
Pubblicazione: (2026)
TokenVerse: Towards Unifying Speech and NLP Tasks via Transducer-based ASR
di: Kumar, Shashi, et al.
Pubblicazione: (2024)
di: Kumar, Shashi, et al.
Pubblicazione: (2024)
Fast Streaming Transducer ASR Prototyping via Knowledge Distillation with Whisper
di: Thorbecke, Iuliia, et al.
Pubblicazione: (2024)
di: Thorbecke, Iuliia, et al.
Pubblicazione: (2024)
Dialog2Flow: Pre-training Soft-Contrastive Action-Driven Sentence Embeddings for Automatic Dialog Flow Extraction
di: Burdisso, Sergio, et al.
Pubblicazione: (2024)
di: Burdisso, Sergio, et al.
Pubblicazione: (2024)
Better Pseudo-labeling with Multi-ASR Fusion and Error Correction by SpeechLLM
di: Prakash, Jeena, et al.
Pubblicazione: (2025)
di: Prakash, Jeena, et al.
Pubblicazione: (2025)
XLSR-Transducer: Streaming ASR for Self-Supervised Pretrained Models
di: Kumar, Shashi, et al.
Pubblicazione: (2024)
di: Kumar, Shashi, et al.
Pubblicazione: (2024)
Closing the Speech-Text Gap with Limited Audio for Effective Domain Adaptation in LLM-Based ASR
di: Bañeras-Roux, Thibault, et al.
Pubblicazione: (2026)
di: Bañeras-Roux, Thibault, et al.
Pubblicazione: (2026)
Reliability Estimation of News Media Sources: Birds of a Feather Flock Together
di: Burdisso, Sergio, et al.
Pubblicazione: (2024)
di: Burdisso, Sergio, et al.
Pubblicazione: (2024)
Mapping the Media Landscape: Predicting Factual Reporting and Political Bias Through Web Interactions
di: Sánchez-Cortés, Dairazalia, et al.
Pubblicazione: (2024)
di: Sánchez-Cortés, Dairazalia, et al.
Pubblicazione: (2024)
Unifying Streaming and Non-streaming Zipformer-based ASR
di: Sharma, Bidisha, et al.
Pubblicazione: (2025)
di: Sharma, Bidisha, et al.
Pubblicazione: (2025)
Improving endpoint detection in end-to-end streaming ASR for conversational speech
di: C, Anandh, et al.
Pubblicazione: (2025)
di: C, Anandh, et al.
Pubblicazione: (2025)
Effectiveness of Text, Acoustic, and Lattice-based representations in Spoken Language Understanding tasks
di: Villatoro-Tello, Esaú, et al.
Pubblicazione: (2022)
di: Villatoro-Tello, Esaú, et al.
Pubblicazione: (2022)
SDialog: A Python Toolkit for End-to-End Agent Building, User Simulation, Dialog Generation, and Evaluation
di: Burdisso, Sergio, et al.
Pubblicazione: (2025)
di: Burdisso, Sergio, et al.
Pubblicazione: (2025)
SDialog: A Python Toolkit for End-to-End Agent Building, User Simulation, Dialog Generation, and Evaluation
di: Burdisso, Sergio, et al.
Pubblicazione: (2025)
di: Burdisso, Sergio, et al.
Pubblicazione: (2025)
DAIC-WOZ: On the Validity of Using the Therapist's prompts in Automatic Depression Detection from Clinical Interviews
di: Burdisso, Sergio, et al.
Pubblicazione: (2024)
di: Burdisso, Sergio, et al.
Pubblicazione: (2024)
IDIAPers @ Causal News Corpus 2022: Efficient Causal Relation Identification Through a Prompt-based Few-shot Approach
di: Burdisso, Sergio, et al.
Pubblicazione: (2022)
di: Burdisso, Sergio, et al.
Pubblicazione: (2022)
A Probabilistic Method for Ranking Refinementin Geographic Information Retrieval
di: Esaú Villatoro-Tello
Pubblicazione: (2010)
di: Esaú Villatoro-Tello
Pubblicazione: (2010)
Adaptive Multimodal Person Recognition: A Robust Framework for Handling Missing Modalities
di: Farhadipour, Aref, et al.
Pubblicazione: (2025)
di: Farhadipour, Aref, et al.
Pubblicazione: (2025)
When Consistency Becomes Bias: Interviewer Effects in Semi-Structured Clinical Interviews
di: Watawana, Hasindri, et al.
Pubblicazione: (2026)
di: Watawana, Hasindri, et al.
Pubblicazione: (2026)
SpeechLLMs for Large-scale Contextualized Zero-shot Slot Filling
di: Hacioglu, Kadri, et al.
Pubblicazione: (2025)
di: Hacioglu, Kadri, et al.
Pubblicazione: (2025)
Slot Filling as a Reasoning Task for SpeechLLMs
di: Hacioglu, Kadri, et al.
Pubblicazione: (2025)
di: Hacioglu, Kadri, et al.
Pubblicazione: (2025)
Doctor or Patient? Synergizing Diarization and ASR for Code-Switched Hinglish Medical Conditions Extraction
di: Baroudi, Séverin, et al.
Pubblicazione: (2026)
di: Baroudi, Séverin, et al.
Pubblicazione: (2026)
A Differentiable Alignment Framework for Sequence-to-Sequence Modeling via Optimal Transport
di: Kaloga, Yacouba, et al.
Pubblicazione: (2025)
di: Kaloga, Yacouba, et al.
Pubblicazione: (2025)
Evaluation of Automatic Speech Recognition Using Generative Large Language Models
di: Bañeras-Roux, Thibault, et al.
Pubblicazione: (2026)
di: Bañeras-Roux, Thibault, et al.
Pubblicazione: (2026)
Latent Space Factorization in LoRA
di: Kumar, Shashi, et al.
Pubblicazione: (2025)
di: Kumar, Shashi, et al.
Pubblicazione: (2025)
Geometric Latent Reasoning Induces Shorter Generations in LLMs
di: Kumar, Shashi, et al.
Pubblicazione: (2026)
di: Kumar, Shashi, et al.
Pubblicazione: (2026)
Temporal fine-tuning for early risk detection
di: Thompson, Horacio, et al.
Pubblicazione: (2025)
di: Thompson, Horacio, et al.
Pubblicazione: (2025)
Zero-shot Slot Filling in the Age of LLMs for Dialogue Systems
di: Rana, Mansi, et al.
Pubblicazione: (2024)
di: Rana, Mansi, et al.
Pubblicazione: (2024)
TidyVoice: A Curated Multilingual Dataset for Speaker Verification Derived from Common Voice
di: Farhadipour, Aref, et al.
Pubblicazione: (2026)
di: Farhadipour, Aref, et al.
Pubblicazione: (2026)
Benchmarking Children's ASR with Supervised and Self-supervised Speech Foundation Models
di: Fan, Ruchao, et al.
Pubblicazione: (2024)
di: Fan, Ruchao, et al.
Pubblicazione: (2024)
Designing a curriculum for AI prompting strategy for business decision‐makers—A qualitative approach
di: Pavankumar Mulgund, et al.
Pubblicazione: (2026)
di: Pavankumar Mulgund, et al.
Pubblicazione: (2026)
De las producciones narrativas a la tabulación feminista: La Manzana de Eva
di: Cynthia Carofilis Cedeño
Pubblicazione: (2023)
di: Cynthia Carofilis Cedeño
Pubblicazione: (2023)
ACTRESS: Active Retraining for Semi-supervised Visual Grounding
di: Kang, Weitai, et al.
Pubblicazione: (2024)
di: Kang, Weitai, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Efficient Data Selection for Domain Adaptation of ASR Using Pseudo-Labels and Multi-Stage Filtering
di: Rangappa, Pradeep, et al.
Pubblicazione: (2025) -
Text-only adaptation in LLM-based ASR through text denoising
di: Carofilis, Andrés, et al.
Pubblicazione: (2026) -
TokenVerse++: Towards Flexible Multitask Learning with Dynamic Task Activation
di: Kumar, Shashi, et al.
Pubblicazione: (2025) -
Reducing Prompt Sensitivity in LLM-based Speech Recognition Through Learnable Projection
di: Burdisso, Sergio, et al.
Pubblicazione: (2026) -
Unifying Global and Near-Context Biasing in a Single Trie Pass
di: Thorbecke, Iuliia, et al.
Pubblicazione: (2024)