Towards ASR Robust Spoken Language Understanding Through In-Context Learning With Word Confusion Networks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Everson, Kevin, Gu, Yile, Yang, Huck, Shivakumar, Prashanth Gurunath, Lin, Guan-Ting, Kolehmainen, Jari, Bulyko, Ivan, Gandhe, Ankur, Ghosh, Shalini, Hamza, Wael, Lee, Hung-yi, Rastrow, Ariya, Stolcke, Andreas |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Multi-Modal Retrieval For Large Language Model Based Speech Recognition
par: Kolehmainen, Jari, et autres
Publié: (2024)
par: Kolehmainen, Jari, et autres
Publié: (2024)
Speech Recognition Rescoring with Large Speech-Text Foundation Models
par: Shivakumar, Prashanth Gurunath, et autres
Publié: (2024)
par: Shivakumar, Prashanth Gurunath, et autres
Publié: (2024)
Paralinguistics-Enhanced Large Language Modeling of Spoken Dialogue
par: Lin, Guan-Ting, et autres
Publié: (2023)
par: Lin, Guan-Ting, et autres
Publié: (2023)
Group Relative Policy Optimization for Speech Recognition
par: Shivakumar, Prashanth Gurunath, et autres
Publié: (2025)
par: Shivakumar, Prashanth Gurunath, et autres
Publié: (2025)
Align-SLM: Textless Spoken Language Models with Reinforcement Learning from AI Feedback
par: Lin, Guan-Ting, et autres
Publié: (2024)
par: Lin, Guan-Ting, et autres
Publié: (2024)
Streaming Speech-to-Confusion Network Speech Recognition
par: Filimonov, Denis, et autres
Publié: (2023)
par: Filimonov, Denis, et autres
Publié: (2023)
Investigating Training Strategies and Model Robustness of Low-Rank Adaptation for Language Modeling in Speech Recognition
par: Yu, Yu, et autres
Publié: (2024)
par: Yu, Yu, et autres
Publié: (2024)
Incentivizing Consistent, Effective and Scalable Reasoning Capability in Audio LLMs via Reasoning Process Rewards
par: Fan, Jiajun, et autres
Publié: (2025)
par: Fan, Jiajun, et autres
Publié: (2025)
Low-rank Adaptation of Large Language Model Rescoring for Parameter-Efficient Speech Recognition
par: Yu, Yu, et autres
Publié: (2023)
par: Yu, Yu, et autres
Publié: (2023)
PROCTER: PROnunciation-aware ConTextual adaptER for personalized speech recognition in neural transducers
par: Pandey, Rahul, et autres
Publié: (2023)
par: Pandey, Rahul, et autres
Publié: (2023)
Generative Speech Recognition Error Correction with Large Language Models and Task-Activating Prompting
par: Yang, Chao-Han Huck, et autres
Publié: (2023)
par: Yang, Chao-Han Huck, et autres
Publié: (2023)
An Efficient Self-Learning Framework For Interactive Spoken Dialog Systems
par: Tulsiani, Hitesh, et autres
Publié: (2024)
par: Tulsiani, Hitesh, et autres
Publié: (2024)
Task Oriented Dialogue as a Catalyst for Self-Supervised Automatic Speech Recognition
par: Chan, David M., et autres
Publié: (2024)
par: Chan, David M., et autres
Publié: (2024)
Spoken Conversational Agents with Large Language Models
par: Yang, Chao-Han Huck, et autres
Publié: (2025)
par: Yang, Chao-Han Huck, et autres
Publié: (2025)
Phone Duration Modeling for Speaker Age Estimation in Children
par: Shivakumar, Prashanth Gurunath, et autres
Publié: (2021)
par: Shivakumar, Prashanth Gurunath, et autres
Publié: (2021)
Advancing Large Language Models to Capture Varied Speaking Styles and Respond Properly in Spoken Conversations
par: Lin, Guan-Ting, et autres
Publié: (2024)
par: Lin, Guan-Ting, et autres
Publié: (2024)
SUTA-LM: Bridging Test-Time Adaptation and Language Model Rescoring for Robust ASR
par: Huang, Wei-Ping, et autres
Publié: (2025)
par: Huang, Wei-Ping, et autres
Publié: (2025)
TASTE-Streaming: Towards Streamable Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
par: Tseng, Liang-Hsuan, et autres
Publié: (2026)
par: Tseng, Liang-Hsuan, et autres
Publié: (2026)
HDEE: Heterogeneous Domain Expert Ensemble
par: Ersoy, Oğuzhan, et autres
Publié: (2025)
par: Ersoy, Oğuzhan, et autres
Publié: (2025)
Spoken Words.
par: Seadle, Michael
Publié: (2000)
par: Seadle, Michael
Publié: (2000)
SPAR-K: Scheduled Periodic Alternating Early Exit for Spoken Language Models
par: Huang, Hsiao-Ying, et autres
Publié: (2026)
par: Huang, Hsiao-Ying, et autres
Publié: (2026)
Metal‐Free Organocatalytic Formylation by CO 2 ‐Masked Carbene Functionalized Graphene Oxide Nanosheets
par: Swarbhanu Ghosh, et autres
Publié: (2025)
par: Swarbhanu Ghosh, et autres
Publié: (2025)
SpeechDPR: End-to-End Spoken Passage Retrieval for Open-Domain Spoken Question Answering
par: Lin, Chyi-Jiunn, et autres
Publié: (2024)
par: Lin, Chyi-Jiunn, et autres
Publié: (2024)
Spoken Stereoset: On Evaluating Social Bias Toward Speaker in Speech Large Language Models
par: Lin, Yi-Cheng, et autres
Publié: (2024)
par: Lin, Yi-Cheng, et autres
Publié: (2024)
Style Amnesia: Investigating Speaking Style Degradation and Mitigation in Multi-Turn Spoken Language Models
par: Lin, Yu-Xiang, et autres
Publié: (2025)
par: Lin, Yu-Xiang, et autres
Publié: (2025)
TiCo: Time-Controllable Spoken Dialogue Model
par: Chang, Kai-Wei, et autres
Publié: (2026)
par: Chang, Kai-Wei, et autres
Publié: (2026)
GSQA: An End-to-End Model for Generative Spoken Question Answering
par: Shih, Min-Han, et autres
Publié: (2023)
par: Shih, Min-Han, et autres
Publié: (2023)
CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing
par: Lu, Yen-Ju, et autres
Publié: (2024)
par: Lu, Yen-Ju, et autres
Publié: (2024)
Enhancing Conversational TTS with Cascaded Prompting and ICL-Based Online Reinforcement Learning
par: Ouyang, Zhicheng, et autres
Publié: (2026)
par: Ouyang, Zhicheng, et autres
Publié: (2026)
Enhancing Multilingual ASR for Unseen Languages via Language Embedding Modeling
par: Huang, Shao-Syuan, et autres
Publié: (2024)
par: Huang, Shao-Syuan, et autres
Publié: (2024)
Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities
par: Lin, Guan-Ting, et autres
Publié: (2025)
par: Lin, Guan-Ting, et autres
Publié: (2025)
Can LLMs Understand the Implication of Emphasized Sentences in Dialogue?
par: Lin, Guan-Ting, et autres
Publié: (2024)
par: Lin, Guan-Ting, et autres
Publié: (2024)
NoLoCo: No-all-reduce Low Communication Training Method for Large Models
par: Kolehmainen, Jari, et autres
Publié: (2025)
par: Kolehmainen, Jari, et autres
Publié: (2025)
Learning When to Trust Which Teacher for Weakly Supervised ASR
par: Agrawal, Aakriti, et autres
Publié: (2023)
par: Agrawal, Aakriti, et autres
Publié: (2023)
TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
par: Tseng, Liang-Hsuan, et autres
Publié: (2025)
par: Tseng, Liang-Hsuan, et autres
Publié: (2025)
The inverse conductivity problem with an imperfectly known boundary / Ville Kolehmainen, Matti Lassas, Petri Ola
par: Kolehmainen, Ville
Publié: (2005)
par: Kolehmainen, Ville
Publié: (2005)
FormalASR: End-to-End Spoken Chinese to Formal Text
par: Ning, Wanyi, et autres
Publié: (2026)
par: Ning, Wanyi, et autres
Publié: (2026)
Game-Time: Evaluating Temporal Dynamics in Spoken Language Models
par: Chang, Kai-Wei, et autres
Publié: (2025)
par: Chang, Kai-Wei, et autres
Publié: (2025)
Investigating the Effects of Large-Scale Pseudo-Stereo Data and Different Speech Foundation Model on Dialogue Generative Spoken Language Model
par: Fu, Yu-Kuan, et autres
Publié: (2024)
par: Fu, Yu-Kuan, et autres
Publié: (2024)
Zero Resource Code-switched Speech Benchmark Using Speech Utterance Pairs For Multiple Spoken Languages
par: Huang, Kuan-Po, et autres
Publié: (2023)
par: Huang, Kuan-Po, et autres
Publié: (2023)
Documents similaires
-
Multi-Modal Retrieval For Large Language Model Based Speech Recognition
par: Kolehmainen, Jari, et autres
Publié: (2024) -
Speech Recognition Rescoring with Large Speech-Text Foundation Models
par: Shivakumar, Prashanth Gurunath, et autres
Publié: (2024) -
Paralinguistics-Enhanced Large Language Modeling of Spoken Dialogue
par: Lin, Guan-Ting, et autres
Publié: (2023) -
Group Relative Policy Optimization for Speech Recognition
par: Shivakumar, Prashanth Gurunath, et autres
Publié: (2025) -
Align-SLM: Textless Spoken Language Models with Reinforcement Learning from AI Feedback
par: Lin, Guan-Ting, et autres
Publié: (2024)