Evaluating and Improving Continual Learning in Spoken Language Understanding
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Muqiao, Li, Xiang, Cappellazzo, Umberto, Watanabe, Shinji, Raj, Bhiksha |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Continual Contrastive Spoken Language Understanding
por: Cappellazzo, Umberto, et al.
Publicado: (2023)
por: Cappellazzo, Umberto, et al.
Publicado: (2023)
On the Evaluation of Speech Foundation Models for Spoken Language Understanding
por: Arora, Siddhant, et al.
Publicado: (2024)
por: Arora, Siddhant, et al.
Publicado: (2024)
DiscreteSLU: A Large Language Model with Self-Supervised Discrete Speech Units for Spoken Language Understanding
por: Shon, Suwon, et al.
Publicado: (2024)
por: Shon, Suwon, et al.
Publicado: (2024)
UniverSLU: Universal Spoken Language Understanding for Diverse Tasks with Natural Language Instructions
por: Arora, Siddhant, et al.
Publicado: (2023)
por: Arora, Siddhant, et al.
Publicado: (2023)
MUGEN: Evaluating and Improving Multi-audio Understanding of Large Audio-Language Models
por: Yang, Chih-Kai, et al.
Publicado: (2026)
por: Yang, Chih-Kai, et al.
Publicado: (2026)
UniSLU: Unified Spoken Language Understanding from Heterogeneous Cross-Task Datasets
por: Sheng, Zhichao, et al.
Publicado: (2025)
por: Sheng, Zhichao, et al.
Publicado: (2025)
Data-Centric Improvements for Enhancing Multi-Modal Understanding in Spoken Conversation Modeling
por: Chen, Maximillian, et al.
Publicado: (2024)
por: Chen, Maximillian, et al.
Publicado: (2024)
Towards Robust Speech Representation Learning for Thousands of Languages
por: Chen, William, et al.
Publicado: (2024)
por: Chen, William, et al.
Publicado: (2024)
GOAT-SLM: A Spoken Language Model with Paralinguistic and Speaker Characteristic Awareness
por: Chen, Hongjie, et al.
Publicado: (2025)
por: Chen, Hongjie, et al.
Publicado: (2025)
TELEVAL: A Dynamic Benchmark Designed for Spoken Language Models in Chinese Interactive Scenarios
por: Li, Zehan, et al.
Publicado: (2025)
por: Li, Zehan, et al.
Publicado: (2025)
An Efficient Self-Learning Framework For Interactive Spoken Dialog Systems
por: Tulsiani, Hitesh, et al.
Publicado: (2024)
por: Tulsiani, Hitesh, et al.
Publicado: (2024)
A Variational Framework for Improving Naturalness in Generative Spoken Language Models
por: Chen, Li-Wei, et al.
Publicado: (2025)
por: Chen, Li-Wei, et al.
Publicado: (2025)
Revisiting Acoustic Features for Robust ASR
por: Shah, Muhammad A., et al.
Publicado: (2024)
por: Shah, Muhammad A., et al.
Publicado: (2024)
On The Landscape of Spoken Language Models: A Comprehensive Survey
por: Arora, Siddhant, et al.
Publicado: (2025)
por: Arora, Siddhant, et al.
Publicado: (2025)
Data Augmentation for Spoken Grammatical Error Correction
por: Karanasou, Penny, et al.
Publicado: (2025)
por: Karanasou, Penny, et al.
Publicado: (2025)
VStyle: A Benchmark for Voice Style Adaptation with Spoken Instructions
por: Zhan, Jun, et al.
Publicado: (2025)
por: Zhan, Jun, et al.
Publicado: (2025)
Spoken Language Intelligence of Large Language Models for Language Learning
por: Peng, Linkai, et al.
Publicado: (2023)
por: Peng, Linkai, et al.
Publicado: (2023)
Retrieval Augmented End-to-End Spoken Dialog Models
por: Wang, Mingqiu, et al.
Publicado: (2024)
por: Wang, Mingqiu, et al.
Publicado: (2024)
NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction
por: Wang, Qichao, et al.
Publicado: (2025)
por: Wang, Qichao, et al.
Publicado: (2025)
What Do Speech Foundation Models Not Learn About Speech?
por: Waheed, Abdul, et al.
Publicado: (2024)
por: Waheed, Abdul, et al.
Publicado: (2024)
Training dynamic models using early exits for automatic speech recognition on resource-constrained devices
por: Wright, George August, et al.
Publicado: (2023)
por: Wright, George August, et al.
Publicado: (2023)
LLaMA-Omni2: LLM-based Real-time Spoken Chatbot with Autoregressive Streaming Speech Synthesis
por: Fang, Qingkai, et al.
Publicado: (2025)
por: Fang, Qingkai, et al.
Publicado: (2025)
SpeechIQ: Speech-Agentic Intelligence Quotient Across Cognitive Levels in Voice Understanding by Large Language Models
por: Wan, Zhen, et al.
Publicado: (2025)
por: Wan, Zhen, et al.
Publicado: (2025)
LALM-as-a-Judge: Benchmarking Large Audio-Language Models for Safety Evaluation in Multi-Turn Spoken Dialogues
por: Ivry, Amir, et al.
Publicado: (2026)
por: Ivry, Amir, et al.
Publicado: (2026)
MULTI-Bench: A Multi-Turn Interactive Benchmark for Assessing Emotional Intelligence ability of Spoken Dialogue Models
por: Deng, Yayue, et al.
Publicado: (2025)
por: Deng, Yayue, et al.
Publicado: (2025)
MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark
por: Wang, Dingdong, et al.
Publicado: (2025)
por: Wang, Dingdong, et al.
Publicado: (2025)
Chain-of-Thought Reasoning in Streaming Full-Duplex End-to-End Spoken Dialogue Systems
por: Arora, Siddhant, et al.
Publicado: (2025)
por: Arora, Siddhant, et al.
Publicado: (2025)
KoALa-Bench: Evaluating Large Audio Language Models on Korean Speech Understanding and Faithfulness
por: Kim, Jinyoung, et al.
Publicado: (2026)
por: Kim, Jinyoung, et al.
Publicado: (2026)
SpeechComposer: Unifying Multiple Speech Tasks with Prompt Composition
por: Wu, Yihan, et al.
Publicado: (2024)
por: Wu, Yihan, et al.
Publicado: (2024)
ADIFF: Explaining audio difference using natural language
por: Deshmukh, Soham, et al.
Publicado: (2025)
por: Deshmukh, Soham, et al.
Publicado: (2025)
Mellow: a small audio language model for reasoning
por: Deshmukh, Soham, et al.
Publicado: (2025)
por: Deshmukh, Soham, et al.
Publicado: (2025)
Chain-of-Thought Training for Open E2E Spoken Dialogue Systems
por: Arora, Siddhant, et al.
Publicado: (2025)
por: Arora, Siddhant, et al.
Publicado: (2025)
All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation
por: Foo, Leonardo Haw-Yang, et al.
Publicado: (2026)
por: Foo, Leonardo Haw-Yang, et al.
Publicado: (2026)
Roadmap towards Superhuman Speech Understanding using Large Language Models
por: Bu, Fan, et al.
Publicado: (2024)
por: Bu, Fan, et al.
Publicado: (2024)
BERT-LID: Leveraging BERT to Improve Spoken Language Identification
por: Nie, Yuting, et al.
Publicado: (2022)
por: Nie, Yuting, et al.
Publicado: (2022)
Effectiveness of Text, Acoustic, and Lattice-based representations in Spoken Language Understanding tasks
por: Villatoro-Tello, Esaú, et al.
Publicado: (2022)
por: Villatoro-Tello, Esaú, et al.
Publicado: (2022)
Interventional Speech Noise Injection for ASR Generalizable Spoken Language Understanding
por: Jung, Yeonjoon, et al.
Publicado: (2024)
por: Jung, Yeonjoon, et al.
Publicado: (2024)
ESPnet-SDS: Unified Toolkit and Demo for Spoken Dialogue Systems
por: Arora, Siddhant, et al.
Publicado: (2025)
por: Arora, Siddhant, et al.
Publicado: (2025)
Towards Holistic Evaluation of Large Audio-Language Models: A Comprehensive Survey
por: Yang, Chih-Kai, et al.
Publicado: (2025)
por: Yang, Chih-Kai, et al.
Publicado: (2025)
uDistil-Whisper: Label-Free Data Filtering for Knowledge Distillation in Low-Data Regimes
por: Waheed, Abdul, et al.
Publicado: (2024)
por: Waheed, Abdul, et al.
Publicado: (2024)
Ejemplares similares
-
Continual Contrastive Spoken Language Understanding
por: Cappellazzo, Umberto, et al.
Publicado: (2023) -
On the Evaluation of Speech Foundation Models for Spoken Language Understanding
por: Arora, Siddhant, et al.
Publicado: (2024) -
DiscreteSLU: A Large Language Model with Self-Supervised Discrete Speech Units for Spoken Language Understanding
por: Shon, Suwon, et al.
Publicado: (2024) -
UniverSLU: Universal Spoken Language Understanding for Diverse Tasks with Natural Language Instructions
por: Arora, Siddhant, et al.
Publicado: (2023) -
MUGEN: Evaluating and Improving Multi-audio Understanding of Large Audio-Language Models
por: Yang, Chih-Kai, et al.
Publicado: (2026)