Are LLMs Robust for Spoken Dialogues?
Fuente:
arXiv
Guardado en:
| Autores principales: | Mousavi, Seyed Mahed, Roccabruna, Gabriel, Alghisi, Simone, Rizzoli, Massimo, Ravanelli, Mirco, Riccardi, Giuseppe |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Should We Fine-Tune or RAG? Evaluating Different Techniques to Adapt LLMs for Dialogue
por: Alghisi, Simone, et al.
Publicado: (2024)
por: Alghisi, Simone, et al.
Publicado: (2024)
[De|Re]constructing VLMs' Reasoning in Counting
por: Alghisi, Simone, et al.
Publicado: (2025)
por: Alghisi, Simone, et al.
Publicado: (2025)
CIVET: Systematic Evaluation of Understanding in VLMs
por: Rizzoli, Massimo, et al.
Publicado: (2025)
por: Rizzoli, Massimo, et al.
Publicado: (2025)
LLMs as Repositories of Factual Knowledge: Limitations and Solutions
por: Mousavi, Seyed Mahed, et al.
Publicado: (2025)
por: Mousavi, Seyed Mahed, et al.
Publicado: (2025)
What Does Loss Optimization Actually Teach, If Anything? Knowledge Dynamics in Continual Pre-training of LLMs
por: Mousavi, Seyed Mahed, et al.
Publicado: (2026)
por: Mousavi, Seyed Mahed, et al.
Publicado: (2026)
DyKnow: Dynamically Verifying Time-Sensitive Factual Knowledge in LLMs
por: Mousavi, Seyed Mahed, et al.
Publicado: (2024)
por: Mousavi, Seyed Mahed, et al.
Publicado: (2024)
Getting to the Point: Pointing Improves LVLMs at Counting
por: Alghisi, Simone, et al.
Publicado: (2026)
por: Alghisi, Simone, et al.
Publicado: (2026)
Will LLMs Replace the Encoder-Only Models in Temporal Relation Classification?
por: Roccabruna, Gabriel, et al.
Publicado: (2024)
por: Roccabruna, Gabriel, et al.
Publicado: (2024)
V-DyKnow: A Dynamic Benchmark for Time-Sensitive Knowledge in Vision Language Models
por: Mousavi, Seyed Mahed, et al.
Publicado: (2026)
por: Mousavi, Seyed Mahed, et al.
Publicado: (2026)
Garbage In, Reasoning Out? Why Benchmark Scores are Unreliable and What to Do About It
por: Mousavi, Seyed Mahed, et al.
Publicado: (2025)
por: Mousavi, Seyed Mahed, et al.
Publicado: (2025)
ALAS: Measuring Latent Speech-Text Alignment For Spoken Language Understanding In Multimodal LLMs
por: Mousavi, Pooneh, et al.
Publicado: (2025)
por: Mousavi, Pooneh, et al.
Publicado: (2025)
MATEO: A Multimodal Benchmark for Temporal Reasoning and Planning in LVLMs
por: Roccabruna, Gabriel, et al.
Publicado: (2026)
por: Roccabruna, Gabriel, et al.
Publicado: (2026)
What Are They Doing? Joint Audio-Speech Co-Reasoning
por: Wang, Yingzhi, et al.
Publicado: (2024)
por: Wang, Yingzhi, et al.
Publicado: (2024)
Joint Learning of Context and Feedback Embeddings in Spoken Dialogue
por: Qian, Livia, et al.
Publicado: (2024)
por: Qian, Livia, et al.
Publicado: (2024)
ProGRes: Prompted Generative Rescoring on ASR n-Best
por: Tur, Ada Defne, et al.
Publicado: (2024)
por: Tur, Ada Defne, et al.
Publicado: (2024)
SpokenUS: A Spoken User Simulator for Task-Oriented Dialogue
por: Lee, Jonggeun, et al.
Publicado: (2026)
por: Lee, Jonggeun, et al.
Publicado: (2026)
Evaluating Bias in Spoken Dialogue LLMs for Real-World Decisions and Recommendations
por: Wu, Yihao, et al.
Publicado: (2025)
por: Wu, Yihao, et al.
Publicado: (2025)
WavSLM: Single-Stream Speech Language Modeling via WavLM Distillation
por: Della Libera, Luca, et al.
Publicado: (2026)
por: Della Libera, Luca, et al.
Publicado: (2026)
Adaptation Odyssey in LLMs: Why Does Additional Pretraining Sometimes Fail to Improve?
por: Öncel, Fırat, et al.
Publicado: (2024)
por: Öncel, Fırat, et al.
Publicado: (2024)
Calm-Whisper: Reduce Whisper Hallucination On Non-Speech By Calming Crazy Heads Down
por: Wang, Yingzhi, et al.
Publicado: (2025)
por: Wang, Yingzhi, et al.
Publicado: (2025)
An Analysis of User Behaviors for Objectively Evaluating Spoken Dialogue Systems
por: Inoue, Koji, et al.
Publicado: (2024)
por: Inoue, Koji, et al.
Publicado: (2024)
Adapting Text-based Dialogue State Tracker for Spoken Dialogues
por: Yoon, Jaeseok, et al.
Publicado: (2023)
por: Yoon, Jaeseok, et al.
Publicado: (2023)
J-CHAT: Japanese Large-scale Spoken Dialogue Corpus for Spoken Dialogue Language Modeling
por: Nakata, Wataru, et al.
Publicado: (2024)
por: Nakata, Wataru, et al.
Publicado: (2024)
How Should We Extract Discrete Audio Tokens from Self-Supervised Models?
por: Mousavi, Pooneh, et al.
Publicado: (2024)
por: Mousavi, Pooneh, et al.
Publicado: (2024)
LLM-Enhanced Dialogue Management for Full-Duplex Spoken Dialogue Systems
por: Zhang, Hao, et al.
Publicado: (2025)
por: Zhang, Hao, et al.
Publicado: (2025)
MOSS-TTSD: Text to Spoken Dialogue Generation
por: Zhang, Yuqian, et al.
Publicado: (2026)
por: Zhang, Yuqian, et al.
Publicado: (2026)
SKILL: Similarity-aware Knowledge distILLation for Speech Self-Supervised Learning
por: Zampierin, Luca, et al.
Publicado: (2024)
por: Zampierin, Luca, et al.
Publicado: (2024)
EmoNews: A Spoken Dialogue System for Expressive News Conversations
por: Matsuura, Ryuki, et al.
Publicado: (2025)
por: Matsuura, Ryuki, et al.
Publicado: (2025)
SpokenWOZ: A Large-Scale Speech-Text Benchmark for Spoken Task-Oriented Dialogue Agents
por: Si, Shuzheng, et al.
Publicado: (2023)
por: Si, Shuzheng, et al.
Publicado: (2023)
Paralinguistics-Enhanced Large Language Modeling of Spoken Dialogue
por: Lin, Guan-Ting, et al.
Publicado: (2023)
por: Lin, Guan-Ting, et al.
Publicado: (2023)
LLMs Are Not Intelligent Thinkers: Introducing Mathematical Topic Tree Benchmark for Comprehensive Evaluation of LLMs
por: Davoodi, Arash Gholami, et al.
Publicado: (2024)
por: Davoodi, Arash Gholami, et al.
Publicado: (2024)
Chronological Thinking in Full-Duplex Spoken Dialogue Language Models
por: Wu, Donghang, et al.
Publicado: (2025)
por: Wu, Donghang, et al.
Publicado: (2025)
DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset
por: Koudounas, Alkis, et al.
Publicado: (2025)
por: Koudounas, Alkis, et al.
Publicado: (2025)
Easy Turn: Integrating Acoustic and Linguistic Modalities for Robust Turn-Taking in Full-Duplex Spoken Dialogue Systems
por: Li, Guojian, et al.
Publicado: (2025)
por: Li, Guojian, et al.
Publicado: (2025)
LiSTEN: Learning Soft Token Embeddings for Neural Audio LLMs
por: Mousavi, Pooneh, et al.
Publicado: (2025)
por: Mousavi, Pooneh, et al.
Publicado: (2025)
Spoken DialogSum: An Emotion-Rich Conversational Dataset for Spoken Dialogue Summarization
por: Lu, Yen-Ju, et al.
Publicado: (2025)
por: Lu, Yen-Ju, et al.
Publicado: (2025)
Towards a Japanese Full-duplex Spoken Dialogue System
por: Ohashi, Atsumoto, et al.
Publicado: (2025)
por: Ohashi, Atsumoto, et al.
Publicado: (2025)
Discourse-Aware Dual-Track Streaming Response for Low-Latency Spoken Dialogue Systems
por: Liu, Siyuan, et al.
Publicado: (2026)
por: Liu, Siyuan, et al.
Publicado: (2026)
Triadic Multi-party Voice Activity Projection for Turn-taking in Spoken Dialogue Systems
por: Elmers, Mikey, et al.
Publicado: (2025)
por: Elmers, Mikey, et al.
Publicado: (2025)
WavBench: Benchmarking Reasoning, Colloquialism, and Paralinguistics for End-to-End Spoken Dialogue Models
por: Li, Yangzhuo, et al.
Publicado: (2026)
por: Li, Yangzhuo, et al.
Publicado: (2026)
Ejemplares similares
-
Should We Fine-Tune or RAG? Evaluating Different Techniques to Adapt LLMs for Dialogue
por: Alghisi, Simone, et al.
Publicado: (2024) -
[De|Re]constructing VLMs' Reasoning in Counting
por: Alghisi, Simone, et al.
Publicado: (2025) -
CIVET: Systematic Evaluation of Understanding in VLMs
por: Rizzoli, Massimo, et al.
Publicado: (2025) -
LLMs as Repositories of Factual Knowledge: Limitations and Solutions
por: Mousavi, Seyed Mahed, et al.
Publicado: (2025) -
What Does Loss Optimization Actually Teach, If Anything? Knowledge Dynamics in Continual Pre-training of LLMs
por: Mousavi, Seyed Mahed, et al.
Publicado: (2026)