Game-Time: Evaluating Temporal Dynamics in Spoken Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Chang, Kai-Wei, Hu, En-Pei, Kuan, Chun-Yi, Ren, Wenze, Chen, Wei-Chih, Lin, Guan-Ting, Tsao, Yu, Sun, Shao-Hua, Lee, Hung-yi, Glass, James |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
TiCo: Time-Controllable Spoken Dialogue Model
por: Chang, Kai-Wei, et al.
Publicado: (2026)
por: Chang, Kai-Wei, et al.
Publicado: (2026)
Spoken Stereoset: On Evaluating Social Bias Toward Speaker in Speech Large Language Models
por: Lin, Yi-Cheng, et al.
Publicado: (2024)
por: Lin, Yi-Cheng, et al.
Publicado: (2024)
Zero Resource Code-switched Speech Benchmark Using Speech Utterance Pairs For Multiple Spoken Languages
por: Huang, Kuan-Po, et al.
Publicado: (2023)
por: Huang, Kuan-Po, et al.
Publicado: (2023)
Full-Duplex-Bench-v2: A Multi-Turn Evaluation Framework for Duplex Dialogue Systems with an Automated Examiner
por: Lin, Guan-Ting, et al.
Publicado: (2025)
por: Lin, Guan-Ting, et al.
Publicado: (2025)
AQAScore: Evaluating Semantic Alignment in Text-to-Audio Generation via Audio Question Answering
por: Kuan, Chun-Yi, et al.
Publicado: (2026)
por: Kuan, Chun-Yi, et al.
Publicado: (2026)
Advancing Large Language Models to Capture Varied Speaking Styles and Respond Properly in Spoken Conversations
por: Lin, Guan-Ting, et al.
Publicado: (2024)
por: Lin, Guan-Ting, et al.
Publicado: (2024)
EMO-Codec: An In-Depth Look at Emotion Preservation capacity of Legacy and Neural Codec Models With Subjective and Objective Evaluations
por: Ren, Wenze, et al.
Publicado: (2024)
por: Ren, Wenze, et al.
Publicado: (2024)
Rethinking Entropy Minimization in Test-Time Adaptation for Autoregressive Models
por: Huang, Wei-Ping, et al.
Publicado: (2026)
por: Huang, Wei-Ping, et al.
Publicado: (2026)
Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models
por: Hsiao, Chi-Yuan, et al.
Publicado: (2025)
por: Hsiao, Chi-Yuan, et al.
Publicado: (2025)
Continual Test-time Adaptation for End-to-end Speech Recognition on Noisy Speech
por: Lin, Guan-Ting, et al.
Publicado: (2024)
por: Lin, Guan-Ting, et al.
Publicado: (2024)
Do Prompts Really Prompt? Exploring the Prompt Understanding Capability of Whisper
por: Yang, Chih-Kai, et al.
Publicado: (2024)
por: Yang, Chih-Kai, et al.
Publicado: (2024)
Speech-Copilot: Leveraging Large Language Models for Speech Processing via Task Decomposition, Modularization, and Program Generation
por: Kuan, Chun-Yi, et al.
Publicado: (2024)
por: Kuan, Chun-Yi, et al.
Publicado: (2024)
Speech-IFEval: Evaluating Instruction-Following and Quantifying Catastrophic Forgetting in Speech-Aware Language Models
por: Lu, Ke-Han, et al.
Publicado: (2025)
por: Lu, Ke-Han, et al.
Publicado: (2025)
Can Large Audio-Language Models Truly Hear? Tackling Hallucinations with Multi-Task Assessment and Stepwise Audio Reasoning
por: Kuan, Chun-Yi, et al.
Publicado: (2024)
por: Kuan, Chun-Yi, et al.
Publicado: (2024)
Teaching Audio-Aware Large Language Models What Does Not Hear: Mitigating Hallucinations through Synthesized Negative Samples
por: Kuan, Chun-Yi, et al.
Publicado: (2025)
por: Kuan, Chun-Yi, et al.
Publicado: (2025)
Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities
por: Lin, Guan-Ting, et al.
Publicado: (2025)
por: Lin, Guan-Ting, et al.
Publicado: (2025)
MOS-Bias: From Hidden Gender Bias to Gender-Aware Speech Quality Assessment
por: Ren, Wenze, et al.
Publicado: (2026)
por: Ren, Wenze, et al.
Publicado: (2026)
TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
por: Tseng, Liang-Hsuan, et al.
Publicado: (2025)
por: Tseng, Liang-Hsuan, et al.
Publicado: (2025)
Gender Bias in Instruction-Guided Speech Synthesis Models
por: Kuan, Chun-Yi, et al.
Publicado: (2025)
por: Kuan, Chun-Yi, et al.
Publicado: (2025)
Full-Duplex-Bench v1.5: Evaluating Overlap Handling for Full-Duplex Speech Models
por: Lin, Guan-Ting, et al.
Publicado: (2025)
por: Lin, Guan-Ting, et al.
Publicado: (2025)
Building a Taiwanese Mandarin Spoken Language Model: A First Attempt
por: Yang, Chih-Kai, et al.
Publicado: (2024)
por: Yang, Chih-Kai, et al.
Publicado: (2024)
HighRateMOS: Sampling-Rate Aware Modeling for Speech Quality Assessment
por: Ren, Wenze, et al.
Publicado: (2025)
por: Ren, Wenze, et al.
Publicado: (2025)
Investigating Zero-Shot Generalizability on Mandarin-English Code-Switched ASR and Speech-to-text Translation of Recent Foundation Models with Self-Supervision and Weak Supervision
por: Yang, Chih-Kai, et al.
Publicado: (2023)
por: Yang, Chih-Kai, et al.
Publicado: (2023)
TaigiSpeech: A Low-Resource Real-World Speech Intent Dataset and Preliminary Results with Scalable Data Mining In-the-Wild
por: Chang, Kai-Wei, et al.
Publicado: (2026)
por: Chang, Kai-Wei, et al.
Publicado: (2026)
Align-SLM: Textless Spoken Language Models with Reinforcement Learning from AI Feedback
por: Lin, Guan-Ting, et al.
Publicado: (2024)
por: Lin, Guan-Ting, et al.
Publicado: (2024)
SUTA-LM: Bridging Test-Time Adaptation and Language Model Rescoring for Robust ASR
por: Huang, Wei-Ping, et al.
Publicado: (2025)
por: Huang, Wei-Ping, et al.
Publicado: (2025)
Understanding Sounds, Missing the Questions: The Challenge of Object Hallucination in Large Audio-Language Models
por: Kuan, Chun-Yi, et al.
Publicado: (2024)
por: Kuan, Chun-Yi, et al.
Publicado: (2024)
Paralinguistics-Enhanced Large Language Modeling of Spoken Dialogue
por: Lin, Guan-Ting, et al.
Publicado: (2023)
por: Lin, Guan-Ting, et al.
Publicado: (2023)
SpeechDPR: End-to-End Spoken Passage Retrieval for Open-Domain Spoken Question Answering
por: Lin, Chyi-Jiunn, et al.
Publicado: (2024)
por: Lin, Chyi-Jiunn, et al.
Publicado: (2024)
SPAR-K: Scheduled Periodic Alternating Early Exit for Spoken Language Models
por: Huang, Hsiao-Ying, et al.
Publicado: (2026)
por: Huang, Hsiao-Ying, et al.
Publicado: (2026)
Robust Audio-Visual Speech Enhancement: Correcting Misassignments in Complex Environments with Advanced Post-Processing
por: Ren, Wenze, et al.
Publicado: (2024)
por: Ren, Wenze, et al.
Publicado: (2024)
DFADD: The Diffusion and Flow-Matching Based Audio Deepfake Dataset
por: Du, Jiawei, et al.
Publicado: (2024)
por: Du, Jiawei, et al.
Publicado: (2024)
Towards Holistic Evaluation of Large Audio-Language Models: A Comprehensive Survey
por: Yang, Chih-Kai, et al.
Publicado: (2025)
por: Yang, Chih-Kai, et al.
Publicado: (2025)
How Auditory Knowledge in LLM Backbones Shapes Audio Language Models: A Holistic Evaluation
por: Lu, Ke-Han, et al.
Publicado: (2026)
por: Lu, Ke-Han, et al.
Publicado: (2026)
MC-SEMamba: A Simple Multi-channel Extension of SEMamba
por: Ting, Wen-Yuan, et al.
Publicado: (2024)
por: Ting, Wen-Yuan, et al.
Publicado: (2024)
SAKURA: On the Multi-hop Reasoning of Large Audio-Language Models Based on Speech and Audio Information
por: Yang, Chih-Kai, et al.
Publicado: (2025)
por: Yang, Chih-Kai, et al.
Publicado: (2025)
Dynamic-SUPERB Phase-2: A Collaboratively Expanding Benchmark for Measuring the Capabilities of Spoken Language Models with 180 Tasks
por: Huang, Chien-yu, et al.
Publicado: (2024)
por: Huang, Chien-yu, et al.
Publicado: (2024)
Listen and Speak Fairly: A Study on Semantic Gender Bias in Speech Integrated Large Language Models
por: Lin, Yi-Cheng, et al.
Publicado: (2024)
por: Lin, Yi-Cheng, et al.
Publicado: (2024)
Do You Hear What I Mean? Quantifying the Instruction-Perception Gap in Instruction-Guided Expressive Text-To-Speech Systems
por: Lin, Yi-Cheng, et al.
Publicado: (2025)
por: Lin, Yi-Cheng, et al.
Publicado: (2025)
Leveraging Mamba with Full-Face Vision for Audio-Visual Speech Enhancement
por: Chao, Rong, et al.
Publicado: (2025)
por: Chao, Rong, et al.
Publicado: (2025)
Ejemplares similares
-
TiCo: Time-Controllable Spoken Dialogue Model
por: Chang, Kai-Wei, et al.
Publicado: (2026) -
Spoken Stereoset: On Evaluating Social Bias Toward Speaker in Speech Large Language Models
por: Lin, Yi-Cheng, et al.
Publicado: (2024) -
Zero Resource Code-switched Speech Benchmark Using Speech Utterance Pairs For Multiple Spoken Languages
por: Huang, Kuan-Po, et al.
Publicado: (2023) -
Full-Duplex-Bench-v2: A Multi-Turn Evaluation Framework for Duplex Dialogue Systems with an Automated Examiner
por: Lin, Guan-Ting, et al.
Publicado: (2025) -
AQAScore: Evaluating Semantic Alignment in Text-to-Audio Generation via Audio Question Answering
por: Kuan, Chun-Yi, et al.
Publicado: (2026)