TiCo: Time-Controllable Spoken Dialogue Model
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Chang, Kai-Wei, Chen, Wei-Chih, Hu, En-Pei, Lee, Hung-yi, Glass, James |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Game-Time: Evaluating Temporal Dynamics in Spoken Language Models
von: Chang, Kai-Wei, et al.
Veröffentlicht: (2025)
von: Chang, Kai-Wei, et al.
Veröffentlicht: (2025)
Spoken Stereoset: On Evaluating Social Bias Toward Speaker in Speech Large Language Models
von: Lin, Yi-Cheng, et al.
Veröffentlicht: (2024)
von: Lin, Yi-Cheng, et al.
Veröffentlicht: (2024)
Paralinguistics-Enhanced Large Language Modeling of Spoken Dialogue
von: Lin, Guan-Ting, et al.
Veröffentlicht: (2023)
von: Lin, Guan-Ting, et al.
Veröffentlicht: (2023)
Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models
von: Hsiao, Chi-Yuan, et al.
Veröffentlicht: (2025)
von: Hsiao, Chi-Yuan, et al.
Veröffentlicht: (2025)
Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities
von: Lin, Guan-Ting, et al.
Veröffentlicht: (2025)
von: Lin, Guan-Ting, et al.
Veröffentlicht: (2025)
SPAR-K: Scheduled Periodic Alternating Early Exit for Spoken Language Models
von: Huang, Hsiao-Ying, et al.
Veröffentlicht: (2026)
von: Huang, Hsiao-Ying, et al.
Veröffentlicht: (2026)
Advancing Large Language Models to Capture Varied Speaking Styles and Respond Properly in Spoken Conversations
von: Lin, Guan-Ting, et al.
Veröffentlicht: (2024)
von: Lin, Guan-Ting, et al.
Veröffentlicht: (2024)
TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
von: Tseng, Liang-Hsuan, et al.
Veröffentlicht: (2025)
von: Tseng, Liang-Hsuan, et al.
Veröffentlicht: (2025)
Zero Resource Code-switched Speech Benchmark Using Speech Utterance Pairs For Multiple Spoken Languages
von: Huang, Kuan-Po, et al.
Veröffentlicht: (2023)
von: Huang, Kuan-Po, et al.
Veröffentlicht: (2023)
Building a Taiwanese Mandarin Spoken Language Model: A First Attempt
von: Yang, Chih-Kai, et al.
Veröffentlicht: (2024)
von: Yang, Chih-Kai, et al.
Veröffentlicht: (2024)
UltraVoice: Scaling Fine-Grained Style-Controlled Speech Conversations for Spoken Dialogue Models
von: Tu, Wenming, et al.
Veröffentlicht: (2025)
von: Tu, Wenming, et al.
Veröffentlicht: (2025)
URO-Bench: Towards Comprehensive Evaluation for End-to-End Spoken Dialogue Models
von: Yan, Ruiqi, et al.
Veröffentlicht: (2025)
von: Yan, Ruiqi, et al.
Veröffentlicht: (2025)
Do Prompts Really Prompt? Exploring the Prompt Understanding Capability of Whisper
von: Yang, Chih-Kai, et al.
Veröffentlicht: (2024)
von: Yang, Chih-Kai, et al.
Veröffentlicht: (2024)
Investigating the Effects of Large-Scale Pseudo-Stereo Data and Different Speech Foundation Model on Dialogue Generative Spoken Language Model
von: Fu, Yu-Kuan, et al.
Veröffentlicht: (2024)
von: Fu, Yu-Kuan, et al.
Veröffentlicht: (2024)
Align-SLM: Textless Spoken Language Models with Reinforcement Learning from AI Feedback
von: Lin, Guan-Ting, et al.
Veröffentlicht: (2024)
von: Lin, Guan-Ting, et al.
Veröffentlicht: (2024)
SHANKS: Simultaneous Hearing and Thinking for Spoken Language Models
von: Chiang, Cheng-Han, et al.
Veröffentlicht: (2025)
von: Chiang, Cheng-Han, et al.
Veröffentlicht: (2025)
SAKURA: On the Multi-hop Reasoning of Large Audio-Language Models Based on Speech and Audio Information
von: Yang, Chih-Kai, et al.
Veröffentlicht: (2025)
von: Yang, Chih-Kai, et al.
Veröffentlicht: (2025)
Towards Holistic Evaluation of Large Audio-Language Models: A Comprehensive Survey
von: Yang, Chih-Kai, et al.
Veröffentlicht: (2025)
von: Yang, Chih-Kai, et al.
Veröffentlicht: (2025)
Speech-Copilot: Leveraging Large Language Models for Speech Processing via Task Decomposition, Modularization, and Program Generation
von: Kuan, Chun-Yi, et al.
Veröffentlicht: (2024)
von: Kuan, Chun-Yi, et al.
Veröffentlicht: (2024)
STITCH: Simultaneous Thinking and Talking with Chunked Reasoning for Spoken Language Models
von: Chiang, Cheng-Han, et al.
Veröffentlicht: (2025)
von: Chiang, Cheng-Han, et al.
Veröffentlicht: (2025)
On The Landscape of Spoken Language Models: A Comprehensive Survey
von: Arora, Siddhant, et al.
Veröffentlicht: (2025)
von: Arora, Siddhant, et al.
Veröffentlicht: (2025)
LLM-Enhanced Dialogue Management for Full-Duplex Spoken Dialogue Systems
von: Zhang, Hao, et al.
Veröffentlicht: (2025)
von: Zhang, Hao, et al.
Veröffentlicht: (2025)
J-CHAT: Japanese Large-scale Spoken Dialogue Corpus for Spoken Dialogue Language Modeling
von: Nakata, Wataru, et al.
Veröffentlicht: (2024)
von: Nakata, Wataru, et al.
Veröffentlicht: (2024)
A Preliminary Exploration with GPT-4o Voice Mode
von: Lin, Yu-Xiang, et al.
Veröffentlicht: (2025)
von: Lin, Yu-Xiang, et al.
Veröffentlicht: (2025)
Exploring In-Context Learning of Textless Speech Language Model for Speech Classification Tasks
von: Hsu, Ming-Hao, et al.
Veröffentlicht: (2023)
von: Hsu, Ming-Hao, et al.
Veröffentlicht: (2023)
FlashLabs Chroma 1.0: A Real-Time End-to-End Spoken Dialogue Model with Personalized Voice Cloning
von: Chen, Tanyu, et al.
Veröffentlicht: (2026)
von: Chen, Tanyu, et al.
Veröffentlicht: (2026)
On the Evaluation of Speech Foundation Models for Spoken Language Understanding
von: Arora, Siddhant, et al.
Veröffentlicht: (2024)
von: Arora, Siddhant, et al.
Veröffentlicht: (2024)
ZipVoice-Dialog: Non-Autoregressive Spoken Dialogue Generation with Flow Matching
von: Zhu, Han, et al.
Veröffentlicht: (2025)
von: Zhu, Han, et al.
Veröffentlicht: (2025)
AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models
von: Yang, Chih-Kai, et al.
Veröffentlicht: (2025)
von: Yang, Chih-Kai, et al.
Veröffentlicht: (2025)
SpeechDPR: End-to-End Spoken Passage Retrieval for Open-Domain Spoken Question Answering
von: Lin, Chyi-Jiunn, et al.
Veröffentlicht: (2024)
von: Lin, Chyi-Jiunn, et al.
Veröffentlicht: (2024)
DC-Spin: A Speaker-invariant Speech Tokenizer for Spoken Language Models
von: Chang, Heng-Jui, et al.
Veröffentlicht: (2024)
von: Chang, Heng-Jui, et al.
Veröffentlicht: (2024)
SUTA-LM: Bridging Test-Time Adaptation and Language Model Rescoring for Robust ASR
von: Huang, Wei-Ping, et al.
Veröffentlicht: (2025)
von: Huang, Wei-Ping, et al.
Veröffentlicht: (2025)
Investigating Zero-Shot Generalizability on Mandarin-English Code-Switched ASR and Speech-to-text Translation of Recent Foundation Models with Self-Supervision and Weak Supervision
von: Yang, Chih-Kai, et al.
Veröffentlicht: (2023)
von: Yang, Chih-Kai, et al.
Veröffentlicht: (2023)
Listen and Speak Fairly: A Study on Semantic Gender Bias in Speech Integrated Large Language Models
von: Lin, Yi-Cheng, et al.
Veröffentlicht: (2024)
von: Lin, Yi-Cheng, et al.
Veröffentlicht: (2024)
Towards a Japanese Full-duplex Spoken Dialogue System
von: Ohashi, Atsumoto, et al.
Veröffentlicht: (2025)
von: Ohashi, Atsumoto, et al.
Veröffentlicht: (2025)
Can Large Audio-Language Models Truly Hear? Tackling Hallucinations with Multi-Task Assessment and Stepwise Audio Reasoning
von: Kuan, Chun-Yi, et al.
Veröffentlicht: (2024)
von: Kuan, Chun-Yi, et al.
Veröffentlicht: (2024)
Teaching Audio-Aware Large Language Models What Does Not Hear: Mitigating Hallucinations through Synthesized Negative Samples
von: Kuan, Chun-Yi, et al.
Veröffentlicht: (2025)
von: Kuan, Chun-Yi, et al.
Veröffentlicht: (2025)
ML-SUPERB: Multilingual Speech Universal PERformance Benchmark
von: Shi, Jiatong, et al.
Veröffentlicht: (2023)
von: Shi, Jiatong, et al.
Veröffentlicht: (2023)
Speech-IFEval: Evaluating Instruction-Following and Quantifying Catastrophic Forgetting in Speech-Aware Language Models
von: Lu, Ke-Han, et al.
Veröffentlicht: (2025)
von: Lu, Ke-Han, et al.
Veröffentlicht: (2025)
EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Spoken Dialogue Systems
von: Liu, Jingwen, et al.
Veröffentlicht: (2025)
von: Liu, Jingwen, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Game-Time: Evaluating Temporal Dynamics in Spoken Language Models
von: Chang, Kai-Wei, et al.
Veröffentlicht: (2025) -
Spoken Stereoset: On Evaluating Social Bias Toward Speaker in Speech Large Language Models
von: Lin, Yi-Cheng, et al.
Veröffentlicht: (2024) -
Paralinguistics-Enhanced Large Language Modeling of Spoken Dialogue
von: Lin, Guan-Ting, et al.
Veröffentlicht: (2023) -
Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models
von: Hsiao, Chi-Yuan, et al.
Veröffentlicht: (2025) -
Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities
von: Lin, Guan-Ting, et al.
Veröffentlicht: (2025)