Advancing Large Language Models to Capture Varied Speaking Styles and Respond Properly in Spoken Conversations
Fuente:
arXiv
Guardado en:
| Autores principales: | Lin, Guan-Ting, Chiang, Cheng-Han, Lee, Hung-yi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SPAR-K: Scheduled Periodic Alternating Early Exit for Spoken Language Models
por: Huang, Hsiao-Ying, et al.
Publicado: (2026)
por: Huang, Hsiao-Ying, et al.
Publicado: (2026)
Audio-Aware Large Language Models as Judges for Speaking Styles
por: Chiang, Cheng-Han, et al.
Publicado: (2025)
por: Chiang, Cheng-Han, et al.
Publicado: (2025)
Spoken Stereoset: On Evaluating Social Bias Toward Speaker in Speech Large Language Models
por: Lin, Yi-Cheng, et al.
Publicado: (2024)
por: Lin, Yi-Cheng, et al.
Publicado: (2024)
Paralinguistics-Enhanced Large Language Modeling of Spoken Dialogue
por: Lin, Guan-Ting, et al.
Publicado: (2023)
por: Lin, Guan-Ting, et al.
Publicado: (2023)
SpeechCaps: Advancing Instruction-Based Universal Speech Models with Multi-Talker Speaking Style Captioning
por: Huang, Chien-yu, et al.
Publicado: (2024)
por: Huang, Chien-yu, et al.
Publicado: (2024)
SHANKS: Simultaneous Hearing and Thinking for Spoken Language Models
por: Chiang, Cheng-Han, et al.
Publicado: (2025)
por: Chiang, Cheng-Han, et al.
Publicado: (2025)
STITCH: Simultaneous Thinking and Talking with Chunked Reasoning for Spoken Language Models
por: Chiang, Cheng-Han, et al.
Publicado: (2025)
por: Chiang, Cheng-Han, et al.
Publicado: (2025)
Align-SLM: Textless Spoken Language Models with Reinforcement Learning from AI Feedback
por: Lin, Guan-Ting, et al.
Publicado: (2024)
por: Lin, Guan-Ting, et al.
Publicado: (2024)
Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding
por: Hsu, Tzu-wen, et al.
Publicado: (2025)
por: Hsu, Tzu-wen, et al.
Publicado: (2025)
Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities
por: Lin, Guan-Ting, et al.
Publicado: (2025)
por: Lin, Guan-Ting, et al.
Publicado: (2025)
TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
por: Tseng, Liang-Hsuan, et al.
Publicado: (2025)
por: Tseng, Liang-Hsuan, et al.
Publicado: (2025)
MI-Fuse: Label Fusion for Unsupervised Domain Adaptation with Closed-Source Large-Audio Language Model
por: Huang, Hsiao-Ying, et al.
Publicado: (2025)
por: Huang, Hsiao-Ying, et al.
Publicado: (2025)
Listen and Speak Fairly: A Study on Semantic Gender Bias in Speech Integrated Large Language Models
por: Lin, Yi-Cheng, et al.
Publicado: (2024)
por: Lin, Yi-Cheng, et al.
Publicado: (2024)
Full-Duplex-Bench-v3: Benchmarking Tool Use for Full-Duplex Voice Agents Under Real-World Disfluency
por: Lin, Guan-Ting, et al.
Publicado: (2026)
por: Lin, Guan-Ting, et al.
Publicado: (2026)
How Contrastive Decoding Enhances Large Audio Language Models?
por: Lin, Tzu-Quan, et al.
Publicado: (2026)
por: Lin, Tzu-Quan, et al.
Publicado: (2026)
Game-Time: Evaluating Temporal Dynamics in Spoken Language Models
por: Chang, Kai-Wei, et al.
Publicado: (2025)
por: Chang, Kai-Wei, et al.
Publicado: (2025)
Towards ASR Robust Spoken Language Understanding Through In-Context Learning With Word Confusion Networks
por: Everson, Kevin, et al.
Publicado: (2024)
por: Everson, Kevin, et al.
Publicado: (2024)
SUTA-LM: Bridging Test-Time Adaptation and Language Model Rescoring for Robust ASR
por: Huang, Wei-Ping, et al.
Publicado: (2025)
por: Huang, Wei-Ping, et al.
Publicado: (2025)
SpeechDPR: End-to-End Spoken Passage Retrieval for Open-Domain Spoken Question Answering
por: Lin, Chyi-Jiunn, et al.
Publicado: (2024)
por: Lin, Chyi-Jiunn, et al.
Publicado: (2024)
Investigating the Effects of Large-Scale Pseudo-Stereo Data and Different Speech Foundation Model on Dialogue Generative Spoken Language Model
por: Fu, Yu-Kuan, et al.
Publicado: (2024)
por: Fu, Yu-Kuan, et al.
Publicado: (2024)
On the Evaluation of Speech Foundation Models for Spoken Language Understanding
por: Arora, Siddhant, et al.
Publicado: (2024)
por: Arora, Siddhant, et al.
Publicado: (2024)
VIBE: Voice-Induced open-ended Bias Evaluation for Large Audio-Language Models via Real-World Speech
por: Lin, Yi-Cheng, et al.
Publicado: (2026)
por: Lin, Yi-Cheng, et al.
Publicado: (2026)
Can Large Audio-Language Models Truly Hear? Tackling Hallucinations with Multi-Task Assessment and Stepwise Audio Reasoning
por: Kuan, Chun-Yi, et al.
Publicado: (2024)
por: Kuan, Chun-Yi, et al.
Publicado: (2024)
Teaching Audio-Aware Large Language Models What Does Not Hear: Mitigating Hallucinations through Synthesized Negative Samples
por: Kuan, Chun-Yi, et al.
Publicado: (2025)
por: Kuan, Chun-Yi, et al.
Publicado: (2025)
Speech-IFEval: Evaluating Instruction-Following and Quantifying Catastrophic Forgetting in Speech-Aware Language Models
por: Lu, Ke-Han, et al.
Publicado: (2025)
por: Lu, Ke-Han, et al.
Publicado: (2025)
SAKURA: On the Multi-hop Reasoning of Large Audio-Language Models Based on Speech and Audio Information
por: Yang, Chih-Kai, et al.
Publicado: (2025)
por: Yang, Chih-Kai, et al.
Publicado: (2025)
UltraVoice: Scaling Fine-Grained Style-Controlled Speech Conversations for Spoken Dialogue Models
por: Tu, Wenming, et al.
Publicado: (2025)
por: Tu, Wenming, et al.
Publicado: (2025)
Zero Resource Code-switched Speech Benchmark Using Speech Utterance Pairs For Multiple Spoken Languages
por: Huang, Kuan-Po, et al.
Publicado: (2023)
por: Huang, Kuan-Po, et al.
Publicado: (2023)
TiCo: Time-Controllable Spoken Dialogue Model
por: Chang, Kai-Wei, et al.
Publicado: (2026)
por: Chang, Kai-Wei, et al.
Publicado: (2026)
DeSTA: Enhancing Speech Language Models through Descriptive Speech-Text Alignment
por: Lu, Ke-Han, et al.
Publicado: (2024)
por: Lu, Ke-Han, et al.
Publicado: (2024)
Finetuning End-to-End Models for Estonian Conversational Spoken Language Translation
por: Sildam, Tiia, et al.
Publicado: (2024)
por: Sildam, Tiia, et al.
Publicado: (2024)
Improving Speech Emotion Recognition in Under-Resourced Languages via Speech-to-Speech Translation with Bootstrapping Data Selection
por: Lin, Hsi-Che, et al.
Publicado: (2024)
por: Lin, Hsi-Che, et al.
Publicado: (2024)
Enhancing Multilingual ASR for Unseen Languages via Language Embedding Modeling
por: Huang, Shao-Syuan, et al.
Publicado: (2024)
por: Huang, Shao-Syuan, et al.
Publicado: (2024)
Mitigating Subgroup Disparities in Multi-Label Speech Emotion Recognition: A Pseudo-Labeling and Unsupervised Learning Approach
por: Lin, Yi-Cheng, et al.
Publicado: (2025)
por: Lin, Yi-Cheng, et al.
Publicado: (2025)
Multi-Distillation from Speech and Music Representation Models
por: Wei, Jui-Chiang, et al.
Publicado: (2025)
por: Wei, Jui-Chiang, et al.
Publicado: (2025)
ASPIRin: Action Space Projection for Interactivity-Optimized Reinforcement Learning in Full-Duplex Speech Language Models
por: Hsiao, Chi-Yuan, et al.
Publicado: (2026)
por: Hsiao, Chi-Yuan, et al.
Publicado: (2026)
Building a Taiwanese Mandarin Spoken Language Model: A First Attempt
por: Yang, Chih-Kai, et al.
Publicado: (2024)
por: Yang, Chih-Kai, et al.
Publicado: (2024)
CO-VADA: A Confidence-Oriented Voice Augmentation Debiasing Approach for Fair Speech Emotion Recognition
por: Tsai, Yun-Shao, et al.
Publicado: (2025)
por: Tsai, Yun-Shao, et al.
Publicado: (2025)
SMILE: Speech Meta In-Context Learning for Low-Resource Language Automatic Speech Recognition
por: Hsu, Ming-Hao, et al.
Publicado: (2024)
por: Hsu, Ming-Hao, et al.
Publicado: (2024)
Property Neurons in Self-Supervised Speech Transformers
por: Lin, Tzu-Quan, et al.
Publicado: (2024)
por: Lin, Tzu-Quan, et al.
Publicado: (2024)
Ejemplares similares
-
SPAR-K: Scheduled Periodic Alternating Early Exit for Spoken Language Models
por: Huang, Hsiao-Ying, et al.
Publicado: (2026) -
Audio-Aware Large Language Models as Judges for Speaking Styles
por: Chiang, Cheng-Han, et al.
Publicado: (2025) -
Spoken Stereoset: On Evaluating Social Bias Toward Speaker in Speech Large Language Models
por: Lin, Yi-Cheng, et al.
Publicado: (2024) -
Paralinguistics-Enhanced Large Language Modeling of Spoken Dialogue
por: Lin, Guan-Ting, et al.
Publicado: (2023) -
SpeechCaps: Advancing Instruction-Based Universal Speech Models with Multi-Talker Speaking Style Captioning
por: Huang, Chien-yu, et al.
Publicado: (2024)