Pheme: Efficient and Conversational Speech Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Budzianowski, Paweł, Sereda, Taras, Cichy, Tomasz, Vulić, Ivan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Transcribe, Align and Segment: Creating speech datasets for low-resource languages
por: Sereda, Taras
Publicado: (2024)
por: Sereda, Taras
Publicado: (2024)
Conversational Speech Reveals Structural Robustness Failures in SpeechLLM Backbones
por: Teleki, Maria, et al.
Publicado: (2025)
por: Teleki, Maria, et al.
Publicado: (2025)
KAME: Tandem Architecture for Enhancing Knowledge in Real-Time Speech-to-Speech Conversational AI
por: Kuroki, So, et al.
Publicado: (2025)
por: Kuroki, So, et al.
Publicado: (2025)
StutterZero and StutterFormer: End-to-End Speech Conversion for Stuttering Transcription and Correction
por: Xu, Qianheng
Publicado: (2025)
por: Xu, Qianheng
Publicado: (2025)
A Unified Speech LLM for Diarization and Speech Recognition in Multilingual Conversations
por: Saengthong, Phurich, et al.
Publicado: (2025)
por: Saengthong, Phurich, et al.
Publicado: (2025)
Speech Retrieval-Augmented Generation without Automatic Speech Recognition
por: Min, Do June, et al.
Publicado: (2024)
por: Min, Do June, et al.
Publicado: (2024)
Dual Information Speech Language Models for Emotional Conversations
por: Wang, Chun, et al.
Publicado: (2025)
por: Wang, Chun, et al.
Publicado: (2025)
COSMIC: Data Efficient Instruction-tuning For Speech In-Context Learning
por: Pan, Jing, et al.
Publicado: (2023)
por: Pan, Jing, et al.
Publicado: (2023)
MTR-DuplexBench: Towards a Comprehensive Evaluation of Multi-Round Conversations for Full-Duplex Speech Language Models
por: Zhang, He, et al.
Publicado: (2025)
por: Zhang, He, et al.
Publicado: (2025)
What Makes a Good Speech Tokenizer for LLM-Centric Speech Generation? A Systematic Study
por: Fan, Xiaoran, et al.
Publicado: (2025)
por: Fan, Xiaoran, et al.
Publicado: (2025)
Frame-Stacked Local Transformers For Efficient Multi-Codebook Speech Generation
por: Fejgin, Roy, et al.
Publicado: (2025)
por: Fejgin, Roy, et al.
Publicado: (2025)
FastAdaSP: Multitask-Adapted Efficient Inference for Large Speech Language Model
por: Lu, Yichen, et al.
Publicado: (2024)
por: Lu, Yichen, et al.
Publicado: (2024)
Efficient Streaming LLM for Speech Recognition
por: Jia, Junteng, et al.
Publicado: (2024)
por: Jia, Junteng, et al.
Publicado: (2024)
Phonology-Guided Speech-to-Speech Translation for African Languages
por: Ochieng, Peter, et al.
Publicado: (2024)
por: Ochieng, Peter, et al.
Publicado: (2024)
Streaming Speech-to-Text Translation with a SpeechLLM
por: Parcollet, Titouan, et al.
Publicado: (2026)
por: Parcollet, Titouan, et al.
Publicado: (2026)
Device-Directed Speech Detection for Follow-up Conversations Using Large Language Models
por: Ognjen, et al.
Publicado: (2024)
por: Ognjen, et al.
Publicado: (2024)
Toward Conversational Hungarian Speech Recognition: Introducing the BEA-Large and BEA-Dialogue Datasets
por: Gedeon, Máté, et al.
Publicado: (2025)
por: Gedeon, Máté, et al.
Publicado: (2025)
LipGER: Visually-Conditioned Generative Error Correction for Robust Automatic Speech Recognition
por: Ghosh, Sreyan, et al.
Publicado: (2024)
por: Ghosh, Sreyan, et al.
Publicado: (2024)
Efficient Compression of Multitask Multilingual Speech Models
por: Ferraz, Thomas Palmeira
Publicado: (2024)
por: Ferraz, Thomas Palmeira
Publicado: (2024)
WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling
por: Yang, Guanrou, et al.
Publicado: (2026)
por: Yang, Guanrou, et al.
Publicado: (2026)
TacoLM: GaTed Attention Equipped Codec Language Model are Efficient Zero-Shot Text to Speech Synthesizers
por: Song, Yakun, et al.
Publicado: (2024)
por: Song, Yakun, et al.
Publicado: (2024)
Exploring In-Context Learning of Textless Speech Language Model for Speech Classification Tasks
por: Hsu, Ming-Hao, et al.
Publicado: (2023)
por: Hsu, Ming-Hao, et al.
Publicado: (2023)
MERaLiON-SpeechEncoder: Towards a Speech Foundation Model for Singapore and Beyond
por: Huzaifah, Muhammad, et al.
Publicado: (2024)
por: Huzaifah, Muhammad, et al.
Publicado: (2024)
SimulU: Training-free Policy for Long-form Simultaneous Speech-to-Speech Translation
por: Djanibekov, Amirbek, et al.
Publicado: (2026)
por: Djanibekov, Amirbek, et al.
Publicado: (2026)
Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation
por: Wang, Qiongqiong, et al.
Publicado: (2025)
por: Wang, Qiongqiong, et al.
Publicado: (2025)
Greek2MathTex: A Greek Speech-to-Text Framework for LaTeX Equations Generation
por: Gkritzali, Evangelia, et al.
Publicado: (2024)
por: Gkritzali, Evangelia, et al.
Publicado: (2024)
A Non-autoregressive Generation Framework for End-to-End Simultaneous Speech-to-Speech Translation
por: Ma, Zhengrui, et al.
Publicado: (2024)
por: Ma, Zhengrui, et al.
Publicado: (2024)
PolySpeech-100: A Large-Scale Benchmark for Speech Understanding Across 100+ Languages and Dialects
por: Yang, Sicheng, et al.
Publicado: (2026)
por: Yang, Sicheng, et al.
Publicado: (2026)
Style-Talker: Finetuning Audio Language Model and Style-Based Text-to-Speech Model for Fast Spoken Dialogue Generation
por: Li, Yinghao Aaron, et al.
Publicado: (2024)
por: Li, Yinghao Aaron, et al.
Publicado: (2024)
Handling Numeric Expressions in Automatic Speech Recognition
por: Huber, Christian, et al.
Publicado: (2024)
por: Huber, Christian, et al.
Publicado: (2024)
Can Speech LLMs Think while Listening?
por: Shih, Yi-Jen, et al.
Publicado: (2025)
por: Shih, Yi-Jen, et al.
Publicado: (2025)
MultiGen: Child-Friendly Multilingual Speech Generator with LLMs
por: Gao, Xiaoxue, et al.
Publicado: (2025)
por: Gao, Xiaoxue, et al.
Publicado: (2025)
Linear-Complexity Self-Supervised Learning for Speech Processing
por: Zhang, Shucong, et al.
Publicado: (2024)
por: Zhang, Shucong, et al.
Publicado: (2024)
Benchmarking Rotary Position Embeddings for Automatic Speech Recognition
por: Zhang, Shucong, et al.
Publicado: (2025)
por: Zhang, Shucong, et al.
Publicado: (2025)
HARNESS: Lightweight Distilled Arabic Speech Foundation Models
por: Sukhadia, Vrunda N., et al.
Publicado: (2026)
por: Sukhadia, Vrunda N., et al.
Publicado: (2026)
Closing the Gap Between Text and Speech Understanding in LLMs
por: Cuervo, Santiago, et al.
Publicado: (2025)
por: Cuervo, Santiago, et al.
Publicado: (2025)
Unifying Model and Layer Fusion for Speech Foundation Models
por: Shih, Yi-Jen, et al.
Publicado: (2025)
por: Shih, Yi-Jen, et al.
Publicado: (2025)
ARTI-6: Towards Six-dimensional Articulatory Speech Encoding
por: Lee, Jihwan, et al.
Publicado: (2025)
por: Lee, Jihwan, et al.
Publicado: (2025)
Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models
por: Wang, Qiongqiong, et al.
Publicado: (2025)
por: Wang, Qiongqiong, et al.
Publicado: (2025)
Towards Robust Speech Recognition for Jamaican Patois Music Transcription
por: Madden, Jordan, et al.
Publicado: (2025)
por: Madden, Jordan, et al.
Publicado: (2025)
Ejemplares similares
-
Transcribe, Align and Segment: Creating speech datasets for low-resource languages
por: Sereda, Taras
Publicado: (2024) -
Conversational Speech Reveals Structural Robustness Failures in SpeechLLM Backbones
por: Teleki, Maria, et al.
Publicado: (2025) -
KAME: Tandem Architecture for Enhancing Knowledge in Real-Time Speech-to-Speech Conversational AI
por: Kuroki, So, et al.
Publicado: (2025) -
StutterZero and StutterFormer: End-to-End Speech Conversion for Stuttering Transcription and Correction
por: Xu, Qianheng
Publicado: (2025) -
A Unified Speech LLM for Diarization and Speech Recognition in Multilingual Conversations
por: Saengthong, Phurich, et al.
Publicado: (2025)