Guardado en:
| Autores principales: | Mai, Long, Carson-Berndsen, Julie |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2501.04877 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Leveraging Unit Language Guidance to Advance Speech Modeling in Textless Speech-to-Speech Translation
por: Zhang, Yuhao, et al.
Publicado: (2025)
por: Zhang, Yuhao, et al.
Publicado: (2025)
Textless NLP -- Zero Resource Challenge with Low Resource Compute
por: Ramadass, Krithiga, et al.
Publicado: (2024)
por: Ramadass, Krithiga, et al.
Publicado: (2024)
CTC-based Non-autoregressive Textless Speech-to-Speech Translation
por: Fang, Qingkai, et al.
Publicado: (2024)
por: Fang, Qingkai, et al.
Publicado: (2024)
Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM
por: Wang, Xiong, et al.
Publicado: (2024)
por: Wang, Xiong, et al.
Publicado: (2024)
How "Real" is Your Real-Time Simultaneous Speech-to-Text Translation System?
por: Papi, Sara, et al.
Publicado: (2024)
por: Papi, Sara, et al.
Publicado: (2024)
NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction
por: Wang, Qichao, et al.
Publicado: (2025)
por: Wang, Qichao, et al.
Publicado: (2025)
An LLM Benchmark for Addressee Recognition in Multi-modal Multi-party Dialogue
por: Inoue, Koji, et al.
Publicado: (2025)
por: Inoue, Koji, et al.
Publicado: (2025)
Enhancing Dialogue Annotation with Speaker Characteristics Leveraging a Frozen LLM
por: Thebaud, Thomas, et al.
Publicado: (2025)
por: Thebaud, Thomas, et al.
Publicado: (2025)
Benchmarking Open-ended Audio Dialogue Understanding for Large Audio-Language Models
por: Gao, Kuofeng, et al.
Publicado: (2024)
por: Gao, Kuofeng, et al.
Publicado: (2024)
Toward Conversational Hungarian Speech Recognition: Introducing the BEA-Large and BEA-Dialogue Datasets
por: Gedeon, Máté, et al.
Publicado: (2025)
por: Gedeon, Máté, et al.
Publicado: (2025)
Talk With Human-like Agents: Empathetic Dialogue Through Perceptible Acoustic Reception and Reaction
por: Yan, Haoqiu, et al.
Publicado: (2024)
por: Yan, Haoqiu, et al.
Publicado: (2024)
Dub-S2ST: Textless Speech-to-Speech Translation for Seamless Dubbing
por: Choi, Jeongsoo, et al.
Publicado: (2025)
por: Choi, Jeongsoo, et al.
Publicado: (2025)
Speech ReaLLM -- Real-time Streaming Speech Recognition with Multimodal LLMs by Teaching the Flow of Time
por: Seide, Frank, et al.
Publicado: (2024)
por: Seide, Frank, et al.
Publicado: (2024)
MULTI-Bench: A Multi-Turn Interactive Benchmark for Assessing Emotional Intelligence ability of Spoken Dialogue Models
por: Deng, Yayue, et al.
Publicado: (2025)
por: Deng, Yayue, et al.
Publicado: (2025)
Using LLM for Real-Time Transcription and Summarization of Doctor-Patient Interactions into ePuskesmas in Indonesia: A Proof-of-Concept Study
por: Khatim, Nur Ahmad, et al.
Publicado: (2024)
por: Khatim, Nur Ahmad, et al.
Publicado: (2024)
Textless Acoustic Model with Self-Supervised Distillation for Noise-Robust Expressive Speech-to-Speech Translation
por: Hwang, Min-Jae, et al.
Publicado: (2024)
por: Hwang, Min-Jae, et al.
Publicado: (2024)
ControlAudio: Tackling Text-Guided, Timing-Indicated and Intelligible Audio Generation via Progressive Diffusion Modeling
por: Jiang, Yuxuan, et al.
Publicado: (2025)
por: Jiang, Yuxuan, et al.
Publicado: (2025)
PSLM: Parallel Generation of Text and Speech with LLMs for Low-Latency Spoken Dialogue Systems
por: Mitsui, Kentaro, et al.
Publicado: (2024)
por: Mitsui, Kentaro, et al.
Publicado: (2024)
Dialogue in Resonance: An Interactive Music Piece for Piano and Real-Time Automatic Transcription System
por: Bang, Hayeon, et al.
Publicado: (2025)
por: Bang, Hayeon, et al.
Publicado: (2025)
LLaMA-Omni2: LLM-based Real-time Spoken Chatbot with Autoregressive Streaming Speech Synthesis
por: Fang, Qingkai, et al.
Publicado: (2025)
por: Fang, Qingkai, et al.
Publicado: (2025)
MSLM-S2ST: A Multitask Speech Language Model for Textless Speech-to-Speech Translation with Speaker Style Preservation
por: Peng, Yifan, et al.
Publicado: (2024)
por: Peng, Yifan, et al.
Publicado: (2024)
SUTA-LM: Bridging Test-Time Adaptation and Language Model Rescoring for Robust ASR
por: Huang, Wei-Ping, et al.
Publicado: (2025)
por: Huang, Wei-Ping, et al.
Publicado: (2025)
Analyzing Speech Unit Selection for Textless Speech-to-Speech Translation
por: Duret, Jarod, et al.
Publicado: (2024)
por: Duret, Jarod, et al.
Publicado: (2024)
Real-time Speech Summarization for Medical Conversations
por: Le-Duc, Khai, et al.
Publicado: (2024)
por: Le-Duc, Khai, et al.
Publicado: (2024)
Bob's Confetti: Phonetic Memorization Attacks in Music and Video Generation
por: Roh, Jaechul, et al.
Publicado: (2025)
por: Roh, Jaechul, et al.
Publicado: (2025)
Text2midi: Generating Symbolic Music from Captions
por: Bhandari, Keshav, et al.
Publicado: (2024)
por: Bhandari, Keshav, et al.
Publicado: (2024)
Frame-Stacked Local Transformers For Efficient Multi-Codebook Speech Generation
por: Fejgin, Roy, et al.
Publicado: (2025)
por: Fejgin, Roy, et al.
Publicado: (2025)
Controlling Surprisal in Music Generation via Information Content Curve Matching
por: Bjare, Mathias Rose, et al.
Publicado: (2024)
por: Bjare, Mathias Rose, et al.
Publicado: (2024)
FLEURS-R: A Restored Multilingual Speech Corpus for Generation Tasks
por: Ma, Min, et al.
Publicado: (2024)
por: Ma, Min, et al.
Publicado: (2024)
Kling-Foley: Multimodal Diffusion Transformer for High-Quality Video-to-Audio Generation
por: Wang, Jun, et al.
Publicado: (2025)
por: Wang, Jun, et al.
Publicado: (2025)
Auffusion: Leveraging the Power of Diffusion and Large Language Models for Text-to-Audio Generation
por: Xue, Jinlong, et al.
Publicado: (2024)
por: Xue, Jinlong, et al.
Publicado: (2024)
Channel-Aware Domain-Adaptive Generative Adversarial Network for Robust Speech Recognition
por: Wang, Chien-Chun, et al.
Publicado: (2024)
por: Wang, Chien-Chun, et al.
Publicado: (2024)
VocalNet: Speech LLM with Multi-Token Prediction for Faster and High-Quality Generation
por: Wang, Yuhao, et al.
Publicado: (2025)
por: Wang, Yuhao, et al.
Publicado: (2025)
Ming-UniAudio: Speech LLM for Joint Understanding, Generation and Editing with Unified Representation
por: Yan, Canxiang, et al.
Publicado: (2025)
por: Yan, Canxiang, et al.
Publicado: (2025)
KidSpeak: A General Multi-purpose LLM for Kids' Speech Recognition and Screening
por: Sharma, Rohan, et al.
Publicado: (2025)
por: Sharma, Rohan, et al.
Publicado: (2025)
SongComposer: A Large Language Model for Lyric and Melody Generation in Song Composition
por: Ding, Shuangrui, et al.
Publicado: (2024)
por: Ding, Shuangrui, et al.
Publicado: (2024)
A Non-autoregressive Generation Framework for End-to-End Simultaneous Speech-to-Speech Translation
por: Ma, Zhengrui, et al.
Publicado: (2024)
por: Ma, Zhengrui, et al.
Publicado: (2024)
Optimizing the Songwriting Process: Genre-Based Lyric Generation Using Deep Learning Models
por: Cai, Tracy, et al.
Publicado: (2024)
por: Cai, Tracy, et al.
Publicado: (2024)
SALMONN-omni: A Codec-free LLM for Full-duplex Speech Understanding and Generation
por: Yu, Wenyi, et al.
Publicado: (2024)
por: Yu, Wenyi, et al.
Publicado: (2024)
LLaSE-G1: Incentivizing Generalization Capability for LLaMA-based Speech Enhancement
por: Kang, Boyi, et al.
Publicado: (2025)
por: Kang, Boyi, et al.
Publicado: (2025)
Ejemplares similares
-
Leveraging Unit Language Guidance to Advance Speech Modeling in Textless Speech-to-Speech Translation
por: Zhang, Yuhao, et al.
Publicado: (2025) -
Textless NLP -- Zero Resource Challenge with Low Resource Compute
por: Ramadass, Krithiga, et al.
Publicado: (2024) -
CTC-based Non-autoregressive Textless Speech-to-Speech Translation
por: Fang, Qingkai, et al.
Publicado: (2024) -
Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM
por: Wang, Xiong, et al.
Publicado: (2024) -
How "Real" is Your Real-Time Simultaneous Speech-to-Text Translation System?
por: Papi, Sara, et al.
Publicado: (2024)