C3LLM: Conditional Multimodal Content Generation Using Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Zixuan, Duan, Qinkai, Tai, Yu-Wing, Tang, Chi-Keung |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Audio-Agent: Leveraging LLMs For Audio Generation, Editing and Composition
di: Wang, Zixuan, et al.
Pubblicazione: (2024)
di: Wang, Zixuan, et al.
Pubblicazione: (2024)
CLaMP 2: Multimodal Music Information Retrieval Across 101 Languages Using Large Language Models
di: Wu, Shangda, et al.
Pubblicazione: (2024)
di: Wu, Shangda, et al.
Pubblicazione: (2024)
Generating Data with Text-to-Speech and Large-Language Models for Conversational Speech Recognition
di: Cornell, Samuele, et al.
Pubblicazione: (2024)
di: Cornell, Samuele, et al.
Pubblicazione: (2024)
SALMONN: Towards Generic Hearing Abilities for Large Language Models
di: Tang, Changli, et al.
Pubblicazione: (2023)
di: Tang, Changli, et al.
Pubblicazione: (2023)
Spontaneous Speech-Based Suicide Risk Detection Using Whisper and Large Language Models
di: Cui, Ziyun, et al.
Pubblicazione: (2024)
di: Cui, Ziyun, et al.
Pubblicazione: (2024)
SpeechGuard: Exploring the Adversarial Robustness of Multimodal Large Language Models
di: Peri, Raghuveer, et al.
Pubblicazione: (2024)
di: Peri, Raghuveer, et al.
Pubblicazione: (2024)
An End-to-End Speech Summarization Using Large Language Model
di: Shang, Hengchao, et al.
Pubblicazione: (2024)
di: Shang, Hengchao, et al.
Pubblicazione: (2024)
How Auditory Knowledge in LLM Backbones Shapes Audio Language Models: A Holistic Evaluation
di: Lu, Ke-Han, et al.
Pubblicazione: (2026)
di: Lu, Ke-Han, et al.
Pubblicazione: (2026)
SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation
di: Lu, Haitian, et al.
Pubblicazione: (2025)
di: Lu, Haitian, et al.
Pubblicazione: (2025)
DeSTA2.5-Audio: Toward General-Purpose Large Audio Language Model with Self-Generated Cross-Modal Alignment
di: Lu, Ke-Han, et al.
Pubblicazione: (2025)
di: Lu, Ke-Han, et al.
Pubblicazione: (2025)
What do MLLMs hear? Examining reasoning with text and sound components in Multimodal Large Language Models
di: Çoban, Enis Berk, et al.
Pubblicazione: (2024)
di: Çoban, Enis Berk, et al.
Pubblicazione: (2024)
Pinyin Regularization in Error Correction for Chinese Speech Recognition with Large Language Models
di: Tang, Zhiyuan, et al.
Pubblicazione: (2024)
di: Tang, Zhiyuan, et al.
Pubblicazione: (2024)
Self-Powered LLM Modality Expansion for Large Speech-Text Models
di: Yu, Tengfei, et al.
Pubblicazione: (2024)
di: Yu, Tengfei, et al.
Pubblicazione: (2024)
Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving
di: Xie, Jingran, et al.
Pubblicazione: (2025)
di: Xie, Jingran, et al.
Pubblicazione: (2025)
Enabling Auditory Large Language Models for Automatic Speech Quality Evaluation
di: Wang, Siyin, et al.
Pubblicazione: (2024)
di: Wang, Siyin, et al.
Pubblicazione: (2024)
Direct Simultaneous Translation Activation for Large Audio-Language Models
di: Zhang, Pei, et al.
Pubblicazione: (2025)
di: Zhang, Pei, et al.
Pubblicazione: (2025)
Fine-Tuning Large Multimodal Models for Automatic Pronunciation Assessment
di: Wang, Ke, et al.
Pubblicazione: (2025)
di: Wang, Ke, et al.
Pubblicazione: (2025)
Large Language Model Should Understand Pinyin for Chinese ASR Error Correction
di: Li, Yuang, et al.
Pubblicazione: (2024)
di: Li, Yuang, et al.
Pubblicazione: (2024)
Assessment of L2 Oral Proficiency using Speech Large Language Models
di: Ma, Rao, et al.
Pubblicazione: (2025)
di: Ma, Rao, et al.
Pubblicazione: (2025)
LESS: Large Language Model Enhanced Semi-Supervised Learning for Speech Foundational Models Using in-the-wild Data
di: Ding, Wen, et al.
Pubblicazione: (2025)
di: Ding, Wen, et al.
Pubblicazione: (2025)
When Large Language Models Meet Speech: A Survey on Integration Approaches
di: Yang, Zhengdong, et al.
Pubblicazione: (2025)
di: Yang, Zhengdong, et al.
Pubblicazione: (2025)
Exploring the Potential of Large Multimodal Models as Effective Alternatives for Pronunciation Assessment
di: Wang, Ke, et al.
Pubblicazione: (2025)
di: Wang, Ke, et al.
Pubblicazione: (2025)
An Empirical Study of Speech Language Models for Prompt-Conditioned Speech Synthesis
di: Peng, Yifan, et al.
Pubblicazione: (2024)
di: Peng, Yifan, et al.
Pubblicazione: (2024)
Cross-Utterance Conditioned VAE for Speech Generation
di: Li, Yang, et al.
Pubblicazione: (2023)
di: Li, Yang, et al.
Pubblicazione: (2023)
SEAL: Speech Embedding Alignment Learning for Speech Large Language Model with Retrieval-Augmented Generation
di: Sun, Chunyu, et al.
Pubblicazione: (2025)
di: Sun, Chunyu, et al.
Pubblicazione: (2025)
ISA-Bench: Benchmarking Instruction Sensitivity for Large Audio Language Models
di: Li, Bohan, et al.
Pubblicazione: (2025)
di: Li, Bohan, et al.
Pubblicazione: (2025)
Generative Pre-trained Speech Language Model with Efficient Hierarchical Transformer
di: Zhu, Yongxin, et al.
Pubblicazione: (2024)
di: Zhu, Yongxin, et al.
Pubblicazione: (2024)
Customizing Speech Recognition Model with Large Language Model Feedback
di: Ling, Shaoshi, et al.
Pubblicazione: (2025)
di: Ling, Shaoshi, et al.
Pubblicazione: (2025)
RE-LLM: Refining Empathetic Speech-LLM Responses by Integrating Emotion Nuance
di: Chen, Jing-Han, et al.
Pubblicazione: (2026)
di: Chen, Jing-Han, et al.
Pubblicazione: (2026)
AzeroS: Extending LLM to Speech with Self-Generated Instruction-Free Tuning
di: Shao, Yiwen, et al.
Pubblicazione: (2025)
di: Shao, Yiwen, et al.
Pubblicazione: (2025)
Speech-Copilot: Leveraging Large Language Models for Speech Processing via Task Decomposition, Modularization, and Program Generation
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2024)
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2024)
Large Language Models for Dysfluency Detection in Stuttered Speech
di: Wagner, Dominik, et al.
Pubblicazione: (2024)
di: Wagner, Dominik, et al.
Pubblicazione: (2024)
ASR Error Correction using Large Language Models
di: Ma, Rao, et al.
Pubblicazione: (2024)
di: Ma, Rao, et al.
Pubblicazione: (2024)
Towards Probing Speech-Specific Risks in Large Multimodal Models: A Taxonomy, Benchmark, and Insights
di: Yang, Hao, et al.
Pubblicazione: (2024)
di: Yang, Hao, et al.
Pubblicazione: (2024)
How Contrastive Decoding Enhances Large Audio Language Models?
di: Lin, Tzu-Quan, et al.
Pubblicazione: (2026)
di: Lin, Tzu-Quan, et al.
Pubblicazione: (2026)
BLSP-Emo: Towards Empathetic Large Speech-Language Models
di: Wang, Chen, et al.
Pubblicazione: (2024)
di: Wang, Chen, et al.
Pubblicazione: (2024)
Closing the Modality Reasoning Gap for Speech Large Language Models
di: Wang, Chaoren, et al.
Pubblicazione: (2026)
di: Wang, Chaoren, et al.
Pubblicazione: (2026)
Spatial Audio Processing with Large Language Model on Wearable Devices
di: Mishra, Ayushi, et al.
Pubblicazione: (2025)
di: Mishra, Ayushi, et al.
Pubblicazione: (2025)
Boosting Large Language Model for Speech Synthesis: An Empirical Study
di: Hao, Hongkun, et al.
Pubblicazione: (2023)
di: Hao, Hongkun, et al.
Pubblicazione: (2023)
Multilingual and Fully Non-Autoregressive ASR with Large Language Model Fusion: A Comprehensive Study
di: Huang, W. Ronny, et al.
Pubblicazione: (2024)
di: Huang, W. Ronny, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Audio-Agent: Leveraging LLMs For Audio Generation, Editing and Composition
di: Wang, Zixuan, et al.
Pubblicazione: (2024) -
CLaMP 2: Multimodal Music Information Retrieval Across 101 Languages Using Large Language Models
di: Wu, Shangda, et al.
Pubblicazione: (2024) -
Generating Data with Text-to-Speech and Large-Language Models for Conversational Speech Recognition
di: Cornell, Samuele, et al.
Pubblicazione: (2024) -
SALMONN: Towards Generic Hearing Abilities for Large Language Models
di: Tang, Changli, et al.
Pubblicazione: (2023) -
Spontaneous Speech-Based Suicide Risk Detection Using Whisper and Large Language Models
di: Cui, Ziyun, et al.
Pubblicazione: (2024)