S2Cap: A Benchmark and a Baseline for Singing Style Captioning
Fuente:
arXiv
Salvato in:
| Autori principali: | Ok, Hyunjong, Lee, Jaeho |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Imagine to Hear: Auditory Knowledge Generation can be an Effective Assistant for Language Models
di: Yoo, Suho, et al.
Pubblicazione: (2025)
di: Yoo, Suho, et al.
Pubblicazione: (2025)
Speculative End-Turn Detector for Efficient Speech Chatbot Assistant
di: Ok, Hyunjong, et al.
Pubblicazione: (2025)
di: Ok, Hyunjong, et al.
Pubblicazione: (2025)
AudioBERT: Audio Knowledge Augmented Language Model
di: Ok, Hyunjong, et al.
Pubblicazione: (2024)
di: Ok, Hyunjong, et al.
Pubblicazione: (2024)
CapSpeech: Enabling Downstream Applications in Style-Captioned Text-to-Speech
di: Wang, Helin, et al.
Pubblicazione: (2025)
di: Wang, Helin, et al.
Pubblicazione: (2025)
LibriTTS-P: A Corpus with Speaking Style and Speaker Identity Prompts for Text-to-Speech and Style Captioning
di: Kawamura, Masaya, et al.
Pubblicazione: (2024)
di: Kawamura, Masaya, et al.
Pubblicazione: (2024)
Scaling Rich Style-Prompted Text-to-Speech Datasets
di: Diwan, Anuj, et al.
Pubblicazione: (2025)
di: Diwan, Anuj, et al.
Pubblicazione: (2025)
Large Language Model Based Generative Error Correction: A Challenge and Baselines for Speech Recognition, Speaker Tagging, and Emotion Recognition
di: Yang, Chao-Han Huck, et al.
Pubblicazione: (2024)
di: Yang, Chao-Han Huck, et al.
Pubblicazione: (2024)
VStyle: A Benchmark for Voice Style Adaptation with Spoken Instructions
di: Zhan, Jun, et al.
Pubblicazione: (2025)
di: Zhan, Jun, et al.
Pubblicazione: (2025)
Benchmarking and Confidence Evaluation of LALMs For Temporal Reasoning
di: Bhattacharya, Debarpan, et al.
Pubblicazione: (2025)
di: Bhattacharya, Debarpan, et al.
Pubblicazione: (2025)
Sing it, Narrate it: Quality Musical Lyrics Translation
di: Ye, Zhuorui, et al.
Pubblicazione: (2024)
di: Ye, Zhuorui, et al.
Pubblicazione: (2024)
XMAD-Bench: Cross-Domain Multilingual Audio Deepfake Benchmark
di: Ciobanu, Ioan-Paul, et al.
Pubblicazione: (2025)
di: Ciobanu, Ioan-Paul, et al.
Pubblicazione: (2025)
CSyMR: Benchmarking Compositional Music Information Retrieval in Symbolic Music Reasoning
di: Wang, Boyang, et al.
Pubblicazione: (2025)
di: Wang, Boyang, et al.
Pubblicazione: (2025)
StyleSinger: Style Transfer for Out-of-Domain Singing Voice Synthesis
di: Zhang, Yu, et al.
Pubblicazione: (2023)
di: Zhang, Yu, et al.
Pubblicazione: (2023)
An Investigation Into Explainable Audio Hate Speech Detection
di: An, Jinmyeong, et al.
Pubblicazione: (2024)
di: An, Jinmyeong, et al.
Pubblicazione: (2024)
Text2midi: Generating Symbolic Music from Captions
di: Bhandari, Keshav, et al.
Pubblicazione: (2024)
di: Bhandari, Keshav, et al.
Pubblicazione: (2024)
SingMOS-Pro: An Comprehensive Benchmark for Singing Quality Assessment
di: Tang, Yuxun, et al.
Pubblicazione: (2025)
di: Tang, Yuxun, et al.
Pubblicazione: (2025)
Improving Text-To-Audio Models with Synthetic Captions
di: Kong, Zhifeng, et al.
Pubblicazione: (2024)
di: Kong, Zhifeng, et al.
Pubblicazione: (2024)
CoMoSVC: Consistency Model-based Singing Voice Conversion
di: Lu, Yiwen, et al.
Pubblicazione: (2024)
di: Lu, Yiwen, et al.
Pubblicazione: (2024)
Prompt-Singer: Controllable Singing-Voice-Synthesis with Natural Language Prompt
di: Wang, Yongqi, et al.
Pubblicazione: (2024)
di: Wang, Yongqi, et al.
Pubblicazione: (2024)
RECAP: Retrieval-Augmented Audio Captioning
di: Ghosh, Sreyan, et al.
Pubblicazione: (2023)
di: Ghosh, Sreyan, et al.
Pubblicazione: (2023)
Classifier-Guided Captioning Across Modalities
di: Shaulov, Ariel, et al.
Pubblicazione: (2025)
di: Shaulov, Ariel, et al.
Pubblicazione: (2025)
AQUA-Bench: Beyond Finding Answers to Knowing When There Are None in Audio Question Answering
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2026)
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2026)
From Alignment to Advancement: Bootstrapping Audio-Language Alignment with Synthetic Data
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2025)
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2025)
Facing the Music: Tackling Singing Voice Separation in Cinematic Audio Source Separation
di: Watcharasupat, Karn N., et al.
Pubblicazione: (2024)
di: Watcharasupat, Karn N., et al.
Pubblicazione: (2024)
Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2026)
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2026)
AQAScore: Evaluating Semantic Alignment in Text-to-Audio Generation via Audio Question Answering
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2026)
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2026)
DiTTo-TTS: Diffusion Transformers for Scalable Text-to-Speech without Domain-Specific Factors
di: Lee, Keon, et al.
Pubblicazione: (2024)
di: Lee, Keon, et al.
Pubblicazione: (2024)
Diffusion-Link: Diffusion Probabilistic Model for Bridging the Audio-Text Modality Gap
di: Nam, KiHyun, et al.
Pubblicazione: (2025)
di: Nam, KiHyun, et al.
Pubblicazione: (2025)
Task Arithmetic can Mitigate Synthetic-to-Real Gap in Automatic Speech Recognition
di: Su, Hsuan, et al.
Pubblicazione: (2024)
di: Su, Hsuan, et al.
Pubblicazione: (2024)
Factor-Conditioned Speaking-Style Captioning
di: Ando, Atsushi, et al.
Pubblicazione: (2024)
di: Ando, Atsushi, et al.
Pubblicazione: (2024)
Evaluating the Effectiveness of Transformer Layers in Wav2Vec 2.0, XLS-R, and Whisper for Speaker Identification Tasks
di: Stuhlmann, Linus, et al.
Pubblicazione: (2025)
di: Stuhlmann, Linus, et al.
Pubblicazione: (2025)
TCSinger: Zero-Shot Singing Voice Synthesis with Style Transfer and Multi-Level Style Control
di: Zhang, Yu, et al.
Pubblicazione: (2024)
di: Zhang, Yu, et al.
Pubblicazione: (2024)
AlignCap: Aligning Speech Emotion Captioning to Human Preferences
di: Liang, Ziqi, et al.
Pubblicazione: (2024)
di: Liang, Ziqi, et al.
Pubblicazione: (2024)
Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models
di: Hsiao, Chi-Yuan, et al.
Pubblicazione: (2025)
di: Hsiao, Chi-Yuan, et al.
Pubblicazione: (2025)
DiffStyleTTS: Diffusion-based Hierarchical Prosody Modeling for Text-to-Speech with Diverse and Controllable Styles
di: Liu, Jiaxuan, et al.
Pubblicazione: (2024)
di: Liu, Jiaxuan, et al.
Pubblicazione: (2024)
Slamming: Training a Speech Language Model on One GPU in a Day
di: Maimon, Gallil, et al.
Pubblicazione: (2025)
di: Maimon, Gallil, et al.
Pubblicazione: (2025)
Foundation Models for Music: A Survey
di: Ma, Yinghao, et al.
Pubblicazione: (2024)
di: Ma, Yinghao, et al.
Pubblicazione: (2024)
A Literature Review of Keyword Spotting Technologies for Urdu
di: Rizvi, Syed Muhammad Aqdas
Pubblicazione: (2024)
di: Rizvi, Syed Muhammad Aqdas
Pubblicazione: (2024)
Moshi: a speech-text foundation model for real-time dialogue
di: Défossez, Alexandre, et al.
Pubblicazione: (2024)
di: Défossez, Alexandre, et al.
Pubblicazione: (2024)
Whisper-GPT: A Hybrid Representation Audio Large Language Model
di: Verma, Prateek
Pubblicazione: (2024)
di: Verma, Prateek
Pubblicazione: (2024)
Documenti analoghi
-
Imagine to Hear: Auditory Knowledge Generation can be an Effective Assistant for Language Models
di: Yoo, Suho, et al.
Pubblicazione: (2025) -
Speculative End-Turn Detector for Efficient Speech Chatbot Assistant
di: Ok, Hyunjong, et al.
Pubblicazione: (2025) -
AudioBERT: Audio Knowledge Augmented Language Model
di: Ok, Hyunjong, et al.
Pubblicazione: (2024) -
CapSpeech: Enabling Downstream Applications in Style-Captioned Text-to-Speech
di: Wang, Helin, et al.
Pubblicazione: (2025) -
LibriTTS-P: A Corpus with Speaking Style and Speaker Identity Prompts for Text-to-Speech and Style Captioning
di: Kawamura, Masaya, et al.
Pubblicazione: (2024)