K-pop Lyric Translation: Dataset, Analysis, and Neural-Modelling
Fuente:
arXiv
Salvato in:
| Autori principali: | Kim, Haven, Jung, Jongmin, Jeong, Dasaem, Nam, Juhan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
On the de-duplication of the Lakh MIDI dataset
di: Choi, Eunjin, et al.
Pubblicazione: (2025)
di: Choi, Eunjin, et al.
Pubblicazione: (2025)
LAV: Audio-Driven Dynamic Visual Generation with Neural Compression and StyleGAN2
di: Jung, Jongmin, et al.
Pubblicazione: (2025)
di: Jung, Jongmin, et al.
Pubblicazione: (2025)
Automatic Time Signature Determination for New Scores Using Lyrics for Latent Rhythmic Structure
di: Liao, Callie C., et al.
Pubblicazione: (2023)
di: Liao, Callie C., et al.
Pubblicazione: (2023)
Self-Comparison for Dataset-Level Membership Inference in Large (Vision-)Language Models
di: Ren, Jie, et al.
Pubblicazione: (2024)
di: Ren, Jie, et al.
Pubblicazione: (2024)
Towards Efficient and Real-Time Piano Transcription Using Neural Autoregressive Models
di: Kwon, Taegyun, et al.
Pubblicazione: (2024)
di: Kwon, Taegyun, et al.
Pubblicazione: (2024)
Training Data Efficiency in Multimodal Process Reward Models
di: Li, Jinyuan, et al.
Pubblicazione: (2026)
di: Li, Jinyuan, et al.
Pubblicazione: (2026)
KMMMU: Evaluation of Massive Multi-discipline Multimodal Understanding in Korean Language and Context
di: Lee, Nahyun, et al.
Pubblicazione: (2026)
di: Lee, Nahyun, et al.
Pubblicazione: (2026)
ChemDFM-X: Towards Large Multimodal Model for Chemistry
di: Zhao, Zihan, et al.
Pubblicazione: (2024)
di: Zhao, Zihan, et al.
Pubblicazione: (2024)
Multimodal Large Language Models for Medicine: A Comprehensive Survey
di: Ye, Jiarui, et al.
Pubblicazione: (2025)
di: Ye, Jiarui, et al.
Pubblicazione: (2025)
Enriching Music Descriptions with a Finetuned-LLM and Metadata for Text-to-Music Retrieval
di: Doh, SeungHeon, et al.
Pubblicazione: (2024)
di: Doh, SeungHeon, et al.
Pubblicazione: (2024)
Video-Foley: Two-Stage Video-To-Sound Generation via Temporal Event Condition For Foley Sound
di: Lee, Junwon, et al.
Pubblicazione: (2024)
di: Lee, Junwon, et al.
Pubblicazione: (2024)
MUDI: A Multimodal Biomedical Dataset for Understanding Pharmacodynamic Drug-Drug Interactions
di: Ngo, Tung-Lam, et al.
Pubblicazione: (2025)
di: Ngo, Tung-Lam, et al.
Pubblicazione: (2025)
Emotion Collider: Dual Hyperbolic Mirror Manifolds for Sentiment Recovery via Anti Emotion Reflection
di: Fu, Rong, et al.
Pubblicazione: (2026)
di: Fu, Rong, et al.
Pubblicazione: (2026)
MemeCLIP: Leveraging CLIP Representations for Multimodal Meme Classification
di: Shah, Siddhant Bikram, et al.
Pubblicazione: (2024)
di: Shah, Siddhant Bikram, et al.
Pubblicazione: (2024)
Where Do We Go from Here? Multi-scale Allocentric Relational Inference from Natural Spatial Descriptions
di: Paz-Argaman, Tzuf, et al.
Pubblicazione: (2024)
di: Paz-Argaman, Tzuf, et al.
Pubblicazione: (2024)
Dental-TriageBench: Benchmarking Multimodal Reasoning for Hierarchical Dental Triage
di: He, Ziyi, et al.
Pubblicazione: (2026)
di: He, Ziyi, et al.
Pubblicazione: (2026)
Proactive Conversational Assistant for a Procedural Manual Task based on Audio and IMU
di: Mahfuz, Rehana, et al.
Pubblicazione: (2026)
di: Mahfuz, Rehana, et al.
Pubblicazione: (2026)
StreaMulT: Streaming Multimodal Transformer for Heterogeneous and Arbitrary Long Sequential Data
di: Pellegrain, Victor, et al.
Pubblicazione: (2021)
di: Pellegrain, Victor, et al.
Pubblicazione: (2021)
Mixture of LoRA Experts
di: Wu, Xun, et al.
Pubblicazione: (2024)
di: Wu, Xun, et al.
Pubblicazione: (2024)
ModalImmune: Immunity Driven Unlearning via Self Destructive Training
di: Fu, Rong, et al.
Pubblicazione: (2026)
di: Fu, Rong, et al.
Pubblicazione: (2026)
Hear What Matters! Text-conditioned Selective Video-to-Audio Generation
di: Lee, Junwon, et al.
Pubblicazione: (2025)
di: Lee, Junwon, et al.
Pubblicazione: (2025)
Large Language Models for Computer-Aided Design: A Survey
di: Zhang, Licheng, et al.
Pubblicazione: (2025)
di: Zhang, Licheng, et al.
Pubblicazione: (2025)
Multimodal Multi-loss Fusion Network for Sentiment Analysis
di: Wu, Zehui, et al.
Pubblicazione: (2023)
di: Wu, Zehui, et al.
Pubblicazione: (2023)
DLF: Disentangled-Language-Focused Multimodal Sentiment Analysis
di: Wang, Pan, et al.
Pubblicazione: (2024)
di: Wang, Pan, et al.
Pubblicazione: (2024)
Doctor Sun: A Bilingual Multimodal Large Language Model for Biomedical AI
di: Xue, Dong, et al.
Pubblicazione: (2025)
di: Xue, Dong, et al.
Pubblicazione: (2025)
Sample then Identify: A General Framework for Risk Control and Assessment in Multimodal Large Language Models
di: Wang, Qingni, et al.
Pubblicazione: (2024)
di: Wang, Qingni, et al.
Pubblicazione: (2024)
OLKAVS: An Open Large-Scale Korean Audio-Visual Speech Dataset
di: Park, Jeongkyun, et al.
Pubblicazione: (2023)
di: Park, Jeongkyun, et al.
Pubblicazione: (2023)
EEG2TEXT-CN: An Exploratory Study of Open-Vocabulary Chinese Text-EEG Alignment via Large Language Model and Contrastive Learning on ChineseEEG
di: Lu, Jacky Tai-Yu, et al.
Pubblicazione: (2025)
di: Lu, Jacky Tai-Yu, et al.
Pubblicazione: (2025)
Language Models as Black-Box Optimizers for Vision-Language Models
di: Liu, Shihong, et al.
Pubblicazione: (2023)
di: Liu, Shihong, et al.
Pubblicazione: (2023)
VALOR: Vision-Audio-Language Omni-Perception Pretraining Model and Dataset
di: Liu, Jing, et al.
Pubblicazione: (2023)
di: Liu, Jing, et al.
Pubblicazione: (2023)
Let Multimodal Embedders Learn When to Augment Query via Adaptive Query Augmentation
di: Kim, Wongyu, et al.
Pubblicazione: (2025)
di: Kim, Wongyu, et al.
Pubblicazione: (2025)
Music for All: Representational Bias and Cross-Cultural Adaptability of Music Generation Models
di: Mehta, Atharva, et al.
Pubblicazione: (2025)
di: Mehta, Atharva, et al.
Pubblicazione: (2025)
Unleashing the Power of Imbalanced Modality Information for Multi-modal Knowledge Graph Completion
di: Zhang, Yichi, et al.
Pubblicazione: (2024)
di: Zhang, Yichi, et al.
Pubblicazione: (2024)
'No' Matters: Out-of-Distribution Detection in Multimodality Long Dialogue
di: Gao, Rena, et al.
Pubblicazione: (2024)
di: Gao, Rena, et al.
Pubblicazione: (2024)
MultiScript30k: Leveraging Multilingual Embeddings to Extend Cross Script Parallel Data
di: Driggers-Ellis, Christopher, et al.
Pubblicazione: (2025)
di: Driggers-Ellis, Christopher, et al.
Pubblicazione: (2025)
MultiMedEdit: A Scenario-Aware Benchmark for Evaluating Knowledge Editing in Medical VQA
di: Wen, Shengtao, et al.
Pubblicazione: (2025)
di: Wen, Shengtao, et al.
Pubblicazione: (2025)
MuPHI: Learning Implicit Multimodal Harm Reasoning via Semantically Grounded Reward Optimization
di: Saha, Anisha, et al.
Pubblicazione: (2026)
di: Saha, Anisha, et al.
Pubblicazione: (2026)
Decoding the Hook: A Multimodal LLM Framework for Analyzing the Hooking Period of Video Ads
di: Zhang, Kunpeng, et al.
Pubblicazione: (2026)
di: Zhang, Kunpeng, et al.
Pubblicazione: (2026)
Reasoning LLMs are Wandering Solution Explorers
di: Lu, Jiahao, et al.
Pubblicazione: (2025)
di: Lu, Jiahao, et al.
Pubblicazione: (2025)
Clustering Internet Memes Through Template Matching and Multi-Dimensional Similarity
di: Bloem, Tygo, et al.
Pubblicazione: (2025)
di: Bloem, Tygo, et al.
Pubblicazione: (2025)
Documenti analoghi
-
On the de-duplication of the Lakh MIDI dataset
di: Choi, Eunjin, et al.
Pubblicazione: (2025) -
LAV: Audio-Driven Dynamic Visual Generation with Neural Compression and StyleGAN2
di: Jung, Jongmin, et al.
Pubblicazione: (2025) -
Automatic Time Signature Determination for New Scores Using Lyrics for Latent Rhythmic Structure
di: Liao, Callie C., et al.
Pubblicazione: (2023) -
Self-Comparison for Dataset-Level Membership Inference in Large (Vision-)Language Models
di: Ren, Jie, et al.
Pubblicazione: (2024) -
Towards Efficient and Real-Time Piano Transcription Using Neural Autoregressive Models
di: Kwon, Taegyun, et al.
Pubblicazione: (2024)