K-pop Lyric Translation: Dataset, Analysis, and Neural-Modelling
Fuente:
arXiv
Guardado en:
| Autores principales: | Kim, Haven, Jung, Jongmin, Jeong, Dasaem, Nam, Juhan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
On the de-duplication of the Lakh MIDI dataset
por: Choi, Eunjin, et al.
Publicado: (2025)
por: Choi, Eunjin, et al.
Publicado: (2025)
LAV: Audio-Driven Dynamic Visual Generation with Neural Compression and StyleGAN2
por: Jung, Jongmin, et al.
Publicado: (2025)
por: Jung, Jongmin, et al.
Publicado: (2025)
Automatic Time Signature Determination for New Scores Using Lyrics for Latent Rhythmic Structure
por: Liao, Callie C., et al.
Publicado: (2023)
por: Liao, Callie C., et al.
Publicado: (2023)
Self-Comparison for Dataset-Level Membership Inference in Large (Vision-)Language Models
por: Ren, Jie, et al.
Publicado: (2024)
por: Ren, Jie, et al.
Publicado: (2024)
Towards Efficient and Real-Time Piano Transcription Using Neural Autoregressive Models
por: Kwon, Taegyun, et al.
Publicado: (2024)
por: Kwon, Taegyun, et al.
Publicado: (2024)
Training Data Efficiency in Multimodal Process Reward Models
por: Li, Jinyuan, et al.
Publicado: (2026)
por: Li, Jinyuan, et al.
Publicado: (2026)
KMMMU: Evaluation of Massive Multi-discipline Multimodal Understanding in Korean Language and Context
por: Lee, Nahyun, et al.
Publicado: (2026)
por: Lee, Nahyun, et al.
Publicado: (2026)
ChemDFM-X: Towards Large Multimodal Model for Chemistry
por: Zhao, Zihan, et al.
Publicado: (2024)
por: Zhao, Zihan, et al.
Publicado: (2024)
Multimodal Large Language Models for Medicine: A Comprehensive Survey
por: Ye, Jiarui, et al.
Publicado: (2025)
por: Ye, Jiarui, et al.
Publicado: (2025)
Enriching Music Descriptions with a Finetuned-LLM and Metadata for Text-to-Music Retrieval
por: Doh, SeungHeon, et al.
Publicado: (2024)
por: Doh, SeungHeon, et al.
Publicado: (2024)
Video-Foley: Two-Stage Video-To-Sound Generation via Temporal Event Condition For Foley Sound
por: Lee, Junwon, et al.
Publicado: (2024)
por: Lee, Junwon, et al.
Publicado: (2024)
MUDI: A Multimodal Biomedical Dataset for Understanding Pharmacodynamic Drug-Drug Interactions
por: Ngo, Tung-Lam, et al.
Publicado: (2025)
por: Ngo, Tung-Lam, et al.
Publicado: (2025)
Emotion Collider: Dual Hyperbolic Mirror Manifolds for Sentiment Recovery via Anti Emotion Reflection
por: Fu, Rong, et al.
Publicado: (2026)
por: Fu, Rong, et al.
Publicado: (2026)
MemeCLIP: Leveraging CLIP Representations for Multimodal Meme Classification
por: Shah, Siddhant Bikram, et al.
Publicado: (2024)
por: Shah, Siddhant Bikram, et al.
Publicado: (2024)
Where Do We Go from Here? Multi-scale Allocentric Relational Inference from Natural Spatial Descriptions
por: Paz-Argaman, Tzuf, et al.
Publicado: (2024)
por: Paz-Argaman, Tzuf, et al.
Publicado: (2024)
Dental-TriageBench: Benchmarking Multimodal Reasoning for Hierarchical Dental Triage
por: He, Ziyi, et al.
Publicado: (2026)
por: He, Ziyi, et al.
Publicado: (2026)
Proactive Conversational Assistant for a Procedural Manual Task based on Audio and IMU
por: Mahfuz, Rehana, et al.
Publicado: (2026)
por: Mahfuz, Rehana, et al.
Publicado: (2026)
StreaMulT: Streaming Multimodal Transformer for Heterogeneous and Arbitrary Long Sequential Data
por: Pellegrain, Victor, et al.
Publicado: (2021)
por: Pellegrain, Victor, et al.
Publicado: (2021)
Mixture of LoRA Experts
por: Wu, Xun, et al.
Publicado: (2024)
por: Wu, Xun, et al.
Publicado: (2024)
ModalImmune: Immunity Driven Unlearning via Self Destructive Training
por: Fu, Rong, et al.
Publicado: (2026)
por: Fu, Rong, et al.
Publicado: (2026)
Hear What Matters! Text-conditioned Selective Video-to-Audio Generation
por: Lee, Junwon, et al.
Publicado: (2025)
por: Lee, Junwon, et al.
Publicado: (2025)
Large Language Models for Computer-Aided Design: A Survey
por: Zhang, Licheng, et al.
Publicado: (2025)
por: Zhang, Licheng, et al.
Publicado: (2025)
Multimodal Multi-loss Fusion Network for Sentiment Analysis
por: Wu, Zehui, et al.
Publicado: (2023)
por: Wu, Zehui, et al.
Publicado: (2023)
DLF: Disentangled-Language-Focused Multimodal Sentiment Analysis
por: Wang, Pan, et al.
Publicado: (2024)
por: Wang, Pan, et al.
Publicado: (2024)
Doctor Sun: A Bilingual Multimodal Large Language Model for Biomedical AI
por: Xue, Dong, et al.
Publicado: (2025)
por: Xue, Dong, et al.
Publicado: (2025)
Sample then Identify: A General Framework for Risk Control and Assessment in Multimodal Large Language Models
por: Wang, Qingni, et al.
Publicado: (2024)
por: Wang, Qingni, et al.
Publicado: (2024)
OLKAVS: An Open Large-Scale Korean Audio-Visual Speech Dataset
por: Park, Jeongkyun, et al.
Publicado: (2023)
por: Park, Jeongkyun, et al.
Publicado: (2023)
EEG2TEXT-CN: An Exploratory Study of Open-Vocabulary Chinese Text-EEG Alignment via Large Language Model and Contrastive Learning on ChineseEEG
por: Lu, Jacky Tai-Yu, et al.
Publicado: (2025)
por: Lu, Jacky Tai-Yu, et al.
Publicado: (2025)
Language Models as Black-Box Optimizers for Vision-Language Models
por: Liu, Shihong, et al.
Publicado: (2023)
por: Liu, Shihong, et al.
Publicado: (2023)
VALOR: Vision-Audio-Language Omni-Perception Pretraining Model and Dataset
por: Liu, Jing, et al.
Publicado: (2023)
por: Liu, Jing, et al.
Publicado: (2023)
Let Multimodal Embedders Learn When to Augment Query via Adaptive Query Augmentation
por: Kim, Wongyu, et al.
Publicado: (2025)
por: Kim, Wongyu, et al.
Publicado: (2025)
Music for All: Representational Bias and Cross-Cultural Adaptability of Music Generation Models
por: Mehta, Atharva, et al.
Publicado: (2025)
por: Mehta, Atharva, et al.
Publicado: (2025)
Unleashing the Power of Imbalanced Modality Information for Multi-modal Knowledge Graph Completion
por: Zhang, Yichi, et al.
Publicado: (2024)
por: Zhang, Yichi, et al.
Publicado: (2024)
'No' Matters: Out-of-Distribution Detection in Multimodality Long Dialogue
por: Gao, Rena, et al.
Publicado: (2024)
por: Gao, Rena, et al.
Publicado: (2024)
MultiScript30k: Leveraging Multilingual Embeddings to Extend Cross Script Parallel Data
por: Driggers-Ellis, Christopher, et al.
Publicado: (2025)
por: Driggers-Ellis, Christopher, et al.
Publicado: (2025)
MultiMedEdit: A Scenario-Aware Benchmark for Evaluating Knowledge Editing in Medical VQA
por: Wen, Shengtao, et al.
Publicado: (2025)
por: Wen, Shengtao, et al.
Publicado: (2025)
MuPHI: Learning Implicit Multimodal Harm Reasoning via Semantically Grounded Reward Optimization
por: Saha, Anisha, et al.
Publicado: (2026)
por: Saha, Anisha, et al.
Publicado: (2026)
Decoding the Hook: A Multimodal LLM Framework for Analyzing the Hooking Period of Video Ads
por: Zhang, Kunpeng, et al.
Publicado: (2026)
por: Zhang, Kunpeng, et al.
Publicado: (2026)
Reasoning LLMs are Wandering Solution Explorers
por: Lu, Jiahao, et al.
Publicado: (2025)
por: Lu, Jiahao, et al.
Publicado: (2025)
Clustering Internet Memes Through Template Matching and Multi-Dimensional Similarity
por: Bloem, Tygo, et al.
Publicado: (2025)
por: Bloem, Tygo, et al.
Publicado: (2025)
Ejemplares similares
-
On the de-duplication of the Lakh MIDI dataset
por: Choi, Eunjin, et al.
Publicado: (2025) -
LAV: Audio-Driven Dynamic Visual Generation with Neural Compression and StyleGAN2
por: Jung, Jongmin, et al.
Publicado: (2025) -
Automatic Time Signature Determination for New Scores Using Lyrics for Latent Rhythmic Structure
por: Liao, Callie C., et al.
Publicado: (2023) -
Self-Comparison for Dataset-Level Membership Inference in Large (Vision-)Language Models
por: Ren, Jie, et al.
Publicado: (2024) -
Towards Efficient and Real-Time Piano Transcription Using Neural Autoregressive Models
por: Kwon, Taegyun, et al.
Publicado: (2024)