Can Impressions of Music be Extracted from Thumbnail Images?
Fuente:
arXiv
Salvato in:
| Autori principali: | Harada, Takashi, Motomitsu, Takehiro, Hayashi, Katsuhiko, Sakai, Yusuke, Kamigaito, Hidetaka |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Beyond Musical Descriptors: Extracting Preference-Bearing Intent in Music Queries
di: Baranes, Marion, et al.
Pubblicazione: (2026)
di: Baranes, Marion, et al.
Pubblicazione: (2026)
Analyzing Byte-Pair Encoding on Monophonic and Polyphonic Symbolic Music: A Focus on Musical Phrase Segmentation
di: Le, Dinh-Viet-Toan, et al.
Pubblicazione: (2024)
di: Le, Dinh-Viet-Toan, et al.
Pubblicazione: (2024)
Simultaneous Interpretation Corpus Construction by Large Language Models in Distant Language Pair
di: Sakai, Yusuke, et al.
Pubblicazione: (2024)
di: Sakai, Yusuke, et al.
Pubblicazione: (2024)
Transforming LLMs into Cross-modal and Cross-lingual Retrieval Systems
di: Gomez, Frank Palma, et al.
Pubblicazione: (2024)
di: Gomez, Frank Palma, et al.
Pubblicazione: (2024)
CLASP: Contrastive Language-Speech Pretraining for Multilingual Multimodal Information Retrieval
di: Abootorabi, Mohammad Mahdi, et al.
Pubblicazione: (2024)
di: Abootorabi, Mohammad Mahdi, et al.
Pubblicazione: (2024)
SpeechDPR: End-to-End Spoken Passage Retrieval for Open-Domain Spoken Question Answering
di: Lin, Chyi-Jiunn, et al.
Pubblicazione: (2024)
di: Lin, Chyi-Jiunn, et al.
Pubblicazione: (2024)
Automatic Estimation of Singing Voice Musical Dynamics
di: Narang, Jyoti, et al.
Pubblicazione: (2024)
di: Narang, Jyoti, et al.
Pubblicazione: (2024)
The Kolmogorov Complexity of Irish traditional dance music
di: McGettrick, Michael, et al.
Pubblicazione: (2024)
di: McGettrick, Michael, et al.
Pubblicazione: (2024)
Exploring GPT's Ability as a Judge in Music Understanding
di: Fang, Kun, et al.
Pubblicazione: (2025)
di: Fang, Kun, et al.
Pubblicazione: (2025)
Do Captioning Metrics Reflect Music Semantic Alignment?
di: Lee, Jinwoo, et al.
Pubblicazione: (2024)
di: Lee, Jinwoo, et al.
Pubblicazione: (2024)
TALKPLAY: Multimodal Music Recommendation with Large Language Models
di: Doh, Seungheon, et al.
Pubblicazione: (2025)
di: Doh, Seungheon, et al.
Pubblicazione: (2025)
Exploring Diverse Sounds: Identifying Outliers in a Music Corpus
di: Cai, Le, et al.
Pubblicazione: (2024)
di: Cai, Le, et al.
Pubblicazione: (2024)
FusID: Modality-Fused Semantic IDs for Generative Music Recommendation
di: Kim, Haven, et al.
Pubblicazione: (2026)
di: Kim, Haven, et al.
Pubblicazione: (2026)
Evaluating Interval-based Tokenization for Pitch Representation in Symbolic Music Analysis
di: Le, Dinh-Viet-Toan, et al.
Pubblicazione: (2025)
di: Le, Dinh-Viet-Toan, et al.
Pubblicazione: (2025)
Music Discovery Dialogue Generation Using Human Intent Analysis and Large Language Models
di: Doh, SeungHeon, et al.
Pubblicazione: (2024)
di: Doh, SeungHeon, et al.
Pubblicazione: (2024)
Personalized Dynamic Music Emotion Recognition with Dual-Scale Attention-Based Meta-Learning
di: Zhang, Dengming, et al.
Pubblicazione: (2024)
di: Zhang, Dengming, et al.
Pubblicazione: (2024)
Evaluating High-Resolution Piano Sustain Pedal Depth Estimation with Musically Informed Metrics
di: Zhang, Hanwen, et al.
Pubblicazione: (2025)
di: Zhang, Hanwen, et al.
Pubblicazione: (2025)
WikiMuTe: A web-sourced dataset of semantic descriptions for music audio
di: Weck, Benno, et al.
Pubblicazione: (2023)
di: Weck, Benno, et al.
Pubblicazione: (2023)
Multi-Modal Retrieval For Large Language Model Based Speech Recognition
di: Kolehmainen, Jari, et al.
Pubblicazione: (2024)
di: Kolehmainen, Jari, et al.
Pubblicazione: (2024)
Technical Report on classification of literature related to children speech disorder
di: Wang, Ziang, et al.
Pubblicazione: (2025)
di: Wang, Ziang, et al.
Pubblicazione: (2025)
I can listen but cannot read: An evaluation of two-tower multimodal systems for instrument recognition
di: Vasilakis, Yannis, et al.
Pubblicazione: (2024)
di: Vasilakis, Yannis, et al.
Pubblicazione: (2024)
A GEN AI Framework for Medical Note Generation
di: Leong, Hui Yi, et al.
Pubblicazione: (2024)
di: Leong, Hui Yi, et al.
Pubblicazione: (2024)
More than words: Advancements and challenges in speech recognition for singing
di: Kruspe, Anna
Pubblicazione: (2024)
di: Kruspe, Anna
Pubblicazione: (2024)
Bridging the Gap Between Semantic and User Preference Spaces for Multi-modal Music Representation Learning
di: Pan, Xiaofeng, et al.
Pubblicazione: (2025)
di: Pan, Xiaofeng, et al.
Pubblicazione: (2025)
Expressivity-aware Music Performance Retrieval using Mid-level Perceptual Features and Emotion Word Embeddings
di: Chowdhury, Shreyan, et al.
Pubblicazione: (2024)
di: Chowdhury, Shreyan, et al.
Pubblicazione: (2024)
Navigating Speech Recording Collections with AI-Generated Illustrations
di: Håland, Sirina, et al.
Pubblicazione: (2025)
di: Håland, Sirina, et al.
Pubblicazione: (2025)
Enriching Music Descriptions with a Finetuned-LLM and Metadata for Text-to-Music Retrieval
di: Doh, SeungHeon, et al.
Pubblicazione: (2024)
di: Doh, SeungHeon, et al.
Pubblicazione: (2024)
Multimodal Transformer Distillation for Audio-Visual Synchronization
di: Chen, Xuanjun, et al.
Pubblicazione: (2022)
di: Chen, Xuanjun, et al.
Pubblicazione: (2022)
Voice Impression Control in Zero-Shot TTS
di: Fujita, Kenichi, et al.
Pubblicazione: (2025)
di: Fujita, Kenichi, et al.
Pubblicazione: (2025)
Separating the "Chirp" from the "Chat": Self-supervised Visual Grounding of Sound and Language
di: Hamilton, Mark, et al.
Pubblicazione: (2024)
di: Hamilton, Mark, et al.
Pubblicazione: (2024)
TalkPlay-Tools: Conversational Music Recommendation with LLM Tool Calling
di: Doh, Seungheon, et al.
Pubblicazione: (2025)
di: Doh, Seungheon, et al.
Pubblicazione: (2025)
Diff4Steer: Steerable Diffusion Prior for Generative Music Retrieval with Semantic Guidance
di: Bao, Xuchan, et al.
Pubblicazione: (2024)
di: Bao, Xuchan, et al.
Pubblicazione: (2024)
JEPOO: Highly Accurate Joint Estimation of Pitch, Onset and Offset for Music Information Retrieval
di: Wei, Haojie, et al.
Pubblicazione: (2023)
di: Wei, Haojie, et al.
Pubblicazione: (2023)
Music Foundation Model as Generic Booster for Music Downstream Tasks
di: Liao, WeiHsiang, et al.
Pubblicazione: (2024)
di: Liao, WeiHsiang, et al.
Pubblicazione: (2024)
Universal Music Representations? Evaluating Foundation Models on World Music Corpora
di: Papaioannou, Charilaos, et al.
Pubblicazione: (2025)
di: Papaioannou, Charilaos, et al.
Pubblicazione: (2025)
A Multi-Probe Audit of Clinical-Interview Depression Detection Benchmarks
di: Ishikawa, Takehiro, et al.
Pubblicazione: (2026)
di: Ishikawa, Takehiro, et al.
Pubblicazione: (2026)
Audio Does Matter: Importance-Aware Multi-Granularity Fusion for Video Moment Retrieval
di: Lin, Junan, et al.
Pubblicazione: (2025)
di: Lin, Junan, et al.
Pubblicazione: (2025)
Nested Music Transformer: Sequentially Decoding Compound Tokens in Symbolic Music and Audio Generation
di: Yoo, HaeJun, et al.
Pubblicazione: (2024)
di: Yoo, HaeJun, et al.
Pubblicazione: (2024)
Music Auto-Tagging with Robust Music Representation Learned via Domain Adversarial Training
di: Joung, Haesun, et al.
Pubblicazione: (2024)
di: Joung, Haesun, et al.
Pubblicazione: (2024)
Advancing the Foundation Model for Music Understanding
di: Jiang, Yi, et al.
Pubblicazione: (2025)
di: Jiang, Yi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Beyond Musical Descriptors: Extracting Preference-Bearing Intent in Music Queries
di: Baranes, Marion, et al.
Pubblicazione: (2026) -
Analyzing Byte-Pair Encoding on Monophonic and Polyphonic Symbolic Music: A Focus on Musical Phrase Segmentation
di: Le, Dinh-Viet-Toan, et al.
Pubblicazione: (2024) -
Simultaneous Interpretation Corpus Construction by Large Language Models in Distant Language Pair
di: Sakai, Yusuke, et al.
Pubblicazione: (2024) -
Transforming LLMs into Cross-modal and Cross-lingual Retrieval Systems
di: Gomez, Frank Palma, et al.
Pubblicazione: (2024) -
CLASP: Contrastive Language-Speech Pretraining for Multilingual Multimodal Information Retrieval
di: Abootorabi, Mohammad Mahdi, et al.
Pubblicazione: (2024)