Multi-Axis Speech Similarity via Factor-Partitioned Embeddings
Fuente:
arXiv
Guardado en:
| Autores principales: | O'Regan, Jim, Edlund, Jens |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Multiscale Matching Driven by Cross-Modal Similarity Consistency for Audio-Text Retrieval
por: Wang, Qian, et al.
Publicado: (2024)
por: Wang, Qian, et al.
Publicado: (2024)
Expressivity-aware Music Performance Retrieval using Mid-level Perceptual Features and Emotion Word Embeddings
por: Chowdhury, Shreyan, et al.
Publicado: (2024)
por: Chowdhury, Shreyan, et al.
Publicado: (2024)
Melody-Lyrics Matching with Contrastive Alignment Loss
por: Wang, Changhong, et al.
Publicado: (2025)
por: Wang, Changhong, et al.
Publicado: (2025)
Audio Prototypical Network For Controllable Music Recommendation
por: Öncel, Fırat, et al.
Publicado: (2025)
por: Öncel, Fırat, et al.
Publicado: (2025)
PolySinger: Singing-Voice to Singing-Voice Translation from English to Japanese
por: Antonisen, Silas, et al.
Publicado: (2024)
por: Antonisen, Silas, et al.
Publicado: (2024)
Multi-Sample Dynamic Time Warping for Few-Shot Keyword Spotting
por: Wilkinghoff, Kevin, et al.
Publicado: (2024)
por: Wilkinghoff, Kevin, et al.
Publicado: (2024)
Bridging the Gap Between Semantic and User Preference Spaces for Multi-modal Music Representation Learning
por: Pan, Xiaofeng, et al.
Publicado: (2025)
por: Pan, Xiaofeng, et al.
Publicado: (2025)
BEST-STD: Bidirectional Mamba-Enhanced Speech Tokenization for Spoken Term Detection
por: Singh, Anup, et al.
Publicado: (2024)
por: Singh, Anup, et al.
Publicado: (2024)
Similar but Faster: Manipulation of Tempo in Music Audio Embeddings for Tempo Prediction and Search
por: McCallum, Matthew C., et al.
Publicado: (2024)
por: McCallum, Matthew C., et al.
Publicado: (2024)
SECP: A Speech Enhancement-Based Curation Pipeline For Scalable Acquisition Of Clean Speech
por: Sabra, Adam, et al.
Publicado: (2024)
por: Sabra, Adam, et al.
Publicado: (2024)
Application of Audio Fingerprinting Techniques for Real-Time Scalable Speech Retrieval and Speech Clusterization
por: Altwlkany, Kemal, et al.
Publicado: (2024)
por: Altwlkany, Kemal, et al.
Publicado: (2024)
Hybrid Losses for Hierarchical Embedding Learning
por: Tian, Haokun, et al.
Publicado: (2025)
por: Tian, Haokun, et al.
Publicado: (2025)
FusID: Modality-Fused Semantic IDs for Generative Music Recommendation
por: Kim, Haven, et al.
Publicado: (2026)
por: Kim, Haven, et al.
Publicado: (2026)
VoxRAG: A Step Toward Transcription-Free RAG Systems in Spoken Question Answering
por: Rackauckas, Zackary, et al.
Publicado: (2025)
por: Rackauckas, Zackary, et al.
Publicado: (2025)
Exploring Diverse Sounds: Identifying Outliers in a Music Corpus
por: Cai, Le, et al.
Publicado: (2024)
por: Cai, Le, et al.
Publicado: (2024)
Music Discovery Dialogue Generation Using Human Intent Analysis and Large Language Models
por: Doh, SeungHeon, et al.
Publicado: (2024)
por: Doh, SeungHeon, et al.
Publicado: (2024)
Track Role Prediction of Single-Instrumental Sequences
por: Han, Changheon, et al.
Publicado: (2024)
por: Han, Changheon, et al.
Publicado: (2024)
Personalized Dynamic Music Emotion Recognition with Dual-Scale Attention-Based Meta-Learning
por: Zhang, Dengming, et al.
Publicado: (2024)
por: Zhang, Dengming, et al.
Publicado: (2024)
LARP: Language Audio Relational Pre-training for Cold-Start Playlist Continuation
por: Salganik, Rebecca, et al.
Publicado: (2024)
por: Salganik, Rebecca, et al.
Publicado: (2024)
DiffATR: Diffusion-based Generative Modeling for Audio-Text Retrieval
por: Xin, Yifei, et al.
Publicado: (2024)
por: Xin, Yifei, et al.
Publicado: (2024)
Exploring GPT's Ability as a Judge in Music Understanding
por: Fang, Kun, et al.
Publicado: (2025)
por: Fang, Kun, et al.
Publicado: (2025)
Language-based Audio Retrieval with Co-Attention Networks
por: Sun, Haoran, et al.
Publicado: (2024)
por: Sun, Haoran, et al.
Publicado: (2024)
Do Captioning Metrics Reflect Music Semantic Alignment?
por: Lee, Jinwoo, et al.
Publicado: (2024)
por: Lee, Jinwoo, et al.
Publicado: (2024)
Automatic Estimation of Singing Voice Musical Dynamics
por: Narang, Jyoti, et al.
Publicado: (2024)
por: Narang, Jyoti, et al.
Publicado: (2024)
Evaluating Interval-based Tokenization for Pitch Representation in Symbolic Music Analysis
por: Le, Dinh-Viet-Toan, et al.
Publicado: (2025)
por: Le, Dinh-Viet-Toan, et al.
Publicado: (2025)
A SOUND APPROACH: Using Large Language Models to generate audio descriptions for egocentric text-audio retrieval
por: Oncescu, Andreea-Maria, et al.
Publicado: (2024)
por: Oncescu, Andreea-Maria, et al.
Publicado: (2024)
TALKPLAY: Multimodal Music Recommendation with Large Language Models
por: Doh, Seungheon, et al.
Publicado: (2025)
por: Doh, Seungheon, et al.
Publicado: (2025)
Evaluating High-Resolution Piano Sustain Pedal Depth Estimation with Musically Informed Metrics
por: Zhang, Hanwen, et al.
Publicado: (2025)
por: Zhang, Hanwen, et al.
Publicado: (2025)
Engraving Oriented Joint Estimation of Pitch Spelling and Local and Global Keys
por: Bouquillard, Augustin, et al.
Publicado: (2024)
por: Bouquillard, Augustin, et al.
Publicado: (2024)
Towards Computational Analysis of Pansori Singing
por: Park, Sangheon, et al.
Publicado: (2024)
por: Park, Sangheon, et al.
Publicado: (2024)
CLASP: Contrastive Language-Speech Pretraining for Multilingual Multimodal Information Retrieval
por: Abootorabi, Mohammad Mahdi, et al.
Publicado: (2024)
por: Abootorabi, Mohammad Mahdi, et al.
Publicado: (2024)
Zema Dataset: A Comprehensive Study of Yaredawi Zema with a Focus on Horologium Chants
por: Muluneh, Mequanent Argaw, et al.
Publicado: (2024)
por: Muluneh, Mequanent Argaw, et al.
Publicado: (2024)
SpeechDPR: End-to-End Spoken Passage Retrieval for Open-Domain Spoken Question Answering
por: Lin, Chyi-Jiunn, et al.
Publicado: (2024)
por: Lin, Chyi-Jiunn, et al.
Publicado: (2024)
MUSE: Flexible Voiceprint Receptive Fields and Multi-Path Fusion Enhanced Taylor Transformer for U-Net-based Speech Enhancement
por: Lin, Zizhen, et al.
Publicado: (2024)
por: Lin, Zizhen, et al.
Publicado: (2024)
Multi-Modal Retrieval For Large Language Model Based Speech Recognition
por: Kolehmainen, Jari, et al.
Publicado: (2024)
por: Kolehmainen, Jari, et al.
Publicado: (2024)
TalkPlay-Tools: Conversational Music Recommendation with LLM Tool Calling
por: Doh, Seungheon, et al.
Publicado: (2025)
por: Doh, Seungheon, et al.
Publicado: (2025)
Diff4Steer: Steerable Diffusion Prior for Generative Music Retrieval with Semantic Guidance
por: Bao, Xuchan, et al.
Publicado: (2024)
por: Bao, Xuchan, et al.
Publicado: (2024)
Enriching Music Descriptions with a Finetuned-LLM and Metadata for Text-to-Music Retrieval
por: Doh, SeungHeon, et al.
Publicado: (2024)
por: Doh, SeungHeon, et al.
Publicado: (2024)
JEPOO: Highly Accurate Joint Estimation of Pitch, Onset and Offset for Music Information Retrieval
por: Wei, Haojie, et al.
Publicado: (2023)
por: Wei, Haojie, et al.
Publicado: (2023)
Streaming Piano Transcription Based on Consistent Onset and Offset Decoding with Sustain Pedal Detection
por: Wei, Weixing, et al.
Publicado: (2025)
por: Wei, Weixing, et al.
Publicado: (2025)
Ejemplares similares
-
Multiscale Matching Driven by Cross-Modal Similarity Consistency for Audio-Text Retrieval
por: Wang, Qian, et al.
Publicado: (2024) -
Expressivity-aware Music Performance Retrieval using Mid-level Perceptual Features and Emotion Word Embeddings
por: Chowdhury, Shreyan, et al.
Publicado: (2024) -
Melody-Lyrics Matching with Contrastive Alignment Loss
por: Wang, Changhong, et al.
Publicado: (2025) -
Audio Prototypical Network For Controllable Music Recommendation
por: Öncel, Fırat, et al.
Publicado: (2025) -
PolySinger: Singing-Voice to Singing-Voice Translation from English to Japanese
por: Antonisen, Silas, et al.
Publicado: (2024)