Anchor-aware Deep Metric Learning for Audio-visual Retrieval
Fuente:
arXiv
Salvato in:
| Autori principali: | Zeng, Donghuo, Wang, Yanan, Ikeda, Kazushi, Yu, Yi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Metric Learning with Progressive Self-Distillation for Audio-Visual Embedding Learning
di: Zeng, Donghuo, et al.
Pubblicazione: (2025)
di: Zeng, Donghuo, et al.
Pubblicazione: (2025)
TalkPlayData 2: An Agentic Synthetic Data Pipeline for Multimodal Conversational Music Recommendation
di: Choi, Keunwoo, et al.
Pubblicazione: (2025)
di: Choi, Keunwoo, et al.
Pubblicazione: (2025)
Diff4Steer: Steerable Diffusion Prior for Generative Music Retrieval with Semantic Guidance
di: Bao, Xuchan, et al.
Pubblicazione: (2024)
di: Bao, Xuchan, et al.
Pubblicazione: (2024)
JEPOO: Highly Accurate Joint Estimation of Pitch, Onset and Offset for Music Information Retrieval
di: Wei, Haojie, et al.
Pubblicazione: (2023)
di: Wei, Haojie, et al.
Pubblicazione: (2023)
Enriching Music Descriptions with a Finetuned-LLM and Metadata for Text-to-Music Retrieval
di: Doh, SeungHeon, et al.
Pubblicazione: (2024)
di: Doh, SeungHeon, et al.
Pubblicazione: (2024)
ASK: Adaptive Self-improving Knowledge Framework for Audio Text Retrieval
di: Fu, Siyuan, et al.
Pubblicazione: (2025)
di: Fu, Siyuan, et al.
Pubblicazione: (2025)
Retrieval-Augmented Text-to-Audio Generation
di: Yuan, Yi, et al.
Pubblicazione: (2023)
di: Yuan, Yi, et al.
Pubblicazione: (2023)
TalkPlay-Tools: Conversational Music Recommendation with LLM Tool Calling
di: Doh, Seungheon, et al.
Pubblicazione: (2025)
di: Doh, Seungheon, et al.
Pubblicazione: (2025)
Streaming Piano Transcription Based on Consistent Onset and Offset Decoding with Sustain Pedal Detection
di: Wei, Weixing, et al.
Pubblicazione: (2025)
di: Wei, Weixing, et al.
Pubblicazione: (2025)
On the Effect of Data-Augmentation on Local Embedding Properties in the Contrastive Learning of Music Audio Representations
di: McCallum, Matthew C., et al.
Pubblicazione: (2024)
di: McCallum, Matthew C., et al.
Pubblicazione: (2024)
Pretrained Conformers for Audio Fingerprinting and Retrieval
di: Altwlkany, Kemal, et al.
Pubblicazione: (2025)
di: Altwlkany, Kemal, et al.
Pubblicazione: (2025)
MERGE -- A Bimodal Audio-Lyrics Dataset for Static Music Emotion Recognition
di: Louro, Pedro Lima, et al.
Pubblicazione: (2024)
di: Louro, Pedro Lima, et al.
Pubblicazione: (2024)
SynthTab: Leveraging Synthesized Data for Guitar Tablature Transcription
di: Zang, Yongyi, et al.
Pubblicazione: (2023)
di: Zang, Yongyi, et al.
Pubblicazione: (2023)
Towards Assessing Data Replication in Music Generation with Music Similarity Metrics on Raw Audio
di: Batlle-Roca, Roser, et al.
Pubblicazione: (2024)
di: Batlle-Roca, Roser, et al.
Pubblicazione: (2024)
AudioRole: An Audio Dataset for Character Role-Playing in Large Language Models
di: Li, Wenyu, et al.
Pubblicazione: (2025)
di: Li, Wenyu, et al.
Pubblicazione: (2025)
Learning Audio-Visual Embeddings with Inferred Latent Interaction Graphs
di: Zeng, Donghuo, et al.
Pubblicazione: (2026)
di: Zeng, Donghuo, et al.
Pubblicazione: (2026)
DeepFake Doctor: Diagnosing and Treating Audio-Video Fake Detection
di: Klemt, Marcel, et al.
Pubblicazione: (2025)
di: Klemt, Marcel, et al.
Pubblicazione: (2025)
Audio Does Matter: Importance-Aware Multi-Granularity Fusion for Video Moment Retrieval
di: Lin, Junan, et al.
Pubblicazione: (2025)
di: Lin, Junan, et al.
Pubblicazione: (2025)
DreamHead: Learning Spatial-Temporal Correspondence via Hierarchical Diffusion for Audio-driven Talking Head Synthesis
di: Hong, Fa-Ting, et al.
Pubblicazione: (2024)
di: Hong, Fa-Ting, et al.
Pubblicazione: (2024)
Leveraging Pre-trained AudioLDM for Sound Generation: A Benchmark Study
di: Yuan, Yi, et al.
Pubblicazione: (2023)
di: Yuan, Yi, et al.
Pubblicazione: (2023)
Robust Audio Anti-Spoofing with Fusion-Reconstruction Learning on Multi-Order Spectrograms
di: Wen, Penghui, et al.
Pubblicazione: (2023)
di: Wen, Penghui, et al.
Pubblicazione: (2023)
AudioLDM 2: Learning Holistic Audio Generation with Self-supervised Pretraining
di: Liu, Haohe, et al.
Pubblicazione: (2023)
di: Liu, Haohe, et al.
Pubblicazione: (2023)
Learning Normal Patterns in Musical Loops
di: Dadman, Shayan, et al.
Pubblicazione: (2025)
di: Dadman, Shayan, et al.
Pubblicazione: (2025)
Leveraging Pre-Trained Autoencoders for Interpretable Prototype Learning of Music Audio
di: Alonso-Jiménez, Pablo, et al.
Pubblicazione: (2024)
di: Alonso-Jiménez, Pablo, et al.
Pubblicazione: (2024)
Music Genre Classification: Ensemble Learning with Subcomponents-level Attention
di: Liu, Yichen, et al.
Pubblicazione: (2024)
di: Liu, Yichen, et al.
Pubblicazione: (2024)
OmniCustom: Sync Audio-Video Customization Via Joint Audio-Video Generation Model
di: Li, Maomao, et al.
Pubblicazione: (2026)
di: Li, Maomao, et al.
Pubblicazione: (2026)
FreeAudio: Training-Free Timing Planning for Controllable Long-Form Text-to-Audio Generation
di: Jiang, Yuxuan, et al.
Pubblicazione: (2025)
di: Jiang, Yuxuan, et al.
Pubblicazione: (2025)
Towards Generating Diverse Audio Captions via Adversarial Training
di: Mei, Xinhao, et al.
Pubblicazione: (2022)
di: Mei, Xinhao, et al.
Pubblicazione: (2022)
A Multi-Stream Fusion Approach with One-Class Learning for Audio-Visual Deepfake Detection
di: Lee, Kyungbok, et al.
Pubblicazione: (2024)
di: Lee, Kyungbok, et al.
Pubblicazione: (2024)
Neural Style Transfer for Audio Spectograms
di: Verma, Prateek, et al.
Pubblicazione: (2018)
di: Verma, Prateek, et al.
Pubblicazione: (2018)
Embedding Alignment in Code Generation for Audio
di: Kouteili, Sam, et al.
Pubblicazione: (2025)
di: Kouteili, Sam, et al.
Pubblicazione: (2025)
Integrating IP Broadcasting with Audio Tags: Workflow and Challenges
di: Burchett-Vass, Rhys, et al.
Pubblicazione: (2024)
di: Burchett-Vass, Rhys, et al.
Pubblicazione: (2024)
Unveiling Visual Biases in Audio-Visual Localization Benchmarks
di: Chen, Liangyu, et al.
Pubblicazione: (2024)
di: Chen, Liangyu, et al.
Pubblicazione: (2024)
High-Resolution Sustain Pedal Depth Estimation from Piano Audio Across Room Acoustics
di: Fang, Kun, et al.
Pubblicazione: (2025)
di: Fang, Kun, et al.
Pubblicazione: (2025)
Prompt-aware classifier free guidance for diffusion models
di: Zhang, Xuanhao, et al.
Pubblicazione: (2025)
di: Zhang, Xuanhao, et al.
Pubblicazione: (2025)
PIAST: A Multimodal Piano Dataset with Audio, Symbolic and Text
di: Bang, Hayeon, et al.
Pubblicazione: (2024)
di: Bang, Hayeon, et al.
Pubblicazione: (2024)
Learning Temporal Resolution in Spectrogram for Audio Classification
di: Liu, Haohe, et al.
Pubblicazione: (2022)
di: Liu, Haohe, et al.
Pubblicazione: (2022)
Latent Diffusion Bridges for Unsupervised Musical Audio Timbre Transfer
di: Mancusi, Michele, et al.
Pubblicazione: (2024)
di: Mancusi, Michele, et al.
Pubblicazione: (2024)
LPIPS-AttnWav2Lip: Generic Audio-Driven lip synchronization for Talking Head Generation in the Wild
di: Chen, Zhipeng, et al.
Pubblicazione: (2026)
di: Chen, Zhipeng, et al.
Pubblicazione: (2026)
LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport
di: Rho, Kyeongha, et al.
Pubblicazione: (2025)
di: Rho, Kyeongha, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Metric Learning with Progressive Self-Distillation for Audio-Visual Embedding Learning
di: Zeng, Donghuo, et al.
Pubblicazione: (2025) -
TalkPlayData 2: An Agentic Synthetic Data Pipeline for Multimodal Conversational Music Recommendation
di: Choi, Keunwoo, et al.
Pubblicazione: (2025) -
Diff4Steer: Steerable Diffusion Prior for Generative Music Retrieval with Semantic Guidance
di: Bao, Xuchan, et al.
Pubblicazione: (2024) -
JEPOO: Highly Accurate Joint Estimation of Pitch, Onset and Offset for Music Information Retrieval
di: Wei, Haojie, et al.
Pubblicazione: (2023) -
Enriching Music Descriptions with a Finetuned-LLM and Metadata for Text-to-Music Retrieval
di: Doh, SeungHeon, et al.
Pubblicazione: (2024)