Towards Leveraging Contrastively Pretrained Neural Audio Embeddings for Recommender Tasks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Grötschla, Florian, Strässle, Luca, Lanzendörfer, Luca A., Wattenhofer, Roger |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Audio Atlas: Visualizing and Exploring Audio Datasets
par: Lanzendörfer, Luca A., et autres
Publié: (2024)
par: Lanzendörfer, Luca A., et autres
Publié: (2024)
Multi-bit Audio Watermarking
par: Lanzendörfer, Luca A., et autres
Publié: (2025)
par: Lanzendörfer, Luca A., et autres
Publié: (2025)
MaskBeat: Loopable Drum Beat Generation
par: Lanzendörfer, Luca A., et autres
Publié: (2025)
par: Lanzendörfer, Luca A., et autres
Publié: (2025)
Parametric Neural Amp Modeling with Active Learning
par: Grötschla, Florian, et autres
Publié: (2025)
par: Grötschla, Florian, et autres
Publié: (2025)
SNAC: Multi-Scale Neural Audio Codec
par: Siuzdak, Hubert, et autres
Publié: (2024)
par: Siuzdak, Hubert, et autres
Publié: (2024)
High-Fidelity Speech Enhancement via Discrete Audio Tokens
par: Lanzendörfer, Luca A., et autres
Publié: (2025)
par: Lanzendörfer, Luca A., et autres
Publié: (2025)
Gibberish is All You Need for Membership Inference Detection in Contrastive Language-Audio Pretraining
par: Cheng, Ruoxi, et autres
Publié: (2024)
par: Cheng, Ruoxi, et autres
Publié: (2024)
CoLLAP: Contrastive Long-form Language-Audio Pretraining with Musical Temporal Structure Augmentation
par: Wu, Junda, et autres
Publié: (2024)
par: Wu, Junda, et autres
Publié: (2024)
Audio Mamba: Pretrained Audio State Space Model For Audio Tagging
par: Lin, Jiaju, et autres
Publié: (2024)
par: Lin, Jiaju, et autres
Publié: (2024)
EnCLAP: Combining Neural Audio Codec and Audio-Text Joint Embedding for Automated Audio Captioning
par: Kim, Jaeyeon, et autres
Publié: (2024)
par: Kim, Jaeyeon, et autres
Publié: (2024)
Towards Attention-based Contrastive Learning for Audio Spoof Detection
par: Goel, Chirag, et autres
Publié: (2024)
par: Goel, Chirag, et autres
Publié: (2024)
VCNAC: A Variable-Channel Neural Audio Codec for Mono, Stereo, and Surround Sound
par: Grötschla, Florian, et autres
Publié: (2026)
par: Grötschla, Florian, et autres
Publié: (2026)
SLAP: Scalable Language-Audio Pretraining with Variable-Duration Audio and Multi-Objective Training
par: Mei, Xinhao, et autres
Publié: (2026)
par: Mei, Xinhao, et autres
Publié: (2026)
Leveraging Speaker Embeddings in End-to-End Neural Diarization for Two-Speaker Scenarios
par: Alvarez-Trejos, Juan Ignacio, et autres
Publié: (2024)
par: Alvarez-Trejos, Juan Ignacio, et autres
Publié: (2024)
MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge
par: Jing, Xin, et autres
Publié: (2025)
par: Jing, Xin, et autres
Publié: (2025)
Unify Variables in Neural Scaling Laws for General Audio Representations via Embedding Effective Rank
par: Deng, Xuyao, et autres
Publié: (2025)
par: Deng, Xuyao, et autres
Publié: (2025)
Leveraging Whisper Embeddings for Audio-based Lyrics Matching
par: Mancini, Eleonora, et autres
Publié: (2025)
par: Mancini, Eleonora, et autres
Publié: (2025)
DASB - Discrete Audio and Speech Benchmark
par: Mousavi, Pooneh, et autres
Publié: (2024)
par: Mousavi, Pooneh, et autres
Publié: (2024)
HierCon: Hierarchical Contrastive Attention for Audio Deepfake Detection
par: Liang, Zhili Nicholas, et autres
Publié: (2026)
par: Liang, Zhili Nicholas, et autres
Publié: (2026)
Towards Controllable Audio Texture Morphing
par: Gupta, Chitralekha, et autres
Publié: (2023)
par: Gupta, Chitralekha, et autres
Publié: (2023)
Do Joint Language-Audio Embeddings Encode Perceptual Timbre Semantics?
par: Deng, Qixin, et autres
Publié: (2025)
par: Deng, Qixin, et autres
Publié: (2025)
AAT: Adapting Audio Transformer for Various Acoustics Recognition Tasks
par: Liang, Yun, et autres
Publié: (2024)
par: Liang, Yun, et autres
Publié: (2024)
CTC-aligned Audio-Text Embedding for Streaming Open-vocabulary Keyword Spotting
par: Jin, Sichen, et autres
Publié: (2024)
par: Jin, Sichen, et autres
Publié: (2024)
OpenSep: Leveraging Large Language Models with Textual Inversion for Open World Audio Separation
par: Mahmud, Tanvir, et autres
Publié: (2024)
par: Mahmud, Tanvir, et autres
Publié: (2024)
FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion
par: Chen, Shunian, et autres
Publié: (2025)
par: Chen, Shunian, et autres
Publié: (2025)
Leveraging Contrastive Learning and Self-Training for Multimodal Emotion Recognition with Limited Labeled Samples
par: Fan, Qi, et autres
Publié: (2024)
par: Fan, Qi, et autres
Publié: (2024)
Embedding Alignment in Code Generation for Audio
par: Kouteili, Sam, et autres
Publié: (2025)
par: Kouteili, Sam, et autres
Publié: (2025)
AHAMask: Reliable Task Specification for Large Audio Language Models without Instructions
par: Guo, Yiwei, et autres
Publié: (2025)
par: Guo, Yiwei, et autres
Publié: (2025)
The Computation of Generalized Embeddings for Underwater Acoustic Target Recognition using Contrastive Learning
par: Hummel, Hilde I., et autres
Publié: (2025)
par: Hummel, Hilde I., et autres
Publié: (2025)
Pretrained Conformers for Audio Fingerprinting and Retrieval
par: Altwlkany, Kemal, et autres
Publié: (2025)
par: Altwlkany, Kemal, et autres
Publié: (2025)
TTMBA: Towards Text To Multiple Sources Binaural Audio Generation
par: He, Yuxuan, et autres
Publié: (2025)
par: He, Yuxuan, et autres
Publié: (2025)
Prior-agnostic Multi-scale Contrastive Text-Audio Pre-training for Parallelized TTS Frontend Modeling
par: Wang, Quanxiu, et autres
Publié: (2024)
par: Wang, Quanxiu, et autres
Publié: (2024)
Universal Speech Token Learning via Low-Bitrate Neural Codec and Pretrained Representations
par: Jiang, Xue, et autres
Publié: (2025)
par: Jiang, Xue, et autres
Publié: (2025)
SpectroStream: A Versatile Neural Codec for General Audio
par: Li, Yunpeng, et autres
Publié: (2025)
par: Li, Yunpeng, et autres
Publié: (2025)
Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine
par: Kuznetsova, Anastasia, et autres
Publié: (2025)
par: Kuznetsova, Anastasia, et autres
Publié: (2025)
Audio Deepfake Detection in the Age of Advanced Text-to-Speech models
par: Singh, Robin, et autres
Publié: (2026)
par: Singh, Robin, et autres
Publié: (2026)
Exploring Musical Roots: Applying Audio Embeddings to Empower Influence Attribution for a Generative Music Model
par: Barnett, Julia, et autres
Publié: (2024)
par: Barnett, Julia, et autres
Publié: (2024)
Speech Enhancement Using Continuous Embeddings of Neural Audio Codec
par: Li, Haoyang, et autres
Publié: (2025)
par: Li, Haoyang, et autres
Publié: (2025)
Quantum-Inspired Audio Unlearning: Towards Privacy-Preserving Voice Biometrics
par: Pathak, Shreyansh, et autres
Publié: (2025)
par: Pathak, Shreyansh, et autres
Publié: (2025)
How Do Neural Spoofing Countermeasures Detect Partially Spoofed Audio?
par: Liu, Tianchi, et autres
Publié: (2024)
par: Liu, Tianchi, et autres
Publié: (2024)
Documents similaires
-
Audio Atlas: Visualizing and Exploring Audio Datasets
par: Lanzendörfer, Luca A., et autres
Publié: (2024) -
Multi-bit Audio Watermarking
par: Lanzendörfer, Luca A., et autres
Publié: (2025) -
MaskBeat: Loopable Drum Beat Generation
par: Lanzendörfer, Luca A., et autres
Publié: (2025) -
Parametric Neural Amp Modeling with Active Learning
par: Grötschla, Florian, et autres
Publié: (2025) -
SNAC: Multi-Scale Neural Audio Codec
par: Siuzdak, Hubert, et autres
Publié: (2024)