HEAR: Holistic Evaluation of Audio Representations
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Turian, Joseph, Shier, Jordie, Khan, Humair Raj, Raj, Bhiksha, Schuller, Björn W., Steinmetz, Christian J., Malloy, Colin, Tzanetakis, George, Velarde, Gissel, McNally, Kirk, Henry, Max, Pinto, Nicolas, Noufi, Camille, Clough, Christian, Herremans, Dorien, Fonseca, Eduardo, Engel, Jesse, Salamon, Justin, Esling, Philippe, Manocha, Pranay, Watanabe, Shinji, Jin, Zeyu, Bisk, Yonatan |
|---|---|
| Format: | Preprint |
| Publié: |
2022
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Real-time Timbre Remapping with Differentiable DSP
par: Shier, Jordie, et autres
Publié: (2024)
par: Shier, Jordie, et autres
Publié: (2024)
Are We There Yet? A Brief Survey of Music Emotion Prediction Datasets, Models and Outstanding Challenges
par: Kang, Jaeyong, et autres
Publié: (2024)
par: Kang, Jaeyong, et autres
Publié: (2024)
DisfluencySpeech -- Single-Speaker Conversational Speech Dataset with Paralanguage
par: Wang, Kyra, et autres
Publié: (2024)
par: Wang, Kyra, et autres
Publié: (2024)
PreBit -- A multimodal model with Twitter FinBERT embeddings for extreme price movement prediction of Bitcoin
par: Zou, Yanzhao, et autres
Publié: (2022)
par: Zou, Yanzhao, et autres
Publié: (2022)
Towards Unified Music Emotion Recognition across Dimensional and Categorical Models
par: Kang, Jaeyong, et autres
Publié: (2025)
par: Kang, Jaeyong, et autres
Publié: (2025)
Aligning Generative Music AI with Human Preferences: Methods and Challenges
par: Herremans, Dorien, et autres
Publié: (2025)
par: Herremans, Dorien, et autres
Publié: (2025)
DeepUnifiedMom: Unified Time-series Momentum Portfolio Construction via Multi-Task Learning with Multi-Gate Mixture of Experts
par: Ong, Joel, et autres
Publié: (2024)
par: Ong, Joel, et autres
Publié: (2024)
Anesthetic Considerations in Unvaccinated Pediatric Patients
par: Michael McNally, et autres
Publié: (2025)
par: Michael McNally, et autres
Publié: (2025)
Designing Neural Synthesizers for Low-Latency Interaction
par: Caspe, Franco, et autres
Publié: (2025)
par: Caspe, Franco, et autres
Publié: (2025)
Human Voice is Unique
par: Singh, Rita, et autres
Publié: (2025)
par: Singh, Rita, et autres
Publié: (2025)
APEX: Large-scale Multi-task Aesthetic-Informed Popularity Prediction for AI-Generated Music
par: Husain, Jaavid Aktar, et autres
Publié: (2026)
par: Husain, Jaavid Aktar, et autres
Publié: (2026)
Forecasting Bitcoin volatility spikes from whale transactions and CryptoQuant data using Synthesizer Transformer models
par: Herremans, Dorien, et autres
Publié: (2022)
par: Herremans, Dorien, et autres
Publié: (2022)
Media and Carbon Literacy: Shaping opportunities for cognitive engagement with Low Carbon Transition in Irish media, 2000-2013.
par: Brenda McNally
Publié: (2015)
par: Brenda McNally
Publié: (2015)
Non-Book Materials and Copyright.
par: McNally, Paul T.
Publié: (1978)
par: McNally, Paul T.
Publié: (1978)
Revisiting Acoustic Features for Robust ASR
par: Shah, Muhammad A., et autres
Publié: (2024)
par: Shah, Muhammad A., et autres
Publié: (2024)
KARMA-MV: A Benchmark for Causal Question Answering on Music Videos
par: Ghosh, Archishman, et autres
Publié: (2026)
par: Ghosh, Archishman, et autres
Publié: (2026)
BandCondiNet: Parallel Transformers-based Conditional Popular Music Generation with Multi-View Features
par: Luo, Jing, et autres
Publié: (2024)
par: Luo, Jing, et autres
Publié: (2024)
Leveraging LLM Embeddings for Cross Dataset Label Alignment and Zero Shot Music Emotion Prediction
par: Liu, Renhang, et autres
Publié: (2024)
par: Liu, Renhang, et autres
Publié: (2024)
Digital Lifelong Learning in the Age of AI: Trends and Insights
par: Puri, Geeta, et autres
Publié: (2026)
par: Puri, Geeta, et autres
Publié: (2026)
MidiCaps: A large-scale MIDI dataset with text captions
par: Melechovsky, Jan, et autres
Publié: (2024)
par: Melechovsky, Jan, et autres
Publié: (2024)
MIRFLEX: Music Information Retrieval Feature Library for Extraction
par: Chopra, Anuradha, et autres
Publié: (2024)
par: Chopra, Anuradha, et autres
Publié: (2024)
Smart Timing for Mining: A Deep Learning Framework for Bitcoin Hardware ROI Prediction
par: Wickramasinghe, Sithumi, et autres
Publié: (2025)
par: Wickramasinghe, Sithumi, et autres
Publié: (2025)
MERIT: Learning Disentangled Music Representations for Audio Similarity
par: Roy, Abhinaba, et autres
Publié: (2026)
par: Roy, Abhinaba, et autres
Publié: (2026)
SonicVerse: Multi-Task Learning for Music Feature-Informed Captioning
par: Chopra, Anuradha, et autres
Publié: (2025)
par: Chopra, Anuradha, et autres
Publié: (2025)
Text2midi-InferAlign: Improving Symbolic Music Generation with Inference-Time Alignment
par: Roy, Abhinaba, et autres
Publié: (2025)
par: Roy, Abhinaba, et autres
Publié: (2025)
Video2Music: Suitable Music Generation from Videos using an Affective Multimodal Transformer model
par: Kang, Jaeyong, et autres
Publié: (2023)
par: Kang, Jaeyong, et autres
Publié: (2023)
HEAR
Publié: (2023)
Publié: (2023)
Road atlas: United States, Canada, Mexic
par: Rand McNally and Company
par: Rand McNally and Company
A PRELIMINARY EXPLORATION OF THE DEVELOPMENT OF WISDOM IN ENTREPRENEURSHIP EDUCATION
par: Jeffrey J McNally
Publié: (2018)
par: Jeffrey J McNally
Publié: (2018)
Video in Libraries--An International Perspective. AV in Action 5.
par: McNally, Paul, Ed.
Publié: (1985)
par: McNally, Paul, Ed.
Publié: (1985)
Teaching Performance Measurement for Reference Service.
par: McNally, Peter F.
Publié: (1989)
par: McNally, Peter F.
Publié: (1989)
A Guide to the Practice of Non-Book Librarianship.
par: McNally, Paul Terence
Publié: (1972)
par: McNally, Paul Terence
Publié: (1972)
Fanfares and Celebrations: Anniversaries in Canadian Graduate Education for Library and Information Studies.
par: McNally, Peter F.
Publié: (1993)
par: McNally, Peter F.
Publié: (1993)
WhisperRT -- Turning Whisper into a Causal Streaming Model
par: Krichli, Tomer, et autres
Publié: (2025)
par: Krichli, Tomer, et autres
Publié: (2025)
MACE: Leveraging Audio for Evaluating Audio Captioning Systems
par: Dixit, Satvik, et autres
Publié: (2024)
par: Dixit, Satvik, et autres
Publié: (2024)
AURA Score: A Metric For Holistic Audio Question Answering Evaluation
par: Dixit, Satvik, et autres
Publié: (2025)
par: Dixit, Satvik, et autres
Publié: (2025)
Domain Adaptation for Contrastive Audio-Language Models
par: Deshmukh, Soham, et autres
Publié: (2024)
par: Deshmukh, Soham, et autres
Publié: (2024)
Large Language Model Guided Decoding for Self-Supervised Speech Recognition
par: Cohen, Eyal, et autres
Publié: (2025)
par: Cohen, Eyal, et autres
Publié: (2025)
DELULU: Discriminative Embedding Learning Using Latent Units for Speaker-Aware Self-Trained Speech Foundational Model
par: Baali, Massa, et autres
Publié: (2025)
par: Baali, Massa, et autres
Publié: (2025)
Performance of Machine Learning Classifiers for Anomaly Detection in Cyber Security Applications
par: Haug, Markus, et autres
Publié: (2025)
par: Haug, Markus, et autres
Publié: (2025)
Documents similaires
-
Real-time Timbre Remapping with Differentiable DSP
par: Shier, Jordie, et autres
Publié: (2024) -
Are We There Yet? A Brief Survey of Music Emotion Prediction Datasets, Models and Outstanding Challenges
par: Kang, Jaeyong, et autres
Publié: (2024) -
DisfluencySpeech -- Single-Speaker Conversational Speech Dataset with Paralanguage
par: Wang, Kyra, et autres
Publié: (2024) -
PreBit -- A multimodal model with Twitter FinBERT embeddings for extreme price movement prediction of Bitcoin
par: Zou, Yanzhao, et autres
Publié: (2022) -
Towards Unified Music Emotion Recognition across Dimensional and Categorical Models
par: Kang, Jaeyong, et autres
Publié: (2025)