Mellow: a small audio language model for reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Deshmukh, Soham, Dixit, Satvik, Singh, Rita, Raj, Bhiksha |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ADIFF: Explaining audio difference using natural language
di: Deshmukh, Soham, et al.
Pubblicazione: (2025)
di: Deshmukh, Soham, et al.
Pubblicazione: (2025)
MACE: Leveraging Audio for Evaluating Audio Captioning Systems
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
AURA Score: A Metric For Holistic Audio Question Answering Evaluation
di: Dixit, Satvik, et al.
Pubblicazione: (2025)
di: Dixit, Satvik, et al.
Pubblicazione: (2025)
Domain Adaptation for Contrastive Audio-Language Models
di: Deshmukh, Soham, et al.
Pubblicazione: (2024)
di: Deshmukh, Soham, et al.
Pubblicazione: (2024)
Improving Speaker Representations Using Contrastive Losses on Multi-scale Features
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
SELM: Enhancing Speech Emotion Recognition for Out-of-Domain Scenarios
di: Bukhari, Hazim, et al.
Pubblicazione: (2024)
di: Bukhari, Hazim, et al.
Pubblicazione: (2024)
Deciphering GunType Hierarchy through Acoustic Analysis of Gunshot Recordings
di: Shah, Ankit, et al.
Pubblicazione: (2025)
di: Shah, Ankit, et al.
Pubblicazione: (2025)
Human Voice is Unique
di: Singh, Rita, et al.
Pubblicazione: (2025)
di: Singh, Rita, et al.
Pubblicazione: (2025)
Audio Entailment: Assessing Deductive Reasoning for Audio Understanding
di: Deshmukh, Soham, et al.
Pubblicazione: (2024)
di: Deshmukh, Soham, et al.
Pubblicazione: (2024)
Did You Hear That? Introducing AADG: A Framework for Generating Benchmark Data in Audio Anomaly Detection
di: Raghavan, Ksheeraja, et al.
Pubblicazione: (2024)
di: Raghavan, Ksheeraja, et al.
Pubblicazione: (2024)
FoleyBench: A Benchmark For Video-to-Audio Models
di: Dixit, Satvik, et al.
Pubblicazione: (2025)
di: Dixit, Satvik, et al.
Pubblicazione: (2025)
PAM: Prompting Audio-Language Models for Audio Quality Assessment
di: Deshmukh, Soham, et al.
Pubblicazione: (2024)
di: Deshmukh, Soham, et al.
Pubblicazione: (2024)
Explaining Deep Learning Embeddings for Speech Emotion Recognition by Predicting Interpretable Acoustic Features
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
Pengi: An Audio Language Model for Audio Tasks
di: Deshmukh, Soham, et al.
Pubblicazione: (2023)
di: Deshmukh, Soham, et al.
Pubblicazione: (2023)
CoLMbo: Speaker Language Model for Descriptive Profiling
di: Baali, Massa, et al.
Pubblicazione: (2025)
di: Baali, Massa, et al.
Pubblicazione: (2025)
GRAM: Spatial general-purpose audio representation models for real-world applications
di: Yuksel, Goksenin, et al.
Pubblicazione: (2025)
di: Yuksel, Goksenin, et al.
Pubblicazione: (2025)
Efficient Autoregressive Audio Modeling via Next-Scale Prediction
di: Qiu, Kai, et al.
Pubblicazione: (2024)
di: Qiu, Kai, et al.
Pubblicazione: (2024)
Towards audio language modeling -- an overview
di: Wu, Haibin, et al.
Pubblicazione: (2024)
di: Wu, Haibin, et al.
Pubblicazione: (2024)
Where are we in audio deepfake detection? A systematic analysis over generative and detection models
di: Li, Xiang, et al.
Pubblicazione: (2024)
di: Li, Xiang, et al.
Pubblicazione: (2024)
Vision Language Models Are Few-Shot Audio Spectrogram Classifiers
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
Sustaining model performance for covid-19 detection from dynamic audio data: Development and evaluation of a comprehensive drift-adaptive framework
di: Ganitidis, Theofanis, et al.
Pubblicazione: (2024)
di: Ganitidis, Theofanis, et al.
Pubblicazione: (2024)
AudioMAE++: learning better masked audio representations with SwiGLU FFNs
di: Yadav, Sarthak, et al.
Pubblicazione: (2025)
di: Yadav, Sarthak, et al.
Pubblicazione: (2025)
Tessellated Linear Model for Age Prediction from Voice
di: Alharthi, Dareen, et al.
Pubblicazione: (2025)
di: Alharthi, Dareen, et al.
Pubblicazione: (2025)
What Do Speech Foundation Models Not Learn About Speech?
di: Waheed, Abdul, et al.
Pubblicazione: (2024)
di: Waheed, Abdul, et al.
Pubblicazione: (2024)
Evaluating and Improving Continual Learning in Spoken Language Understanding
di: Yang, Muqiao, et al.
Pubblicazione: (2024)
di: Yang, Muqiao, et al.
Pubblicazione: (2024)
Making deep neural networks work for medical audio: representation, compression and domain adaptation
di: Onu, Charles C
Pubblicazione: (2025)
di: Onu, Charles C
Pubblicazione: (2025)
An overview of neural architectures for self-supervised audio representation learning from masked spectrograms
di: Yadav, Sarthak, et al.
Pubblicazione: (2025)
di: Yadav, Sarthak, et al.
Pubblicazione: (2025)
AISTAT lab system for DCASE2025 Task6: Language-based audio retrieval
di: Kim, Hyun Jun, et al.
Pubblicazione: (2025)
di: Kim, Hyun Jun, et al.
Pubblicazione: (2025)
Enhanced Sound Event Localization and Detection in Real 360-degree audio-visual soundscapes
di: Roman, Adrian S., et al.
Pubblicazione: (2024)
di: Roman, Adrian S., et al.
Pubblicazione: (2024)
DualSpec: Text-to-spatial-audio Generation via Dual-Spectrogram Guided Diffusion Model
di: Zhao, Lei, et al.
Pubblicazione: (2025)
di: Zhao, Lei, et al.
Pubblicazione: (2025)
Speaker anonymization using neural audio codec language models
di: Panariello, Michele, et al.
Pubblicazione: (2023)
di: Panariello, Michele, et al.
Pubblicazione: (2023)
Omni-CLST: Error-aware Curriculum Learning with guided Selective chain-of-Thought for audio question answering
di: Zhao, Jinghua, et al.
Pubblicazione: (2025)
di: Zhao, Jinghua, et al.
Pubblicazione: (2025)
A sound description: Exploring prompt templates and class descriptions to enhance zero-shot audio classification
di: Olvera, Michel, et al.
Pubblicazione: (2024)
di: Olvera, Michel, et al.
Pubblicazione: (2024)
Semantic visually-guided acoustic highlighting with large vision-language models
di: Huang, Junhua, et al.
Pubblicazione: (2026)
di: Huang, Junhua, et al.
Pubblicazione: (2026)
Natural Language Supervision for General-Purpose Audio Representations
di: Elizalde, Benjamin, et al.
Pubblicazione: (2023)
di: Elizalde, Benjamin, et al.
Pubblicazione: (2023)
ParaCLAP -- Towards a general language-audio model for computational paralinguistic tasks
di: Jing, Xin, et al.
Pubblicazione: (2024)
di: Jing, Xin, et al.
Pubblicazione: (2024)
Discriminating real and synthetic super-resolved audio samples using embedding-based classifiers
di: Silaev, Mikhail, et al.
Pubblicazione: (2026)
di: Silaev, Mikhail, et al.
Pubblicazione: (2026)
Automated evaluation of children's speech fluency for low-resource languages
di: Zhang, Bowen, et al.
Pubblicazione: (2025)
di: Zhang, Bowen, et al.
Pubblicazione: (2025)
Learning Perceptually Relevant Temporal Envelope Morphing
di: Dixit, Satvik, et al.
Pubblicazione: (2025)
di: Dixit, Satvik, et al.
Pubblicazione: (2025)
Human-CLAP: Human-perception-based contrastive language-audio pretraining
di: Takano, Taisei, et al.
Pubblicazione: (2025)
di: Takano, Taisei, et al.
Pubblicazione: (2025)
Documenti analoghi
-
ADIFF: Explaining audio difference using natural language
di: Deshmukh, Soham, et al.
Pubblicazione: (2025) -
MACE: Leveraging Audio for Evaluating Audio Captioning Systems
di: Dixit, Satvik, et al.
Pubblicazione: (2024) -
AURA Score: A Metric For Holistic Audio Question Answering Evaluation
di: Dixit, Satvik, et al.
Pubblicazione: (2025) -
Domain Adaptation for Contrastive Audio-Language Models
di: Deshmukh, Soham, et al.
Pubblicazione: (2024) -
Improving Speaker Representations Using Contrastive Losses on Multi-scale Features
di: Dixit, Satvik, et al.
Pubblicazione: (2024)