ADIFF: Explaining audio difference using natural language
Fuente:
arXiv
Guardado en:
| Autores principales: | Deshmukh, Soham, Han, Shuo, Singh, Rita, Raj, Bhiksha |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Mellow: a small audio language model for reasoning
por: Deshmukh, Soham, et al.
Publicado: (2025)
por: Deshmukh, Soham, et al.
Publicado: (2025)
Domain Adaptation for Contrastive Audio-Language Models
por: Deshmukh, Soham, et al.
Publicado: (2024)
por: Deshmukh, Soham, et al.
Publicado: (2024)
SELM: Enhancing Speech Emotion Recognition for Out-of-Domain Scenarios
por: Bukhari, Hazim, et al.
Publicado: (2024)
por: Bukhari, Hazim, et al.
Publicado: (2024)
Audio Entailment: Assessing Deductive Reasoning for Audio Understanding
por: Deshmukh, Soham, et al.
Publicado: (2024)
por: Deshmukh, Soham, et al.
Publicado: (2024)
MACE: Leveraging Audio for Evaluating Audio Captioning Systems
por: Dixit, Satvik, et al.
Publicado: (2024)
por: Dixit, Satvik, et al.
Publicado: (2024)
ADIFF: Explaining audio difference using natural language
por: Deshmukh, Soham, et al.
Publicado: (2025)
por: Deshmukh, Soham, et al.
Publicado: (2025)
Deciphering GunType Hierarchy through Acoustic Analysis of Gunshot Recordings
por: Shah, Ankit, et al.
Publicado: (2025)
por: Shah, Ankit, et al.
Publicado: (2025)
Human Voice is Unique
por: Singh, Rita, et al.
Publicado: (2025)
por: Singh, Rita, et al.
Publicado: (2025)
AURA Score: A Metric For Holistic Audio Question Answering Evaluation
por: Dixit, Satvik, et al.
Publicado: (2025)
por: Dixit, Satvik, et al.
Publicado: (2025)
Did You Hear That? Introducing AADG: A Framework for Generating Benchmark Data in Audio Anomaly Detection
por: Raghavan, Ksheeraja, et al.
Publicado: (2024)
por: Raghavan, Ksheeraja, et al.
Publicado: (2024)
CoLMbo: Speaker Language Model for Descriptive Profiling
por: Baali, Massa, et al.
Publicado: (2025)
por: Baali, Massa, et al.
Publicado: (2025)
PAM: Prompting Audio-Language Models for Audio Quality Assessment
por: Deshmukh, Soham, et al.
Publicado: (2024)
por: Deshmukh, Soham, et al.
Publicado: (2024)
Improving Speaker Representations Using Contrastive Losses on Multi-scale Features
por: Dixit, Satvik, et al.
Publicado: (2024)
por: Dixit, Satvik, et al.
Publicado: (2024)
Pengi: An Audio Language Model for Audio Tasks
por: Deshmukh, Soham, et al.
Publicado: (2023)
por: Deshmukh, Soham, et al.
Publicado: (2023)
DeWinder: Single-Channel Wind Noise Reduction using Ultrasound Sensing
por: Yuan, Kuang, et al.
Publicado: (2024)
por: Yuan, Kuang, et al.
Publicado: (2024)
Efficient Autoregressive Audio Modeling via Next-Scale Prediction
por: Qiu, Kai, et al.
Publicado: (2024)
por: Qiu, Kai, et al.
Publicado: (2024)
AudioMAE++: learning better masked audio representations with SwiGLU FFNs
por: Yadav, Sarthak, et al.
Publicado: (2025)
por: Yadav, Sarthak, et al.
Publicado: (2025)
GRAM: Spatial general-purpose audio representation models for real-world applications
por: Yuksel, Goksenin, et al.
Publicado: (2025)
por: Yuksel, Goksenin, et al.
Publicado: (2025)
Tessellated Linear Model for Age Prediction from Voice
por: Alharthi, Dareen, et al.
Publicado: (2025)
por: Alharthi, Dareen, et al.
Publicado: (2025)
What Do Speech Foundation Models Not Learn About Speech?
por: Waheed, Abdul, et al.
Publicado: (2024)
por: Waheed, Abdul, et al.
Publicado: (2024)
Evaluating and Improving Continual Learning in Spoken Language Understanding
por: Yang, Muqiao, et al.
Publicado: (2024)
por: Yang, Muqiao, et al.
Publicado: (2024)
Making deep neural networks work for medical audio: representation, compression and domain adaptation
por: Onu, Charles C
Publicado: (2025)
por: Onu, Charles C
Publicado: (2025)
An overview of neural architectures for self-supervised audio representation learning from masked spectrograms
por: Yadav, Sarthak, et al.
Publicado: (2025)
por: Yadav, Sarthak, et al.
Publicado: (2025)
AISTAT lab system for DCASE2025 Task6: Language-based audio retrieval
por: Kim, Hyun Jun, et al.
Publicado: (2025)
por: Kim, Hyun Jun, et al.
Publicado: (2025)
Enhanced Sound Event Localization and Detection in Real 360-degree audio-visual soundscapes
por: Roman, Adrian S., et al.
Publicado: (2024)
por: Roman, Adrian S., et al.
Publicado: (2024)
DualSpec: Text-to-spatial-audio Generation via Dual-Spectrogram Guided Diffusion Model
por: Zhao, Lei, et al.
Publicado: (2025)
por: Zhao, Lei, et al.
Publicado: (2025)
Where are we in audio deepfake detection? A systematic analysis over generative and detection models
por: Li, Xiang, et al.
Publicado: (2024)
por: Li, Xiang, et al.
Publicado: (2024)
Speaker anonymization using neural audio codec language models
por: Panariello, Michele, et al.
Publicado: (2023)
por: Panariello, Michele, et al.
Publicado: (2023)
Discriminating real and synthetic super-resolved audio samples using embedding-based classifiers
por: Silaev, Mikhail, et al.
Publicado: (2026)
por: Silaev, Mikhail, et al.
Publicado: (2026)
Omni-CLST: Error-aware Curriculum Learning with guided Selective chain-of-Thought for audio question answering
por: Zhao, Jinghua, et al.
Publicado: (2025)
por: Zhao, Jinghua, et al.
Publicado: (2025)
A sound description: Exploring prompt templates and class descriptions to enhance zero-shot audio classification
por: Olvera, Michel, et al.
Publicado: (2024)
por: Olvera, Michel, et al.
Publicado: (2024)
Towards audio language modeling -- an overview
por: Wu, Haibin, et al.
Publicado: (2024)
por: Wu, Haibin, et al.
Publicado: (2024)
Natural Language Supervision for General-Purpose Audio Representations
por: Elizalde, Benjamin, et al.
Publicado: (2023)
por: Elizalde, Benjamin, et al.
Publicado: (2023)
Sustaining model performance for covid-19 detection from dynamic audio data: Development and evaluation of a comprehensive drift-adaptive framework
por: Ganitidis, Theofanis, et al.
Publicado: (2024)
por: Ganitidis, Theofanis, et al.
Publicado: (2024)
Forensic deepfake audio detection using segmental speech features
por: Yang, Tianle, et al.
Publicado: (2025)
por: Yang, Tianle, et al.
Publicado: (2025)
Explaining Deep Learning Embeddings for Speech Emotion Recognition by Predicting Interpretable Acoustic Features
por: Dixit, Satvik, et al.
Publicado: (2024)
por: Dixit, Satvik, et al.
Publicado: (2024)
Improved Intelligibility of Dysarthric Speech using Conditional Flow Matching
por: Das, Shoutrik, et al.
Publicado: (2025)
por: Das, Shoutrik, et al.
Publicado: (2025)
Automated evaluation of children's speech fluency for low-resource languages
por: Zhang, Bowen, et al.
Publicado: (2025)
por: Zhang, Bowen, et al.
Publicado: (2025)
Semantic visually-guided acoustic highlighting with large vision-language models
por: Huang, Junhua, et al.
Publicado: (2026)
por: Huang, Junhua, et al.
Publicado: (2026)
Human-CLAP: Human-perception-based contrastive language-audio pretraining
por: Takano, Taisei, et al.
Publicado: (2025)
por: Takano, Taisei, et al.
Publicado: (2025)
Ejemplares similares
-
Mellow: a small audio language model for reasoning
por: Deshmukh, Soham, et al.
Publicado: (2025) -
Domain Adaptation for Contrastive Audio-Language Models
por: Deshmukh, Soham, et al.
Publicado: (2024) -
SELM: Enhancing Speech Emotion Recognition for Out-of-Domain Scenarios
por: Bukhari, Hazim, et al.
Publicado: (2024) -
Audio Entailment: Assessing Deductive Reasoning for Audio Understanding
por: Deshmukh, Soham, et al.
Publicado: (2024) -
MACE: Leveraging Audio for Evaluating Audio Captioning Systems
por: Dixit, Satvik, et al.
Publicado: (2024)