Comprehensive Audio Query Handling System with Integrated Expert Models and Contextual Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Naveen, Vakada, Sridhar, Arvind Krishna, Guo, Yinyi, Visser, Erik |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LongAudio-RAG: Event-Grounded Question Answering over Multi-Hour Long Audio
di: Vakada, Naveen, et al.
Pubblicazione: (2026)
di: Vakada, Naveen, et al.
Pubblicazione: (2026)
Enhancing Temporal Understanding in Audio Question Answering for Large Audio Language Models
di: Sridhar, Arvind Krishna, et al.
Pubblicazione: (2024)
di: Sridhar, Arvind Krishna, et al.
Pubblicazione: (2024)
Resource-Efficient Reference-Free Evaluation of Audio Captions
di: Mahfuz, Rehana, et al.
Pubblicazione: (2024)
di: Mahfuz, Rehana, et al.
Pubblicazione: (2024)
Aligning Audio Captions with Human Preferences
di: Hegde, Kartik, et al.
Pubblicazione: (2025)
di: Hegde, Kartik, et al.
Pubblicazione: (2025)
Compositional Audio Representation Learning
di: Sridhar, Sripathi, et al.
Pubblicazione: (2024)
di: Sridhar, Sripathi, et al.
Pubblicazione: (2024)
VC-ENHANCE: Speech Restoration with Integrated Noise Suppression and Voice Conversion
di: Byun, Kyungguen, et al.
Pubblicazione: (2024)
di: Byun, Kyungguen, et al.
Pubblicazione: (2024)
Context-Aware Query Refinement for Target Sound Extraction: Handling Partially Matched Queries
di: Sato, Ryo, et al.
Pubblicazione: (2025)
di: Sato, Ryo, et al.
Pubblicazione: (2025)
Improving Query-by-Vocal Imitation with Contrastive Learning and Audio Pretraining
di: Greif, Jonathan, et al.
Pubblicazione: (2024)
di: Greif, Jonathan, et al.
Pubblicazione: (2024)
Towards Multimodal Query-Based Spatial Audio Source Extraction
di: Yu, Chenxin, et al.
Pubblicazione: (2025)
di: Yu, Chenxin, et al.
Pubblicazione: (2025)
Attention-Based Audio Embeddings for Query-by-Example
di: Singh, Anup, et al.
Pubblicazione: (2022)
di: Singh, Anup, et al.
Pubblicazione: (2022)
Adaptive Mixture of Low-Rank Experts for Robust Audio Spoofing Detection
di: Chen, Qixian, et al.
Pubblicazione: (2025)
di: Chen, Qixian, et al.
Pubblicazione: (2025)
SPUR: A Plug-and-Play Framework for Integrating Spatial Audio Understanding and Reasoning into Large Audio-Language Models
di: Sakshi, S, et al.
Pubblicazione: (2025)
di: Sakshi, S, et al.
Pubblicazione: (2025)
Audio Entailment: Assessing Deductive Reasoning for Audio Understanding
di: Deshmukh, Soham, et al.
Pubblicazione: (2024)
di: Deshmukh, Soham, et al.
Pubblicazione: (2024)
Audio-Mind: An Auditable Agentic Framework for Audio Understanding
di: Wang, Yucheng, et al.
Pubblicazione: (2026)
di: Wang, Yucheng, et al.
Pubblicazione: (2026)
Can Large Language Models Understand Spatial Audio?
di: Tang, Changli, et al.
Pubblicazione: (2024)
di: Tang, Changli, et al.
Pubblicazione: (2024)
From Contrast to Commonality: Audio Commonality Captioning for Enhanced Audio-Text Cross-modal Understanding in Multimodal LLMs
di: Jia, Yuhang, et al.
Pubblicazione: (2025)
di: Jia, Yuhang, et al.
Pubblicazione: (2025)
Voice-ENHANCE: Speech Restoration using a Diffusion-based Voice Conversion Framework
di: Byun, Kyungguen, et al.
Pubblicazione: (2025)
di: Byun, Kyungguen, et al.
Pubblicazione: (2025)
Audio-Cogito: Towards Deep Audio Reasoning in Large Audio Language Models
di: Li, Longhao, et al.
Pubblicazione: (2026)
di: Li, Longhao, et al.
Pubblicazione: (2026)
A Generalist Audio Foundation Model for Comprehensive Body Sound Auscultation
di: Wang, Pingjie, et al.
Pubblicazione: (2024)
di: Wang, Pingjie, et al.
Pubblicazione: (2024)
Comprehensive Layer-wise Analysis of SSL Models for Audio Deepfake Detection
di: Kheir, Yassine El, et al.
Pubblicazione: (2025)
di: Kheir, Yassine El, et al.
Pubblicazione: (2025)
TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models
di: Wang, Hui, et al.
Pubblicazione: (2025)
di: Wang, Hui, et al.
Pubblicazione: (2025)
A Reference-free Metric for Language-Queried Audio Source Separation using Contrastive Language-Audio Pretraining
di: Xiao, Feiyang, et al.
Pubblicazione: (2024)
di: Xiao, Feiyang, et al.
Pubblicazione: (2024)
Listening with Time: Precise Temporal Awareness for Long-Form Audio Understanding
di: Shao, Mingchen, et al.
Pubblicazione: (2026)
di: Shao, Mingchen, et al.
Pubblicazione: (2026)
Leveraging Audio-Only Data for Text-Queried Target Sound Extraction
di: Saijo, Kohei, et al.
Pubblicazione: (2024)
di: Saijo, Kohei, et al.
Pubblicazione: (2024)
Exploring Text-Queried Sound Event Detection with Audio Source Separation
di: Yin, Han, et al.
Pubblicazione: (2024)
di: Yin, Han, et al.
Pubblicazione: (2024)
MiDashengLM: Efficient Audio Understanding with General Audio Captions
di: Dinkel, Heinrich, et al.
Pubblicazione: (2025)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2025)
Integrating Continuous and Binary Relevances in Audio-Text Relevance Learning
di: Xie, Huang, et al.
Pubblicazione: (2024)
di: Xie, Huang, et al.
Pubblicazione: (2024)
A Comprehensive Review and Taxonomy of Audio-Visual Synchronization Techniques for Realistic Speech Animation
di: Fernandes, Jose Geraldo, et al.
Pubblicazione: (2024)
di: Fernandes, Jose Geraldo, et al.
Pubblicazione: (2024)
Improving ASR Contextual Biasing with Guided Attention
di: Tang, Jiyang, et al.
Pubblicazione: (2024)
di: Tang, Jiyang, et al.
Pubblicazione: (2024)
Automatic Contextual Audio Denoising
di: Luong, Diep, et al.
Pubblicazione: (2026)
di: Luong, Diep, et al.
Pubblicazione: (2026)
SALM: Spatial Audio Language Model with Structured Embeddings for Understanding and Editing
di: Hu, Jinbo, et al.
Pubblicazione: (2025)
di: Hu, Jinbo, et al.
Pubblicazione: (2025)
Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities
di: Ghosh, Sreyan, et al.
Pubblicazione: (2025)
di: Ghosh, Sreyan, et al.
Pubblicazione: (2025)
From Audio Encoders to Piano Judges: Benchmarking Performance Understanding for Solo Piano
di: Zhang, Huan, et al.
Pubblicazione: (2024)
di: Zhang, Huan, et al.
Pubblicazione: (2024)
Measuring Audio's Impact on Correctness: Audio-Contribution-Aware Post-Training of Large Audio Language Models
di: He, Haolin, et al.
Pubblicazione: (2025)
di: He, Haolin, et al.
Pubblicazione: (2025)
A Survey of Audio Reasoning in Multimodal Foundation Models
di: Guo, Zhihan, et al.
Pubblicazione: (2026)
di: Guo, Zhihan, et al.
Pubblicazione: (2026)
Audio-Visual Speech Enhancement in Noisy Environments via Emotion-Based Contextual Cues
di: Hussain, Tassadaq, et al.
Pubblicazione: (2024)
di: Hussain, Tassadaq, et al.
Pubblicazione: (2024)
AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models
di: Bai, Jisheng, et al.
Pubblicazione: (2024)
di: Bai, Jisheng, et al.
Pubblicazione: (2024)
An Adaptive CMSA for Solving the Longest Filled Common Subsequence Problem with an Application in Audio Querying
di: Djukanovic, Marko, et al.
Pubblicazione: (2025)
di: Djukanovic, Marko, et al.
Pubblicazione: (2025)
Task-Aware Answer Preservation under Audio Compression for Large Audio Language Models
di: Ivry, Amir
Pubblicazione: (2026)
di: Ivry, Amir
Pubblicazione: (2026)
MACE: Leveraging Audio for Evaluating Audio Captioning Systems
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
Documenti analoghi
-
LongAudio-RAG: Event-Grounded Question Answering over Multi-Hour Long Audio
di: Vakada, Naveen, et al.
Pubblicazione: (2026) -
Enhancing Temporal Understanding in Audio Question Answering for Large Audio Language Models
di: Sridhar, Arvind Krishna, et al.
Pubblicazione: (2024) -
Resource-Efficient Reference-Free Evaluation of Audio Captions
di: Mahfuz, Rehana, et al.
Pubblicazione: (2024) -
Aligning Audio Captions with Human Preferences
di: Hegde, Kartik, et al.
Pubblicazione: (2025) -
Compositional Audio Representation Learning
di: Sridhar, Sripathi, et al.
Pubblicazione: (2024)