LongAudio-RAG: Event-Grounded Question Answering over Multi-Hour Long Audio
Fuente:
arXiv
Salvato in:
| Autori principali: | Vakada, Naveen, Hegde, Kartik, Sridhar, Arvind Krishna, Guo, Yinyi, Visser, Erik |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Comprehensive Audio Query Handling System with Integrated Expert Models and Contextual Understanding
di: Naveen, Vakada, et al.
Pubblicazione: (2024)
di: Naveen, Vakada, et al.
Pubblicazione: (2024)
Enhancing Temporal Understanding in Audio Question Answering for Large Audio Language Models
di: Sridhar, Arvind Krishna, et al.
Pubblicazione: (2024)
di: Sridhar, Arvind Krishna, et al.
Pubblicazione: (2024)
Aligning Audio Captions with Human Preferences
di: Hegde, Kartik, et al.
Pubblicazione: (2025)
di: Hegde, Kartik, et al.
Pubblicazione: (2025)
Resource-Efficient Reference-Free Evaluation of Audio Captions
di: Mahfuz, Rehana, et al.
Pubblicazione: (2024)
di: Mahfuz, Rehana, et al.
Pubblicazione: (2024)
Improving Audio Question Answering with Variational Inference
di: Chen, Haolin
Pubblicazione: (2026)
di: Chen, Haolin
Pubblicazione: (2026)
Multi-Source Evidence Fusion for Audio Question Answering
di: Olev, Aivo, et al.
Pubblicazione: (2026)
di: Olev, Aivo, et al.
Pubblicazione: (2026)
AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning
di: Zhang, Haoyu, et al.
Pubblicazione: (2025)
di: Zhang, Haoyu, et al.
Pubblicazione: (2025)
Data-Balanced Curriculum Learning for Audio Question Answering
di: Wijngaard, Gijs, et al.
Pubblicazione: (2025)
di: Wijngaard, Gijs, et al.
Pubblicazione: (2025)
Towards Spatial Audio Understanding via Question Answering
di: Sudarsanam, Parthasaarathy, et al.
Pubblicazione: (2025)
di: Sudarsanam, Parthasaarathy, et al.
Pubblicazione: (2025)
Compositional Audio Representation Learning
di: Sridhar, Sripathi, et al.
Pubblicazione: (2024)
di: Sridhar, Sripathi, et al.
Pubblicazione: (2024)
AudioLog: LLMs-Powered Long Audio Logging with Hybrid Token-Semantic Contrastive Learning
di: Bai, Jisheng, et al.
Pubblicazione: (2023)
di: Bai, Jisheng, et al.
Pubblicazione: (2023)
AudioNet: Supervised Deep Hashing for Retrieval of Similar Audio Events
di: Dutta, Sagar, et al.
Pubblicazione: (2025)
di: Dutta, Sagar, et al.
Pubblicazione: (2025)
AudioRAG: A Challenging Benchmark for Audio Reasoning and Information Retrieval
di: Lin, Jingru, et al.
Pubblicazione: (2026)
di: Lin, Jingru, et al.
Pubblicazione: (2026)
AURA Score: A Metric For Holistic Audio Question Answering Evaluation
di: Dixit, Satvik, et al.
Pubblicazione: (2025)
di: Dixit, Satvik, et al.
Pubblicazione: (2025)
Listening with Time: Precise Temporal Awareness for Long-Form Audio Understanding
di: Shao, Mingchen, et al.
Pubblicazione: (2026)
di: Shao, Mingchen, et al.
Pubblicazione: (2026)
LongCat-Audio-Codec: An Audio Tokenizer and Detokenizer Solution Designed for Speech Large Language Models
di: Zhao, Xiaohan, et al.
Pubblicazione: (2025)
di: Zhao, Xiaohan, et al.
Pubblicazione: (2025)
Unified Audio Event Detection
di: Jiang, Yidi, et al.
Pubblicazione: (2024)
di: Jiang, Yidi, et al.
Pubblicazione: (2024)
Train Short, Infer Long: Speech-LLM Enables Zero-Shot Streamable Joint ASR and Diarization on Long Audio
di: Shi, Mohan, et al.
Pubblicazione: (2025)
di: Shi, Mohan, et al.
Pubblicazione: (2025)
LoVA: Long-form Video-to-Audio Generation
di: Cheng, Xin, et al.
Pubblicazione: (2024)
di: Cheng, Xin, et al.
Pubblicazione: (2024)
Spatial Audio Question Answering and Reasoning on Dynamic Source Movements
di: Sridhar, Arvind Krishna, et al.
Pubblicazione: (2026)
di: Sridhar, Arvind Krishna, et al.
Pubblicazione: (2026)
Audio-Cogito: Towards Deep Audio Reasoning in Large Audio Language Models
di: Li, Longhao, et al.
Pubblicazione: (2026)
di: Li, Longhao, et al.
Pubblicazione: (2026)
Towards Weakly Supervised Text-to-Audio Grounding
di: Xu, Xuenan, et al.
Pubblicazione: (2024)
di: Xu, Xuenan, et al.
Pubblicazione: (2024)
AudioSpa: Spatializing Sound Events with Text
di: Feng, Linfeng, et al.
Pubblicazione: (2025)
di: Feng, Linfeng, et al.
Pubblicazione: (2025)
Advancing Multi-grained Alignment for Contrastive Language-Audio Pre-training
di: Li, Yiming, et al.
Pubblicazione: (2024)
di: Li, Yiming, et al.
Pubblicazione: (2024)
InfiniteAudio: Infinite-Length Audio Generation with Consistency
di: Jung, Chaeyoung, et al.
Pubblicazione: (2025)
di: Jung, Chaeyoung, et al.
Pubblicazione: (2025)
Measuring Audio's Impact on Correctness: Audio-Contribution-Aware Post-Training of Large Audio Language Models
di: He, Haolin, et al.
Pubblicazione: (2025)
di: He, Haolin, et al.
Pubblicazione: (2025)
SemanticAudio: Audio Generation and Editing in Semantic Space
di: Dai, Zheqi, et al.
Pubblicazione: (2026)
di: Dai, Zheqi, et al.
Pubblicazione: (2026)
Audio-Language Datasets of Scenes and Events: A Survey
di: Wijngaard, Gijs, et al.
Pubblicazione: (2024)
di: Wijngaard, Gijs, et al.
Pubblicazione: (2024)
Aud-Sur: An Audio Analyzer Assistant for Audio Surveillance Applications
di: Lam, Phat, et al.
Pubblicazione: (2025)
di: Lam, Phat, et al.
Pubblicazione: (2025)
SALAD-VAE: Semantic Audio Compression with Language-Audio Distillation
di: Braun, Sebastian, et al.
Pubblicazione: (2025)
di: Braun, Sebastian, et al.
Pubblicazione: (2025)
Improving Audio Spectrogram Transformers for Sound Event Detection Through Multi-Stage Training
di: Schmid, Florian, et al.
Pubblicazione: (2024)
di: Schmid, Florian, et al.
Pubblicazione: (2024)
LCB-net: Long-Context Biasing for Audio-Visual Speech Recognition
di: Yu, Fan, et al.
Pubblicazione: (2024)
di: Yu, Fan, et al.
Pubblicazione: (2024)
AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models
di: Bai, Jisheng, et al.
Pubblicazione: (2024)
di: Bai, Jisheng, et al.
Pubblicazione: (2024)
CASTELLA: Long Audio Dataset with Captions and Temporal Boundaries
di: Munakata, Hokuto, et al.
Pubblicazione: (2025)
di: Munakata, Hokuto, et al.
Pubblicazione: (2025)
Lightweight Audio Segmentation for Long-form Speech Translation
di: Lee, Jaesong, et al.
Pubblicazione: (2024)
di: Lee, Jaesong, et al.
Pubblicazione: (2024)
Audio Deepfake Detection with Self-Supervised WavLM and Multi-Fusion Attentive Classifier
di: Guo, Yinlin, et al.
Pubblicazione: (2023)
di: Guo, Yinlin, et al.
Pubblicazione: (2023)
LongCat-AudioDiT: High-Fidelity Diffusion Text-to-Speech in the Waveform Latent Space
di: Xin, Detai, et al.
Pubblicazione: (2026)
di: Xin, Detai, et al.
Pubblicazione: (2026)
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
di: Yang, Dongchao, et al.
Pubblicazione: (2023)
di: Yang, Dongchao, et al.
Pubblicazione: (2023)
Optimal Transport Audio Distance with Learned Riemannian Ground Metrics
di: Jeong, Wonwoo
Pubblicazione: (2026)
di: Jeong, Wonwoo
Pubblicazione: (2026)
SHMamba: Structured Hyperbolic State Space Model for Audio-Visual Question Answering
di: Yang, Zhe, et al.
Pubblicazione: (2024)
di: Yang, Zhe, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Comprehensive Audio Query Handling System with Integrated Expert Models and Contextual Understanding
di: Naveen, Vakada, et al.
Pubblicazione: (2024) -
Enhancing Temporal Understanding in Audio Question Answering for Large Audio Language Models
di: Sridhar, Arvind Krishna, et al.
Pubblicazione: (2024) -
Aligning Audio Captions with Human Preferences
di: Hegde, Kartik, et al.
Pubblicazione: (2025) -
Resource-Efficient Reference-Free Evaluation of Audio Captions
di: Mahfuz, Rehana, et al.
Pubblicazione: (2024) -
Improving Audio Question Answering with Variational Inference
di: Chen, Haolin
Pubblicazione: (2026)