Adaptive Evidence Weighting for Audio-Spatiotemporal Fusion
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Ovanger, Oscar, Harris, Levi, Keitt, Timothy H. |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Are Audio-Language Models Listening? Audio-Specialist Heads for Adaptive Audio Steering
von: Glazer, Neta, et al.
Veröffentlicht: (2026)
von: Glazer, Neta, et al.
Veröffentlicht: (2026)
Audio-Guided Dynamic Modality Fusion with Stereo-Aware Attention for Audio-Visual Navigation
von: Li, Jia, et al.
Veröffentlicht: (2025)
von: Li, Jia, et al.
Veröffentlicht: (2025)
Deepfake Audio Detection Using Self-supervised Fusion Representations
von: Zaman, Khalid, et al.
Veröffentlicht: (2026)
von: Zaman, Khalid, et al.
Veröffentlicht: (2026)
EvA: An Evidence-First Audio Understanding Paradigm for LALMs
von: Xie, Xinyuan, et al.
Veröffentlicht: (2026)
von: Xie, Xinyuan, et al.
Veröffentlicht: (2026)
HarmonicAttack: An Adaptive Cross-Domain Audio Watermark Removal
von: Li, Kexin, et al.
Veröffentlicht: (2025)
von: Li, Kexin, et al.
Veröffentlicht: (2025)
MSMT-FN: Multi-segment Multi-task Fusion Network for Marketing Audio Classification
von: Liu, HongYu, et al.
Veröffentlicht: (2025)
von: Liu, HongYu, et al.
Veröffentlicht: (2025)
DGFNet: End-to-End Audio-Visual Source Separation Based on Dynamic Gating Fusion
von: Yu, Yinfeng, et al.
Veröffentlicht: (2025)
von: Yu, Yinfeng, et al.
Veröffentlicht: (2025)
Towards Explicit Acoustic Evidence Perception in Audio LLMs for Speech Deepfake Detection
von: Guo, Xiaoxuan, et al.
Veröffentlicht: (2026)
von: Guo, Xiaoxuan, et al.
Veröffentlicht: (2026)
Audio Spatially-Guided Fusion for Audio-Visual Navigation
von: Zhou, Xinyu, et al.
Veröffentlicht: (2026)
von: Zhou, Xinyu, et al.
Veröffentlicht: (2026)
Rebellion: Noise-Robust Reasoning Training for Audio Reasoning Models
von: Huang, Tiansheng, et al.
Veröffentlicht: (2025)
von: Huang, Tiansheng, et al.
Veröffentlicht: (2025)
FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion
von: Chen, Shunian, et al.
Veröffentlicht: (2025)
von: Chen, Shunian, et al.
Veröffentlicht: (2025)
Eureka-Audio: Triggering Audio Intelligence in Compact Language Models
von: Zhang, Dan, et al.
Veröffentlicht: (2026)
von: Zhang, Dan, et al.
Veröffentlicht: (2026)
Modality-Specific Speech Enhancement and Noise-Adaptive Fusion for Acoustic and Body-Conduction Microphone Framework
von: Kim, Yunsik, et al.
Veröffentlicht: (2025)
von: Kim, Yunsik, et al.
Veröffentlicht: (2025)
AudioMoG: Guiding Audio Generation with Mixture-of-Guidance
von: Wang, Junyou, et al.
Veröffentlicht: (2025)
von: Wang, Junyou, et al.
Veröffentlicht: (2025)
Spatial-Aware Conditioned Fusion for Audio-Visual Navigation
von: Wu, Shaohang, et al.
Veröffentlicht: (2026)
von: Wu, Shaohang, et al.
Veröffentlicht: (2026)
Audio-Guided Fusion Techniques for Multimodal Emotion Analysis
von: Shi, Pujin, et al.
Veröffentlicht: (2024)
von: Shi, Pujin, et al.
Veröffentlicht: (2024)
The Sonar Moment: Benchmarking Audio-Language Models in Audio Geo-Localization
von: Zhang, Ruixing, et al.
Veröffentlicht: (2026)
von: Zhang, Ruixing, et al.
Veröffentlicht: (2026)
MeanAudio: Fast and Faithful Text-to-Audio Generation with Mean Flows
von: Li, Xiquan, et al.
Veröffentlicht: (2025)
von: Li, Xiquan, et al.
Veröffentlicht: (2025)
AudioMotionBench: Evaluating Auditory Motion Perception in Audio LLMs
von: Sun, Zhe, et al.
Veröffentlicht: (2025)
von: Sun, Zhe, et al.
Veröffentlicht: (2025)
Stable Audio 3
von: Evans, Zach, et al.
Veröffentlicht: (2026)
von: Evans, Zach, et al.
Veröffentlicht: (2026)
AudioSAE: Towards Understanding of Audio-Processing Models with Sparse AutoEncoders
von: Aparin, Georgii, et al.
Veröffentlicht: (2026)
von: Aparin, Georgii, et al.
Veröffentlicht: (2026)
Audio-Maestro: Enhancing Large Audio-Language Models with Tool-Augmented Reasoning
von: Lee, Kuan-Yi, et al.
Veröffentlicht: (2025)
von: Lee, Kuan-Yi, et al.
Veröffentlicht: (2025)
AudioCapBench: Quick Evaluation on Audio Captioning across Sound, Music, and Speech
von: Qiu, Jielin, et al.
Veröffentlicht: (2026)
von: Qiu, Jielin, et al.
Veröffentlicht: (2026)
AudioGuard: Toward Comprehensive Audio Safety Protection Across Diverse Threat Models
von: Kang, Mintong, et al.
Veröffentlicht: (2026)
von: Kang, Mintong, et al.
Veröffentlicht: (2026)
HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models
von: Zhao, Feiyu, et al.
Veröffentlicht: (2026)
von: Zhao, Feiyu, et al.
Veröffentlicht: (2026)
Reliability-Aware Geometric Fusion for Robust Audio-Visual Navigation
von: Liu, Teng, et al.
Veröffentlicht: (2026)
von: Liu, Teng, et al.
Veröffentlicht: (2026)
MOSS-Audio Technical Report
von: Yang, Chen, et al.
Veröffentlicht: (2026)
von: Yang, Chen, et al.
Veröffentlicht: (2026)
Interpretable All-Type Audio Deepfake Detection with Audio LLMs via Frequency-Time Reinforcement Learning
von: Xie, Yuankun, et al.
Veröffentlicht: (2026)
von: Xie, Yuankun, et al.
Veröffentlicht: (2026)
Codec-Robust Attacks on Audio LLMs
von: Roh, Jaechul, et al.
Veröffentlicht: (2026)
von: Roh, Jaechul, et al.
Veröffentlicht: (2026)
PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation
von: Xie, Tianxin, et al.
Veröffentlicht: (2025)
von: Xie, Tianxin, et al.
Veröffentlicht: (2025)
VidAudio-Bench: Benchmarking V2A and VT2A Generation across Four Audio Categories
von: Zhang, Qian, et al.
Veröffentlicht: (2026)
von: Zhang, Qian, et al.
Veröffentlicht: (2026)
Towards Fine-grained Temporal Perception: Post-Training Large Audio-Language Models with Audio-Side Time Prompt
von: Shi, Yanfeng, et al.
Veröffentlicht: (2026)
von: Shi, Yanfeng, et al.
Veröffentlicht: (2026)
Improving Audio Event Recognition with Consistency Regularization
von: Sadhu, Shanmuka, et al.
Veröffentlicht: (2025)
von: Sadhu, Shanmuka, et al.
Veröffentlicht: (2025)
TDFNet: An Efficient Audio-Visual Speech Separation Model with Top-down Fusion
von: Pegg, Samuel, et al.
Veröffentlicht: (2024)
von: Pegg, Samuel, et al.
Veröffentlicht: (2024)
Tadabur: A Large-Scale Quran Audio Dataset
von: Alherran, Faisal
Veröffentlicht: (2026)
von: Alherran, Faisal
Veröffentlicht: (2026)
Latent-Mark: An Audio Watermark Robust to Neural Resynthesis
von: Chen, Yen-Shan, et al.
Veröffentlicht: (2026)
von: Chen, Yen-Shan, et al.
Veröffentlicht: (2026)
ATIR: Towards Audio-Text Interleaved Contextual Retrieval
von: Zhao, Tong, et al.
Veröffentlicht: (2026)
von: Zhao, Tong, et al.
Veröffentlicht: (2026)
Evaluation of Audio Language Models for Fairness, Safety, and Security
von: Aloufi, Ranya, et al.
Veröffentlicht: (2026)
von: Aloufi, Ranya, et al.
Veröffentlicht: (2026)
Break-the-Beat! Controllable MIDI-to-Drum Audio Synthesis
von: Cui, Shuyang, et al.
Veröffentlicht: (2026)
von: Cui, Shuyang, et al.
Veröffentlicht: (2026)
Fusion Segment Transformer: Bi-Directional Attention Guided Fusion Network for AI-Generated Music Detection
von: Kim, Yumin, et al.
Veröffentlicht: (2026)
von: Kim, Yumin, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Are Audio-Language Models Listening? Audio-Specialist Heads for Adaptive Audio Steering
von: Glazer, Neta, et al.
Veröffentlicht: (2026) -
Audio-Guided Dynamic Modality Fusion with Stereo-Aware Attention for Audio-Visual Navigation
von: Li, Jia, et al.
Veröffentlicht: (2025) -
Deepfake Audio Detection Using Self-supervised Fusion Representations
von: Zaman, Khalid, et al.
Veröffentlicht: (2026) -
EvA: An Evidence-First Audio Understanding Paradigm for LALMs
von: Xie, Xinyuan, et al.
Veröffentlicht: (2026) -
HarmonicAttack: An Adaptive Cross-Domain Audio Watermark Removal
von: Li, Kexin, et al.
Veröffentlicht: (2025)