RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Biswas, Subrata, Khan, Mohammad Nur Hossain, Islam, Bashima |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LLaSA: A Sensor-Aware LLM for Natural Language Reasoning of Human Activity from IMU Data
par: Imran, Sheikh Asif, et autres
Publié: (2024)
par: Imran, Sheikh Asif, et autres
Publié: (2024)
Missingness-resilient Video-enhanced Multimodal Disfluency Detection
par: Mohapatra, Payal, et autres
Publié: (2024)
par: Mohapatra, Payal, et autres
Publié: (2024)
QUADS: QUAntized Distillation Framework for Efficient Speech Language Understanding
par: Biswas, Subrata, et autres
Publié: (2025)
par: Biswas, Subrata, et autres
Publié: (2025)
OWL: Geometry-Aware Spatial Reasoning for Audio Large Language Models
par: Biswas, Subrata, et autres
Publié: (2025)
par: Biswas, Subrata, et autres
Publié: (2025)
Hierarchical Vision-Language Reasoning for Multimodal Multiple-Choice Question Answering
par: Zhou, Ao, et autres
Publié: (2025)
par: Zhou, Ao, et autres
Publié: (2025)
Memory-Centric Embodied Question Answering
par: Zhai, Mingliang, et autres
Publié: (2025)
par: Zhai, Mingliang, et autres
Publié: (2025)
LocoMotion: Learning Motion-Focused Video-Language Representations
par: Doughty, Hazel, et autres
Publié: (2024)
par: Doughty, Hazel, et autres
Publié: (2024)
Knowledge Acquisition Disentanglement for Knowledge-based Visual Question Answering with Large Language Models
par: An, Wenbin, et autres
Publié: (2024)
par: An, Wenbin, et autres
Publié: (2024)
Self-Adaptive Sampling for Efficient Video Question-Answering on Image--Text Models
par: Han, Wei, et autres
Publié: (2023)
par: Han, Wei, et autres
Publié: (2023)
Multi-Domain Audio Question Answering Benchmark Toward Acoustic Content Reasoning
par: Yang, Chao-Han Huck, et autres
Publié: (2025)
par: Yang, Chao-Han Huck, et autres
Publié: (2025)
SEA: Low-Resource Safety Alignment for Multimodal Large Language Models via Synthetic Embeddings
par: Lu, Weikai, et autres
Publié: (2025)
par: Lu, Weikai, et autres
Publié: (2025)
POLYCHARTQA: Benchmarking Large Vision-Language Models with Multilingual Chart Question Answering
par: Xu, Yichen, et autres
Publié: (2025)
par: Xu, Yichen, et autres
Publié: (2025)
Learning Audio Concepts from Counterfactual Natural Language
par: Vosoughi, Ali, et autres
Publié: (2024)
par: Vosoughi, Ali, et autres
Publié: (2024)
Enhancing the Learning Experience: Using Vision-Language Models to Generate Questions for Educational Videos
par: Stamatakis, Markos, et autres
Publié: (2025)
par: Stamatakis, Markos, et autres
Publié: (2025)
Traits Run Deep: Enhancing Personality Assessment via Psychology-Guided LLM Representations and Multimodal Apparent Behaviors
par: Li, Jia, et autres
Publié: (2025)
par: Li, Jia, et autres
Publié: (2025)
PediatricsMQA: a Multi-modal Pediatrics Question Answering Benchmark
par: Bahaj, Adil, et autres
Publié: (2025)
par: Bahaj, Adil, et autres
Publié: (2025)
Mutual Information-based Representations Disentanglement for Unaligned Multimodal Language Sequences
par: Qian, Fan, et autres
Publié: (2024)
par: Qian, Fan, et autres
Publié: (2024)
Audio-Thinker: Guiding Audio Language Model When and How to Think via Reinforcement Learning
par: Wu, Shu, et autres
Publié: (2025)
par: Wu, Shu, et autres
Publié: (2025)
SpeechCraft: A Fine-grained Expressive Speech Dataset with Natural Language Description
par: Jin, Zeyu, et autres
Publié: (2024)
par: Jin, Zeyu, et autres
Publié: (2024)
Fine-Tuning MIDI-to-Audio Alignment using a Neural Network on Piano Roll and CQT Representations
par: Murgul, Sebastian, et autres
Publié: (2025)
par: Murgul, Sebastian, et autres
Publié: (2025)
On the Audio Hallucinations in Large Audio-Video Language Models
par: Nishimura, Taichi, et autres
Publié: (2024)
par: Nishimura, Taichi, et autres
Publié: (2024)
HFS: Holistic Query-Aware Frame Selection for Efficient Video Reasoning
par: Yang, Yiqing, et autres
Publié: (2025)
par: Yang, Yiqing, et autres
Publié: (2025)
SLAM-LLM: A Modular, Open-Source Multimodal Large Language Model Framework and Best Practice for Speech, Language, Audio and Music Processing
par: Ma, Ziyang, et autres
Publié: (2026)
par: Ma, Ziyang, et autres
Publié: (2026)
The Interspeech 2026 Audio Reasoning Challenge: Evaluating Reasoning Process Quality for Audio Reasoning Models and Agents
par: Ma, Ziyang, et autres
Publié: (2026)
par: Ma, Ziyang, et autres
Publié: (2026)
Reshaping Representation Space to Balance the Safety and Over-rejection in Large Audio Language Models
par: Yang, Hao, et autres
Publié: (2025)
par: Yang, Hao, et autres
Publié: (2025)
ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answering
par: Compagnoni, Alberto, et autres
Publié: (2025)
par: Compagnoni, Alberto, et autres
Publié: (2025)
TeleAntiFraud-28k: An Audio-Text Slow-Thinking Dataset for Telecom Fraud Detection
par: Ma, Zhiming, et autres
Publié: (2025)
par: Ma, Zhiming, et autres
Publié: (2025)
AQUALLM: Audio Question Answering Data Generation Using Large Language Models
par: Behera, Swarup Ranjan, et autres
Publié: (2023)
par: Behera, Swarup Ranjan, et autres
Publié: (2023)
IBMEA: Exploring Variational Information Bottleneck for Multi-modal Entity Alignment
par: Su, Taoyu, et autres
Publié: (2024)
par: Su, Taoyu, et autres
Publié: (2024)
LoginMEA: Local-to-Global Interaction Network for Multi-modal Entity Alignment
par: Su, Taoyu, et autres
Publié: (2024)
par: Su, Taoyu, et autres
Publié: (2024)
MuLTI: Efficient Video-and-Language Understanding with Text-Guided MultiWay-Sampler and Multiple Choice Modeling
par: Xu, Jiaqi, et autres
Publié: (2023)
par: Xu, Jiaqi, et autres
Publié: (2023)
Augmenting Multimodal LLMs with Self-Reflective Tokens for Knowledge-based Visual Question Answering
par: Cocchi, Federico, et autres
Publié: (2024)
par: Cocchi, Federico, et autres
Publié: (2024)
Patch-level Sounding Object Tracking for Audio-Visual Question Answering
par: Li, Zhangbin, et autres
Publié: (2024)
par: Li, Zhangbin, et autres
Publié: (2024)
Video2Roleplay: A Multimodal Dataset and Framework for Video-Guided Role-playing Agents
par: Zhang, Xueqiao, et autres
Publié: (2025)
par: Zhang, Xueqiao, et autres
Publié: (2025)
An Evaluation of Interleaved Instruction Tuning on Semantic Reasoning Performance in an Audio MLLM
par: Liu, Jiawei, et autres
Publié: (2025)
par: Liu, Jiawei, et autres
Publié: (2025)
Teacher-Guided Pseudo Supervision and Cross-Modal Alignment for Audio-Visual Video Parsing
par: Chen, Yaru, et autres
Publié: (2025)
par: Chen, Yaru, et autres
Publié: (2025)
AudioSetMix: Enhancing Audio-Language Datasets with LLM-Assisted Augmentations
par: Xu, David
Publié: (2024)
par: Xu, David
Publié: (2024)
Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Model
par: Ma, Ziyang, et autres
Publié: (2025)
par: Ma, Ziyang, et autres
Publié: (2025)
LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long Videos
par: Geng, Tiantian, et autres
Publié: (2024)
par: Geng, Tiantian, et autres
Publié: (2024)
VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering
par: Meng, Yiran, et autres
Publié: (2025)
par: Meng, Yiran, et autres
Publié: (2025)
Documents similaires
-
LLaSA: A Sensor-Aware LLM for Natural Language Reasoning of Human Activity from IMU Data
par: Imran, Sheikh Asif, et autres
Publié: (2024) -
Missingness-resilient Video-enhanced Multimodal Disfluency Detection
par: Mohapatra, Payal, et autres
Publié: (2024) -
QUADS: QUAntized Distillation Framework for Efficient Speech Language Understanding
par: Biswas, Subrata, et autres
Publié: (2025) -
OWL: Geometry-Aware Spatial Reasoning for Audio Large Language Models
par: Biswas, Subrata, et autres
Publié: (2025) -
Hierarchical Vision-Language Reasoning for Multimodal Multiple-Choice Question Answering
par: Zhou, Ao, et autres
Publié: (2025)