Can I Trust Your Answer? Visually Grounded Video Question Answering
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xiao, Junbin, Yao, Angela, Li, Yicong, Chua, Tat Seng |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Question-Answering Dense Video Events
par: Qin, Hangyu, et autres
Publié: (2024)
par: Qin, Hangyu, et autres
Publié: (2024)
Scene-Text Grounding for Text-Based Video Question Answering
par: Zhou, Sheng, et autres
Publié: (2024)
par: Zhou, Sheng, et autres
Publié: (2024)
EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering
par: Zhou, Sheng, et autres
Publié: (2025)
par: Zhou, Sheng, et autres
Publié: (2025)
MuKV: Multi-Grained KV Cache Compression for Long Streaming Video Question-Answering
par: Xiao, Junbin, et autres
Publié: (2026)
par: Xiao, Junbin, et autres
Publié: (2026)
InstructVid2Vid: Controllable Video Editing with Natural Language Instructions
par: Qin, Bosheng, et autres
Publié: (2023)
par: Qin, Bosheng, et autres
Publié: (2023)
MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering
par: Dang, Jisheng, et autres
Publié: (2025)
par: Dang, Jisheng, et autres
Publié: (2025)
Ego-Grounding for Personalized Question-Answering in Egocentric Videos
par: Xiao, Junbin, et autres
Publié: (2026)
par: Xiao, Junbin, et autres
Publié: (2026)
EgoBlind: Towards Egocentric Visual Assistance for the Blind
par: Xiao, Junbin, et autres
Publié: (2025)
par: Xiao, Junbin, et autres
Publié: (2025)
Extending Visual Dynamics for Video-to-Music Generation
par: Liu, Xiaohao, et autres
Publié: (2025)
par: Liu, Xiaohao, et autres
Publié: (2025)
EQ-TAA: Equivariant Traffic Accident Anticipation via Diffusion-Based Accident Video Synthesis
par: Fang, Jianwu, et autres
Publié: (2025)
par: Fang, Jianwu, et autres
Publié: (2025)
VidCtx: Context-aware Video Question Answering with Image Models
par: Goulas, Andreas, et autres
Publié: (2024)
par: Goulas, Andreas, et autres
Publié: (2024)
Learning Trimodal Relation for Audio-Visual Question Answering with Missing Modality
par: Park, Kyu Ri, et autres
Publié: (2024)
par: Park, Kyu Ri, et autres
Publié: (2024)
AdaCoder: Adaptive Prompt Compression for Programmatic Visual Question Answering
par: Ukai, Mahiro, et autres
Publié: (2024)
par: Ukai, Mahiro, et autres
Publié: (2024)
Boosting Audio Visual Question Answering via Key Semantic-Aware Cues
par: Li, Guangyao, et autres
Publié: (2024)
par: Li, Guangyao, et autres
Publié: (2024)
VINCIE: Unlocking In-context Image Editing from Video
par: Qu, Leigang, et autres
Publié: (2025)
par: Qu, Leigang, et autres
Publié: (2025)
Revolutionizing Text-to-Image Retrieval as Autoregressive Token-to-Voken Generation
par: Li, Yongqi, et autres
Publié: (2024)
par: Li, Yongqi, et autres
Publié: (2024)
TTOM: Test-Time Optimization and Memorization for Compositional Video Generation
par: Qu, Leigang, et autres
Publié: (2025)
par: Qu, Leigang, et autres
Publié: (2025)
Discriminative Probing and Tuning for Text-to-Image Generation
par: Qu, Leigang, et autres
Publié: (2024)
par: Qu, Leigang, et autres
Publié: (2024)
Mitigating Easy Option Bias in Multiple-Choice Question Answering
par: Zhang, Hao, et autres
Publié: (2025)
par: Zhang, Hao, et autres
Publié: (2025)
Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
par: Fang, Xiang, et autres
Publié: (2026)
par: Fang, Xiang, et autres
Publié: (2026)
Self-Adaptive Sampling for Efficient Video Question-Answering on Image--Text Models
par: Han, Wei, et autres
Publié: (2023)
par: Han, Wei, et autres
Publié: (2023)
ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answering
par: Compagnoni, Alberto, et autres
Publié: (2025)
par: Compagnoni, Alberto, et autres
Publié: (2025)
Navigating the Mirage: A Dual-Path Agentic Framework for Robust Misleading Chart Question Answering
par: Zhang, Yanjie, et autres
Publié: (2026)
par: Zhang, Yanjie, et autres
Publié: (2026)
Augmenting Multimodal LLMs with Self-Reflective Tokens for Knowledge-based Visual Question Answering
par: Cocchi, Federico, et autres
Publié: (2024)
par: Cocchi, Federico, et autres
Publié: (2024)
Grounding is All You Need? Dual Temporal Grounding for Video Dialog
par: Qin, You, et autres
Publié: (2024)
par: Qin, You, et autres
Publié: (2024)
NExT-OMNI: Towards Any-to-Any Omnimodal Foundation Models with Discrete Flow Matching
par: Luo, Run, et autres
Publié: (2025)
par: Luo, Run, et autres
Publié: (2025)
TraceRouter: Robust Safety for Large Foundation Models via Path-Level Intervention
par: Shi, Chuancheng, et autres
Publié: (2026)
par: Shi, Chuancheng, et autres
Publié: (2026)
Open-o3-Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence
par: Meng, Jiahao, et autres
Publié: (2025)
par: Meng, Jiahao, et autres
Publié: (2025)
Generative Cross-Modal Retrieval: Memorizing Images in Multimodal Language Models for Retrieval and Beyond
par: Li, Yongqi, et autres
Publié: (2024)
par: Li, Yongqi, et autres
Publié: (2024)
VideoQA in the Era of LLMs: An Empirical Study
par: Xiao, Junbin, et autres
Publié: (2024)
par: Xiao, Junbin, et autres
Publié: (2024)
TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning
par: Zeng, Xiangyu, et autres
Publié: (2024)
par: Zeng, Xiangyu, et autres
Publié: (2024)
POINTS: Improving Your Vision-language Model with Affordable Strategies
par: Liu, Yuan, et autres
Publié: (2024)
par: Liu, Yuan, et autres
Publié: (2024)
Compose Your Aesthetics: Empowering Text-to-Image Models with the Principles of Art
par: Jin, Zhe, et autres
Publié: (2025)
par: Jin, Zhe, et autres
Publié: (2025)
MSC: A Marine Wildlife Video Dataset with Grounded Segmentation and Clip-Level Captioning
par: Truong, Quang-Trung, et autres
Publié: (2025)
par: Truong, Quang-Trung, et autres
Publié: (2025)
SILMM: Self-Improving Large Multimodal Models for Compositional Text-to-Image Generation
par: Qu, Leigang, et autres
Publié: (2024)
par: Qu, Leigang, et autres
Publié: (2024)
TIGeR: Unifying Text-to-Image Generation and Retrieval with Large Multimodal Models
par: Qu, Leigang, et autres
Publié: (2024)
par: Qu, Leigang, et autres
Publié: (2024)
Label-anticipated Event Disentanglement for Audio-Visual Video Parsing
par: Zhou, Jinxing, et autres
Publié: (2024)
par: Zhou, Jinxing, et autres
Publié: (2024)
"I Can See Forever!": Evaluating Real-time VideoLLMs for Assisting Individuals with Visual Impairments
par: Zhang, Ziyi, et autres
Publié: (2025)
par: Zhang, Ziyi, et autres
Publié: (2025)
PolySmart @ TRECVid 2024 Medical Video Question Answering
par: Wu, Jiaxin, et autres
Publié: (2024)
par: Wu, Jiaxin, et autres
Publié: (2024)
POLYCHARTQA: Benchmarking Large Vision-Language Models with Multilingual Chart Question Answering
par: Xu, Yichen, et autres
Publié: (2025)
par: Xu, Yichen, et autres
Publié: (2025)
Documents similaires
-
Question-Answering Dense Video Events
par: Qin, Hangyu, et autres
Publié: (2024) -
Scene-Text Grounding for Text-Based Video Question Answering
par: Zhou, Sheng, et autres
Publié: (2024) -
EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering
par: Zhou, Sheng, et autres
Publié: (2025) -
MuKV: Multi-Grained KV Cache Compression for Long Streaming Video Question-Answering
par: Xiao, Junbin, et autres
Publié: (2026) -
InstructVid2Vid: Controllable Video Editing with Natural Language Instructions
par: Qin, Bosheng, et autres
Publié: (2023)