ViLA: Efficient Video-Language Alignment for Video Question Answering
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Xijun, Liang, Junbang, Wang, Chun-Kai, Deng, Kenan, Lou, Yu, Lin, Ming, Yang, Shan |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VideoDistill: Language-aware Vision Distillation for Video Question Answering
par: Zou, Bo, et autres
Publié: (2024)
par: Zou, Bo, et autres
Publié: (2024)
Uncertainty-Guided Self-Questioning and Answering for Video-Language Alignment
par: Chen, Jin, et autres
Publié: (2024)
par: Chen, Jin, et autres
Publié: (2024)
DocVideoQA: Towards Comprehensive Understanding of Document-Centric Videos through Question Answering
par: Wang, Haochen, et autres
Publié: (2025)
par: Wang, Haochen, et autres
Publié: (2025)
SurgViVQA: Temporally-Grounded Video Question Answering for Surgical Scene Understanding
par: Drago, Mauro Orazio, et autres
Publié: (2025)
par: Drago, Mauro Orazio, et autres
Publié: (2025)
Align and Aggregate: Compositional Reasoning with Video Alignment and Answer Aggregation for Video Question-Answering
par: Liao, Zhaohe, et autres
Publié: (2024)
par: Liao, Zhaohe, et autres
Publié: (2024)
Prompting Video-Language Foundation Models with Domain-specific Fine-grained Heuristics for Video Question Answering
par: Yu, Ting, et autres
Publié: (2024)
par: Yu, Ting, et autres
Publié: (2024)
STAIR: Spatial-Temporal Reasoning with Auditable Intermediate Results for Video Question Answering
par: Wang, Yueqian, et autres
Publié: (2024)
par: Wang, Yueqian, et autres
Publié: (2024)
ChineseVideoBench: Benchmarking Multi-modal Large Models for Chinese Video Question Answering
par: Nie, Yuxiang, et autres
Publié: (2025)
par: Nie, Yuxiang, et autres
Publié: (2025)
Agentic Keyframe Search for Video Question Answering
par: Fan, Sunqi, et autres
Publié: (2025)
par: Fan, Sunqi, et autres
Publié: (2025)
ViViD: Video Virtual Try-on using Diffusion Models
par: Fang, Zixun, et autres
Publié: (2024)
par: Fang, Zixun, et autres
Publié: (2024)
Streaming Video Question-Answering with In-context Video KV-Cache Retrieval
par: Di, Shangzhe, et autres
Publié: (2025)
par: Di, Shangzhe, et autres
Publié: (2025)
CogStream: Context-guided Streaming Video Question Answering
par: Zhao, Zicheng, et autres
Publié: (2025)
par: Zhao, Zicheng, et autres
Publié: (2025)
ViLLa: Video Reasoning Segmentation with Large Language Model
par: Zheng, Rongkun, et autres
Publié: (2024)
par: Zheng, Rongkun, et autres
Publié: (2024)
AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering
par: Chen, Xiuyuan, et autres
Publié: (2023)
par: Chen, Xiuyuan, et autres
Publié: (2023)
ETVA: Evaluation of Text-to-Video Alignment via Fine-grained Question Generation and Answering
par: Guan, Kaisi, et autres
Publié: (2025)
par: Guan, Kaisi, et autres
Publié: (2025)
A Simple LLM Framework for Long-Range Video Question-Answering
par: Zhang, Ce, et autres
Publié: (2023)
par: Zhang, Ce, et autres
Publié: (2023)
VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering
par: Meng, Yiran, et autres
Publié: (2025)
par: Meng, Yiran, et autres
Publié: (2025)
MovieChat+: Question-aware Sparse Memory for Long Video Question Answering
par: Song, Enxin, et autres
Publié: (2024)
par: Song, Enxin, et autres
Publié: (2024)
Semantic Event Graphs for Long-Form Video Question Answering
par: Dixit, Aradhya, et autres
Publié: (2026)
par: Dixit, Aradhya, et autres
Publié: (2026)
Scene-Text Grounding for Text-Based Video Question Answering
par: Zhou, Sheng, et autres
Publié: (2024)
par: Zhou, Sheng, et autres
Publié: (2024)
Bridging Vision Language Models and Symbolic Grounding for Video Question Answering
par: Ma, Haodi, et autres
Publié: (2025)
par: Ma, Haodi, et autres
Publié: (2025)
Enhancing Long Video Question Answering with Scene-Localized Frame Grouping
par: Yang, Xuyi, et autres
Publié: (2025)
par: Yang, Xuyi, et autres
Publié: (2025)
Progressive Image Restoration via Text-Conditioned Video Generation
par: Kang, Peng, et autres
Publié: (2025)
par: Kang, Peng, et autres
Publié: (2025)
Grounded Question-Answering in Long Egocentric Videos
par: Di, Shangzhe, et autres
Publié: (2023)
par: Di, Shangzhe, et autres
Publié: (2023)
Glance and Focus: Memory Prompting for Multi-Event Video Question Answering
par: Bai, Ziyi, et autres
Publié: (2024)
par: Bai, Ziyi, et autres
Publié: (2024)
REVEAL: Relation-based Video Representation Learning for Video-Question-Answering
par: Chaybouti, Sofian, et autres
Publié: (2025)
par: Chaybouti, Sofian, et autres
Publié: (2025)
MobileViCLIP: An Efficient Video-Text Model for Mobile Devices
par: Yang, Min, et autres
Publié: (2025)
par: Yang, Min, et autres
Publié: (2025)
Object-centric Video Question Answering with Visual Grounding and Referring
par: Wang, Haochen, et autres
Publié: (2025)
par: Wang, Haochen, et autres
Publié: (2025)
ImViD: Immersive Volumetric Videos for Enhanced VR Engagement
par: Yang, Zhengxian, et autres
Publié: (2025)
par: Yang, Zhengxian, et autres
Publié: (2025)
Cross-modal Causal Relation Alignment for Video Question Grounding
par: Chen, Weixing, et autres
Publié: (2025)
par: Chen, Weixing, et autres
Publié: (2025)
Ranking Distillation for Open-Ended Video Question Answering with Insufficient Labels
par: Liang, Tianming, et autres
Publié: (2024)
par: Liang, Tianming, et autres
Publié: (2024)
Empowering Large Language Model for Continual Video Question Answering with Collaborative Prompting
par: Cai, Chen, et autres
Publié: (2024)
par: Cai, Chen, et autres
Publié: (2024)
ViSpeak: Visual Instruction Feedback in Streaming Videos
par: Fu, Shenghao, et autres
Publié: (2025)
par: Fu, Shenghao, et autres
Publié: (2025)
End-to-End Video Question Answering with Frame Scoring Mechanisms and Adaptive Sampling
par: Liang, Jianxin, et autres
Publié: (2024)
par: Liang, Jianxin, et autres
Publié: (2024)
StreamKV: Streaming Video Question-Answering with Segment-based KV Cache Retrieval and Compression
par: Chen, Yilong, et autres
Publié: (2025)
par: Chen, Yilong, et autres
Publié: (2025)
Neural-Symbolic VideoQA: Learning Compositional Spatio-Temporal Reasoning for Real-world Video Question Answering
par: Liang, Lili, et autres
Publié: (2024)
par: Liang, Lili, et autres
Publié: (2024)
A.I.R.: Enabling Adaptive, Iterative, and Reasoning-based Frame Selection For Video Question Answering
par: Zou, Yuanhao, et autres
Publié: (2025)
par: Zou, Yuanhao, et autres
Publié: (2025)
BIMBA: Selective-Scan Compression for Long-Range Video Question Answering
par: Islam, Md Mohaiminul, et autres
Publié: (2025)
par: Islam, Md Mohaiminul, et autres
Publié: (2025)
Neuro Symbolic Knowledge Reasoning for Procedural Video Question Answering
par: Fernando, Basura, et autres
Publié: (2025)
par: Fernando, Basura, et autres
Publié: (2025)
Question-Answering Dense Video Events
par: Qin, Hangyu, et autres
Publié: (2024)
par: Qin, Hangyu, et autres
Publié: (2024)
Documents similaires
-
VideoDistill: Language-aware Vision Distillation for Video Question Answering
par: Zou, Bo, et autres
Publié: (2024) -
Uncertainty-Guided Self-Questioning and Answering for Video-Language Alignment
par: Chen, Jin, et autres
Publié: (2024) -
DocVideoQA: Towards Comprehensive Understanding of Document-Centric Videos through Question Answering
par: Wang, Haochen, et autres
Publié: (2025) -
SurgViVQA: Temporally-Grounded Video Question Answering for Surgical Scene Understanding
par: Drago, Mauro Orazio, et autres
Publié: (2025) -
Align and Aggregate: Compositional Reasoning with Video Alignment and Answer Aggregation for Video Question-Answering
par: Liao, Zhaohe, et autres
Publié: (2024)