HCQA @ Ego4D EgoSchema Challenge 2024

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Zhang, Haoyu, Xie, Yuquan, Feng, Yisen, Li, Zaijing, Liu, Meng, Nie, Liqiang
Format: Preprint
Published: 2024
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866909369801637888
author Zhang, Haoyu
Xie, Yuquan
Feng, Yisen
Li, Zaijing
Liu, Meng
Nie, Liqiang
author_facet Zhang, Haoyu
Xie, Yuquan
Feng, Yisen
Li, Zaijing
Liu, Meng
Nie, Liqiang
contents In this report, we present our champion solution for Ego4D EgoSchema Challenge in CVPR 2024. To deeply integrate the powerful egocentric captioning model and question reasoning model, we propose a novel Hierarchical Comprehension scheme for egocentric video Question Answering, named HCQA. It consists of three stages: Fine-grained Caption Generation, Context-driven Summarization, and Inference-guided Answering. Given a long-form video, HCQA captures local detailed visual information and global summarised visual information via Fine-grained Caption Generation and Context-driven Summarization, respectively. Then in Inference-guided Answering, HCQA utilizes this hierarchical information to reason and answer given question. On the EgoSchema blind test set, HCQA achieves 75% accuracy in answering over 5,000 human curated multiple-choice questions. Our code will be released at https://github.com/Hyu-Zhang/HCQA.
format Preprint
id arxiv_https___arxiv_org_abs_2406_15771
institution arXiv
publishDate 2024
record_format arxiv
spellingShingle HCQA @ Ego4D EgoSchema Challenge 2024
Zhang, Haoyu
Xie, Yuquan
Feng, Yisen
Li, Zaijing
Liu, Meng
Nie, Liqiang
Computer Vision and Pattern Recognition
Artificial Intelligence
In this report, we present our champion solution for Ego4D EgoSchema Challenge in CVPR 2024. To deeply integrate the powerful egocentric captioning model and question reasoning model, we propose a novel Hierarchical Comprehension scheme for egocentric video Question Answering, named HCQA. It consists of three stages: Fine-grained Caption Generation, Context-driven Summarization, and Inference-guided Answering. Given a long-form video, HCQA captures local detailed visual information and global summarised visual information via Fine-grained Caption Generation and Context-driven Summarization, respectively. Then in Inference-guided Answering, HCQA utilizes this hierarchical information to reason and answer given question. On the EgoSchema blind test set, HCQA achieves 75% accuracy in answering over 5,000 human curated multiple-choice questions. Our code will be released at https://github.com/Hyu-Zhang/HCQA.
title HCQA @ Ego4D EgoSchema Challenge 2024
topic Computer Vision and Pattern Recognition
Artificial Intelligence
url https://arxiv.org/abs/2406.15771