VideoDistill: Language-aware Vision Distillation for Video Question Answering
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zou, Bo, Yang, Chao, Qiao, Yu, Quan, Chengbin, Zhao, Youjian |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LLaMA-Excitor: General Instruction Tuning via Indirect Feature Interaction
par: Zou, Bo, et autres
Publié: (2024)
par: Zou, Bo, et autres
Publié: (2024)
Ranking Distillation for Open-Ended Video Question Answering with Insufficient Labels
par: Liang, Tianming, et autres
Publié: (2024)
par: Liang, Tianming, et autres
Publié: (2024)
Distilling Vision-Language Models on Millions of Videos
par: Zhao, Yue, et autres
Publié: (2024)
par: Zhao, Yue, et autres
Publié: (2024)
ViLA: Efficient Video-Language Alignment for Video Question Answering
par: Wang, Xijun, et autres
Publié: (2023)
par: Wang, Xijun, et autres
Publié: (2023)
Dataset Distillation via Vision-Language Category Prototype
par: Zou, Yawen, et autres
Publié: (2025)
par: Zou, Yawen, et autres
Publié: (2025)
MovieChat+: Question-aware Sparse Memory for Long Video Question Answering
par: Song, Enxin, et autres
Publié: (2024)
par: Song, Enxin, et autres
Publié: (2024)
Distill Video Datasets into Images
par: Zhao, Zhenghao, et autres
Publié: (2025)
par: Zhao, Zhenghao, et autres
Publié: (2025)
EVLF: Early Vision-Language Fusion for Generative Dataset Distillation
par: Cai, Wenqi, et autres
Publié: (2026)
par: Cai, Wenqi, et autres
Publié: (2026)
Overcoming Language Priors for Visual Question Answering Based on Knowledge Distillation
par: Peng, Daowan, et autres
Publié: (2025)
par: Peng, Daowan, et autres
Publié: (2025)
HORNet: Task-Guided Frame Selection for Video Question Answering with Vision-Language Models
par: Bai, Xiangyu, et autres
Publié: (2026)
par: Bai, Xiangyu, et autres
Publié: (2026)
Agentic Keyframe Search for Video Question Answering
par: Fan, Sunqi, et autres
Publié: (2025)
par: Fan, Sunqi, et autres
Publié: (2025)
AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering
par: Chen, Xiuyuan, et autres
Publié: (2023)
par: Chen, Xiuyuan, et autres
Publié: (2023)
From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering
par: Zhao, Yu, et autres
Publié: (2025)
par: Zhao, Yu, et autres
Publié: (2025)
CPFD: Confidence-aware Privileged Feature Distillation for Short Video Classification
par: Shi, Jinghao, et autres
Publié: (2024)
par: Shi, Jinghao, et autres
Publié: (2024)
SeeClear: Semantic Distillation Enhances Pixel Condensation for Video Super-Resolution
par: Tang, Qi, et autres
Publié: (2024)
par: Tang, Qi, et autres
Publié: (2024)
Teeth-SEG: An Efficient Instance Segmentation Framework for Orthodontic Treatment based on Anthropic Prior Knowledge
par: Zou, Bo, et autres
Publié: (2024)
par: Zou, Bo, et autres
Publié: (2024)
Streaming Video Question-Answering with In-context Video KV-Cache Retrieval
par: Di, Shangzhe, et autres
Publié: (2025)
par: Di, Shangzhe, et autres
Publié: (2025)
VDOT: Efficient Unified Video Creation via Optimal Transport Distillation
par: Wang, Yutong, et autres
Publié: (2025)
par: Wang, Yutong, et autres
Publié: (2025)
Latent Video Dataset Distillation
par: Li, Ning, et autres
Publié: (2025)
par: Li, Ning, et autres
Publié: (2025)
Video Set Distillation: Information Diversification and Temporal Densification
par: Zhao, Yinjie, et autres
Publié: (2024)
par: Zhao, Yinjie, et autres
Publié: (2024)
PartDistill: 3D Shape Part Segmentation by Vision-Language Model Distillation
par: Umam, Ardian, et autres
Publié: (2023)
par: Umam, Ardian, et autres
Publié: (2023)
Training-Free Motion Customization for Distilled Video Generators with Adaptive Test-Time Distillation
par: Rong, Jintao, et autres
Publié: (2025)
par: Rong, Jintao, et autres
Publié: (2025)
Grounded Question-Answering in Long Egocentric Videos
par: Di, Shangzhe, et autres
Publié: (2023)
par: Di, Shangzhe, et autres
Publié: (2023)
REVEAL: Relation-based Video Representation Learning for Video-Question-Answering
par: Chaybouti, Sofian, et autres
Publié: (2025)
par: Chaybouti, Sofian, et autres
Publié: (2025)
Enhancing Continual Learning in Visual Question Answering with Modality-Aware Feature Distillation
par: Nikandrou, Malvina, et autres
Publié: (2024)
par: Nikandrou, Malvina, et autres
Publié: (2024)
VidCtx: Context-aware Video Question Answering with Image Models
par: Goulas, Andreas, et autres
Publié: (2024)
par: Goulas, Andreas, et autres
Publié: (2024)
SIMPLOT: Enhancing Chart Question Answering by Distilling Essentials
par: Kim, Wonjoong, et autres
Publié: (2024)
par: Kim, Wonjoong, et autres
Publié: (2024)
Bridging Vision Language Models and Symbolic Grounding for Video Question Answering
par: Ma, Haodi, et autres
Publié: (2025)
par: Ma, Haodi, et autres
Publié: (2025)
ChineseVideoBench: Benchmarking Multi-modal Large Models for Chinese Video Question Answering
par: Nie, Yuxiang, et autres
Publié: (2025)
par: Nie, Yuxiang, et autres
Publié: (2025)
Prompting Video-Language Foundation Models with Domain-specific Fine-grained Heuristics for Video Question Answering
par: Yu, Ting, et autres
Publié: (2024)
par: Yu, Ting, et autres
Publié: (2024)
VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering
par: Meng, Yiran, et autres
Publié: (2025)
par: Meng, Yiran, et autres
Publié: (2025)
VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding
par: Kim, Younggun, et autres
Publié: (2025)
par: Kim, Younggun, et autres
Publié: (2025)
A.I.R.: Enabling Adaptive, Iterative, and Reasoning-based Frame Selection For Video Question Answering
par: Zou, Yuanhao, et autres
Publié: (2025)
par: Zou, Yuanhao, et autres
Publié: (2025)
Vision-Language Dataset Distillation
par: Wu, Xindi, et autres
Publié: (2023)
par: Wu, Xindi, et autres
Publié: (2023)
LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering
par: Zhang, Hongjie, et autres
Publié: (2023)
par: Zhang, Hongjie, et autres
Publié: (2023)
Neuro Symbolic Knowledge Reasoning for Procedural Video Question Answering
par: Fernando, Basura, et autres
Publié: (2025)
par: Fernando, Basura, et autres
Publié: (2025)
Question-Instructed Visual Descriptions for Zero-Shot Video Question Answering
par: Romero, David, et autres
Publié: (2024)
par: Romero, David, et autres
Publié: (2024)
Streaming Autoregressive Video Generation via Diagonal Distillation
par: Liu, Jinxiu, et autres
Publié: (2026)
par: Liu, Jinxiu, et autres
Publié: (2026)
Narrative Aligned Long Form Video Question Answering
par: Jain, Rahul, et autres
Publié: (2026)
par: Jain, Rahul, et autres
Publié: (2026)
Tool-Augmented Spatiotemporal Reasoning for Streamlining Video Question Answering Task
par: Fan, Sunqi, et autres
Publié: (2025)
par: Fan, Sunqi, et autres
Publié: (2025)
Documents similaires
-
LLaMA-Excitor: General Instruction Tuning via Indirect Feature Interaction
par: Zou, Bo, et autres
Publié: (2024) -
Ranking Distillation for Open-Ended Video Question Answering with Insufficient Labels
par: Liang, Tianming, et autres
Publié: (2024) -
Distilling Vision-Language Models on Millions of Videos
par: Zhao, Yue, et autres
Publié: (2024) -
ViLA: Efficient Video-Language Alignment for Video Question Answering
par: Wang, Xijun, et autres
Publié: (2023) -
Dataset Distillation via Vision-Language Category Prototype
par: Zou, Yawen, et autres
Publié: (2025)