Self-Adaptive Sampling for Efficient Video Question-Answering on Image--Text Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Han, Wei, Chen, Hui, Kan, Min-Yen, Poria, Soujanya |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Scene-Text Grounding for Text-Based Video Question Answering
par: Zhou, Sheng, et autres
Publié: (2024)
par: Zhou, Sheng, et autres
Publié: (2024)
Knowledge Acquisition Disentanglement for Knowledge-based Visual Question Answering with Large Language Models
par: An, Wenbin, et autres
Publié: (2024)
par: An, Wenbin, et autres
Publié: (2024)
Seeing Through Deception: Uncovering Misleading Creator Intent in Multimodal News with Vision-Language Models
par: Wu, Jiaying, et autres
Publié: (2025)
par: Wu, Jiaying, et autres
Publié: (2025)
EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering
par: Zhou, Sheng, et autres
Publié: (2025)
par: Zhou, Sheng, et autres
Publié: (2025)
MuLTI: Efficient Video-and-Language Understanding with Text-Guided MultiWay-Sampler and Multiple Choice Modeling
par: Xu, Jiaqi, et autres
Publié: (2023)
par: Xu, Jiaqi, et autres
Publié: (2023)
PolySmart @ TRECVid 2024 Medical Video Question Answering
par: Wu, Jiaxin, et autres
Publié: (2024)
par: Wu, Jiaxin, et autres
Publié: (2024)
PREMISE: Matching-based Prediction for Accurate Review Recommendation
par: Han, Wei, et autres
Publié: (2025)
par: Han, Wei, et autres
Publié: (2025)
VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering
par: Meng, Yiran, et autres
Publié: (2025)
par: Meng, Yiran, et autres
Publié: (2025)
POLYCHARTQA: Benchmarking Large Vision-Language Models with Multilingual Chart Question Answering
par: Xu, Yichen, et autres
Publié: (2025)
par: Xu, Yichen, et autres
Publié: (2025)
Augmenting Multimodal LLMs with Self-Reflective Tokens for Knowledge-based Visual Question Answering
par: Cocchi, Federico, et autres
Publié: (2024)
par: Cocchi, Federico, et autres
Publié: (2024)
Enhancing the Learning Experience: Using Vision-Language Models to Generate Questions for Educational Videos
par: Stamatakis, Markos, et autres
Publié: (2025)
par: Stamatakis, Markos, et autres
Publié: (2025)
Beyond Coarse-Grained Matching in Video-Text Retrieval
par: Chen, Aozhu, et autres
Publié: (2024)
par: Chen, Aozhu, et autres
Publié: (2024)
Prompt-aware of Frame Sampling for Efficient Text-Video Retrieval
par: Zhang, Deyu, et autres
Publié: (2025)
par: Zhang, Deyu, et autres
Publié: (2025)
RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language
par: Biswas, Subrata, et autres
Publié: (2025)
par: Biswas, Subrata, et autres
Publié: (2025)
VidCtx: Context-aware Video Question Answering with Image Models
par: Goulas, Andreas, et autres
Publié: (2024)
par: Goulas, Andreas, et autres
Publié: (2024)
DreamArtist++: Controllable One-Shot Text-to-Image Generation via Positive-Negative Adapter
par: Dong, Ziyi, et autres
Publié: (2022)
par: Dong, Ziyi, et autres
Publié: (2022)
DMC$^3$: Dual-Modal Counterfactual Contrastive Construction for Egocentric Video Question Answering
par: Zou, Jiayi, et autres
Publié: (2025)
par: Zou, Jiayi, et autres
Publié: (2025)
Dynamic Self-adaptive Multiscale Distillation from Pre-trained Multimodal Large Model for Efficient Cross-modal Representation Learning
par: Liang, Zhengyang, et autres
Publié: (2024)
par: Liang, Zhengyang, et autres
Publié: (2024)
POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency
par: Dahal, Ashim, et autres
Publié: (2025)
par: Dahal, Ashim, et autres
Publié: (2025)
ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answering
par: Compagnoni, Alberto, et autres
Publié: (2025)
par: Compagnoni, Alberto, et autres
Publié: (2025)
Prompt-A-Video: Prompt Your Video Diffusion Model via Preference-Aligned LLM
par: Ji, Yatai, et autres
Publié: (2024)
par: Ji, Yatai, et autres
Publié: (2024)
Mitigating Hallucination in Large Vision-Language Models via Adaptive Attention Calibration
par: Fazli, Mehrdad, et autres
Publié: (2025)
par: Fazli, Mehrdad, et autres
Publié: (2025)
Copy-Move Forgery Detection and Question Answering for Remote Sensing Image
par: Zhang, Ze, et autres
Publié: (2024)
par: Zhang, Ze, et autres
Publié: (2024)
Anim-Director: A Large Multimodal Model Powered Agent for Controllable Animation Video Generation
par: Li, Yunxin, et autres
Publié: (2024)
par: Li, Yunxin, et autres
Publié: (2024)
Question-Answering Dense Video Events
par: Qin, Hangyu, et autres
Publié: (2024)
par: Qin, Hangyu, et autres
Publié: (2024)
Ask Questions with Double Hints: Visual Question Generation with Answer-awareness and Region-reference
par: Shen, Kai, et autres
Publié: (2024)
par: Shen, Kai, et autres
Publié: (2024)
HFS: Holistic Query-Aware Frame Selection for Efficient Video Reasoning
par: Yang, Yiqing, et autres
Publié: (2025)
par: Yang, Yiqing, et autres
Publié: (2025)
AdaReTaKe: Adaptive Redundancy Reduction to Perceive Longer for Video-language Understanding
par: Wang, Xiao, et autres
Publié: (2025)
par: Wang, Xiao, et autres
Publié: (2025)
VideoCLIP-XL: Advancing Long Description Understanding for Video CLIP Models
par: Wang, Jiapeng, et autres
Publié: (2024)
par: Wang, Jiapeng, et autres
Publié: (2024)
Multimodal Cinematic Video Synthesis Using Text-to-Image and Audio Generation Models
par: S, Sridhar, et autres
Publié: (2025)
par: S, Sridhar, et autres
Publié: (2025)
DeepMoLM: Leveraging Visual and Geometric Structural Information for Molecule-Text Modeling
par: Lan, Jing, et autres
Publié: (2026)
par: Lan, Jing, et autres
Publié: (2026)
KeyVideoLLM: Towards Large-scale Video Keyframe Selection
par: Liang, Hao, et autres
Publié: (2024)
par: Liang, Hao, et autres
Publié: (2024)
Towards Flexible Evaluation for Generative Visual Question Answering
par: Ji, Huishan, et autres
Publié: (2024)
par: Ji, Huishan, et autres
Publié: (2024)
Towards Event-oriented Long Video Understanding
par: Du, Yifan, et autres
Publié: (2024)
par: Du, Yifan, et autres
Publié: (2024)
Unleashing Text-to-Image Diffusion Prior for Zero-Shot Image Captioning
par: Luo, Jianjie, et autres
Publié: (2024)
par: Luo, Jianjie, et autres
Publié: (2024)
Dual-Modal Attention-Enhanced Text-Video Retrieval with Triplet Partial Margin Contrastive Learning
par: Jiang, Chen, et autres
Publié: (2023)
par: Jiang, Chen, et autres
Publié: (2023)
Video2Roleplay: A Multimodal Dataset and Framework for Video-Guided Role-playing Agents
par: Zhang, Xueqiao, et autres
Publié: (2025)
par: Zhang, Xueqiao, et autres
Publié: (2025)
Enhancing Generalization in Medical Visual Question Answering Tasks via Gradient-Guided Model Perturbation
par: Liu, Gang, et autres
Publié: (2024)
par: Liu, Gang, et autres
Publié: (2024)
Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion
par: Lv, Zheqi, et autres
Publié: (2025)
par: Lv, Zheqi, et autres
Publié: (2025)
See or Guess: Counterfactually Regularized Image Captioning
par: Cao, Qian, et autres
Publié: (2024)
par: Cao, Qian, et autres
Publié: (2024)
Documents similaires
-
Scene-Text Grounding for Text-Based Video Question Answering
par: Zhou, Sheng, et autres
Publié: (2024) -
Knowledge Acquisition Disentanglement for Knowledge-based Visual Question Answering with Large Language Models
par: An, Wenbin, et autres
Publié: (2024) -
Seeing Through Deception: Uncovering Misleading Creator Intent in Multimodal News with Vision-Language Models
par: Wu, Jiaying, et autres
Publié: (2025) -
EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering
par: Zhou, Sheng, et autres
Publié: (2025) -
MuLTI: Efficient Video-and-Language Understanding with Text-Guided MultiWay-Sampler and Multiple Choice Modeling
par: Xu, Jiaqi, et autres
Publié: (2023)