EventLens: Leveraging Event-Aware Pretraining and Cross-modal Linking Enhances Visual Commonsense Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ma, Mingjie, Yu, Zhihuan, Ma, Yichao, Li, Guohui |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor
par: Chen, Jiali, et autres
Publié: (2024)
par: Chen, Jiali, et autres
Publié: (2024)
Multimodal LLM Enhanced Cross-lingual Cross-modal Retrieval
par: Wang, Yabing, et autres
Publié: (2024)
par: Wang, Yabing, et autres
Publié: (2024)
Generative Visual Commonsense Answering and Explaining with Generative Scene Graph Constructing
par: Yuan, Fan, et autres
Publié: (2025)
par: Yuan, Fan, et autres
Publié: (2025)
CAVE: Detecting and Explaining Commonsense Anomalies in Visual Environments
par: Bhagwatkar, Rishika, et autres
Publié: (2025)
par: Bhagwatkar, Rishika, et autres
Publié: (2025)
VideoXum: Cross-modal Visual and Textural Summarization of Videos
par: Lin, Jingyang, et autres
Publié: (2023)
par: Lin, Jingyang, et autres
Publié: (2023)
ViCor: Bridging Visual Understanding and Commonsense Reasoning with Large Language Models
par: Zhou, Kaiwen, et autres
Publié: (2023)
par: Zhou, Kaiwen, et autres
Publié: (2023)
Activating Visual Context and Commonsense Reasoning through Masked Prediction in VLMs
par: Yu, Jiaao, et autres
Publié: (2025)
par: Yu, Jiaao, et autres
Publié: (2025)
Computed Tomography Visual Question Answering with Cross-modal Feature Graphing
par: Tian, Yuanhe, et autres
Publié: (2025)
par: Tian, Yuanhe, et autres
Publié: (2025)
FSMR: A Feature Swapping Multi-modal Reasoning Approach with Joint Textual and Visual Clues
par: Li, Shuang, et autres
Publié: (2024)
par: Li, Shuang, et autres
Publié: (2024)
GeReA: Question-Aware Prompt Captions for Knowledge-based Visual Question Answering
par: Ma, Ziyu, et autres
Publié: (2024)
par: Ma, Ziyu, et autres
Publié: (2024)
Customizing Visual-Language Foundation Models for Multi-modal Anomaly Detection and Reasoning
par: Xu, Xiaohao, et autres
Publié: (2024)
par: Xu, Xiaohao, et autres
Publié: (2024)
Visual Riddles: a Commonsense and World Knowledge Challenge for Large Vision and Language Models
par: Bitton-Guetta, Nitzan, et autres
Publié: (2024)
par: Bitton-Guetta, Nitzan, et autres
Publié: (2024)
X-InstructBLIP: A Framework for aligning X-Modal instruction-aware representations to LLMs and Emergent Cross-modal Reasoning
par: Panagopoulou, Artemis, et autres
Publié: (2023)
par: Panagopoulou, Artemis, et autres
Publié: (2023)
Advancing Large Multi-modal Models with Explicit Chain-of-Reasoning and Visual Question Generation
par: Uehara, Kohei, et autres
Publié: (2024)
par: Uehara, Kohei, et autres
Publié: (2024)
Locality-aware Cross-modal Correspondence Learning for Dense Audio-Visual Events Localization
par: Xing, Ling, et autres
Publié: (2024)
par: Xing, Ling, et autres
Publié: (2024)
MathCoder2: Better Math Reasoning from Continued Pretraining on Model-translated Mathematical Code
par: Lu, Zimu, et autres
Publié: (2024)
par: Lu, Zimu, et autres
Publié: (2024)
Gemini in Reasoning: Unveiling Commonsense in Multimodal Large Language Models
par: Wang, Yuqing, et autres
Publié: (2023)
par: Wang, Yuqing, et autres
Publié: (2023)
II-MMR: Identifying and Improving Multi-modal Multi-hop Reasoning in Visual Question Answering
par: Kil, Jihyung, et autres
Publié: (2024)
par: Kil, Jihyung, et autres
Publié: (2024)
Towards Effective Long-Video Event Prediction via Multi-Level Event Semantics Mining
par: Peng, Bo, et autres
Publié: (2026)
par: Peng, Bo, et autres
Publié: (2026)
Fostering Video Reasoning via Next-Event Prediction
par: Wang, Haonan, et autres
Publié: (2025)
par: Wang, Haonan, et autres
Publié: (2025)
Multi-modal Semantic Understanding with Contrastive Cross-modal Feature Alignment
par: Zhang, Ming, et autres
Publié: (2024)
par: Zhang, Ming, et autres
Publié: (2024)
EventDance: Unsupervised Source-free Cross-modal Adaptation for Event-based Object Recognition
par: Zheng, Xu, et autres
Publié: (2024)
par: Zheng, Xu, et autres
Publié: (2024)
Latent Visual Reasoning
par: Li, Bangzheng, et autres
Publié: (2025)
par: Li, Bangzheng, et autres
Publié: (2025)
FrEVL: Leveraging Frozen Pretrained Embeddings for Efficient Vision-Language Understanding
par: Bourigault, Emmanuelle, et autres
Publié: (2025)
par: Bourigault, Emmanuelle, et autres
Publié: (2025)
How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding
par: Yu, Zhuoran, et autres
Publié: (2025)
par: Yu, Zhuoran, et autres
Publié: (2025)
Enhancing Event-based Object Detection with Monocular Normal Maps
par: Liu, Mingjie, et autres
Publié: (2025)
par: Liu, Mingjie, et autres
Publié: (2025)
Dynamic Adapter with Semantics Disentangling for Cross-lingual Cross-modal Retrieval
par: Cai, Rui, et autres
Publié: (2024)
par: Cai, Rui, et autres
Publié: (2024)
KARL: Knowledge-Aware Reasoning and Reinforcement Learning for Knowledge-Intensive Visual Grounding
par: Ma, Xinyu, et autres
Publié: (2025)
par: Ma, Xinyu, et autres
Publié: (2025)
Scaling Dense Event-Stream Pretraining from Visual Foundation Models
par: Chen, Zhiwen, et autres
Publié: (2026)
par: Chen, Zhiwen, et autres
Publié: (2026)
Grounding Partially-Defined Events in Multimodal Data
par: Sanders, Kate, et autres
Publié: (2024)
par: Sanders, Kate, et autres
Publié: (2024)
FLEX-CLIP: Feature-Level GEneration Network Enhanced CLIP for X-shot Cross-modal Retrieval
par: Xie, Jingyou, et autres
Publié: (2024)
par: Xie, Jingyou, et autres
Publié: (2024)
Robust Disentangled Counterfactual Learning for Physical Audiovisual Commonsense Reasoning
par: Qi, Mengshi, et autres
Publié: (2025)
par: Qi, Mengshi, et autres
Publié: (2025)
EventVAD: Training-Free Event-Aware Video Anomaly Detection
par: Shao, Yihua, et autres
Publié: (2025)
par: Shao, Yihua, et autres
Publié: (2025)
Causal Debiasing for Visual Commonsense Reasoning
par: Zou, Jiayi, et autres
Publié: (2025)
par: Zou, Jiayi, et autres
Publié: (2025)
MoKus: Leveraging Cross-Modal Knowledge Transfer for Knowledge-Aware Concept Customization
par: Zhu, Chenyang, et autres
Publié: (2026)
par: Zhu, Chenyang, et autres
Publié: (2026)
EventDance++: Language-guided Unsupervised Source-free Cross-modal Adaptation for Event-based Object Recognition
par: Zheng, Xu, et autres
Publié: (2024)
par: Zheng, Xu, et autres
Publié: (2024)
LDP: Generalizing to Multilingual Visual Information Extraction by Language Decoupled Pretraining
par: Shen, Huawen, et autres
Publié: (2024)
par: Shen, Huawen, et autres
Publié: (2024)
Visual Language Tracking with Multi-modal Interaction: A Robust Benchmark
par: Li, Xuchen, et autres
Publié: (2024)
par: Li, Xuchen, et autres
Publié: (2024)
Commonsense-T2I Challenge: Can Text-to-Image Generation Models Understand Commonsense?
par: Fu, Xingyu, et autres
Publié: (2024)
par: Fu, Xingyu, et autres
Publié: (2024)
Learning to Remove Lens Flare in Event Camera
par: Han, Haiqian, et autres
Publié: (2025)
par: Han, Haiqian, et autres
Publié: (2025)
Documents similaires
-
Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor
par: Chen, Jiali, et autres
Publié: (2024) -
Multimodal LLM Enhanced Cross-lingual Cross-modal Retrieval
par: Wang, Yabing, et autres
Publié: (2024) -
Generative Visual Commonsense Answering and Explaining with Generative Scene Graph Constructing
par: Yuan, Fan, et autres
Publié: (2025) -
CAVE: Detecting and Explaining Commonsense Anomalies in Visual Environments
par: Bhagwatkar, Rishika, et autres
Publié: (2025) -
VideoXum: Cross-modal Visual and Textural Summarization of Videos
par: Lin, Jingyang, et autres
Publié: (2023)