Generative Visual Commonsense Answering and Explaining with Generative Scene Graph Constructing
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yuan, Fan, Fang, Xiaoyuan, Quan, Rong, Li, Jing, Bi, Wei, Xu, Xiaogang, Li, Piji |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
HELPD: Mitigating Hallucination of LVLMs by Hierarchical Feedback Learning with Vision-enhanced Penalty Decoding
par: Yuan, Fan, et autres
Publié: (2024)
par: Yuan, Fan, et autres
Publié: (2024)
CAVE: Detecting and Explaining Commonsense Anomalies in Visual Environments
par: Bhagwatkar, Rishika, et autres
Publié: (2025)
par: Bhagwatkar, Rishika, et autres
Publié: (2025)
Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor
par: Chen, Jiali, et autres
Publié: (2024)
par: Chen, Jiali, et autres
Publié: (2024)
ViConsFormer: Constituting Meaningful Phrases of Scene Texts using Transformer-based Method in Vietnamese Text-based Visual Question Answering
par: Nguyen, Nghia Hieu, et autres
Publié: (2024)
par: Nguyen, Nghia Hieu, et autres
Publié: (2024)
QA-Dragon: Query-Aware Dynamic RAG System for Knowledge-Intensive Visual Question Answering
par: Jiang, Zhuohang, et autres
Publié: (2025)
par: Jiang, Zhuohang, et autres
Publié: (2025)
Commonsense-T2I Challenge: Can Text-to-Image Generation Models Understand Commonsense?
par: Fu, Xingyu, et autres
Publié: (2024)
par: Fu, Xingyu, et autres
Publié: (2024)
CommonScenes: Generating Commonsense 3D Indoor Scenes with Scene Graph Diffusion
par: Zhai, Guangyao, et autres
Publié: (2023)
par: Zhai, Guangyao, et autres
Publié: (2023)
EventLens: Leveraging Event-Aware Pretraining and Cross-modal Linking Enhances Visual Commonsense Reasoning
par: Ma, Mingjie, et autres
Publié: (2024)
par: Ma, Mingjie, et autres
Publié: (2024)
SceneAlign: Aligning Multimodal Reasoning to Scene Graphs in Complex Visual Scenes
par: Wang, Chuhan, et autres
Publié: (2026)
par: Wang, Chuhan, et autres
Publié: (2026)
Grounding Chest X-Ray Visual Question Answering with Generated Radiology Reports
par: Serra, Francesco Dalla, et autres
Publié: (2025)
par: Serra, Francesco Dalla, et autres
Publié: (2025)
Interleaved Scene Graphs for Interleaved Text-and-Image Generation Assessment
par: Chen, Dongping, et autres
Publié: (2024)
par: Chen, Dongping, et autres
Publié: (2024)
Open World Scene Graph Generation using Vision Language Models
par: Dutta, Amartya, et autres
Publié: (2025)
par: Dutta, Amartya, et autres
Publié: (2025)
Computed Tomography Visual Question Answering with Cross-modal Feature Graphing
par: Tian, Yuanhe, et autres
Publié: (2025)
par: Tian, Yuanhe, et autres
Publié: (2025)
Visual-RAG: Benchmarking Text-to-Image Retrieval Augmented Generation for Visual Knowledge Intensive Queries
par: Wu, Yin, et autres
Publié: (2025)
par: Wu, Yin, et autres
Publié: (2025)
VisualSimpleQA: A Benchmark for Decoupled Evaluation of Large Vision-Language Models in Fact-Seeking Question Answering
par: Wang, Yanling, et autres
Publié: (2025)
par: Wang, Yanling, et autres
Publié: (2025)
Overcoming Language Priors for Visual Question Answering Based on Knowledge Distillation
par: Peng, Daowan, et autres
Publié: (2025)
par: Peng, Daowan, et autres
Publié: (2025)
Natural Language Understanding and Inference with MLLM in Visual Question Answering: A Survey
par: Kuang, Jiayi, et autres
Publié: (2024)
par: Kuang, Jiayi, et autres
Publié: (2024)
DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies
par: Song, Wei, et autres
Publié: (2025)
par: Song, Wei, et autres
Publié: (2025)
Visual Riddles: a Commonsense and World Knowledge Challenge for Large Vision and Language Models
par: Bitton-Guetta, Nitzan, et autres
Publié: (2024)
par: Bitton-Guetta, Nitzan, et autres
Publié: (2024)
Predicate Debiasing in Vision-Language Models Integration for Scene Graph Generation Enhancement
par: Wang, Yuxuan, et autres
Publié: (2024)
par: Wang, Yuxuan, et autres
Publié: (2024)
Selectively Answering Visual Questions
par: Eisenschlos, Julian Martin, et autres
Publié: (2024)
par: Eisenschlos, Julian Martin, et autres
Publié: (2024)
Improving Brain-to-Image Reconstruction via Fine-Grained Text Bridging
par: Xia, Runze, et autres
Publié: (2025)
par: Xia, Runze, et autres
Publié: (2025)
Estimating Commonsense Scene Composition on Belief Scene Graphs
par: Saucedo, Mario A. V., et autres
Publié: (2025)
par: Saucedo, Mario A. V., et autres
Publié: (2025)
HERO: Hierarchical Traversable 3D Scene Graphs for Embodied Navigation Among Movable Obstacles
par: Wang, Yunheng, et autres
Publié: (2025)
par: Wang, Yunheng, et autres
Publié: (2025)
Informative Scene Graph Generation via Debiasing
par: Gao, Lianli, et autres
Publié: (2023)
par: Gao, Lianli, et autres
Publié: (2023)
Global-Local Tree Search in VLMs for 3D Indoor Scene Generation
par: Deng, Wei, et autres
Publié: (2025)
par: Deng, Wei, et autres
Publié: (2025)
LSRS: Latent Scale Rejection Sampling for Visual Autoregressive Modeling
par: Zheng, Hong-Kai, et autres
Publié: (2025)
par: Zheng, Hong-Kai, et autres
Publié: (2025)
MSG-Chart: Multimodal Scene Graph for ChartQA
par: Dai, Yue, et autres
Publié: (2024)
par: Dai, Yue, et autres
Publié: (2024)
Enhancing Scene Graph Generation with Hierarchical Relationships and Commonsense Knowledge
par: Jiang, Bowen, et autres
Publié: (2023)
par: Jiang, Bowen, et autres
Publié: (2023)
Design as Desired: Utilizing Visual Question Answering for Multimodal Pre-training
par: Su, Tongkun, et autres
Publié: (2024)
par: Su, Tongkun, et autres
Publié: (2024)
ViCor: Bridging Visual Understanding and Commonsense Reasoning with Large Language Models
par: Zhou, Kaiwen, et autres
Publié: (2023)
par: Zhou, Kaiwen, et autres
Publié: (2023)
GraphEQA: Using 3D Semantic Scene Graphs for Real-time Embodied Question Answering
par: Saxena, Saumya, et autres
Publié: (2024)
par: Saxena, Saumya, et autres
Publié: (2024)
Beyond the Textual: Generating Coherent Visual Options for MCQs
par: Wang, Wanqiang, et autres
Publié: (2025)
par: Wang, Wanqiang, et autres
Publié: (2025)
Towards Visual-Prompt Temporal Answering Grounding in Medical Instructional Video
par: Li, Bin, et autres
Publié: (2022)
par: Li, Bin, et autres
Publié: (2022)
Generalizing Visual Question Answering from Synthetic to Human-Written Questions via a Chain of QA with a Large Language Model
par: Kim, Taehee, et autres
Publié: (2024)
par: Kim, Taehee, et autres
Publié: (2024)
LLMs Meet Long Video: Advancing Long Video Question Answering with An Interactive Visual Adapter in LLMs
par: Li, Yunxin, et autres
Publié: (2024)
par: Li, Yunxin, et autres
Publié: (2024)
VIALM: A Survey and Benchmark of Visually Impaired Assistance with Large Models
par: Zhao, Yi, et autres
Publié: (2024)
par: Zhao, Yi, et autres
Publié: (2024)
Unbiased Video Scene Graph Generation via Visual and Semantic Dual Debiasing
par: Li, Yanjun, et autres
Publié: (2025)
par: Li, Yanjun, et autres
Publié: (2025)
GeReA: Question-Aware Prompt Captions for Knowledge-based Visual Question Answering
par: Ma, Ziyu, et autres
Publié: (2024)
par: Ma, Ziyu, et autres
Publié: (2024)
ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answering
par: Compagnoni, Alberto, et autres
Publié: (2025)
par: Compagnoni, Alberto, et autres
Publié: (2025)
Documents similaires
-
HELPD: Mitigating Hallucination of LVLMs by Hierarchical Feedback Learning with Vision-enhanced Penalty Decoding
par: Yuan, Fan, et autres
Publié: (2024) -
CAVE: Detecting and Explaining Commonsense Anomalies in Visual Environments
par: Bhagwatkar, Rishika, et autres
Publié: (2025) -
Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor
par: Chen, Jiali, et autres
Publié: (2024) -
ViConsFormer: Constituting Meaningful Phrases of Scene Texts using Transformer-based Method in Vietnamese Text-based Visual Question Answering
par: Nguyen, Nghia Hieu, et autres
Publié: (2024) -
QA-Dragon: Query-Aware Dynamic RAG System for Knowledge-Intensive Visual Question Answering
par: Jiang, Zhuohang, et autres
Publié: (2025)