VCD: A Dataset for Visual Commonsense Discovery in Images
Fuente:
arXiv
Salvato in:
| Autori principali: | Shen, Xiangqing, Wang, Fanfan, Wu, Siwei, Xia, Rui |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Study of Commonsense Reasoning over Visual Object Properties
di: Kolari, Abhishek, et al.
Pubblicazione: (2025)
di: Kolari, Abhishek, et al.
Pubblicazione: (2025)
Commonsense-T2I Challenge: Can Text-to-Image Generation Models Understand Commonsense?
di: Fu, Xingyu, et al.
Pubblicazione: (2024)
di: Fu, Xingyu, et al.
Pubblicazione: (2024)
DIVE: Towards Descriptive and Diverse Visual Commonsense Generation
di: Park, Jun-Hyung, et al.
Pubblicazione: (2024)
di: Park, Jun-Hyung, et al.
Pubblicazione: (2024)
SCO-VIST: Social Interaction Commonsense Knowledge-based Visual Storytelling
di: Wang, Eileen, et al.
Pubblicazione: (2024)
di: Wang, Eileen, et al.
Pubblicazione: (2024)
Activating Visual Context and Commonsense Reasoning through Masked Prediction in VLMs
di: Yu, Jiaao, et al.
Pubblicazione: (2025)
di: Yu, Jiaao, et al.
Pubblicazione: (2025)
Reason-Align-Respond: Aligning LLM Reasoning with Knowledge Graphs for KGQA
di: Shen, Xiangqing, et al.
Pubblicazione: (2025)
di: Shen, Xiangqing, et al.
Pubblicazione: (2025)
LoCoT2V-Bench: Benchmarking Long-Form and Complex Text-to-Video Generation
di: Zheng, Xiangqing, et al.
Pubblicazione: (2025)
di: Zheng, Xiangqing, et al.
Pubblicazione: (2025)
HQ-Edit: A High-Quality Dataset for Instruction-based Image Editing
di: Hui, Mude, et al.
Pubblicazione: (2024)
di: Hui, Mude, et al.
Pubblicazione: (2024)
Augmented Commonsense Knowledge for Remote Object Grounding
di: Mohammadi, Bahram, et al.
Pubblicazione: (2024)
di: Mohammadi, Bahram, et al.
Pubblicazione: (2024)
ViCor: Bridging Visual Understanding and Commonsense Reasoning with Large Language Models
di: Zhou, Kaiwen, et al.
Pubblicazione: (2023)
di: Zhou, Kaiwen, et al.
Pubblicazione: (2023)
AEye: A Visualization Tool for Image Datasets
di: Grötschla, Florian, et al.
Pubblicazione: (2024)
di: Grötschla, Florian, et al.
Pubblicazione: (2024)
Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor
di: Chen, Jiali, et al.
Pubblicazione: (2024)
di: Chen, Jiali, et al.
Pubblicazione: (2024)
CoralVQA: A Large-Scale Visual Question Answering Dataset for Coral Reef Image Understanding
di: Han, Hongyong, et al.
Pubblicazione: (2025)
di: Han, Hongyong, et al.
Pubblicazione: (2025)
Visual Prompt Discovery via Semantic Exploration
di: Kim, Jaechang, et al.
Pubblicazione: (2026)
di: Kim, Jaechang, et al.
Pubblicazione: (2026)
CDH-Bench: A Commonsense-Driven Hallucination Benchmark for Evaluating Visual Fidelity in Vision-Language Models
di: Chen, Kesheng, et al.
Pubblicazione: (2026)
di: Chen, Kesheng, et al.
Pubblicazione: (2026)
Automatic Discovery of Visual Circuits
di: Rajaram, Achyuta, et al.
Pubblicazione: (2024)
di: Rajaram, Achyuta, et al.
Pubblicazione: (2024)
Generating Attribution Reports for Manipulated Facial Images: A Dataset and Baseline
di: Lian, Jingchun, et al.
Pubblicazione: (2024)
di: Lian, Jingchun, et al.
Pubblicazione: (2024)
Gemini in Reasoning: Unveiling Commonsense in Multimodal Large Language Models
di: Wang, Yuqing, et al.
Pubblicazione: (2023)
di: Wang, Yuqing, et al.
Pubblicazione: (2023)
GPT-Image-2 in the Wild: A Twitter Dataset of Self-Reported AI-Generated Images from the First Week of Deployment
di: Zewde, Kidus, et al.
Pubblicazione: (2026)
di: Zewde, Kidus, et al.
Pubblicazione: (2026)
Towards Ancient Plant Seed Classification: A Benchmark Dataset and Baseline Model
di: Xing, Rui, et al.
Pubblicazione: (2025)
di: Xing, Rui, et al.
Pubblicazione: (2025)
RL-I2IT: Image-to-Image Translation with Deep Reinforcement Learning
di: Hu, Jing, et al.
Pubblicazione: (2023)
di: Hu, Jing, et al.
Pubblicazione: (2023)
Commonsense Video Question Answering through Video-Grounded Entailment Tree Reasoning
di: Liu, Huabin, et al.
Pubblicazione: (2025)
di: Liu, Huabin, et al.
Pubblicazione: (2025)
BrandFusion: A Multi-Agent Framework for Seamless Brand Integration in Text-to-Video Generation
di: Zhu, Zihao, et al.
Pubblicazione: (2026)
di: Zhu, Zihao, et al.
Pubblicazione: (2026)
BrainVis: Exploring the Bridge between Brain and Visual Signals via Image Reconstruction
di: Fu, Honghao, et al.
Pubblicazione: (2023)
di: Fu, Honghao, et al.
Pubblicazione: (2023)
Enhancing Skin Disease Diagnosis: Interpretable Visual Concept Discovery with SAM
di: Hu, Xin, et al.
Pubblicazione: (2024)
di: Hu, Xin, et al.
Pubblicazione: (2024)
VIRTUE: Visual-Interactive Text-Image Universal Embedder
di: Wang, Wei-Yao, et al.
Pubblicazione: (2025)
di: Wang, Wei-Yao, et al.
Pubblicazione: (2025)
Let's Go Shopping (LGS) -- Web-Scale Image-Text Dataset for Visual Concept Understanding
di: Bai, Yatong, et al.
Pubblicazione: (2024)
di: Bai, Yatong, et al.
Pubblicazione: (2024)
Conditional Image Synthesis with Diffusion Models: A Survey
di: Zhan, Zheyuan, et al.
Pubblicazione: (2024)
di: Zhan, Zheyuan, et al.
Pubblicazione: (2024)
Chatting with Images for Introspective Visual Thinking
di: Wu, Junfei, et al.
Pubblicazione: (2026)
di: Wu, Junfei, et al.
Pubblicazione: (2026)
Large Language Models Can Understanding Depth from Monocular Images
di: Xia, Zhongyi, et al.
Pubblicazione: (2024)
di: Xia, Zhongyi, et al.
Pubblicazione: (2024)
ResAgent: Entropy-based Prior Point Discovery and Visual Reasoning for Referring Expression Segmentation
di: Wang, Yihao, et al.
Pubblicazione: (2026)
di: Wang, Yihao, et al.
Pubblicazione: (2026)
JPEG AI Image Compression Visual Artifacts: Detection Methods and Dataset
di: Tsereh, Daria, et al.
Pubblicazione: (2024)
di: Tsereh, Daria, et al.
Pubblicazione: (2024)
Adversarial Testing for Visual Grounding via Image-Aware Property Reduction
di: Chang, Zhiyuan, et al.
Pubblicazione: (2024)
di: Chang, Zhiyuan, et al.
Pubblicazione: (2024)
ViPO: Visual Preference Optimization at Scale
di: Li, Ming, et al.
Pubblicazione: (2026)
di: Li, Ming, et al.
Pubblicazione: (2026)
JARVIS: A Neuro-Symbolic Commonsense Reasoning Framework for Conversational Embodied Agents
di: Zheng, Kaizhi, et al.
Pubblicazione: (2022)
di: Zheng, Kaizhi, et al.
Pubblicazione: (2022)
TwiFF (Think With Future Frames): A Large-Scale Dataset for Dynamic Visual Reasoning
di: Liu, Junhua, et al.
Pubblicazione: (2026)
di: Liu, Junhua, et al.
Pubblicazione: (2026)
Towards Commonsense Knowledge based Fuzzy Systems for Supporting Size-Related Fine-Grained Object Detection
di: Zhang, Pu, et al.
Pubblicazione: (2023)
di: Zhang, Pu, et al.
Pubblicazione: (2023)
HMGIE: Hierarchical and Multi-Grained Inconsistency Evaluation for Vision-Language Data Cleansing
di: Zhu, Zihao, et al.
Pubblicazione: (2024)
di: Zhu, Zihao, et al.
Pubblicazione: (2024)
Boosting Generalizability towards Zero-Shot Cross-Dataset Single-Image Indoor Depth by Meta-Initialization
di: Wu, Cho-Ying, et al.
Pubblicazione: (2024)
di: Wu, Cho-Ying, et al.
Pubblicazione: (2024)
OpenGPT-4o-Image: A Comprehensive Dataset for Advanced Image Generation and Editing
di: Chen, Zhihong, et al.
Pubblicazione: (2025)
di: Chen, Zhihong, et al.
Pubblicazione: (2025)
Documenti analoghi
-
A Study of Commonsense Reasoning over Visual Object Properties
di: Kolari, Abhishek, et al.
Pubblicazione: (2025) -
Commonsense-T2I Challenge: Can Text-to-Image Generation Models Understand Commonsense?
di: Fu, Xingyu, et al.
Pubblicazione: (2024) -
DIVE: Towards Descriptive and Diverse Visual Commonsense Generation
di: Park, Jun-Hyung, et al.
Pubblicazione: (2024) -
SCO-VIST: Social Interaction Commonsense Knowledge-based Visual Storytelling
di: Wang, Eileen, et al.
Pubblicazione: (2024) -
Activating Visual Context and Commonsense Reasoning through Masked Prediction in VLMs
di: Yu, Jiaao, et al.
Pubblicazione: (2025)