LogicQA: Logical Anomaly Detection with Vision Language Model Generated Questions
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kwon, Yejin, Moon, Daeun, Oh, Youngje, Yoon, Hyunsoo |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Bidirectional Multimodal Prompt Learning with Scale-Aware Training for Few-Shot Multi-Class Anomaly Detection
par: Lee, Yujin, et autres
Publié: (2024)
par: Lee, Yujin, et autres
Publié: (2024)
SALAD -- Semantics-Aware Logical Anomaly Detection
par: Fučka, Matic, et autres
Publié: (2025)
par: Fučka, Matic, et autres
Publié: (2025)
TMUAD: Enhancing Logical Capabilities in Unified Anomaly Detection Models with a Text Memory Bank
par: Liu, Jiawei, et autres
Publié: (2025)
par: Liu, Jiawei, et autres
Publié: (2025)
Self-Correcting Text-to-Video Generation with Misalignment Detection and Localized Refinement
par: Lee, Daeun, et autres
Publié: (2024)
par: Lee, Daeun, et autres
Publié: (2024)
DarkQA: Benchmarking Vision-Language Models on Visual-Primitive Question Answering in Low-Light Indoor Scenes
par: Park, Yohan, et autres
Publié: (2025)
par: Park, Yohan, et autres
Publié: (2025)
Local-to-Global Logical Explanations for Deep Vision Models
par: Vasu, Bhavan, et autres
Publié: (2026)
par: Vasu, Bhavan, et autres
Publié: (2026)
Self-Evolving Spatial Reasoning in Vision Language Models via Geometric Logic Consistency
par: Liu, Junming, et autres
Publié: (2026)
par: Liu, Junming, et autres
Publié: (2026)
VALUED -- Vision and Logical Understanding Evaluation Dataset
par: Saha, Soumadeep, et autres
Publié: (2023)
par: Saha, Soumadeep, et autres
Publié: (2023)
\textit{FocaLogic}: Logic-Based Interpretation of Visual Model Decisions
par: Zhao, Chenchen, et autres
Publié: (2026)
par: Zhao, Chenchen, et autres
Publié: (2026)
Multimodal Distribution Matching for Vision-Language Dataset Distillation
par: Jeong, Jongoh, et autres
Publié: (2026)
par: Jeong, Jongoh, et autres
Publié: (2026)
KKA: Improving Vision Anomaly Detection through Anomaly-related Knowledge from Large Language Models
par: Chen, Dong, et autres
Publié: (2025)
par: Chen, Dong, et autres
Publié: (2025)
mChartQA: A universal benchmark for multimodal Chart Question Answer based on Vision-Language Alignment and Reasoning
par: Wei, Jingxuan, et autres
Publié: (2024)
par: Wei, Jingxuan, et autres
Publié: (2024)
Few Shot Part Segmentation Reveals Compositional Logic for Industrial Anomaly Detection
par: Kim, Soopil, et autres
Publié: (2023)
par: Kim, Soopil, et autres
Publié: (2023)
VLM's Eye Examination: Instruct and Inspect Visual Competency of Vision Language Models
par: Hyeon-Woo, Nam, et autres
Publié: (2024)
par: Hyeon-Woo, Nam, et autres
Publié: (2024)
MetaLogic: Robustness Evaluation of Text-to-Image Models via Logically Equivalent Prompts
par: Shen, Yifan, et autres
Publié: (2025)
par: Shen, Yifan, et autres
Publié: (2025)
Unlocking Vision-Language Models for Video Anomaly Detection via Fine-Grained Prompting
par: Zou, Shu, et autres
Publié: (2025)
par: Zou, Shu, et autres
Publié: (2025)
VoQA: Visual-only Question Answering
par: An, Jianing, et autres
Publié: (2025)
par: An, Jianing, et autres
Publié: (2025)
FIQ: Fundamental Question Generation with the Integration of Question Embeddings for Video Question Answering
par: Oh, Ju-Young, et autres
Publié: (2025)
par: Oh, Ju-Young, et autres
Publié: (2025)
Logical Closed Loop: Uncovering Object Hallucinations in Large Vision-Language Models
par: Wu, Junfei, et autres
Publié: (2024)
par: Wu, Junfei, et autres
Publié: (2024)
YTCommentQA: Video Question Answerability in Instructional Videos
par: Yang, Saelyne, et autres
Publié: (2024)
par: Yang, Saelyne, et autres
Publié: (2024)
VideoGameQA-Bench: Evaluating Vision-Language Models for Video Game Quality Assurance
par: Taesiri, Mohammad Reza, et autres
Publié: (2025)
par: Taesiri, Mohammad Reza, et autres
Publié: (2025)
Towards Visual Text Design Transfer Across Languages
par: Choi, Yejin, et autres
Publié: (2024)
par: Choi, Yejin, et autres
Publié: (2024)
Harnessing Vision-Language Models for Time Series Anomaly Detection
par: He, Zelin, et autres
Publié: (2025)
par: He, Zelin, et autres
Publié: (2025)
VisionCoach: Reinforcing Grounded Video Reasoning via Visual-Perception Prompting
par: Lee, Daeun, et autres
Publié: (2026)
par: Lee, Daeun, et autres
Publié: (2026)
Research on Vision-Language Question Answering Models for Industrial Robots
par: Li, Ping, et autres
Publié: (2026)
par: Li, Ping, et autres
Publié: (2026)
WildVision: Evaluating Vision-Language Models in the Wild with Human Preferences
par: Lu, Yujie, et autres
Publié: (2024)
par: Lu, Yujie, et autres
Publié: (2024)
LPOI: Listwise Preference Optimization for Vision Language Models
par: Zadeh, Fatemeh Pesaran, et autres
Publié: (2025)
par: Zadeh, Fatemeh Pesaran, et autres
Publié: (2025)
Anomaly-Aware Vision-Language Adapters for Zero-Shot Anomaly Detection
par: Aqeel, Muhammad, et autres
Publié: (2026)
par: Aqeel, Muhammad, et autres
Publié: (2026)
Video-Skill-CoT: Skill-based Chain-of-Thoughts for Domain-Adaptive Video Reasoning
par: Lee, Daeun, et autres
Publié: (2025)
par: Lee, Daeun, et autres
Publié: (2025)
PIP: Detecting Adversarial Examples in Large Vision-Language Models via Attention Patterns of Irrelevant Probe Questions
par: Zhang, Yudong, et autres
Publié: (2024)
par: Zhang, Yudong, et autres
Publié: (2024)
Adapting Lightweight Vision Language Models for Radiological Visual Question Answering
par: Shourya, Aditya, et autres
Publié: (2025)
par: Shourya, Aditya, et autres
Publié: (2025)
NuScenes-SpatialQA: A Spatial Understanding and Reasoning Benchmark for Vision-Language Models in Autonomous Driving
par: Tian, Kexin, et autres
Publié: (2025)
par: Tian, Kexin, et autres
Publié: (2025)
Generating by Understanding: Neural Visual Generation with Logical Symbol Groundings
par: Peng, Yifei, et autres
Publié: (2023)
par: Peng, Yifei, et autres
Publié: (2023)
Visual Accommodation: Rethinking Image Scale as a Learnable Variable for Object Detection
par: Seo, Daeun, et autres
Publié: (2024)
par: Seo, Daeun, et autres
Publié: (2024)
LingoQA: Visual Question Answering for Autonomous Driving
par: Marcu, Ana-Maria, et autres
Publié: (2023)
par: Marcu, Ana-Maria, et autres
Publié: (2023)
Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models
par: Mohamud, Safaa Abdullahi Moallim, et autres
Publié: (2025)
par: Mohamud, Safaa Abdullahi Moallim, et autres
Publié: (2025)
InfoChartQA: A Benchmark for Multimodal Question Answering on Infographic Charts
par: Xie, Tianchi, et autres
Publié: (2025)
par: Xie, Tianchi, et autres
Publié: (2025)
MAFA: Managing False Negatives for Vision-Language Pre-training
par: Byun, Jaeseok, et autres
Publié: (2023)
par: Byun, Jaeseok, et autres
Publié: (2023)
Bias Detection and Rotation-Robustness Mitigation in Vision-Language Models and Generative Image Models
par: Mithila, Tarannum
Publié: (2026)
par: Mithila, Tarannum
Publié: (2026)
AD-Copilot: A Vision-Language Assistant for Industrial Anomaly Detection via Visual In-context Comparison
par: Jiang, Xi, et autres
Publié: (2026)
par: Jiang, Xi, et autres
Publié: (2026)
Documents similaires
-
Bidirectional Multimodal Prompt Learning with Scale-Aware Training for Few-Shot Multi-Class Anomaly Detection
par: Lee, Yujin, et autres
Publié: (2024) -
SALAD -- Semantics-Aware Logical Anomaly Detection
par: Fučka, Matic, et autres
Publié: (2025) -
TMUAD: Enhancing Logical Capabilities in Unified Anomaly Detection Models with a Text Memory Bank
par: Liu, Jiawei, et autres
Publié: (2025) -
Self-Correcting Text-to-Video Generation with Misalignment Detection and Localized Refinement
par: Lee, Daeun, et autres
Publié: (2024) -
DarkQA: Benchmarking Vision-Language Models on Visual-Primitive Question Answering in Low-Light Indoor Scenes
par: Park, Yohan, et autres
Publié: (2025)