ViFP: A Framework for Visual False Positive Detection to Enhance Reasoning Reliability in VLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Ben, Yu, LuLu, Gao, Lei, Guo, QuanJiang, Liu, Jing, Gao, Hui |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
From COCO to COCO-FP: A Deep Dive into Background False Positives for COCO Detectors
di: Liu, Longfei, et al.
Pubblicazione: (2024)
di: Liu, Longfei, et al.
Pubblicazione: (2024)
Image Copy-Move Forgery Detection and Localization Scheme: How to Avoid Missed Detection and False Alarm
di: Jiang, Li, et al.
Pubblicazione: (2024)
di: Jiang, Li, et al.
Pubblicazione: (2024)
Focusing by Contrastive Attention: Enhancing VLMs' Visual Reasoning
di: Ge, Yuyao, et al.
Pubblicazione: (2025)
di: Ge, Yuyao, et al.
Pubblicazione: (2025)
Exploiting Lightweight Hierarchical ViT and Dynamic Framework for Efficient Visual Tracking
di: Kang, Ben, et al.
Pubblicazione: (2025)
di: Kang, Ben, et al.
Pubblicazione: (2025)
Can VLMs Unlock Semantic Anomaly Detection? A Framework for Structured Reasoning
di: Brusnicki, Roberto, et al.
Pubblicazione: (2025)
di: Brusnicki, Roberto, et al.
Pubblicazione: (2025)
How Auxiliary Reasoning Unleashes GUI Grounding in VLMs
di: Li, Weiming, et al.
Pubblicazione: (2025)
di: Li, Weiming, et al.
Pubblicazione: (2025)
Vision Verification Enhanced Fusion of VLMs for Efficient Visual Reasoning
di: Tekin, Selim Furkan, et al.
Pubblicazione: (2026)
di: Tekin, Selim Furkan, et al.
Pubblicazione: (2026)
LLMs Meet VLMs: Boost Open Vocabulary Object Detection with Fine-grained Descriptors
di: Jin, Sheng, et al.
Pubblicazione: (2024)
di: Jin, Sheng, et al.
Pubblicazione: (2024)
Probing the Reliability of Driving VLMs: From Inconsistent Responses to Grounded Temporal Reasoning
di: Chang, Chun-Peng, et al.
Pubblicazione: (2026)
di: Chang, Chun-Peng, et al.
Pubblicazione: (2026)
To See or To Please: Uncovering Visual Sycophancy and Split Beliefs in VLMs
di: Hong, Rui, et al.
Pubblicazione: (2026)
di: Hong, Rui, et al.
Pubblicazione: (2026)
ViRC: Enhancing Visual Interleaved Mathematical CoT with Reason Chunking
di: Wang, Lihong, et al.
Pubblicazione: (2025)
di: Wang, Lihong, et al.
Pubblicazione: (2025)
ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs
di: Wang, Xiyao, et al.
Pubblicazione: (2025)
di: Wang, Xiyao, et al.
Pubblicazione: (2025)
VLMs have Tunnel Vision: Evaluating Nonlocal Visual Reasoning in Leading VLMs
di: Berman, Shmuel, et al.
Pubblicazione: (2025)
di: Berman, Shmuel, et al.
Pubblicazione: (2025)
Adaptive Chain-of-Focus Reasoning via Dynamic Visual Search and Zooming for Efficient VLMs
di: Zhang, Xintong, et al.
Pubblicazione: (2025)
di: Zhang, Xintong, et al.
Pubblicazione: (2025)
Beyond Shortcuts: Mitigating Visual Illusions in Frozen VLMs via Qualitative Reasoning
di: Guo, Hao, et al.
Pubblicazione: (2026)
di: Guo, Hao, et al.
Pubblicazione: (2026)
ViSA-Enhanced Aerial VLN: A Visual-Spatial Reasoning Enhanced Framework for Aerial Vision-Language Navigation
di: Tong, Haoyu, et al.
Pubblicazione: (2026)
di: Tong, Haoyu, et al.
Pubblicazione: (2026)
ProSR: Process-Shaped Spatial Reasoning for Reliable Chain-of-Thought in VLMs
di: Li, Jiangyang, et al.
Pubblicazione: (2026)
di: Li, Jiangyang, et al.
Pubblicazione: (2026)
ETC: Extreme Token Compression via Task-aware Visual Information Distillation in VLMs
di: Gao, Yiling, et al.
Pubblicazione: (2026)
di: Gao, Yiling, et al.
Pubblicazione: (2026)
Think Twice to See More: Iterative Visual Reasoning in Medical VLMs
di: Chen, Kaitao, et al.
Pubblicazione: (2025)
di: Chen, Kaitao, et al.
Pubblicazione: (2025)
Targeted False Positive Synthesis via Detector-guided Adversarial Diffusion Attacker for Robust Polyp Detection
di: Zhou, Quan, et al.
Pubblicazione: (2025)
di: Zhou, Quan, et al.
Pubblicazione: (2025)
VRIQ: Benchmarking and Analyzing Visual-Reasoning IQ of VLMs
di: Khezresmaeilzadeh, Tina, et al.
Pubblicazione: (2026)
di: Khezresmaeilzadeh, Tina, et al.
Pubblicazione: (2026)
Activating Visual Context and Commonsense Reasoning through Masked Prediction in VLMs
di: Yu, Jiaao, et al.
Pubblicazione: (2025)
di: Yu, Jiaao, et al.
Pubblicazione: (2025)
ViLLa: Video Reasoning Segmentation with Large Language Model
di: Zheng, Rongkun, et al.
Pubblicazione: (2024)
di: Zheng, Rongkun, et al.
Pubblicazione: (2024)
Decomposing Visual Classification: Assessing Tree-Based Reasoning in VLMs
di: Elmansoury, Sary, et al.
Pubblicazione: (2025)
di: Elmansoury, Sary, et al.
Pubblicazione: (2025)
VisRes Bench: On Evaluating the Visual Reasoning Capabilities of VLMs
di: Törtei, Brigitta Malagurski, et al.
Pubblicazione: (2025)
di: Törtei, Brigitta Malagurski, et al.
Pubblicazione: (2025)
TAR-TVG: Enhancing VLMs with Timestamp Anchor-Constrained Reasoning for Temporal Video Grounding
di: Guo, Chaohong, et al.
Pubblicazione: (2025)
di: Guo, Chaohong, et al.
Pubblicazione: (2025)
Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs
di: Zhang, Qizhe, et al.
Pubblicazione: (2024)
di: Zhang, Qizhe, et al.
Pubblicazione: (2024)
TikArt: Stabilizing Aperture-Guided Fine-Grained Visual Reasoning with Reinforcement Learning
di: Ding, Hao, et al.
Pubblicazione: (2026)
di: Ding, Hao, et al.
Pubblicazione: (2026)
Narrative Weaver: Towards Controllable Long-Range Visual Consistency with Multi-Modal Conditioning
di: Yao, Zhengjian, et al.
Pubblicazione: (2026)
di: Yao, Zhengjian, et al.
Pubblicazione: (2026)
Thinking with Gaze: Sequential Eye-Tracking as Visual Reasoning Supervision for Medical VLMs
di: Li, Yiwei, et al.
Pubblicazione: (2026)
di: Li, Yiwei, et al.
Pubblicazione: (2026)
Visual Structures Helps Visual Reasoning: Addressing the Binding Problem in VLMs
di: Izadi, Amirmohammad, et al.
Pubblicazione: (2025)
di: Izadi, Amirmohammad, et al.
Pubblicazione: (2025)
False Positive Sampling-based Data Augmentation for Enhanced 3D Object Detection Accuracy
di: Oh, Jiyong, et al.
Pubblicazione: (2024)
di: Oh, Jiyong, et al.
Pubblicazione: (2024)
LaViT: Aligning Latent Visual Thoughts for Multi-modal Reasoning
di: Wu, Linquan, et al.
Pubblicazione: (2026)
di: Wu, Linquan, et al.
Pubblicazione: (2026)
DuQuant++: Fine-grained Rotation Enhances Microscaling FP4 Quantization
di: Lin, Haokun, et al.
Pubblicazione: (2026)
di: Lin, Haokun, et al.
Pubblicazione: (2026)
ViDA: Homeostatic Visual Domain Adapter for Continual Test Time Adaptation
di: Liu, Jiaming, et al.
Pubblicazione: (2023)
di: Liu, Jiaming, et al.
Pubblicazione: (2023)
Spatial-ViLT: Enhancing Visual Spatial Reasoning through Multi-Task Learning
di: Islam, Chashi Mahiul, et al.
Pubblicazione: (2025)
di: Islam, Chashi Mahiul, et al.
Pubblicazione: (2025)
VACoT: Rethinking Visual Data Augmentation with VLMs
di: Xu, Zhengzhuo, et al.
Pubblicazione: (2025)
di: Xu, Zhengzhuo, et al.
Pubblicazione: (2025)
iVISPAR -- An Interactive Visual-Spatial Reasoning Benchmark for VLMs
di: Mayer, Julius, et al.
Pubblicazione: (2025)
di: Mayer, Julius, et al.
Pubblicazione: (2025)
FP-Predictor - False Positive Prediction for Static Analysis Reports
di: Ohlmer, Tom, et al.
Pubblicazione: (2026)
di: Ohlmer, Tom, et al.
Pubblicazione: (2026)
LVC: A Lightweight Compression Framework for Enhancing VLMs in Long Video Understanding
di: Wang, Ziyi, et al.
Pubblicazione: (2025)
di: Wang, Ziyi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
From COCO to COCO-FP: A Deep Dive into Background False Positives for COCO Detectors
di: Liu, Longfei, et al.
Pubblicazione: (2024) -
Image Copy-Move Forgery Detection and Localization Scheme: How to Avoid Missed Detection and False Alarm
di: Jiang, Li, et al.
Pubblicazione: (2024) -
Focusing by Contrastive Attention: Enhancing VLMs' Visual Reasoning
di: Ge, Yuyao, et al.
Pubblicazione: (2025) -
Exploiting Lightweight Hierarchical ViT and Dynamic Framework for Efficient Visual Tracking
di: Kang, Ben, et al.
Pubblicazione: (2025) -
Can VLMs Unlock Semantic Anomaly Detection? A Framework for Structured Reasoning
di: Brusnicki, Roberto, et al.
Pubblicazione: (2025)