ChromouVQA: Benchmarking Vision-Language Models under Chromatic Camouflaged Images
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Yunfei, He, Yizhuo, Shao, Yuanxun, Yao, Zhengtao, Xu, Haoyan, Dong, Junhao, Yao, Zhen, Dong, Zhikang |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
AMMKD: Adaptive Multimodal Multi-teacher Distillation for Lightweight Vision-Language Models
by: Li, Yuqi, et al.
Published: (2025)
by: Li, Yuqi, et al.
Published: (2025)
JEPA-T: Joint-Embedding Predictive Architecture with Text Fusion for Image Generation
by: Wan, Siheng, et al.
Published: (2025)
by: Wan, Siheng, et al.
Published: (2025)
Camouflaged Object Tracking: A Benchmark
by: Guo, Xiaoyu, et al.
Published: (2024)
by: Guo, Xiaoyu, et al.
Published: (2024)
Forensics-Bench: A Comprehensive Forgery Detection Benchmark Suite for Large Vision Language Models
by: Wang, Jin, et al.
Published: (2025)
by: Wang, Jin, et al.
Published: (2025)
CLAP4CLIP: Continual Learning with Probabilistic Finetuning for Vision-Language Models
by: Jha, Saurav, et al.
Published: (2024)
by: Jha, Saurav, et al.
Published: (2024)
C3-OWD: A Curriculum Cross-modal Contrastive Learning Framework for Open-World Detection
by: Wang, Siheng, et al.
Published: (2025)
by: Wang, Siheng, et al.
Published: (2025)
MathSight: A Benchmark Exploring Have Vision-Language Models Really Seen in University-Level Mathematical Reasoning?
by: Wang, Yuandong, et al.
Published: (2025)
by: Wang, Yuandong, et al.
Published: (2025)
IllusionVQA: A Challenging Optical Illusion Dataset for Vision Language Models
by: Shahgir, Haz Sameen, et al.
Published: (2024)
by: Shahgir, Haz Sameen, et al.
Published: (2024)
CAMotion: A High-Quality Benchmark for Camouflaged Moving Object Detection in the Wild
by: Yao, Siyuan, et al.
Published: (2026)
by: Yao, Siyuan, et al.
Published: (2026)
Light-VQA+: A Video Quality Assessment Model for Exposure Correction with Vision-Language Guidance
by: Zhou, Xunchu, et al.
Published: (2024)
by: Zhou, Xunchu, et al.
Published: (2024)
SurgCheck: Do Vision-Language Models Really Look at Images in Surgical VQA?
by: Shin, Jongmin, et al.
Published: (2026)
by: Shin, Jongmin, et al.
Published: (2026)
Exploring Iterative Manifold Constraint for Zero-shot Image Editing
by: Li, Maomao, et al.
Published: (2025)
by: Li, Maomao, et al.
Published: (2025)
Camouflage-aware Image-Text Retrieval via Expert Collaboration
by: Jiang, Yao, et al.
Published: (2026)
by: Jiang, Yao, et al.
Published: (2026)
Face-GPS: A Comprehensive Technique for Quantifying Facial Muscle Dynamics in Videos
by: Kim, Juni, et al.
Published: (2024)
by: Kim, Juni, et al.
Published: (2024)
Beyond Surrogate Gradients: Fully Differentiable Token Pruning for Vision-Language Models
by: He, Landi, et al.
Published: (2026)
by: He, Landi, et al.
Published: (2026)
SpaceMind: Camera-Guided Modality Fusion for Spatial Reasoning in Vision-Language Models
by: Zhao, Ruosen, et al.
Published: (2025)
by: Zhao, Ruosen, et al.
Published: (2025)
Open-Vocabulary Camouflaged Object Segmentation with Cascaded Vision Language Models
by: Zhao, Kai, et al.
Published: (2025)
by: Zhao, Kai, et al.
Published: (2025)
Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models
by: Zhu, Wenhui, et al.
Published: (2025)
by: Zhu, Wenhui, et al.
Published: (2025)
Spectral Compressive Imaging via Chromaticity-Intensity Decomposition
by: Wang, Xiaodong, et al.
Published: (2025)
by: Wang, Xiaodong, et al.
Published: (2025)
Vision-Language Model Guided Image Restoration
by: Yang, Cuixin, et al.
Published: (2025)
by: Yang, Cuixin, et al.
Published: (2025)
KOFFVQA: An Objectively Evaluated Free-form VQA Benchmark for Large Vision-Language Models in the Korean Language
by: Kim, Yoonshik, et al.
Published: (2025)
by: Kim, Yoonshik, et al.
Published: (2025)
MCOD: The First Challenging Benchmark for Multispectral Camouflaged Object Detection
by: Li, Yang, et al.
Published: (2025)
by: Li, Yang, et al.
Published: (2025)
Frequency Perception Network for Camouflaged Object Detection
by: Cong, Runmin, et al.
Published: (2023)
by: Cong, Runmin, et al.
Published: (2023)
Lost in Volume: The CT-SpatialVQA Benchmark for Evaluating Semantic-Spatial Understanding of 3D Medical Vision-Language Models
by: Monon, Mashrafi, et al.
Published: (2026)
by: Monon, Mashrafi, et al.
Published: (2026)
Every Image Listens, Every Image Dances: Music-Driven Image Animation
by: Dong, Zhikang, et al.
Published: (2025)
by: Dong, Zhikang, et al.
Published: (2025)
Rethinking Low-Light Image Enhancement: A Log-Domain Intensity--Chromaticity Decoupling Perspective
by: Bai, Guangrui, et al.
Published: (2026)
by: Bai, Guangrui, et al.
Published: (2026)
OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model
by: Chen, Qiguang, et al.
Published: (2026)
by: Chen, Qiguang, et al.
Published: (2026)
An Instance-Aware Prompting Framework for Training-free Camouflaged Object Segmentation
by: Yin, Chao, et al.
Published: (2025)
by: Yin, Chao, et al.
Published: (2025)
Universal Camouflage Attack on Vision-Language Models for Autonomous Driving
by: Kong, Dehong, et al.
Published: (2025)
by: Kong, Dehong, et al.
Published: (2025)
Towards Efficient and General-Purpose Few-Shot Misclassification Detection for Vision-Language Models
by: Zeng, Fanhu, et al.
Published: (2025)
by: Zeng, Fanhu, et al.
Published: (2025)
Embodied Scene Understanding for Vision Language Models via MetaVQA
by: Wang, Weizhen, et al.
Published: (2025)
by: Wang, Weizhen, et al.
Published: (2025)
VLRMBench: A Comprehensive and Challenging Benchmark for Vision-Language Reward Models
by: Ruan, Jiacheng, et al.
Published: (2025)
by: Ruan, Jiacheng, et al.
Published: (2025)
Omniview-Tuning: Boosting Viewpoint Invariance of Vision-Language Pre-training Models
by: Ruan, Shouwei, et al.
Published: (2024)
by: Ruan, Shouwei, et al.
Published: (2024)
SurveillanceVQA-589K: A Benchmark for Comprehensive Surveillance Video-Language Understanding with Large Models
by: Liu, Bo, et al.
Published: (2025)
by: Liu, Bo, et al.
Published: (2025)
OmniMedVQA: A New Large-Scale Comprehensive Evaluation Benchmark for Medical LVLM
by: Hu, Yutao, et al.
Published: (2024)
by: Hu, Yutao, et al.
Published: (2024)
STAG4D: Spatial-Temporal Anchored Generative 4D Gaussians
by: Zeng, Yifei, et al.
Published: (2024)
by: Zeng, Yifei, et al.
Published: (2024)
Unleashing the Capabilities of Large Vision-Language Models for Intelligent Perception of Roadside Infrastructure
by: Fu, Luxuan, et al.
Published: (2026)
by: Fu, Luxuan, et al.
Published: (2026)
Seamless Detection: Unifying Salient Object Detection and Camouflaged Object Detection
by: Liu, Yi, et al.
Published: (2024)
by: Liu, Yi, et al.
Published: (2024)
SLENet: A Guidance-Enhanced Network for Underwater Camouflaged Object Detection
by: Huang, Xinxin, et al.
Published: (2025)
by: Huang, Xinxin, et al.
Published: (2025)
PixelVLA: Advancing Pixel-level Understanding in Vision-Language-Action Model
by: Liang, Wenqi, et al.
Published: (2025)
by: Liang, Wenqi, et al.
Published: (2025)
Similar Items
-
AMMKD: Adaptive Multimodal Multi-teacher Distillation for Lightweight Vision-Language Models
by: Li, Yuqi, et al.
Published: (2025) -
JEPA-T: Joint-Embedding Predictive Architecture with Text Fusion for Image Generation
by: Wan, Siheng, et al.
Published: (2025) -
Camouflaged Object Tracking: A Benchmark
by: Guo, Xiaoyu, et al.
Published: (2024) -
Forensics-Bench: A Comprehensive Forgery Detection Benchmark Suite for Large Vision Language Models
by: Wang, Jin, et al.
Published: (2025) -
CLAP4CLIP: Continual Learning with Probabilistic Finetuning for Vision-Language Models
by: Jha, Saurav, et al.
Published: (2024)