SNAP: A Benchmark for Testing the Effects of Capture Conditions on Fundamental Vision Tasks
Fuente:
arXiv
Saved in:
| Main Authors: | Kotseruba, Iuliia, Tsotsos, John K. |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Understanding and Modeling the Effects of Task and Context on Drivers' Gaze Allocation
by: Kotseruba, Iuliia, et al.
Published: (2023)
by: Kotseruba, Iuliia, et al.
Published: (2023)
SCOUT+: Towards Practical Task-Driven Drivers' Gaze Prediction
by: Kotseruba, Iuliia, et al.
Published: (2024)
by: Kotseruba, Iuliia, et al.
Published: (2024)
Data Limitations for Modeling Top-Down Effects on Drivers' Attention
by: Kotseruba, Iuliia, et al.
Published: (2024)
by: Kotseruba, Iuliia, et al.
Published: (2024)
Do Saliency Models Detect Odd-One-Out Targets? New Datasets and Evaluations
by: Kotseruba, Iuliia, et al.
Published: (2020)
by: Kotseruba, Iuliia, et al.
Published: (2020)
Diving Deeper Into Pedestrian Behavior Understanding: Intention Estimation, Action Prediction, and Event Risk Assessment
by: Rasouli, Amir, et al.
Published: (2024)
by: Rasouli, Amir, et al.
Published: (2024)
Statistical Challenges with Dataset Construction: Why You Will Never Have Enough Images
by: Goldman, Josh, et al.
Published: (2024)
by: Goldman, Josh, et al.
Published: (2024)
SNAP: Towards Segmenting Anything in Any Point Cloud
by: Gupta, Aniket, et al.
Published: (2025)
by: Gupta, Aniket, et al.
Published: (2025)
Diffusion-Based Authentication of Copy Detection Patterns: A Multimodal Framework with Printer Signature Conditioning
by: Atoki, Bolutife, et al.
Published: (2026)
by: Atoki, Bolutife, et al.
Published: (2026)
A Review of Transformer-Based Models for Computer Vision Tasks: Capturing Global Context and Spatial Relationships
by: Pereira, Gracile Astlin, et al.
Published: (2024)
by: Pereira, Gracile Astlin, et al.
Published: (2024)
GEOBench-VLM: Benchmarking Vision-Language Models for Geospatial Tasks
by: Danish, Muhammad Sohail, et al.
Published: (2024)
by: Danish, Muhammad Sohail, et al.
Published: (2024)
OmniEarth: A Benchmark for Evaluating Vision-Language Models in Geospatial Tasks
by: Fu, Ronghao, et al.
Published: (2026)
by: Fu, Ronghao, et al.
Published: (2026)
Benchmarking and Improving Large Vision-Language Models for Fundamental Visual Graph Understanding and Reasoning
by: Zhu, Yingjie, et al.
Published: (2024)
by: Zhu, Yingjie, et al.
Published: (2024)
HUGE-Bench: A Benchmark for High-Level UAV Vision-Language-Action Tasks
by: Guo, Jingyu, et al.
Published: (2026)
by: Guo, Jingyu, et al.
Published: (2026)
Capturing the Unseen: Vision-Free Facial Motion Capture Using Inertial Measurement Units
by: Wang, Youjia, et al.
Published: (2024)
by: Wang, Youjia, et al.
Published: (2024)
Motion Capture from Inertial and Vision Sensors
by: Chen, Xiaodong, et al.
Published: (2024)
by: Chen, Xiaodong, et al.
Published: (2024)
Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: A Comprehensive Evaluation
by: Yu, Hong-Tao, et al.
Published: (2025)
by: Yu, Hong-Tao, et al.
Published: (2025)
CartoMapQA: A Fundamental Benchmark Dataset Evaluating Vision-Language Models on Cartographic Map Understanding
by: Ung, Huy Quang, et al.
Published: (2025)
by: Ung, Huy Quang, et al.
Published: (2025)
Vision-Language Models for Vision Tasks: A Survey
by: Zhang, Jingyi, et al.
Published: (2023)
by: Zhang, Jingyi, et al.
Published: (2023)
DIJIT: A Robotic Head for an Active Observer
by: Tabrizi, Mostafa Kamali, et al.
Published: (2025)
by: Tabrizi, Mostafa Kamali, et al.
Published: (2025)
Benchmark Evaluation of Image Fusion algorithms for Smartphone Camera Capture
by: Kirsten, Lucas N.
Published: (2024)
by: Kirsten, Lucas N.
Published: (2024)
SleepWalk: A Three-Tier Benchmark for Stress-Testing Instruction-Guided Vision-Language Navigation
by: Rawal, Niyati, et al.
Published: (2026)
by: Rawal, Niyati, et al.
Published: (2026)
DarkVRAI: Capture-Condition Conditioning and Burst-Order Selective Scan for Low-light RAW Video Denoising
by: Oh, Youngjin, et al.
Published: (2025)
by: Oh, Youngjin, et al.
Published: (2025)
RVTBench: A Benchmark for Visual Reasoning Tasks
by: Shen, Yiqing, et al.
Published: (2025)
by: Shen, Yiqing, et al.
Published: (2025)
Beyond Blanket Masking: Examining Granularity for Privacy Protection in Images Captured by Blind and Low Vision Users
by: Murrugarra-LLerena, Jeffri, et al.
Published: (2025)
by: Murrugarra-LLerena, Jeffri, et al.
Published: (2025)
Conditional Representation Learning for Customized Tasks
by: Liu, Honglin, et al.
Published: (2025)
by: Liu, Honglin, et al.
Published: (2025)
Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks
by: Chengyu, Jia, et al.
Published: (2026)
by: Chengyu, Jia, et al.
Published: (2026)
EagleVision: A Multi-Task Benchmark for Cross-Domain Perception in High-Speed Autonomous Racing
by: Yagudin, Zakhar, et al.
Published: (2026)
by: Yagudin, Zakhar, et al.
Published: (2026)
Seeing Beyond Redundancy: Task Complexity's Role in Vision Token Specialization in VLLMs
by: Hannan, Darryl, et al.
Published: (2026)
by: Hannan, Darryl, et al.
Published: (2026)
Controlling Vision-Language Models for Multi-Task Image Restoration
by: Luo, Ziwei, et al.
Published: (2023)
by: Luo, Ziwei, et al.
Published: (2023)
VisionLLaMA: A Unified LLaMA Backbone for Vision Tasks
by: Chu, Xiangxiang, et al.
Published: (2024)
by: Chu, Xiangxiang, et al.
Published: (2024)
Cross-Task Benchmarking of CNN Architectures
by: Sherawat, Kamal, et al.
Published: (2026)
by: Sherawat, Kamal, et al.
Published: (2026)
Rotation Equivariant Mamba for Vision Tasks
by: Zhao, Zhongchen, et al.
Published: (2026)
by: Zhao, Zhongchen, et al.
Published: (2026)
Learning What Helps: Task-Aligned Context Selection for Vision Tasks
by: Guo, Jingyu, et al.
Published: (2025)
by: Guo, Jingyu, et al.
Published: (2025)
Vision-based 3D Semantic Scene Completion via Capture Dynamic Representations
by: Wang, Meng, et al.
Published: (2025)
by: Wang, Meng, et al.
Published: (2025)
QuaMo: Quaternion Motions for Vision-based 3D Human Kinematics Capture
by: Le, Cuong, et al.
Published: (2026)
by: Le, Cuong, et al.
Published: (2026)
Benchmarking Vision, Language, & Action Models on Robotic Learning Tasks
by: Guruprasad, Pranav, et al.
Published: (2024)
by: Guruprasad, Pranav, et al.
Published: (2024)
VL-GLUE: A Suite of Fundamental yet Challenging Visuo-Linguistic Reasoning Tasks
by: Sampat, Shailaja Keyur, et al.
Published: (2024)
by: Sampat, Shailaja Keyur, et al.
Published: (2024)
RGB-to-Polarization Estimation: A New Task and Benchmark Study
by: Lin, Beibei, et al.
Published: (2025)
by: Lin, Beibei, et al.
Published: (2025)
A Comparative Study of Vision Transformers and CNNs for Few-Shot Rigid Transformation and Fundamental Matrix Estimation
by: Kaya, Alon, et al.
Published: (2025)
by: Kaya, Alon, et al.
Published: (2025)
Benchmarking Monocular 3D Dog Pose Estimation Using In-The-Wild Motion Capture Data
by: Shooter, Moira, et al.
Published: (2024)
by: Shooter, Moira, et al.
Published: (2024)
Similar Items
-
Understanding and Modeling the Effects of Task and Context on Drivers' Gaze Allocation
by: Kotseruba, Iuliia, et al.
Published: (2023) -
SCOUT+: Towards Practical Task-Driven Drivers' Gaze Prediction
by: Kotseruba, Iuliia, et al.
Published: (2024) -
Data Limitations for Modeling Top-Down Effects on Drivers' Attention
by: Kotseruba, Iuliia, et al.
Published: (2024) -
Do Saliency Models Detect Odd-One-Out Targets? New Datasets and Evaluations
by: Kotseruba, Iuliia, et al.
Published: (2020) -
Diving Deeper Into Pedestrian Behavior Understanding: Intention Estimation, Action Prediction, and Event Risk Assessment
by: Rasouli, Amir, et al.
Published: (2024)