Enregistré dans:
| Auteurs principaux: | Hamilton, Brayden, Cashmore, Tim, Driscoll, Peter, Gee, Trevor, Williams, Henry |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2601.20196 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Automated Building Heritage Assessment Using Street-Level Imagery
par: Dabrock, Kristina, et autres
Publié: (2025)
par: Dabrock, Kristina, et autres
Publié: (2025)
Automated Assessment of Residual Plots with Computer Vision Models
par: Li, Weihao, et autres
Publié: (2024)
par: Li, Weihao, et autres
Publié: (2024)
Benchmarking PhD-Level Coding in 3D Geometric Computer Vision
par: Li, Wenyi, et autres
Publié: (2026)
par: Li, Wenyi, et autres
Publié: (2026)
Vision Function Layer in Multimodal LLMs
par: Shi, Cheng, et autres
Publié: (2025)
par: Shi, Cheng, et autres
Publié: (2025)
Pallet Detection And Localisation From Synthetic Data
par: Mueller, Henri, et autres
Publié: (2025)
par: Mueller, Henri, et autres
Publié: (2025)
Benchmarking the Trustworthiness in Multimodal LLMs for Video Understanding
par: Wang, Youze, et autres
Publié: (2025)
par: Wang, Youze, et autres
Publié: (2025)
Multimodal LLMs Struggle with Basic Visual Network Analysis: a VNA Benchmark
par: Williams, Evan M., et autres
Publié: (2024)
par: Williams, Evan M., et autres
Publié: (2024)
LogicGaze: Benchmarking Causal Consistency in Visual Narratives via Counterfactual Verification
par: Driscoll, Rory, et autres
Publié: (2026)
par: Driscoll, Rory, et autres
Publié: (2026)
Leveraging Vision Capabilities of Multimodal LLMs for Automated Data Extraction from Plots
par: Polak, Maciej P., et autres
Publié: (2025)
par: Polak, Maciej P., et autres
Publié: (2025)
Skipping Computations in Multimodal LLMs
par: Shukor, Mustafa, et autres
Publié: (2024)
par: Shukor, Mustafa, et autres
Publié: (2024)
VidHal: Benchmarking Temporal Hallucinations in Vision LLMs
par: Choong, Wey Yeh, et autres
Publié: (2024)
par: Choong, Wey Yeh, et autres
Publié: (2024)
Exploring Automated Recognition of Instructional Activity and Discourse from Multimodal Classroom Data
par: Bueno, Ivo, et autres
Publié: (2025)
par: Bueno, Ivo, et autres
Publié: (2025)
A Computer Vision Pipeline for Individual-Level Behavior Analysis: Benchmarking on the Edinburgh Pig Dataset
par: Yang, Haiyu, et autres
Publié: (2025)
par: Yang, Haiyu, et autres
Publié: (2025)
HERM: Benchmarking and Enhancing Multimodal LLMs for Human-Centric Understanding
par: Li, Keliang, et autres
Publié: (2024)
par: Li, Keliang, et autres
Publié: (2024)
SpineBench: Benchmarking Multimodal LLMs for Spinal Pathology Analysis
par: Zhang, Chenghanyu, et autres
Publié: (2025)
par: Zhang, Chenghanyu, et autres
Publié: (2025)
Advancing from Automated to Autonomous Beamline by Leveraging Computer Vision
par: Li, Baolu, et autres
Publié: (2025)
par: Li, Baolu, et autres
Publié: (2025)
Vision-Language Foundation Models for Comprehensive Automated Pavement Condition Assessment
par: Kyem, Blessing Agyei, et autres
Publié: (2026)
par: Kyem, Blessing Agyei, et autres
Publié: (2026)
Visual Haystacks: A Vision-Centric Needle-In-A-Haystack Benchmark
par: Wu, Tsung-Han, et autres
Publié: (2024)
par: Wu, Tsung-Han, et autres
Publié: (2024)
Multimodal AI for Body Fat Estimation: Computer Vision and Anthropometry with DEXA Benchmarks
par: Aldajani, Rayan
Publié: (2025)
par: Aldajani, Rayan
Publié: (2025)
CCTVBench: Contrastive Consistency Traffic VideoQA Benchmark for Multimodal LLMs
par: Zhou, Xingcheng, et autres
Publié: (2026)
par: Zhou, Xingcheng, et autres
Publié: (2026)
Hyperphantasia: A Benchmark for Evaluating the Mental Visualization Capabilities of Multimodal LLMs
par: Sepehri, Mohammad Shahab, et autres
Publié: (2025)
par: Sepehri, Mohammad Shahab, et autres
Publié: (2025)
Recent Advances of Continual Learning in Computer Vision: An Overview
par: Qu, Haoxuan, et autres
Publié: (2021)
par: Qu, Haoxuan, et autres
Publié: (2021)
Computer Vision based Automated Quantification of Agricultural Sprayers Boom Displacement
par: Dalal, Aryan Singh, et autres
Publié: (2025)
par: Dalal, Aryan Singh, et autres
Publié: (2025)
FireANTs: Adaptive Riemannian Optimization for Multi-Scale Diffeomorphic Matching
par: Jena, Rohit, et autres
Publié: (2024)
par: Jena, Rohit, et autres
Publié: (2024)
Scaling Vision Pre-Training to 4K Resolution
par: Shi, Baifeng, et autres
Publié: (2025)
par: Shi, Baifeng, et autres
Publié: (2025)
Dissecting Bit-Level Scaling Laws in Quantizing Vision Generative Models
par: Ding, Xin, et autres
Publié: (2025)
par: Ding, Xin, et autres
Publié: (2025)
Robust Computer-Vision based Construction Site Detection for Assistive-Technology Applications
par: Feng, Junchi, et autres
Publié: (2025)
par: Feng, Junchi, et autres
Publié: (2025)
From Where Things Are to What They Are For: Benchmarking Spatial-Functional Intelligence in Multimodal LLMs
par: Zhang, Le, et autres
Publié: (2026)
par: Zhang, Le, et autres
Publié: (2026)
DisasterInsight: A Multimodal Benchmark for Function-Aware and Grounded Disaster Assessment
par: Tehrani, Sara, et autres
Publié: (2026)
par: Tehrani, Sara, et autres
Publié: (2026)
MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding
par: Li, Renjie, et autres
Publié: (2025)
par: Li, Renjie, et autres
Publié: (2025)
Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs
par: Tong, Shengbang, et autres
Publié: (2024)
par: Tong, Shengbang, et autres
Publié: (2024)
Designing High-Performing Networks for Multi-Scale Computer Vision
par: Picron, Cédric
Publié: (2024)
par: Picron, Cédric
Publié: (2024)
Visual-Word Tokenizer: Beyond Fixed Sets of Tokens in Vision Transformers
par: Gee, Leonidas, et autres
Publié: (2024)
par: Gee, Leonidas, et autres
Publié: (2024)
Beyond the Mud: Datasets and Benchmarks for Computer Vision in Off-Road Racing
par: Tyo, Jacob, et autres
Publié: (2024)
par: Tyo, Jacob, et autres
Publié: (2024)
Weather-Robust Scene Semantics with Vision-Aligned 4D Radar
par: Hamilton, Kali, et autres
Publié: (2026)
par: Hamilton, Kali, et autres
Publié: (2026)
Foul prediction with estimated poses from soccer broadcast video
par: Fang, Jiale, et autres
Publié: (2024)
par: Fang, Jiale, et autres
Publié: (2024)
PathMMU: A Massive Multimodal Expert-Level Benchmark for Understanding and Reasoning in Pathology
par: Sun, Yuxuan, et autres
Publié: (2024)
par: Sun, Yuxuan, et autres
Publié: (2024)
SALMUBench: A Benchmark for Sensitive Association-Level Multimodal Unlearning
par: Selvas-Sala, Cai, et autres
Publié: (2026)
par: Selvas-Sala, Cai, et autres
Publié: (2026)
HUGE-Bench: A Benchmark for High-Level UAV Vision-Language-Action Tasks
par: Guo, Jingyu, et autres
Publié: (2026)
par: Guo, Jingyu, et autres
Publié: (2026)
Enhancing Computer Vision Model Generalization in Warehouse Facilities: A Case Study on Anomaly Detection in Vertical Material Handling Systems
par: Liu, Ruiliang, et autres
Publié: (2026)
par: Liu, Ruiliang, et autres
Publié: (2026)
Documents similaires
-
Automated Building Heritage Assessment Using Street-Level Imagery
par: Dabrock, Kristina, et autres
Publié: (2025) -
Automated Assessment of Residual Plots with Computer Vision Models
par: Li, Weihao, et autres
Publié: (2024) -
Benchmarking PhD-Level Coding in 3D Geometric Computer Vision
par: Li, Wenyi, et autres
Publié: (2026) -
Vision Function Layer in Multimodal LLMs
par: Shi, Cheng, et autres
Publié: (2025) -
Pallet Detection And Localisation From Synthetic Data
par: Mueller, Henri, et autres
Publié: (2025)