Benchmarking In-the-wild Multimodal Disease Recognition and A Versatile Baseline
Fuente:
arXiv
Saved in:
| Main Authors: | Wei, Tianqi, Chen, Zhi, Huang, Zi, Yu, Xin |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
PlantSeg: A Large-Scale In-the-wild Dataset for Plant Disease Segmentation
by: Wei, Tianqi, et al.
Published: (2024)
by: Wei, Tianqi, et al.
Published: (2024)
Augment to Segment: Tackling Pixel-Level Imbalance in Wheat Disease and Pest Segmentation
by: Wei, Tianqi, et al.
Published: (2025)
by: Wei, Tianqi, et al.
Published: (2025)
Snap and Diagnose: An Advanced Multimodal Retrieval System for Identifying Plant Diseases in the Wild
by: Wei, Tianqi, et al.
Published: (2024)
by: Wei, Tianqi, et al.
Published: (2024)
Distributed Zero-Shot Learning for Visual Recognition
by: Chen, Zhi, et al.
Published: (2025)
by: Chen, Zhi, et al.
Published: (2025)
Gait Recognition in the Wild: A Large-scale Benchmark and NAS-based Baseline
by: Guo, Xianda, et al.
Published: (2022)
by: Guo, Xianda, et al.
Published: (2022)
See, Remember, Explore: A Benchmark and Baselines for Streaming Spatial Reasoning
by: Wei, Yuxi, et al.
Published: (2026)
by: Wei, Yuxi, et al.
Published: (2026)
Track Any Peppers: Weakly Supervised Sweet Pepper Tracking Using VLMs
by: Lim, Jia Syuen, et al.
Published: (2024)
by: Lim, Jia Syuen, et al.
Published: (2024)
CF-PRNet: Coarse-to-Fine Prototype Refining Network for Point Cloud Completion and Reconstruction
by: Chen, Zhi, et al.
Published: (2024)
by: Chen, Zhi, et al.
Published: (2024)
A Simple Aerial Detection Baseline of Multimodal Language Models
by: Li, Qingyun, et al.
Published: (2025)
by: Li, Qingyun, et al.
Published: (2025)
Multiple Object Tracking in Video SAR: A Benchmark and Tracking Baseline
by: Chen, Haoxiang, et al.
Published: (2025)
by: Chen, Haoxiang, et al.
Published: (2025)
EI: Early Intervention for Multimodal Imaging based Disease Recognition
by: Wei, Qijie, et al.
Published: (2026)
by: Wei, Qijie, et al.
Published: (2026)
Event-based Tiny Object Detection: A Benchmark Dataset and Baseline
by: Chen, Nuo, et al.
Published: (2025)
by: Chen, Nuo, et al.
Published: (2025)
WildAvatar: Learning In-the-wild 3D Avatars from the Web
by: Huang, Zihao, et al.
Published: (2024)
by: Huang, Zihao, et al.
Published: (2024)
Versatile Multimodal Controls for Expressive Talking Human Animation
by: Qin, Zheng, et al.
Published: (2025)
by: Qin, Zheng, et al.
Published: (2025)
Cluster-Aware Prompt Ensemble Learning for Few-Shot Vision-Language Model Adaptation
by: Chen, Zhi, et al.
Published: (2025)
by: Chen, Zhi, et al.
Published: (2025)
VBench++: Comprehensive and Versatile Benchmark Suite for Video Generative Models
by: Huang, Ziqi, et al.
Published: (2024)
by: Huang, Ziqi, et al.
Published: (2024)
Towards Multimodal Lifelong Understanding: A Dataset and Agentic Baseline
by: Chen, Guo, et al.
Published: (2026)
by: Chen, Guo, et al.
Published: (2026)
MuGS: Multi-Baseline Generalizable Gaussian Splatting Reconstruction
by: Lou, Yaopeng, et al.
Published: (2025)
by: Lou, Yaopeng, et al.
Published: (2025)
A Versatile Multimodal Agent for Multimedia Content Generation
by: Zhang, Daoan, et al.
Published: (2026)
by: Zhang, Daoan, et al.
Published: (2026)
OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation
by: Wu, Size, et al.
Published: (2025)
by: Wu, Size, et al.
Published: (2025)
A Baseline Study and Benchmark for Few-Shot Open-Set Action Recognition with Feature Residual Discrimination
by: Berti, Stefano, et al.
Published: (2026)
by: Berti, Stefano, et al.
Published: (2026)
Complex Mathematical Expression Recognition: Benchmark, Large-Scale Dataset and Strong Baseline
by: Bai, Weikang, et al.
Published: (2025)
by: Bai, Weikang, et al.
Published: (2025)
MMRareBench: A Rare-Disease Multimodal and Multi-Image Medical Benchmark
by: Ning, Junzhi, et al.
Published: (2026)
by: Ning, Junzhi, et al.
Published: (2026)
Lumen: Unleashing Versatile Vision-Centric Capabilities of Large Multimodal Models
by: Jiao, Yang, et al.
Published: (2024)
by: Jiao, Yang, et al.
Published: (2024)
GIR-Bench: Versatile Benchmark for Generating Images with Reasoning
by: Li, Hongxiang, et al.
Published: (2025)
by: Li, Hongxiang, et al.
Published: (2025)
MedVLThinker: Simple Baselines for Multimodal Medical Reasoning
by: Huang, Xiaoke, et al.
Published: (2025)
by: Huang, Xiaoke, et al.
Published: (2025)
Fusion Meets Diverse Conditions: A High-diversity Benchmark and Baseline for UAV-based Multimodal Object Detection with Condition Cues
by: Chen, Chen, et al.
Published: (2025)
by: Chen, Chen, et al.
Published: (2025)
OPEN: A Benchmark Dataset and Baseline for Older Adult Patient Engagement Recognition in Virtual Rehabilitation Learning Environments
by: Abedi, Ali, et al.
Published: (2025)
by: Abedi, Ali, et al.
Published: (2025)
Spatial4D-Bench: A Versatile 4D Spatial Intelligence Benchmark
by: Wang, Pan, et al.
Published: (2025)
by: Wang, Pan, et al.
Published: (2025)
T2Vs Meet VLMs: A Scalable Multimodal Dataset for Visual Harmfulness Recognition
by: Yeh, Chen, et al.
Published: (2024)
by: Yeh, Chen, et al.
Published: (2024)
Multi-Modal Building Change Detection for Large-Scale Small Changes: Benchmark and Baseline
by: Wang, Ye, et al.
Published: (2026)
by: Wang, Ye, et al.
Published: (2026)
ChatDiT: A Training-Free Baseline for Task-Agnostic Free-Form Chatting with Diffusion Transformers
by: Huang, Lianghua, et al.
Published: (2024)
by: Huang, Lianghua, et al.
Published: (2024)
Building Extraction from Remote Sensing Imagery under Hazy and Low-light Conditions: Benchmark and Baseline
by: Sang, Feifei, et al.
Published: (2026)
by: Sang, Feifei, et al.
Published: (2026)
Benchmarking Badminton Action Recognition with a New Fine-Grained Dataset
by: Li, Qi, et al.
Published: (2024)
by: Li, Qi, et al.
Published: (2024)
Interactive Medical Image Segmentation: A Benchmark Dataset and Baseline
by: Cheng, Junlong, et al.
Published: (2024)
by: Cheng, Junlong, et al.
Published: (2024)
BaseReward: A Strong Baseline for Multimodal Reward Model
by: Zhang, Yi-Fan, et al.
Published: (2025)
by: Zhang, Yi-Fan, et al.
Published: (2025)
RoboSurg-VQA: A Multimodal Benchmark for Surgical Segmentation-Aware Visual Question Answering
by: Zhang, Chengyi, et al.
Published: (2026)
by: Zhang, Chengyi, et al.
Published: (2026)
LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering
by: Zhang, Hongjie, et al.
Published: (2023)
by: Zhang, Hongjie, et al.
Published: (2023)
Towards Automatic Power Battery Detection: New Challenge, Benchmark Dataset and Baseline
by: Zhao, Xiaoqi, et al.
Published: (2023)
by: Zhao, Xiaoqi, et al.
Published: (2023)
OpenStereo: A Comprehensive Benchmark for Stereo Matching and Strong Baseline
by: Guo, Xianda, et al.
Published: (2023)
by: Guo, Xianda, et al.
Published: (2023)
Similar Items
-
PlantSeg: A Large-Scale In-the-wild Dataset for Plant Disease Segmentation
by: Wei, Tianqi, et al.
Published: (2024) -
Augment to Segment: Tackling Pixel-Level Imbalance in Wheat Disease and Pest Segmentation
by: Wei, Tianqi, et al.
Published: (2025) -
Snap and Diagnose: An Advanced Multimodal Retrieval System for Identifying Plant Diseases in the Wild
by: Wei, Tianqi, et al.
Published: (2024) -
Distributed Zero-Shot Learning for Visual Recognition
by: Chen, Zhi, et al.
Published: (2025) -
Gait Recognition in the Wild: A Large-scale Benchmark and NAS-based Baseline
by: Guo, Xianda, et al.
Published: (2022)