Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Qingmei, Zhang, Yang, Mai, Zurong, Chen, Yuhang, Lou, Shuohong, Huang, Henglian, Zhang, Jiarui, Zhang, Zhiwei, Wen, Yibin, Li, Weijia, Fu, Haohuan, Huang, Jianxi, Zheng, Juepeng |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
AgroNVILA: Perception-Reasoning Decoupling for Multi-view Agricultural Multimodal Large Language Models
by: Zhang, Jiarui, et al.
Published: (2026)
by: Zhang, Jiarui, et al.
Published: (2026)
AgroCoT: A Chain-of-Thought Benchmark for Evaluating Reasoning in Vision-Language Models for Agriculture
by: Wen, Yibin, et al.
Published: (2025)
by: Wen, Yibin, et al.
Published: (2025)
AgroTools: A Benchmark for Tool-Augmented Multimodal Agents in Agriculture
by: Ye, Zi, et al.
Published: (2026)
by: Ye, Zi, et al.
Published: (2026)
A Comprehensive Review of Agricultural Parcel and Boundary Delineation from Remote Sensing Images: Recent Progress and Future Perspectives
by: Zheng, Juepeng, et al.
Published: (2025)
by: Zheng, Juepeng, et al.
Published: (2025)
AgroVG: A Large-Scale Multi-Source Benchmark for Agricultural Visual Grounding
by: Li, Haocheng, et al.
Published: (2026)
by: Li, Haocheng, et al.
Published: (2026)
GTPBD: A Fine-Grained Global Terraced Parcel and Boundary Dataset
by: Zhang, Zhiwei, et al.
Published: (2025)
by: Zhang, Zhiwei, et al.
Published: (2025)
GALA: A GlobAl-LocAl Approach for Multi-Source Active Domain Adaptation
by: Zheng, Juepeng, et al.
Published: (2025)
by: Zheng, Juepeng, et al.
Published: (2025)
HM-Bench: A Comprehensive Benchmark for Multimodal Large Language Models in Hyperspectral Remote Sensing
by: Zhang, Xinyu, et al.
Published: (2026)
by: Zhang, Xinyu, et al.
Published: (2026)
SAGE: Style-Adaptive Generalization for Privacy-Constrained Semantic Segmentation Across Domains
by: Li, Qingmei, et al.
Published: (2025)
by: Li, Qingmei, et al.
Published: (2025)
Low Saturation Confidence Distribution-based Test-Time Adaptation for Cross-Domain Remote Sensing Image Classification
by: Liang, Yu, et al.
Published: (2024)
by: Liang, Yu, et al.
Published: (2024)
Parameter-Efficient Modality-Balanced Symmetric Fusion for Multimodal Remote Sensing Semantic Segmentation
by: Li, Haocheng, et al.
Published: (2026)
by: Li, Haocheng, et al.
Published: (2026)
Evidential Graph Contrastive Alignment for Source-Free Blending-Target Domain Adaptation
by: Zheng, Juepeng, et al.
Published: (2024)
by: Zheng, Juepeng, et al.
Published: (2024)
GTPBD-MM: A Global Terraced Parcel and Boundary Dataset with Multi-Modality
by: Zhang, Zhiwei, et al.
Published: (2026)
by: Zhang, Zhiwei, et al.
Published: (2026)
From Noisy Historical Maps to Time-Series Oil Palm Mapping Without Annotation in Malaysia and Indonesia (2020-2024)
by: Kuapanich, Nuttaset, et al.
Published: (2026)
by: Kuapanich, Nuttaset, et al.
Published: (2026)
Building Bridges across Spatial and Temporal Resolutions: Reference-Based Super-Resolution via Change Priors and Conditional Diffusion Model
by: Dong, Runmin, et al.
Published: (2024)
by: Dong, Runmin, et al.
Published: (2024)
Unified Reward Model for Multimodal Understanding and Generation
by: Wang, Yibin, et al.
Published: (2025)
by: Wang, Yibin, et al.
Published: (2025)
Exploring Test-Time Adaptation for Object Detection in Continually Changing Environments
by: Cao, Shilei, et al.
Published: (2024)
by: Cao, Shilei, et al.
Published: (2024)
FUSU: A Multi-temporal-source Land Use Change Segmentation Dataset for Fine-grained Urban Semantic Understanding
by: Yuan, Shuai, et al.
Published: (2024)
by: Yuan, Shuai, et al.
Published: (2024)
AgriGPT-VL: Agricultural Vision-Language Understanding Suite
by: Yang, Bo, et al.
Published: (2025)
by: Yang, Bo, et al.
Published: (2025)
DeepLight: Reconstructing High-Resolution Observations of Nighttime Light With Multi-Modal Remote Sensing Data
by: Zhang, Lixian, et al.
Published: (2024)
by: Zhang, Lixian, et al.
Published: (2024)
A$^{2}$-MAE: A spatial-temporal-spectral unified remote sensing pre-training method based on anchor-aware masked autoencoder
by: Zhang, Lixian, et al.
Published: (2024)
by: Zhang, Lixian, et al.
Published: (2024)
AIM: Asymmetric Information Masking for Visual Question Answering Continual Learning
by: Zhang, Peifeng, et al.
Published: (2026)
by: Zhang, Peifeng, et al.
Published: (2026)
UrbanFeel: A Comprehensive Benchmark for Temporal and Perceptual Understanding of City Scenes through Human Perspective
by: He, Jun, et al.
Published: (2025)
by: He, Jun, et al.
Published: (2025)
DC-Scene: Data-Centric Learning for 3D Scene Understanding
by: Huang, Ting, et al.
Published: (2025)
by: Huang, Ting, et al.
Published: (2025)
Mind-Brush: Integrating Agentic Cognitive Search and Reasoning into Image Generation
by: He, Jun, et al.
Published: (2026)
by: He, Jun, et al.
Published: (2026)
Dense Multimodal Alignment for Open-Vocabulary 3D Scene Understanding
by: Li, Ruihuang, et al.
Published: (2024)
by: Li, Ruihuang, et al.
Published: (2024)
RieMind: Geometry-Grounded Spatial Agent for Scene Understanding
by: Ropero, Fernando, et al.
Published: (2026)
by: Ropero, Fernando, et al.
Published: (2026)
OmniAID: Decoupling Semantic and Artifacts for Universal AI-Generated Image Detection in the Wild
by: Guo, Yuncheng, et al.
Published: (2025)
by: Guo, Yuncheng, et al.
Published: (2025)
Mixture-of-Minds: Multi-Agent Reinforcement Learning for Table Understanding
by: Zhou, Yuhang, et al.
Published: (2025)
by: Zhou, Yuhang, et al.
Published: (2025)
Can MLLMs Read Students' Minds? Unpacking Multimodal Error Analysis in Handwritten Math
by: Song, Dingjie, et al.
Published: (2026)
by: Song, Dingjie, et al.
Published: (2026)
Beyond Graph Convolution: Multimodal Recommendation with Topology-aware MLPs
by: Huang, Junjie, et al.
Published: (2024)
by: Huang, Junjie, et al.
Published: (2024)
SceneAlign: Aligning Multimodal Reasoning to Scene Graphs in Complex Visual Scenes
by: Wang, Chuhan, et al.
Published: (2026)
by: Wang, Chuhan, et al.
Published: (2026)
Impaired Aortic Biomechanical Properties in Patients With Severe Obstructive Sleep Apnea Syndrome
by: Li Yu, et al.
Published: (2025)
by: Li Yu, et al.
Published: (2025)
AgroBench: Vision-Language Model Benchmark in Agriculture
by: Shinoda, Risa, et al.
Published: (2025)
by: Shinoda, Risa, et al.
Published: (2025)
DGSG-Mind: Dynamic 3D Gaussian Scene Graphs for Long-Term Scene Understanding and Grounding
by: Ge, Luzhou, et al.
Published: (2026)
by: Ge, Luzhou, et al.
Published: (2026)
Generating Multimodal Driving Scenes via Next-Scene Prediction
by: Wu, Yanhao, et al.
Published: (2025)
by: Wu, Yanhao, et al.
Published: (2025)
AgroFlux: A Spatial-Temporal Benchmark for Carbon and Nitrogen Flux Prediction in Agricultural Ecosystems
by: Cheng, Qi, et al.
Published: (2026)
by: Cheng, Qi, et al.
Published: (2026)
Intersectional Impact of Allosexism Experiences on Non‐Suicidal Self‐Injury Among Asexual Youth
by: Zurong Liang, et al.
Published: (2025)
by: Zurong Liang, et al.
Published: (2025)
Longitudinal associations between internalized homophobia trajectories and psychological distress among sexual minority adults: A growth mixture model
by: Jingtao Yu, et al.
Published: (2026)
by: Jingtao Yu, et al.
Published: (2026)
DreamText: High Fidelity Scene Text Synthesis
by: Wang, Yibin, et al.
Published: (2024)
by: Wang, Yibin, et al.
Published: (2024)
Similar Items
-
AgroNVILA: Perception-Reasoning Decoupling for Multi-view Agricultural Multimodal Large Language Models
by: Zhang, Jiarui, et al.
Published: (2026) -
AgroCoT: A Chain-of-Thought Benchmark for Evaluating Reasoning in Vision-Language Models for Agriculture
by: Wen, Yibin, et al.
Published: (2025) -
AgroTools: A Benchmark for Tool-Augmented Multimodal Agents in Agriculture
by: Ye, Zi, et al.
Published: (2026) -
A Comprehensive Review of Agricultural Parcel and Boundary Delineation from Remote Sensing Images: Recent Progress and Future Perspectives
by: Zheng, Juepeng, et al.
Published: (2025) -
AgroVG: A Large-Scale Multi-Source Benchmark for Agricultural Visual Grounding
by: Li, Haocheng, et al.
Published: (2026)