AgroNVILA: Perception-Reasoning Decoupling for Multi-view Agricultural Multimodal Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Jiarui, Hu, Junqi, Mai, Zurong, Chen, Yuhang, Lou, Shuohong, Huang, Henglian, Zhao, Lingyuan, Huang, Jianxi, Lu, Yutong, Fu, Haohuan, Zheng, Juepeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind
di: Li, Qingmei, et al.
Pubblicazione: (2025)
di: Li, Qingmei, et al.
Pubblicazione: (2025)
AgroCoT: A Chain-of-Thought Benchmark for Evaluating Reasoning in Vision-Language Models for Agriculture
di: Wen, Yibin, et al.
Pubblicazione: (2025)
di: Wen, Yibin, et al.
Pubblicazione: (2025)
AgroTools: A Benchmark for Tool-Augmented Multimodal Agents in Agriculture
di: Ye, Zi, et al.
Pubblicazione: (2026)
di: Ye, Zi, et al.
Pubblicazione: (2026)
AgroVG: A Large-Scale Multi-Source Benchmark for Agricultural Visual Grounding
di: Li, Haocheng, et al.
Pubblicazione: (2026)
di: Li, Haocheng, et al.
Pubblicazione: (2026)
HM-Bench: A Comprehensive Benchmark for Multimodal Large Language Models in Hyperspectral Remote Sensing
di: Zhang, Xinyu, et al.
Pubblicazione: (2026)
di: Zhang, Xinyu, et al.
Pubblicazione: (2026)
A Comprehensive Review of Agricultural Parcel and Boundary Delineation from Remote Sensing Images: Recent Progress and Future Perspectives
di: Zheng, Juepeng, et al.
Pubblicazione: (2025)
di: Zheng, Juepeng, et al.
Pubblicazione: (2025)
Parameter-Efficient Modality-Balanced Symmetric Fusion for Multimodal Remote Sensing Semantic Segmentation
di: Li, Haocheng, et al.
Pubblicazione: (2026)
di: Li, Haocheng, et al.
Pubblicazione: (2026)
Low Saturation Confidence Distribution-based Test-Time Adaptation for Cross-Domain Remote Sensing Image Classification
di: Liang, Yu, et al.
Pubblicazione: (2024)
di: Liang, Yu, et al.
Pubblicazione: (2024)
GTPBD: A Fine-Grained Global Terraced Parcel and Boundary Dataset
di: Zhang, Zhiwei, et al.
Pubblicazione: (2025)
di: Zhang, Zhiwei, et al.
Pubblicazione: (2025)
GTPBD-MM: A Global Terraced Parcel and Boundary Dataset with Multi-Modality
di: Zhang, Zhiwei, et al.
Pubblicazione: (2026)
di: Zhang, Zhiwei, et al.
Pubblicazione: (2026)
NVILA: Efficient Frontier Visual Language Models
di: Liu, Zhijian, et al.
Pubblicazione: (2024)
di: Liu, Zhijian, et al.
Pubblicazione: (2024)
AIM: Asymmetric Information Masking for Visual Question Answering Continual Learning
di: Zhang, Peifeng, et al.
Pubblicazione: (2026)
di: Zhang, Peifeng, et al.
Pubblicazione: (2026)
SAGE: Style-Adaptive Generalization for Privacy-Constrained Semantic Segmentation Across Domains
di: Li, Qingmei, et al.
Pubblicazione: (2025)
di: Li, Qingmei, et al.
Pubblicazione: (2025)
Evidential Graph Contrastive Alignment for Source-Free Blending-Target Domain Adaptation
di: Zheng, Juepeng, et al.
Pubblicazione: (2024)
di: Zheng, Juepeng, et al.
Pubblicazione: (2024)
GALA: A GlobAl-LocAl Approach for Multi-Source Active Domain Adaptation
di: Zheng, Juepeng, et al.
Pubblicazione: (2025)
di: Zheng, Juepeng, et al.
Pubblicazione: (2025)
DeepLight: Reconstructing High-Resolution Observations of Nighttime Light With Multi-Modal Remote Sensing Data
di: Zhang, Lixian, et al.
Pubblicazione: (2024)
di: Zhang, Lixian, et al.
Pubblicazione: (2024)
AgriBench: A Hierarchical Agriculture Benchmark for Multimodal Large Language Models
di: Zhou, Yutong, et al.
Pubblicazione: (2024)
di: Zhou, Yutong, et al.
Pubblicazione: (2024)
From Noisy Historical Maps to Time-Series Oil Palm Mapping Without Annotation in Malaysia and Indonesia (2020-2024)
di: Kuapanich, Nuttaset, et al.
Pubblicazione: (2026)
di: Kuapanich, Nuttaset, et al.
Pubblicazione: (2026)
Decoupling the Image Perception and Multimodal Reasoning for Reasoning Segmentation with Digital Twin Representations
di: Li, Yizhen, et al.
Pubblicazione: (2025)
di: Li, Yizhen, et al.
Pubblicazione: (2025)
Exploring Test-Time Adaptation for Object Detection in Continually Changing Environments
di: Cao, Shilei, et al.
Pubblicazione: (2024)
di: Cao, Shilei, et al.
Pubblicazione: (2024)
Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided Reasoning
di: Hua, Jiacheng, et al.
Pubblicazione: (2026)
di: Hua, Jiacheng, et al.
Pubblicazione: (2026)
Awakening LLMs' Reasoning Potential: A Fine-Grained Pipeline to Evaluate and Mitigate Vague Perception
di: Ling, Zipeng, et al.
Pubblicazione: (2025)
di: Ling, Zipeng, et al.
Pubblicazione: (2025)
AgroBench: Vision-Language Model Benchmark in Agriculture
di: Shinoda, Risa, et al.
Pubblicazione: (2025)
di: Shinoda, Risa, et al.
Pubblicazione: (2025)
Intersectional Impact of Allosexism Experiences on Non‐Suicidal Self‐Injury Among Asexual Youth
di: Zurong Liang, et al.
Pubblicazione: (2025)
di: Zurong Liang, et al.
Pubblicazione: (2025)
Longitudinal associations between internalized homophobia trajectories and psychological distress among sexual minority adults: A growth mixture model
di: Jingtao Yu, et al.
Pubblicazione: (2026)
di: Jingtao Yu, et al.
Pubblicazione: (2026)
Large photo-induced tuning of ferroelectricity in sliding ferroelectrics
di: Gao, Lingyuan, et al.
Pubblicazione: (2024)
di: Gao, Lingyuan, et al.
Pubblicazione: (2024)
Building Bridges across Spatial and Temporal Resolutions: Reference-Based Super-Resolution via Change Priors and Conditional Diffusion Model
di: Dong, Runmin, et al.
Pubblicazione: (2024)
di: Dong, Runmin, et al.
Pubblicazione: (2024)
FUSU: A Multi-temporal-source Land Use Change Segmentation Dataset for Fine-grained Urban Semantic Understanding
di: Yuan, Shuai, et al.
Pubblicazione: (2024)
di: Yuan, Shuai, et al.
Pubblicazione: (2024)
Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models
di: Li, Yunxin, et al.
Pubblicazione: (2025)
di: Li, Yunxin, et al.
Pubblicazione: (2025)
Think in Safety: Unveiling and Mitigating Safety Alignment Collapse in Multimodal Large Reasoning Model
di: Lou, Xinyue, et al.
Pubblicazione: (2025)
di: Lou, Xinyue, et al.
Pubblicazione: (2025)
RAIN-Merging: A Gradient-Free Method to Enhance Instruction Following in Large Reasoning Models with Preserved Thinking Format
di: Huang, Zhehao, et al.
Pubblicazione: (2026)
di: Huang, Zhehao, et al.
Pubblicazione: (2026)
Less is More: Selective Reflection for Compatible and Efficient Knowledge Distillation in Large Language Models
di: Liu, Lingyuan, et al.
Pubblicazione: (2025)
di: Liu, Lingyuan, et al.
Pubblicazione: (2025)
OmniAID: Decoupling Semantic and Artifacts for Universal AI-Generated Image Detection in the Wild
di: Guo, Yuncheng, et al.
Pubblicazione: (2025)
di: Guo, Yuncheng, et al.
Pubblicazione: (2025)
Reasoning-Aligned Perception Decoupling for Scalable Multi-modal Reasoning
di: Gou, Yunhao, et al.
Pubblicazione: (2025)
di: Gou, Yunhao, et al.
Pubblicazione: (2025)
SR-CIS: Self-Reflective Incremental System with Decoupled Memory and Reasoning
di: Qi, Biqing, et al.
Pubblicazione: (2024)
di: Qi, Biqing, et al.
Pubblicazione: (2024)
PixelLM: Pixel Reasoning with Large Multimodal Model
di: Ren, Zhongwei, et al.
Pubblicazione: (2023)
di: Ren, Zhongwei, et al.
Pubblicazione: (2023)
Being Strong Progressively! Enhancing Knowledge Distillation of Large Language Models through a Curriculum Learning Framework
di: Liu, Lingyuan, et al.
Pubblicazione: (2025)
di: Liu, Lingyuan, et al.
Pubblicazione: (2025)
Categorical structure in coherent theory of arithmetic
di: Ye, Lingyuan
Pubblicazione: (2023)
di: Ye, Lingyuan
Pubblicazione: (2023)
Coexact completion of profinite Heyting algebras and uniform interpolation
di: Ye, Lingyuan
Pubblicazione: (2026)
di: Ye, Lingyuan
Pubblicazione: (2026)
Stack Representation of Finitely Presented Heyting Pretoposes I
di: Ye, Lingyuan
Pubblicazione: (2024)
di: Ye, Lingyuan
Pubblicazione: (2024)
Documenti analoghi
-
Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind
di: Li, Qingmei, et al.
Pubblicazione: (2025) -
AgroCoT: A Chain-of-Thought Benchmark for Evaluating Reasoning in Vision-Language Models for Agriculture
di: Wen, Yibin, et al.
Pubblicazione: (2025) -
AgroTools: A Benchmark for Tool-Augmented Multimodal Agents in Agriculture
di: Ye, Zi, et al.
Pubblicazione: (2026) -
AgroVG: A Large-Scale Multi-Source Benchmark for Agricultural Visual Grounding
di: Li, Haocheng, et al.
Pubblicazione: (2026) -
HM-Bench: A Comprehensive Benchmark for Multimodal Large Language Models in Hyperspectral Remote Sensing
di: Zhang, Xinyu, et al.
Pubblicazione: (2026)