AgriChat: A Multimodal Large Language Model for Agriculture Image Understanding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Boudiaf, Abderrahmene, Hussain, Irfan, Javed, Sajid |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SegRAG: Training-Free Retrieval-Augmented Semantic Segmentation
par: Boudiaf, Abderrahmene, et autres
Publié: (2026)
par: Boudiaf, Abderrahmene, et autres
Publié: (2026)
CropVLM: A Domain-Adapted Vision-Language Model for Open-Set Crop Analysis
par: Boudiaf, Abderrahmene, et autres
Publié: (2026)
par: Boudiaf, Abderrahmene, et autres
Publié: (2026)
AgriBench: A Hierarchical Agriculture Benchmark for Multimodal Large Language Models
par: Zhou, Yutong, et autres
Publié: (2024)
par: Zhou, Yutong, et autres
Publié: (2024)
AgriVLN: Vision-and-Language Navigation for Agricultural Robots
par: Zhao, Xiaobei, et autres
Publié: (2025)
par: Zhao, Xiaobei, et autres
Publié: (2025)
TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding
par: Ren, Shuhuai, et autres
Publié: (2023)
par: Ren, Shuhuai, et autres
Publié: (2023)
Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind
par: Li, Qingmei, et autres
Publié: (2025)
par: Li, Qingmei, et autres
Publié: (2025)
SlideChat: A Large Vision-Language Assistant for Whole-Slide Pathology Image Understanding
par: Chen, Ying, et autres
Publié: (2024)
par: Chen, Ying, et autres
Publié: (2024)
PsOCR: Benchmarking Large Multimodal Models for Optical Character Recognition in Low-resource Pashto Language
par: Haq, Ijazul, et autres
Publié: (2025)
par: Haq, Ijazul, et autres
Publié: (2025)
AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis
par: Alawode, Basit, et autres
Publié: (2025)
par: Alawode, Basit, et autres
Publié: (2025)
CrashChat: A Multimodal Large Language Model for Multitask Traffic Crash Video Analysis
par: Liang, Kaidi, et autres
Publié: (2025)
par: Liang, Kaidi, et autres
Publié: (2025)
CLDTracker: A Comprehensive Language Description for Visual Tracking
par: Alansari, Mohamad, et autres
Publié: (2025)
par: Alansari, Mohamad, et autres
Publié: (2025)
Leveraging Chat-Based Large Vision Language Models for Multimodal Out-Of-Context Detection
par: Shalabi, Fatma, et autres
Publié: (2024)
par: Shalabi, Fatma, et autres
Publié: (2024)
II-Bench: An Image Implication Understanding Benchmark for Multimodal Large Language Models
par: Liu, Ziqiang, et autres
Publié: (2024)
par: Liu, Ziqiang, et autres
Publié: (2024)
ChatBEV: A Visual Language Model that Understands BEV Maps
par: Xu, Qingyao, et autres
Publié: (2025)
par: Xu, Qingyao, et autres
Publié: (2025)
AgroNVILA: Perception-Reasoning Decoupling for Multi-view Agricultural Multimodal Large Language Models
par: Zhang, Jiarui, et autres
Publié: (2026)
par: Zhang, Jiarui, et autres
Publié: (2026)
Can Multimodal Large Language Models Truly Understand Small Objects?
par: Han, Fujun, et autres
Publié: (2026)
par: Han, Fujun, et autres
Publié: (2026)
Cognitive Mismatch in Multimodal Large Language Models for Discrete Symbol Understanding
par: Li, Yinghui, et autres
Publié: (2026)
par: Li, Yinghui, et autres
Publié: (2026)
Photon: Speedup Volume Understanding with Efficient Multimodal Large Language Models
par: Fang, Chengyu, et autres
Publié: (2026)
par: Fang, Chengyu, et autres
Publié: (2026)
MOSABench: Multi-Object Sentiment Analysis Benchmark for Evaluating Multimodal Large Language Models Understanding of Complex Image
par: Song, Shezheng, et autres
Publié: (2024)
par: Song, Shezheng, et autres
Publié: (2024)
Harnessing Large Vision and Language Models in Agriculture: A Review
par: Zhu, Hongyan, et autres
Publié: (2024)
par: Zhu, Hongyan, et autres
Publié: (2024)
EventVL: Understand Event Streams via Multimodal Large Language Model
par: Li, Pengteng, et autres
Publié: (2025)
par: Li, Pengteng, et autres
Publié: (2025)
FaceLLM: A Multimodal Large Language Model for Face Understanding
par: Shahreza, Hatef Otroshi, et autres
Publié: (2025)
par: Shahreza, Hatef Otroshi, et autres
Publié: (2025)
SurgMLLMBench: A Multimodal Large Language Model Benchmark Dataset for Surgical Scene Understanding
par: Choi, Tae-Min, et autres
Publié: (2025)
par: Choi, Tae-Min, et autres
Publié: (2025)
Large Language Models Can Understanding Depth from Monocular Images
par: Xia, Zhongyi, et autres
Publié: (2024)
par: Xia, Zhongyi, et autres
Publié: (2024)
Benchmarking Large Multimodal Models for Ophthalmic Visual Question Answering with OphthalWeChat
par: Xu, Pusheng, et autres
Publié: (2025)
par: Xu, Pusheng, et autres
Publié: (2025)
Can Multimodal Large Language Models Understand Pathologic Movements? A Pilot Study on Seizure Semiology
par: Zhang, Lina, et autres
Publié: (2026)
par: Zhang, Lina, et autres
Publié: (2026)
UniSVG: A Unified Dataset for Vector Graphic Understanding and Generation with Multimodal Large Language Models
par: Li, Jinke, et autres
Publié: (2025)
par: Li, Jinke, et autres
Publié: (2025)
Apollo: An Exploration of Video Understanding in Large Multimodal Models
par: Zohar, Orr, et autres
Publié: (2024)
par: Zohar, Orr, et autres
Publié: (2024)
Tokenization Allows Multimodal Large Language Models to Understand, Generate and Edit Architectural Floor Plans
par: Qin, Sizhong, et autres
Publié: (2026)
par: Qin, Sizhong, et autres
Publié: (2026)
Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism
par: Chen, Tao, et autres
Publié: (2026)
par: Chen, Tao, et autres
Publié: (2026)
Single Image Unlearning: Efficient Machine Unlearning in Multimodal Large Language Models
par: Li, Jiaqi, et autres
Publié: (2024)
par: Li, Jiaqi, et autres
Publié: (2024)
PARTONOMY: Large Multimodal Models with Part-Level Visual Understanding
par: Blume, Ansel, et autres
Publié: (2025)
par: Blume, Ansel, et autres
Publié: (2025)
SONIC-O1: A Real-World Benchmark for Evaluating Multimodal Large Language Models on Audio-Video Understanding
par: Radwan, Ahmed Y., et autres
Publié: (2026)
par: Radwan, Ahmed Y., et autres
Publié: (2026)
RxnBench: A Multimodal Benchmark for Evaluating Large Language Models on Chemical Reaction Understanding from Scientific Literature
par: Li, Hanzheng, et autres
Publié: (2025)
par: Li, Hanzheng, et autres
Publié: (2025)
MLLM-HWSI: A Multimodal Large Language Model for Hierarchical Whole Slide Image Understanding
par: Alawode, Basit, et autres
Publié: (2026)
par: Alawode, Basit, et autres
Publié: (2026)
Efficient Multimodal Large Language Models: A Survey
par: Jin, Yizhang, et autres
Publié: (2024)
par: Jin, Yizhang, et autres
Publié: (2024)
Deeper Thought, Weaker Aim: Understanding and Mitigating Perceptual Impairment during Reasoning in Multimodal Large Language Models
par: Peng, Ruiying, et autres
Publié: (2026)
par: Peng, Ruiying, et autres
Publié: (2026)
Is 'Right' Right? Enhancing Object Orientation Understanding in Multimodal Large Language Models through Egocentric Instruction Tuning
par: Jung, Ji Hyeok, et autres
Publié: (2024)
par: Jung, Ji Hyeok, et autres
Publié: (2024)
Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models
par: Zhan, Yufei, et autres
Publié: (2025)
par: Zhan, Yufei, et autres
Publié: (2025)
TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document
par: Liu, Yuliang, et autres
Publié: (2024)
par: Liu, Yuliang, et autres
Publié: (2024)
Documents similaires
-
SegRAG: Training-Free Retrieval-Augmented Semantic Segmentation
par: Boudiaf, Abderrahmene, et autres
Publié: (2026) -
CropVLM: A Domain-Adapted Vision-Language Model for Open-Set Crop Analysis
par: Boudiaf, Abderrahmene, et autres
Publié: (2026) -
AgriBench: A Hierarchical Agriculture Benchmark for Multimodal Large Language Models
par: Zhou, Yutong, et autres
Publié: (2024) -
AgriVLN: Vision-and-Language Navigation for Agricultural Robots
par: Zhao, Xiaobei, et autres
Publié: (2025) -
TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding
par: Ren, Shuhuai, et autres
Publié: (2023)