AgriGPT-VL: Agricultural Vision-Language Understanding Suite
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Bo, Chen, Yunkui, Feng, Lanfei, Zhang, Yu, Xu, Xiao, Zhang, Jianyu, Aierken, Nueraili, Huang, Runhe, Lin, Hongjian, Ying, Yibin, Li, Shijian |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AgriGPT-Omni: A Unified Speech-Vision-Text Framework for Multilingual Agricultural Intelligence
por: Yang, Bo, et al.
Publicado: (2025)
por: Yang, Bo, et al.
Publicado: (2025)
AgriGPT: a Large Language Model Ecosystem for Agriculture
por: Yang, Bo, et al.
Publicado: (2025)
por: Yang, Bo, et al.
Publicado: (2025)
AgriAgent: Contract-Driven Planning and Capability-Aware Tool Orchestration in Real-World Agriculture
por: Yang, Bo, et al.
Publicado: (2026)
por: Yang, Bo, et al.
Publicado: (2026)
ZPD Detector: Data Selection via Capability-Difficulty Alignment for Large Language Models
por: Yang, Bo, et al.
Publicado: (2026)
por: Yang, Bo, et al.
Publicado: (2026)
FairJudge: An Adaptive, Debiased, and Consistent LLM-as-a-Judge
por: Yang, Bo, et al.
Publicado: (2026)
por: Yang, Bo, et al.
Publicado: (2026)
Flash-VL 2B: Optimizing Vision-Language Model Performance for Ultra-Low Latency and High Throughput
por: Zhang, Bo, et al.
Publicado: (2025)
por: Zhang, Bo, et al.
Publicado: (2025)
SUM-AgriVLN: Spatial Understanding Memory for Agricultural Vision-and-Language Navigation
por: Zhao, Xiaobei, et al.
Publicado: (2025)
por: Zhao, Xiaobei, et al.
Publicado: (2025)
AgriVLN: Vision-and-Language Navigation for Agricultural Robots
por: Zhao, Xiaobei, et al.
Publicado: (2025)
por: Zhao, Xiaobei, et al.
Publicado: (2025)
DeepSeek-VL: Towards Real-World Vision-Language Understanding
por: Lu, Haoyu, et al.
Publicado: (2024)
por: Lu, Haoyu, et al.
Publicado: (2024)
A Framework For Image Synthesis Using Supervised Contrastive Learning
por: Liu, Yibin, et al.
Publicado: (2024)
por: Liu, Yibin, et al.
Publicado: (2024)
Firebolt-VL: Efficient Vision-Language Understanding with Cross-Modality Modulation
por: Trinh, Quoc-Huy, et al.
Publicado: (2026)
por: Trinh, Quoc-Huy, et al.
Publicado: (2026)
PlanGPT-VL: Enhancing Urban Planning with Domain-Specific Vision-Language Models
por: Zhu, He, et al.
Publicado: (2025)
por: Zhu, He, et al.
Publicado: (2025)
Multimodal Interpretation of Remote Sensing Images: Dynamic Resolution Input Strategy and Multi-scale Vision-Language Alignment Mechanism
por: Zhang, Siyu, et al.
Publicado: (2025)
por: Zhang, Siyu, et al.
Publicado: (2025)
AgriChat: A Multimodal Large Language Model for Agriculture Image Understanding
por: Boudiaf, Abderrahmene, et al.
Publicado: (2026)
por: Boudiaf, Abderrahmene, et al.
Publicado: (2026)
MDE-AgriVLN: Agricultural Vision-and-Language Navigation with Monocular Depth Estimation
por: Zhao, Xiaobei, et al.
Publicado: (2025)
por: Zhao, Xiaobei, et al.
Publicado: (2025)
VL-RouterBench: A Benchmark for Vision-Language Model Routing
por: Huang, Zhehao, et al.
Publicado: (2025)
por: Huang, Zhehao, et al.
Publicado: (2025)
EarthVL: A Progressive Earth Vision-Language Understanding and Generation Framework
por: Wang, Junjue, et al.
Publicado: (2026)
por: Wang, Junjue, et al.
Publicado: (2026)
HaploVL: A Single-Transformer Baseline for Multi-Modal Understanding
por: Yang, Rui, et al.
Publicado: (2025)
por: Yang, Rui, et al.
Publicado: (2025)
SDAR-VL: Stable and Efficient Block-wise Diffusion for Vision-Language Understanding
por: Cheng, Shuang, et al.
Publicado: (2025)
por: Cheng, Shuang, et al.
Publicado: (2025)
JW-VL: A Vision-Language Model for Solar Physics
por: Shao, Mingfu, et al.
Publicado: (2026)
por: Shao, Mingfu, et al.
Publicado: (2026)
Vision-Language Models for Vision Tasks: A Survey
por: Zhang, Jingyi, et al.
Publicado: (2023)
por: Zhang, Jingyi, et al.
Publicado: (2023)
R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization
por: Zhang, Jingyi, et al.
Publicado: (2025)
por: Zhang, Jingyi, et al.
Publicado: (2025)
Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation
por: Zhang, Jianyu, et al.
Publicado: (2024)
por: Zhang, Jianyu, et al.
Publicado: (2024)
AgriChain Visually Grounded Expert Verified Reasoning for Interpretable Agricultural Vision Language Models
por: Mahmood, Hazza, et al.
Publicado: (2026)
por: Mahmood, Hazza, et al.
Publicado: (2026)
IMAC-AgriVLN: Can Agricultural Vision-and-Language Navigation Agents be Aware of Instruction Mistakes?
por: Zhao, Xiaobei, et al.
Publicado: (2026)
por: Zhao, Xiaobei, et al.
Publicado: (2026)
AgriDoctor: A Multimodal Intelligent Assistant for Agriculture
por: Zhang, Mingqing, et al.
Publicado: (2025)
por: Zhang, Mingqing, et al.
Publicado: (2025)
HeartcareGPT: A Unified Multimodal ECG Suite for Dual Signal-Image Modeling and Understanding
por: Xie, Yihan, et al.
Publicado: (2025)
por: Xie, Yihan, et al.
Publicado: (2025)
MeDocVL: A Visual Language Model for Medical Document Understanding and Parsing
por: Wang, Wenjie, et al.
Publicado: (2026)
por: Wang, Wenjie, et al.
Publicado: (2026)
FTibSuite: A Comprehensive Resource Suite for Tibetan Vision-Language Modeling
por: Xu, Guixian, et al.
Publicado: (2026)
por: Xu, Guixian, et al.
Publicado: (2026)
A-VL: Adaptive Attention for Large Vision-Language Models
por: Zhang, Junyang, et al.
Publicado: (2024)
por: Zhang, Junyang, et al.
Publicado: (2024)
ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification
por: He, Yefei, et al.
Publicado: (2024)
por: He, Yefei, et al.
Publicado: (2024)
Agri Startups and Entrepreneurship in Modern Agriculture
por: Prof. Suryawanshi Sharad Kantilal
Publicado: (2025)
por: Prof. Suryawanshi Sharad Kantilal
Publicado: (2025)
Qianfan-VL: Domain-Enhanced Universal Vision-Language Models
por: Dong, Daxiang, et al.
Publicado: (2025)
por: Dong, Daxiang, et al.
Publicado: (2025)
VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning
por: Wang, Haozhe, et al.
Publicado: (2025)
por: Wang, Haozhe, et al.
Publicado: (2025)
Light as Deception: GPT-driven Natural Relighting Against Vision-Language Pre-training Models
por: Yang, Ying, et al.
Publicado: (2025)
por: Yang, Ying, et al.
Publicado: (2025)
DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding
por: Wu, Zhiyu, et al.
Publicado: (2024)
por: Wu, Zhiyu, et al.
Publicado: (2024)
Rice-VL: Evaluating Vision-Language Models for Cultural Understanding Across ASEAN Countries
por: Pranav, Tushar, et al.
Publicado: (2025)
por: Pranav, Tushar, et al.
Publicado: (2025)
Skeleton Detection Using Dual Radars with Integration of Dual-View CNN Models and mmPose
por: Kodama, Masaharu, et al.
Publicado: (2024)
por: Kodama, Masaharu, et al.
Publicado: (2024)
VL-Uncertainty: Detecting Hallucination in Large Vision-Language Model via Uncertainty Estimation
por: Zhang, Ruiyang, et al.
Publicado: (2024)
por: Zhang, Ruiyang, et al.
Publicado: (2024)
VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training
por: Zhang, Jipeng, et al.
Publicado: (2025)
por: Zhang, Jipeng, et al.
Publicado: (2025)
Ejemplares similares
-
AgriGPT-Omni: A Unified Speech-Vision-Text Framework for Multilingual Agricultural Intelligence
por: Yang, Bo, et al.
Publicado: (2025) -
AgriGPT: a Large Language Model Ecosystem for Agriculture
por: Yang, Bo, et al.
Publicado: (2025) -
AgriAgent: Contract-Driven Planning and Capability-Aware Tool Orchestration in Real-World Agriculture
por: Yang, Bo, et al.
Publicado: (2026) -
ZPD Detector: Data Selection via Capability-Difficulty Alignment for Large Language Models
por: Yang, Bo, et al.
Publicado: (2026) -
FairJudge: An Adaptive, Debiased, and Consistent LLM-as-a-Judge
por: Yang, Bo, et al.
Publicado: (2026)