GPT-4 as Evaluator: Evaluating Large Language Models on Pest Management in Agriculture
Fuente:
arXiv
Saved in:
| Main Authors: | Yang, Shanglong, Yuan, Zhipeng, Li, Shunbao, Peng, Ruoling, Liu, Kang, Yang, Po |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
PestMA: LLM-based Multi-Agent System for Informed Pest Management
by: Shi, Hongrui, et al.
Published: (2025)
by: Shi, Hongrui, et al.
Published: (2025)
ShizishanGPT: An Agricultural Large Language Model Integrating Tools and Resources
by: Yang, Shuting, et al.
Published: (2024)
by: Yang, Shuting, et al.
Published: (2024)
Graph-Augmented Reasoning with Large Language Models for Tobacco Pest and Disease Management
by: Li, Siyu, et al.
Published: (2026)
by: Li, Siyu, et al.
Published: (2026)
Robust Evaluation Measures for Evaluating Social Biases in Masked Language Models
by: Liu, Yang
Published: (2024)
by: Liu, Yang
Published: (2024)
OMGEval: An Open Multilingual Generative Evaluation Benchmark for Large Language Models
by: Liu, Yang, et al.
Published: (2024)
by: Liu, Yang, et al.
Published: (2024)
Evaluating Large Language Models with Psychometrics
by: Li, Yuan, et al.
Published: (2024)
by: Li, Yuan, et al.
Published: (2024)
AesBiasBench: Evaluating Bias and Alignment in Multimodal Language Models for Personalized Image Aesthetic Assessment
by: Li, Kun, et al.
Published: (2025)
by: Li, Kun, et al.
Published: (2025)
DePrompt: Desensitization and Evaluation of Personal Identifiable Information in Large Language Model Prompts
by: Sun, Xiongtao, et al.
Published: (2024)
by: Sun, Xiongtao, et al.
Published: (2024)
AgriGPT-VL: Agricultural Vision-Language Understanding Suite
by: Yang, Bo, et al.
Published: (2025)
by: Yang, Bo, et al.
Published: (2025)
Evaluating Quantized Large Language Models
by: Li, Shiyao, et al.
Published: (2024)
by: Li, Shiyao, et al.
Published: (2024)
CodeMind: Evaluating Large Language Models for Code Reasoning
by: Liu, Changshu, et al.
Published: (2024)
by: Liu, Changshu, et al.
Published: (2024)
Can Large Language Models Automatically Jailbreak GPT-4V?
by: Wu, Yuanwei, et al.
Published: (2024)
by: Wu, Yuanwei, et al.
Published: (2024)
Knowledge Reasoning of Large Language Models Integrating Graph-Structured Information for Pest and Disease Control in Tobacco
by: Li, Siyu, et al.
Published: (2025)
by: Li, Siyu, et al.
Published: (2025)
Gradable ChatGPT Translation Evaluation
by: Jiao, Hui, et al.
Published: (2024)
by: Jiao, Hui, et al.
Published: (2024)
Radiology-GPT: A Large Language Model for Radiology
by: Liu, Zhengliang, et al.
Published: (2023)
by: Liu, Zhengliang, et al.
Published: (2023)
EconNLI: Evaluating Large Language Models on Economics Reasoning
by: Guo, Yue, et al.
Published: (2024)
by: Guo, Yue, et al.
Published: (2024)
PclGPT: A Large Language Model for Patronizing and Condescending Language Detection
by: Wang, Hongbo, et al.
Published: (2024)
by: Wang, Hongbo, et al.
Published: (2024)
AC-EVAL: Evaluating Ancient Chinese Language Understanding in Large Language Models
by: Wei, Yuting, et al.
Published: (2024)
by: Wei, Yuting, et al.
Published: (2024)
Word Recovery in Large Language Models Enables Character-Level Tokenization Robustness
by: Yang, Zhipeng, et al.
Published: (2026)
by: Yang, Zhipeng, et al.
Published: (2026)
Large Language Model Evaluation via Matrix Nuclear-Norm
by: Li, Yahan, et al.
Published: (2024)
by: Li, Yahan, et al.
Published: (2024)
Evaluating and Enhancing Large Language Models Performance in Domain-specific Medicine: Osteoarthritis Management with DocOA
by: Chen, Xi, et al.
Published: (2024)
by: Chen, Xi, et al.
Published: (2024)
Inference-Time Decontamination: Reusing Leaked Benchmarks for Large Language Model Evaluation
by: Zhu, Qin, et al.
Published: (2024)
by: Zhu, Qin, et al.
Published: (2024)
Evaluating Large Language Models on Financial Report Summarization: An Empirical Study
by: Yang, Xinqi, et al.
Published: (2024)
by: Yang, Xinqi, et al.
Published: (2024)
A Survey on Evaluation of Large Language Models
by: Chang, Yupeng, et al.
Published: (2023)
by: Chang, Yupeng, et al.
Published: (2023)
GPT as a Monte Carlo Language Tree: A Probabilistic Perspective
by: Ning, Kun-Peng, et al.
Published: (2025)
by: Ning, Kun-Peng, et al.
Published: (2025)
Mitigating the Bias of Large Language Model Evaluation
by: Zhou, Hongli, et al.
Published: (2024)
by: Zhou, Hongli, et al.
Published: (2024)
Evaluating Text Creativity across Diverse Domains: A Dataset and Large Language Model Evaluator
by: Cao, Qian, et al.
Published: (2025)
by: Cao, Qian, et al.
Published: (2025)
DEP: A Decentralized Large Language Model Evaluation Protocol
by: Peng, Jianxiang, et al.
Published: (2026)
by: Peng, Jianxiang, et al.
Published: (2026)
Bias in Large Language Models: Origin, Evaluation, and Mitigation
by: Guo, Yufei, et al.
Published: (2024)
by: Guo, Yufei, et al.
Published: (2024)
Towards Personalized Evaluation of Large Language Models with An Anonymous Crowd-Sourcing Platform
by: Cheng, Mingyue, et al.
Published: (2024)
by: Cheng, Mingyue, et al.
Published: (2024)
PediatricsGPT: Large Language Models as Chinese Medical Assistants for Pediatric Applications
by: Yang, Dingkang, et al.
Published: (2024)
by: Yang, Dingkang, et al.
Published: (2024)
Evaluating Large Language Models for Radiology Natural Language Processing
by: Liu, Zhengliang, et al.
Published: (2023)
by: Liu, Zhengliang, et al.
Published: (2023)
Evaluating Character Understanding of Large Language Models via Character Profiling from Fictional Works
by: Yuan, Xinfeng, et al.
Published: (2024)
by: Yuan, Xinfeng, et al.
Published: (2024)
RAD-Bench: Evaluating Large Language Models Capabilities in Retrieval Augmented Dialogues
by: Kuo, Tzu-Lin, et al.
Published: (2024)
by: Kuo, Tzu-Lin, et al.
Published: (2024)
Bias and Volatility: A Statistical Framework for Evaluating Large Language Model's Stereotypes and the Associated Generation Inconsistency
by: Liu, Yiran, et al.
Published: (2024)
by: Liu, Yiran, et al.
Published: (2024)
An Empirical Analysis of Uncertainty in Large Language Model Evaluations
by: Xie, Qiujie, et al.
Published: (2025)
by: Xie, Qiujie, et al.
Published: (2025)
S3Eval: A Synthetic, Scalable, Systematic Evaluation Suite for Large Language Models
by: Lei, Fangyu, et al.
Published: (2023)
by: Lei, Fangyu, et al.
Published: (2023)
Self-Evaluation of Large Language Model based on Glass-box Features
by: Huang, Hui, et al.
Published: (2024)
by: Huang, Hui, et al.
Published: (2024)
Evaluating Telugu Proficiency in Large Language Models_ A Comparative Analysis of ChatGPT and Gemini
by: Kishore, Katikela Sreeharsha, et al.
Published: (2024)
by: Kishore, Katikela Sreeharsha, et al.
Published: (2024)
A Comprehensive Survey of Large Language Models and Multimodal Large Language Models in Medicine
by: Xiao, Hanguang, et al.
Published: (2024)
by: Xiao, Hanguang, et al.
Published: (2024)
Similar Items
-
PestMA: LLM-based Multi-Agent System for Informed Pest Management
by: Shi, Hongrui, et al.
Published: (2025) -
ShizishanGPT: An Agricultural Large Language Model Integrating Tools and Resources
by: Yang, Shuting, et al.
Published: (2024) -
Graph-Augmented Reasoning with Large Language Models for Tobacco Pest and Disease Management
by: Li, Siyu, et al.
Published: (2026) -
Robust Evaluation Measures for Evaluating Social Biases in Masked Language Models
by: Liu, Yang
Published: (2024) -
OMGEval: An Open Multilingual Generative Evaluation Benchmark for Large Language Models
by: Liu, Yang, et al.
Published: (2024)