PromptBench: A Unified Library for Evaluation of Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhu, Kaijie, Zhao, Qinlin, Chen, Hao, Wang, Jindong, Xie, Xing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Dynamic Evaluation of Large Language Models by Meta Probing Agents
di: Zhu, Kaijie, et al.
Pubblicazione: (2024)
di: Zhu, Kaijie, et al.
Pubblicazione: (2024)
DyVal: Dynamic Evaluation of Large Language Models for Reasoning Tasks
di: Zhu, Kaijie, et al.
Pubblicazione: (2023)
di: Zhu, Kaijie, et al.
Pubblicazione: (2023)
CompeteAI: Understanding the Competition Dynamics in Large Language Model-based Agents
di: Zhao, Qinlin, et al.
Pubblicazione: (2023)
di: Zhao, Qinlin, et al.
Pubblicazione: (2023)
CultureLLM: Incorporating Cultural Differences into Large Language Models
di: Li, Cheng, et al.
Pubblicazione: (2024)
di: Li, Cheng, et al.
Pubblicazione: (2024)
KIEval: A Knowledge-grounded Interactive Evaluation Framework for Large Language Models
di: Yu, Zhuohao, et al.
Pubblicazione: (2024)
di: Yu, Zhuohao, et al.
Pubblicazione: (2024)
PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts
di: Zhu, Kaijie, et al.
Pubblicazione: (2023)
di: Zhu, Kaijie, et al.
Pubblicazione: (2023)
Understanding and Mitigating Bias Inheritance in LLM-based Data Augmentation on Downstream Tasks
di: Li, Miaomiao, et al.
Pubblicazione: (2025)
di: Li, Miaomiao, et al.
Pubblicazione: (2025)
ERBench: An Entity-Relationship based Automatically Verifiable Hallucination Benchmark for Large Language Models
di: Oh, Jio, et al.
Pubblicazione: (2024)
di: Oh, Jio, et al.
Pubblicazione: (2024)
UniSD: Towards a Unified Self-Distillation Framework for Large Language Models
di: Jin, Yiqiao, et al.
Pubblicazione: (2026)
di: Jin, Yiqiao, et al.
Pubblicazione: (2026)
SciBench: Evaluating College-Level Scientific Problem-Solving Abilities of Large Language Models
di: Wang, Xiaoxuan, et al.
Pubblicazione: (2023)
di: Wang, Xiaoxuan, et al.
Pubblicazione: (2023)
StyleBench: Evaluating thinking styles in Large Language Models
di: Guo, Junyu, et al.
Pubblicazione: (2025)
di: Guo, Junyu, et al.
Pubblicazione: (2025)
Soft Prompting for Unlearning in Large Language Models
di: Bhaila, Karuna, et al.
Pubblicazione: (2024)
di: Bhaila, Karuna, et al.
Pubblicazione: (2024)
CityBench: Evaluating the Capabilities of Large Language Models for Urban Tasks
di: Feng, Jie, et al.
Pubblicazione: (2024)
di: Feng, Jie, et al.
Pubblicazione: (2024)
On Catastrophic Inheritance of Large Foundation Models
di: Chen, Hao, et al.
Pubblicazione: (2024)
di: Chen, Hao, et al.
Pubblicazione: (2024)
RePST: Language Model Empowered Spatio-Temporal Forecasting via Semantic-Oriented Reprogramming
di: Wang, Hao, et al.
Pubblicazione: (2024)
di: Wang, Hao, et al.
Pubblicazione: (2024)
CliBench: A Multifaceted and Multigranular Evaluation of Large Language Models for Clinical Decision Making
di: Ma, Mingyu Derek, et al.
Pubblicazione: (2024)
di: Ma, Mingyu Derek, et al.
Pubblicazione: (2024)
AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models
di: Lee, Jaeho, et al.
Pubblicazione: (2025)
di: Lee, Jaeho, et al.
Pubblicazione: (2025)
On Prompt-Driven Safeguarding for Large Language Models
di: Zheng, Chujie, et al.
Pubblicazione: (2024)
di: Zheng, Chujie, et al.
Pubblicazione: (2024)
UniGuardian: A Unified Defense for Detecting Prompt Injection, Backdoor Attacks and Adversarial Attacks in Large Language Models
di: Lin, Huawei, et al.
Pubblicazione: (2025)
di: Lin, Huawei, et al.
Pubblicazione: (2025)
Flaw or Artifact? Rethinking Prompt Sensitivity in Evaluating LLMs
di: Hua, Andong, et al.
Pubblicazione: (2025)
di: Hua, Andong, et al.
Pubblicazione: (2025)
Graph Neural Prompting with Large Language Models
di: Tian, Yijun, et al.
Pubblicazione: (2023)
di: Tian, Yijun, et al.
Pubblicazione: (2023)
Diff-eRank: A Novel Rank-Based Metric for Evaluating Large Language Models
di: Wei, Lai, et al.
Pubblicazione: (2024)
di: Wei, Lai, et al.
Pubblicazione: (2024)
PMPO: Probabilistic Metric Prompt Optimization for Small and Large Language Models
di: Zhao, Chenzhuo, et al.
Pubblicazione: (2025)
di: Zhao, Chenzhuo, et al.
Pubblicazione: (2025)
RePrompt: Planning by Automatic Prompt Engineering for Large Language Models Agents
di: Chen, Weizhe, et al.
Pubblicazione: (2024)
di: Chen, Weizhe, et al.
Pubblicazione: (2024)
Disentangling Logic: The Role of Context in Large Language Model Reasoning Capabilities
di: Hua, Wenyue, et al.
Pubblicazione: (2024)
di: Hua, Wenyue, et al.
Pubblicazione: (2024)
FusionBench: A Unified Library and Comprehensive Benchmark for Deep Model Fusion
di: Tang, Anke, et al.
Pubblicazione: (2024)
di: Tang, Anke, et al.
Pubblicazione: (2024)
BeyondBench: Contamination-Resistant Evaluation of Reasoning in Language Models
di: Srivastava, Gaurav, et al.
Pubblicazione: (2025)
di: Srivastava, Gaurav, et al.
Pubblicazione: (2025)
Towards a Unified View of Large Language Model Post-Training
di: Lv, Xingtai, et al.
Pubblicazione: (2025)
di: Lv, Xingtai, et al.
Pubblicazione: (2025)
AQA-Bench: An Interactive Benchmark for Evaluating LLMs' Sequential Reasoning Ability
di: Yang, Siwei, et al.
Pubblicazione: (2024)
di: Yang, Siwei, et al.
Pubblicazione: (2024)
AlignBench: Benchmarking Chinese Alignment of Large Language Models
di: Liu, Xiao, et al.
Pubblicazione: (2023)
di: Liu, Xiao, et al.
Pubblicazione: (2023)
CodeEditorBench: Evaluating Code Editing Capability of Large Language Models
di: Guo, Jiawei, et al.
Pubblicazione: (2024)
di: Guo, Jiawei, et al.
Pubblicazione: (2024)
AfroBench: How Good are Large Language Models on African Languages?
di: Ojo, Jessica, et al.
Pubblicazione: (2023)
di: Ojo, Jessica, et al.
Pubblicazione: (2023)
Prompt Optimization Via Diffusion Language Models
di: Wang, Shiyu, et al.
Pubblicazione: (2026)
di: Wang, Shiyu, et al.
Pubblicazione: (2026)
A Survey on Evaluation of Large Language Models
di: Chang, Yupeng, et al.
Pubblicazione: (2023)
di: Chang, Yupeng, et al.
Pubblicazione: (2023)
Structured Prompts Improve Evaluation of Language Models
di: Aali, Asad, et al.
Pubblicazione: (2025)
di: Aali, Asad, et al.
Pubblicazione: (2025)
TracrBench: Generating Interpretability Testbeds with Large Language Models
di: Thurnherr, Hannes, et al.
Pubblicazione: (2024)
di: Thurnherr, Hannes, et al.
Pubblicazione: (2024)
Large Language Model Unlearning via Embedding-Corrupted Prompts
di: Liu, Chris Yuhao, et al.
Pubblicazione: (2024)
di: Liu, Chris Yuhao, et al.
Pubblicazione: (2024)
AraLingBench A Human-Annotated Benchmark for Evaluating Arabic Linguistic Capabilities of Large Language Models
di: Zbeeb, Mohammad, et al.
Pubblicazione: (2025)
di: Zbeeb, Mohammad, et al.
Pubblicazione: (2025)
Generative Evaluation of Complex Reasoning in Large Language Models
di: Lin, Haowei, et al.
Pubblicazione: (2025)
di: Lin, Haowei, et al.
Pubblicazione: (2025)
APPL: A Prompt Programming Language for Harmonious Integration of Programs and Large Language Model Prompts
di: Dong, Honghua, et al.
Pubblicazione: (2024)
di: Dong, Honghua, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Dynamic Evaluation of Large Language Models by Meta Probing Agents
di: Zhu, Kaijie, et al.
Pubblicazione: (2024) -
DyVal: Dynamic Evaluation of Large Language Models for Reasoning Tasks
di: Zhu, Kaijie, et al.
Pubblicazione: (2023) -
CompeteAI: Understanding the Competition Dynamics in Large Language Model-based Agents
di: Zhao, Qinlin, et al.
Pubblicazione: (2023) -
CultureLLM: Incorporating Cultural Differences into Large Language Models
di: Li, Cheng, et al.
Pubblicazione: (2024) -
KIEval: A Knowledge-grounded Interactive Evaluation Framework for Large Language Models
di: Yu, Zhuohao, et al.
Pubblicazione: (2024)