Beyond Prompts: Dynamic Conversational Benchmarking of Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Castillo-Bolado, David, Davidson, Joseph, Gray, Finlay, Rosa, Marek |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Benchmarking Prompt Sensitivity in Large Language Models
by: Razavi, Amirhossein, et al.
Published: (2025)
by: Razavi, Amirhossein, et al.
Published: (2025)
Benchmarking Large Language Models on Multiple Tasks in Bioinformatics NLP with Prompting
by: Jiang, Jiyue, et al.
Published: (2025)
by: Jiang, Jiyue, et al.
Published: (2025)
Strategic Prompting for Conversational Tasks: A Comparative Analysis of Large Language Models Across Diverse Conversational Tasks
by: Joshi, Ratnesh Kumar, et al.
Published: (2024)
by: Joshi, Ratnesh Kumar, et al.
Published: (2024)
Beyond Facts: Benchmarking Distributional Reading Comprehension in Large Language Models
by: Guo, Pei-Fu, et al.
Published: (2026)
by: Guo, Pei-Fu, et al.
Published: (2026)
Dynamic Compressing Prompts for Efficient Inference of Large Language Models
by: Hu, Jinwu, et al.
Published: (2025)
by: Hu, Jinwu, et al.
Published: (2025)
Benchmarking and Defending Against Indirect Prompt Injection Attacks on Large Language Models
by: Yi, Jingwei, et al.
Published: (2023)
by: Yi, Jingwei, et al.
Published: (2023)
Order Matters in Hallucination: Reasoning Order as Benchmark and Reflexive Prompting for Large-Language-Models
by: Xie, Zikai
Published: (2024)
by: Xie, Zikai
Published: (2024)
The PICCO Framework for Large Language Model Prompting: A Taxonomy and Reference Architecture for Prompt Structure
by: Cook, David A.
Published: (2026)
by: Cook, David A.
Published: (2026)
Meta-Reasoning Improves Tool Use in Large Language Models
by: Alazraki, Lisa, et al.
Published: (2024)
by: Alazraki, Lisa, et al.
Published: (2024)
PromptBridge: Cross-Model Prompt Transfer for Large Language Models
by: Wang, Yaxuan, et al.
Published: (2025)
by: Wang, Yaxuan, et al.
Published: (2025)
Large Language Models Vote: Prompting for Rare Disease Identification
by: Oniani, David, et al.
Published: (2023)
by: Oniani, David, et al.
Published: (2023)
Plan-Grounded Large Language Models for Dual Goal Conversational Settings
by: Glória-Silva, Diogo, et al.
Published: (2024)
by: Glória-Silva, Diogo, et al.
Published: (2024)
Are Large Language Models Good Prompt Optimizers?
by: Ma, Ruotian, et al.
Published: (2024)
by: Ma, Ruotian, et al.
Published: (2024)
Large Language Models Prompting With Episodic Memory
by: Do, Dai, et al.
Published: (2024)
by: Do, Dai, et al.
Published: (2024)
On the Worst Prompt Performance of Large Language Models
by: Cao, Bowen, et al.
Published: (2024)
by: Cao, Bowen, et al.
Published: (2024)
Robustness of Prompting: Enhancing Robustness of Large Language Models Against Prompting Attacks
by: Mu, Lin, et al.
Published: (2025)
by: Mu, Lin, et al.
Published: (2025)
Diverse Prompts: Illuminating the Prompt Space of Large Language Models with MAP-Elites
by: Santos, Gabriel Machado, et al.
Published: (2025)
by: Santos, Gabriel Machado, et al.
Published: (2025)
JMedEthicBench: A Multi-Turn Conversational Benchmark for Evaluating Medical Safety in Japanese Large Language Models
by: Liu, Junyu, et al.
Published: (2026)
by: Liu, Junyu, et al.
Published: (2026)
Towards Generalist Prompting for Large Language Models by Mental Models
by: Guan, Haoxiang, et al.
Published: (2024)
by: Guan, Haoxiang, et al.
Published: (2024)
Unveiling and Manipulating Prompt Influence in Large Language Models
by: Feng, Zijian, et al.
Published: (2024)
by: Feng, Zijian, et al.
Published: (2024)
Prompt and Parameter Co-Optimization for Large Language Models
by: Bo, Xiaohe, et al.
Published: (2025)
by: Bo, Xiaohe, et al.
Published: (2025)
Metacognitive Prompting Improves Understanding in Large Language Models
by: Wang, Yuqing, et al.
Published: (2023)
by: Wang, Yuqing, et al.
Published: (2023)
Prompt-based Depth Pruning of Large Language Models
by: Wee, Juyun, et al.
Published: (2025)
by: Wee, Juyun, et al.
Published: (2025)
Prompt-Based Value Steering of Large Language Models
by: Abbo, Giulio Antonio, et al.
Published: (2025)
by: Abbo, Giulio Antonio, et al.
Published: (2025)
An Empirical Study on Prompt Compression for Large Language Models
by: Zhang, Zheng, et al.
Published: (2025)
by: Zhang, Zheng, et al.
Published: (2025)
CFDLLMBench: A Benchmark Suite for Evaluating Large Language Models in Computational Fluid Dynamics
by: Somasekharan, Nithin, et al.
Published: (2025)
by: Somasekharan, Nithin, et al.
Published: (2025)
Role-Play Zero-Shot Prompting with Large Language Models for Open-Domain Human-Machine Conversation
by: Njifenjou, Ahmed, et al.
Published: (2024)
by: Njifenjou, Ahmed, et al.
Published: (2024)
Large Language Models as Misleading Assistants in Conversation
by: Hou, Betty Li, et al.
Published: (2024)
by: Hou, Betty Li, et al.
Published: (2024)
Beyond Correctness: Benchmarking Multi-dimensional Code Generation for Large Language Models
by: Zheng, Jiasheng, et al.
Published: (2024)
by: Zheng, Jiasheng, et al.
Published: (2024)
Large Language Models in the Clinic: A Comprehensive Benchmark
by: Liu, Fenglin, et al.
Published: (2024)
by: Liu, Fenglin, et al.
Published: (2024)
Codenames as a Benchmark for Large Language Models
by: Stephenson, Matthew, et al.
Published: (2024)
by: Stephenson, Matthew, et al.
Published: (2024)
Benchmarking Distributional Alignment of Large Language Models
by: Meister, Nicole, et al.
Published: (2024)
by: Meister, Nicole, et al.
Published: (2024)
Large Language Model Benchmarks in Medical Tasks
by: Yan, Lawrence K. Q., et al.
Published: (2024)
by: Yan, Lawrence K. Q., et al.
Published: (2024)
Cross-Lingual Conversational Speech Summarization with Large Language Models
by: Nelson, Max, et al.
Published: (2024)
by: Nelson, Max, et al.
Published: (2024)
Benchmarking the Pedagogical Knowledge of Large Language Models
by: Lelièvre, Maxime, et al.
Published: (2025)
by: Lelièvre, Maxime, et al.
Published: (2025)
BELL: Benchmarking the Explainability of Large Language Models
by: Ahmed, Syed Quiser, et al.
Published: (2025)
by: Ahmed, Syed Quiser, et al.
Published: (2025)
Is There a Case for Conversation Optimized Tokenizers in Large Language Models?
by: Ferrando, Raquel, et al.
Published: (2025)
by: Ferrando, Raquel, et al.
Published: (2025)
Time Awareness in Large Language Models: Benchmarking Fact Recall Across Time
by: Herel, David, et al.
Published: (2024)
by: Herel, David, et al.
Published: (2024)
Continual Learning Using Only Large Language Model Prompting
by: Qiu, Jiabao, et al.
Published: (2024)
by: Qiu, Jiabao, et al.
Published: (2024)
Prompting Large Language Models for Supporting the Differential Diagnosis of Anemia
by: Castagnari, Elisa, et al.
Published: (2024)
by: Castagnari, Elisa, et al.
Published: (2024)
Similar Items
-
Benchmarking Prompt Sensitivity in Large Language Models
by: Razavi, Amirhossein, et al.
Published: (2025) -
Benchmarking Large Language Models on Multiple Tasks in Bioinformatics NLP with Prompting
by: Jiang, Jiyue, et al.
Published: (2025) -
Strategic Prompting for Conversational Tasks: A Comparative Analysis of Large Language Models Across Diverse Conversational Tasks
by: Joshi, Ratnesh Kumar, et al.
Published: (2024) -
Beyond Facts: Benchmarking Distributional Reading Comprehension in Large Language Models
by: Guo, Pei-Fu, et al.
Published: (2026) -
Dynamic Compressing Prompts for Efficient Inference of Large Language Models
by: Hu, Jinwu, et al.
Published: (2025)