Beyond Prompts: Dynamic Conversational Benchmarking of Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Castillo-Bolado, David, Davidson, Joseph, Gray, Finlay, Rosa, Marek |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Benchmarking Prompt Sensitivity in Large Language Models
von: Razavi, Amirhossein, et al.
Veröffentlicht: (2025)
von: Razavi, Amirhossein, et al.
Veröffentlicht: (2025)
Benchmarking Large Language Models on Multiple Tasks in Bioinformatics NLP with Prompting
von: Jiang, Jiyue, et al.
Veröffentlicht: (2025)
von: Jiang, Jiyue, et al.
Veröffentlicht: (2025)
Strategic Prompting for Conversational Tasks: A Comparative Analysis of Large Language Models Across Diverse Conversational Tasks
von: Joshi, Ratnesh Kumar, et al.
Veröffentlicht: (2024)
von: Joshi, Ratnesh Kumar, et al.
Veröffentlicht: (2024)
Beyond Facts: Benchmarking Distributional Reading Comprehension in Large Language Models
von: Guo, Pei-Fu, et al.
Veröffentlicht: (2026)
von: Guo, Pei-Fu, et al.
Veröffentlicht: (2026)
Dynamic Compressing Prompts for Efficient Inference of Large Language Models
von: Hu, Jinwu, et al.
Veröffentlicht: (2025)
von: Hu, Jinwu, et al.
Veröffentlicht: (2025)
Benchmarking and Defending Against Indirect Prompt Injection Attacks on Large Language Models
von: Yi, Jingwei, et al.
Veröffentlicht: (2023)
von: Yi, Jingwei, et al.
Veröffentlicht: (2023)
Order Matters in Hallucination: Reasoning Order as Benchmark and Reflexive Prompting for Large-Language-Models
von: Xie, Zikai
Veröffentlicht: (2024)
von: Xie, Zikai
Veröffentlicht: (2024)
The PICCO Framework for Large Language Model Prompting: A Taxonomy and Reference Architecture for Prompt Structure
von: Cook, David A.
Veröffentlicht: (2026)
von: Cook, David A.
Veröffentlicht: (2026)
Meta-Reasoning Improves Tool Use in Large Language Models
von: Alazraki, Lisa, et al.
Veröffentlicht: (2024)
von: Alazraki, Lisa, et al.
Veröffentlicht: (2024)
PromptBridge: Cross-Model Prompt Transfer for Large Language Models
von: Wang, Yaxuan, et al.
Veröffentlicht: (2025)
von: Wang, Yaxuan, et al.
Veröffentlicht: (2025)
Large Language Models Vote: Prompting for Rare Disease Identification
von: Oniani, David, et al.
Veröffentlicht: (2023)
von: Oniani, David, et al.
Veröffentlicht: (2023)
Plan-Grounded Large Language Models for Dual Goal Conversational Settings
von: Glória-Silva, Diogo, et al.
Veröffentlicht: (2024)
von: Glória-Silva, Diogo, et al.
Veröffentlicht: (2024)
Are Large Language Models Good Prompt Optimizers?
von: Ma, Ruotian, et al.
Veröffentlicht: (2024)
von: Ma, Ruotian, et al.
Veröffentlicht: (2024)
Large Language Models Prompting With Episodic Memory
von: Do, Dai, et al.
Veröffentlicht: (2024)
von: Do, Dai, et al.
Veröffentlicht: (2024)
On the Worst Prompt Performance of Large Language Models
von: Cao, Bowen, et al.
Veröffentlicht: (2024)
von: Cao, Bowen, et al.
Veröffentlicht: (2024)
Robustness of Prompting: Enhancing Robustness of Large Language Models Against Prompting Attacks
von: Mu, Lin, et al.
Veröffentlicht: (2025)
von: Mu, Lin, et al.
Veröffentlicht: (2025)
Diverse Prompts: Illuminating the Prompt Space of Large Language Models with MAP-Elites
von: Santos, Gabriel Machado, et al.
Veröffentlicht: (2025)
von: Santos, Gabriel Machado, et al.
Veröffentlicht: (2025)
JMedEthicBench: A Multi-Turn Conversational Benchmark for Evaluating Medical Safety in Japanese Large Language Models
von: Liu, Junyu, et al.
Veröffentlicht: (2026)
von: Liu, Junyu, et al.
Veröffentlicht: (2026)
Towards Generalist Prompting for Large Language Models by Mental Models
von: Guan, Haoxiang, et al.
Veröffentlicht: (2024)
von: Guan, Haoxiang, et al.
Veröffentlicht: (2024)
Unveiling and Manipulating Prompt Influence in Large Language Models
von: Feng, Zijian, et al.
Veröffentlicht: (2024)
von: Feng, Zijian, et al.
Veröffentlicht: (2024)
Prompt and Parameter Co-Optimization for Large Language Models
von: Bo, Xiaohe, et al.
Veröffentlicht: (2025)
von: Bo, Xiaohe, et al.
Veröffentlicht: (2025)
Metacognitive Prompting Improves Understanding in Large Language Models
von: Wang, Yuqing, et al.
Veröffentlicht: (2023)
von: Wang, Yuqing, et al.
Veröffentlicht: (2023)
Prompt-based Depth Pruning of Large Language Models
von: Wee, Juyun, et al.
Veröffentlicht: (2025)
von: Wee, Juyun, et al.
Veröffentlicht: (2025)
Prompt-Based Value Steering of Large Language Models
von: Abbo, Giulio Antonio, et al.
Veröffentlicht: (2025)
von: Abbo, Giulio Antonio, et al.
Veröffentlicht: (2025)
An Empirical Study on Prompt Compression for Large Language Models
von: Zhang, Zheng, et al.
Veröffentlicht: (2025)
von: Zhang, Zheng, et al.
Veröffentlicht: (2025)
CFDLLMBench: A Benchmark Suite for Evaluating Large Language Models in Computational Fluid Dynamics
von: Somasekharan, Nithin, et al.
Veröffentlicht: (2025)
von: Somasekharan, Nithin, et al.
Veröffentlicht: (2025)
Role-Play Zero-Shot Prompting with Large Language Models for Open-Domain Human-Machine Conversation
von: Njifenjou, Ahmed, et al.
Veröffentlicht: (2024)
von: Njifenjou, Ahmed, et al.
Veröffentlicht: (2024)
Large Language Models as Misleading Assistants in Conversation
von: Hou, Betty Li, et al.
Veröffentlicht: (2024)
von: Hou, Betty Li, et al.
Veröffentlicht: (2024)
Beyond Correctness: Benchmarking Multi-dimensional Code Generation for Large Language Models
von: Zheng, Jiasheng, et al.
Veröffentlicht: (2024)
von: Zheng, Jiasheng, et al.
Veröffentlicht: (2024)
Large Language Models in the Clinic: A Comprehensive Benchmark
von: Liu, Fenglin, et al.
Veröffentlicht: (2024)
von: Liu, Fenglin, et al.
Veröffentlicht: (2024)
Codenames as a Benchmark for Large Language Models
von: Stephenson, Matthew, et al.
Veröffentlicht: (2024)
von: Stephenson, Matthew, et al.
Veröffentlicht: (2024)
Benchmarking Distributional Alignment of Large Language Models
von: Meister, Nicole, et al.
Veröffentlicht: (2024)
von: Meister, Nicole, et al.
Veröffentlicht: (2024)
Large Language Model Benchmarks in Medical Tasks
von: Yan, Lawrence K. Q., et al.
Veröffentlicht: (2024)
von: Yan, Lawrence K. Q., et al.
Veröffentlicht: (2024)
Cross-Lingual Conversational Speech Summarization with Large Language Models
von: Nelson, Max, et al.
Veröffentlicht: (2024)
von: Nelson, Max, et al.
Veröffentlicht: (2024)
Benchmarking the Pedagogical Knowledge of Large Language Models
von: Lelièvre, Maxime, et al.
Veröffentlicht: (2025)
von: Lelièvre, Maxime, et al.
Veröffentlicht: (2025)
BELL: Benchmarking the Explainability of Large Language Models
von: Ahmed, Syed Quiser, et al.
Veröffentlicht: (2025)
von: Ahmed, Syed Quiser, et al.
Veröffentlicht: (2025)
Is There a Case for Conversation Optimized Tokenizers in Large Language Models?
von: Ferrando, Raquel, et al.
Veröffentlicht: (2025)
von: Ferrando, Raquel, et al.
Veröffentlicht: (2025)
Time Awareness in Large Language Models: Benchmarking Fact Recall Across Time
von: Herel, David, et al.
Veröffentlicht: (2024)
von: Herel, David, et al.
Veröffentlicht: (2024)
Continual Learning Using Only Large Language Model Prompting
von: Qiu, Jiabao, et al.
Veröffentlicht: (2024)
von: Qiu, Jiabao, et al.
Veröffentlicht: (2024)
Prompting Large Language Models for Supporting the Differential Diagnosis of Anemia
von: Castagnari, Elisa, et al.
Veröffentlicht: (2024)
von: Castagnari, Elisa, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Benchmarking Prompt Sensitivity in Large Language Models
von: Razavi, Amirhossein, et al.
Veröffentlicht: (2025) -
Benchmarking Large Language Models on Multiple Tasks in Bioinformatics NLP with Prompting
von: Jiang, Jiyue, et al.
Veröffentlicht: (2025) -
Strategic Prompting for Conversational Tasks: A Comparative Analysis of Large Language Models Across Diverse Conversational Tasks
von: Joshi, Ratnesh Kumar, et al.
Veröffentlicht: (2024) -
Beyond Facts: Benchmarking Distributional Reading Comprehension in Large Language Models
von: Guo, Pei-Fu, et al.
Veröffentlicht: (2026) -
Dynamic Compressing Prompts for Efficient Inference of Large Language Models
von: Hu, Jinwu, et al.
Veröffentlicht: (2025)