Evaluating Ill-Defined Tasks in Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhou, Yi, Shbita, Basel |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Adaptive Decoding via Test-Time Policy Learning for Self-Improving Generation
von: Bhardwaj, Asmita, et al.
Veröffentlicht: (2026)
von: Bhardwaj, Asmita, et al.
Veröffentlicht: (2026)
Empirical Evaluation of Public HateSpeech Datasets
von: Jaf, Sadar, et al.
Veröffentlicht: (2024)
von: Jaf, Sadar, et al.
Veröffentlicht: (2024)
WikiVQABench: A Knowledge-Grounded Visual Question Answering Benchmark from Wikipedia and Wikidata
von: Shbita, Basel, et al.
Veröffentlicht: (2026)
von: Shbita, Basel, et al.
Veröffentlicht: (2026)
Large Language Models as User-Agents for Evaluating Task-Oriented-Dialogue Systems
von: Kazi, Taaha, et al.
Veröffentlicht: (2024)
von: Kazi, Taaha, et al.
Veröffentlicht: (2024)
Evaluating Large Language Models for Abstract Evaluation Tasks: An Empirical Study
von: Liu, Yinuo, et al.
Veröffentlicht: (2026)
von: Liu, Yinuo, et al.
Veröffentlicht: (2026)
Evaluating Large Language Models for Real-World Engineering Tasks
von: Heesch, Rene, et al.
Veröffentlicht: (2025)
von: Heesch, Rene, et al.
Veröffentlicht: (2025)
MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks
von: Bedi, Suhana, et al.
Veröffentlicht: (2025)
von: Bedi, Suhana, et al.
Veröffentlicht: (2025)
Mathify: Evaluating Large Language Models on Mathematical Problem Solving Tasks
von: Anand, Avinash, et al.
Veröffentlicht: (2024)
von: Anand, Avinash, et al.
Veröffentlicht: (2024)
MermaidSeqBench: An Evaluation Benchmark for NL-to-Mermaid Sequence Diagram Generation
von: Shbita, Basel, et al.
Veröffentlicht: (2025)
von: Shbita, Basel, et al.
Veröffentlicht: (2025)
Defining and Evaluating Decision and Composite Risk in Language Models Applied to Natural Language Inference
von: Shen, Ke, et al.
Veröffentlicht: (2024)
von: Shen, Ke, et al.
Veröffentlicht: (2024)
EvalLM: Interactive Evaluation of Large Language Model Prompts on User-Defined Criteria
von: Kim, Tae Soo, et al.
Veröffentlicht: (2023)
von: Kim, Tae Soo, et al.
Veröffentlicht: (2023)
Using Counterfactual Tasks to Evaluate the Generality of Analogical Reasoning in Large Language Models
von: Lewis, Martha, et al.
Veröffentlicht: (2024)
von: Lewis, Martha, et al.
Veröffentlicht: (2024)
Eliciting Causal Abilities in Large Language Models for Reasoning Tasks
von: Wang, Yajing, et al.
Veröffentlicht: (2024)
von: Wang, Yajing, et al.
Veröffentlicht: (2024)
TLoRA: Task-aware Low Rank Adaptation of Large Language Models
von: Lin, Weicheng, et al.
Veröffentlicht: (2026)
von: Lin, Weicheng, et al.
Veröffentlicht: (2026)
TaskBench: Benchmarking Large Language Models for Task Automation
von: Shen, Yongliang, et al.
Veröffentlicht: (2023)
von: Shen, Yongliang, et al.
Veröffentlicht: (2023)
A Comprehensive Evaluation of Large Language Models on Benchmark Biomedical Text Processing Tasks
von: Jahan, Israt, et al.
Veröffentlicht: (2023)
von: Jahan, Israt, et al.
Veröffentlicht: (2023)
Evaluation of Large Language Models for Summarization Tasks in the Medical Domain: A Narrative Review
von: Croxford, Emma, et al.
Veröffentlicht: (2024)
von: Croxford, Emma, et al.
Veröffentlicht: (2024)
An Evaluation of Large Language Models on Text Summarization Tasks Using Prompt Engineering Techniques
von: Aly, Walid Mohamed, et al.
Veröffentlicht: (2025)
von: Aly, Walid Mohamed, et al.
Veröffentlicht: (2025)
A Survey on Evaluation of Large Language Models
von: Chang, Yupeng, et al.
Veröffentlicht: (2023)
von: Chang, Yupeng, et al.
Veröffentlicht: (2023)
LLMON: An LLM-native Markup Language to Leverage Structure and Semantics at the LLM Interface
von: Hind, Michael, et al.
Veröffentlicht: (2026)
von: Hind, Michael, et al.
Veröffentlicht: (2026)
ML-Bench: Evaluating Large Language Models and Agents for Machine Learning Tasks on Repository-Level Code
von: Tang, Xiangru, et al.
Veröffentlicht: (2023)
von: Tang, Xiangru, et al.
Veröffentlicht: (2023)
Evaluating the Performance of Large Language Models on GAOKAO Benchmark
von: Zhang, Xiaotian, et al.
Veröffentlicht: (2023)
von: Zhang, Xiaotian, et al.
Veröffentlicht: (2023)
Large Language Model Benchmarks in Medical Tasks
von: Yan, Lawrence K. Q., et al.
Veröffentlicht: (2024)
von: Yan, Lawrence K. Q., et al.
Veröffentlicht: (2024)
THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering
von: Patel, Udita, et al.
Veröffentlicht: (2025)
von: Patel, Udita, et al.
Veröffentlicht: (2025)
OneShield -- the Next Generation of LLM Guardrails
von: DeLuca, Chad, et al.
Veröffentlicht: (2025)
von: DeLuca, Chad, et al.
Veröffentlicht: (2025)
Impact of Task Phrasing on Presumptions in Large Language Models
von: Ong, Kenneth J. K.
Veröffentlicht: (2026)
von: Ong, Kenneth J. K.
Veröffentlicht: (2026)
BenHalluEval: A Multi-Task Hallucination Evaluation Framework for Large Language Models on Bengali
von: Adib, Shefayat E Shams, et al.
Veröffentlicht: (2026)
von: Adib, Shefayat E Shams, et al.
Veröffentlicht: (2026)
Reasoning Capabilities of Large Language Models on Dynamic Tasks
von: Wong, Annie, et al.
Veröffentlicht: (2025)
von: Wong, Annie, et al.
Veröffentlicht: (2025)
Task-Aligned Tool Recommendation for Large Language Models
von: Gao, Hang, et al.
Veröffentlicht: (2024)
von: Gao, Hang, et al.
Veröffentlicht: (2024)
CityBench: Evaluating the Capabilities of Large Language Models for Urban Tasks
von: Feng, Jie, et al.
Veröffentlicht: (2024)
von: Feng, Jie, et al.
Veröffentlicht: (2024)
DyVal: Dynamic Evaluation of Large Language Models for Reasoning Tasks
von: Zhu, Kaijie, et al.
Veröffentlicht: (2023)
von: Zhu, Kaijie, et al.
Veröffentlicht: (2023)
Evaluating Uncertainty Quantification Methods in Argumentative Large Language Models
von: Zhou, Kevin, et al.
Veröffentlicht: (2025)
von: Zhou, Kevin, et al.
Veröffentlicht: (2025)
Evaluating Prompting Strategies and Large Language Models in Systematic Literature Review Screening: Relevance and Task-Stage Classification
von: Han, Binglan, et al.
Veröffentlicht: (2025)
von: Han, Binglan, et al.
Veröffentlicht: (2025)
General365: Benchmarking General Reasoning in Large Language Models Across Diverse and Challenging Tasks
von: Liu, Junlin, et al.
Veröffentlicht: (2026)
von: Liu, Junlin, et al.
Veröffentlicht: (2026)
EmotionQueen: A Benchmark for Evaluating Empathy of Large Language Models
von: Chen, Yuyan, et al.
Veröffentlicht: (2024)
von: Chen, Yuyan, et al.
Veröffentlicht: (2024)
Perspective Transition of Large Language Models for Solving Subjective Tasks
von: Wang, Xiaolong, et al.
Veröffentlicht: (2025)
von: Wang, Xiaolong, et al.
Veröffentlicht: (2025)
Characterizing Large Language Models as Rationalizers of Knowledge-intensive Tasks
von: Mishra, Aditi, et al.
Veröffentlicht: (2023)
von: Mishra, Aditi, et al.
Veröffentlicht: (2023)
Evaluating Quantized Large Language Models
von: Li, Shiyao, et al.
Veröffentlicht: (2024)
von: Li, Shiyao, et al.
Veröffentlicht: (2024)
Quantized Large Language Models in Biomedical Natural Language Processing: Evaluation and Recommendation
von: Zhan, Zaifu, et al.
Veröffentlicht: (2025)
von: Zhan, Zaifu, et al.
Veröffentlicht: (2025)
Language Models can Evaluate Themselves via Probability Discrepancy
von: Xia, Tingyu, et al.
Veröffentlicht: (2024)
von: Xia, Tingyu, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Adaptive Decoding via Test-Time Policy Learning for Self-Improving Generation
von: Bhardwaj, Asmita, et al.
Veröffentlicht: (2026) -
Empirical Evaluation of Public HateSpeech Datasets
von: Jaf, Sadar, et al.
Veröffentlicht: (2024) -
WikiVQABench: A Knowledge-Grounded Visual Question Answering Benchmark from Wikipedia and Wikidata
von: Shbita, Basel, et al.
Veröffentlicht: (2026) -
Large Language Models as User-Agents for Evaluating Task-Oriented-Dialogue Systems
von: Kazi, Taaha, et al.
Veröffentlicht: (2024) -
Evaluating Large Language Models for Abstract Evaluation Tasks: An Empirical Study
von: Liu, Yinuo, et al.
Veröffentlicht: (2026)