Salvato in:
| Autori principali: | Zhou, Yi, Shbita, Basel |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2603.17067 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Adaptive Decoding via Test-Time Policy Learning for Self-Improving Generation
di: Bhardwaj, Asmita, et al.
Pubblicazione: (2026)
di: Bhardwaj, Asmita, et al.
Pubblicazione: (2026)
WikiVQABench: A Knowledge-Grounded Visual Question Answering Benchmark from Wikipedia and Wikidata
di: Shbita, Basel, et al.
Pubblicazione: (2026)
di: Shbita, Basel, et al.
Pubblicazione: (2026)
Empirical Evaluation of Public HateSpeech Datasets
di: Jaf, Sadar, et al.
Pubblicazione: (2024)
di: Jaf, Sadar, et al.
Pubblicazione: (2024)
MermaidSeqBench: An Evaluation Benchmark for NL-to-Mermaid Sequence Diagram Generation
di: Shbita, Basel, et al.
Pubblicazione: (2025)
di: Shbita, Basel, et al.
Pubblicazione: (2025)
LLMON: An LLM-native Markup Language to Leverage Structure and Semantics at the LLM Interface
di: Hind, Michael, et al.
Pubblicazione: (2026)
di: Hind, Michael, et al.
Pubblicazione: (2026)
Large Language Models as User-Agents for Evaluating Task-Oriented-Dialogue Systems
di: Kazi, Taaha, et al.
Pubblicazione: (2024)
di: Kazi, Taaha, et al.
Pubblicazione: (2024)
Evaluating Large Language Models for Abstract Evaluation Tasks: An Empirical Study
di: Liu, Yinuo, et al.
Pubblicazione: (2026)
di: Liu, Yinuo, et al.
Pubblicazione: (2026)
OneShield -- the Next Generation of LLM Guardrails
di: DeLuca, Chad, et al.
Pubblicazione: (2025)
di: DeLuca, Chad, et al.
Pubblicazione: (2025)
Evaluating Large Language Models for Real-World Engineering Tasks
di: Heesch, Rene, et al.
Pubblicazione: (2025)
di: Heesch, Rene, et al.
Pubblicazione: (2025)
MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks
di: Bedi, Suhana, et al.
Pubblicazione: (2025)
di: Bedi, Suhana, et al.
Pubblicazione: (2025)
EvalLM: Interactive Evaluation of Large Language Model Prompts on User-Defined Criteria
di: Kim, Tae Soo, et al.
Pubblicazione: (2023)
di: Kim, Tae Soo, et al.
Pubblicazione: (2023)
Mathify: Evaluating Large Language Models on Mathematical Problem Solving Tasks
di: Anand, Avinash, et al.
Pubblicazione: (2024)
di: Anand, Avinash, et al.
Pubblicazione: (2024)
Defining and Evaluating Decision and Composite Risk in Language Models Applied to Natural Language Inference
di: Shen, Ke, et al.
Pubblicazione: (2024)
di: Shen, Ke, et al.
Pubblicazione: (2024)
Using Counterfactual Tasks to Evaluate the Generality of Analogical Reasoning in Large Language Models
di: Lewis, Martha, et al.
Pubblicazione: (2024)
di: Lewis, Martha, et al.
Pubblicazione: (2024)
Eliciting Causal Abilities in Large Language Models for Reasoning Tasks
di: Wang, Yajing, et al.
Pubblicazione: (2024)
di: Wang, Yajing, et al.
Pubblicazione: (2024)
TLoRA: Task-aware Low Rank Adaptation of Large Language Models
di: Lin, Weicheng, et al.
Pubblicazione: (2026)
di: Lin, Weicheng, et al.
Pubblicazione: (2026)
A Survey on Evaluation of Large Language Models
di: Chang, Yupeng, et al.
Pubblicazione: (2023)
di: Chang, Yupeng, et al.
Pubblicazione: (2023)
TaskBench: Benchmarking Large Language Models for Task Automation
di: Shen, Yongliang, et al.
Pubblicazione: (2023)
di: Shen, Yongliang, et al.
Pubblicazione: (2023)
A Comprehensive Evaluation of Large Language Models on Benchmark Biomedical Text Processing Tasks
di: Jahan, Israt, et al.
Pubblicazione: (2023)
di: Jahan, Israt, et al.
Pubblicazione: (2023)
Evaluation of Large Language Models for Summarization Tasks in the Medical Domain: A Narrative Review
di: Croxford, Emma, et al.
Pubblicazione: (2024)
di: Croxford, Emma, et al.
Pubblicazione: (2024)
An Evaluation of Large Language Models on Text Summarization Tasks Using Prompt Engineering Techniques
di: Aly, Walid Mohamed, et al.
Pubblicazione: (2025)
di: Aly, Walid Mohamed, et al.
Pubblicazione: (2025)
ML-Bench: Evaluating Large Language Models and Agents for Machine Learning Tasks on Repository-Level Code
di: Tang, Xiangru, et al.
Pubblicazione: (2023)
di: Tang, Xiangru, et al.
Pubblicazione: (2023)
Evaluating the Performance of Large Language Models on GAOKAO Benchmark
di: Zhang, Xiaotian, et al.
Pubblicazione: (2023)
di: Zhang, Xiaotian, et al.
Pubblicazione: (2023)
Large Language Model Benchmarks in Medical Tasks
di: Yan, Lawrence K. Q., et al.
Pubblicazione: (2024)
di: Yan, Lawrence K. Q., et al.
Pubblicazione: (2024)
THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering
di: Patel, Udita, et al.
Pubblicazione: (2025)
di: Patel, Udita, et al.
Pubblicazione: (2025)
CityBench: Evaluating the Capabilities of Large Language Models for Urban Tasks
di: Feng, Jie, et al.
Pubblicazione: (2024)
di: Feng, Jie, et al.
Pubblicazione: (2024)
DyVal: Dynamic Evaluation of Large Language Models for Reasoning Tasks
di: Zhu, Kaijie, et al.
Pubblicazione: (2023)
di: Zhu, Kaijie, et al.
Pubblicazione: (2023)
Impact of Task Phrasing on Presumptions in Large Language Models
di: Ong, Kenneth J. K.
Pubblicazione: (2026)
di: Ong, Kenneth J. K.
Pubblicazione: (2026)
Reasoning Capabilities of Large Language Models on Dynamic Tasks
di: Wong, Annie, et al.
Pubblicazione: (2025)
di: Wong, Annie, et al.
Pubblicazione: (2025)
Task-Aligned Tool Recommendation for Large Language Models
di: Gao, Hang, et al.
Pubblicazione: (2024)
di: Gao, Hang, et al.
Pubblicazione: (2024)
BenHalluEval: A Multi-Task Hallucination Evaluation Framework for Large Language Models on Bengali
di: Adib, Shefayat E Shams, et al.
Pubblicazione: (2026)
di: Adib, Shefayat E Shams, et al.
Pubblicazione: (2026)
Evaluating Uncertainty Quantification Methods in Argumentative Large Language Models
di: Zhou, Kevin, et al.
Pubblicazione: (2025)
di: Zhou, Kevin, et al.
Pubblicazione: (2025)
General365: Benchmarking General Reasoning in Large Language Models Across Diverse and Challenging Tasks
di: Liu, Junlin, et al.
Pubblicazione: (2026)
di: Liu, Junlin, et al.
Pubblicazione: (2026)
EmotionQueen: A Benchmark for Evaluating Empathy of Large Language Models
di: Chen, Yuyan, et al.
Pubblicazione: (2024)
di: Chen, Yuyan, et al.
Pubblicazione: (2024)
Evaluating Prompting Strategies and Large Language Models in Systematic Literature Review Screening: Relevance and Task-Stage Classification
di: Han, Binglan, et al.
Pubblicazione: (2025)
di: Han, Binglan, et al.
Pubblicazione: (2025)
Prompting Science Report 3: I'll pay you or I'll kill you -- but will you care?
di: Meincke, Lennart, et al.
Pubblicazione: (2025)
di: Meincke, Lennart, et al.
Pubblicazione: (2025)
Quantized Large Language Models in Biomedical Natural Language Processing: Evaluation and Recommendation
di: Zhan, Zaifu, et al.
Pubblicazione: (2025)
di: Zhan, Zaifu, et al.
Pubblicazione: (2025)
Perspective Transition of Large Language Models for Solving Subjective Tasks
di: Wang, Xiaolong, et al.
Pubblicazione: (2025)
di: Wang, Xiaolong, et al.
Pubblicazione: (2025)
Characterizing Large Language Models as Rationalizers of Knowledge-intensive Tasks
di: Mishra, Aditi, et al.
Pubblicazione: (2023)
di: Mishra, Aditi, et al.
Pubblicazione: (2023)
Language Models can Evaluate Themselves via Probability Discrepancy
di: Xia, Tingyu, et al.
Pubblicazione: (2024)
di: Xia, Tingyu, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Adaptive Decoding via Test-Time Policy Learning for Self-Improving Generation
di: Bhardwaj, Asmita, et al.
Pubblicazione: (2026) -
WikiVQABench: A Knowledge-Grounded Visual Question Answering Benchmark from Wikipedia and Wikidata
di: Shbita, Basel, et al.
Pubblicazione: (2026) -
Empirical Evaluation of Public HateSpeech Datasets
di: Jaf, Sadar, et al.
Pubblicazione: (2024) -
MermaidSeqBench: An Evaluation Benchmark for NL-to-Mermaid Sequence Diagram Generation
di: Shbita, Basel, et al.
Pubblicazione: (2025) -
LLMON: An LLM-native Markup Language to Leverage Structure and Semantics at the LLM Interface
di: Hind, Michael, et al.
Pubblicazione: (2026)