Qworld: Question-Specific Evaluation Criteria for LLMs
Fuente:
arXiv
Saved in:
| Main Authors: | Gao, Shanghua, Su, Yuchang, Sui, Pengwei, Ginder, Curtis, Zitnik, Marinka |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
A Generative AI System for Biomedical Data Discovery with Grammar-Based Visualizations
by: Lange, Devin, et al.
Published: (2025)
by: Lange, Devin, et al.
Published: (2025)
TxAgent: An AI Agent for Therapeutic Reasoning Across a Universe of Tools
by: Gao, Shanghua, et al.
Published: (2025)
by: Gao, Shanghua, et al.
Published: (2025)
AutoScientists: Self-Organizing Agent Teams for Long-Running Scientific Experimentation
by: Gao, Shanghua, et al.
Published: (2026)
by: Gao, Shanghua, et al.
Published: (2026)
Multimodal Medical Code Tokenizer
by: Su, Xiaorui, et al.
Published: (2025)
by: Su, Xiaorui, et al.
Published: (2025)
Let's Think Outside the Box: Exploring Leap-of-Thought in Large Language Models with Creative Humor Generation
by: Zhong, Shanshan, et al.
Published: (2023)
by: Zhong, Shanshan, et al.
Published: (2023)
A Causality-aware Paradigm for Evaluating Creativity of Multimodal Large Language Models
by: Huang, Zhongzhan, et al.
Published: (2025)
by: Huang, Zhongzhan, et al.
Published: (2025)
YAC: Bridging Natural Language and Interactive Visual Exploration with Generative AI for Biomedical Data Discovery
by: Lange, Devin, et al.
Published: (2025)
by: Lange, Devin, et al.
Published: (2025)
Ken Utilization Layer: Hebbian Replay Within a Student's Ken for Adaptive Exercise Recommendation
by: Kuling, Grey, et al.
Published: (2025)
by: Kuling, Grey, et al.
Published: (2025)
KGARevion: An AI Agent for Knowledge-Intensive Biomedical QA
by: Su, Xiaorui, et al.
Published: (2024)
by: Su, Xiaorui, et al.
Published: (2024)
UniTS: A Unified Multi-Task Time Series Model
by: Gao, Shanghua, et al.
Published: (2024)
by: Gao, Shanghua, et al.
Published: (2024)
MoExtend: Tuning New Experts for Modality and Task Extension
by: Zhong, Shanshan, et al.
Published: (2024)
by: Zhong, Shanshan, et al.
Published: (2024)
TALEC: Teach Your LLM to Evaluate in Specific Domain with In-house Criteria by Criteria Division and Zero-shot Plus Few-shot
by: Zhang, Kaiqi, et al.
Published: (2024)
by: Zhang, Kaiqi, et al.
Published: (2024)
Conversation for Non-verifiable Learning: Self-Evolving LLMs through Meta-Evaluation
by: Sui, Yuan, et al.
Published: (2026)
by: Sui, Yuan, et al.
Published: (2026)
Democratizing AI scientists using ToolUniverse
by: Gao, Shanghua, et al.
Published: (2025)
by: Gao, Shanghua, et al.
Published: (2025)
From Answers to Questions: EQGBench for Evaluating LLMs' Educational Question Generation
by: Zhou, Chengliang, et al.
Published: (2025)
by: Zhou, Chengliang, et al.
Published: (2025)
Automated Generation of Challenging Multiple-Choice Questions for Vision Language Model Evaluation
by: Zhang, Yuhui, et al.
Published: (2025)
by: Zhang, Yuhui, et al.
Published: (2025)
LLMs as Function Approximators: Terminology, Taxonomy, and Questions for Evaluation
by: Schlangen, David
Published: (2024)
by: Schlangen, David
Published: (2024)
Automatic Evaluation of Healthcare LLMs Beyond Question-Answering
by: Arias-Duart, Anna, et al.
Published: (2025)
by: Arias-Duart, Anna, et al.
Published: (2025)
On the Credibility of Evaluating LLMs using Survey Questions
by: Libovický, Jindřich
Published: (2026)
by: Libovický, Jindřich
Published: (2026)
One Patient, Many Contexts: Scaling Medical AI with Contextual Intelligence
by: Li, Michelle M., et al.
Published: (2025)
by: Li, Michelle M., et al.
Published: (2025)
Unveiling the Lexical Sensitivity of LLMs: Combinatorial Optimization for Prompt Enhancement
by: Zhan, Pengwei, et al.
Published: (2024)
by: Zhan, Pengwei, et al.
Published: (2024)
Evaluating and Enhancing LLMs for Multi-turn Text-to-SQL with Multiple Question Types
by: Guo, Ziming, et al.
Published: (2024)
by: Guo, Ziming, et al.
Published: (2024)
Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies
by: Li, Kevin, et al.
Published: (2025)
by: Li, Kevin, et al.
Published: (2025)
From Guidelines to Guarantees: A Graph-Based Evaluation Harness for Domain-Specific Evaluation of LLMs
by: Lundin, Jessica M., et al.
Published: (2025)
by: Lundin, Jessica M., et al.
Published: (2025)
Benchmarking LLMs' Mathematical Reasoning with Unseen Random Variables Questions
by: Hong, Zijin, et al.
Published: (2025)
by: Hong, Zijin, et al.
Published: (2025)
Evaluating Relational Reasoning in LLMs with REL
by: Fesser, Lukas, et al.
Published: (2026)
by: Fesser, Lukas, et al.
Published: (2026)
QPaug: Question and Passage Augmentation for Open-Domain Question Answering of LLMs
by: Kim, Minsang, et al.
Published: (2024)
by: Kim, Minsang, et al.
Published: (2024)
QuestA: Expanding Reasoning Capacity in LLMs via Question Augmentation
by: Li, Jiazheng, et al.
Published: (2025)
by: Li, Jiazheng, et al.
Published: (2025)
Can LLMs Ask Good Questions?
by: Zhang, Yueheng, et al.
Published: (2025)
by: Zhang, Yueheng, et al.
Published: (2025)
Bring Your Own Prompts: Use-Case-Specific Bias and Fairness Evaluation for LLMs
by: Bouchard, Dylan
Published: (2024)
by: Bouchard, Dylan
Published: (2024)
All-in-One Tuning and Structural Pruning for Domain-Specific LLMs
by: Lu, Lei, et al.
Published: (2024)
by: Lu, Lei, et al.
Published: (2024)
Revisiting NLI: Towards Cost-Effective and Human-Aligned Metrics for Evaluating LLMs in Question Answering
by: Balamurali, Sai Shridhar, et al.
Published: (2025)
by: Balamurali, Sai Shridhar, et al.
Published: (2025)
KG-FPQ: Evaluating Factuality Hallucination in LLMs with Knowledge Graph-based False Premise Questions
by: Zhu, Yanxu, et al.
Published: (2024)
by: Zhu, Yanxu, et al.
Published: (2024)
MedEthicsQA: A Comprehensive Question Answering Benchmark for Medical Ethics Evaluation of LLMs
by: Wei, Jianhui, et al.
Published: (2025)
by: Wei, Jianhui, et al.
Published: (2025)
Assessing the Capability of LLMs in Solving POSCOMP Questions
by: Viegas, Cayo, et al.
Published: (2025)
by: Viegas, Cayo, et al.
Published: (2025)
When Sensors Fail: Temporal Sequence Models for Robust PPO under Sensor Drift
by: Vogt-Lowell, Kevin, et al.
Published: (2026)
by: Vogt-Lowell, Kevin, et al.
Published: (2026)
Open-LLM-Leaderboard: From Multi-choice to Open-style Questions for LLMs Evaluation, Benchmark, and Arena
by: Myrzakhan, Aidar, et al.
Published: (2024)
by: Myrzakhan, Aidar, et al.
Published: (2024)
InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training
by: Wang, Pengkai, et al.
Published: (2025)
by: Wang, Pengkai, et al.
Published: (2025)
Can Knowledge Graphs Make Large Language Models More Trustworthy? An Empirical Study Over Open-ended Question Answering
by: Sui, Yuan, et al.
Published: (2024)
by: Sui, Yuan, et al.
Published: (2024)
Automated Evaluation of Classroom Instructional Support with LLMs and BoWs: Connecting Global Predictions to Specific Feedback
by: Whitehill, Jacob, et al.
Published: (2023)
by: Whitehill, Jacob, et al.
Published: (2023)
Similar Items
-
A Generative AI System for Biomedical Data Discovery with Grammar-Based Visualizations
by: Lange, Devin, et al.
Published: (2025) -
TxAgent: An AI Agent for Therapeutic Reasoning Across a Universe of Tools
by: Gao, Shanghua, et al.
Published: (2025) -
AutoScientists: Self-Organizing Agent Teams for Long-Running Scientific Experimentation
by: Gao, Shanghua, et al.
Published: (2026) -
Multimodal Medical Code Tokenizer
by: Su, Xiaorui, et al.
Published: (2025) -
Let's Think Outside the Box: Exploring Leap-of-Thought in Large Language Models with Creative Humor Generation
by: Zhong, Shanshan, et al.
Published: (2023)