Structured Prompts Improve Evaluation of Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Aali, Asad, Mohsin, Muhammad Ahmed, Bikia, Vasiliki, Singhvi, Arnav, Gaus, Richard, Bedi, Suhana, Cui, Hejie, Fuentes, Miguel, Unell, Alyssa, Mai, Yifan, Cahoon, Jordan, Pfeffer, Michael, Daneshjou, Roxana, Koyejo, Sanmi, Alsentzer, Emily, Potts, Christopher, Shah, Nigam H., Chaudhari, Akshay S. |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Prompt Triage: Structured Optimization Enhances Vision-Language Model Performance on Medical Imaging Benchmarks
by: Singhvi, Arnav, et al.
Published: (2025)
by: Singhvi, Arnav, et al.
Published: (2025)
TIMER: Temporal Instruction Modeling and Evaluation for Longitudinal Clinical Records
by: Cui, Hejie, et al.
Published: (2025)
by: Cui, Hejie, et al.
Published: (2025)
The Optimization Paradox in Clinical AI Multi-Agent Systems
by: Bedi, Suhana, et al.
Published: (2025)
by: Bedi, Suhana, et al.
Published: (2025)
Quantifying and Mitigating Premature Closure in Frontier LLMs
by: Handler, Rebecca, et al.
Published: (2026)
by: Handler, Rebecca, et al.
Published: (2026)
Attention Head Entropy of LLMs Predicts Answer Correctness
by: Ostmeier, Sophie, et al.
Published: (2026)
by: Ostmeier, Sophie, et al.
Published: (2026)
MedVAL: Toward Expert-Level Medical Text Validation with Language Models
by: Aali, Asad, et al.
Published: (2025)
by: Aali, Asad, et al.
Published: (2025)
ZIP-FIT: Embedding-Free Data Selection via Compression-Based Alignment
by: Obbad, Elyas, et al.
Published: (2024)
by: Obbad, Elyas, et al.
Published: (2024)
Context Clues: Evaluating Long Context Models for Clinical Prediction Tasks on EHRs
by: Wornow, Michael, et al.
Published: (2024)
by: Wornow, Michael, et al.
Published: (2024)
Clinical Note Bloat Reduction for Efficient LLM Use
by: Cahoon, Jordan L., et al.
Published: (2026)
by: Cahoon, Jordan L., et al.
Published: (2026)
Distilling Large Language Models for Efficient Clinical Information Extraction
by: Vedula, Karthik S., et al.
Published: (2024)
by: Vedula, Karthik S., et al.
Published: (2024)
SycEval: Evaluating LLM Sycophancy
by: Fanous, Aaron, et al.
Published: (2025)
by: Fanous, Aaron, et al.
Published: (2025)
Measurement to Meaning: A Validity-Centered Framework for AI Evaluation
by: Salaudeen, Olawale, et al.
Published: (2025)
by: Salaudeen, Olawale, et al.
Published: (2025)
HealthAdminBench: Evaluating Computer-Use Agents on Healthcare Administration Tasks
by: Bedi, Suhana, et al.
Published: (2026)
by: Bedi, Suhana, et al.
Published: (2026)
Causally Inspired Regularization Enables Domain General Representations
by: Salaudeen, Olawale, et al.
Published: (2024)
by: Salaudeen, Olawale, et al.
Published: (2024)
Let's Measure Information Step-by-Step: AI-Based Evaluation Beyond Vibes
by: Robertson, Zachary, et al.
Published: (2025)
by: Robertson, Zachary, et al.
Published: (2025)
CURE: Cultural Understanding and Reasoning Evaluation - A Framework for "Thick" Culture Alignment Evaluation in LLMs
by: Vo, Truong, et al.
Published: (2025)
by: Vo, Truong, et al.
Published: (2025)
Training-Free Adaptation of New-Generation LLMs using Legacy Clinical Models
by: Ronaghi, Sasha, et al.
Published: (2026)
by: Ronaghi, Sasha, et al.
Published: (2026)
A Framework for Objective-Driven Dynamical Stochastic Fields
by: Zhang, Yibo Jacky, et al.
Published: (2025)
by: Zhang, Yibo Jacky, et al.
Published: (2025)
Splitwiser: Efficient LM inference with constrained resources
by: Aali, Asad, et al.
Published: (2025)
by: Aali, Asad, et al.
Published: (2025)
In-Context Learning of Energy Functions
by: Schaeffer, Rylan, et al.
Published: (2024)
by: Schaeffer, Rylan, et al.
Published: (2024)
Discovering Implicit Large Language Model Alignment Objectives
by: Chen, Edward, et al.
Published: (2026)
by: Chen, Edward, et al.
Published: (2026)
High-Dimensional Markov-switching Ordinary Differential Processes
by: Tsai, Katherine, et al.
Published: (2024)
by: Tsai, Katherine, et al.
Published: (2024)
Distributional Machine Unlearning via Selective Data Removal
by: Allouah, Youssef, et al.
Published: (2025)
by: Allouah, Youssef, et al.
Published: (2025)
SCENEBench: An Audio Understanding Benchmark Grounded in Assistive and Industrial Use Cases
by: Iyer, Laya, et al.
Published: (2026)
by: Iyer, Laya, et al.
Published: (2026)
HiFA: High-fidelity Text-to-3D Generation with Advanced Diffusion Guidance
by: Zhu, Junzhe, et al.
Published: (2023)
by: Zhu, Junzhe, et al.
Published: (2023)
meds_reader: A fast and efficient EHR processing library
by: Steinberg, Ethan, et al.
Published: (2024)
by: Steinberg, Ethan, et al.
Published: (2024)
A Systematic Analysis of Declining Medical Safety Messaging in Generative AI Models
by: Sharma, Sonali, et al.
Published: (2025)
by: Sharma, Sonali, et al.
Published: (2025)
DSPy Assertions: Computational Constraints for Self-Refining Language Model Pipelines
by: Singhvi, Arnav, et al.
Published: (2023)
by: Singhvi, Arnav, et al.
Published: (2023)
Automated detection of underdiagnosed medical conditions via opportunistic imaging
by: Aali, Asad, et al.
Published: (2024)
by: Aali, Asad, et al.
Published: (2024)
Reasoning Models Don't Just Think Longer, They Move Differently
by: Gjølbye, Anders, et al.
Published: (2026)
by: Gjølbye, Anders, et al.
Published: (2026)
Is Backpropagation Optimal? When Synthetic Gradients Improve Sample Efficiency
by: Zhang, Yibo Jacky, et al.
Published: (2026)
by: Zhang, Yibo Jacky, et al.
Published: (2026)
The Inadequacy of Offline LLM Evaluations: A Need to Account for Personalization in Model Behavior
by: Wang, Angelina, et al.
Published: (2025)
by: Wang, Angelina, et al.
Published: (2025)
Principled Federated Domain Adaptation: Gradient Projection and Auto-Weighting
by: Jiang, Enyi, et al.
Published: (2023)
by: Jiang, Enyi, et al.
Published: (2023)
Best Practices for Large Language Models in Radiology
by: Bluethgen, Christian, et al.
Published: (2024)
by: Bluethgen, Christian, et al.
Published: (2024)
ResearchBox 1802, 'Deep learning-aided decision support for diagnosis', https://researchbox.org/1802
by: Matt Groh, et al.
Published: (2023)
by: Matt Groh, et al.
Published: (2023)
BiasICL: In-Context Learning and Demographic Biases of Vision Language Models
by: Xu, Sonnet, et al.
Published: (2025)
by: Xu, Sonnet, et al.
Published: (2025)
Entanglement Entropy of Yukawa-Coupled Fields Across a Rindler Horizon
by: Kulkarni, Akshay, et al.
Published: (2026)
by: Kulkarni, Akshay, et al.
Published: (2026)
Entanglement Entropy for Screened Interactions via Dimensional Mapping to Harmonic Oscillators
by: Kulkarni, Akshay, et al.
Published: (2026)
by: Kulkarni, Akshay, et al.
Published: (2026)
Fast and Accurate Inverse Blood Flow Modeling from Minimal Cuff-Pressure Data via PINNs
by: Anagnostopoulos, Sokratis J., et al.
Published: (2026)
by: Anagnostopoulos, Sokratis J., et al.
Published: (2026)
Compositional Neuro-Symbolic Reasoning
by: Das, Anugyan, et al.
Published: (2026)
by: Das, Anugyan, et al.
Published: (2026)
Similar Items
-
Prompt Triage: Structured Optimization Enhances Vision-Language Model Performance on Medical Imaging Benchmarks
by: Singhvi, Arnav, et al.
Published: (2025) -
TIMER: Temporal Instruction Modeling and Evaluation for Longitudinal Clinical Records
by: Cui, Hejie, et al.
Published: (2025) -
The Optimization Paradox in Clinical AI Multi-Agent Systems
by: Bedi, Suhana, et al.
Published: (2025) -
Quantifying and Mitigating Premature Closure in Frontier LLMs
by: Handler, Rebecca, et al.
Published: (2026) -
Attention Head Entropy of LLMs Predicts Answer Correctness
by: Ostmeier, Sophie, et al.
Published: (2026)