Quantifying construct validity in large language model evaluations
Fuente:
arXiv
Salvato in:
| Autore principale: | Kearns, Ryan Othniel |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LLMs Don't Know Their Own Decision Boundaries: The Unreliability of Self-Generated Counterfactual Explanations
di: Mayne, Harry, et al.
Pubblicazione: (2025)
di: Mayne, Harry, et al.
Pubblicazione: (2025)
Alignment faking in large language models
di: Greenblatt, Ryan, et al.
Pubblicazione: (2024)
di: Greenblatt, Ryan, et al.
Pubblicazione: (2024)
Mechanistic understanding and validation of large AI models with SemanticLens
di: Dreyer, Maximilian, et al.
Pubblicazione: (2025)
di: Dreyer, Maximilian, et al.
Pubblicazione: (2025)
Representation in large language models
di: Yetman, Cameron
Pubblicazione: (2025)
di: Yetman, Cameron
Pubblicazione: (2025)
Efficiency optimization of large-scale language models based on deep learning in natural language processing tasks
di: Mei, Taiyuan, et al.
Pubblicazione: (2024)
di: Mei, Taiyuan, et al.
Pubblicazione: (2024)
Long-form factuality in large language models
di: Wei, Jerry, et al.
Pubblicazione: (2024)
di: Wei, Jerry, et al.
Pubblicazione: (2024)
Can large language models explore in-context?
di: Krishnamurthy, Akshay, et al.
Pubblicazione: (2024)
di: Krishnamurthy, Akshay, et al.
Pubblicazione: (2024)
Pretraining large language models with MXFP4 on Native FP4 Hardware
di: Cim, Musa, et al.
Pubblicazione: (2026)
di: Cim, Musa, et al.
Pubblicazione: (2026)
A federated large language model for long-term time series forecasting
di: Abdel-Sater, Raed, et al.
Pubblicazione: (2024)
di: Abdel-Sater, Raed, et al.
Pubblicazione: (2024)
Large language models as uncertainty-calibrated optimizers for experimental discovery
di: Ranković, Bojana, et al.
Pubblicazione: (2025)
di: Ranković, Bojana, et al.
Pubblicazione: (2025)
AI-AI Bias: large language models favor communications generated by large language models
di: Laurito, Walter, et al.
Pubblicazione: (2024)
di: Laurito, Walter, et al.
Pubblicazione: (2024)
Comprehensive benchmarking of large language models for RNA secondary structure prediction
di: Zablocki, L. I., et al.
Pubblicazione: (2024)
di: Zablocki, L. I., et al.
Pubblicazione: (2024)
Are large language models superhuman chemists?
di: Mirza, Adrian, et al.
Pubblicazione: (2024)
di: Mirza, Adrian, et al.
Pubblicazione: (2024)
Using large language models for embodied planning introduces systematic safety risks
di: Zhang, Tao, et al.
Pubblicazione: (2026)
di: Zhang, Tao, et al.
Pubblicazione: (2026)
Safety challenges of AI in medicine in the era of large language models
di: Wang, Xiaoye, et al.
Pubblicazione: (2024)
di: Wang, Xiaoye, et al.
Pubblicazione: (2024)
Inducing anxiety in large language models can induce bias
di: Coda-Forno, Julian, et al.
Pubblicazione: (2023)
di: Coda-Forno, Julian, et al.
Pubblicazione: (2023)
Post-training makes large language models less human-like
di: Binz, Marcel, et al.
Pubblicazione: (2026)
di: Binz, Marcel, et al.
Pubblicazione: (2026)
Exploring the limits of strong membership inference attacks on large language models
di: Hayes, Jamie, et al.
Pubblicazione: (2025)
di: Hayes, Jamie, et al.
Pubblicazione: (2025)
Context information can be more important than reasoning for time series forecasting with a large language model
di: Yang, Janghoon
Pubblicazione: (2025)
di: Yang, Janghoon
Pubblicazione: (2025)
Integrating remote sensing data assimilation, deep learning and large language model for interactive wheat breeding yield prediction
di: Yang, Guofeng, et al.
Pubblicazione: (2025)
di: Yang, Guofeng, et al.
Pubblicazione: (2025)
Prior-informed optimization of treatment recommendation via bandit algorithms trained on large language model-processed historical records
di: Nessari, Saman, et al.
Pubblicazione: (2025)
di: Nessari, Saman, et al.
Pubblicazione: (2025)
Benchmarking large language models for biomedical natural language processing applications and recommendations
di: Chen, Qingyu, et al.
Pubblicazione: (2023)
di: Chen, Qingyu, et al.
Pubblicazione: (2023)
Physical models realizing the transformer architecture of large language models
di: Chen, Zeqian
Pubblicazione: (2025)
di: Chen, Zeqian
Pubblicazione: (2025)
Safety and accuracy follow different scaling laws in clinical large language models
di: Wind, Sebastian, et al.
Pubblicazione: (2026)
di: Wind, Sebastian, et al.
Pubblicazione: (2026)
Benchmarking large language models for materials synthesis: the case of atomic layer deposition
di: Yanguas-Gil, Angel, et al.
Pubblicazione: (2024)
di: Yanguas-Gil, Angel, et al.
Pubblicazione: (2024)
A dataset and benchmark for hospital course summarization with adapted large language models
di: Aali, Asad, et al.
Pubblicazione: (2024)
di: Aali, Asad, et al.
Pubblicazione: (2024)
A note on the impossibility of conditional PAC-efficient reasoning in large language models
di: Zeng, Hao
Pubblicazione: (2025)
di: Zeng, Hao
Pubblicazione: (2025)
CogBench: a large language model walks into a psychology lab
di: Coda-Forno, Julian, et al.
Pubblicazione: (2024)
di: Coda-Forno, Julian, et al.
Pubblicazione: (2024)
Empirical evaluation of the Frank-Wolfe methods for constructing white-box adversarial attacks
di: Korotkova, Kristina, et al.
Pubblicazione: (2025)
di: Korotkova, Kristina, et al.
Pubblicazione: (2025)
Analogy making as amortised model construction
di: Nagy, David G., et al.
Pubblicazione: (2025)
di: Nagy, David G., et al.
Pubblicazione: (2025)
SteuerLLM: Local specialized large language model for German tax law analysis
di: Wind, Sebastian, et al.
Pubblicazione: (2026)
di: Wind, Sebastian, et al.
Pubblicazione: (2026)
Mathematics with large language models as provers and verifiers
di: Duc, Hieu Le, et al.
Pubblicazione: (2025)
di: Duc, Hieu Le, et al.
Pubblicazione: (2025)
Multi-step retrieval and reasoning improves radiology question answering with large language models
di: Wind, Sebastian, et al.
Pubblicazione: (2025)
di: Wind, Sebastian, et al.
Pubblicazione: (2025)
Beyond designer's knowledge: Generating materials design hypotheses via large language models
di: Liu, Quanliang, et al.
Pubblicazione: (2024)
di: Liu, Quanliang, et al.
Pubblicazione: (2024)
Multimodal large language model for wheat breeding: a new exploration of smart breeding
di: Yang, Guofeng, et al.
Pubblicazione: (2024)
di: Yang, Guofeng, et al.
Pubblicazione: (2024)
Pre-trained knowledge elevates large language models beyond traditional chemical reaction optimizers
di: MacKnight, Robert, et al.
Pubblicazione: (2025)
di: MacKnight, Robert, et al.
Pubblicazione: (2025)
Model Ensembling for Constrained Optimization
di: Globus-Harris, Ira, et al.
Pubblicazione: (2024)
di: Globus-Harris, Ira, et al.
Pubblicazione: (2024)
How predictable is language model benchmark performance?
di: Owen, David
Pubblicazione: (2024)
di: Owen, David
Pubblicazione: (2024)
Zero-shot data citation function classification using transformer-based large language models (LLMs)
di: Byers, Neil, et al.
Pubblicazione: (2025)
di: Byers, Neil, et al.
Pubblicazione: (2025)
Assay2Mol: large language model-based drug design using BioAssay context
di: Deng, Yifan, et al.
Pubblicazione: (2025)
di: Deng, Yifan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
LLMs Don't Know Their Own Decision Boundaries: The Unreliability of Self-Generated Counterfactual Explanations
di: Mayne, Harry, et al.
Pubblicazione: (2025) -
Alignment faking in large language models
di: Greenblatt, Ryan, et al.
Pubblicazione: (2024) -
Mechanistic understanding and validation of large AI models with SemanticLens
di: Dreyer, Maximilian, et al.
Pubblicazione: (2025) -
Representation in large language models
di: Yetman, Cameron
Pubblicazione: (2025) -
Efficiency optimization of large-scale language models based on deep learning in natural language processing tasks
di: Mei, Taiyuan, et al.
Pubblicazione: (2024)