Measuring short-form factuality in large language models
Fuente:
arXiv
Saved in:
| Main Authors: | Wei, Jason, Karina, Nguyen, Chung, Hyung Won, Jiao, Yunxin Joy, Papay, Spencer, Glaese, Amelia, Schulman, John, Fedus, William |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents
by: Wei, Jason, et al.
Published: (2025)
by: Wei, Jason, et al.
Published: (2025)
Long-form factuality in large language models
by: Wei, Jerry, et al.
Published: (2024)
by: Wei, Jerry, et al.
Published: (2024)
Collaborative decoding of critical tokens for boosting factuality of large language models
by: Jin, Lifeng, et al.
Published: (2024)
by: Jin, Lifeng, et al.
Published: (2024)
Markov Chain Monte Carlo Effective Range Analysis of Low-Energy Electron Elastic Scattering from Xenon
by: Kamil Fedus
Published: (2016)
by: Kamil Fedus
Published: (2016)
Electron Scattering from Neon Via Effective Range Theory
by: Kamil Fedus
Published: (2014)
by: Kamil Fedus
Published: (2014)
VERISCORE: Evaluating the factuality of verifiable claims in long-form text generation
by: Song, Yixiao, et al.
Published: (2024)
by: Song, Yixiao, et al.
Published: (2024)
VeriFastScore: Speeding up long-form factuality evaluation
by: Rajendhran, Rishanth, et al.
Published: (2025)
by: Rajendhran, Rishanth, et al.
Published: (2025)
Human-interpretable clustering of short-text using large language models
by: Miller, Justin K., et al.
Published: (2024)
by: Miller, Justin K., et al.
Published: (2024)
MLRIP: Pre-training a military language representation model with informative factual knowledge and professional knowledge base
by: Li, Hui, et al.
Published: (2022)
by: Li, Hui, et al.
Published: (2022)
Deliberative Alignment: Reasoning Enables Safer Language Models
by: Guan, Melody Y., et al.
Published: (2024)
by: Guan, Melody Y., et al.
Published: (2024)
Training LLMs for Honesty via Confessions
by: Joglekar, Manas, et al.
Published: (2025)
by: Joglekar, Manas, et al.
Published: (2025)
Case-based Explainability for Random Forest: Prototypes, Critics, Counter-factuals and Semi-factuals
by: Yampolsky, Gregory, et al.
Published: (2024)
by: Yampolsky, Gregory, et al.
Published: (2024)
Tophaceous Gout
by: Yunxin Liu, et al.
Published: (2025)
by: Yunxin Liu, et al.
Published: (2025)
Strategies for political-statement segmentation and labelling in unstructured text
by: Nikolaev, Dmitry, et al.
Published: (2025)
by: Nikolaev, Dmitry, et al.
Published: (2025)
Assay2Mol: large language model-based drug design using BioAssay context
by: Deng, Yifan, et al.
Published: (2025)
by: Deng, Yifan, et al.
Published: (2025)
From RAGs to rich parameters: Probing how language models utilize external knowledge over parametric information for factual queries
by: Wadhwa, Hitesh, et al.
Published: (2024)
by: Wadhwa, Hitesh, et al.
Published: (2024)
Causal Discovery under Latent Class Confounding
by: Mazaheri, Bijan, et al.
Published: (2023)
by: Mazaheri, Bijan, et al.
Published: (2023)
A large-scale evaluation of commonsense knowledge in humans and large language models
by: Nguyen, Tuan Dung, et al.
Published: (2025)
by: Nguyen, Tuan Dung, et al.
Published: (2025)
Global risk management: The role of collective cognition in response to COVID‐19. By LouiseComfort, Mary LeeRhodes, New York and London: Routledge. 2022. pp. 291. ISBN: 978‐1‐032‐18182‐0
by: Paul Schulman
Published: (2024)
by: Paul Schulman
Published: (2024)
A Look Inside Those Shiny Covers: Mass-Market Children's Books.
by: Schulman, Janet
Published: (1982)
by: Schulman, Janet
Published: (1982)
A suggested reorganization of the Florida marine fisheries laws
by: Schulman, M.
Published: (1953)
by: Schulman, M.
Published: (1953)
Retrieval augmentation of large language models for lay language generation
by: Guo, Yue, et al.
Published: (2022)
by: Guo, Yue, et al.
Published: (2022)
Quantifying perturbation impacts for large language models
by: Rauba, Paulius, et al.
Published: (2024)
by: Rauba, Paulius, et al.
Published: (2024)
Stealth edits to large language models
by: Sutton, Oliver J., et al.
Published: (2024)
by: Sutton, Oliver J., et al.
Published: (2024)
Dissociating language and thought in large language models
by: Mahowald, Kyle, et al.
Published: (2023)
by: Mahowald, Kyle, et al.
Published: (2023)
Validating the Chinese version of short‐form foreign language classroom anxiety scale
by: Yaxin Dong, et al.
Published: (2024)
by: Yaxin Dong, et al.
Published: (2024)
Professor Américo: ultrapassar a história factual
by: Norberto Dallabrida
Published: (2011)
by: Norberto Dallabrida
Published: (2011)
Representation in large language models
by: Yetman, Cameron
Published: (2025)
by: Yetman, Cameron
Published: (2025)
AI-AI Bias: large language models favor communications generated by large language models
by: Laurito, Walter, et al.
Published: (2024)
by: Laurito, Walter, et al.
Published: (2024)
(Table S2) First order shipboard age model of IODP Site 321-U1338
by: Drury, Anna Joy, et al.
Published: (2016)
by: Drury, Anna Joy, et al.
Published: (2016)
Genesis del modernismo : Marti, Najera, Silva, Casal / por Iv n A. Schulman
by: Schulman, Iván A
Published: (1968)
by: Schulman, Iván A
Published: (1968)
Génesis del modernismo ; Martí, N jera, Silva, Casal / Iv n A. Schulman
by: Schulman, Iván A
by: Schulman, Iván A
B-score: Detecting biases in large language models using response history
by: Vo, An, et al.
Published: (2025)
by: Vo, An, et al.
Published: (2025)
Are Humans as Brittle as Large Language Models?
by: Li, Jiahui, et al.
Published: (2025)
by: Li, Jiahui, et al.
Published: (2025)
Efficient Language Modeling for Low-Resource Settings with Hybrid RNN-Transformer Architectures
by: Lindenmaier, Gabriel, et al.
Published: (2025)
by: Lindenmaier, Gabriel, et al.
Published: (2025)
Actor Identification in Discourse: A Challenge for LLMs?
by: Barić, Ana, et al.
Published: (2024)
by: Barić, Ana, et al.
Published: (2024)
Regular-pattern-sensitive CRFs for Distant Label Interactions
by: Papay, Sean, et al.
Published: (2024)
by: Papay, Sean, et al.
Published: (2024)
Can a large language model be a gaslighter?
by: Li, Wei, et al.
Published: (2024)
by: Li, Wei, et al.
Published: (2024)
Measuring text summarization factuality using atomic facts entailment metrics in the context of retrieval augmented generation
by: Kriman, N. E.
Published: (2024)
by: Kriman, N. E.
Published: (2024)
Using large language models to automate summarization of CT simulation orders in radiation oncology
by: Meiyun Cao, et al.
Published: (2025)
by: Meiyun Cao, et al.
Published: (2025)
Similar Items
-
BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents
by: Wei, Jason, et al.
Published: (2025) -
Long-form factuality in large language models
by: Wei, Jerry, et al.
Published: (2024) -
Collaborative decoding of critical tokens for boosting factuality of large language models
by: Jin, Lifeng, et al.
Published: (2024) -
Markov Chain Monte Carlo Effective Range Analysis of Low-Energy Electron Elastic Scattering from Xenon
by: Kamil Fedus
Published: (2016) -
Electron Scattering from Neon Via Effective Range Theory
by: Kamil Fedus
Published: (2014)