Do Large Language Models Perform the Way People Expect? Measuring the Human Generalization Function
Fuente:
arXiv
Salvato in:
| Autori principali: | Vafa, Keyon, Rambachan, Ashesh, Mullainathan, Sendhil |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Evaluating the World Model Implicit in a Generative Model
di: Vafa, Keyon, et al.
Pubblicazione: (2024)
di: Vafa, Keyon, et al.
Pubblicazione: (2024)
What Has a Foundation Model Found? Using Inductive Bias to Probe for World Models
di: Vafa, Keyon, et al.
Pubblicazione: (2025)
di: Vafa, Keyon, et al.
Pubblicazione: (2025)
Potemkin Understanding in Large Language Models
di: Mancoridis, Marina, et al.
Pubblicazione: (2025)
di: Mancoridis, Marina, et al.
Pubblicazione: (2025)
Large Language Models: An Applied Econometric Framework
di: Ludwig, Jens, et al.
Pubblicazione: (2024)
di: Ludwig, Jens, et al.
Pubblicazione: (2024)
What's Producible May Not Be Reachable: Measuring the Steerability of Generative Models
di: Vafa, Keyon, et al.
Pubblicazione: (2025)
di: Vafa, Keyon, et al.
Pubblicazione: (2025)
From Predictive Algorithms to Automatic Generation of Anomalies
di: Mullainathan, Sendhil, et al.
Pubblicazione: (2024)
di: Mullainathan, Sendhil, et al.
Pubblicazione: (2024)
Language Generation in the Limit
di: Kleinberg, Jon, et al.
Pubblicazione: (2024)
di: Kleinberg, Jon, et al.
Pubblicazione: (2024)
How Do Humans Write Code? Large Models Do It the Same Way Too
di: Li, Long, et al.
Pubblicazione: (2024)
di: Li, Long, et al.
Pubblicazione: (2024)
Do Large Language Models Solve ARC Visual Analogies Like People Do?
di: Opiełka, Gustaw, et al.
Pubblicazione: (2024)
di: Opiełka, Gustaw, et al.
Pubblicazione: (2024)
Do Influence Functions Work on Large Language Models?
di: Li, Zhe, et al.
Pubblicazione: (2024)
di: Li, Zhe, et al.
Pubblicazione: (2024)
Measuring Human and AI Values Based on Generative Psychometrics with Large Language Models
di: Ye, Haoran, et al.
Pubblicazione: (2024)
di: Ye, Haoran, et al.
Pubblicazione: (2024)
Is Large Language Model Performance on Reasoning Tasks Impacted by Different Ways Questions Are Asked?
di: Song, Seok Hwan, et al.
Pubblicazione: (2025)
di: Song, Seok Hwan, et al.
Pubblicazione: (2025)
Plausibility as Commonsense Reasoning: Humans Succeed, Large Language Models Do not
di: Karakaş, Sercan
Pubblicazione: (2026)
di: Karakaş, Sercan
Pubblicazione: (2026)
LABOR-LLM: Language-Based Occupational Representations with Large Language Models
di: Athey, Susan, et al.
Pubblicazione: (2024)
di: Athey, Susan, et al.
Pubblicazione: (2024)
Contextual Feature Extraction Hierarchies Converge in Large Language Models and the Brain
di: Mischler, Gavin, et al.
Pubblicazione: (2024)
di: Mischler, Gavin, et al.
Pubblicazione: (2024)
Measuring and Benchmarking Large Language Models' Capabilities to Generate Persuasive Language
di: Pauli, Amalie Brogaard, et al.
Pubblicazione: (2024)
di: Pauli, Amalie Brogaard, et al.
Pubblicazione: (2024)
How Do Language Models Compose Functions?
di: Khandelwal, Apoorv, et al.
Pubblicazione: (2025)
di: Khandelwal, Apoorv, et al.
Pubblicazione: (2025)
Measuring Form and Function in Language Models
di: Martínez, Héctor Javier Vázquez, et al.
Pubblicazione: (2026)
di: Martínez, Héctor Javier Vázquez, et al.
Pubblicazione: (2026)
Critical Thinking: Which Kinds of Complexity Govern Optimal Reasoning Length?
di: Lee, Celine, et al.
Pubblicazione: (2025)
di: Lee, Celine, et al.
Pubblicazione: (2025)
Measuring Meaning Composition in the Human Brain with Composition Scores from Large Language Models
di: Gao, Changjiang, et al.
Pubblicazione: (2024)
di: Gao, Changjiang, et al.
Pubblicazione: (2024)
Do Large Language Models Mirror Cognitive Language Processing?
di: Ren, Yuqi, et al.
Pubblicazione: (2024)
di: Ren, Yuqi, et al.
Pubblicazione: (2024)
Evaluating Creative Short Story Generation in Humans and Large Language Models
di: Ismayilzada, Mete, et al.
Pubblicazione: (2024)
di: Ismayilzada, Mete, et al.
Pubblicazione: (2024)
The Only Way is Ethics: A Guide to Ethical Research with Large Language Models
di: Ungless, Eddie L., et al.
Pubblicazione: (2024)
di: Ungless, Eddie L., et al.
Pubblicazione: (2024)
A Comparison of Large Language Model and Human Performance on Random Number Generation Tasks
di: Harrison, Rachel M.
Pubblicazione: (2024)
di: Harrison, Rachel M.
Pubblicazione: (2024)
Do Large Language Models Possess Sensitive to Sentiment?
di: Liu, Yang, et al.
Pubblicazione: (2024)
di: Liu, Yang, et al.
Pubblicazione: (2024)
Do Large Language Models Understand Word Senses?
di: Meconi, Domenico, et al.
Pubblicazione: (2025)
di: Meconi, Domenico, et al.
Pubblicazione: (2025)
Do Large Language Models Know What They Are Capable Of?
di: Barkan, Casey O., et al.
Pubblicazione: (2025)
di: Barkan, Casey O., et al.
Pubblicazione: (2025)
Do AI Models Perform Human-like Abstract Reasoning Across Modalities?
di: Beger, Claas, et al.
Pubblicazione: (2025)
di: Beger, Claas, et al.
Pubblicazione: (2025)
ConSiDERS-The-Human Evaluation Framework: Rethinking Human Evaluation for Generative Large Language Models
di: Elangovan, Aparna, et al.
Pubblicazione: (2024)
di: Elangovan, Aparna, et al.
Pubblicazione: (2024)
SwissNYF: Tool Grounded LLM Agents for Black Box Setting
di: Kumar, Somnath Sendhil, et al.
Pubblicazione: (2024)
di: Kumar, Somnath Sendhil, et al.
Pubblicazione: (2024)
How Well Do Large Language Models Truly Ground?
di: Lee, Hyunji, et al.
Pubblicazione: (2023)
di: Lee, Hyunji, et al.
Pubblicazione: (2023)
Do Large Language Models Excel in Complex Logical Reasoning with Formal Language?
di: Jiang, Jin, et al.
Pubblicazione: (2025)
di: Jiang, Jin, et al.
Pubblicazione: (2025)
Divergent Creativity in Humans and Large Language Models
di: Bellemare-Pepin, Antoine, et al.
Pubblicazione: (2024)
di: Bellemare-Pepin, Antoine, et al.
Pubblicazione: (2024)
Measuring Pragmatic Influence in Large Language Model Instructions
di: Geng, Yilin, et al.
Pubblicazione: (2026)
di: Geng, Yilin, et al.
Pubblicazione: (2026)
Measuring Representation Robustness in Large Language Models for Geometry
di: Jawandhia, Vedant, et al.
Pubblicazione: (2026)
di: Jawandhia, Vedant, et al.
Pubblicazione: (2026)
Measuring and Eliminating Refusals in Military Large Language Models
di: FitzGerald, Jack, et al.
Pubblicazione: (2026)
di: FitzGerald, Jack, et al.
Pubblicazione: (2026)
Playing With AI: How Do State-Of-The-Art Large Language Models Perform in the 1977 Text-Based Adventure Game Zork?
di: Gerrits, Berry
Pubblicazione: (2026)
di: Gerrits, Berry
Pubblicazione: (2026)
Do Large Language Models Understand Logic or Just Mimick Context?
di: Yan, Junbing, et al.
Pubblicazione: (2024)
di: Yan, Junbing, et al.
Pubblicazione: (2024)
Do Large Language Models Need a Content Delivery Network?
di: Cheng, Yihua, et al.
Pubblicazione: (2024)
di: Cheng, Yihua, et al.
Pubblicazione: (2024)
On the Worst Prompt Performance of Large Language Models
di: Cao, Bowen, et al.
Pubblicazione: (2024)
di: Cao, Bowen, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Evaluating the World Model Implicit in a Generative Model
di: Vafa, Keyon, et al.
Pubblicazione: (2024) -
What Has a Foundation Model Found? Using Inductive Bias to Probe for World Models
di: Vafa, Keyon, et al.
Pubblicazione: (2025) -
Potemkin Understanding in Large Language Models
di: Mancoridis, Marina, et al.
Pubblicazione: (2025) -
Large Language Models: An Applied Econometric Framework
di: Ludwig, Jens, et al.
Pubblicazione: (2024) -
What's Producible May Not Be Reachable: Measuring the Steerability of Generative Models
di: Vafa, Keyon, et al.
Pubblicazione: (2025)