Potemkin Understanding in Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Mancoridis, Marina, Weeks, Bec, Vafa, Keyon, Mullainathan, Sendhil |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Do Large Language Models Perform the Way People Expect? Measuring the Human Generalization Function
por: Vafa, Keyon, et al.
Publicado: (2024)
por: Vafa, Keyon, et al.
Publicado: (2024)
Evaluating the World Model Implicit in a Generative Model
por: Vafa, Keyon, et al.
Publicado: (2024)
por: Vafa, Keyon, et al.
Publicado: (2024)
What's Producible May Not Be Reachable: Measuring the Steerability of Generative Models
por: Vafa, Keyon, et al.
Publicado: (2025)
por: Vafa, Keyon, et al.
Publicado: (2025)
What Has a Foundation Model Found? Using Inductive Bias to Probe for World Models
por: Vafa, Keyon, et al.
Publicado: (2025)
por: Vafa, Keyon, et al.
Publicado: (2025)
Language Generation in the Limit
por: Kleinberg, Jon, et al.
Publicado: (2024)
por: Kleinberg, Jon, et al.
Publicado: (2024)
Large Language Models: An Applied Econometric Framework
por: Ludwig, Jens, et al.
Publicado: (2024)
por: Ludwig, Jens, et al.
Publicado: (2024)
LABOR-LLM: Language-Based Occupational Representations with Large Language Models
por: Athey, Susan, et al.
Publicado: (2024)
por: Athey, Susan, et al.
Publicado: (2024)
Critical Thinking: Which Kinds of Complexity Govern Optimal Reasoning Length?
por: Lee, Celine, et al.
Publicado: (2025)
por: Lee, Celine, et al.
Publicado: (2025)
Understanding the Dilemma of Unlearning for Large Language Models
por: Zhang, Qingjie, et al.
Publicado: (2025)
por: Zhang, Qingjie, et al.
Publicado: (2025)
Mechanistic Indicators of Understanding in Large Language Models
por: Beckmann, Pierre, et al.
Publicado: (2025)
por: Beckmann, Pierre, et al.
Publicado: (2025)
Evaluating Spatial Understanding of Large Language Models
por: Yamada, Yutaro, et al.
Publicado: (2023)
por: Yamada, Yutaro, et al.
Publicado: (2023)
Assessing and Understanding Creativity in Large Language Models
por: Zhao, Yunpu, et al.
Publicado: (2024)
por: Zhao, Yunpu, et al.
Publicado: (2024)
SwissNYF: Tool Grounded LLM Agents for Black Box Setting
por: Kumar, Somnath Sendhil, et al.
Publicado: (2024)
por: Kumar, Somnath Sendhil, et al.
Publicado: (2024)
Do Large Language Models Understand Word Senses?
por: Meconi, Domenico, et al.
Publicado: (2025)
por: Meconi, Domenico, et al.
Publicado: (2025)
Large Language Models Understanding: an Inherent Ambiguity Barrier
por: Nissani, Daniel N.
Publicado: (2025)
por: Nissani, Daniel N.
Publicado: (2025)
"Understanding AI": Semantic Grounding in Large Language Models
por: Lyre, Holger
Publicado: (2024)
por: Lyre, Holger
Publicado: (2024)
Metacognitive Prompting Improves Understanding in Large Language Models
por: Wang, Yuqing, et al.
Publicado: (2023)
por: Wang, Yuqing, et al.
Publicado: (2023)
Using Large Language Models to Understand Telecom Standards
por: Karapantelakis, Athanasios, et al.
Publicado: (2024)
por: Karapantelakis, Athanasios, et al.
Publicado: (2024)
Preservation of Language Understanding Capabilities in Speech-aware Large Language Models
por: Kubis, Marek, et al.
Publicado: (2025)
por: Kubis, Marek, et al.
Publicado: (2025)
Modeling Understanding of Story-Based Analogies Using Large Language Models
por: Inani, Kalit, et al.
Publicado: (2025)
por: Inani, Kalit, et al.
Publicado: (2025)
Toward Understanding the Transferability of Adversarial Suffixes in Large Language Models
por: Ball, Sarah, et al.
Publicado: (2025)
por: Ball, Sarah, et al.
Publicado: (2025)
Understanding Privacy Risks of Embeddings Induced by Large Language Models
por: Zhu, Zhihao, et al.
Publicado: (2024)
por: Zhu, Zhihao, et al.
Publicado: (2024)
Natural Context Drift Undermines the Natural Language Understanding of Large Language Models
por: Wu, Yulong, et al.
Publicado: (2025)
por: Wu, Yulong, et al.
Publicado: (2025)
Improving the Language Understanding Capabilities of Large Language Models Using Reinforcement Learning
por: Hu, Bokai, et al.
Publicado: (2024)
por: Hu, Bokai, et al.
Publicado: (2024)
Evaluating List Construction and Temporal Understanding capabilities of Large Language Models
por: Dumitru, Alexandru, et al.
Publicado: (2025)
por: Dumitru, Alexandru, et al.
Publicado: (2025)
Counterfactual-Consistency Prompting for Relative Temporal Understanding in Large Language Models
por: Kim, Jongho, et al.
Publicado: (2025)
por: Kim, Jongho, et al.
Publicado: (2025)
Coding Triangle: How Does Large Language Model Understand Code?
por: Zhang, Taolin, et al.
Publicado: (2025)
por: Zhang, Taolin, et al.
Publicado: (2025)
Understanding Data Temporality Impact on Large Language Models Pre-training
por: Pilchen, Hippolyte, et al.
Publicado: (2026)
por: Pilchen, Hippolyte, et al.
Publicado: (2026)
Can Large Language Models Understand Real-World Complex Instructions?
por: He, Qianyu, et al.
Publicado: (2023)
por: He, Qianyu, et al.
Publicado: (2023)
Enhancing Contextual Understanding in Large Language Models through Contrastive Decoding
por: Zhao, Zheng, et al.
Publicado: (2024)
por: Zhao, Zheng, et al.
Publicado: (2024)
Do Large Language Models Understand Logic or Just Mimick Context?
por: Yan, Junbing, et al.
Publicado: (2024)
por: Yan, Junbing, et al.
Publicado: (2024)
Evaluating Semantic and Syntactic Understanding in Large Language Models for Payroll Systems
por: Maclean, Hendrika, et al.
Publicado: (2026)
por: Maclean, Hendrika, et al.
Publicado: (2026)
From Understanding to Utilization: A Survey on Explainability for Large Language Models
por: Luo, Haoyan, et al.
Publicado: (2024)
por: Luo, Haoyan, et al.
Publicado: (2024)
SarcasmBench: Towards Evaluating Large Language Models on Sarcasm Understanding
por: Zhang, Yazhou, et al.
Publicado: (2024)
por: Zhang, Yazhou, et al.
Publicado: (2024)
Cause and Effect: Can Large Language Models Truly Understand Causality?
por: Ashwani, Swagata, et al.
Publicado: (2024)
por: Ashwani, Swagata, et al.
Publicado: (2024)
IndicMMLU-Pro: Benchmarking Indic Large Language Models on Multi-Task Language Understanding
por: KJ, Sankalp, et al.
Publicado: (2025)
por: KJ, Sankalp, et al.
Publicado: (2025)
Developing a Pragmatic Benchmark for Assessing Korean Legal Language Understanding in Large Language Models
por: Kim, Yeeun, et al.
Publicado: (2024)
por: Kim, Yeeun, et al.
Publicado: (2024)
Benchmarking Large Language Models on CFLUE -- A Chinese Financial Language Understanding Evaluation Dataset
por: Zhu, Jie, et al.
Publicado: (2024)
por: Zhu, Jie, et al.
Publicado: (2024)
Large Language Models for Oral History Understanding with Text Classification and Sentiment Analysis
por: Cherukuri, Komala Subramanyam, et al.
Publicado: (2025)
por: Cherukuri, Komala Subramanyam, et al.
Publicado: (2025)
TabularMath: Understanding Math Reasoning over Tables with Large Language Models
por: Tian, Shi-Yu, et al.
Publicado: (2025)
por: Tian, Shi-Yu, et al.
Publicado: (2025)
Ejemplares similares
-
Do Large Language Models Perform the Way People Expect? Measuring the Human Generalization Function
por: Vafa, Keyon, et al.
Publicado: (2024) -
Evaluating the World Model Implicit in a Generative Model
por: Vafa, Keyon, et al.
Publicado: (2024) -
What's Producible May Not Be Reachable: Measuring the Steerability of Generative Models
por: Vafa, Keyon, et al.
Publicado: (2025) -
What Has a Foundation Model Found? Using Inductive Bias to Probe for World Models
por: Vafa, Keyon, et al.
Publicado: (2025) -
Language Generation in the Limit
por: Kleinberg, Jon, et al.
Publicado: (2024)