Testing AI on language comprehension tasks reveals insensitivity to underlying meaning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dentella, Vittoria, Guenther, Fritz, Murphy, Elliot, Marcus, Gary, Leivada, Evelina |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Language in Vivo vs. in Silico: Size Matters but Larger Language Models Still Do Not Comprehend Language on a Par with Humans Due to Impenetrable Semantic Reference
par: Dentella, Vittoria, et autres
Publié: (2024)
par: Dentella, Vittoria, et autres
Publié: (2024)
Fundamental Principles of Linguistic Structure are Not Represented by o3
par: Murphy, Elliot, et autres
Publié: (2025)
par: Murphy, Elliot, et autres
Publié: (2025)
A Sentence is Worth a Thousand Pictures: Can Large Language Models Understand Hum4n L4ngu4ge and the W0rld behind W0rds?
par: Leivada, Evelina, et autres
Publié: (2023)
par: Leivada, Evelina, et autres
Publié: (2023)
ChatGPT-generated texts show authorship traits that identify them as non-human
par: Dentella, Vittoria, et autres
Publié: (2025)
par: Dentella, Vittoria, et autres
Publié: (2025)
Tracing the ongoing emergence of human-like reasoning in Large Language Models
par: Morosi, Paolo, et autres
Publié: (2026)
par: Morosi, Paolo, et autres
Publié: (2026)
Impact of enriched meaning representations for language generation in dialogue tasks: A comprehensive exploration of the relevance of tasks, corpora and metrics
par: Vázquez, Alain, et autres
Publié: (2026)
par: Vázquez, Alain, et autres
Publié: (2026)
Multilingual Large Language Models do not comprehend all natural languages to equal degrees
par: Moskvina, Natalia, et autres
Publié: (2026)
par: Moskvina, Natalia, et autres
Publié: (2026)
Large Language Model probabilities cannot distinguish between possible and impossible language
par: Leivada, Evelina, et autres
Publié: (2025)
par: Leivada, Evelina, et autres
Publié: (2025)
Dissociating language and thought in large language models
par: Mahowald, Kyle, et autres
Publié: (2023)
par: Mahowald, Kyle, et autres
Publié: (2023)
Just-in-time and distributed task representations in language models
par: Li, Yuxuan, et autres
Publié: (2025)
par: Li, Yuxuan, et autres
Publié: (2025)
Auxiliary task demands mask the capabilities of smaller language models
par: Hu, Jennifer, et autres
Publié: (2024)
par: Hu, Jennifer, et autres
Publié: (2024)
Community size rather than grammatical complexity better predicts Large Language Model accuracy in a novel Wug Test
par: Pantelidou, Nikoleta, et autres
Publié: (2025)
par: Pantelidou, Nikoleta, et autres
Publié: (2025)
Predict the Next Word: Humans exhibit uncertainty in this task and language models _____
par: Ilia, Evgenia, et autres
Publié: (2024)
par: Ilia, Evgenia, et autres
Publié: (2024)
Superhuman performance of a large language model on the reasoning tasks of a physician
par: Brodeur, Peter G., et autres
Publié: (2024)
par: Brodeur, Peter G., et autres
Publié: (2024)
Code-enabled language models can outperform reasoning models on diverse tasks
par: Zhang, Cedegao E., et autres
Publié: (2025)
par: Zhang, Cedegao E., et autres
Publié: (2025)
Leveraging small language models for Text2SPARQL tasks to improve the resilience of AI assistance
par: Brei, Felix, et autres
Publié: (2024)
par: Brei, Felix, et autres
Publié: (2024)
Evidence from counterfactual tasks supports emergent analogical reasoning in large language models
par: Webb, Taylor, et autres
Publié: (2024)
par: Webb, Taylor, et autres
Publié: (2024)
Aviary: training language agents on challenging scientific tasks
par: Narayanan, Siddharth, et autres
Publié: (2024)
par: Narayanan, Siddharth, et autres
Publié: (2024)
Cognitive models can reveal interpretable value trade-offs in language models
par: Murthy, Sonia K., et autres
Publié: (2025)
par: Murthy, Sonia K., et autres
Publié: (2025)
The production of meaning in the processing of natural language
par: Agostino, Christopher J., et autres
Publié: (2026)
par: Agostino, Christopher J., et autres
Publié: (2026)
Can large language models understand uncommon meanings of common words?
par: Wu, Jinyang, et autres
Publié: (2024)
par: Wu, Jinyang, et autres
Publié: (2024)
Visual Grounding Helps Learn Word Meanings in Low-Data Regimes
par: Zhuang, Chengxu, et autres
Publié: (2023)
par: Zhuang, Chengxu, et autres
Publié: (2023)
TechGPT-2.0: A large language model project to solve the task of knowledge graph construction
par: Wang, Jiaqi, et autres
Publié: (2024)
par: Wang, Jiaqi, et autres
Publié: (2024)
Tokens, the oft-overlooked appetizer: Large language models, the distributional hypothesis, and meaning
par: Zimmerman, Julia Witte, et autres
Publié: (2024)
par: Zimmerman, Julia Witte, et autres
Publié: (2024)
Where meaning lives: Layer-wise accessibility of psycholinguistic features in encoder and decoder language models
par: Tikhomirova, Taisiia, et autres
Publié: (2026)
par: Tikhomirova, Taisiia, et autres
Publié: (2026)
Do language models capture implied discourse meanings? An investigation with exhaustivity implicatures of Korean morphology
par: Shin, Hagyeong, et autres
Publié: (2024)
par: Shin, Hagyeong, et autres
Publié: (2024)
Multi-Target Cross-Lingual Summarization: a novel task and a language-neutral approach
par: Pernes, Diogo, et autres
Publié: (2024)
par: Pernes, Diogo, et autres
Publié: (2024)
Post-training makes large language models less human-like
par: Binz, Marcel, et autres
Publié: (2026)
par: Binz, Marcel, et autres
Publié: (2026)
Large language models can consistently generate high-quality content for election disinformation operations
par: Williams, Angus R., et autres
Publié: (2024)
par: Williams, Angus R., et autres
Publié: (2024)
Lexicon-Level Contrastive Visual-Grounding Improves Language Modeling
par: Zhuang, Chengxu, et autres
Publié: (2024)
par: Zhuang, Chengxu, et autres
Publié: (2024)
People who frequently use ChatGPT for writing tasks are accurate and robust detectors of AI-generated text
par: Russell, Jenna, et autres
Publié: (2025)
par: Russell, Jenna, et autres
Publié: (2025)
Natural language processing for African languages
par: Adelani, David Ifeoluwa
Publié: (2025)
par: Adelani, David Ifeoluwa
Publié: (2025)
Merge-based syntax is mediated by distinct neurocognitive mechanisms: A clustering analysis of comprehension abilities in 84,000 individuals with language deficits across nine languages
par: Murphy, Elliot, et autres
Publié: (2025)
par: Murphy, Elliot, et autres
Publié: (2025)
AI-AI Bias: large language models favor communications generated by large language models
par: Laurito, Walter, et autres
Publié: (2024)
par: Laurito, Walter, et autres
Publié: (2024)
Outraged AI: Large language models prioritise emotion over cost in fairness enforcement
par: Liu, Hao, et autres
Publié: (2025)
par: Liu, Hao, et autres
Publié: (2025)
Log Probabilities Are a Reliable Estimate of Semantic Plausibility in Base and Instruction-Tuned Language Models
par: Kauf, Carina, et autres
Publié: (2024)
par: Kauf, Carina, et autres
Publié: (2024)
Representational Curvature Modulates Behavioral Uncertainty in Large Language Models
par: King, Jack, et autres
Publié: (2026)
par: King, Jack, et autres
Publié: (2026)
Agent-Testing Agent: A Meta-Agent for Automated Testing and Evaluation of Conversational AI Agents
par: Komoravolu, Sameer, et autres
Publié: (2025)
par: Komoravolu, Sameer, et autres
Publié: (2025)
Rare Disease Differential Diagnosis with Large Language Models at Scale: From Abdominal Actinomycosis to Wilson's Disease
par: Schumacher, Elliot, et autres
Publié: (2025)
par: Schumacher, Elliot, et autres
Publié: (2025)
Large-scale cloze evaluation reveals that token prediction tasks are neither lexically nor semantically aligned
par: Jacobs, Cassandra L., et autres
Publié: (2024)
par: Jacobs, Cassandra L., et autres
Publié: (2024)
Documents similaires
-
Language in Vivo vs. in Silico: Size Matters but Larger Language Models Still Do Not Comprehend Language on a Par with Humans Due to Impenetrable Semantic Reference
par: Dentella, Vittoria, et autres
Publié: (2024) -
Fundamental Principles of Linguistic Structure are Not Represented by o3
par: Murphy, Elliot, et autres
Publié: (2025) -
A Sentence is Worth a Thousand Pictures: Can Large Language Models Understand Hum4n L4ngu4ge and the W0rld behind W0rds?
par: Leivada, Evelina, et autres
Publié: (2023) -
ChatGPT-generated texts show authorship traits that identify them as non-human
par: Dentella, Vittoria, et autres
Publié: (2025) -
Tracing the ongoing emergence of human-like reasoning in Large Language Models
par: Morosi, Paolo, et autres
Publié: (2026)