Evaluating Developmental Cognition Capabilities of LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xiao, Xiao, Noh, Hayoun, Gonzalez-Franco, Mar |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
How AI Companionship Develops: Evidence from a Longitudinal Study
par: Hwang, Angel Hsing-Chi, et autres
Publié: (2025)
par: Hwang, Angel Hsing-Chi, et autres
Publié: (2025)
CHBench: A Cognitive Hierarchy Benchmark for Evaluating Strategic Reasoning Capability of LLMs
par: Liu, Hongtao, et autres
Publié: (2025)
par: Liu, Hongtao, et autres
Publié: (2025)
Are Your LLMs Capable of Stable Reasoning?
par: Liu, Junnan, et autres
Publié: (2024)
par: Liu, Junnan, et autres
Publié: (2024)
Evaluating LLMs Capabilities Towards Understanding Social Dynamics
par: Tahir, Anique, et autres
Publié: (2024)
par: Tahir, Anique, et autres
Publié: (2024)
An Extensive Evaluation of PDDL Capabilities in off-the-shelf LLMs
par: Vyas, Kaustubh, et autres
Publié: (2025)
par: Vyas, Kaustubh, et autres
Publié: (2025)
Are LLMs Effective Negotiators? Systematic Evaluation of the Multifaceted Capabilities of LLMs in Negotiation Dialogues
par: Kwon, Deuksin, et autres
Publié: (2024)
par: Kwon, Deuksin, et autres
Publié: (2024)
Digital Companionship: Overlapping Uses of AI Companions and AI Assistants
par: Manoli, Aikaterina, et autres
Publié: (2025)
par: Manoli, Aikaterina, et autres
Publié: (2025)
Lilith: Developmental Modular LLMs with Chemical Signaling
par: Farooqi, Mohid, et autres
Publié: (2025)
par: Farooqi, Mohid, et autres
Publié: (2025)
Assessing the Zero-Shot Capabilities of LLMs for Action Evaluation in RL
par: Pignatelli, Eduardo, et autres
Publié: (2024)
par: Pignatelli, Eduardo, et autres
Publié: (2024)
On Evaluating LLMs' Capabilities as Functional Approximators: A Bayesian Perspective
par: Siddiqui, Shoaib Ahmed, et autres
Publié: (2024)
par: Siddiqui, Shoaib Ahmed, et autres
Publié: (2024)
A Comprehensive Evaluation of Cognitive Biases in LLMs
par: Malberg, Simon, et autres
Publié: (2024)
par: Malberg, Simon, et autres
Publié: (2024)
Psycholinguistic Word Features: a New Approach for the Evaluation of LLMs Alignment with Humans
par: Conde, Javier, et autres
Publié: (2025)
par: Conde, Javier, et autres
Publié: (2025)
CAREBench: Evaluating LLMs' Emotion Understanding by Assessing Cognitive Appraisal Reasoning
par: Sun, Zhaoyue, et autres
Publié: (2026)
par: Sun, Zhaoyue, et autres
Publié: (2026)
Are LLMs Capable of Data-based Statistical and Causal Reasoning? Benchmarking Advanced Quantitative Reasoning with Data
par: Liu, Xiao, et autres
Publié: (2024)
par: Liu, Xiao, et autres
Publié: (2024)
Evaluating the Capabilities of LLMs for Supporting Anticipatory Impact Assessment
par: Allaham, Mowafak, et autres
Publié: (2024)
par: Allaham, Mowafak, et autres
Publié: (2024)
Mutation-based Consistency Testing for Evaluating the Code Understanding Capability of LLMs
par: Li, Ziyu, et autres
Publié: (2024)
par: Li, Ziyu, et autres
Publié: (2024)
How Does Alignment Enhance LLMs' Multilingual Capabilities? A Language Neurons Perspective
par: Zhang, Shimao, et autres
Publié: (2025)
par: Zhang, Shimao, et autres
Publié: (2025)
Evaluating LLMs Across Multi-Cognitive Levels: From Medical Knowledge Mastery to Scenario-Based Problem Solving
par: Zhou, Yuxuan, et autres
Publié: (2025)
par: Zhou, Yuxuan, et autres
Publié: (2025)
Is LLM an Overconfident Judge? Unveiling the Capabilities of LLMs in Detecting Offensive Language with Annotation Disagreement
par: Lu, Junyu, et autres
Publié: (2025)
par: Lu, Junyu, et autres
Publié: (2025)
Evaluation of Safety Cognition Capability in Vision-Language Models for Autonomous Driving
par: Zhang, Enming, et autres
Publié: (2025)
par: Zhang, Enming, et autres
Publié: (2025)
Unlocking Cognitive Capabilities and Analyzing the Perception-Logic Trade-off
par: Zhang, Longyin, et autres
Publié: (2026)
par: Zhang, Longyin, et autres
Publié: (2026)
LLMs Can Covertly Sandbag on Capability Evaluations Against Chain-of-Thought Monitoring
par: Li, Chloe, et autres
Publié: (2025)
par: Li, Chloe, et autres
Publié: (2025)
Evaluating LLMs' Divergent Thinking Capabilities for Scientific Idea Generation with Minimal Context
par: Ruan, Kai, et autres
Publié: (2024)
par: Ruan, Kai, et autres
Publié: (2024)
EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs
par: Xu, Wanghan, et autres
Publié: (2025)
par: Xu, Wanghan, et autres
Publié: (2025)
Capability Self-Assessment: Teaching LLMs to Know Their Limits
par: Yang, Haoyan, et autres
Publié: (2026)
par: Yang, Haoyan, et autres
Publié: (2026)
Why the Valuable Capabilities of LLMs Are Precisely the Unexplainable Ones
par: Cheng, Quan
Publié: (2026)
par: Cheng, Quan
Publié: (2026)
Evidence of Cognitive Deficits andDevelopmental Advances in Generative AI: A Clock Drawing Test Analysis
par: Galatzer-Levy, Isaac R., et autres
Publié: (2024)
par: Galatzer-Levy, Isaac R., et autres
Publié: (2024)
The Cognitive Capabilities of Generative AI: A Comparative Analysis with Human Benchmarks
par: Galatzer-Levy, Isaac R., et autres
Publié: (2024)
par: Galatzer-Levy, Isaac R., et autres
Publié: (2024)
CharacterBox: Evaluating the Role-Playing Capabilities of LLMs in Text-Based Virtual Worlds
par: Wang, Lei, et autres
Publié: (2024)
par: Wang, Lei, et autres
Publié: (2024)
Assessing the Capabilities of LLMs in Humor:A Multi-dimensional Analysis of Oogiri Generation and Evaluation
par: Sakabe, Ritsu, et autres
Publié: (2025)
par: Sakabe, Ritsu, et autres
Publié: (2025)
Counterfactual Evaluation Reveals Hidden Capability Profiles in Clinical LLMs and Agents
par: Turk, Matt
Publié: (2026)
par: Turk, Matt
Publié: (2026)
Theory Trace Card: Theory-Driven Socio-Cognitive Evaluation of LLMs
par: Karimi-Malekabadi, Farzan, et autres
Publié: (2026)
par: Karimi-Malekabadi, Farzan, et autres
Publié: (2026)
Cognitive Foundations for Reasoning and Their Manifestation in LLMs
par: Kargupta, Priyanka, et autres
Publié: (2025)
par: Kargupta, Priyanka, et autres
Publié: (2025)
Recent Advancement of Emotion Cognition in Large Language Models
par: Chen, Yuyan, et autres
Publié: (2024)
par: Chen, Yuyan, et autres
Publié: (2024)
LLMs with Personalities in Multi-issue Negotiation Games
par: Noh, Sean, et autres
Publié: (2024)
par: Noh, Sean, et autres
Publié: (2024)
Cognitive Science-Inspired Evaluation of Core Capabilities for Object Understanding in AI
par: Rutar, Danaja, et autres
Publié: (2025)
par: Rutar, Danaja, et autres
Publié: (2025)
Evaluation of Multilingual LLMs Personalized Text Generation Capabilities Targeting Groups and Social-Media Platforms
par: Macko, Dominik
Publié: (2026)
par: Macko, Dominik
Publié: (2026)
Evaluating GPT's Capability in Identifying Stages of Cognitive Impairment from Electronic Health Data
par: Leng, Yu, et autres
Publié: (2025)
par: Leng, Yu, et autres
Publié: (2025)
EarthSpatialBench: Benchmarking Spatial Reasoning Capabilities of Multimodal LLMs on Earth Imagery
par: Xu, Zelin, et autres
Publié: (2026)
par: Xu, Zelin, et autres
Publié: (2026)
AstroMMBench: A Benchmark for Evaluating Multimodal Large Language Models Capabilities in Astronomy
par: Shi, Jinghang, et autres
Publié: (2025)
par: Shi, Jinghang, et autres
Publié: (2025)
Documents similaires
-
How AI Companionship Develops: Evidence from a Longitudinal Study
par: Hwang, Angel Hsing-Chi, et autres
Publié: (2025) -
CHBench: A Cognitive Hierarchy Benchmark for Evaluating Strategic Reasoning Capability of LLMs
par: Liu, Hongtao, et autres
Publié: (2025) -
Are Your LLMs Capable of Stable Reasoning?
par: Liu, Junnan, et autres
Publié: (2024) -
Evaluating LLMs Capabilities Towards Understanding Social Dynamics
par: Tahir, Anique, et autres
Publié: (2024) -
An Extensive Evaluation of PDDL Capabilities in off-the-shelf LLMs
par: Vyas, Kaustubh, et autres
Publié: (2025)