Do Large Language Models Truly Grasp Mathematics? An Empirical Exploration From Cognitive Psychology
Fuente:
arXiv
Guardado en:
| Autores principales: | Xie, Wei, Ma, Shuoyoucheng, Wang, Zhenhua, Wang, Enze, Chen, Kai, Sun, Xiaobing, Wang, Baosheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Foot In The Door: Understanding Large Language Model Jailbreaking via Cognitive Psychology
por: Wang, Zhenhua, et al.
Publicado: (2024)
por: Wang, Zhenhua, et al.
Publicado: (2024)
AIPsychoBench: Understanding the Psychometric Differences between LLMs and Humans
por: Xie, Wei, et al.
Publicado: (2025)
por: Xie, Wei, et al.
Publicado: (2025)
League of LLMs: A Benchmark-Free Paradigm for Mutual Evaluation of Large Language Models
por: Guo, Qianhong, et al.
Publicado: (2025)
por: Guo, Qianhong, et al.
Publicado: (2025)
AIPsychoBench: Understanding the Psychometric Differences Between LLMs and Humans
por: Wei Xie, et al.
Publicado: (2026)
por: Wei Xie, et al.
Publicado: (2026)
Do Large Language Models Truly Understand Geometric Structures?
por: Wang, Xiaofeng, et al.
Publicado: (2025)
por: Wang, Xiaofeng, et al.
Publicado: (2025)
Do Large Language Models Truly Grasp Addition? A Rule-Focused Diagnostic Using Two-Integer Arithmetic
por: Yan, Yang, et al.
Publicado: (2025)
por: Yan, Yang, et al.
Publicado: (2025)
How Well Do Large Language Models Truly Ground?
por: Lee, Hyunji, et al.
Publicado: (2023)
por: Lee, Hyunji, et al.
Publicado: (2023)
Do Large Language Models Truly Understand Cross-cultural Differences?
por: Guo, Shiwei, et al.
Publicado: (2025)
por: Guo, Shiwei, et al.
Publicado: (2025)
Memorization $\neq$ Understanding: Do Large Language Models Have the Ability of Scenario Cognition?
por: Ma, Boxiang, et al.
Publicado: (2025)
por: Ma, Boxiang, et al.
Publicado: (2025)
WenyanGPT: A Large Language Model for Classical Chinese Tasks
por: Yao, Xinyu, et al.
Publicado: (2025)
por: Yao, Xinyu, et al.
Publicado: (2025)
PERM: Psychology-grounded Empathetic Reward Modeling for Large Language Models
por: Wang, Chengbing, et al.
Publicado: (2026)
por: Wang, Chengbing, et al.
Publicado: (2026)
Do Large Language Models Grasp The Grammar? Evidence from Grammar-Book-Guided Probing in Luxembourgish
por: Li, Lujun, et al.
Publicado: (2025)
por: Li, Lujun, et al.
Publicado: (2025)
The End of Manual Decoding: Towards Truly End-to-End Language Models
por: Wang, Zhichao, et al.
Publicado: (2025)
por: Wang, Zhichao, et al.
Publicado: (2025)
Do as We Do, Not as You Think: the Conformity of Large Language Models
por: Weng, Zhiyuan, et al.
Publicado: (2025)
por: Weng, Zhiyuan, et al.
Publicado: (2025)
Optimizing Psychological Counseling with Instruction-Tuned Large Language Models
por: Li, Wenjie, et al.
Publicado: (2024)
por: Li, Wenjie, et al.
Publicado: (2024)
LLM-Generated Natural Language Meets Scaling Laws: New Explorations and Data Augmentation Methods
por: Wang, Zhenhua, et al.
Publicado: (2024)
por: Wang, Zhenhua, et al.
Publicado: (2024)
Are Large Language Models Truly Smarter Than Humans?
por: M, Eshwar Reddy, et al.
Publicado: (2026)
por: M, Eshwar Reddy, et al.
Publicado: (2026)
Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap
por: Xu, Yige, et al.
Publicado: (2026)
por: Xu, Yige, et al.
Publicado: (2026)
Do Large Language Models Rank Fairly? An Empirical Study on the Fairness of LLMs as Rankers
por: Wang, Yuan, et al.
Publicado: (2024)
por: Wang, Yuan, et al.
Publicado: (2024)
A Survey on Large Language Models for Mathematical Reasoning
por: Wang, Peng-Yuan, et al.
Publicado: (2025)
por: Wang, Peng-Yuan, et al.
Publicado: (2025)
CogAtom: From Cognitive Atoms to Olympiad-level Mathematical Reasoning in Large Language Models
por: Chen, Zhuofan, et al.
Publicado: (2025)
por: Chen, Zhuofan, et al.
Publicado: (2025)
Locally Confident, Globally Stuck: The Quality-Exploration Dilemma in Diffusion Language Models
por: Fang, Liancheng, et al.
Publicado: (2026)
por: Fang, Liancheng, et al.
Publicado: (2026)
Key-Point-Driven Mathematical Reasoning Distillation of Large Language Model
por: Zhu, Xunyu, et al.
Publicado: (2024)
por: Zhu, Xunyu, et al.
Publicado: (2024)
OralMLLM-Bench: Evaluating Cognitive Capabilities of Multimodal Large Language Models in Dental Practice
por: Wang, Rongyang, et al.
Publicado: (2026)
por: Wang, Rongyang, et al.
Publicado: (2026)
Progressive-Hint Prompting Improves Reasoning in Large Language Models
por: Zheng, Chuanyang, et al.
Publicado: (2023)
por: Zheng, Chuanyang, et al.
Publicado: (2023)
Unveiling the Learning Mind of Language Models: A Cognitive Framework and Empirical Study
por: Hu, Zhengyu, et al.
Publicado: (2025)
por: Hu, Zhengyu, et al.
Publicado: (2025)
FAC$^2$E: Better Understanding Large Language Model Capabilities by Dissociating Language and Cognition
por: Wang, Xiaoqiang, et al.
Publicado: (2024)
por: Wang, Xiaoqiang, et al.
Publicado: (2024)
An Empirical Study on Prompt Compression for Large Language Models
por: Zhang, Zheng, et al.
Publicado: (2025)
por: Zhang, Zheng, et al.
Publicado: (2025)
Do Large Language Models Mirror Cognitive Language Processing?
por: Ren, Yuqi, et al.
Publicado: (2024)
por: Ren, Yuqi, et al.
Publicado: (2024)
Exploring Mathematical Extrapolation of Large Language Models with Synthetic Data
por: Li, Haolong, et al.
Publicado: (2024)
por: Li, Haolong, et al.
Publicado: (2024)
ReliableMath: Benchmark of Reliable Mathematical Reasoning on Large Language Models
por: Xue, Boyang, et al.
Publicado: (2025)
por: Xue, Boyang, et al.
Publicado: (2025)
Burn After Reading: Do Multimodal Large Language Models Truly Capture Order of Events in Image Sequences?
por: Song, Yingjin, et al.
Publicado: (2025)
por: Song, Yingjin, et al.
Publicado: (2025)
Do LLMs Know What Is Private Internally? Probing and Steering Contextual Privacy Norms in Large Language Model Representations
por: Wang, Haoran, et al.
Publicado: (2026)
por: Wang, Haoran, et al.
Publicado: (2026)
Structured Semantic Cloaking for Jailbreak Attacks on Large Language Models
por: Sun, Xiaobing, et al.
Publicado: (2026)
por: Sun, Xiaobing, et al.
Publicado: (2026)
Cause and Effect: Can Large Language Models Truly Understand Causality?
por: Ashwani, Swagata, et al.
Publicado: (2024)
por: Ashwani, Swagata, et al.
Publicado: (2024)
Large Language Models Have Intrinsic Meta-Cognition, but Need a Good Lens
por: Ma, Ziyang, et al.
Publicado: (2025)
por: Ma, Ziyang, et al.
Publicado: (2025)
Revisiting the Reliability of Psychological Scales on Large Language Models
por: Huang, Jen-tse, et al.
Publicado: (2023)
por: Huang, Jen-tse, et al.
Publicado: (2023)
Towards Reliable Medical LLMs: Benchmarking and Enhancing Confidence Estimation of Large Language Models in Medical Consultation
por: Ren, Zhiyao, et al.
Publicado: (2026)
por: Ren, Zhiyao, et al.
Publicado: (2026)
Modeling Multi-Dimensional Cognitive States in Large Language Models under Cognitive Crowding
por: Zhong, Lin, et al.
Publicado: (2026)
por: Zhong, Lin, et al.
Publicado: (2026)
Do Large Language Models Possess Sensitive to Sentiment?
por: Liu, Yang, et al.
Publicado: (2024)
por: Liu, Yang, et al.
Publicado: (2024)
Ejemplares similares
-
Foot In The Door: Understanding Large Language Model Jailbreaking via Cognitive Psychology
por: Wang, Zhenhua, et al.
Publicado: (2024) -
AIPsychoBench: Understanding the Psychometric Differences between LLMs and Humans
por: Xie, Wei, et al.
Publicado: (2025) -
League of LLMs: A Benchmark-Free Paradigm for Mutual Evaluation of Large Language Models
por: Guo, Qianhong, et al.
Publicado: (2025) -
AIPsychoBench: Understanding the Psychometric Differences Between LLMs and Humans
por: Wei Xie, et al.
Publicado: (2026) -
Do Large Language Models Truly Understand Geometric Structures?
por: Wang, Xiaofeng, et al.
Publicado: (2025)