CHBench: A Cognitive Hierarchy Benchmark for Evaluating Strategic Reasoning Capability of LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Hongtao, Du, Zhicheng, Wang, Zihe, Shen, Weiran |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Strategic Chain-of-Thought: Guiding Accurate Reasoning in LLMs through Strategy Elicitation
di: Wang, Yu, et al.
Pubblicazione: (2024)
di: Wang, Yu, et al.
Pubblicazione: (2024)
Olapa-MCoT: Enhancing the Chinese Mathematical Reasoning Capability of LLMs
di: Zhu, Shaojie, et al.
Pubblicazione: (2023)
di: Zhu, Shaojie, et al.
Pubblicazione: (2023)
WordDecipher: Enhancing Digital Workspace Communication with Explainable AI for Non-native English Speakers
di: Chen, Yuexi, et al.
Pubblicazione: (2024)
di: Chen, Yuexi, et al.
Pubblicazione: (2024)
Status Hierarchies in Language Models
di: Barkett, Emilio
Pubblicazione: (2026)
di: Barkett, Emilio
Pubblicazione: (2026)
Your Co-Workers Matter: Evaluating Collaborative Capabilities of Language Models in Blocks World
di: Wu, Guande, et al.
Pubblicazione: (2024)
di: Wu, Guande, et al.
Pubblicazione: (2024)
Can LLMs Model Incorrect Student Reasoning? A Case Study on Distractor Generation
di: Zengaffinen, Yanick, et al.
Pubblicazione: (2026)
di: Zengaffinen, Yanick, et al.
Pubblicazione: (2026)
Evaluating LLMs as Human Surrogates in Controlled Experiments
di: Hoq, Adnan, et al.
Pubblicazione: (2026)
di: Hoq, Adnan, et al.
Pubblicazione: (2026)
Large Language Models as Psychological Simulators: A Methodological Guide
di: Lin, Zhicheng
Pubblicazione: (2025)
di: Lin, Zhicheng
Pubblicazione: (2025)
A validity-guided workflow for robust large language model research in psychology
di: Lin, Zhicheng
Pubblicazione: (2025)
di: Lin, Zhicheng
Pubblicazione: (2025)
From Prompts to Constructs: A Dual-Validity Framework for LLM Research in Psychology
di: Lin, Zhicheng
Pubblicazione: (2025)
di: Lin, Zhicheng
Pubblicazione: (2025)
ConsistencyAI: A Benchmark to Assess LLMs' Factual Consistency When Responding to Different Demographic Groups
di: Banyas, Peter, et al.
Pubblicazione: (2025)
di: Banyas, Peter, et al.
Pubblicazione: (2025)
Mind the Value-Action Gap: Do LLMs Act in Alignment with Their Values?
di: Shen, Hua, et al.
Pubblicazione: (2025)
di: Shen, Hua, et al.
Pubblicazione: (2025)
CUPID: Evaluating Personalized and Contextualized Alignment of LLMs from Interactions
di: Kim, Tae Soo, et al.
Pubblicazione: (2025)
di: Kim, Tae Soo, et al.
Pubblicazione: (2025)
Copiloting Diagnosis of Autism in Real Clinical Scenarios via LLMs
di: Jiang, Yi, et al.
Pubblicazione: (2024)
di: Jiang, Yi, et al.
Pubblicazione: (2024)
Prompt Decorators: A Declarative and Composable Syntax for Reasoning, Formatting, and Control in LLMs
di: Heris, Mostapha Kalami
Pubblicazione: (2025)
di: Heris, Mostapha Kalami
Pubblicazione: (2025)
Meta-Evaluating Local LLMs: Rethinking Performance Metrics for Serious Games
di: Isaza-Giraldo, Andrés, et al.
Pubblicazione: (2025)
di: Isaza-Giraldo, Andrés, et al.
Pubblicazione: (2025)
Hidden Prompts in Manuscripts Exploit AI-Assisted Peer Review
di: Lin, Zhicheng
Pubblicazione: (2025)
di: Lin, Zhicheng
Pubblicazione: (2025)
Unpacking Human Preference for LLMs: Demographically Aware Evaluation with the HUMAINE Framework
di: Petrova, Nora, et al.
Pubblicazione: (2026)
di: Petrova, Nora, et al.
Pubblicazione: (2026)
Helmsman of the Masses? Evaluate the Opinion Leadership of Large Language Models in the Werewolf Game
di: Du, Silin, et al.
Pubblicazione: (2024)
di: Du, Silin, et al.
Pubblicazione: (2024)
Personalized Benchmarking: Evaluating LLMs by Individual Preferences
di: Garbacea, Cristina, et al.
Pubblicazione: (2026)
di: Garbacea, Cristina, et al.
Pubblicazione: (2026)
ValueCompass: A Framework for Measuring Contextual Value Alignment Between Human and LLMs
di: Shen, Hua, et al.
Pubblicazione: (2024)
di: Shen, Hua, et al.
Pubblicazione: (2024)
An Evaluation of Estimative Uncertainty in Large Language Models
di: Tang, Zhisheng, et al.
Pubblicazione: (2024)
di: Tang, Zhisheng, et al.
Pubblicazione: (2024)
HealMe: Harnessing Cognitive Reframing in Large Language Models for Psychotherapy
di: Xiao, Mengxi, et al.
Pubblicazione: (2024)
di: Xiao, Mengxi, et al.
Pubblicazione: (2024)
Alignment Drift in Multimodal LLMs: A Two-Phase, Longitudinal Evaluation of Harm Across Eight Model Releases
di: Ford, Casey, et al.
Pubblicazione: (2026)
di: Ford, Casey, et al.
Pubblicazione: (2026)
Direct Advantage Regression: Aligning LLMs with Online AI Reward
di: He, Li, et al.
Pubblicazione: (2025)
di: He, Li, et al.
Pubblicazione: (2025)
LETGAMES: An LLM-Powered Gamified Approach to Cognitive Training for Patients with Cognitive Impairment
di: Shi, Jingwei, et al.
Pubblicazione: (2026)
di: Shi, Jingwei, et al.
Pubblicazione: (2026)
Name of Thrones: Evaluating How LLMs Rank Student Names, Race, and Gender in Status Hierarchies
di: Sakunkoo, Annabella, et al.
Pubblicazione: (2025)
di: Sakunkoo, Annabella, et al.
Pubblicazione: (2025)
HICode: Hierarchical Inductive Coding with LLMs
di: Zhong, Mian, et al.
Pubblicazione: (2025)
di: Zhong, Mian, et al.
Pubblicazione: (2025)
Probing the Multi-turn Planning Capabilities of LLMs via 20 Question Games
di: Zhang, Yizhe, et al.
Pubblicazione: (2023)
di: Zhang, Yizhe, et al.
Pubblicazione: (2023)
Evaluating the Semantic Profiling Abilities of LLMs for Natural Language Utterances in Data Visualization
di: Bako, Hannah K., et al.
Pubblicazione: (2024)
di: Bako, Hannah K., et al.
Pubblicazione: (2024)
Cognition Chain for Explainable Psychological Stress Detection on Social Media
di: Wang, Xin, et al.
Pubblicazione: (2024)
di: Wang, Xin, et al.
Pubblicazione: (2024)
Benchmarking LLM Tool-Use in the Wild
di: Yu, Peijie, et al.
Pubblicazione: (2026)
di: Yu, Peijie, et al.
Pubblicazione: (2026)
Multi-agent KTO: Reinforcing Strategic Interactions of Large Language Model in Language Game
di: Ye, Rong, et al.
Pubblicazione: (2025)
di: Ye, Rong, et al.
Pubblicazione: (2025)
ReasonGraph: Visualisation of Reasoning Paths
di: Li, Zongqian, et al.
Pubblicazione: (2025)
di: Li, Zongqian, et al.
Pubblicazione: (2025)
Are Today's LLMs Ready to Explain Well-Being Concepts?
di: Jiang, Bohan, et al.
Pubblicazione: (2025)
di: Jiang, Bohan, et al.
Pubblicazione: (2025)
Evaluating the Application of ChatGPT in Outpatient Triage Guidance: A Comparative Study
di: Liu, Dou, et al.
Pubblicazione: (2024)
di: Liu, Dou, et al.
Pubblicazione: (2024)
Step Guided Reasoning: Improving Mathematical Reasoning using Guidance Generation and Step Reasoning
di: Cao, Lang, et al.
Pubblicazione: (2024)
di: Cao, Lang, et al.
Pubblicazione: (2024)
Estimating LLM Consistency: A User Baseline vs Surrogate Metrics
di: Wu, Xiaoyuan, et al.
Pubblicazione: (2025)
di: Wu, Xiaoyuan, et al.
Pubblicazione: (2025)
Generating Pedagogically Meaningful Visuals for Math Word Problems: A New Benchmark and Analysis of Text-to-Image Models
di: Wang, Junling, et al.
Pubblicazione: (2025)
di: Wang, Junling, et al.
Pubblicazione: (2025)
Exploring Big Five Personality and AI Capability Effects in LLM-Simulated Negotiation Dialogues
di: Cohen, Myke C., et al.
Pubblicazione: (2025)
di: Cohen, Myke C., et al.
Pubblicazione: (2025)
Documenti analoghi
-
Strategic Chain-of-Thought: Guiding Accurate Reasoning in LLMs through Strategy Elicitation
di: Wang, Yu, et al.
Pubblicazione: (2024) -
Olapa-MCoT: Enhancing the Chinese Mathematical Reasoning Capability of LLMs
di: Zhu, Shaojie, et al.
Pubblicazione: (2023) -
WordDecipher: Enhancing Digital Workspace Communication with Explainable AI for Non-native English Speakers
di: Chen, Yuexi, et al.
Pubblicazione: (2024) -
Status Hierarchies in Language Models
di: Barkett, Emilio
Pubblicazione: (2026) -
Your Co-Workers Matter: Evaluating Collaborative Capabilities of Language Models in Blocks World
di: Wu, Guande, et al.
Pubblicazione: (2024)