ActTraitBench: Quantifying the Knowledge-Decision Gap in Large Language Models via Human-Grounded Behavioral Validation
Fuente:
arXiv
Saved in:
| Main Authors: | Yang, Yutong, Miao, Chenxi, Li, Weikang, Wu, Yunfang |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Trait-Aware Policy Optimization for Autoregressive Multi-Trait Essay Scoring
by: Wang, Zhengyang, et al.
Published: (2026)
by: Wang, Zhengyang, et al.
Published: (2026)
Aligning Language Models with Real-time Knowledge Editing
by: Tang, Chenming, et al.
Published: (2025)
by: Tang, Chenming, et al.
Published: (2025)
Towards Knowledge-Grounded Natural Language Understanding and Generation
by: Whitehouse, Chenxi
Published: (2024)
by: Whitehouse, Chenxi
Published: (2024)
Unsupervised Distractor Generation via Large Language Model Distilling and Counterfactual Contrastive Decoding
by: Qu, Fanyi, et al.
Published: (2024)
by: Qu, Fanyi, et al.
Published: (2024)
MHGraphBench: Knowledge Graph-Grounded Benchmarking of Mental Health Knowledge in Large Language Models
by: Liu, Weixin, et al.
Published: (2026)
by: Liu, Weixin, et al.
Published: (2026)
Evaluating the Capability of Large-scale Language Models on Chinese Grammatical Error Correction Task
by: Qu, Fanyi, et al.
Published: (2023)
by: Qu, Fanyi, et al.
Published: (2023)
Beyond Spurious Signals: Debiasing Multimodal Large Language Models via Counterfactual Inference and Adaptive Expert Routing
by: Wu, Zichen, et al.
Published: (2025)
by: Wu, Zichen, et al.
Published: (2025)
On the Thinking-Language Modeling Gap in Large Language Models
by: Liu, Chenxi, et al.
Published: (2025)
by: Liu, Chenxi, et al.
Published: (2025)
Large Language Models Might Not Care What You Are Saying: Prompt Format Beats Descriptions
by: Tang, Chenming, et al.
Published: (2024)
by: Tang, Chenming, et al.
Published: (2024)
A Comparative Study of Large Language Models and Human Personality Traits
by: Jiaqi, Wang, et al.
Published: (2025)
by: Jiaqi, Wang, et al.
Published: (2025)
Assessing the Performance of Chinese Open Source Large Language Models in Information Extraction Tasks
by: Cai, Yida, et al.
Published: (2024)
by: Cai, Yida, et al.
Published: (2024)
Unleashing Large Language Models' Proficiency in Zero-shot Essay Scoring
by: Lee, Sanwoo, et al.
Published: (2024)
by: Lee, Sanwoo, et al.
Published: (2024)
SimBench: Benchmarking the Ability of Large Language Models to Simulate Human Behaviors
by: Hu, Tiancheng, et al.
Published: (2025)
by: Hu, Tiancheng, et al.
Published: (2025)
Chain-of-Knowledge: Grounding Large Language Models via Dynamic Knowledge Adapting over Heterogeneous Sources
by: Li, Xingxuan, et al.
Published: (2023)
by: Li, Xingxuan, et al.
Published: (2023)
VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents
by: Hu, Jiliang, et al.
Published: (2025)
by: Hu, Jiliang, et al.
Published: (2025)
Closing the Confidence-Faithfulness Gap in Large Language Models
by: Miao, Miranda Muqing, et al.
Published: (2026)
by: Miao, Miranda Muqing, et al.
Published: (2026)
BrainBench: Exposing the Commonsense Reasoning Gap in Large Language Models
by: Tang, Yuzhe
Published: (2026)
by: Tang, Yuzhe
Published: (2026)
Grounding Gaps in Language Model Generations
by: Shaikh, Omar, et al.
Published: (2023)
by: Shaikh, Omar, et al.
Published: (2023)
"Lost-in-the-Later": Framework for Quantifying Contextual Grounding in Large Language Models
by: Tao, Yufei, et al.
Published: (2025)
by: Tao, Yufei, et al.
Published: (2025)
FoundaBench: Evaluating Chinese Fundamental Knowledge Capabilities of Large Language Models
by: Li, Wei, et al.
Published: (2024)
by: Li, Wei, et al.
Published: (2024)
Rank-Then-Score: Enhancing Large Language Models for Automated Essay Scoring
by: Cai, Yida, et al.
Published: (2025)
by: Cai, Yida, et al.
Published: (2025)
CCD-Bench: Probing Cultural Conflict in Large Language Model Decision-Making
by: Rahman, Hasibur, et al.
Published: (2025)
by: Rahman, Hasibur, et al.
Published: (2025)
A Survey of Uncertainty Estimation in LLMs: Theory Meets Practice
by: Huang, Hsiu-Yuan, et al.
Published: (2024)
by: Huang, Hsiu-Yuan, et al.
Published: (2024)
Unlocking the Power of LLM Uncertainty for Active In-Context Example Selection
by: Huang, Hsiu-Yuan, et al.
Published: (2024)
by: Huang, Hsiu-Yuan, et al.
Published: (2024)
Artificial Impressions: Evaluating Large Language Model Behavior Through the Lens of Trait Impressions
by: Deas, Nicholas, et al.
Published: (2025)
by: Deas, Nicholas, et al.
Published: (2025)
Eliciting Personality Traits in Large Language Models
by: Hilliard, Airlie, et al.
Published: (2024)
by: Hilliard, Airlie, et al.
Published: (2024)
Lost in Localization: Building RabakBench with Human-in-the-Loop Validation to Measure Multilingual Safety Gaps
by: Chua, Gabriel, et al.
Published: (2025)
by: Chua, Gabriel, et al.
Published: (2025)
Efficient Tuning of Large Language Models for Knowledge-Grounded Dialogue Generation
by: Zhang, Bo, et al.
Published: (2025)
by: Zhang, Bo, et al.
Published: (2025)
Does Visual Grounding Enhance the Understanding of Embodied Knowledge in Large Language Models?
by: Yang, Zhihui, et al.
Published: (2025)
by: Yang, Zhihui, et al.
Published: (2025)
REI-Bench: Can Embodied Agents Understand Vague Human Instructions in Task Planning?
by: Jiang, Chenxi, et al.
Published: (2025)
by: Jiang, Chenxi, et al.
Published: (2025)
CBT-Bench: Evaluating Large Language Models on Assisting Cognitive Behavior Therapy
by: Zhang, Mian, et al.
Published: (2024)
by: Zhang, Mian, et al.
Published: (2024)
Can Language Models Act as Knowledge Bases at Scale?
by: He, Qiyuan, et al.
Published: (2024)
by: He, Qiyuan, et al.
Published: (2024)
GroundAct: Can LLM Agents Ground Actions in Environmental States?
by: Wang, Zixuan, et al.
Published: (2025)
by: Wang, Zixuan, et al.
Published: (2025)
SI-Bench: Benchmarking Social Intelligence of Large Language Models in Human-to-Human Conversations
by: Huang, Shuai, et al.
Published: (2025)
by: Huang, Shuai, et al.
Published: (2025)
Probing Large Language Models from A Human Behavioral Perspective
by: Wang, Xintong, et al.
Published: (2023)
by: Wang, Xintong, et al.
Published: (2023)
CFMS: Towards Explainable and Fine-Grained Chinese Multimodal Sarcasm Detection Benchmark
by: Zhang, Junzhao, et al.
Published: (2026)
by: Zhang, Junzhao, et al.
Published: (2026)
ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models
by: Zhao, Yunhan, et al.
Published: (2026)
by: Zhao, Yunhan, et al.
Published: (2026)
ConflictBench: Evaluating Human-AI Conflict via Interactive and Visually Grounded Environments
by: Zhao, Weixiang, et al.
Published: (2026)
by: Zhao, Weixiang, et al.
Published: (2026)
V2P-Bench: Evaluating Video-Language Understanding with Visual Prompts for Better Human-Model Interaction
by: Zhao, Yiming, et al.
Published: (2025)
by: Zhao, Yiming, et al.
Published: (2025)
Guiding Clinical Reasoning with Large Language Models via Knowledge Seeds
by: WU, Jiageng, et al.
Published: (2024)
by: WU, Jiageng, et al.
Published: (2024)
Similar Items
-
Trait-Aware Policy Optimization for Autoregressive Multi-Trait Essay Scoring
by: Wang, Zhengyang, et al.
Published: (2026) -
Aligning Language Models with Real-time Knowledge Editing
by: Tang, Chenming, et al.
Published: (2025) -
Towards Knowledge-Grounded Natural Language Understanding and Generation
by: Whitehouse, Chenxi
Published: (2024) -
Unsupervised Distractor Generation via Large Language Model Distilling and Counterfactual Contrastive Decoding
by: Qu, Fanyi, et al.
Published: (2024) -
MHGraphBench: Knowledge Graph-Grounded Benchmarking of Mental Health Knowledge in Large Language Models
by: Liu, Weixin, et al.
Published: (2026)