Accounting Reasoning in Large Language Models: Concepts, Evaluation, and Empirical Analysis
Fuente:
arXiv
Saved in:
| Main Authors: | Zhou, Jie, Chen, Xin, Zhang, Jie, Li, Zhe |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Evaluating Accounting Reasoning Capabilities of Large Language Models
by: Zhou, Jie, et al.
Published: (2026)
by: Zhou, Jie, et al.
Published: (2026)
An Empirical Analysis of Uncertainty in Large Language Model Evaluations
by: Xie, Qiujie, et al.
Published: (2025)
by: Xie, Qiujie, et al.
Published: (2025)
ConceptMath: A Bilingual Concept-wise Benchmark for Measuring Mathematical Reasoning of Large Language Models
by: Wu, Yanan, et al.
Published: (2024)
by: Wu, Yanan, et al.
Published: (2024)
An Empirical Study of Catastrophic Forgetting in Large Language Models During Continual Fine-tuning
by: Luo, Yun, et al.
Published: (2023)
by: Luo, Yun, et al.
Published: (2023)
The Dawn After the Dark: An Empirical Study on Factuality Hallucination in Large Language Models
by: Li, Junyi, et al.
Published: (2024)
by: Li, Junyi, et al.
Published: (2024)
Who Reasons in the Large Language Models?
by: Shao, Jie, et al.
Published: (2025)
by: Shao, Jie, et al.
Published: (2025)
Automatic Knowledge Graph Construction for Judicial Cases
by: Zhou, Jie, et al.
Published: (2024)
by: Zhou, Jie, et al.
Published: (2024)
Fin-PRM: A Domain-Specialized Process Reward Model for Financial Reasoning in Large Language Models
by: Zhu, Jie, et al.
Published: (2025)
by: Zhu, Jie, et al.
Published: (2025)
Prompting Large Language Models for Counterfactual Generation: An Empirical Study
by: Li, Yongqi, et al.
Published: (2023)
by: Li, Yongqi, et al.
Published: (2023)
An Empirical Analysis on Large Language Models in Debate Evaluation
by: Liu, Xinyi, et al.
Published: (2024)
by: Liu, Xinyi, et al.
Published: (2024)
Code-Driven Inductive Synthesis: Enhancing Reasoning Abilities of Large Language Models with Sequences
by: Chen, Kedi, et al.
Published: (2025)
by: Chen, Kedi, et al.
Published: (2025)
EffiReason-Bench: A Unified Benchmark for Evaluating and Advancing Efficient Reasoning in Large Language Models
by: Huang, Junquan, et al.
Published: (2025)
by: Huang, Junquan, et al.
Published: (2025)
An Empirical Study on Parameter-Efficient Fine-Tuning for MultiModal Large Language Models
by: Zhou, Xiongtao, et al.
Published: (2024)
by: Zhou, Xiongtao, et al.
Published: (2024)
An Empirical Study of Many-to-Many Summarization with Large Language Models
by: Wang, Jiaan, et al.
Published: (2025)
by: Wang, Jiaan, et al.
Published: (2025)
Evaluating Robustness of Large Audio Language Models to Audio Injection: An Empirical Study
by: Hou, Guanyu, et al.
Published: (2025)
by: Hou, Guanyu, et al.
Published: (2025)
Incorporating Self-Rewriting into Large Language Model Reasoning Reinforcement
by: Yao, Jiashu, et al.
Published: (2025)
by: Yao, Jiashu, et al.
Published: (2025)
Character as a Latent Variable in Large Language Models: A Mechanistic Account of Emergent Misalignment and Conditional Safety Failures
by: Su, Yanghao, et al.
Published: (2026)
by: Su, Yanghao, et al.
Published: (2026)
DiaHalu: A Dialogue-level Hallucination Evaluation Benchmark for Large Language Models
by: Chen, Kedi, et al.
Published: (2024)
by: Chen, Kedi, et al.
Published: (2024)
Benchmarking Knowledge Boundary for Large Language Models: A Different Perspective on Model Evaluation
by: Yin, Xunjian, et al.
Published: (2024)
by: Yin, Xunjian, et al.
Published: (2024)
An Empirical Study on Eliciting and Improving R1-like Reasoning Models
by: Chen, Zhipeng, et al.
Published: (2025)
by: Chen, Zhipeng, et al.
Published: (2025)
A Survey of Inductive Reasoning for Large Language Models
by: Chen, Kedi, et al.
Published: (2025)
by: Chen, Kedi, et al.
Published: (2025)
Boosting Large Language Models with Continual Learning for Aspect-based Sentiment Analysis
by: Ding, Xuanwen, et al.
Published: (2024)
by: Ding, Xuanwen, et al.
Published: (2024)
Multilingual Machine Translation with Large Language Models: Empirical Results and Analysis
by: Zhu, Wenhao, et al.
Published: (2023)
by: Zhu, Wenhao, et al.
Published: (2023)
Exploring Mathematical Extrapolation of Large Language Models with Synthetic Data
by: Li, Haolong, et al.
Published: (2024)
by: Li, Haolong, et al.
Published: (2024)
Large Language Models Cannot Self-Correct Reasoning Yet
by: Huang, Jie, et al.
Published: (2023)
by: Huang, Jie, et al.
Published: (2023)
On the Same Wavelength? Evaluating Pragmatic Reasoning in Language Models across Broad Concepts
by: Qiu, Linlu, et al.
Published: (2025)
by: Qiu, Linlu, et al.
Published: (2025)
Dissecting Long-Chain-of-Thought Reasoning Models: An Empirical Study
by: Mu, Yongyu, et al.
Published: (2025)
by: Mu, Yongyu, et al.
Published: (2025)
CityLens: Evaluating Large Vision-Language Models for Urban Socioeconomic Sensing
by: Liu, Tianhui, et al.
Published: (2025)
by: Liu, Tianhui, et al.
Published: (2025)
CMM-Math: A Chinese Multimodal Math Dataset To Evaluate and Enhance the Mathematics Reasoning of Large Multimodal Models
by: Liu, Wentao, et al.
Published: (2024)
by: Liu, Wentao, et al.
Published: (2024)
Guiding Clinical Reasoning with Large Language Models via Knowledge Seeds
by: WU, Jiageng, et al.
Published: (2024)
by: WU, Jiageng, et al.
Published: (2024)
SocialMaze: A Benchmark for Evaluating Social Reasoning in Large Language Models
by: Xu, Zixiang, et al.
Published: (2025)
by: Xu, Zixiang, et al.
Published: (2025)
Kuaiji: the First Chinese Accounting Large Language Model
by: Luo, Jiayuan, et al.
Published: (2024)
by: Luo, Jiayuan, et al.
Published: (2024)
PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models
by: Qiu, Shi, et al.
Published: (2025)
by: Qiu, Shi, et al.
Published: (2025)
DARG: Dynamic Evaluation of Large Language Models via Adaptive Reasoning Graph
by: Zhang, Zhehao, et al.
Published: (2024)
by: Zhang, Zhehao, et al.
Published: (2024)
Reasoning as State Transition: A Representational Analysis of Reasoning Evolution in Large Language Models
by: Zhang, Siyuan, et al.
Published: (2026)
by: Zhang, Siyuan, et al.
Published: (2026)
Assessing Judging Bias in Large Reasoning Models: An Empirical Study
by: Wang, Qian, et al.
Published: (2025)
by: Wang, Qian, et al.
Published: (2025)
A Comprehensive Analysis of the Effectiveness of Large Language Models as Automatic Dialogue Evaluators
by: Zhang, Chen, et al.
Published: (2023)
by: Zhang, Chen, et al.
Published: (2023)
How Interpretable are Reasoning Explanations from Prompting Large Language Models?
by: Yeo, Wei Jie, et al.
Published: (2024)
by: Yeo, Wei Jie, et al.
Published: (2024)
CRAT: A Multi-Agent Framework for Causality-Enhanced Reflective and Retrieval-Augmented Translation with Large Language Models
by: Chen, Meiqi, et al.
Published: (2024)
by: Chen, Meiqi, et al.
Published: (2024)
Can Large Language Models Identify Implicit Suicidal Ideation? An Empirical Evaluation
by: Li, Tong, et al.
Published: (2025)
by: Li, Tong, et al.
Published: (2025)
Similar Items
-
Evaluating Accounting Reasoning Capabilities of Large Language Models
by: Zhou, Jie, et al.
Published: (2026) -
An Empirical Analysis of Uncertainty in Large Language Model Evaluations
by: Xie, Qiujie, et al.
Published: (2025) -
ConceptMath: A Bilingual Concept-wise Benchmark for Measuring Mathematical Reasoning of Large Language Models
by: Wu, Yanan, et al.
Published: (2024) -
An Empirical Study of Catastrophic Forgetting in Large Language Models During Continual Fine-tuning
by: Luo, Yun, et al.
Published: (2023) -
The Dawn After the Dark: An Empirical Study on Factuality Hallucination in Large Language Models
by: Li, Junyi, et al.
Published: (2024)