Data Analysis and Performance Evaluation of Simulation Deduction Based on LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Shansi, Li, Min |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Fine-Grained and Thematic Evaluation of LLMs in Social Deduction Game
par: Kim, Byungjun, et autres
Publié: (2024)
par: Kim, Byungjun, et autres
Publié: (2024)
The World According to LLMs: How Geographic Origin Influences LLMs' Entity Deduction Capabilities
par: Lalai, Harsh Nishant, et autres
Publié: (2025)
par: Lalai, Harsh Nishant, et autres
Publié: (2025)
IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis
par: Li, Hanyu, et autres
Publié: (2025)
par: Li, Hanyu, et autres
Publié: (2025)
Werewolf Arena: A Case Study in LLM Evaluation via Social Deduction
par: Bailis, Suma, et autres
Publié: (2024)
par: Bailis, Suma, et autres
Publié: (2024)
Evaluation Ethics of LLMs in Legal Domain
par: Zhang, Ruizhe, et autres
Publié: (2024)
par: Zhang, Ruizhe, et autres
Publié: (2024)
Inductive-Deductive Strategy Reuse for Multi-Turn Instructional Dialogues
par: Ou, Jiao, et autres
Publié: (2024)
par: Ou, Jiao, et autres
Publié: (2024)
Revealing Algorithmic Deductive Circuits for Logical Reasoning
par: Nguyen, Phuong Minh, et autres
Publié: (2026)
par: Nguyen, Phuong Minh, et autres
Publié: (2026)
From Facts to Conclusions : Integrating Deductive Reasoning in Retrieval-Augmented LLMs
par: Mishra, Shubham, et autres
Publié: (2025)
par: Mishra, Shubham, et autres
Publié: (2025)
Hypothesis Testing Prompting Improves Deductive Reasoning in Large Language Models
par: Li, Yitian, et autres
Publié: (2024)
par: Li, Yitian, et autres
Publié: (2024)
Toward Mechanistic Explanation of Deductive Reasoning in Language Models
par: Maltoni, Davide, et autres
Publié: (2025)
par: Maltoni, Davide, et autres
Publié: (2025)
Investigating the Robustness of Deductive Reasoning with Large Language Models
par: Hoppe, Fabian, et autres
Publié: (2025)
par: Hoppe, Fabian, et autres
Publié: (2025)
MASLegalBench: Benchmarking Multi-Agent Systems in Deductive Legal Reasoning
par: Jing, Huihao, et autres
Publié: (2025)
par: Jing, Huihao, et autres
Publié: (2025)
DeduCE: Deductive Consistency as a Framework to Evaluate LLM Reasoning
par: Pandey, Atharva, et autres
Publié: (2025)
par: Pandey, Atharva, et autres
Publié: (2025)
The Role of Deductive and Inductive Reasoning in Large Language Models
par: Cai, Chengkun, et autres
Publié: (2024)
par: Cai, Chengkun, et autres
Publié: (2024)
How Clued up are LLMs? Evaluating Multi-Step Deductive Reasoning in a Text-Based Game Environment
par: Ansell, Rebecca, et autres
Publié: (2026)
par: Ansell, Rebecca, et autres
Publié: (2026)
Are Large Reasoning Models Good Translation Evaluators? Analysis and Performance Boost
par: Zhan, Runzhe, et autres
Publié: (2025)
par: Zhan, Runzhe, et autres
Publié: (2025)
Team-Based Self-Play With Dual Adaptive Weighting for Fine-Tuning LLMs
par: Li, Wu, et autres
Publié: (2026)
par: Li, Wu, et autres
Publié: (2026)
Comparing Inferential Strategies of Humans and Large Language Models in Deductive Reasoning
par: Mondorf, Philipp, et autres
Publié: (2024)
par: Mondorf, Philipp, et autres
Publié: (2024)
Synthesizing Post-Training Data for LLMs through Multi-Agent Simulation
par: Tang, Shuo, et autres
Publié: (2024)
par: Tang, Shuo, et autres
Publié: (2024)
JustLogic: A Comprehensive Benchmark for Evaluating Deductive Reasoning in Large Language Models
par: Chen, Michael K., et autres
Publié: (2025)
par: Chen, Michael K., et autres
Publié: (2025)
On Robustness and Reliability of Benchmark-Based Evaluation of LLMs
par: Lunardi, Riccardo, et autres
Publié: (2025)
par: Lunardi, Riccardo, et autres
Publié: (2025)
IDEA: Enhancing the Rule Learning Ability of Large Language Model Agent through Induction, Deduction, and Abduction
par: He, Kaiyu, et autres
Publié: (2024)
par: He, Kaiyu, et autres
Publié: (2024)
Data-Augmentation-Based Dialectal Adaptation for LLMs
par: Faisal, Fahim, et autres
Publié: (2024)
par: Faisal, Fahim, et autres
Publié: (2024)
MAQA: Evaluating Uncertainty Quantification in LLMs Regarding Data Uncertainty
par: Yang, Yongjin, et autres
Publié: (2024)
par: Yang, Yongjin, et autres
Publié: (2024)
ItD: Large Language Models Can Teach Themselves Induction through Deduction
par: Sun, Wangtao, et autres
Publié: (2024)
par: Sun, Wangtao, et autres
Publié: (2024)
How Far Are We from Intelligent Visual Deductive Reasoning?
par: Zhang, Yizhe, et autres
Publié: (2024)
par: Zhang, Yizhe, et autres
Publié: (2024)
Unlocking Recursive Thinking of LLMs: Alignment via Refinement
par: Zhang, Haoke, et autres
Publié: (2025)
par: Zhang, Haoke, et autres
Publié: (2025)
Do Large Language Models Have an English Accent? Evaluating and Improving the Naturalness of Multilingual LLMs
par: Guo, Yanzhu, et autres
Publié: (2024)
par: Guo, Yanzhu, et autres
Publié: (2024)
Towards Simulating Social Media Users with LLMs: Evaluating the Operational Validity of Conditioned Comment Prediction
par: Schwager, Nils, et autres
Publié: (2026)
par: Schwager, Nils, et autres
Publié: (2026)
Theorem-of-Thought: A Multi-Agent Framework for Abductive, Deductive, and Inductive Reasoning in Language Models
par: Abdaljalil, Samir, et autres
Publié: (2025)
par: Abdaljalil, Samir, et autres
Publié: (2025)
Project SHADOW: Symbolic Higher-order Associative Deductive reasoning On Wikidata using LM probing
par: Akl, Hanna Abi
Publié: (2024)
par: Akl, Hanna Abi
Publié: (2024)
DARE-bench: Evaluating Modeling and Instruction Fidelity of LLMs in Data Science
par: Shu, Fan, et autres
Publié: (2026)
par: Shu, Fan, et autres
Publié: (2026)
Encyclo-K: Evaluating LLMs with Dynamically Composed Knowledge Statements
par: Liang, Yiming, et autres
Publié: (2025)
par: Liang, Yiming, et autres
Publié: (2025)
Understanding the Role of LLMs in Multimodal Evaluation Benchmarks
par: Jiang, Botian, et autres
Publié: (2024)
par: Jiang, Botian, et autres
Publié: (2024)
SELT: Self-Evaluation Tree Search for LLMs with Task Decomposition
par: Wu, Mengsong, et autres
Publié: (2025)
par: Wu, Mengsong, et autres
Publié: (2025)
CharacterBox: Evaluating the Role-Playing Capabilities of LLMs in Text-Based Virtual Worlds
par: Wang, Lei, et autres
Publié: (2024)
par: Wang, Lei, et autres
Publié: (2024)
MoralBench: Moral Evaluation of LLMs
par: Ji, Jianchao, et autres
Publié: (2024)
par: Ji, Jianchao, et autres
Publié: (2024)
Leak, Cheat, Repeat: Data Contamination and Evaluation Malpractices in Closed-Source LLMs
par: Balloccu, Simone, et autres
Publié: (2024)
par: Balloccu, Simone, et autres
Publié: (2024)
From Guidelines to Guarantees: A Graph-Based Evaluation Harness for Domain-Specific Evaluation of LLMs
par: Lundin, Jessica M., et autres
Publié: (2025)
par: Lundin, Jessica M., et autres
Publié: (2025)
How Good Are LLMs for Literary Translation, Really? Literary Translation Evaluation with Humans and LLMs
par: Zhang, Ran, et autres
Publié: (2024)
par: Zhang, Ran, et autres
Publié: (2024)
Documents similaires
-
Fine-Grained and Thematic Evaluation of LLMs in Social Deduction Game
par: Kim, Byungjun, et autres
Publié: (2024) -
The World According to LLMs: How Geographic Origin Influences LLMs' Entity Deduction Capabilities
par: Lalai, Harsh Nishant, et autres
Publié: (2025) -
IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis
par: Li, Hanyu, et autres
Publié: (2025) -
Werewolf Arena: A Case Study in LLM Evaluation via Social Deduction
par: Bailis, Suma, et autres
Publié: (2024) -
Evaluation Ethics of LLMs in Legal Domain
par: Zhang, Ruizhe, et autres
Publié: (2024)