From Reasoning to Generalization: Knowledge-Augmented LLMs for ARC Benchmark
Fuente:
arXiv
Saved in:
| Main Authors: | Lei, Chao, Lipovetzky, Nir, Ehinger, Krista A., Chang, Yanchuan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Planning-Driven Programming: A Large Language Model Programming Workflow
by: Lei, Chao, et al.
Published: (2024)
by: Lei, Chao, et al.
Published: (2024)
Generalized Planning for the Abstraction and Reasoning Corpus
by: Lei, Chao, et al.
Published: (2024)
by: Lei, Chao, et al.
Published: (2024)
Chasing Progress, Not Perfection: Revisiting Strategies for End-to-End LLM Plan Generation
by: Huang, Sukai, et al.
Published: (2024)
by: Huang, Sukai, et al.
Published: (2024)
State-Based Disassembly Planning
by: Lei, Chao, et al.
Published: (2025)
by: Lei, Chao, et al.
Published: (2025)
LLM-ARC: Enhancing LLMs with an Automated Reasoning Critic
by: Kalyanpur, Aditya, et al.
Published: (2024)
by: Kalyanpur, Aditya, et al.
Published: (2024)
KAG-Thinker: Interactive Thinking and Deep Reasoning in LLMs via Knowledge-Augmented Generation
by: Zhang, Dalong, et al.
Published: (2025)
by: Zhang, Dalong, et al.
Published: (2025)
ARC-TGI: Human-Validated Task Generators with Reasoning Chain Templates for ARC-AGI
by: Lehmann, Jens, et al.
Published: (2026)
by: Lehmann, Jens, et al.
Published: (2026)
Dialogue Benchmark Generation from Knowledge Graphs with Cost-Effective Retrieval-Augmented LLMs
by: Omar, Reham, et al.
Published: (2025)
by: Omar, Reham, et al.
Published: (2025)
CodeARC: Benchmarking Reasoning Capabilities of LLM Agents for Inductive Program Synthesis
by: Wei, Anjiang, et al.
Published: (2025)
by: Wei, Anjiang, et al.
Published: (2025)
KAG: Boosting LLMs in Professional Domains via Knowledge Augmented Generation
by: Liang, Lei, et al.
Published: (2024)
by: Liang, Lei, et al.
Published: (2024)
ReaRAG: Knowledge-guided Reasoning Enhances Factuality of Large Reasoning Models with Iterative Retrieval Augmented Generation
by: Lee, Zhicheng, et al.
Published: (2025)
by: Lee, Zhicheng, et al.
Published: (2025)
KALE: An Artwork Image Captioning System Augmented with Heterogeneous Graph
by: Jiang, Yanbei, et al.
Published: (2024)
by: Jiang, Yanbei, et al.
Published: (2024)
LocalBench: Benchmarking LLMs on County-Level Local Knowledge and Reasoning
by: Gao, Zihan, et al.
Published: (2025)
by: Gao, Zihan, et al.
Published: (2025)
Toward Structured Knowledge Reasoning: Contrastive Retrieval-Augmented Generation on Experience
by: Gu, Jiawei, et al.
Published: (2025)
by: Gu, Jiawei, et al.
Published: (2025)
Are LLMs Capable of Data-based Statistical and Causal Reasoning? Benchmarking Advanced Quantitative Reasoning with Data
by: Liu, Xiao, et al.
Published: (2024)
by: Liu, Xiao, et al.
Published: (2024)
Knowledge-Augmented Reasoning for EUAIA Compliance and Adversarial Robustness of LLMs
by: Momcilovic, Tomas Bueno, et al.
Published: (2024)
by: Momcilovic, Tomas Bueno, et al.
Published: (2024)
MediEval: A Unified Medical Benchmark for Patient-Contextual and Knowledge-Grounded Reasoning in LLMs
by: Qu, Zhan, et al.
Published: (2025)
by: Qu, Zhan, et al.
Published: (2025)
Towards Global Retrieval Augmented Generation: A Benchmark for Corpus-Level Reasoning
by: Luo, Qi, et al.
Published: (2025)
by: Luo, Qi, et al.
Published: (2025)
CausalARC: Abstract Reasoning with Causal World Models
by: Maasch, Jacqueline, et al.
Published: (2025)
by: Maasch, Jacqueline, et al.
Published: (2025)
TRACE the Evidence: Constructing Knowledge-Grounded Reasoning Chains for Retrieval-Augmented Generation
by: Fang, Jinyuan, et al.
Published: (2024)
by: Fang, Jinyuan, et al.
Published: (2024)
Benchmarking the Detection of LLMs-Generated Modern Chinese Poetry
by: Wang, Shanshan, et al.
Published: (2025)
by: Wang, Shanshan, et al.
Published: (2025)
SciRerankBench: Benchmarking Rerankers Towards Scientific Retrieval-Augmented Generated LLMs
by: Chen, Haotian, et al.
Published: (2025)
by: Chen, Haotian, et al.
Published: (2025)
MedReason: Eliciting Factual Medical Reasoning Steps in LLMs via Knowledge Graphs
by: Wu, Juncheng, et al.
Published: (2025)
by: Wu, Juncheng, et al.
Published: (2025)
Search and Refine During Think: Facilitating Knowledge Refinement for Improved Retrieval-Augmented Reasoning
by: Shi, Yaorui, et al.
Published: (2025)
by: Shi, Yaorui, et al.
Published: (2025)
MDBench: A Synthetic Multi-Document Reasoning Benchmark Generated with Knowledge Guidance
by: Peper, Joseph J., et al.
Published: (2025)
by: Peper, Joseph J., et al.
Published: (2025)
SuperCLUE-Math6: Graded Multi-Step Math Reasoning Benchmark for LLMs in Chinese
by: Xu, Liang, et al.
Published: (2024)
by: Xu, Liang, et al.
Published: (2024)
Beyond Perception: Evaluating Abstract Visual Reasoning through Multi-Stage Task
by: Jiang, Yanbei, et al.
Published: (2025)
by: Jiang, Yanbei, et al.
Published: (2025)
Human Goal Recognition as Bayesian Inference: Investigating the Impact of Actions, Timing, and Goal Solvability
by: Zhang, Chenyuan, et al.
Published: (2024)
by: Zhang, Chenyuan, et al.
Published: (2024)
Multi-Source Knowledge Pruning for Retrieval-Augmented Generation: A Benchmark and Empirical Study
by: Yu, Shuo, et al.
Published: (2024)
by: Yu, Shuo, et al.
Published: (2024)
Count-based Novelty Exploration in Classical Planning
by: Rosa, Giacomo, et al.
Published: (2024)
by: Rosa, Giacomo, et al.
Published: (2024)
SKA-Bench: A Fine-Grained Benchmark for Evaluating Structured Knowledge Understanding of LLMs
by: Liu, Zhiqiang, et al.
Published: (2025)
by: Liu, Zhiqiang, et al.
Published: (2025)
MTCMB: A Multi-Task Benchmark Framework for Evaluating LLMs on Knowledge, Reasoning, and Safety in Traditional Chinese Medicine
by: Kong, Shufeng, et al.
Published: (2025)
by: Kong, Shufeng, et al.
Published: (2025)
CBR-RAG: Case-Based Reasoning for Retrieval Augmented Generation in LLMs for Legal Question Answering
by: Wiratunga, Nirmalie, et al.
Published: (2024)
by: Wiratunga, Nirmalie, et al.
Published: (2024)
From Chains to Graphs: Self-Structured Reasoning for General-Domain LLMs
by: Chen, Yingjian, et al.
Published: (2026)
by: Chen, Yingjian, et al.
Published: (2026)
Do LLMs Understand Social Knowledge? Evaluating the Sociability of Large Language Models with SocKET Benchmark
by: Choi, Minje, et al.
Published: (2023)
by: Choi, Minje, et al.
Published: (2023)
Where Common Knowledge Cannot Be Formed, Common Belief Can -- Planning with Multi-Agent Belief Using Group Justified Perspectives
by: Hu, Guang, et al.
Published: (2024)
by: Hu, Guang, et al.
Published: (2024)
Nondeterministic Polynomial-time Problem Challenge: An Ever-Scaling Reasoning Benchmark for LLMs
by: Yang, Chang, et al.
Published: (2025)
by: Yang, Chang, et al.
Published: (2025)
NSA: Neuro-symbolic ARC Challenge
by: Batorski, Paweł, et al.
Published: (2025)
by: Batorski, Paweł, et al.
Published: (2025)
ARC-AGI-2 Technical Report
by: de Oliveira, Wallyson Lemes, et al.
Published: (2026)
by: de Oliveira, Wallyson Lemes, et al.
Published: (2026)
Reasoning over User Preferences: Knowledge Graph-Augmented LLMs for Explainable Conversational Recommendations
by: Qiu, Zhangchi, et al.
Published: (2024)
by: Qiu, Zhangchi, et al.
Published: (2024)
Similar Items
-
Planning-Driven Programming: A Large Language Model Programming Workflow
by: Lei, Chao, et al.
Published: (2024) -
Generalized Planning for the Abstraction and Reasoning Corpus
by: Lei, Chao, et al.
Published: (2024) -
Chasing Progress, Not Perfection: Revisiting Strategies for End-to-End LLM Plan Generation
by: Huang, Sukai, et al.
Published: (2024) -
State-Based Disassembly Planning
by: Lei, Chao, et al.
Published: (2025) -
LLM-ARC: Enhancing LLMs with an Automated Reasoning Critic
by: Kalyanpur, Aditya, et al.
Published: (2024)