ARCHE: A Novel Task to Evaluate LLMs on Latent Reasoning Chain Extraction
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Pengze, Liu, Jiaqi, Yu, Junchi, Liu, Lihao, Ding, Mingyu, Ouyang, Wanli, Tang, Shixiang, Chen, Xi |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Mimicking the Physicist's Eye:A VLM-centric Approach for Physics Formula Discovery
by: Liu, Jiaqi, et al.
Published: (2025)
by: Liu, Jiaqi, et al.
Published: (2025)
Hidden in Plain Sight: Visual-to-Symbolic Analytical Solution Inference from Field Visualizations
by: Li, Pengze, et al.
Published: (2026)
by: Li, Pengze, et al.
Published: (2026)
PhysUniBench: A Multi-Modal Physics Reasoning Benchmark at Undergraduate Level
by: Wang, Lintao, et al.
Published: (2025)
by: Wang, Lintao, et al.
Published: (2025)
ResearchBench: Benchmarking LLMs in Scientific Discovery via Inspiration-Based Task Decomposition
by: Liu, Yujie, et al.
Published: (2025)
by: Liu, Yujie, et al.
Published: (2025)
Dynamic Knowledge Exchange and Dual-diversity Review: Concisely Unleashing the Potential of a Multi-Agent Research Team
by: Yu, Weilun, et al.
Published: (2025)
by: Yu, Weilun, et al.
Published: (2025)
MotionGPT: Finetuned LLMs Are General-Purpose Motion Generators
by: Zhang, Yaqi, et al.
Published: (2023)
by: Zhang, Yaqi, et al.
Published: (2023)
CPRet: A Dataset, Benchmark, and Model for Retrieval in Competitive Programming
by: Deng, Han, et al.
Published: (2025)
by: Deng, Han, et al.
Published: (2025)
POLIS-Bench: Towards Multi-Dimensional Evaluation of LLMs for Bilingual Policy Tasks in Governmental Scenarios
by: Yang, Tingyue, et al.
Published: (2025)
by: Yang, Tingyue, et al.
Published: (2025)
DetToolChain: A New Prompting Paradigm to Unleash Detection Ability of MLLM
by: Wu, Yixuan, et al.
Published: (2024)
by: Wu, Yixuan, et al.
Published: (2024)
PricingLogic: Evaluating LLMs Reasoning on Complex Tourism Pricing Tasks
by: Liu, Yunuo, et al.
Published: (2025)
by: Liu, Yunuo, et al.
Published: (2025)
Pragmatic Inference Chain (PIC) Improving LLMs' Reasoning of Authentic Implicit Toxic Language
by: Chen, Xi, et al.
Published: (2025)
by: Chen, Xi, et al.
Published: (2025)
LLM Reasoning Is Latent, Not the Chain of Thought
by: Wang, Wenshuo
Published: (2026)
by: Wang, Wenshuo
Published: (2026)
Latent Chain-of-Thought as Planning: Decoupling Reasoning from Verbalization
by: Wang, Jiecong, et al.
Published: (2026)
by: Wang, Jiecong, et al.
Published: (2026)
Structured Self-Consistency:A Multi-Task Evaluation of LLMs on VirtualHome
by: Xu, Jiaqi, et al.
Published: (2026)
by: Xu, Jiaqi, et al.
Published: (2026)
How Well Do LLMs Perform on the Simplest Long-Chain Reasoning Tasks: An Empirical Study on the Equivalence Class Problem
by: Zheng, Chun, et al.
Published: (2026)
by: Zheng, Chun, et al.
Published: (2026)
Hulk: A Universal Knowledge Translator for Human-Centric Tasks
by: Wang, Yizhou, et al.
Published: (2023)
by: Wang, Yizhou, et al.
Published: (2023)
AI-for-Science Low-code Platform with Bayesian Adversarial Multi-Agent Framework
by: Zeng, Zihang, et al.
Published: (2026)
by: Zeng, Zihang, et al.
Published: (2026)
Human-Centric Foundation Models: Perception, Generation and Agentic Modeling
by: Tang, Shixiang, et al.
Published: (2025)
by: Tang, Shixiang, et al.
Published: (2025)
GraphGen: Enhancing Supervised Fine-Tuning for LLMs with Knowledge-Driven Synthetic Data Generation
by: Chen, Zihong, et al.
Published: (2025)
by: Chen, Zihong, et al.
Published: (2025)
A Comprehensive Survey on 3D Content Generation
by: Liu, Jian, et al.
Published: (2024)
by: Liu, Jian, et al.
Published: (2024)
S3Mem: Structured Spatiotemporal Scene-Event Memory for Long-Horizon Interactive Question Answering
by: Su, Encheng, et al.
Published: (2026)
by: Su, Encheng, et al.
Published: (2026)
The Geometry of Self-Verification in a Task-Specific Reasoning Model
by: Lee, Andrew, et al.
Published: (2025)
by: Lee, Andrew, et al.
Published: (2025)
Latent Chain-of-Thought for Visual Reasoning
by: Sun, Guohao, et al.
Published: (2025)
by: Sun, Guohao, et al.
Published: (2025)
Reasoning via Video: The First Evaluation of Video Models' Reasoning Abilities through Maze-Solving Tasks
by: Yang, Cheng, et al.
Published: (2025)
by: Yang, Cheng, et al.
Published: (2025)
Autonomous Evaluation of LLMs for Truth Maintenance and Reasoning Tasks
by: Karia, Rushang, et al.
Published: (2024)
by: Karia, Rushang, et al.
Published: (2024)
From Chains to Graphs: Self-Structured Reasoning for General-Domain LLMs
by: Chen, Yingjian, et al.
Published: (2026)
by: Chen, Yingjian, et al.
Published: (2026)
MTCMB: A Multi-Task Benchmark Framework for Evaluating LLMs on Knowledge, Reasoning, and Safety in Traditional Chinese Medicine
by: Kong, Shufeng, et al.
Published: (2025)
by: Kong, Shufeng, et al.
Published: (2025)
LaRS: Latent Reasoning Skills for Chain-of-Thought Reasoning
by: Xu, Zifan, et al.
Published: (2023)
by: Xu, Zifan, et al.
Published: (2023)
Learning Modal-Mixed Chain-of-Thought Reasoning with Latent Embeddings
by: Shao, Yifei, et al.
Published: (2026)
by: Shao, Yifei, et al.
Published: (2026)
THE-Tree: Can Tracing Historical Evolution Enhance Scientific Verification and Reasoning?
by: Wang, Xin, et al.
Published: (2025)
by: Wang, Xin, et al.
Published: (2025)
Are Reasoning LLMs Robust to Interventions on Their Chain-of-Thought?
by: von Recum, Alexander, et al.
Published: (2026)
by: von Recum, Alexander, et al.
Published: (2026)
Evaluating the Logical Reasoning Abilities of Large Reasoning Models
by: Liu, Hanmeng, et al.
Published: (2025)
by: Liu, Hanmeng, et al.
Published: (2025)
SciIF: Benchmarking Scientific Instruction Following Towards Rigorous Scientific Intelligence
by: Su, Encheng, et al.
Published: (2026)
by: Su, Encheng, et al.
Published: (2026)
Reasoning Beyond Chain-of-Thought: A Latent Computational Mode in Large Language Models
by: He, Zhenghao, et al.
Published: (2026)
by: He, Zhenghao, et al.
Published: (2026)
Data-Chain Backdoor: Do You Trust Diffusion Models as Generative Data Supplier?
by: Lu, Junchi, et al.
Published: (2025)
by: Lu, Junchi, et al.
Published: (2025)
DRAFT-RL: Multi-Agent Chain-of-Draft Reasoning for Reinforcement Learning-Enhanced LLMs
by: Li, Yuanhao, et al.
Published: (2025)
by: Li, Yuanhao, et al.
Published: (2025)
LLMSense: Harnessing LLMs for High-level Reasoning Over Spatiotemporal Sensor Traces
by: Ouyang, Xiaomin, et al.
Published: (2024)
by: Ouyang, Xiaomin, et al.
Published: (2024)
Schema Lineage Extraction at Scale: Multilingual Pipelines, Composite Evaluation, and Language-Model Benchmarks
by: Yin, Jiaqi, et al.
Published: (2025)
by: Yin, Jiaqi, et al.
Published: (2025)
Thought Propagation: An Analogical Approach to Complex Reasoning with Large Language Models
by: Yu, Junchi, et al.
Published: (2023)
by: Yu, Junchi, et al.
Published: (2023)
Beyond Chain-of-Thought: A Survey of Chain-of-X Paradigms for LLMs
by: Xia, Yu, et al.
Published: (2024)
by: Xia, Yu, et al.
Published: (2024)
Similar Items
-
Mimicking the Physicist's Eye:A VLM-centric Approach for Physics Formula Discovery
by: Liu, Jiaqi, et al.
Published: (2025) -
Hidden in Plain Sight: Visual-to-Symbolic Analytical Solution Inference from Field Visualizations
by: Li, Pengze, et al.
Published: (2026) -
PhysUniBench: A Multi-Modal Physics Reasoning Benchmark at Undergraduate Level
by: Wang, Lintao, et al.
Published: (2025) -
ResearchBench: Benchmarking LLMs in Scientific Discovery via Inspiration-Based Task Decomposition
by: Liu, Yujie, et al.
Published: (2025) -
Dynamic Knowledge Exchange and Dual-diversity Review: Concisely Unleashing the Potential of a Multi-Agent Research Team
by: Yu, Weilun, et al.
Published: (2025)