X-RAY: Mapping LLM Reasoning Capability via Formalized and Calibrated Probes
Fuente:
arXiv
Guardado en:
| Autores principales: | Tianxi, Gao, Yufan, Cai, Yusi, Yuan, Song, Dong Jin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Towards Trustworthy Legal AI through LLM Agents and Formal Reasoning
por: Chen, Linze, et al.
Publicado: (2025)
por: Chen, Linze, et al.
Publicado: (2025)
Which Changes Matter? Towards Trustworthy Legal AI via Relevance-Sensitive Evaluation and Solver-Grounded Reasoning
por: Linze, Chen, et al.
Publicado: (2026)
por: Linze, Chen, et al.
Publicado: (2026)
Uncertainty Reasoning with Large Language Models for Explainable Disease Diagnosis
por: Fan, Xiaoyang, et al.
Publicado: (2026)
por: Fan, Xiaoyang, et al.
Publicado: (2026)
Let's Reason Formally: Natural-Formal Hybrid Reasoning Enhances LLM's Math Capability
por: Wang, Ruida, et al.
Publicado: (2025)
por: Wang, Ruida, et al.
Publicado: (2025)
Capturing LLM Capabilities via Evidence-Calibrated Query Clustering
por: Wu, Fangzhou, et al.
Publicado: (2026)
por: Wu, Fangzhou, et al.
Publicado: (2026)
Absurd World: A Simple Yet Powerful Method to Absurdify the Real-world for Probing LLM Reasoning Capabilities
por: Albright, Ryan, et al.
Publicado: (2026)
por: Albright, Ryan, et al.
Publicado: (2026)
Evaluating the Formal Reasoning Capabilities of Large Language Models through Chomsky Hierarchy
por: Dong, Yihong, et al.
Publicado: (2026)
por: Dong, Yihong, et al.
Publicado: (2026)
Self-Consistency Boosts Calibration for Math Reasoning
por: Wang, Ante, et al.
Publicado: (2024)
por: Wang, Ante, et al.
Publicado: (2024)
Latent Causal Probing: A Formal Perspective on Probing with Causal Models of Data
por: Jin, Charles, et al.
Publicado: (2024)
por: Jin, Charles, et al.
Publicado: (2024)
Prefix-Safe Bayesian Belief Tracking for LLM Reasoning Reliability:Separating Calibration from Ranking
por: Song, Zhenghan, et al.
Publicado: (2026)
por: Song, Zhenghan, et al.
Publicado: (2026)
OptMerge: Unifying Multimodal LLM Capabilities and Modalities via Model Merging
por: Wei, Yongxian, et al.
Publicado: (2025)
por: Wei, Yongxian, et al.
Publicado: (2025)
Do Large Language Models Excel in Complex Logical Reasoning with Formal Language?
por: Jiang, Jin, et al.
Publicado: (2025)
por: Jiang, Jin, et al.
Publicado: (2025)
ET-Agent: Incentivizing Effective Tool-Integrated Reasoning Agent via Behavior Calibration
por: Chen, Yifei, et al.
Publicado: (2026)
por: Chen, Yifei, et al.
Publicado: (2026)
Unleashing LLM Reasoning Capability via Scalable Question Synthesis from Scratch
por: Ding, Yuyang, et al.
Publicado: (2024)
por: Ding, Yuyang, et al.
Publicado: (2024)
Does Math Reasoning Improve General LLM Capabilities? Understanding Transferability of LLM Reasoning
por: Huan, Maggie, et al.
Publicado: (2025)
por: Huan, Maggie, et al.
Publicado: (2025)
Learn to Think: Bootstrapping LLM Reasoning Capability Through Graph Representation Learning
por: Gao, Hang, et al.
Publicado: (2025)
por: Gao, Hang, et al.
Publicado: (2025)
WorkForceAgent-R1: Incentivizing Reasoning Capability in LLM-based Web Agents via Reinforcement Learning
por: Zhuang, Yuchen, et al.
Publicado: (2025)
por: Zhuang, Yuchen, et al.
Publicado: (2025)
PEIRCE: Unifying Material and Formal Reasoning via LLM-Driven Neuro-Symbolic Refinement
por: Quan, Xin, et al.
Publicado: (2025)
por: Quan, Xin, et al.
Publicado: (2025)
Mitigating LLM Hallucination via Behaviorally Calibrated Reinforcement Learning
por: Wu, Jiayun, et al.
Publicado: (2025)
por: Wu, Jiayun, et al.
Publicado: (2025)
The Fusion of Large Language Models and Formal Methods for Trustworthy AI Agents: A Roadmap
por: Zhang, Yedi, et al.
Publicado: (2024)
por: Zhang, Yedi, et al.
Publicado: (2024)
Calibrating LLM Judges: Linear Probes for Fast and Reliable Uncertainty Estimation
por: Radharapu, Bhaktipriya, et al.
Publicado: (2025)
por: Radharapu, Bhaktipriya, et al.
Publicado: (2025)
VERGE: Formal Refinement and Guidance Engine for Verifiable LLM Reasoning
por: Singh, Vikash, et al.
Publicado: (2026)
por: Singh, Vikash, et al.
Publicado: (2026)
Cost-optimal Sequential Testing via Doubly Robust Q-learning
por: Zhou, Doudou, et al.
Publicado: (2026)
por: Zhou, Doudou, et al.
Publicado: (2026)
Aria: An Agent For Retrieval and Iterative Auto-Formalization via Dependency Graph
por: Wang, Hanyu, et al.
Publicado: (2025)
por: Wang, Hanyu, et al.
Publicado: (2025)
CipherBank: Exploring the Boundary of LLM Reasoning Capabilities through Cryptography Challenges
por: Li, Yu, et al.
Publicado: (2025)
por: Li, Yu, et al.
Publicado: (2025)
Online Reasoning Calibration: Test-Time Training Enables Generalizable Conformal LLM Reasoning
por: Zhou, Cai, et al.
Publicado: (2026)
por: Zhou, Cai, et al.
Publicado: (2026)
Robust Answers, Fragile Logic: Probing the Decoupling Hypothesis in LLM Reasoning
por: Jiang, Enyi, et al.
Publicado: (2025)
por: Jiang, Enyi, et al.
Publicado: (2025)
Self-Route: Automatic Mode Switching via Capability Estimation for Efficient Reasoning
por: He, Yang, et al.
Publicado: (2025)
por: He, Yang, et al.
Publicado: (2025)
FM-Agent: Scaling Formal Methods to Large Systems via LLM-Based Hoare-Style Reasoning
por: Ding, Haoran, et al.
Publicado: (2026)
por: Ding, Haoran, et al.
Publicado: (2026)
Intermediate Languages Matter: Formal Choice Drives Neurosymbolic LLM Reasoning
por: Beiser, Alexander, et al.
Publicado: (2025)
por: Beiser, Alexander, et al.
Publicado: (2025)
APOLLO: Automated LLM and Lean Collaboration for Advanced Formal Reasoning
por: Ospanov, Azim, et al.
Publicado: (2025)
por: Ospanov, Azim, et al.
Publicado: (2025)
GlobalDentBench: A Multinational Benchmark for Evaluating LLM Clinical Reasoning in Dentistry with Expert Calibration
por: Zhao, Junjie, et al.
Publicado: (2026)
por: Zhao, Junjie, et al.
Publicado: (2026)
FormalMATH: Benchmarking Formal Mathematical Reasoning of Large Language Models
por: Yu, Zhouliang, et al.
Publicado: (2025)
por: Yu, Zhouliang, et al.
Publicado: (2025)
Uncovering Hidden Correctness in LLM Causal Reasoning via Symbolic Verification
por: He, Paul, et al.
Publicado: (2026)
por: He, Paul, et al.
Publicado: (2026)
Learning Like Humans: Advancing LLM Reasoning Capabilities via Adaptive Difficulty Curriculum Learning and Expert-Guided Self-Reformulation
por: Zhang, Enci, et al.
Publicado: (2025)
por: Zhang, Enci, et al.
Publicado: (2025)
Discovering Novel LLM Experts via Task-Capability Coevolution
por: Dai, Andrew, et al.
Publicado: (2026)
por: Dai, Andrew, et al.
Publicado: (2026)
Reinforcement Learning vs. Distillation: Understanding Accuracy and Capability in LLM Reasoning
por: Kim, Minwu, et al.
Publicado: (2025)
por: Kim, Minwu, et al.
Publicado: (2025)
CADMAS-CTX: Contextual Capability Calibration for Multi-Agent Delegation
por: Qiao, Chuhan
Publicado: (2026)
por: Qiao, Chuhan
Publicado: (2026)
Meta-Memory: Retrieving and Integrating Semantic-Spatial Memories for Robot Spatial Reasoning
por: Mao, Yufan, et al.
Publicado: (2025)
por: Mao, Yufan, et al.
Publicado: (2025)
Are Your LLMs Capable of Stable Reasoning?
por: Liu, Junnan, et al.
Publicado: (2024)
por: Liu, Junnan, et al.
Publicado: (2024)
Ejemplares similares
-
Towards Trustworthy Legal AI through LLM Agents and Formal Reasoning
por: Chen, Linze, et al.
Publicado: (2025) -
Which Changes Matter? Towards Trustworthy Legal AI via Relevance-Sensitive Evaluation and Solver-Grounded Reasoning
por: Linze, Chen, et al.
Publicado: (2026) -
Uncertainty Reasoning with Large Language Models for Explainable Disease Diagnosis
por: Fan, Xiaoyang, et al.
Publicado: (2026) -
Let's Reason Formally: Natural-Formal Hybrid Reasoning Enhances LLM's Math Capability
por: Wang, Ruida, et al.
Publicado: (2025) -
Capturing LLM Capabilities via Evidence-Calibrated Query Clustering
por: Wu, Fangzhou, et al.
Publicado: (2026)