Beyond Scalars: Evaluating and Understanding LLM Reasoning via Geometric Progress and Stability
Fuente:
arXiv
Guardado en:
| Autores principales: | Jiang, Xinyan, Liu, Ninghao, Wang, Di, Hu, Lijie |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Global Evolutionary Steering: Refining Activation Steering Control via Cross-Layer Consistency
por: Jiang, Xinyan, et al.
Publicado: (2026)
por: Jiang, Xinyan, et al.
Publicado: (2026)
Understanding In-context Learning of Addition via Activation Subspaces
por: Hu, Xinyan, et al.
Publicado: (2025)
por: Hu, Xinyan, et al.
Publicado: (2025)
Mechanistic Unveiling of Transformer Circuits: Self-Influence as a Key to Model Reasoning
por: Zhang, Lin, et al.
Publicado: (2025)
por: Zhang, Lin, et al.
Publicado: (2025)
Adaptive Multi-Subspace Representation Steering for Attribute Alignment in Large Language Models
por: Jiang, Xinyan, et al.
Publicado: (2025)
por: Jiang, Xinyan, et al.
Publicado: (2025)
Understanding the Dynamics of Demonstration Conflict in In-Context Learning
por: Jiao, Difan, et al.
Publicado: (2026)
por: Jiao, Difan, et al.
Publicado: (2026)
Predicting LLM Output Length via Entropy-Guided Representations
por: Xie, Huanyi, et al.
Publicado: (2026)
por: Xie, Huanyi, et al.
Publicado: (2026)
Improving Interpretation Faithfulness for Vision Transformers
por: Hu, Lijie, et al.
Publicado: (2023)
por: Hu, Lijie, et al.
Publicado: (2023)
Beyond Accuracy: A Geometric Stability Analysis of Large Language Models in Chess Evaluation
por: Song, Xidan, et al.
Publicado: (2025)
por: Song, Xidan, et al.
Publicado: (2025)
EAP-GP: Mitigating Saturation Effect in Gradient-based Automated Circuit Identification
por: Zhang, Lin, et al.
Publicado: (2025)
por: Zhang, Lin, et al.
Publicado: (2025)
MITS: Enhanced Tree Search Reasoning for LLMs via Pointwise Mutual Information
por: Li, Jiaxi, et al.
Publicado: (2025)
por: Li, Jiaxi, et al.
Publicado: (2025)
Understanding Reasoning in Chain-of-Thought from the Hopfieldian View
por: Hu, Lijie, et al.
Publicado: (2024)
por: Hu, Lijie, et al.
Publicado: (2024)
Evaluating LLM Reasoning Beyond Correctness and CoT
por: Abbasloo, Soheil
Publicado: (2025)
por: Abbasloo, Soheil
Publicado: (2025)
Beyond Accuracy: Evaluating Strategy Diversity in LLM Mathematical Reasoning
por: Yang, Xia, et al.
Publicado: (2026)
por: Yang, Xia, et al.
Publicado: (2026)
When Modalities Conflict: How Unimodal Reasoning Uncertainty Governs Preference Dynamics in MLLMs
por: Zhang, Zhuoran, et al.
Publicado: (2025)
por: Zhang, Zhuoran, et al.
Publicado: (2025)
Enhancing LLM Steering through Sparse Autoencoder-Based Vector Refinement
por: Wang, Anyi, et al.
Publicado: (2025)
por: Wang, Anyi, et al.
Publicado: (2025)
Beyond Scores: Diagnostic LLM Evaluation via Fine-Grained Abilities
por: Zhang, Xu, et al.
Publicado: (2026)
por: Zhang, Xu, et al.
Publicado: (2026)
TRON: Targeted Rule-Verifiable Online Environments for Visual Reasoning RL
por: Yang, Tianze, et al.
Publicado: (2026)
por: Yang, Tianze, et al.
Publicado: (2026)
Beyond Chemical QA: Evaluating LLM's Chemical Reasoning with Modular Chemical Operations
por: Li, Hao, et al.
Publicado: (2025)
por: Li, Hao, et al.
Publicado: (2025)
Visual Self-Fulfilling Alignment: Shaping Safety-Oriented Personas via Threat-Related Images
por: Yang, Qishun, et al.
Publicado: (2026)
por: Yang, Qishun, et al.
Publicado: (2026)
ReasonAudio: A Benchmark for Evaluating Reasoning Beyond Matching in Text-Audio Retrieval
por: Zhang, Honglei, et al.
Publicado: (2026)
por: Zhang, Honglei, et al.
Publicado: (2026)
Beyond Markovian: Reflective Exploration via Bayes-Adaptive RL for LLM Reasoning
por: Zhang, Shenao, et al.
Publicado: (2025)
por: Zhang, Shenao, et al.
Publicado: (2025)
LLM-BABYBENCH: Understanding and Evaluating Grounded Planning and Reasoning in LLMs
por: Choukrani, Omar, et al.
Publicado: (2025)
por: Choukrani, Omar, et al.
Publicado: (2025)
Controlling Repetition in Protein Language Models
por: Zhang, Jiahao, et al.
Publicado: (2026)
por: Zhang, Jiahao, et al.
Publicado: (2026)
Do MLLMs Really Understand Space? A Mathematical Reasoning Evaluation
por: Lu, Shuo, et al.
Publicado: (2026)
por: Lu, Shuo, et al.
Publicado: (2026)
GeoFM: Enhancing Geometric Reasoning of MLLMs via Synthetic Data Generation through Formal Language
por: Zhang, Yuhao, et al.
Publicado: (2025)
por: Zhang, Yuhao, et al.
Publicado: (2025)
SafeSieve: From Heuristics to Experience in Progressive Pruning for LLM-based Multi-Agent Communication
por: Zhang, Ruijia, et al.
Publicado: (2025)
por: Zhang, Ruijia, et al.
Publicado: (2025)
From Data-Centric to Sample-Centric: Enhancing LLM Reasoning via Progressive Optimization
por: Chen, Xinjie, et al.
Publicado: (2025)
por: Chen, Xinjie, et al.
Publicado: (2025)
On LLM-Based Scientific Inductive Reasoning Beyond Equations
por: Lin, Brian S., et al.
Publicado: (2025)
por: Lin, Brian S., et al.
Publicado: (2025)
Beyond Input Activations: Identifying Influential Latents by Gradient Sparse Autoencoders
por: Shu, Dong, et al.
Publicado: (2025)
por: Shu, Dong, et al.
Publicado: (2025)
In-Run Data Shapley for Adam Optimizer
por: Ding, Meng, et al.
Publicado: (2026)
por: Ding, Meng, et al.
Publicado: (2026)
Beyond Meta-Reasoning: Metacognitive Consolidation for Self-Improving LLM Reasoning
por: Zhuang, Ziqing, et al.
Publicado: (2026)
por: Zhuang, Ziqing, et al.
Publicado: (2026)
Private Language Models via Truncated Laplacian Mechanism
por: Huang, Tianhao, et al.
Publicado: (2024)
por: Huang, Tianhao, et al.
Publicado: (2024)
SciIntegrity-Bench: A Benchmark for Evaluating Academic Integrity in AI Scientist Systems
por: Yang, Zonglin, et al.
Publicado: (2026)
por: Yang, Zonglin, et al.
Publicado: (2026)
FCN-LLM: Empower LLM for Brain Functional Connectivity Network Understanding via Graph-level Multi-task Instruction Tuning
por: Hu, Xingcan, et al.
Publicado: (2026)
por: Hu, Xingcan, et al.
Publicado: (2026)
Boosting LLM Reasoning via Spontaneous Self-Correction
por: Zhao, Xutong, et al.
Publicado: (2025)
por: Zhao, Xutong, et al.
Publicado: (2025)
GameArena: Evaluating LLM Reasoning through Live Computer Games
por: Hu, Lanxiang, et al.
Publicado: (2024)
por: Hu, Lanxiang, et al.
Publicado: (2024)
Rethinking Math Reasoning Evaluation: A Robust LLM-as-a-Judge Framework Beyond Symbolic Rigidity
por: Yosef, Erez, et al.
Publicado: (2026)
por: Yosef, Erez, et al.
Publicado: (2026)
Towards Reasoning-Preserving Unlearning in Multimodal Large Language Models
por: Li, Hongji, et al.
Publicado: (2025)
por: Li, Hongji, et al.
Publicado: (2025)
Understanding and Mitigating Premature Confidence for Better LLM Reasoning
por: Gai, Jingchu, et al.
Publicado: (2026)
por: Gai, Jingchu, et al.
Publicado: (2026)
Beyond the Attention Stability Boundary: Agentic Self-Synthesizing Reasoning Protocols
por: Shehata, Dahlia, et al.
Publicado: (2026)
por: Shehata, Dahlia, et al.
Publicado: (2026)
Ejemplares similares
-
Global Evolutionary Steering: Refining Activation Steering Control via Cross-Layer Consistency
por: Jiang, Xinyan, et al.
Publicado: (2026) -
Understanding In-context Learning of Addition via Activation Subspaces
por: Hu, Xinyan, et al.
Publicado: (2025) -
Mechanistic Unveiling of Transformer Circuits: Self-Influence as a Key to Model Reasoning
por: Zhang, Lin, et al.
Publicado: (2025) -
Adaptive Multi-Subspace Representation Steering for Attribute Alignment in Large Language Models
por: Jiang, Xinyan, et al.
Publicado: (2025) -
Understanding the Dynamics of Demonstration Conflict in In-Context Learning
por: Jiao, Difan, et al.
Publicado: (2026)