Uncertainty Under the Curve: A Sequence-Level Entropy Area Metric for Reasoning LLM
Fuente:
arXiv
Saved in:
| Main Authors: | Zhu, Yongfu, Sun, Lin, Zhao, Guangxiang, Lin, Weihong, Zhang, Xiangzheng |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Evaluation is All You Need: Strategic Overclaiming of LLM Reasoning Capabilities Through Evaluation Design
by: Sun, Lin, et al.
Published: (2025)
by: Sun, Lin, et al.
Published: (2025)
Thinking with Reasoning Skills: Fewer Tokens, More Accuracy
by: Zhao, Guangxiang, et al.
Published: (2026)
by: Zhao, Guangxiang, et al.
Published: (2026)
A Primer in Post-Training Reasoning Data: What We Know About How It Works
by: Li, Yaoming, et al.
Published: (2026)
by: Li, Yaoming, et al.
Published: (2026)
Beyond Parameter Arithmetic: Sparse Complementary Fusion for Distribution-Aware Model Merging
by: Lin, Weihong, et al.
Published: (2026)
by: Lin, Weihong, et al.
Published: (2026)
Large Language Models Badly Generalize across Option Length, Problem Types, and Irrelevant Noun Replacements
by: Zhao, Guangxiang, et al.
Published: (2025)
by: Zhao, Guangxiang, et al.
Published: (2025)
Think Just Enough: Sequence-Level Entropy as a Confidence Signal for LLM Reasoning
by: Sharma, Aman, et al.
Published: (2025)
by: Sharma, Aman, et al.
Published: (2025)
TinyR1-32B-Preview: Boosting Accuracy with Branch-Merge Distillation
by: Sun, Lin, et al.
Published: (2025)
by: Sun, Lin, et al.
Published: (2025)
Efficient Switchable Safety Control in LLMs via Magic-Token-Guided Co-Training
by: Si, Jianfeng, et al.
Published: (2025)
by: Si, Jianfeng, et al.
Published: (2025)
Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows
by: Yao, Yilun, et al.
Published: (2026)
by: Yao, Yilun, et al.
Published: (2026)
Noise Aggregation Analysis Driven by Small-Noise Injection: Efficient Membership Inference for Diffusion Models
by: Li, Guo, et al.
Published: (2025)
by: Li, Guo, et al.
Published: (2025)
GTPO and GRPO-S: Token and Sequence-Level Reward Shaping with Policy Entropy
by: Tan, Hongze, et al.
Published: (2025)
by: Tan, Hongze, et al.
Published: (2025)
WebUncertainty: Dual-Level Uncertainty Driven Planning and Reasoning For Autonomous Web Agent
by: Zhang, Lingfeng, et al.
Published: (2026)
by: Zhang, Lingfeng, et al.
Published: (2026)
Beyond Static Alignment: Hierarchical Policy Control for LLM Safety via Risk-Aware Chain-of-Thought
by: Si, Jianfeng, et al.
Published: (2026)
by: Si, Jianfeng, et al.
Published: (2026)
Exploring Knowledge Conflicts for Faithful LLM Reasoning: Benchmark and Method
by: Zhao, Tianzhe, et al.
Published: (2026)
by: Zhao, Tianzhe, et al.
Published: (2026)
Optimizing Partial Area Under the Top-k Curve: Theory and Practice
by: Wang, Zitai, et al.
Published: (2022)
by: Wang, Zitai, et al.
Published: (2022)
The Unreasonable Effectiveness of Entropy Minimization in LLM Reasoning
by: Agarwal, Shivam, et al.
Published: (2025)
by: Agarwal, Shivam, et al.
Published: (2025)
Efficient Reinforcement Learning with Semantic and Token Entropy for LLM Reasoning
by: Cao, Hongye, et al.
Published: (2025)
by: Cao, Hongye, et al.
Published: (2025)
VEPO: Variable Entropy Policy Optimization for Low-Resource Language Foundation Models
by: Liu, Chonghan, et al.
Published: (2026)
by: Liu, Chonghan, et al.
Published: (2026)
From Entropy to Calibrated Uncertainty: Training Language Models to Reason About Uncertainty
by: Jenane, Azza, et al.
Published: (2026)
by: Jenane, Azza, et al.
Published: (2026)
Efficient line search for optimizing Area Under the ROC Curve in gradient descent
by: Fowler, Jadon, et al.
Published: (2024)
by: Fowler, Jadon, et al.
Published: (2024)
SPPO: Sequence-Level PPO for Long-Horizon Reasoning Tasks
by: Wang, Tianyi, et al.
Published: (2026)
by: Wang, Tianyi, et al.
Published: (2026)
ERPO: Token-Level Entropy-Regulated Policy Optimization for Large Reasoning Models
by: Yu, Song, et al.
Published: (2026)
by: Yu, Song, et al.
Published: (2026)
How Uncertain Is the Grade? A Benchmark of Uncertainty Metrics for LLM-Based Automatic Assessment
by: Li, Hang, et al.
Published: (2026)
by: Li, Hang, et al.
Published: (2026)
Expand VSR Benchmark for VLLM to Expertize in Spatial Rules
by: Xie, Peijin, et al.
Published: (2024)
by: Xie, Peijin, et al.
Published: (2024)
LLM-Metrics: Measuring Research Impact Through Large Language Model Memory
by: Shen, Si, et al.
Published: (2026)
by: Shen, Si, et al.
Published: (2026)
Entropy-Aware Speculative Decoding Toward Improved LLM Reasoning
by: Su, Tiancheng, et al.
Published: (2025)
by: Su, Tiancheng, et al.
Published: (2025)
The Reasoning Under Uncertainty Trap: A Structural AI Risk
by: Pilditch, Toby D.
Published: (2024)
by: Pilditch, Toby D.
Published: (2024)
Respecting Self-Uncertainty in On-Policy Self-Distillation for Efficient LLM Reasoning
by: Ke, Junlong, et al.
Published: (2026)
by: Ke, Junlong, et al.
Published: (2026)
EntropyLong: Effective Long-Context Training via Predictive Uncertainty
by: Jia, Junlong, et al.
Published: (2025)
by: Jia, Junlong, et al.
Published: (2025)
Entropy-Guided Loop: Achieving Reasoning through Uncertainty-Aware Generation
by: Correa, Andrew G. A., et al.
Published: (2025)
by: Correa, Andrew G. A., et al.
Published: (2025)
ENTRA: Entropy-Based Redundancy Avoidance in Large Language Model Reasoning
by: Cai, Ruichu, et al.
Published: (2026)
by: Cai, Ruichu, et al.
Published: (2026)
An Empirical Study of LLM Reasoning Ability Under Strict Output Length Constraint
by: Sun, Yi, et al.
Published: (2025)
by: Sun, Yi, et al.
Published: (2025)
Critical Tokens Matter: Token-Level Contrastive Estimation Enhances LLM's Reasoning Capability
by: Lin, Zicheng, et al.
Published: (2024)
by: Lin, Zicheng, et al.
Published: (2024)
Light-IF: Endowing LLMs with Generalizable Reasoning via Preview and Self-Checking for Complex Instruction Following
by: Wang, Chenyang, et al.
Published: (2025)
by: Wang, Chenyang, et al.
Published: (2025)
Canonical Variates in Wasserstein Metric Space
by: Li, Jia, et al.
Published: (2024)
by: Li, Jia, et al.
Published: (2024)
Trajectory Entropy: Modeling Game State Stability from Multimodality Trajectory Prediction
by: Zhang, Yesheng, et al.
Published: (2025)
by: Zhang, Yesheng, et al.
Published: (2025)
GAM-Agent: Game-Theoretic and Uncertainty-Aware Collaboration for Complex Visual Reasoning
by: Zhang, Jusheng, et al.
Published: (2025)
by: Zhang, Jusheng, et al.
Published: (2025)
TriPlay-RL: Tri-Role Self-Play Reinforcement Learning for LLM Safety Alignment
by: Tan, Zhewen, et al.
Published: (2026)
by: Tan, Zhewen, et al.
Published: (2026)
Interactive Learning for LLM Reasoning
by: Lin, Hehai, et al.
Published: (2025)
by: Lin, Hehai, et al.
Published: (2025)
Fine-Grained and Multi-Dimensional Metrics for Document-Level Machine Translation
by: Sun, Yirong, et al.
Published: (2024)
by: Sun, Yirong, et al.
Published: (2024)
Similar Items
-
Evaluation is All You Need: Strategic Overclaiming of LLM Reasoning Capabilities Through Evaluation Design
by: Sun, Lin, et al.
Published: (2025) -
Thinking with Reasoning Skills: Fewer Tokens, More Accuracy
by: Zhao, Guangxiang, et al.
Published: (2026) -
A Primer in Post-Training Reasoning Data: What We Know About How It Works
by: Li, Yaoming, et al.
Published: (2026) -
Beyond Parameter Arithmetic: Sparse Complementary Fusion for Distribution-Aware Model Merging
by: Lin, Weihong, et al.
Published: (2026) -
Large Language Models Badly Generalize across Option Length, Problem Types, and Irrelevant Noun Replacements
by: Zhao, Guangxiang, et al.
Published: (2025)