Agentic Confidence Calibration
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Jiaxin, Xiong, Caiming, Wu, Chien-Sheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Agentic Uncertainty Quantification
por: Zhang, Jiaxin, et al.
Publicado: (2026)
por: Zhang, Jiaxin, et al.
Publicado: (2026)
Benchmarking Deep Search over Heterogeneous Enterprise Data
por: Choubey, Prafulla Kumar, et al.
Publicado: (2025)
por: Choubey, Prafulla Kumar, et al.
Publicado: (2025)
SiReRAG: Indexing Similar and Related Information for Multihop Reasoning
por: Zhang, Nan, et al.
Publicado: (2024)
por: Zhang, Nan, et al.
Publicado: (2024)
Foundational Automatic Evaluators: Scaling Multi-Task Generative Evaluator Training for Reasoning-Centric Domains
por: Xu, Austin, et al.
Publicado: (2025)
por: Xu, Austin, et al.
Publicado: (2025)
Don't Think Twice! Over-Reasoning Impairs Confidence Calibration
por: Lacombe, Romain, et al.
Publicado: (2025)
por: Lacombe, Romain, et al.
Publicado: (2025)
The Illusion of Certainty: Decoupling Capability and Calibration in On-Policy Distillation
por: Zhang, Jiaxin, et al.
Publicado: (2026)
por: Zhang, Jiaxin, et al.
Publicado: (2026)
Synthesizing Agentic Data for Web Agents with Progressive Difficulty Enhancement Mechanisms
por: Pandit, Shrey, et al.
Publicado: (2025)
por: Pandit, Shrey, et al.
Publicado: (2025)
CRMArena: Understanding the Capacity of LLM Agents to Perform Professional CRM Tasks in Realistic Environments
por: Huang, Kung-Hsiang, et al.
Publicado: (2024)
por: Huang, Kung-Hsiang, et al.
Publicado: (2024)
Calibrating Verbalized Confidence with Self-Generated Distractors
por: Wang, Victor, et al.
Publicado: (2025)
por: Wang, Victor, et al.
Publicado: (2025)
Fact-Level Confidence Calibration and Self-Correction
por: Yuan, Yige, et al.
Publicado: (2024)
por: Yuan, Yige, et al.
Publicado: (2024)
CRMArena-Pro: Holistic Assessment of LLM Agents Across Diverse Business Scenarios and Interactions
por: Huang, Kung-Hsiang, et al.
Publicado: (2025)
por: Huang, Kung-Hsiang, et al.
Publicado: (2025)
Double-Calibration: Towards Reliable LLMs via Calibrating Knowledge and Reasoning Confidence
por: Lu, Yuyin, et al.
Publicado: (2026)
por: Lu, Yuyin, et al.
Publicado: (2026)
Why Vision Language Models Struggle with Visual Arithmetic? Towards Enhanced Chart and Geometry Understanding
por: Huang, Kung-Hsiang, et al.
Publicado: (2025)
por: Huang, Kung-Hsiang, et al.
Publicado: (2025)
A Survey of Confidence Estimation and Calibration in Large Language Models
por: Geng, Jiahui, et al.
Publicado: (2023)
por: Geng, Jiahui, et al.
Publicado: (2023)
Confidence-Calibrated Small-Large Language Model Collaboration for Cost-Efficient Reasoning
por: Zhang, Chuang, et al.
Publicado: (2026)
por: Zhang, Chuang, et al.
Publicado: (2026)
Parameter-Efficient Detoxification with Contrastive Decoding
por: Niu, Tong, et al.
Publicado: (2024)
por: Niu, Tong, et al.
Publicado: (2024)
Confidence and Calibration of Activation Oracles for Reliable Interpretation of Language Model Internals
por: Torrielli, Federico, et al.
Publicado: (2026)
por: Torrielli, Federico, et al.
Publicado: (2026)
LACIE: Listener-Aware Finetuning for Confidence Calibration in Large Language Models
por: Stengel-Eskin, Elias, et al.
Publicado: (2024)
por: Stengel-Eskin, Elias, et al.
Publicado: (2024)
ConfTuner: Training Large Language Models to Express Their Confidence Verbally
por: Li, Yibo, et al.
Publicado: (2025)
por: Li, Yibo, et al.
Publicado: (2025)
The Dunning-Kruger Effect in Large Language Models: An Empirical Study of Confidence Calibration
por: Ghosh, Sudipta, et al.
Publicado: (2026)
por: Ghosh, Sudipta, et al.
Publicado: (2026)
Improving the Calibration of Confidence Scores in Text Generation Using the Output Distribution's Characteristics
por: Flores, Lorenzo Jaime Yu, et al.
Publicado: (2025)
por: Flores, Lorenzo Jaime Yu, et al.
Publicado: (2025)
Mind the Confidence Gap: Overconfidence, Calibration, and Distractor Effects in Large Language Models
por: Chhikara, Prateek
Publicado: (2025)
por: Chhikara, Prateek
Publicado: (2025)
A Survey of Frontiers in LLM Reasoning: Inference Scaling, Learning to Reason, and Agentic Systems
por: Ke, Zixuan, et al.
Publicado: (2025)
por: Ke, Zixuan, et al.
Publicado: (2025)
Reasoning Curriculum: Bootstrapping Broad LLM Reasoning from Math
por: Pang, Bo, et al.
Publicado: (2025)
por: Pang, Bo, et al.
Publicado: (2025)
VL-Calibration: Decoupled Confidence Calibration for Large Vision-Language Models Reasoning
por: Xiao, Wenyi, et al.
Publicado: (2026)
por: Xiao, Wenyi, et al.
Publicado: (2026)
Towards Trustworthy Report Generation: A Deep Research Agent with Progressive Confidence Estimation and Calibration
por: Yuan, Yi, et al.
Publicado: (2026)
por: Yuan, Yi, et al.
Publicado: (2026)
Rewarding Doubt: A Reinforcement Learning Approach to Calibrated Confidence Expression of Large Language Models
por: Bani-Harouni, David, et al.
Publicado: (2025)
por: Bani-Harouni, David, et al.
Publicado: (2025)
Time is Not a Label: Continuous Phase Rotation for Temporal Knowledge Graphs and Agentic Memory
por: Li, Weixian Waylon, et al.
Publicado: (2026)
por: Li, Weixian Waylon, et al.
Publicado: (2026)
Calibrated? Not for Everyone: How Sexual Orientation and Religious Markers Distort LLM Accuracy and Confidence in Medical QA
por: Testoni, Alberto, et al.
Publicado: (2026)
por: Testoni, Alberto, et al.
Publicado: (2026)
J4R: Learning to Judge with Equivalent Initial State Group Relative Policy Optimization
por: Xu, Austin, et al.
Publicado: (2025)
por: Xu, Austin, et al.
Publicado: (2025)
Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding
por: Wang, Ziyang, et al.
Publicado: (2025)
por: Wang, Ziyang, et al.
Publicado: (2025)
How Confident Is the First Token? An Uncertainty-Calibrated Prompt Optimization Framework for Large Language Model Classification and Understanding
por: Chen, Wei, et al.
Publicado: (2026)
por: Chen, Wei, et al.
Publicado: (2026)
Self-Anchoring Calibration Drift in Large Language Models: How Multi-Turn Conversations Reshape Model Confidence
por: Harshavardhan
Publicado: (2026)
por: Harshavardhan
Publicado: (2026)
MICE for CATs: Model-Internal Confidence Estimation for Calibrating Agents with Tools
por: Subramani, Nishant, et al.
Publicado: (2025)
por: Subramani, Nishant, et al.
Publicado: (2025)
JudgeRank: Leveraging Large Language Models for Reasoning-Intensive Reranking
por: Niu, Tong, et al.
Publicado: (2024)
por: Niu, Tong, et al.
Publicado: (2024)
HPE:Answering Complex Questions over Text by Hybrid Question Parsing and Execution
por: Liu, Ye, et al.
Publicado: (2023)
por: Liu, Ye, et al.
Publicado: (2023)
Oblivion: Self-Adaptive Agentic Memory Control through Decay-Driven Activation
por: Rana, Ashish, et al.
Publicado: (2026)
por: Rana, Ashish, et al.
Publicado: (2026)
Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards
por: Ma, Zhengzhao, et al.
Publicado: (2026)
por: Ma, Zhengzhao, et al.
Publicado: (2026)
SpecBound: Adaptive Bounded Self-Speculation with Layer-wise Confidence Calibration
por: Wen, Zhuofan, et al.
Publicado: (2026)
por: Wen, Zhuofan, et al.
Publicado: (2026)
AI-Slop to AI-Polish? Aligning Language Models through Edit-Based Writing Rewards and Test-time Computation
por: Chakrabarty, Tuhin, et al.
Publicado: (2025)
por: Chakrabarty, Tuhin, et al.
Publicado: (2025)
Ejemplares similares
-
Agentic Uncertainty Quantification
por: Zhang, Jiaxin, et al.
Publicado: (2026) -
Benchmarking Deep Search over Heterogeneous Enterprise Data
por: Choubey, Prafulla Kumar, et al.
Publicado: (2025) -
SiReRAG: Indexing Similar and Related Information for Multihop Reasoning
por: Zhang, Nan, et al.
Publicado: (2024) -
Foundational Automatic Evaluators: Scaling Multi-Task Generative Evaluator Training for Reasoning-Centric Domains
por: Xu, Austin, et al.
Publicado: (2025) -
Don't Think Twice! Over-Reasoning Impairs Confidence Calibration
por: Lacombe, Romain, et al.
Publicado: (2025)