Guardado en:
| Autores principales: | Xiaohu, Xie, Xiaohu, Liu, Benjamin, Yao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2603.06604 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CaRT: Teaching LLM Agents to Know When They Know Enough
por: Liu, Grace, et al.
Publicado: (2025)
por: Liu, Grace, et al.
Publicado: (2025)
Confidence Estimation for Error Detection in Text-to-SQL Systems
por: Somov, Oleg, et al.
Publicado: (2025)
por: Somov, Oleg, et al.
Publicado: (2025)
Your LLM Knows the Future: Uncovering Its Multi-Token Prediction Potential
por: Samragh, Mohammad, et al.
Publicado: (2025)
por: Samragh, Mohammad, et al.
Publicado: (2025)
Show Your Work with Confidence: Confidence Bands for Tuning Curves
por: Lourie, Nicholas, et al.
Publicado: (2023)
por: Lourie, Nicholas, et al.
Publicado: (2023)
Do Androids Know They're Only Dreaming of Electric Sheep?
por: CH-Wang, Sky, et al.
Publicado: (2023)
por: CH-Wang, Sky, et al.
Publicado: (2023)
Knowing When to Ask: Segment-Level Credit Assignment for LLM Tool Use
por: Kumar, Abhijit, et al.
Publicado: (2026)
por: Kumar, Abhijit, et al.
Publicado: (2026)
Process Supervision of Confidence Margin for Calibrated LLM Reasoning
por: Wang, Liaoyaqi, et al.
Publicado: (2026)
por: Wang, Liaoyaqi, et al.
Publicado: (2026)
Divide-or-Conquer? Which Part Should You Distill Your LLM?
por: Wu, Zhuofeng, et al.
Publicado: (2024)
por: Wu, Zhuofeng, et al.
Publicado: (2024)
Know Your Limits: Entropy Estimation Modeling for Compression and Generalization
por: Badger, Benjamin L., et al.
Publicado: (2025)
por: Badger, Benjamin L., et al.
Publicado: (2025)
Know Where You're Uncertain When Planning with Multimodal Foundation Models: A Formal Framework
por: Bhatt, Neel P., et al.
Publicado: (2024)
por: Bhatt, Neel P., et al.
Publicado: (2024)
NanoKnow: How to Know What Your Language Model Knows
por: Gu, Lingwei, et al.
Publicado: (2026)
por: Gu, Lingwei, et al.
Publicado: (2026)
Your Simulation Runs but Solves the Wrong Physics: PDE-Grounded Intent Verification for LLM-Generated Multiphysics Simulation Code
por: Song, Zhenghan, et al.
Publicado: (2026)
por: Song, Zhenghan, et al.
Publicado: (2026)
Knowing When to Defer: Selective Prediction for Responsible Knowledge Tracing
por: Mitton, Joshua, et al.
Publicado: (2025)
por: Mitton, Joshua, et al.
Publicado: (2025)
Confidence Geometry Reveals Trace-Level Correctness in Large Language Model Reasoning
por: Liu, Shuo, et al.
Publicado: (2026)
por: Liu, Shuo, et al.
Publicado: (2026)
Do You Know What You Are Talking About? Characterizing Query-Knowledge Relevance For Reliable Retrieval Augmented Generation
por: Li, Zhuohang, et al.
Publicado: (2024)
por: Li, Zhuohang, et al.
Publicado: (2024)
To Know or Not To Know? Analyzing Self-Consistency of Large Language Models under Ambiguity
por: Sedova, Anastasiia, et al.
Publicado: (2024)
por: Sedova, Anastasiia, et al.
Publicado: (2024)
Do Small Language Models Know When They're Wrong? Confidence-Based Cascade Scoring for Educational Assessment
por: Burleigh, Tyler
Publicado: (2026)
por: Burleigh, Tyler
Publicado: (2026)
Are LLM Decisions Faithful to Verbal Confidence?
por: Wang, Jiawei, et al.
Publicado: (2026)
por: Wang, Jiawei, et al.
Publicado: (2026)
A Confidence-based Acquisition Model for Self-supervised Active Learning and Label Correction
por: van Niekerk, Carel, et al.
Publicado: (2023)
por: van Niekerk, Carel, et al.
Publicado: (2023)
DRA-GRPO: Your GRPO Needs to Know Diverse Reasoning Paths for Mathematical Reasoning
por: Chen, Xiwen, et al.
Publicado: (2025)
por: Chen, Xiwen, et al.
Publicado: (2025)
ReMoDetect: Reward Models Recognize Aligned LLM's Generations
por: Lee, Hyunseok, et al.
Publicado: (2024)
por: Lee, Hyunseok, et al.
Publicado: (2024)
Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models
por: Li, Pengyi, et al.
Publicado: (2025)
por: Li, Pengyi, et al.
Publicado: (2025)
What is Wrong with Perplexity for Long-context Language Modeling?
por: Fang, Lizhe, et al.
Publicado: (2024)
por: Fang, Lizhe, et al.
Publicado: (2024)
Knowing What You Know Is Not Enough: Large Language Model Confidences Don't Align With Their Actions
por: Pal, Arka, et al.
Publicado: (2025)
por: Pal, Arka, et al.
Publicado: (2025)
Neural Grammatical Error Correction for Romanian
por: Cotet, Teodor-Mihai, et al.
Publicado: (2026)
por: Cotet, Teodor-Mihai, et al.
Publicado: (2026)
Text Knows What, Tables Know When: Clinical Timeline Reconstruction via Retrieval-Augmented Multimodal Alignment
por: Kumar, Sayantan, et al.
Publicado: (2026)
por: Kumar, Sayantan, et al.
Publicado: (2026)
Skill-SD: Skill-Conditioned Self-Distillation for Multi-turn LLM Agents
por: Wang, Hao, et al.
Publicado: (2026)
por: Wang, Hao, et al.
Publicado: (2026)
Let the Code LLM Edit Itself When You Edit the Code
por: He, Zhenyu, et al.
Publicado: (2024)
por: He, Zhenyu, et al.
Publicado: (2024)
Large AI Model Empowered Multimodal Semantic Communications
por: Jiang, Feibo, et al.
Publicado: (2023)
por: Jiang, Feibo, et al.
Publicado: (2023)
Emoji Attack: Enhancing Jailbreak Attacks Against Judge LLM Detection
por: Wei, Zhipeng, et al.
Publicado: (2024)
por: Wei, Zhipeng, et al.
Publicado: (2024)
Cycles of Thought: Measuring LLM Confidence through Stable Explanations
por: Becker, Evan, et al.
Publicado: (2024)
por: Becker, Evan, et al.
Publicado: (2024)
MEDEC: A Benchmark for Medical Error Detection and Correction in Clinical Notes
por: Abacha, Asma Ben, et al.
Publicado: (2024)
por: Abacha, Asma Ben, et al.
Publicado: (2024)
Assessing LLM Text Detection in Educational Contexts: Does Human Contribution Affect Detection?
por: Gehring, Lukas, et al.
Publicado: (2025)
por: Gehring, Lukas, et al.
Publicado: (2025)
Align-then-Unlearn: Embedding Alignment for LLM Unlearning
por: Spohn, Philipp, et al.
Publicado: (2025)
por: Spohn, Philipp, et al.
Publicado: (2025)
What Would You Ask When You First Saw $a^2+b^2=c^2$? Evaluating LLM on Curiosity-Driven Questioning
por: Javaji, Shashidhar Reddy, et al.
Publicado: (2024)
por: Javaji, Shashidhar Reddy, et al.
Publicado: (2024)
Forget What You Know about LLMs Evaluations -- LLMs are Like a Chameleon
por: Cohen-Inger, Nurit, et al.
Publicado: (2025)
por: Cohen-Inger, Nurit, et al.
Publicado: (2025)
MAGE: All-[MASK] Block Already Knows Where to Look in Diffusion LLM
por: Kwon, Omin, et al.
Publicado: (2026)
por: Kwon, Omin, et al.
Publicado: (2026)
When Models Know More Than They Say: Probing Analogical Reasoning in LLMs
por: McGovern, Hope, et al.
Publicado: (2026)
por: McGovern, Hope, et al.
Publicado: (2026)
Where Did It Go Wrong? Attributing Undesirable LLM Behaviors via Representation Gradient Tracing
por: Li, Zhe, et al.
Publicado: (2025)
por: Li, Zhe, et al.
Publicado: (2025)
To Believe or Not to Believe Your LLM
por: Yadkori, Yasin Abbasi, et al.
Publicado: (2024)
por: Yadkori, Yasin Abbasi, et al.
Publicado: (2024)
Ejemplares similares
-
CaRT: Teaching LLM Agents to Know When They Know Enough
por: Liu, Grace, et al.
Publicado: (2025) -
Confidence Estimation for Error Detection in Text-to-SQL Systems
por: Somov, Oleg, et al.
Publicado: (2025) -
Your LLM Knows the Future: Uncovering Its Multi-Token Prediction Potential
por: Samragh, Mohammad, et al.
Publicado: (2025) -
Show Your Work with Confidence: Confidence Bands for Tuning Curves
por: Lourie, Nicholas, et al.
Publicado: (2023) -
Do Androids Know They're Only Dreaming of Electric Sheep?
por: CH-Wang, Sky, et al.
Publicado: (2023)