Teaching LLMs to Abstain via Fine-Grained Semantic Confidence Reward
Fuente:
arXiv
Guardado en:
| Autores principales: | An, Hao, Xu, Yang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Knowing When to Abstain: Medical LLMs Under Clinical Uncertainty
por: Machcha, Sravanthi, et al.
Publicado: (2026)
por: Machcha, Sravanthi, et al.
Publicado: (2026)
CausalAbstain: Enhancing Multilingual LLMs with Causal Reasoning for Trustworthy Abstention
por: Sun, Yuxi, et al.
Publicado: (2025)
por: Sun, Yuxi, et al.
Publicado: (2025)
CAMEL: Confidence-Gated Reflection for Reward Modeling
por: Zhu, Zirui, et al.
Publicado: (2026)
por: Zhu, Zirui, et al.
Publicado: (2026)
When Silence Is Golden: Can LLMs Learn to Abstain in Temporal QA and Beyond?
por: Zhou, Xinyu, et al.
Publicado: (2026)
por: Zhou, Xinyu, et al.
Publicado: (2026)
Atom-Searcher: Enhancing Agentic Deep Research via Fine-Grained Atomic Thought Reward
por: Deng, Yong, et al.
Publicado: (2025)
por: Deng, Yong, et al.
Publicado: (2025)
Mind the Generation Process: Fine-Grained Confidence Estimation During LLM Generation
por: Han, Jinyi, et al.
Publicado: (2025)
por: Han, Jinyi, et al.
Publicado: (2025)
Abstain-R1: Calibrated Abstention and Post-Refusal Clarification via Verifiable RL
por: Zhai, Skylar, et al.
Publicado: (2026)
por: Zhai, Skylar, et al.
Publicado: (2026)
SaySelf: Teaching LLMs to Express Confidence with Self-Reflective Rationales
por: Xu, Tianyang, et al.
Publicado: (2024)
por: Xu, Tianyang, et al.
Publicado: (2024)
PACR: Progressively Ascending Confidence Reward for LLM Reasoning
por: Yoon, Eunseop, et al.
Publicado: (2025)
por: Yoon, Eunseop, et al.
Publicado: (2025)
Fine-Grained and Thematic Evaluation of LLMs in Social Deduction Game
por: Kim, Byungjun, et al.
Publicado: (2024)
por: Kim, Byungjun, et al.
Publicado: (2024)
Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs
por: Liu, Chris Yuhao, et al.
Publicado: (2024)
por: Liu, Chris Yuhao, et al.
Publicado: (2024)
Token Cleaning: Fine-Grained Data Selection for LLM Supervised Fine-Tuning
por: Pang, Jinlong, et al.
Publicado: (2025)
por: Pang, Jinlong, et al.
Publicado: (2025)
FCKT: Fine-Grained Cross-Task Knowledge Transfer with Semantic Contrastive Learning for Targeted Sentiment Analysis
por: Chen, Wei, et al.
Publicado: (2025)
por: Chen, Wei, et al.
Publicado: (2025)
InFi-Check: Interpretable and Fine-Grained Fact-Checking of LLMs
por: Bai, Yuzhuo, et al.
Publicado: (2026)
por: Bai, Yuzhuo, et al.
Publicado: (2026)
Generative Floor Plan Design with LLMs via Reinforcement Learning with Verifiable Rewards
por: Lara, Luis, et al.
Publicado: (2026)
por: Lara, Luis, et al.
Publicado: (2026)
Clarify, Abstain or Answer? Strategising in Conversation with Belief-Augmented Generation
por: Baan, Joris, et al.
Publicado: (2026)
por: Baan, Joris, et al.
Publicado: (2026)
Towards Fine-Grained Code-Switch Speech Translation with Semantic Space Alignment
por: Gao, Yan, et al.
Publicado: (2025)
por: Gao, Yan, et al.
Publicado: (2025)
Confidence Improves Self-Consistency in LLMs
por: Taubenfeld, Amir, et al.
Publicado: (2025)
por: Taubenfeld, Amir, et al.
Publicado: (2025)
Semantic Flow Regularization: Teaching LLMs to Generate Diverse Yet Coherent Responses
por: Peng, Kerui, et al.
Publicado: (2026)
por: Peng, Kerui, et al.
Publicado: (2026)
Reinforcement Learning from Reflective Feedback (RLRF): Aligning and Improving LLMs via Fine-Grained Self-Reflection
por: Lee, Kyungjae, et al.
Publicado: (2024)
por: Lee, Kyungjae, et al.
Publicado: (2024)
Teaching LLMs How to Learn with Contextual Fine-Tuning
por: Choi, Younwoo, et al.
Publicado: (2025)
por: Choi, Younwoo, et al.
Publicado: (2025)
Funny or Persuasive, but Not Both: Evaluating Fine-Grained Multi-Concept Control in LLMs
por: Labroo, Arya, et al.
Publicado: (2026)
por: Labroo, Arya, et al.
Publicado: (2026)
Self-Evolved Reward Learning for LLMs
por: Huang, Chenghua, et al.
Publicado: (2024)
por: Huang, Chenghua, et al.
Publicado: (2024)
FB-Bench: A Fine-Grained Multi-Task Benchmark for Evaluating LLMs' Responsiveness to Human Feedback
por: Li, Youquan, et al.
Publicado: (2024)
por: Li, Youquan, et al.
Publicado: (2024)
Double-Calibration: Towards Reliable LLMs via Calibrating Knowledge and Reasoning Confidence
por: Lu, Yuyin, et al.
Publicado: (2026)
por: Lu, Yuyin, et al.
Publicado: (2026)
MedReflect: Teaching Medical LLMs to Self-Improve via Reflective Correction
por: Huang, Yue, et al.
Publicado: (2025)
por: Huang, Yue, et al.
Publicado: (2025)
Teaching LLMs to Abstain across Languages via Multilingual Feedback
por: Feng, Shangbin, et al.
Publicado: (2024)
por: Feng, Shangbin, et al.
Publicado: (2024)
SKA-Bench: A Fine-Grained Benchmark for Evaluating Structured Knowledge Understanding of LLMs
por: Liu, Zhiqiang, et al.
Publicado: (2025)
por: Liu, Zhiqiang, et al.
Publicado: (2025)
Fine-Tuning Language Models with Reward Learning on Policy
por: Lang, Hao, et al.
Publicado: (2024)
por: Lang, Hao, et al.
Publicado: (2024)
MatchTIR: Fine-Grained Supervision for Tool-Integrated Reasoning via Bipartite Matching
por: Qu, Changle, et al.
Publicado: (2026)
por: Qu, Changle, et al.
Publicado: (2026)
Semantic Loss Guided Data Efficient Supervised Fine Tuning for Safe Responses in LLMs
por: Lu, Yuxiao, et al.
Publicado: (2024)
por: Lu, Yuxiao, et al.
Publicado: (2024)
CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation
por: Cui, Guofeng, et al.
Publicado: (2025)
por: Cui, Guofeng, et al.
Publicado: (2025)
RankAdaptor: Hierarchical Rank Allocation for Efficient Fine-Tuning Pruned LLMs via Performance Model
por: Zhou, Changhai, et al.
Publicado: (2024)
por: Zhou, Changhai, et al.
Publicado: (2024)
UniSumEval: Towards Unified, Fine-Grained, Multi-Dimensional Summarization Evaluation for LLMs
por: Lee, Yuho, et al.
Publicado: (2024)
por: Lee, Yuho, et al.
Publicado: (2024)
Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs
por: Wen, Xumeng, et al.
Publicado: (2025)
por: Wen, Xumeng, et al.
Publicado: (2025)
Confident RAG: Enhancing the Performance of LLMs for Mathematics Question Answering through Multi-Embedding and Confidence Scoring
por: Chen, Shiting, et al.
Publicado: (2025)
por: Chen, Shiting, et al.
Publicado: (2025)
Beyond Semantics: Measuring Fine-Grained Emotion Preservation in Small Language Model-Based Machine Translation
por: Wisniewski, Dawid, et al.
Publicado: (2026)
por: Wisniewski, Dawid, et al.
Publicado: (2026)
Entropy-Adaptive Fine-Tuning: Resolving Confident Conflicts to Mitigate Forgetting
por: Diao, Muxi, et al.
Publicado: (2026)
por: Diao, Muxi, et al.
Publicado: (2026)
NeuronTune: Fine-Grained Neuron Modulation for Balanced Safety-Utility Alignment in LLMs
por: Pan, Birong, et al.
Publicado: (2025)
por: Pan, Birong, et al.
Publicado: (2025)
Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning
por: Turpin, Miles, et al.
Publicado: (2025)
por: Turpin, Miles, et al.
Publicado: (2025)
Ejemplares similares
-
Knowing When to Abstain: Medical LLMs Under Clinical Uncertainty
por: Machcha, Sravanthi, et al.
Publicado: (2026) -
CausalAbstain: Enhancing Multilingual LLMs with Causal Reasoning for Trustworthy Abstention
por: Sun, Yuxi, et al.
Publicado: (2025) -
CAMEL: Confidence-Gated Reflection for Reward Modeling
por: Zhu, Zirui, et al.
Publicado: (2026) -
When Silence Is Golden: Can LLMs Learn to Abstain in Temporal QA and Beyond?
por: Zhou, Xinyu, et al.
Publicado: (2026) -
Atom-Searcher: Enhancing Agentic Deep Research via Fine-Grained Atomic Thought Reward
por: Deng, Yong, et al.
Publicado: (2025)