Teaching LLMs to Abstain via Fine-Grained Semantic Confidence Reward
Fuente:
arXiv
Salvato in:
| Autori principali: | An, Hao, Xu, Yang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Knowing When to Abstain: Medical LLMs Under Clinical Uncertainty
di: Machcha, Sravanthi, et al.
Pubblicazione: (2026)
di: Machcha, Sravanthi, et al.
Pubblicazione: (2026)
CausalAbstain: Enhancing Multilingual LLMs with Causal Reasoning for Trustworthy Abstention
di: Sun, Yuxi, et al.
Pubblicazione: (2025)
di: Sun, Yuxi, et al.
Pubblicazione: (2025)
CAMEL: Confidence-Gated Reflection for Reward Modeling
di: Zhu, Zirui, et al.
Pubblicazione: (2026)
di: Zhu, Zirui, et al.
Pubblicazione: (2026)
When Silence Is Golden: Can LLMs Learn to Abstain in Temporal QA and Beyond?
di: Zhou, Xinyu, et al.
Pubblicazione: (2026)
di: Zhou, Xinyu, et al.
Pubblicazione: (2026)
Atom-Searcher: Enhancing Agentic Deep Research via Fine-Grained Atomic Thought Reward
di: Deng, Yong, et al.
Pubblicazione: (2025)
di: Deng, Yong, et al.
Pubblicazione: (2025)
Mind the Generation Process: Fine-Grained Confidence Estimation During LLM Generation
di: Han, Jinyi, et al.
Pubblicazione: (2025)
di: Han, Jinyi, et al.
Pubblicazione: (2025)
Abstain-R1: Calibrated Abstention and Post-Refusal Clarification via Verifiable RL
di: Zhai, Skylar, et al.
Pubblicazione: (2026)
di: Zhai, Skylar, et al.
Pubblicazione: (2026)
SaySelf: Teaching LLMs to Express Confidence with Self-Reflective Rationales
di: Xu, Tianyang, et al.
Pubblicazione: (2024)
di: Xu, Tianyang, et al.
Pubblicazione: (2024)
PACR: Progressively Ascending Confidence Reward for LLM Reasoning
di: Yoon, Eunseop, et al.
Pubblicazione: (2025)
di: Yoon, Eunseop, et al.
Pubblicazione: (2025)
Fine-Grained and Thematic Evaluation of LLMs in Social Deduction Game
di: Kim, Byungjun, et al.
Pubblicazione: (2024)
di: Kim, Byungjun, et al.
Pubblicazione: (2024)
Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs
di: Liu, Chris Yuhao, et al.
Pubblicazione: (2024)
di: Liu, Chris Yuhao, et al.
Pubblicazione: (2024)
Token Cleaning: Fine-Grained Data Selection for LLM Supervised Fine-Tuning
di: Pang, Jinlong, et al.
Pubblicazione: (2025)
di: Pang, Jinlong, et al.
Pubblicazione: (2025)
FCKT: Fine-Grained Cross-Task Knowledge Transfer with Semantic Contrastive Learning for Targeted Sentiment Analysis
di: Chen, Wei, et al.
Pubblicazione: (2025)
di: Chen, Wei, et al.
Pubblicazione: (2025)
InFi-Check: Interpretable and Fine-Grained Fact-Checking of LLMs
di: Bai, Yuzhuo, et al.
Pubblicazione: (2026)
di: Bai, Yuzhuo, et al.
Pubblicazione: (2026)
Generative Floor Plan Design with LLMs via Reinforcement Learning with Verifiable Rewards
di: Lara, Luis, et al.
Pubblicazione: (2026)
di: Lara, Luis, et al.
Pubblicazione: (2026)
Clarify, Abstain or Answer? Strategising in Conversation with Belief-Augmented Generation
di: Baan, Joris, et al.
Pubblicazione: (2026)
di: Baan, Joris, et al.
Pubblicazione: (2026)
Towards Fine-Grained Code-Switch Speech Translation with Semantic Space Alignment
di: Gao, Yan, et al.
Pubblicazione: (2025)
di: Gao, Yan, et al.
Pubblicazione: (2025)
Confidence Improves Self-Consistency in LLMs
di: Taubenfeld, Amir, et al.
Pubblicazione: (2025)
di: Taubenfeld, Amir, et al.
Pubblicazione: (2025)
Semantic Flow Regularization: Teaching LLMs to Generate Diverse Yet Coherent Responses
di: Peng, Kerui, et al.
Pubblicazione: (2026)
di: Peng, Kerui, et al.
Pubblicazione: (2026)
Reinforcement Learning from Reflective Feedback (RLRF): Aligning and Improving LLMs via Fine-Grained Self-Reflection
di: Lee, Kyungjae, et al.
Pubblicazione: (2024)
di: Lee, Kyungjae, et al.
Pubblicazione: (2024)
Teaching LLMs How to Learn with Contextual Fine-Tuning
di: Choi, Younwoo, et al.
Pubblicazione: (2025)
di: Choi, Younwoo, et al.
Pubblicazione: (2025)
Funny or Persuasive, but Not Both: Evaluating Fine-Grained Multi-Concept Control in LLMs
di: Labroo, Arya, et al.
Pubblicazione: (2026)
di: Labroo, Arya, et al.
Pubblicazione: (2026)
Self-Evolved Reward Learning for LLMs
di: Huang, Chenghua, et al.
Pubblicazione: (2024)
di: Huang, Chenghua, et al.
Pubblicazione: (2024)
FB-Bench: A Fine-Grained Multi-Task Benchmark for Evaluating LLMs' Responsiveness to Human Feedback
di: Li, Youquan, et al.
Pubblicazione: (2024)
di: Li, Youquan, et al.
Pubblicazione: (2024)
Double-Calibration: Towards Reliable LLMs via Calibrating Knowledge and Reasoning Confidence
di: Lu, Yuyin, et al.
Pubblicazione: (2026)
di: Lu, Yuyin, et al.
Pubblicazione: (2026)
MedReflect: Teaching Medical LLMs to Self-Improve via Reflective Correction
di: Huang, Yue, et al.
Pubblicazione: (2025)
di: Huang, Yue, et al.
Pubblicazione: (2025)
Teaching LLMs to Abstain across Languages via Multilingual Feedback
di: Feng, Shangbin, et al.
Pubblicazione: (2024)
di: Feng, Shangbin, et al.
Pubblicazione: (2024)
SKA-Bench: A Fine-Grained Benchmark for Evaluating Structured Knowledge Understanding of LLMs
di: Liu, Zhiqiang, et al.
Pubblicazione: (2025)
di: Liu, Zhiqiang, et al.
Pubblicazione: (2025)
Fine-Tuning Language Models with Reward Learning on Policy
di: Lang, Hao, et al.
Pubblicazione: (2024)
di: Lang, Hao, et al.
Pubblicazione: (2024)
MatchTIR: Fine-Grained Supervision for Tool-Integrated Reasoning via Bipartite Matching
di: Qu, Changle, et al.
Pubblicazione: (2026)
di: Qu, Changle, et al.
Pubblicazione: (2026)
Semantic Loss Guided Data Efficient Supervised Fine Tuning for Safe Responses in LLMs
di: Lu, Yuxiao, et al.
Pubblicazione: (2024)
di: Lu, Yuxiao, et al.
Pubblicazione: (2024)
CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation
di: Cui, Guofeng, et al.
Pubblicazione: (2025)
di: Cui, Guofeng, et al.
Pubblicazione: (2025)
RankAdaptor: Hierarchical Rank Allocation for Efficient Fine-Tuning Pruned LLMs via Performance Model
di: Zhou, Changhai, et al.
Pubblicazione: (2024)
di: Zhou, Changhai, et al.
Pubblicazione: (2024)
UniSumEval: Towards Unified, Fine-Grained, Multi-Dimensional Summarization Evaluation for LLMs
di: Lee, Yuho, et al.
Pubblicazione: (2024)
di: Lee, Yuho, et al.
Pubblicazione: (2024)
Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs
di: Wen, Xumeng, et al.
Pubblicazione: (2025)
di: Wen, Xumeng, et al.
Pubblicazione: (2025)
Confident RAG: Enhancing the Performance of LLMs for Mathematics Question Answering through Multi-Embedding and Confidence Scoring
di: Chen, Shiting, et al.
Pubblicazione: (2025)
di: Chen, Shiting, et al.
Pubblicazione: (2025)
Beyond Semantics: Measuring Fine-Grained Emotion Preservation in Small Language Model-Based Machine Translation
di: Wisniewski, Dawid, et al.
Pubblicazione: (2026)
di: Wisniewski, Dawid, et al.
Pubblicazione: (2026)
Entropy-Adaptive Fine-Tuning: Resolving Confident Conflicts to Mitigate Forgetting
di: Diao, Muxi, et al.
Pubblicazione: (2026)
di: Diao, Muxi, et al.
Pubblicazione: (2026)
NeuronTune: Fine-Grained Neuron Modulation for Balanced Safety-Utility Alignment in LLMs
di: Pan, Birong, et al.
Pubblicazione: (2025)
di: Pan, Birong, et al.
Pubblicazione: (2025)
Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning
di: Turpin, Miles, et al.
Pubblicazione: (2025)
di: Turpin, Miles, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Knowing When to Abstain: Medical LLMs Under Clinical Uncertainty
di: Machcha, Sravanthi, et al.
Pubblicazione: (2026) -
CausalAbstain: Enhancing Multilingual LLMs with Causal Reasoning for Trustworthy Abstention
di: Sun, Yuxi, et al.
Pubblicazione: (2025) -
CAMEL: Confidence-Gated Reflection for Reward Modeling
di: Zhu, Zirui, et al.
Pubblicazione: (2026) -
When Silence Is Golden: Can LLMs Learn to Abstain in Temporal QA and Beyond?
di: Zhou, Xinyu, et al.
Pubblicazione: (2026) -
Atom-Searcher: Enhancing Agentic Deep Research via Fine-Grained Atomic Thought Reward
di: Deng, Yong, et al.
Pubblicazione: (2025)