Supervised Optimism Correction: Be Confident When LLMs Are Sure
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Junjie, Yang, Rushuai, Liu, Shunyu, Lin, Ting-En, Huang, Fei, Chen, Yi, Li, Yongbin, Tao, Dacheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
A Simple "Motivation" Can Enhance Reinforcement Finetuning of Large Reasoning Models
por: Zhang, Junjie, et al.
Publicado: (2025)
por: Zhang, Junjie, et al.
Publicado: (2025)
A Survey on Self-Evolution of Large Language Models
por: Tao, Zhengwei, et al.
Publicado: (2024)
por: Tao, Zhengwei, et al.
Publicado: (2024)
STRIDE: Learnable Stepwise Language Feedback for LLM Reasoning
por: Zhang, Junjie, et al.
Publicado: (2026)
por: Zhang, Junjie, et al.
Publicado: (2026)
When to Trust LLMs: Aligning Confidence with Response Quality
por: Tao, Shuchang, et al.
Publicado: (2024)
por: Tao, Shuchang, et al.
Publicado: (2024)
Reverse Preference Optimization for Complex Instruction Following
por: Huang, Xiang, et al.
Publicado: (2025)
por: Huang, Xiang, et al.
Publicado: (2025)
Confidence v.s. Critique: A Decomposition of Self-Correction Capability for LLMs
por: Yang, Zhe, et al.
Publicado: (2024)
por: Yang, Zhe, et al.
Publicado: (2024)
A Survey of Direct Preference Optimization
por: Liu, Shunyu, et al.
Publicado: (2025)
por: Liu, Shunyu, et al.
Publicado: (2025)
P-GenRM: Personalized Generative Reward Model with Test-time User-based Scaling
por: Zhang, Pinyi, et al.
Publicado: (2026)
por: Zhang, Pinyi, et al.
Publicado: (2026)
The Imperative of Conversation Analysis in the Era of LLMs: A Survey of Tasks, Techniques, and Trends
por: Zhang, Xinghua, et al.
Publicado: (2024)
por: Zhang, Xinghua, et al.
Publicado: (2024)
Fortify the Shortest Stave in Attention: Enhancing Context Awareness of Large Language Models for Effective Tool Use
por: Chen, Yuhan, et al.
Publicado: (2023)
por: Chen, Yuhan, et al.
Publicado: (2023)
Towards Reliable Medical LLMs: Benchmarking and Enhancing Confidence Estimation of Large Language Models in Medical Consultation
por: Ren, Zhiyao, et al.
Publicado: (2026)
por: Ren, Zhiyao, et al.
Publicado: (2026)
IOPO: Empowering LLMs with Complex Instruction Following via Input-Output Preference Optimization
por: Zhang, Xinghua, et al.
Publicado: (2024)
por: Zhang, Xinghua, et al.
Publicado: (2024)
Zero-Shot Confidence Estimation for Small LLMs: When Supervised Baselines Aren't Worth Training
por: Nguyen, Luong N.
Publicado: (2026)
por: Nguyen, Luong N.
Publicado: (2026)
Improving Factual Consistency of News Summarization by Contrastive Preference Optimization
por: Feng, Huawen, et al.
Publicado: (2023)
por: Feng, Huawen, et al.
Publicado: (2023)
SeRL: Self-Play Reinforcement Learning for Large Language Models with Limited Data
por: Fang, Wenkai, et al.
Publicado: (2025)
por: Fang, Wenkai, et al.
Publicado: (2025)
R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization
por: Zhang, Jingyi, et al.
Publicado: (2025)
por: Zhang, Jingyi, et al.
Publicado: (2025)
Intention Analysis Makes LLMs A Good Jailbreak Defender
por: Zhang, Yuqi, et al.
Publicado: (2024)
por: Zhang, Yuqi, et al.
Publicado: (2024)
When Can LLMs Actually Correct Their Own Mistakes? A Critical Survey of Self-Correction of LLMs
por: Kamoi, Ryo, et al.
Publicado: (2024)
por: Kamoi, Ryo, et al.
Publicado: (2024)
Debate Helps Weak-to-Strong Generalization
por: Lang, Hao, et al.
Publicado: (2025)
por: Lang, Hao, et al.
Publicado: (2025)
Selective Weak-to-Strong Generalization
por: Lang, Hao, et al.
Publicado: (2025)
por: Lang, Hao, et al.
Publicado: (2025)
Optimism in Equality Saturation
por: Arbore, Russel, et al.
Publicado: (2025)
por: Arbore, Russel, et al.
Publicado: (2025)
Can Confidence Estimates Decide When Chain-of-Thought Is Necessary for LLMs?
por: Lewis-Lim, Samuel, et al.
Publicado: (2025)
por: Lewis-Lim, Samuel, et al.
Publicado: (2025)
EIFBENCH: Extremely Complex Instruction Following Benchmark for Large Language Models
por: Zou, Tao, et al.
Publicado: (2025)
por: Zou, Tao, et al.
Publicado: (2025)
Step Potential Advantage Estimation: Harnessing Intermediate Confidence and Correctness for Efficient Mathematical Reasoning
por: Wu, Fei, et al.
Publicado: (2026)
por: Wu, Fei, et al.
Publicado: (2026)
Know When You're Wrong: Aligning Confidence with Correctness for LLM Error Detection
por: Xiaohu, Xie, et al.
Publicado: (2026)
por: Xiaohu, Xie, et al.
Publicado: (2026)
VTC-R1: Vision-Text Compression for Efficient Long-Context Reasoning
por: Wang, Yibo, et al.
Publicado: (2026)
por: Wang, Yibo, et al.
Publicado: (2026)
Fine-Tuning Language Models with Reward Learning on Policy
por: Lang, Hao, et al.
Publicado: (2024)
por: Lang, Hao, et al.
Publicado: (2024)
SpokenWOZ: A Large-Scale Speech-Text Benchmark for Spoken Task-Oriented Dialogue Agents
por: Si, Shuzheng, et al.
Publicado: (2023)
por: Si, Shuzheng, et al.
Publicado: (2023)
Confidence Estimation for LLMs in Multi-turn Interactions
por: Zhang, Caiqi, et al.
Publicado: (2026)
por: Zhang, Caiqi, et al.
Publicado: (2026)
EPO: Explicit Policy Optimization for Strategic Reasoning in LLMs via Reinforcement Learning
por: Liu, Xiaoqian, et al.
Publicado: (2025)
por: Liu, Xiaoqian, et al.
Publicado: (2025)
Entropy-Guided Watermarking for LLMs: A Test-Time Framework for Robust and Traceable Text Generation
por: Cai, Shizhan, et al.
Publicado: (2025)
por: Cai, Shizhan, et al.
Publicado: (2025)
Try, Check and Retry: A Divide-and-Conquer Framework for Boosting Long-context Tool-Calling Performance of LLMs
por: Chen, Kunfeng, et al.
Publicado: (2026)
por: Chen, Kunfeng, et al.
Publicado: (2026)
Fact-Level Confidence Calibration and Self-Correction
por: Yuan, Yige, et al.
Publicado: (2024)
por: Yuan, Yige, et al.
Publicado: (2024)
When Weak LLMs Speak with Confidence, Preference Alignment Gets Stronger
por: Afzali, Amirabbas, et al.
Publicado: (2026)
por: Afzali, Amirabbas, et al.
Publicado: (2026)
MMEvol: Empowering Multimodal Large Language Models with Evol-Instruct
por: Luo, Run, et al.
Publicado: (2024)
por: Luo, Run, et al.
Publicado: (2024)
DialCLIP: Empowering CLIP as Multi-Modal Dialog Retriever
por: Yin, Zhichao, et al.
Publicado: (2024)
por: Yin, Zhichao, et al.
Publicado: (2024)
On Verbalized Confidence Scores for LLMs
por: Yang, Daniel, et al.
Publicado: (2024)
por: Yang, Daniel, et al.
Publicado: (2024)
OpenOmni: Advancing Open-Source Omnimodal Large Language Models with Progressive Multimodal Alignment and Real-Time Self-Aware Emotional Speech Synthesis
por: Luo, Run, et al.
Publicado: (2025)
por: Luo, Run, et al.
Publicado: (2025)
Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning
por: Zhang, Kongcheng, et al.
Publicado: (2025)
por: Zhang, Kongcheng, et al.
Publicado: (2025)
Are LLMs Effective Backbones for Fine-tuning? An Experimental Investigation of Supervised LLMs on Chinese Short Text Matching
por: Liu, Shulin, et al.
Publicado: (2024)
por: Liu, Shulin, et al.
Publicado: (2024)
Ejemplares similares
-
A Simple "Motivation" Can Enhance Reinforcement Finetuning of Large Reasoning Models
por: Zhang, Junjie, et al.
Publicado: (2025) -
A Survey on Self-Evolution of Large Language Models
por: Tao, Zhengwei, et al.
Publicado: (2024) -
STRIDE: Learnable Stepwise Language Feedback for LLM Reasoning
por: Zhang, Junjie, et al.
Publicado: (2026) -
When to Trust LLMs: Aligning Confidence with Response Quality
por: Tao, Shuchang, et al.
Publicado: (2024) -
Reverse Preference Optimization for Complex Instruction Following
por: Huang, Xiang, et al.
Publicado: (2025)