Language Models can Evaluate Themselves via Probability Discrepancy
Fuente:
arXiv
Saved in:
| Main Authors: | Xia, Tingyu, Yu, Bowen, Wu, Yuan, Chang, Yi, Zhou, Chang |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
A Survey of RWKV
by: Li, Zhiyuan, et al.
Published: (2024)
by: Li, Zhiyuan, et al.
Published: (2024)
Rethinking Data Selection at Scale: Random Selection is Almost All You Need
by: Xia, Tingyu, et al.
Published: (2024)
by: Xia, Tingyu, et al.
Published: (2024)
Self-play with Execution Feedback: Improving Instruction-following Capabilities of Large Language Models
by: Dong, Guanting, et al.
Published: (2024)
by: Dong, Guanting, et al.
Published: (2024)
Large Language Model Evaluation via Matrix Nuclear-Norm
by: Li, Yahan, et al.
Published: (2024)
by: Li, Yahan, et al.
Published: (2024)
A Survey on Evaluation of Large Language Models
by: Chang, Yupeng, et al.
Published: (2023)
by: Chang, Yupeng, et al.
Published: (2023)
ItD: Large Language Models Can Teach Themselves Induction through Deduction
by: Sun, Wangtao, et al.
Published: (2024)
by: Sun, Wangtao, et al.
Published: (2024)
Looking Inward: Language Models Can Learn About Themselves by Introspection
by: Binder, Felix J, et al.
Published: (2024)
by: Binder, Felix J, et al.
Published: (2024)
Helping Large Language Models Protect Themselves: An Enhanced Filtering and Summarization System
by: Muhaimin, Sheikh Samit, et al.
Published: (2025)
by: Muhaimin, Sheikh Samit, et al.
Published: (2025)
Evaluating Reward Model Generalization via Pairwise Maximum Discrepancy Competitions
by: Luo, Shunyang, et al.
Published: (2026)
by: Luo, Shunyang, et al.
Published: (2026)
Can LLMs Correct Themselves? A Benchmark of Self-Correction in LLMs
by: Tie, Guiyao, et al.
Published: (2025)
by: Tie, Guiyao, et al.
Published: (2025)
Large Language Models can Learn Rules
by: Zhu, Zhaocheng, et al.
Published: (2023)
by: Zhu, Zhaocheng, et al.
Published: (2023)
When LLMs Benchmark Themselves: Deconstructing Self-Bias in Automated Evaluation
by: Xu, Wenda, et al.
Published: (2025)
by: Xu, Wenda, et al.
Published: (2025)
LLMs Judge Themselves: A Game-Theoretic Framework for Human-Aligned Evaluation
by: Yang, Gao, et al.
Published: (2025)
by: Yang, Gao, et al.
Published: (2025)
Can LLMs Explain Themselves Counterfactually?
by: Dehghanighobadi, Zahra, et al.
Published: (2025)
by: Dehghanighobadi, Zahra, et al.
Published: (2025)
Evaluating Progress in Graph Foundation Models: A Comprehensive Benchmark and New Insights
by: Yu, Xingtong, et al.
Published: (2026)
by: Yu, Xingtong, et al.
Published: (2026)
Evaluating Ill-Defined Tasks in Large Language Models
by: Zhou, Yi, et al.
Published: (2026)
by: Zhou, Yi, et al.
Published: (2026)
Rephrase and Respond: Let Large Language Models Ask Better Questions for Themselves
by: Deng, Yihe, et al.
Published: (2023)
by: Deng, Yihe, et al.
Published: (2023)
From Deception to Detection: The Dual Roles of Large Language Models in Fake News
by: Sallami, Dorsaf, et al.
Published: (2024)
by: Sallami, Dorsaf, et al.
Published: (2024)
DiReCT: Diagnostic Reasoning for Clinical Notes via Large Language Models
by: Wang, Bowen, et al.
Published: (2024)
by: Wang, Bowen, et al.
Published: (2024)
LLMs Can Teach Themselves to Better Predict the Future
by: Turtel, Benjamin, et al.
Published: (2025)
by: Turtel, Benjamin, et al.
Published: (2025)
Align, Don't Divide: Revisiting the LoRA Architecture in Multi-Task Learning
by: Liu, Jinda, et al.
Published: (2025)
by: Liu, Jinda, et al.
Published: (2025)
Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking
by: Zelikman, Eric, et al.
Published: (2024)
by: Zelikman, Eric, et al.
Published: (2024)
Injecting Salesperson's Dialogue Strategies in Large Language Models with Chain-of-Thought Reasoning
by: Chang, Wen-Yu, et al.
Published: (2024)
by: Chang, Wen-Yu, et al.
Published: (2024)
Reference-based Metrics Disprove Themselves in Question Generation
by: Nguyen, Bang, et al.
Published: (2024)
by: Nguyen, Bang, et al.
Published: (2024)
SAMGPT: Text-free Graph Foundation Model for Multi-domain Pre-training and Cross-domain Adaptation
by: Yu, Xingtong, et al.
Published: (2025)
by: Yu, Xingtong, et al.
Published: (2025)
CoT-BERT: Enhancing Unsupervised Sentence Representation through Chain-of-Thought
by: Zhang, Bowen, et al.
Published: (2023)
by: Zhang, Bowen, et al.
Published: (2023)
Can Large Language Models Still Explain Themselves? Investigating the Impact of Quantization on Self-Explanations
by: Wang, Qianli, et al.
Published: (2026)
by: Wang, Qianli, et al.
Published: (2026)
Calibrating Verbalized Probabilities for Large Language Models
by: Wang, Cheng, et al.
Published: (2024)
by: Wang, Cheng, et al.
Published: (2024)
Incoherent Probability Judgments in Large Language Models
by: Zhu, Jian-Qiao, et al.
Published: (2024)
by: Zhu, Jian-Qiao, et al.
Published: (2024)
Unitary Multi-Margin BERT for Robust Natural Language Processing
by: Chang, Hao-Yuan, et al.
Published: (2024)
by: Chang, Hao-Yuan, et al.
Published: (2024)
Reverse Constitutional AI: A Framework for Controllable Toxic Data Generation via Probability-Clamped RLAIF
by: Fang, Yuan, et al.
Published: (2026)
by: Fang, Yuan, et al.
Published: (2026)
On the Fallacy of Global Token Perplexity in Spoken Language Model Evaluation
by: Hsu, Chan-Jan, et al.
Published: (2026)
by: Hsu, Chan-Jan, et al.
Published: (2026)
Accelerating Large Language Model Reasoning via Speculative Search
by: Wang, Zhihai, et al.
Published: (2025)
by: Wang, Zhihai, et al.
Published: (2025)
Cross-Examiner: Evaluating Consistency of Large Language Model-Generated Explanations
by: Villa, Danielle, et al.
Published: (2025)
by: Villa, Danielle, et al.
Published: (2025)
Recovering Event Probabilities from Large Language Model Embeddings via Axiomatic Constraints
by: Zhu, Jian-Qiao, et al.
Published: (2025)
by: Zhu, Jian-Qiao, et al.
Published: (2025)
Debiasing Large Language Models via Adaptive Causal Prompting with Sketch-of-Thought
by: Li, Bowen, et al.
Published: (2026)
by: Li, Bowen, et al.
Published: (2026)
Alignment-Enhanced Decoding:Defending via Token-Level Adaptive Refining of Probability Distributions
by: Liu, Quan, et al.
Published: (2024)
by: Liu, Quan, et al.
Published: (2024)
Length-Controlled Margin-Based Preference Optimization without Reference Model
by: Li, Gengxu, et al.
Published: (2025)
by: Li, Gengxu, et al.
Published: (2025)
Investigating Instruction Tuning Large Language Models on Graphs
by: Zhu, Kerui, et al.
Published: (2024)
by: Zhu, Kerui, et al.
Published: (2024)
Improving Retrieval Augmented Language Model with Self-Reasoning
by: Xia, Yuan, et al.
Published: (2024)
by: Xia, Yuan, et al.
Published: (2024)
Similar Items
-
A Survey of RWKV
by: Li, Zhiyuan, et al.
Published: (2024) -
Rethinking Data Selection at Scale: Random Selection is Almost All You Need
by: Xia, Tingyu, et al.
Published: (2024) -
Self-play with Execution Feedback: Improving Instruction-following Capabilities of Large Language Models
by: Dong, Guanting, et al.
Published: (2024) -
Large Language Model Evaluation via Matrix Nuclear-Norm
by: Li, Yahan, et al.
Published: (2024) -
A Survey on Evaluation of Large Language Models
by: Chang, Yupeng, et al.
Published: (2023)