Trustworthy LLMs: a Survey and Guideline for Evaluating Large Language Models' Alignment
Fuente:
arXiv
Saved in:
| Main Authors: | Liu, Yang, Yao, Yuanshun, Ton, Jean-Francois, Zhang, Xiaoying, Guo, Ruocheng, Cheng, Hao, Klochkov, Yegor, Taufiq, Muhammad Faaiz, Li, Hang |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Understanding Chain-of-Thought in LLMs through Information Theory
by: Ton, Jean-Francois, et al.
Published: (2024)
by: Ton, Jean-Francois, et al.
Published: (2024)
How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs
by: Estornell, Andrew, et al.
Published: (2025)
by: Estornell, Andrew, et al.
Published: (2025)
Achievable Fairness on Your Data With Utility Guarantees
by: Taufiq, Muhammad Faaiz, et al.
Published: (2024)
by: Taufiq, Muhammad Faaiz, et al.
Published: (2024)
Uncertainty Quantification and Causal Considerations for Off-Policy Decision Making
by: Taufiq, Muhammad Faaiz
Published: (2025)
by: Taufiq, Muhammad Faaiz
Published: (2025)
A mean teacher algorithm for unlearning of language models
by: Klochkov, Yegor
Published: (2025)
by: Klochkov, Yegor
Published: (2025)
Revisiting inverse Hessian vector products for calculating influence functions
by: Klochkov, Yegor, et al.
Published: (2024)
by: Klochkov, Yegor, et al.
Published: (2024)
Inference-time Stochastic Ranking with Risk Control
by: Guo, Ruocheng, et al.
Published: (2023)
by: Guo, Ruocheng, et al.
Published: (2023)
ACC-Collab: An Actor-Critic Approach to Multi-Agent LLM Collaboration
by: Estornell, Andrew, et al.
Published: (2024)
by: Estornell, Andrew, et al.
Published: (2024)
Post-hoc Bias Scoring Is Optimal For Fair Classification
by: Chen, Wenlong, et al.
Published: (2023)
by: Chen, Wenlong, et al.
Published: (2023)
Conformal Counterfactual Inference under Hidden Confounding
by: Chen, Zonghao, et al.
Published: (2024)
by: Chen, Zonghao, et al.
Published: (2024)
Reviving The Classics: Active Reward Modeling in Large Language Model Alignment
by: Shen, Yunyi, et al.
Published: (2025)
by: Shen, Yunyi, et al.
Published: (2025)
Measuring and Reducing LLM Hallucination without Gold-Standard Answers
by: Wei, Jiaheng, et al.
Published: (2024)
by: Wei, Jiaheng, et al.
Published: (2024)
Large Language Model Unlearning
by: Yao, Yuanshun, et al.
Published: (2023)
by: Yao, Yuanshun, et al.
Published: (2023)
Human-Instruction-Free LLM Self-Alignment with Limited Samples
by: Guo, Hongyi, et al.
Published: (2024)
by: Guo, Hongyi, et al.
Published: (2024)
Spin glass to paramagnetic transition and triple point in Spherical SK model
by: Johnstone, Iain M., et al.
Published: (2021)
by: Johnstone, Iain M., et al.
Published: (2021)
Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs
by: Sun, Hao, et al.
Published: (2025)
by: Sun, Hao, et al.
Published: (2025)
On the Cause of Unfairness: A Training Sample Perspective
by: Yao, Yuanshun, et al.
Published: (2023)
by: Yao, Yuanshun, et al.
Published: (2023)
Improving Reinforcement Learning from Human Feedback Using Contrastive Rewards
by: Shen, Wei, et al.
Published: (2024)
by: Shen, Wei, et al.
Published: (2024)
Overcoming Reward Overoptimization via Adversarial Policy Optimization with Lightweight Uncertainty Estimation
by: Zhang, Xiaoying, et al.
Published: (2024)
by: Zhang, Xiaoying, et al.
Published: (2024)
Toward Optimal LLM Alignments Using Two-Player Games
by: Zheng, Rui, et al.
Published: (2024)
by: Zheng, Rui, et al.
Published: (2024)
Robust Multi-bit Text Watermark with LLM-based Paraphrasers
by: Xu, Xiaojun, et al.
Published: (2024)
by: Xu, Xiaojun, et al.
Published: (2024)
Learning to Watermark LLM-generated Text via Reinforcement Learning
by: Xu, Xiaojun, et al.
Published: (2024)
by: Xu, Xiaojun, et al.
Published: (2024)
Rethinking Bradley-Terry Models in Preference-Based Reward Modeling: Foundations, Theory, and Alternatives
by: Sun, Hao, et al.
Published: (2024)
by: Sun, Hao, et al.
Published: (2024)
Trustworthy Large Models in Vision: A Survey
by: Guo, Ziyan, et al.
Published: (2023)
by: Guo, Ziyan, et al.
Published: (2023)
A Comprehensive Survey of Small Language Models in the Era of Large Language Models: Techniques, Enhancements, Applications, Collaboration with LLMs, and Trustworthiness
by: Wang, Fali, et al.
Published: (2024)
by: Wang, Fali, et al.
Published: (2024)
There Is More to Refusal in Large Language Models than a Single Direction
by: Joad, Faaiz, et al.
Published: (2026)
by: Joad, Faaiz, et al.
Published: (2026)
Evaluating the Dependency Between Cyclomatic Complexity and Response For Class
by: Stavtsev, Maxim, et al.
Published: (2024)
by: Stavtsev, Maxim, et al.
Published: (2024)
A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook
by: Luo, Kaiwen, et al.
Published: (2026)
by: Luo, Kaiwen, et al.
Published: (2026)
Trustworthy Chronic Disease Risk Prediction For Self-Directed Preventive Care via Medical Literature Validation
by: Le, Minh, et al.
Published: (2025)
by: Le, Minh, et al.
Published: (2025)
ToolPRMBench: Evaluating and Advancing Process Reward Models for Tool-using Agents
by: Li, Dawei, et al.
Published: (2026)
by: Li, Dawei, et al.
Published: (2026)
Evaluation of Large Language Models' Concordance With Guidelines on Olfaction
by: Ariana L. Shaari, et al.
Published: (2025)
by: Ariana L. Shaari, et al.
Published: (2025)
A Comprehensive Survey on the Trustworthiness of Large Language Models in Healthcare
by: Aljohani, Manar, et al.
Published: (2025)
by: Aljohani, Manar, et al.
Published: (2025)
A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models
by: Wang, Yanbo, et al.
Published: (2025)
by: Wang, Yanbo, et al.
Published: (2025)
CAM: A Collection of Snapshots of GitHub Java Repositories Together with Metrics
by: Bugayenko, Yegor
Published: (2024)
by: Bugayenko, Yegor
Published: (2024)
Traceless projection of mixed tensor products, and walled Brauer algebras
by: Goncharov, Yegor
Published: (2025)
by: Goncharov, Yegor
Published: (2025)
Spiralling branes, affine qq-characters and elliptic integrable systems
by: Zenkevich, Yegor
Published: (2024)
by: Zenkevich, Yegor
Published: (2024)
Wall crossing, string networks and quantum toroidal algebras
by: Zenkevich, Yegor
Published: (2025)
by: Zenkevich, Yegor
Published: (2025)
Node-Level Uncertainty Estimation in LLM-Generated SQL
by: Hasson, Hilaf, et al.
Published: (2025)
by: Hasson, Hilaf, et al.
Published: (2025)
Towards Trustworthy Retrieval Augmented Generation for Large Language Models: A Survey
by: Ni, Bo, et al.
Published: (2025)
by: Ni, Bo, et al.
Published: (2025)
Trustworthy Alignment of Retrieval-Augmented Large Language Models via Reinforcement Learning
by: Zhang, Zongmeng, et al.
Published: (2024)
by: Zhang, Zongmeng, et al.
Published: (2024)
Similar Items
-
Understanding Chain-of-Thought in LLMs through Information Theory
by: Ton, Jean-Francois, et al.
Published: (2024) -
How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs
by: Estornell, Andrew, et al.
Published: (2025) -
Achievable Fairness on Your Data With Utility Guarantees
by: Taufiq, Muhammad Faaiz, et al.
Published: (2024) -
Uncertainty Quantification and Causal Considerations for Off-Policy Decision Making
by: Taufiq, Muhammad Faaiz
Published: (2025) -
A mean teacher algorithm for unlearning of language models
by: Klochkov, Yegor
Published: (2025)