Guardian-as-an-Advisor: Advancing Next-Generation Guardian Models for Trustworthy LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Huang, Yue, Zhuang, Haomin, Ye, Jiayi, Bao, Han, Wang, Yanbo, Hua, Hang, Wu, Siyuan, Chen, Pin-Yu, Zhang, Xiangliang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Granite Guardian
di: Padhi, Inkit, et al.
Pubblicazione: (2024)
di: Padhi, Inkit, et al.
Pubblicazione: (2024)
Adaptive Distraction: Probing LLM Contextual Robustness with Automated Tree Search
di: Wang, Yanbo, et al.
Pubblicazione: (2025)
di: Wang, Yanbo, et al.
Pubblicazione: (2025)
Guardians of Discourse: Evaluating LLMs on Multilingual Offensive Language Detection
di: He, Jianfei, et al.
Pubblicazione: (2024)
di: He, Jianfei, et al.
Pubblicazione: (2024)
Dual Optimal: Make Your LLM Peer-like with Dignity
di: Wang, Xiangqi, et al.
Pubblicazione: (2026)
di: Wang, Xiangqi, et al.
Pubblicazione: (2026)
Dissecting Logical Reasoning in LLMs: A Fine-Grained Evaluation and Supervision Study
di: Zhou, Yujun, et al.
Pubblicazione: (2025)
di: Zhou, Yujun, et al.
Pubblicazione: (2025)
SLM as Guardian: Pioneering AI Safety with Small Language Models
di: Kwon, Ohjoon, et al.
Pubblicazione: (2024)
di: Kwon, Ohjoon, et al.
Pubblicazione: (2024)
Social Science Meets LLMs: How Reliable Are Large Language Models in Social Simulations?
di: Huang, Yue, et al.
Pubblicazione: (2024)
di: Huang, Yue, et al.
Pubblicazione: (2024)
DynaGuard: A Dynamic Guardian Model With User-Defined Policies
di: Hoover, Monte, et al.
Pubblicazione: (2025)
di: Hoover, Monte, et al.
Pubblicazione: (2025)
Reliable Control-Point Selection for Steering Reasoning in Large Language Models
di: Zhuang, Haomin, et al.
Pubblicazione: (2026)
di: Zhuang, Haomin, et al.
Pubblicazione: (2026)
Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM
di: Zhang, Chi, et al.
Pubblicazione: (2025)
di: Zhang, Chi, et al.
Pubblicazione: (2025)
Guardians of the Machine Translation Meta-Evaluation: Sentinel Metrics Fall In!
di: Perrella, Stefano, et al.
Pubblicazione: (2024)
di: Perrella, Stefano, et al.
Pubblicazione: (2024)
SocialMaze: A Benchmark for Evaluating Social Reasoning in Large Language Models
di: Xu, Zixiang, et al.
Pubblicazione: (2025)
di: Xu, Zixiang, et al.
Pubblicazione: (2025)
Exploring Multi-Temperature Strategies for Token- and Rollout-Level Control in RLVR
di: Zhuang, Haomin, et al.
Pubblicazione: (2025)
di: Zhuang, Haomin, et al.
Pubblicazione: (2025)
The Privacy Guardian Agent: Towards Trustworthy AI Privacy Agents
di: Freiberger, Vincent
Pubblicazione: (2026)
di: Freiberger, Vincent
Pubblicazione: (2026)
SEUF: Is Unlearning One Expert Enough for Mixture-of-Experts LLMs?
di: Zhuang, Haomin, et al.
Pubblicazione: (2024)
di: Zhuang, Haomin, et al.
Pubblicazione: (2024)
ChemOrch: Empowering LLMs with Chemical Intelligence via Synthetic Instructions
di: Huang, Yue, et al.
Pubblicazione: (2025)
di: Huang, Yue, et al.
Pubblicazione: (2025)
Large language models for newspaper sentiment analysis during COVID-19: The Guardian
di: Chandra, Rohitash, et al.
Pubblicazione: (2024)
di: Chandra, Rohitash, et al.
Pubblicazione: (2024)
Equality's Guardians
Pubblicazione: (2025)
Pubblicazione: (2025)
Guardians of the Sea
Pubblicazione: (2018)
Pubblicazione: (2018)
Justice or Prejudice? Quantifying Biases in LLM-as-a-Judge
di: Ye, Jiayi, et al.
Pubblicazione: (2024)
di: Ye, Jiayi, et al.
Pubblicazione: (2024)
SWAP: Study Work Advisor Program: Handbook for the Project Director, Sponsor, Employer, Parent or Guardian.
di: Boeyink, Joann, et al.
Pubblicazione: (1973)
di: Boeyink, Joann, et al.
Pubblicazione: (1973)
UniGuardian: A Unified Defense for Detecting Prompt Injection, Backdoor Attacks and Adversarial Attacks in Large Language Models
di: Lin, Huawei, et al.
Pubblicazione: (2025)
di: Lin, Huawei, et al.
Pubblicazione: (2025)
How to Train Your Advisor: Steering Black-Box LLMs with Advisor Models
di: Asawa, Parth, et al.
Pubblicazione: (2025)
di: Asawa, Parth, et al.
Pubblicazione: (2025)
Cross-Lingual Pitfalls: Automatic Probing Cross-Lingual Weakness of Multilingual Large Language Models
di: Xu, Zixiang, et al.
Pubblicazione: (2025)
di: Xu, Zixiang, et al.
Pubblicazione: (2025)
The Guardian and The NY Times
di: Anonymous Author
Pubblicazione: (2025)
di: Anonymous Author
Pubblicazione: (2025)
Economic Research Guardian
Pubblicazione: (2013)
Pubblicazione: (2013)
Guardians of Land and Water
Pubblicazione: (2025)
Pubblicazione: (2025)
Guardians of Public Value
di: Boin, Arjen, et al.
Pubblicazione: (2020)
di: Boin, Arjen, et al.
Pubblicazione: (2020)
Guardians of the Quantum GAN
di: Ghosh, Archisman, et al.
Pubblicazione: (2024)
di: Ghosh, Archisman, et al.
Pubblicazione: (2024)
1+1>2: Can Large Language Models Serve as Cross-Lingual Knowledge Aggregators?
di: Huang, Yue, et al.
Pubblicazione: (2024)
di: Huang, Yue, et al.
Pubblicazione: (2024)
A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models
di: Wang, Yanbo, et al.
Pubblicazione: (2025)
di: Wang, Yanbo, et al.
Pubblicazione: (2025)
Emergent Social Intelligence Risks in Generative Multi-Agent Systems
di: Huang, Yue, et al.
Pubblicazione: (2026)
di: Huang, Yue, et al.
Pubblicazione: (2026)
Guardian Lion of Route 66
di: Scan-the-World
Pubblicazione: (2026)
di: Scan-the-World
Pubblicazione: (2026)
Guardián de la conciencia
di: Egan, Linda
Pubblicazione: (2008)
di: Egan, Linda
Pubblicazione: (2008)
Guardianes de la red
di: Villalobos, Jorge
Pubblicazione: (2007)
di: Villalobos, Jorge
Pubblicazione: (2007)
AI Alignment Breaks at the Edge
di: Bao, Han, et al.
Pubblicazione: (2026)
di: Bao, Han, et al.
Pubblicazione: (2026)
TrustLLM: Trustworthiness in Large Language Models
di: Huang, Yue, et al.
Pubblicazione: (2024)
di: Huang, Yue, et al.
Pubblicazione: (2024)
DataGen: Unified Synthetic Dataset Generation via Large Language Models
di: Huang, Yue, et al.
Pubblicazione: (2024)
di: Huang, Yue, et al.
Pubblicazione: (2024)
LegalGuardian: A Privacy-Preserving Framework for Secure Integration of Large Language Models in Legal Practice
di: Demir, M. Mikail, et al.
Pubblicazione: (2025)
di: Demir, M. Mikail, et al.
Pubblicazione: (2025)
SenseMath: Do LLMs Have Number Sense? Evaluating Shortcut Use, Judgment, and Generation
di: Zhuang, Haomin, et al.
Pubblicazione: (2026)
di: Zhuang, Haomin, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Granite Guardian
di: Padhi, Inkit, et al.
Pubblicazione: (2024) -
Adaptive Distraction: Probing LLM Contextual Robustness with Automated Tree Search
di: Wang, Yanbo, et al.
Pubblicazione: (2025) -
Guardians of Discourse: Evaluating LLMs on Multilingual Offensive Language Detection
di: He, Jianfei, et al.
Pubblicazione: (2024) -
Dual Optimal: Make Your LLM Peer-like with Dignity
di: Wang, Xiangqi, et al.
Pubblicazione: (2026) -
Dissecting Logical Reasoning in LLMs: A Fine-Grained Evaluation and Supervision Study
di: Zhou, Yujun, et al.
Pubblicazione: (2025)