Output Scouting: Auditing Large Language Models for Catastrophic Responses
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Bell, Andrew, Fonseca, Joao |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Safeguarding Large Language Models in Real-time with Tunable Safety-Performance Trade-offs
par: Fonseca, Joao, et autres
Publié: (2025)
par: Fonseca, Joao, et autres
Publié: (2025)
Revisiting Catastrophic Forgetting in Large Language Model Tuning
par: Li, Hongyu, et autres
Publié: (2024)
par: Li, Hongyu, et autres
Publié: (2024)
The Outputs of Large Language Models are Meaningless
par: Hattiangadi, Anandi, et autres
Publié: (2025)
par: Hattiangadi, Anandi, et autres
Publié: (2025)
Mitigating Catastrophic Forgetting in Large Language Models with Self-Synthesized Rehearsal
par: Huang, Jianheng, et autres
Publié: (2024)
par: Huang, Jianheng, et autres
Publié: (2024)
AuditWen:An Open-Source Large Language Model for Audit
par: Huang, Jiajia, et autres
Publié: (2024)
par: Huang, Jiajia, et autres
Publié: (2024)
Improved Supervised Fine-Tuning for Large Language Models to Mitigate Catastrophic Forgetting
par: Ding, Fei, et autres
Publié: (2025)
par: Ding, Fei, et autres
Publié: (2025)
CALM: Curiosity-Driven Auditing for Large Language Models
par: Zheng, Xiang, et autres
Publié: (2025)
par: Zheng, Xiang, et autres
Publié: (2025)
Towards Automated Regulatory Compliance Verification in Financial Auditing with Large Language Models
par: Berger, Armin, et autres
Publié: (2025)
par: Berger, Armin, et autres
Publié: (2025)
What Is Missing: Interpretable Ratings for Large Language Model Outputs
par: Stranges, Nicholas, et autres
Publié: (2026)
par: Stranges, Nicholas, et autres
Publié: (2026)
Countering Catastrophic Forgetting of Large Language Models for Better Instruction Following via Weight-Space Model Merging
par: Lyu, Mengxian, et autres
Publié: (2026)
par: Lyu, Mengxian, et autres
Publié: (2026)
MoE-CT: A Novel Approach For Large Language Models Training With Resistance To Catastrophic Forgetting
par: Li, Tianhao, et autres
Publié: (2024)
par: Li, Tianhao, et autres
Publié: (2024)
The Structured Output Benchmark: A Multi-Source Benchmark for Evaluating Structured Output Quality in Large Language Models
par: Singh, Abhinav Kumar, et autres
Publié: (2026)
par: Singh, Abhinav Kumar, et autres
Publié: (2026)
PRISM: A Methodology for Auditing Biases in Large Language Models
par: Azzopardi, Leif, et autres
Publié: (2024)
par: Azzopardi, Leif, et autres
Publié: (2024)
SLOT: Structuring the Output of Large Language Models
par: Wang, Darren Yow-Bang, et autres
Publié: (2025)
par: Wang, Darren Yow-Bang, et autres
Publié: (2025)
INACIA: Integrating Large Language Models in Brazilian Audit Courts: Opportunities and Challenges
par: Pereira, Jayr, et autres
Publié: (2024)
par: Pereira, Jayr, et autres
Publié: (2024)
Don't Change My View: Ideological Bias Auditing in Large Language Models
par: Kröger, Paul, et autres
Publié: (2025)
par: Kröger, Paul, et autres
Publié: (2025)
Soft Token Attacks Cannot Reliably Audit Unlearning in Large Language Models
par: Chen, Haokun, et autres
Publié: (2025)
par: Chen, Haokun, et autres
Publié: (2025)
Detoxification of Large Language Models through Output-layer Fusion with a Calibration Model
par: Tian, Yuanhe, et autres
Publié: (2025)
par: Tian, Yuanhe, et autres
Publié: (2025)
An Evaluation on Large Language Model Outputs: Discourse and Memorization
par: de Wynter, Adrian, et autres
Publié: (2023)
par: de Wynter, Adrian, et autres
Publié: (2023)
StruEdit: Structured Outputs Enable the Fast and Accurate Knowledge Editing for Large Language Models
par: Bi, Baolong, et autres
Publié: (2024)
par: Bi, Baolong, et autres
Publié: (2024)
Convergence of Outputs When Two Large Language Models Interact in a Multi-Agentic Setup
par: Maiti, Aniruddha, et autres
Publié: (2025)
par: Maiti, Aniruddha, et autres
Publié: (2025)
Mind the Gap: Conformative Decoding to Improve Output Diversity of Instruction-Tuned Large Language Models
par: Peeperkorn, Max, et autres
Publié: (2025)
par: Peeperkorn, Max, et autres
Publié: (2025)
Preventing Catastrophic Forgetting: Behavior-Aware Sampling for Safer Language Model Fine-Tuning
par: Pham, Anh, et autres
Publié: (2025)
par: Pham, Anh, et autres
Publié: (2025)
Challenges and Responses in the Practice of Large Language Models
par: Zhu, Hongyin
Publié: (2024)
par: Zhu, Hongyin
Publié: (2024)
Can Large Language Model Summarizers Adapt to Diverse Scientific Communication Goals?
par: Fonseca, Marcio, et autres
Publié: (2024)
par: Fonseca, Marcio, et autres
Publié: (2024)
Information Suppression in Large Language Models: Auditing, Quantifying, and Characterizing Censorship in DeepSeek
par: Qiu, Peiran, et autres
Publié: (2025)
par: Qiu, Peiran, et autres
Publié: (2025)
Safe Inputs but Unsafe Output: Benchmarking Cross-modality Safety Alignment of Large Vision-Language Model
par: Wang, Siyin, et autres
Publié: (2024)
par: Wang, Siyin, et autres
Publié: (2024)
DynamicRAG: Leveraging Outputs of Large Language Model as Feedback for Dynamic Reranking in Retrieval-Augmented Generation
par: Sun, Jiashuo, et autres
Publié: (2025)
par: Sun, Jiashuo, et autres
Publié: (2025)
SoK: Large Language Model Copyright Auditing via Fingerprinting
par: Shao, Shuo, et autres
Publié: (2025)
par: Shao, Shuo, et autres
Publié: (2025)
Concept-Level Explainability for Auditing & Steering LLM Responses
par: Amara, Kenza, et autres
Publié: (2025)
par: Amara, Kenza, et autres
Publié: (2025)
How Independent are Large Language Models? A Statistical Framework for Auditing Behavioral Entanglement and Reweighting Verifier Ensembles
par: Kuai, Chenchen, et autres
Publié: (2026)
par: Kuai, Chenchen, et autres
Publié: (2026)
Group-Aware Reinforcement Learning for Output Diversity in Large Language Models
par: Anschel, Oron, et autres
Publié: (2025)
par: Anschel, Oron, et autres
Publié: (2025)
Large Language Models Produce Responses Perceived to be Empathic
par: Lee, Yoon Kyung, et autres
Publié: (2024)
par: Lee, Yoon Kyung, et autres
Publié: (2024)
Enhancing Human-Like Responses in Large Language Models
par: Çalık, Ethem Yağız, et autres
Publié: (2025)
par: Çalık, Ethem Yağız, et autres
Publié: (2025)
Political Alignment in Large Language Models: A Multidimensional Audit of Psychometric Identity and Behavioral Bias
par: Sakhawat, Adib, et autres
Publié: (2026)
par: Sakhawat, Adib, et autres
Publié: (2026)
Large Human Language Models: A Need and the Challenges
par: Soni, Nikita, et autres
Publié: (2023)
par: Soni, Nikita, et autres
Publié: (2023)
UloRL:An Ultra-Long Output Reinforcement Learning Approach for Advancing Large Language Models' Reasoning Abilities
par: Du, Dong, et autres
Publié: (2025)
par: Du, Dong, et autres
Publié: (2025)
ContextGuard: Structured Self-Auditing for Context Learning in Language Models
par: Jin, Hongbo, et autres
Publié: (2026)
par: Jin, Hongbo, et autres
Publié: (2026)
Audit-of-Understanding: Posterior-Constrained Inference for Mathematical Reasoning in Language Models
par: Abdaljalil, Samir, et autres
Publié: (2025)
par: Abdaljalil, Samir, et autres
Publié: (2025)
Can Large Language Models Follow Concept Annotation Guidelines? A Case Study on Scientific and Financial Domains
par: Fonseca, Marcio, et autres
Publié: (2023)
par: Fonseca, Marcio, et autres
Publié: (2023)
Documents similaires
-
Safeguarding Large Language Models in Real-time with Tunable Safety-Performance Trade-offs
par: Fonseca, Joao, et autres
Publié: (2025) -
Revisiting Catastrophic Forgetting in Large Language Model Tuning
par: Li, Hongyu, et autres
Publié: (2024) -
The Outputs of Large Language Models are Meaningless
par: Hattiangadi, Anandi, et autres
Publié: (2025) -
Mitigating Catastrophic Forgetting in Large Language Models with Self-Synthesized Rehearsal
par: Huang, Jianheng, et autres
Publié: (2024) -
AuditWen:An Open-Source Large Language Model for Audit
par: Huang, Jiajia, et autres
Publié: (2024)