ARMOR 2025: A Military-Aligned Benchmark for Evaluating Large Language Model Safety Beyond Civilian Contexts
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Johns, Sydney, Jin, Heng, Zhang, Chaoyu, Hou, Y. Thomas, Lou, Wenjing |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Enabling Trustworthy Federated Learning via Remote Attestation for Mitigating Byzantine Threats
von: Zhang, Chaoyu, et al.
Veröffentlicht: (2025)
von: Zhang, Chaoyu, et al.
Veröffentlicht: (2025)
ProFLingo: A Fingerprinting-based Intellectual Property Protection Scheme for Large Language Models
von: Jin, Heng, et al.
Veröffentlicht: (2024)
von: Jin, Heng, et al.
Veröffentlicht: (2024)
When Context Flips, Safety Breaks: Diagnosing Brittle Safety in Aligned Language Models
von: Choi, Dasol, et al.
Veröffentlicht: (2026)
von: Choi, Dasol, et al.
Veröffentlicht: (2026)
LongSafety: Evaluating Long-Context Safety of Large Language Models
von: Lu, Yida, et al.
Veröffentlicht: (2025)
von: Lu, Yida, et al.
Veröffentlicht: (2025)
CHiSafetyBench: A Chinese Hierarchical Safety Benchmark for Large Language Models
von: Zhang, Wenjing, et al.
Veröffentlicht: (2024)
von: Zhang, Wenjing, et al.
Veröffentlicht: (2024)
Quantum-Cognitive Tunnelling Neural Networks for Military-Civilian Vehicle Classification and Sentiment Analysis
von: Maksimovic, Milan, et al.
Veröffentlicht: (2025)
von: Maksimovic, Milan, et al.
Veröffentlicht: (2025)
On the Military Applications of Large Language Models
von: Johansson, Satu, et al.
Veröffentlicht: (2025)
von: Johansson, Satu, et al.
Veröffentlicht: (2025)
Safety Evaluation of DeepSeek Models in Chinese Contexts
von: Zhang, Wenjing, et al.
Veröffentlicht: (2025)
von: Zhang, Wenjing, et al.
Veröffentlicht: (2025)
SafeSci: Safety Evaluation of Large Language Models in Science Domains and Beyond
von: Zhu, Xiangyang, et al.
Veröffentlicht: (2026)
von: Zhu, Xiangyang, et al.
Veröffentlicht: (2026)
SPRI: Aligning Large Language Models with Context-Situated Principles
von: Zhan, Hongli, et al.
Veröffentlicht: (2025)
von: Zhan, Hongli, et al.
Veröffentlicht: (2025)
Beyond Output Correctness: Benchmarking and Evaluating Large Language Model Reasoning in Coding Tasks
von: Li, Yuangang, et al.
Veröffentlicht: (2026)
von: Li, Yuangang, et al.
Veröffentlicht: (2026)
Safety Layers in Aligned Large Language Models: The Key to LLM Security
von: Li, Shen, et al.
Veröffentlicht: (2024)
von: Li, Shen, et al.
Veröffentlicht: (2024)
Evaluating Menu OCR and Translation: A Benchmark for Aligning Human and Automated Evaluations in Large Vision-Language Models
von: Wu, Zhanglin, et al.
Veröffentlicht: (2025)
von: Wu, Zhanglin, et al.
Veröffentlicht: (2025)
Measuring and Eliminating Refusals in Military Large Language Models
von: FitzGerald, Jack, et al.
Veröffentlicht: (2026)
von: FitzGerald, Jack, et al.
Veröffentlicht: (2026)
SeCoKD: Aligning Large Language Models for In-Context Learning with Fewer Shots
von: Wang, Weixing, et al.
Veröffentlicht: (2024)
von: Wang, Weixing, et al.
Veröffentlicht: (2024)
JMedEthicBench: A Multi-Turn Conversational Benchmark for Evaluating Medical Safety in Japanese Large Language Models
von: Liu, Junyu, et al.
Veröffentlicht: (2026)
von: Liu, Junyu, et al.
Veröffentlicht: (2026)
USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models
von: Zheng, Baolin, et al.
Veröffentlicht: (2025)
von: Zheng, Baolin, et al.
Veröffentlicht: (2025)
TCMBench: A Comprehensive Benchmark for Evaluating Large Language Models in Traditional Chinese Medicine
von: Yue, Wenjing, et al.
Veröffentlicht: (2024)
von: Yue, Wenjing, et al.
Veröffentlicht: (2024)
MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers
von: Zong, Xuanjun, et al.
Veröffentlicht: (2025)
von: Zong, Xuanjun, et al.
Veröffentlicht: (2025)
Large Language Models for Classical Chinese Poetry Translation: Benchmarking, Evaluating, and Improving
von: Chen, Andong, et al.
Veröffentlicht: (2024)
von: Chen, Andong, et al.
Veröffentlicht: (2024)
Enterprise Large Language Model Evaluation Benchmark
von: Wang, Liya, et al.
Veröffentlicht: (2025)
von: Wang, Liya, et al.
Veröffentlicht: (2025)
Robustifying Safety-Aligned Large Language Models through Clean Data Curation
von: Liu, Xiaoqun, et al.
Veröffentlicht: (2024)
von: Liu, Xiaoqun, et al.
Veröffentlicht: (2024)
MedSafetyBench: Evaluating and Improving the Medical Safety of Large Language Models
von: Han, Tessa, et al.
Veröffentlicht: (2024)
von: Han, Tessa, et al.
Veröffentlicht: (2024)
Invasive Context Engineering to Control Large Language Models
von: Rivasseau, Thomas
Veröffentlicht: (2025)
von: Rivasseau, Thomas
Veröffentlicht: (2025)
Towards Context-Invariant Safety Alignment for Large Language Models
von: Wang, Yixu, et al.
Veröffentlicht: (2026)
von: Wang, Yixu, et al.
Veröffentlicht: (2026)
MSDiagnosis: A Benchmark for Evaluating Large Language Models in Multi-Step Clinical Diagnosis
von: Hou, Ruihui, et al.
Veröffentlicht: (2024)
von: Hou, Ruihui, et al.
Veröffentlicht: (2024)
Health-ORSC-Bench: A Benchmark for Measuring Over-Refusal and Safety Completion in Health Context
von: Zhang, Zhihao, et al.
Veröffentlicht: (2026)
von: Zhang, Zhihao, et al.
Veröffentlicht: (2026)
AlignBench: Benchmarking Chinese Alignment of Large Language Models
von: Liu, Xiao, et al.
Veröffentlicht: (2023)
von: Liu, Xiao, et al.
Veröffentlicht: (2023)
A Critical Evaluation of AI Feedback for Aligning Large Language Models
von: Sharma, Archit, et al.
Veröffentlicht: (2024)
von: Sharma, Archit, et al.
Veröffentlicht: (2024)
ARMOR: Empowering Multimodal Understanding Model with Interleaved Multimodal Generation Capability
von: Sun, Jianwen, et al.
Veröffentlicht: (2025)
von: Sun, Jianwen, et al.
Veröffentlicht: (2025)
CCJA: Context-Coherent Jailbreak Attack for Aligned Large Language Models
von: Zhou, Guanghao, et al.
Veröffentlicht: (2025)
von: Zhou, Guanghao, et al.
Veröffentlicht: (2025)
Restoring Calibration for Aligned Large Language Models: A Calibration-Aware Fine-Tuning Approach
von: Xiao, Jiancong, et al.
Veröffentlicht: (2025)
von: Xiao, Jiancong, et al.
Veröffentlicht: (2025)
Safety Evaluation and Enhancement of DeepSeek Models in Chinese Contexts
von: Zhang, Wenjing, et al.
Veröffentlicht: (2025)
von: Zhang, Wenjing, et al.
Veröffentlicht: (2025)
Beyond Labels: Aligning Large Language Models with Human-like Reasoning
von: Kabir, Muhammad Rafsan, et al.
Veröffentlicht: (2024)
von: Kabir, Muhammad Rafsan, et al.
Veröffentlicht: (2024)
ARMOR: Shielding Unlearnable Examples against Data Augmentation
von: Gong, Xueluan, et al.
Veröffentlicht: (2025)
von: Gong, Xueluan, et al.
Veröffentlicht: (2025)
Steering Multimodal Large Language Models Decoding for Context-Aware Safety
von: Liu, Zheyuan, et al.
Veröffentlicht: (2025)
von: Liu, Zheyuan, et al.
Veröffentlicht: (2025)
Context-DPO: Aligning Language Models for Context-Faithfulness
von: Bi, Baolong, et al.
Veröffentlicht: (2024)
von: Bi, Baolong, et al.
Veröffentlicht: (2024)
Beyond Prompts: Dynamic Conversational Benchmarking of Large Language Models
von: Castillo-Bolado, David, et al.
Veröffentlicht: (2024)
von: Castillo-Bolado, David, et al.
Veröffentlicht: (2024)
Beyond Graphs: Can Large Language Models Comprehend Hypergraphs?
von: Feng, Yifan, et al.
Veröffentlicht: (2024)
von: Feng, Yifan, et al.
Veröffentlicht: (2024)
SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal
von: Xie, Tinghao, et al.
Veröffentlicht: (2024)
von: Xie, Tinghao, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Enabling Trustworthy Federated Learning via Remote Attestation for Mitigating Byzantine Threats
von: Zhang, Chaoyu, et al.
Veröffentlicht: (2025) -
ProFLingo: A Fingerprinting-based Intellectual Property Protection Scheme for Large Language Models
von: Jin, Heng, et al.
Veröffentlicht: (2024) -
When Context Flips, Safety Breaks: Diagnosing Brittle Safety in Aligned Language Models
von: Choi, Dasol, et al.
Veröffentlicht: (2026) -
LongSafety: Evaluating Long-Context Safety of Large Language Models
von: Lu, Yida, et al.
Veröffentlicht: (2025) -
CHiSafetyBench: A Chinese Hierarchical Safety Benchmark for Large Language Models
von: Zhang, Wenjing, et al.
Veröffentlicht: (2024)