Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests
Fuente:
arXiv
Salvato in:
| Autori principali: | Noever, David, McKee, Forrest |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Can AI Freelancers Compete? Benchmarking Earnings, Reliability, and Task Success at Scale
di: Noever, David, et al.
Pubblicazione: (2025)
di: Noever, David, et al.
Pubblicazione: (2025)
The Impossible Test: A 2024 Unsolvable Dataset and A Chance for an AGI Quiz
di: Noever, David, et al.
Pubblicazione: (2024)
di: Noever, David, et al.
Pubblicazione: (2024)
Alpha Excel Benchmark
di: Noever, David, et al.
Pubblicazione: (2025)
di: Noever, David, et al.
Pubblicazione: (2025)
Moravec's Paradox: Towards an Auditory Turing Test
di: Noever, David, et al.
Pubblicazione: (2025)
di: Noever, David, et al.
Pubblicazione: (2025)
Hallucinating AI Hijacking Attack: Large Language Models and Malicious Code Recommenders
di: Noever, David, et al.
Pubblicazione: (2024)
di: Noever, David, et al.
Pubblicazione: (2024)
AirTag, You're It: Reverse Logistics and Last Mile Dynamics
di: Noever, David, et al.
Pubblicazione: (2025)
di: Noever, David, et al.
Pubblicazione: (2025)
Beyond No: Quantifying AI Over-Refusal and Emotional Attachment Boundaries
di: Noever, David, et al.
Pubblicazione: (2025)
di: Noever, David, et al.
Pubblicazione: (2025)
Novel AI Camera Camouflage: Face Cloaking Without Full Disguise
di: Noever, David, et al.
Pubblicazione: (2024)
di: Noever, David, et al.
Pubblicazione: (2024)
Exploiting Alpha Transparency In Language And Vision-Based AI Systems
di: Noever, David, et al.
Pubblicazione: (2024)
di: Noever, David, et al.
Pubblicazione: (2024)
Transparency Attacks: How Imperceptible Image Layers Can Fool AI Perception
di: McKee, Forrest, et al.
Pubblicazione: (2024)
di: McKee, Forrest, et al.
Pubblicazione: (2024)
Infecting Generative AI With Viruses
di: Noever, David, et al.
Pubblicazione: (2025)
di: Noever, David, et al.
Pubblicazione: (2025)
Dueling QR Codes: The Hyding of Dr. Jeckyl
di: Noever, David, et al.
Pubblicazione: (2025)
di: Noever, David, et al.
Pubblicazione: (2025)
Favicon Trojans: Executable Steganography Via Ico Alpha Channel Exploitation
di: Noever, David, et al.
Pubblicazione: (2025)
di: Noever, David, et al.
Pubblicazione: (2025)
Safeguarding Voice Privacy: Harnessing Near-Ultrasonic Interference To Protect Against Unauthorized Audio Recording
di: McKee, Forrest, et al.
Pubblicazione: (2024)
di: McKee, Forrest, et al.
Pubblicazione: (2024)
OR-Bench: An Over-Refusal Benchmark for Large Language Models
di: Cui, Justin, et al.
Pubblicazione: (2024)
di: Cui, Justin, et al.
Pubblicazione: (2024)
Can AI Validate Science? Benchmarking LLMs for Accurate Scientific Claim $\rightarrow$ Evidence Reasoning
di: Javaji, Shashidhar Reddy, et al.
Pubblicazione: (2025)
di: Javaji, Shashidhar Reddy, et al.
Pubblicazione: (2025)
PreScience: A Benchmark for Forecasting Scientific Contributions
di: Ajith, Anirudh, et al.
Pubblicazione: (2026)
di: Ajith, Anirudh, et al.
Pubblicazione: (2026)
Refusal Steering: Fine-grained Control over LLM Refusal Behaviour for Sensitive Topics
di: García-Ferrero, Iker, et al.
Pubblicazione: (2025)
di: García-Ferrero, Iker, et al.
Pubblicazione: (2025)
InfiniteScienceGym: An Unbounded, Procedurally-Generated Benchmark for Scientific Analysis
di: Bentham, Oliver, et al.
Pubblicazione: (2026)
di: Bentham, Oliver, et al.
Pubblicazione: (2026)
Discovering Forbidden Topics in Language Models
di: Rager, Can, et al.
Pubblicazione: (2025)
di: Rager, Can, et al.
Pubblicazione: (2025)
Think Before Refusal : Triggering Safety Reflection in LLMs to Mitigate False Refusal Behavior
di: Si, Shengyun, et al.
Pubblicazione: (2025)
di: Si, Shengyun, et al.
Pubblicazione: (2025)
Can LLMs Refuse Questions They Do Not Know? Measuring Knowledge-Aware Refusal in Factual Tasks
di: Pan, Wenbo, et al.
Pubblicazione: (2025)
di: Pan, Wenbo, et al.
Pubblicazione: (2025)
Refuse Whenever You Feel Unsafe: Improving Safety in LLMs via Decoupled Refusal Training
di: Yuan, Youliang, et al.
Pubblicazione: (2024)
di: Yuan, Youliang, et al.
Pubblicazione: (2024)
VisScience: An Extensive Benchmark for Evaluating K12 Educational Multi-modal Scientific Reasoning
di: Jiang, Zhihuan, et al.
Pubblicazione: (2024)
di: Jiang, Zhihuan, et al.
Pubblicazione: (2024)
AstaBench: Rigorous Benchmarking of AI Agents with a Scientific Research Suite
di: Bragg, Jonathan, et al.
Pubblicazione: (2025)
di: Bragg, Jonathan, et al.
Pubblicazione: (2025)
MASSW: A New Dataset and Benchmark Tasks for AI-Assisted Scientific Workflows
di: Zhang, Xingjian, et al.
Pubblicazione: (2024)
di: Zhang, Xingjian, et al.
Pubblicazione: (2024)
MCPMark: A Benchmark for Stress-Testing Realistic and Comprehensive MCP Use
di: Wu, Zijian, et al.
Pubblicazione: (2025)
di: Wu, Zijian, et al.
Pubblicazione: (2025)
Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs
di: von Recum, Alexander, et al.
Pubblicazione: (2024)
di: von Recum, Alexander, et al.
Pubblicazione: (2024)
Measuring and Eliminating Refusals in Military Large Language Models
di: FitzGerald, Jack, et al.
Pubblicazione: (2026)
di: FitzGerald, Jack, et al.
Pubblicazione: (2026)
Learn to Refuse: Making Large Language Models More Controllable and Reliable through Knowledge Scope Limitation and Refusal Mechanism
di: Cao, Lang
Pubblicazione: (2023)
di: Cao, Lang
Pubblicazione: (2023)
RefusalBench: Generative Evaluation of Selective Refusal in Grounded Language Models
di: Muhamed, Aashiq, et al.
Pubblicazione: (2025)
di: Muhamed, Aashiq, et al.
Pubblicazione: (2025)
Goal-Directed Search Outperforms Goal-Agnostic Memory Compression in Long-Context Memory Tasks
di: Zheng, Yicong, et al.
Pubblicazione: (2025)
di: Zheng, Yicong, et al.
Pubblicazione: (2025)
Linearly Decoding Refused Knowledge in Aligned Language Models
di: Shrivastava, Aryan, et al.
Pubblicazione: (2025)
di: Shrivastava, Aryan, et al.
Pubblicazione: (2025)
COSMIC: Generalized Refusal Direction Identification in LLM Activations
di: Siu, Vincent, et al.
Pubblicazione: (2025)
di: Siu, Vincent, et al.
Pubblicazione: (2025)
Learning to Refuse: Towards Mitigating Privacy Risks in LLMs
di: Liu, Zhenhua, et al.
Pubblicazione: (2024)
di: Liu, Zhenhua, et al.
Pubblicazione: (2024)
From Rogue to Safe AI: The Role of Explicit Refusals in Aligning LLMs with International Humanitarian Law
di: Mavi, John, et al.
Pubblicazione: (2025)
di: Mavi, John, et al.
Pubblicazione: (2025)
Literary Narrative as Moral Probe : A Cross-System Framework for Evaluating AI Ethical Reasoning and Refusal Behavior
di: Flynn, David C.
Pubblicazione: (2026)
di: Flynn, David C.
Pubblicazione: (2026)
RepIt: Steering Language Models with Concept-Specific Refusal Vectors
di: Siu, Vincent, et al.
Pubblicazione: (2025)
di: Siu, Vincent, et al.
Pubblicazione: (2025)
Refusal Behavior in Large Language Models: A Nonlinear Perspective
di: Hildebrandt, Fabian, et al.
Pubblicazione: (2025)
di: Hildebrandt, Fabian, et al.
Pubblicazione: (2025)
BioKGBench: A Knowledge Graph Checking Benchmark of AI Agent for Biomedical Science
di: Lin, Xinna, et al.
Pubblicazione: (2024)
di: Lin, Xinna, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Can AI Freelancers Compete? Benchmarking Earnings, Reliability, and Task Success at Scale
di: Noever, David, et al.
Pubblicazione: (2025) -
The Impossible Test: A 2024 Unsolvable Dataset and A Chance for an AGI Quiz
di: Noever, David, et al.
Pubblicazione: (2024) -
Alpha Excel Benchmark
di: Noever, David, et al.
Pubblicazione: (2025) -
Moravec's Paradox: Towards an Auditory Turing Test
di: Noever, David, et al.
Pubblicazione: (2025) -
Hallucinating AI Hijacking Attack: Large Language Models and Malicious Code Recommenders
di: Noever, David, et al.
Pubblicazione: (2024)