ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain
Fuente:
arXiv
Saved in:
| Main Authors: | Zhao, Haochen, Tang, Xiangru, Yang, Ziran, Han, Xiao, Feng, Xuanzhi, Fan, Yueqing, Cheng, Senhao, Jin, Di, Zhao, Yilun, Cohan, Arman, Gerstein, Mark |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Investigating Data Contamination in Modern Benchmarks for Large Language Models
by: Deng, Chunyuan, et al.
Published: (2023)
by: Deng, Chunyuan, et al.
Published: (2023)
Struc-Bench: Are Large Language Models Really Good at Generating Complex Structured Data?
by: Tang, Xiangru, et al.
Published: (2023)
by: Tang, Xiangru, et al.
Published: (2023)
MIMIR: A Streamlined Platform for Personalized Agent Tuning in Domain Expertise
by: Deng, Chunyuan, et al.
Published: (2024)
by: Deng, Chunyuan, et al.
Published: (2024)
MedAgentsBench: Benchmarking Thinking Models and Agent Frameworks for Complex Medical Reasoning
by: Tang, Xiangru, et al.
Published: (2025)
by: Tang, Xiangru, et al.
Published: (2025)
MedAgents: Large Language Models as Collaborators for Zero-shot Medical Reasoning
by: Tang, Xiangru, et al.
Published: (2023)
by: Tang, Xiangru, et al.
Published: (2023)
Step-Back Profiling: Distilling User History for Personalized Scientific Writing
by: Tang, Xiangru, et al.
Published: (2024)
by: Tang, Xiangru, et al.
Published: (2024)
ChemAgent: Self-updating Library in Large Language Models Improves Chemical Reasoning
by: Tang, Xiangru, et al.
Published: (2025)
by: Tang, Xiangru, et al.
Published: (2025)
ChemKANs for Combustion Chemistry Modeling and Acceleration
by: Koenig, Benjamin C., et al.
Published: (2025)
by: Koenig, Benjamin C., et al.
Published: (2025)
A Large Language Model for Chemistry and Retrosynthesis Predictions
by: Zhang, Yueqing, et al.
Published: (2025)
by: Zhang, Yueqing, et al.
Published: (2025)
FinTrust: A Comprehensive Benchmark of Trustworthiness Evaluation in Finance Domain
by: Hu, Tiansheng, et al.
Published: (2025)
by: Hu, Tiansheng, et al.
Published: (2025)
PRESTO: Progressive Pretraining Enhances Synthetic Chemistry Outcomes
by: Cao, He, et al.
Published: (2024)
by: Cao, He, et al.
Published: (2024)
Beyond the Training Domain: Robust Generative Transition State Models for Unseen Chemistry
by: Darouich, Samir, et al.
Published: (2026)
by: Darouich, Samir, et al.
Published: (2026)
Automating Computational Chemistry Workflows via OpenClaw and Domain-Specific Skills
by: Ding, Mingwei, et al.
Published: (2026)
by: Ding, Mingwei, et al.
Published: (2026)
SAGE: Benchmarking and Improving Retrieval for Deep Research Agents
by: Hu, Tiansheng, et al.
Published: (2026)
by: Hu, Tiansheng, et al.
Published: (2026)
Large Language Models to Accelerate Organic Chemistry Synthesis
by: Zhang, Yu, et al.
Published: (2025)
by: Zhang, Yu, et al.
Published: (2025)
xChemAgents: Agentic AI for Explainable Quantum Chemistry
by: Polat, Can, et al.
Published: (2025)
by: Polat, Can, et al.
Published: (2025)
Cover Feature: A Review on Chemistry and Methods of Synthesis of 1,2,4‐Triazole Derivatives (Chem. Rec. 1/2025)
by: Searitha Couto Rodrigues, et al.
Published: (2025)
by: Searitha Couto Rodrigues, et al.
Published: (2025)
MolErr2Fix: Benchmarking LLM Trustworthiness in Chemistry via Modular Error Detection, Localization, Explanation, and Revision
by: Wu, Yuyang, et al.
Published: (2025)
by: Wu, Yuyang, et al.
Published: (2025)
ChemNLP: A Natural Language Processing based Library for Materials Chemistry Text Data
by: Choudhary, Kamal, et al.
Published: (2022)
by: Choudhary, Kamal, et al.
Published: (2022)
On the Hamiltonian used in Polaritonic Chemistry
by: Fiechter, Marit R., et al.
Published: (2025)
by: Fiechter, Marit R., et al.
Published: (2025)
Quantum Solvers for Nonlinear Matrix Equations in Quantum Chemistry
by: Rodenas-Ruiz, Pablo, et al.
Published: (2026)
by: Rodenas-Ruiz, Pablo, et al.
Published: (2026)
One-shot Optimized Steering Vectors Mediate Safety-relevant Behaviors in LLMs
by: Dunefsky, Jacob, et al.
Published: (2025)
by: Dunefsky, Jacob, et al.
Published: (2025)
QuantumChem-200K: A Large-Scale Open Organic Molecular Dataset for Quantum-Chemistry Property Screening and Language Model Benchmarking
by: Zeng, Yinqi, et al.
Published: (2025)
by: Zeng, Yinqi, et al.
Published: (2025)
Unveiling the Spectrum of Data Contamination in Language Models: A Survey from Detection to Remediation
by: Deng, Chunyuan, et al.
Published: (2024)
by: Deng, Chunyuan, et al.
Published: (2024)
Cover Picture: Reductive Transformation of CO2 to Organic Compounds (Chem. Rec. 12/2024)
by: An‐Guo Wu, et al.
Published: (2024)
by: An‐Guo Wu, et al.
Published: (2024)
Risks of AI Scientists: Prioritizing Safeguarding Over Autonomy
by: Tang, Xiangru, et al.
Published: (2024)
by: Tang, Xiangru, et al.
Published: (2024)
QCBench: Evaluating Large Language Models on Domain-Specific Quantitative Chemistry
by: Xie, Jiaqing, et al.
Published: (2025)
by: Xie, Jiaqing, et al.
Published: (2025)
Cover Picture: Catalytic Enantioselective Access to Planar‐Chiral Macrocyclophanes (Chem. Rec. 7/2025)
by: Lei Yang, et al.
Published: (2025)
by: Lei Yang, et al.
Published: (2025)
SUCEA: Reasoning-Intensive Retrieval for Adversarial Fact-checking through Claim Decomposition and Editing
by: Liu, Hongjun, et al.
Published: (2025)
by: Liu, Hongjun, et al.
Published: (2025)
MCTS-RAG: Enhancing Retrieval-Augmented Generation with Monte Carlo Tree Search
by: Hu, Yunhai, et al.
Published: (2025)
by: Hu, Yunhai, et al.
Published: (2025)
Chemistry in Ukraine
by: Oleksandr O. Grygorenko, et al.
Published: (2024)
by: Oleksandr O. Grygorenko, et al.
Published: (2024)
ChemGraph: An Agentic Framework for Computational Chemistry Workflows
by: Pham, Thang D., et al.
Published: (2025)
by: Pham, Thang D., et al.
Published: (2025)
FinanceMath: Knowledge-Intensive Math Reasoning in Finance Domains
by: Zhao, Yilun, et al.
Published: (2023)
by: Zhao, Yilun, et al.
Published: (2023)
Cover Picture: Recent Developments in the Fabrication and Application of Superhydrophobic Suraces (Chem. Rec. 9/2024)
by: Ting Li, et al.
Published: (2024)
by: Ting Li, et al.
Published: (2024)
Forte: A Suite of Advanced Multireference Quantum Chemistry Methods
by: Evangelista, Francesco A., et al.
Published: (2024)
by: Evangelista, Francesco A., et al.
Published: (2024)
Aqueous Solution Chemistry In Silico and the Role of Data Driven Approaches
by: Banerjee, Debarshi, et al.
Published: (2024)
by: Banerjee, Debarshi, et al.
Published: (2024)
Benchmarking Universal Machine-Learned Interatomic Potentials for High-Temperature Metal-Organic Framework Chemistry
by: Edwards, Connor W., et al.
Published: (2026)
by: Edwards, Connor W., et al.
Published: (2026)
Cover Picture: Toward Sustainable Utilization and Production of Tartaric Acid (Chem. Rec. 11/2024)
by: Xiran Li, et al.
Published: (2024)
by: Xiran Li, et al.
Published: (2024)
Chemical Safety and Toxicology: A Comprehensive Review of Current Protocols and Principles
by: Bordikar, Chetan P.
Published: (2025)
by: Bordikar, Chetan P.
Published: (2025)
Cover Picture: (Chem. Rec. 2/2024)
Published: (2024)
Published: (2024)
Similar Items
-
Investigating Data Contamination in Modern Benchmarks for Large Language Models
by: Deng, Chunyuan, et al.
Published: (2023) -
Struc-Bench: Are Large Language Models Really Good at Generating Complex Structured Data?
by: Tang, Xiangru, et al.
Published: (2023) -
MIMIR: A Streamlined Platform for Personalized Agent Tuning in Domain Expertise
by: Deng, Chunyuan, et al.
Published: (2024) -
MedAgentsBench: Benchmarking Thinking Models and Agent Frameworks for Complex Medical Reasoning
by: Tang, Xiangru, et al.
Published: (2025) -
MedAgents: Large Language Models as Collaborators for Zero-shot Medical Reasoning
by: Tang, Xiangru, et al.
Published: (2023)