SciTrust 2.0: A Comprehensive Framework for Evaluating Trustworthiness of Large Language Models in Scientific Applications
Fuente:
arXiv
Saved in:
| Main Authors: | Herron, Emily, Yin, Junqi, Wang, Feiyi |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
TrustMH-Bench: A Comprehensive Benchmark for Evaluating the Trustworthiness of Large Language Models in Mental Health
by: Xiong, Zixin, et al.
Published: (2026)
by: Xiong, Zixin, et al.
Published: (2026)
MultiTrust: A Comprehensive Benchmark Towards Trustworthy Multimodal Large Language Models
by: Zhang, Yichi, et al.
Published: (2024)
by: Zhang, Yichi, et al.
Published: (2024)
SciSafeEval: A Comprehensive Benchmark for Safety Alignment of Large Language Models in Scientific Tasks
by: Li, Tianhao, et al.
Published: (2024)
by: Li, Tianhao, et al.
Published: (2024)
Pretraining Billion-scale Geospatial Foundational Models on Frontier
by: Tsaris, Aristeidis, et al.
Published: (2024)
by: Tsaris, Aristeidis, et al.
Published: (2024)
From Privacy to Trust in the Agentic Era: A Taxonomy of Challenges in Trustworthy Federated Learning Through the Lens of Trust Report 2.0
by: Rodríguez-Barroso, Nuria, et al.
Published: (2025)
by: Rodríguez-Barroso, Nuria, et al.
Published: (2025)
DecodingTrust: A Comprehensive Assessment of Trustworthiness in GPT Models
by: Wang, Boxin, et al.
Published: (2023)
by: Wang, Boxin, et al.
Published: (2023)
A Comprehensive Survey on the Trustworthiness of Large Language Models in Healthcare
by: Aljohani, Manar, et al.
Published: (2025)
by: Aljohani, Manar, et al.
Published: (2025)
A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models
by: Wang, Yanbo, et al.
Published: (2025)
by: Wang, Yanbo, et al.
Published: (2025)
Decoding Memories: An Efficient Pipeline for Self-Consistency Hallucination Detection
by: Gao, Weizhi, et al.
Published: (2025)
by: Gao, Weizhi, et al.
Published: (2025)
Scaling Up Data Parallelism in Decentralized Deep Learning
by: Xie, Bing, et al.
Published: (2025)
by: Xie, Bing, et al.
Published: (2025)
FreeEval: A Modular Framework for Trustworthy and Efficient Evaluation of Large Language Models
by: Yu, Zhuohao, et al.
Published: (2024)
by: Yu, Zhuohao, et al.
Published: (2024)
SciBench: Evaluating College-Level Scientific Problem-Solving Abilities of Large Language Models
by: Wang, Xiaoxuan, et al.
Published: (2023)
by: Wang, Xiaoxuan, et al.
Published: (2023)
Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models
by: Pawelczyk, Martin, et al.
Published: (2024)
by: Pawelczyk, Martin, et al.
Published: (2024)
AudioTrust: Benchmarking the Multifaceted Trustworthiness of Audio Large Language Models
by: Li, Kai, et al.
Published: (2025)
by: Li, Kai, et al.
Published: (2025)
TRUSTVIS: A Multi-Dimensional Trustworthiness Evaluation Framework for Large Language Models
by: Sun, Ruoyu, et al.
Published: (2025)
by: Sun, Ruoyu, et al.
Published: (2025)
TrustLDM: Benchmarking Trustworthiness in Language Diffusion Models
by: Mo, Yichuan, et al.
Published: (2026)
by: Mo, Yichuan, et al.
Published: (2026)
Do You Trust Me? Cognitive-Affective Signatures of Trustworthiness in Large Language Models
by: Yeo, Gerard, et al.
Published: (2025)
by: Yeo, Gerard, et al.
Published: (2025)
SciVid: Cross-Domain Evaluation of Video Models in Scientific Applications
by: Hasson, Yana, et al.
Published: (2025)
by: Hasson, Yana, et al.
Published: (2025)
SciAgent: Tool-augmented Language Models for Scientific Reasoning
by: Ma, Yubo, et al.
Published: (2024)
by: Ma, Yubo, et al.
Published: (2024)
CEFW: A Comprehensive Evaluation Framework for Watermark in Large Language Models
by: Zhang, Shuhao, et al.
Published: (2025)
by: Zhang, Shuhao, et al.
Published: (2025)
Tula: Optimizing Time, Cost, and Generalization in Distributed Large-Batch Training
by: Tyagi, Sahil, et al.
Published: (2026)
by: Tyagi, Sahil, et al.
Published: (2026)
The Compressive Knowledge Graph Hypothesis: Which Graph Facts Matter for Scientific Hypothesis Generation?
by: Sourav, Shashwat, et al.
Published: (2026)
by: Sourav, Shashwat, et al.
Published: (2026)
SciFig: Towards Automating Scientific Figure Generation
by: Huang, Siyuan, et al.
Published: (2026)
by: Huang, Siyuan, et al.
Published: (2026)
Piper: Efficient Large-Scale MoE Training via Resource Modeling and Pipelined Hybrid Parallelism
by: Dash, Sajal, et al.
Published: (2026)
by: Dash, Sajal, et al.
Published: (2026)
A Comprehensive Framework for Evaluating API-oriented Code Generation in Large Language Models
by: Wu, Yixi, et al.
Published: (2024)
by: Wu, Yixi, et al.
Published: (2024)
Trustworthiness Calibration Framework for Phishing Email Detection Using Large Language Models
by: Ganiuly, Daniyal, et al.
Published: (2025)
by: Ganiuly, Daniyal, et al.
Published: (2025)
A Comprehensive Evaluation of Large Language Models on Mental Illnesses
by: Hanafi, Abdelrahman, et al.
Published: (2024)
by: Hanafi, Abdelrahman, et al.
Published: (2024)
Large Language Models and Their Applications in Roadway Safety and Mobility Enhancement: A Comprehensive Review
by: Karim, Muhammad Monjurul, et al.
Published: (2025)
by: Karim, Muhammad Monjurul, et al.
Published: (2025)
Trustworthy LLMs: a Survey and Guideline for Evaluating Large Language Models' Alignment
by: Liu, Yang, et al.
Published: (2023)
by: Liu, Yang, et al.
Published: (2023)
Synergizing Large Language Models and Task-specific Models for Time Series Anomaly Detection
by: Chen, Feiyi, et al.
Published: (2025)
by: Chen, Feiyi, et al.
Published: (2025)
SciIF: Benchmarking Scientific Instruction Following Towards Rigorous Scientific Intelligence
by: Su, Encheng, et al.
Published: (2026)
by: Su, Encheng, et al.
Published: (2026)
Chain-of-Trust: A Progressive Trust Evaluation Framework Enabled by Generative AI
by: Zhu, Botao, et al.
Published: (2025)
by: Zhu, Botao, et al.
Published: (2025)
A Comprehensive Evaluation of Quantization Strategies for Large Language Models
by: Jin, Renren, et al.
Published: (2024)
by: Jin, Renren, et al.
Published: (2024)
Trustworthy AI: Securing Sensitive Data in Large Language Models
by: Feretzakis, Georgios, et al.
Published: (2024)
by: Feretzakis, Georgios, et al.
Published: (2024)
Large Language Models as Evaluators for Scientific Synthesis
by: Evans, Julia, et al.
Published: (2024)
by: Evans, Julia, et al.
Published: (2024)
Unveiling Trust in Multimodal Large Language Models: Evaluation, Analysis, and Mitigation
by: Zhang, Yichi, et al.
Published: (2025)
by: Zhang, Yichi, et al.
Published: (2025)
Navigating the Dual Facets: A Comprehensive Evaluation of Sequential Memory Editing in Large Language Models
by: Lin, Zihao, et al.
Published: (2024)
by: Lin, Zihao, et al.
Published: (2024)
SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
by: Deng, Andong, et al.
Published: (2025)
by: Deng, Andong, et al.
Published: (2025)
SafeSci: Safety Evaluation of Large Language Models in Science Domains and Beyond
by: Zhu, Xiangyang, et al.
Published: (2026)
by: Zhu, Xiangyang, et al.
Published: (2026)
AI TIPS 2.0: A Comprehensive Framework for Operationalizing AI Governance
by: Gupta, Pamela
Published: (2025)
by: Gupta, Pamela
Published: (2025)
Similar Items
-
TrustMH-Bench: A Comprehensive Benchmark for Evaluating the Trustworthiness of Large Language Models in Mental Health
by: Xiong, Zixin, et al.
Published: (2026) -
MultiTrust: A Comprehensive Benchmark Towards Trustworthy Multimodal Large Language Models
by: Zhang, Yichi, et al.
Published: (2024) -
SciSafeEval: A Comprehensive Benchmark for Safety Alignment of Large Language Models in Scientific Tasks
by: Li, Tianhao, et al.
Published: (2024) -
Pretraining Billion-scale Geospatial Foundational Models on Frontier
by: Tsaris, Aristeidis, et al.
Published: (2024) -
From Privacy to Trust in the Agentic Era: A Taxonomy of Challenges in Trustworthy Federated Learning Through the Lens of Trust Report 2.0
by: Rodríguez-Barroso, Nuria, et al.
Published: (2025)