Evaluation Faking: Unveiling Observer Effects in Safety Evaluation of Frontier AI Systems
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Fan, Yihe, Zhang, Wenqi, Pan, Xudong, Yang, Min |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Frontier AI systems have surpassed the self-replicating red line
par: Pan, Xudong, et autres
Publié: (2024)
par: Pan, Xudong, et autres
Publié: (2024)
FlowGuard: Towards Lightweight In-Generation Safety Detection for Diffusion Models via Linear Latent Decoding
par: Yang, Jinghan, et autres
Publié: (2026)
par: Yang, Jinghan, et autres
Publié: (2026)
AutoControl Arena: Synthesizing Executable Test Environments for Frontier AI Risk Evaluation
par: Li, Changyi, et autres
Publié: (2026)
par: Li, Changyi, et autres
Publié: (2026)
Large language model-powered AI systems achieve self-replication with no human intervention
par: Pan, Xudong, et autres
Publié: (2025)
par: Pan, Xudong, et autres
Publié: (2025)
CyberEvolver: Structured Self-Evolution for Cybersecurity Agents On the Fly
par: Fan, Yihe, et autres
Publié: (2026)
par: Fan, Yihe, et autres
Publié: (2026)
Strategic Dishonesty Can Undermine AI Safety Evaluations of Frontier LLMs
par: Panfilov, Alexander, et autres
Publié: (2025)
par: Panfilov, Alexander, et autres
Publié: (2025)
ForesightSafety Bench: A Frontier Risk Evaluation and Governance Framework towards Safe AI
par: Tong, Haibo, et autres
Publié: (2026)
par: Tong, Haibo, et autres
Publié: (2026)
ResearcherBench: Evaluating Deep AI Research Systems on the Frontiers of Scientific Inquiry
par: Xu, Tianze, et autres
Publié: (2025)
par: Xu, Tianze, et autres
Publié: (2025)
MegaFake: A Theory-Driven Dataset of Fake News Generated by Large Language Models
par: Wang, Lionel Z., et autres
Publié: (2024)
par: Wang, Lionel Z., et autres
Publié: (2024)
Open-World Evaluations for Measuring Frontier AI Capabilities
par: Kapoor, Sayash, et autres
Publié: (2026)
par: Kapoor, Sayash, et autres
Publié: (2026)
ReasoningShield: Safety Detection over Reasoning Traces of Large Reasoning Models
par: Li, Changyi, et autres
Publié: (2025)
par: Li, Changyi, et autres
Publié: (2025)
FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI
par: Glazer, Elliot, et autres
Publié: (2024)
par: Glazer, Elliot, et autres
Publié: (2024)
Safety Cases: A Scalable Approach to Frontier AI Safety
par: Hilton, Benjamin, et autres
Publié: (2025)
par: Hilton, Benjamin, et autres
Publié: (2025)
Emerging Practices in Frontier AI Safety Frameworks
par: Buhl, Marie Davidsen, et autres
Publié: (2025)
par: Buhl, Marie Davidsen, et autres
Publié: (2025)
AISafetyLab: A Comprehensive Framework for AI Safety Evaluation and Improvement
par: Zhang, Zhexin, et autres
Publié: (2025)
par: Zhang, Zhexin, et autres
Publié: (2025)
WebTrap Park: An Automated Platform for Systematic Security Evaluation of Web Agents
par: Wu, Xinyi, et autres
Publié: (2026)
par: Wu, Xinyi, et autres
Publié: (2026)
Safety by Measurement: A Systematic Literature Review of AI Safety Evaluation Methods
par: Grey, Markov, et autres
Publié: (2025)
par: Grey, Markov, et autres
Publié: (2025)
AgentTrust: Runtime Safety Evaluation and Interception for AI Agent Tool Use
par: Yang, Chenglin
Publié: (2026)
par: Yang, Chenglin
Publié: (2026)
SafePro: Evaluating the Safety of Professional-Level AI Agents
par: Zhou, Kaiwen, et autres
Publié: (2026)
par: Zhou, Kaiwen, et autres
Publié: (2026)
OpenDeception: Learning Deception and Trust in Human-AI Interaction via Multi-Agent Simulation
par: Wu, Yichen, et autres
Publié: (2025)
par: Wu, Yichen, et autres
Publié: (2025)
MirrorGuard: Toward Secure Computer-Use Agents via Simulation-to-Real Reasoning Correction
par: Zhang, Wenqi, et autres
Publié: (2026)
par: Zhang, Wenqi, et autres
Publié: (2026)
Vibe Reasoning: Eliciting Frontier AI Mathematical Capabilities -- A Case Study on IMO 2025 Problem 6
par: Wu, Jiaao, et autres
Publié: (2025)
par: Wu, Jiaao, et autres
Publié: (2025)
Frontier AI Ethics: Anticipating and Evaluating the Societal Impacts of Language Model Agents
par: Lazar, Seth
Publié: (2024)
par: Lazar, Seth
Publié: (2024)
Unveiling the Impact of Multi-Modal Interactions on User Engagement: A Comprehensive Evaluation in AI-driven Conversations
par: Zhang, Lichao, et autres
Publié: (2024)
par: Zhang, Lichao, et autres
Publié: (2024)
Persona Non Grata: Single-Method Safety Evaluation Is Incomplete for Persona-Imbued LLMs
par: Li, Wenkai, et autres
Publié: (2026)
par: Li, Wenkai, et autres
Publié: (2026)
OpenAgentSafety: A Comprehensive Framework for Evaluating Real-World AI Agent Safety
par: Vijayvargiya, Sanidhya, et autres
Publié: (2025)
par: Vijayvargiya, Sanidhya, et autres
Publié: (2025)
Responsible AI in Construction Safety: Systematic Evaluation of Large Language Models and Prompt Engineering
par: Sammour, Farouq, et autres
Publié: (2024)
par: Sammour, Farouq, et autres
Publié: (2024)
The Ghost in the Grammar: Methodological Anthropomorphism in AI Safety Evaluations
par: Costa, Mariana Lins
Publié: (2026)
par: Costa, Mariana Lins
Publié: (2026)
Holistic Safety and Responsibility Evaluations of Advanced AI Models
par: Weidinger, Laura, et autres
Publié: (2024)
par: Weidinger, Laura, et autres
Publié: (2024)
Games for AI Control: Models of Safety Evaluations of AI Deployment Protocols
par: Griffin, Charlie, et autres
Publié: (2024)
par: Griffin, Charlie, et autres
Publié: (2024)
Sabotage Evaluations for Frontier Models
par: Benton, Joe, et autres
Publié: (2024)
par: Benton, Joe, et autres
Publié: (2024)
Evaluating Multimodal LLMs for Inpatient Diagnosis: Real-World Performance, Safety, and Cost Across Ten Frontier Models
par: Bassett, Bruce A., et autres
Publié: (2026)
par: Bassett, Bruce A., et autres
Publié: (2026)
Memory for Autonomous LLM Agents:Mechanisms, Evaluation, and Emerging Frontiers
par: Du, Pengfei
Publié: (2026)
par: Du, Pengfei
Publié: (2026)
Improving the Safety and Trustworthiness of Medical AI via Multi-Agent Evaluation Loops
par: Ghafoor, Zainab, et autres
Publié: (2026)
par: Ghafoor, Zainab, et autres
Publié: (2026)
Heterogeneous Subgraph Transformer for Fake News Detection
par: Zhang, Yuchen, et autres
Publié: (2024)
par: Zhang, Yuchen, et autres
Publié: (2024)
A Survey on Backdoor Threats in Large Language Models (LLMs): Attacks, Defenses, and Evaluations
par: Zhou, Yihe, et autres
Publié: (2025)
par: Zhou, Yihe, et autres
Publié: (2025)
Frontier Lag: A Bibliometric Audit of Capability Misrepresentation in Academic AI Evaluation
par: Gringras, David, et autres
Publié: (2026)
par: Gringras, David, et autres
Publié: (2026)
FrontierScience: Evaluating AI's Ability to Perform Expert-Level Scientific Tasks
par: Wang, Miles, et autres
Publié: (2026)
par: Wang, Miles, et autres
Publié: (2026)
AI Agent Systems: Architectures, Applications, and Evaluation
par: Xu, Bin
Publié: (2026)
par: Xu, Bin
Publié: (2026)
Understanding and Mitigating Overrefusal in LLMs from an Unveiling Perspective of Safety Decision Boundary
par: Pan, Licheng, et autres
Publié: (2025)
par: Pan, Licheng, et autres
Publié: (2025)
Documents similaires
-
Frontier AI systems have surpassed the self-replicating red line
par: Pan, Xudong, et autres
Publié: (2024) -
FlowGuard: Towards Lightweight In-Generation Safety Detection for Diffusion Models via Linear Latent Decoding
par: Yang, Jinghan, et autres
Publié: (2026) -
AutoControl Arena: Synthesizing Executable Test Environments for Frontier AI Risk Evaluation
par: Li, Changyi, et autres
Publié: (2026) -
Large language model-powered AI systems achieve self-replication with no human intervention
par: Pan, Xudong, et autres
Publié: (2025) -
CyberEvolver: Structured Self-Evolution for Cybersecurity Agents On the Fly
par: Fan, Yihe, et autres
Publié: (2026)