CIBER: A Comprehensive Benchmark for Security Evaluation of Code Interpreter Agents
Fuente:
arXiv
Guardado en:
| Autores principales: | Ba, Lei, Li, Qinbin, Li, Songze |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SecurePay: Enabling Secure and Fast Payment Processing for Platform Economy
por: Lin, Junru, et al.
Publicado: (2025)
por: Lin, Junru, et al.
Publicado: (2025)
BackdoorIndicator: Leveraging OOD Data for Proactive Backdoor Detection in Federated Learning
por: Li, Songze, et al.
Publicado: (2024)
por: Li, Songze, et al.
Publicado: (2024)
Arbitrary-Threshold Fully Homomorphic Encryption with Lower Complexity
por: Chang, Yijia, et al.
Publicado: (2025)
por: Chang, Yijia, et al.
Publicado: (2025)
OmniLytics+: A Secure, Efficient, and Affordable Blockchain Data Market for Machine Learning through Off-Chain Processing
por: Li, Songze, et al.
Publicado: (2024)
por: Li, Songze, et al.
Publicado: (2024)
Running in CIRCLE? A Simple Benchmark for LLM Code Interpreter Security
por: Chua, Gabriel
Publicado: (2025)
por: Chua, Gabriel
Publicado: (2025)
RAS-Eval: A Comprehensive Benchmark for Security Evaluation of LLM Agents in Real-World Environments
por: Fu, Yuchuan, et al.
Publicado: (2025)
por: Fu, Yuchuan, et al.
Publicado: (2025)
BiAxisAudit: A Novel Framework to Evaluate LLM Bias Across Prompt Sensitivity and Response-Layer Divergence
por: Gan, Jialing, et al.
Publicado: (2026)
por: Gan, Jialing, et al.
Publicado: (2026)
SEAL-Tag: Self-Tag Evidence Aggregation with Probabilistic Circuits for PII-Safe Retrieval-Augmented Generation
por: Xie, Jin, et al.
Publicado: (2026)
por: Xie, Jin, et al.
Publicado: (2026)
Privacy-preserving Prompt Personalization in Federated Learning for Multimodal Large Language Models
por: Hou, Sizai, et al.
Publicado: (2025)
por: Hou, Sizai, et al.
Publicado: (2025)
Manifoldchain: Maximizing Blockchain Throughput via Bandwidth-Clustered Sharding
por: Che, Chunjiang, et al.
Publicado: (2024)
por: Che, Chunjiang, et al.
Publicado: (2024)
Unveiling the Security Risks of Federated Learning in the Wild: From Research to Practice
por: Chen, Jiahao, et al.
Publicado: (2026)
por: Chen, Jiahao, et al.
Publicado: (2026)
FuncPoison: Poisoning Function Library to Hijack Multi-agent Autonomous Driving Systems
por: Long, Yuzhen, et al.
Publicado: (2025)
por: Long, Yuzhen, et al.
Publicado: (2025)
LLMs Cannot Reliably Identify and Reason About Security Vulnerabilities (Yet?): A Comprehensive Evaluation, Framework, and Benchmarks
por: Ullah, Saad, et al.
Publicado: (2023)
por: Ullah, Saad, et al.
Publicado: (2023)
Cross-Modal Backdoors in Multimodal Large Language Models
por: Wang, Runhe, et al.
Publicado: (2026)
por: Wang, Runhe, et al.
Publicado: (2026)
CTI-REALM: Benchmark to Evaluate Agent Performance on Security Detection Rule Generation Capabilities
por: Chakraborty, Arjun, et al.
Publicado: (2026)
por: Chakraborty, Arjun, et al.
Publicado: (2026)
CODE: A Contradiction-Based Deliberation Extension Framework for Overthinking Attacks on Retrieval-Augmented Generation
por: Zhang, Xiaolei, et al.
Publicado: (2026)
por: Zhang, Xiaolei, et al.
Publicado: (2026)
CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity
por: Yu, Zhengmin, et al.
Publicado: (2024)
por: Yu, Zhengmin, et al.
Publicado: (2024)
SecRepoBench: Benchmarking Code Agents for Secure Code Completion in Real-World Repositories
por: Shen, Chihao, et al.
Publicado: (2025)
por: Shen, Chihao, et al.
Publicado: (2025)
LLMs Cannot Reliably Judge (Yet?): A Comprehensive Assessment on the Robustness of LLM-as-a-Judge
por: Li, Songze, et al.
Publicado: (2025)
por: Li, Songze, et al.
Publicado: (2025)
TUNI: A Textual Unimodal Detector for Identity Inference in CLIP Models
por: Li, Songze, et al.
Publicado: (2024)
por: Li, Songze, et al.
Publicado: (2024)
Does Teaming-Up LLMs Improve Secure Code Generation? A Comprehensive Evaluation with Multi-LLMSecCodeEval
por: Sabir, Bushra, et al.
Publicado: (2026)
por: Sabir, Bushra, et al.
Publicado: (2026)
PriRoAgg: Achieving Robust Model Aggregation with Minimum Privacy Leakage for Federated Learning
por: Hou, Sizai, et al.
Publicado: (2024)
por: Hou, Sizai, et al.
Publicado: (2024)
A Comparative Evaluation of AI Agent Security Guardrails
por: Li, Qi, et al.
Publicado: (2026)
por: Li, Qi, et al.
Publicado: (2026)
Reframing LLM Agent Security as an Agent-Human Interaction Problem
por: Wang, Peiran, et al.
Publicado: (2026)
por: Wang, Peiran, et al.
Publicado: (2026)
BackdoorDM: A Comprehensive Benchmark for Backdoor Learning on Diffusion Model
por: Lin, Weilin, et al.
Publicado: (2025)
por: Lin, Weilin, et al.
Publicado: (2025)
RealSec-bench: A Benchmark for Evaluating Secure Code Generation in Real-World Repositories
por: Wang, Yanlin, et al.
Publicado: (2026)
por: Wang, Yanlin, et al.
Publicado: (2026)
Defensible Design for OpenClaw: Securing Autonomous Tool-Invoking Agents
por: Li, Zongwei, et al.
Publicado: (2026)
por: Li, Zongwei, et al.
Publicado: (2026)
When Efficiency Backfires: Cascading LLMs Trigger Cascade Failure under Adversarial Attack
por: Sun, Zehan, et al.
Publicado: (2026)
por: Sun, Zehan, et al.
Publicado: (2026)
DeDe: Detecting Backdoor Samples for SSL Encoders via Decoders
por: Hou, Sizai, et al.
Publicado: (2024)
por: Hou, Sizai, et al.
Publicado: (2024)
Endpoint Security Agent: A Comprehensive Approach to Real-time System Monitoring and Threat Detection
por: R, Srihari, et al.
Publicado: (2025)
por: R, Srihari, et al.
Publicado: (2025)
When Code Crosses Borders: A Security-Centric Study of LLM-based Code Translation
por: Chang, Hailong, et al.
Publicado: (2025)
por: Chang, Hailong, et al.
Publicado: (2025)
Towards Secure Retrieval-Augmented Generation: A Comprehensive Review of Threats, Defenses and Benchmarks
por: Mu, Yanming, et al.
Publicado: (2026)
por: Mu, Yanming, et al.
Publicado: (2026)
SeCodePLT: A Unified Platform for Evaluating the Security of Code GenAI
por: Nie, Yuzhou, et al.
Publicado: (2024)
por: Nie, Yuzhou, et al.
Publicado: (2024)
ReCIT: Reconstructing Full Private Data from Gradient in Parameter-Efficient Fine-Tuning of Large Language Models
por: Xie, Jin, et al.
Publicado: (2025)
por: Xie, Jin, et al.
Publicado: (2025)
Cybersecurity AI Benchmark (CAIBench): A Meta-Benchmark for Evaluating Cybersecurity AI Agents
por: Sanz-Gómez, María, et al.
Publicado: (2025)
por: Sanz-Gómez, María, et al.
Publicado: (2025)
Re-Evaluating EVMBench: Are AI Agents Ready for Smart Contract Security?
por: Peng, Chaoyuan, et al.
Publicado: (2026)
por: Peng, Chaoyuan, et al.
Publicado: (2026)
A Comprehensive Evaluation and Practice of System Penetration Testing
por: Zhang, Chunyi, et al.
Publicado: (2025)
por: Zhang, Chunyi, et al.
Publicado: (2025)
Evaluation Framework for Quantum Security Risk Assessment: A Comprehensive Strategy for Quantum-Safe Transition
por: Baseri, Yaser, et al.
Publicado: (2024)
por: Baseri, Yaser, et al.
Publicado: (2024)
Secure UAV Swarms in Low-Altitude Wireless Networks: Challenges and Solutions
por: Wang, Yuntao, et al.
Publicado: (2026)
por: Wang, Yuntao, et al.
Publicado: (2026)
SecGoal: A Benchmark for Extracting Formalizable Security Goals from Protocol Documents
por: Huang, Dawei, et al.
Publicado: (2026)
por: Huang, Dawei, et al.
Publicado: (2026)
Ejemplares similares
-
SecurePay: Enabling Secure and Fast Payment Processing for Platform Economy
por: Lin, Junru, et al.
Publicado: (2025) -
BackdoorIndicator: Leveraging OOD Data for Proactive Backdoor Detection in Federated Learning
por: Li, Songze, et al.
Publicado: (2024) -
Arbitrary-Threshold Fully Homomorphic Encryption with Lower Complexity
por: Chang, Yijia, et al.
Publicado: (2025) -
OmniLytics+: A Secure, Efficient, and Affordable Blockchain Data Market for Machine Learning through Off-Chain Processing
por: Li, Songze, et al.
Publicado: (2024) -
Running in CIRCLE? A Simple Benchmark for LLM Code Interpreter Security
por: Chua, Gabriel
Publicado: (2025)