ExCyTIn-Bench: Evaluating LLM agents on Cyber Threat Investigation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Yiran, Velazco, Mauricio, Zhao, Andrew, Luján, Manuel Raúl Meléndez, Movva, Srisuma, Roy, Yogesh K, Nguyen, Quang, Rodriguez, Roberto, Wu, Qingyun, Albada, Michael, Kiseleva, Julia, Mudgerikar, Anand |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CyBiasBench: Benchmarking Bias in LLM Agents for Cyber-Attack Scenarios
par: Lim, Taein, et autres
Publié: (2026)
par: Lim, Taein, et autres
Publié: (2026)
CyLens: Towards Reinventing Cyber Threat Intelligence in the Paradigm of Agentic Large Language Models
par: Liu, Xiaoqun, et autres
Publié: (2025)
par: Liu, Xiaoqun, et autres
Publié: (2025)
Predicting Clinical Outcomes with Waveform LSTMs
par: Albada, Michael
Publié: (2025)
par: Albada, Michael
Publié: (2025)
Investigating the Temporal Dynamics of Cyber Threat Intelligence
par: Kodituwakku, Angel, et autres
Publié: (2024)
par: Kodituwakku, Angel, et autres
Publié: (2024)
CySecBench: Generative AI-based CyberSecurity-focused Prompt Dataset for Benchmarking Large Language Models
par: Wahréus, Johan, et autres
Publié: (2025)
par: Wahréus, Johan, et autres
Publié: (2025)
TInR: Exploring Tool-Internalized Reasoning in Large Language Models
par: Xu, Qiancheng, et autres
Publié: (2026)
par: Xu, Qiancheng, et autres
Publié: (2026)
Fortified Cyber Defense in DER Management Systems (CyDERFORT)
par: Zehir, Mustafa Alparslan, et autres
Publié: (2023)
par: Zehir, Mustafa Alparslan, et autres
Publié: (2023)
Accurate and Scalable Detection and Investigation of Cyber Persistence Threats
par: Liu, Qi, et autres
Publié: (2024)
par: Liu, Qi, et autres
Publié: (2024)
MemCollab: Cross-Model Memory Collaboration via Contrastive Trajectory Distillation
par: Chang, Yurui, et autres
Publié: (2026)
par: Chang, Yurui, et autres
Publié: (2026)
Reasoning Riddles: How Explainability Reveals Cognitive Limits in Vision-Language Models
par: Movva, Prahitha
Publié: (2025)
par: Movva, Prahitha
Publié: (2025)
Evaluación de la heterogeneidad y función de HDL por el laboratorio
par: Rajesh Movva
Publié: (2009)
par: Rajesh Movva
Publié: (2009)
Combining Threat Intelligence with IoT Scanning to Predict Cyber Attack
par: Soni, Jubin Abhishek, et autres
Publié: (2024)
par: Soni, Jubin Abhishek, et autres
Publié: (2024)
AthenaBench: A Dynamic Benchmark for Evaluating LLMs in Cyber Threat Intelligence
par: Alam, Md Tanvirul, et autres
Publié: (2025)
par: Alam, Md Tanvirul, et autres
Publié: (2025)
CyFence: Securing Cyber-Physical Controllers via Trusted Execution Environment
par: Longari, Stefano, et autres
Publié: (2025)
par: Longari, Stefano, et autres
Publié: (2025)
Discerning Reliable Cyber Threat Indicators for Timely Cyber Threat Intelligence
par: Arikkat, Dincy R, et autres
Publié: (2023)
par: Arikkat, Dincy R, et autres
Publié: (2023)
Characterization by photoreflectance of Eo´ and E1 silicon-like critical points in ion implanted Si1-yCy thin films
par: M. Melendez-Lira
Publié: (2005)
par: M. Melendez-Lira
Publié: (2005)
AgenticCyOps: Securing Multi-Agentic AI Integration in Enterprise Cyber Operations
par: Mitra, Shaswata, et autres
Publié: (2026)
par: Mitra, Shaswata, et autres
Publié: (2026)
CyGATE: Game-Theoretic Cyber Attack-Defense Engine for Patch Strategy Optimization
par: Jiang, Yuning, et autres
Publié: (2025)
par: Jiang, Yuning, et autres
Publié: (2025)
StateFlow: Enhancing LLM Task-Solving through State-Driven Workflows
par: Wu, Yiran, et autres
Publié: (2024)
par: Wu, Yiran, et autres
Publié: (2024)
AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks
par: Zeng, Yifan, et autres
Publié: (2024)
par: Zeng, Yifan, et autres
Publié: (2024)
Live-Evo: Online Evolution of Agentic Memory from Continuous Feedback
par: Zhang, Yaolun, et autres
Publié: (2026)
par: Zhang, Yaolun, et autres
Publié: (2026)
Cyber Threat Hunting: Non-Parametric Mining of Attack Patterns from Cyber Threat Intelligence for Precise Threats Attribution
par: Kanwal, Rimsha, et autres
Publié: (2025)
par: Kanwal, Rimsha, et autres
Publié: (2025)
Countering Autonomous Cyber Threats
par: Heckel, Kade M., et autres
Publié: (2024)
par: Heckel, Kade M., et autres
Publié: (2024)
Highly Efficient Optimal Control for Lyophilization via Simulation of Discrete/Continuous Mixed-index Differential-algebraic Equations
par: Srisuma, Prakitr, et autres
Publié: (2025)
par: Srisuma, Prakitr, et autres
Publié: (2025)
Towards better Human-Agent Alignment: Assessing Task Utility in LLM-Powered Applications
par: Arabzadeh, Negar, et autres
Publié: (2024)
par: Arabzadeh, Negar, et autres
Publié: (2024)
AgenticCyber: A GenAI-Powered Multi-Agent System for Multimodal Threat Detection and Adaptive Response in Cybersecurity
par: Roy, Shovan
Publié: (2025)
par: Roy, Shovan
Publié: (2025)
Towards Cyber Threat Intelligence for the IoT
par: Iacovazzi, Alfonso, et autres
Publié: (2024)
par: Iacovazzi, Alfonso, et autres
Publié: (2024)
The Ouroboros Threat - How AI Cannibalism Degrades Cyber Threat Intelligence
par: Ahmad, Faran
Publié: (2026)
par: Ahmad, Faran
Publié: (2026)
Identification and Estimation of Seller Risk Aversion in Ascending Auctions
par: Gimenes, Nathalie, et autres
Publié: (2025)
par: Gimenes, Nathalie, et autres
Publié: (2025)
Predicting Stock Movement with BERTweet and Transformers
par: Albada, Michael Charles, et autres
Publié: (2025)
par: Albada, Michael Charles, et autres
Publié: (2025)
Real-time Estimation of Bound Water Concentration during Lyophilization with Temperature-based State Observers
par: Srisuma, Prakitr, et autres
Publié: (2024)
par: Srisuma, Prakitr, et autres
Publié: (2024)
KGV: Integrating Large Language Models with Knowledge Graphs for Cyber Threat Intelligence Credibility Assessment
par: Wu, Zongzong, et autres
Publié: (2024)
par: Wu, Zongzong, et autres
Publié: (2024)
THE IMPACT OF THE CRIMEAN AND DONBASS CONSENSUSES ON THE ELECTORAL BEHAVIOR OF RUSSIAN VOTERS
par: Kiseleva, Natalia, et autres
Publié: (2026)
par: Kiseleva, Natalia, et autres
Publié: (2026)
On a homotopy formula for generalized steady Stokes' operators, associated with the de Rham complex
par: Kiseleva, Ulita, et autres
Publié: (2026)
par: Kiseleva, Ulita, et autres
Publié: (2026)
The Cyprus Database of Alien Species (CyDAS).
par: Demetriou, Jakovos, et autres
Publié: (2025)
par: Demetriou, Jakovos, et autres
Publié: (2025)
MALLES: A Multi-agent LLMs-based Economic Sandbox with Consumer Preference Alignment
par: Wu, Yusen, et autres
Publié: (2026)
par: Wu, Yusen, et autres
Publié: (2026)
Temporal Object-Aware Vision Transformer for Few-Shot Video Object Detection
par: Kumar, Yogesh, et autres
Publié: (2025)
par: Kumar, Yogesh, et autres
Publié: (2025)
NLP-Powered Repository and Search Engine for Academic Papers: A Case Study on Cyber Risk Literature with CyLit
par: Zhang, Linfeng, et autres
Publié: (2024)
par: Zhang, Linfeng, et autres
Publié: (2024)
Securing Intelligence: Cyber Threats in AI Systems
par: Tina Borole
Publié: (2026)
par: Tina Borole
Publié: (2026)
Cyber Threat Intelligence meets the Analytic Tradecraft
par: Bjurling, Björn, et autres
Publié: (2024)
par: Bjurling, Björn, et autres
Publié: (2024)
Documents similaires
-
CyBiasBench: Benchmarking Bias in LLM Agents for Cyber-Attack Scenarios
par: Lim, Taein, et autres
Publié: (2026) -
CyLens: Towards Reinventing Cyber Threat Intelligence in the Paradigm of Agentic Large Language Models
par: Liu, Xiaoqun, et autres
Publié: (2025) -
Predicting Clinical Outcomes with Waveform LSTMs
par: Albada, Michael
Publié: (2025) -
Investigating the Temporal Dynamics of Cyber Threat Intelligence
par: Kodituwakku, Angel, et autres
Publié: (2024) -
CySecBench: Generative AI-based CyberSecurity-focused Prompt Dataset for Benchmarking Large Language Models
par: Wahréus, Johan, et autres
Publié: (2025)