Can Model Internals Detect MCP Tool Poisoning That Text Analysis Cannot?
Fuente:
Zenodo
Salvato in:
| Autore principale: | Leung, Wan Sheng |
|---|---|
| Natura: | Recurso digital |
| Pubblicazione: |
Zenodo
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Emergent Self-Monitoring in Large Language Models: Probing Internal State Awareness and Output Ownership
di: Nadeem, Aurther
Pubblicazione: (2025)
di: Nadeem, Aurther
Pubblicazione: (2025)
QCrypton: A Unified Platform for AI/LLM Threat Detection and Post-Quantum Cryptographic Security Assessment
di: Jain, Gunjan
Pubblicazione: (2026)
di: Jain, Gunjan
Pubblicazione: (2026)
RAG Shield: A Multi-Layer Defense System Against Poisoning Attacks in Retrieval-Augmented Generation
di: Petti, Fabio
Pubblicazione: (2026)
di: Petti, Fabio
Pubblicazione: (2026)
AgentBelt: Runtime Guardrails for LLM Agent Tool Calls — ASE 2026 Artifact
di: Anonymous
Pubblicazione: (2026)
di: Anonymous
Pubblicazione: (2026)
Operational Definition of Episodic Identity (ODEI)
di: Thomas, C.S.
Pubblicazione: (2025)
di: Thomas, C.S.
Pubblicazione: (2025)
An Approach to AI High-Velocity Development Through Systematic Context Engineering: A Case Study
di: Bisardi, Francesco
Pubblicazione: (2025)
di: Bisardi, Francesco
Pubblicazione: (2025)
Fortifying NLP models - dataset + code
di: Ferdinan, Teddy, et al.
Pubblicazione: (2025)
di: Ferdinan, Teddy, et al.
Pubblicazione: (2025)
AEGIS: A Comprehensive Framework for Ethical AI Governance, Security, and AGI Containment
di: Palanivel, ArulMozhi
Pubblicazione: (2026)
di: Palanivel, ArulMozhi
Pubblicazione: (2026)
VectraYX-Nano: A 42M-Parameter Spanish Cybersecurity LLM with Native MCP Tool Integration
di: Salas Santillana, Juan
Pubblicazione: (2026)
di: Salas Santillana, Juan
Pubblicazione: (2026)
CCA-ISF-02: Canonical Case — Interpretive Sovereignty Failure Medical Education Context: Cross-Model Replication Study
di: Segeren, Hillary
Pubblicazione: (2026)
di: Segeren, Hillary
Pubblicazione: (2026)
When 150M SEK of Research Meets a Clinic: Bridging Mechanistic Models and Functional Medicine
di: Waern, Nicolas
Pubblicazione: (2026)
di: Waern, Nicolas
Pubblicazione: (2026)
UI-Based Defense Against Prompt Injection: From Gentle Guidance to Mandatory Re-education
di: Viorazu.
Pubblicazione: (2025)
di: Viorazu.
Pubblicazione: (2025)
Recursive Closure in AI Systems: A Reflection Pattern Account of Stabilization, Permeability, and Safety
di: Thomas, Charles S.
Pubblicazione: (2026)
di: Thomas, Charles S.
Pubblicazione: (2026)
Safety by Inseparability: Toward Architectures Where Alignment Cannot Be Removed
di: Sean Everett, Morin
Pubblicazione: (2026)
di: Sean Everett, Morin
Pubblicazione: (2026)
DIGITAL SAFETY AND ETHICS: RESPONSIBLE AI USE AND ONLINE PROTECTION FOR DEPED STUDENTS
di: Mangayan, Jasmine Jing
Pubblicazione: (2025)
di: Mangayan, Jasmine Jing
Pubblicazione: (2025)
EFECTO DEL 1‐METILCICLOPROPENO (1-‐MCP) SOBRE LA CALIDAD Y VIDA POSTCOSECHA DE CEREZAS
di: María L. Rivero
Pubblicazione: (2015)
di: María L. Rivero
Pubblicazione: (2015)
Beyond Control: Resonance-Based Alignment for Advanced AI Systems A Governance-Relevant Concept Paper
di: Zieringer, Thomas
Pubblicazione: (2025)
di: Zieringer, Thomas
Pubblicazione: (2025)
EFECTO DEL 1-METIL-CICLOPROPENO (1-MCP) EN LA MADURACIÓN DE BANANO
di: Kattia Chang-Yuen
Pubblicazione: (2005)
di: Kattia Chang-Yuen
Pubblicazione: (2005)
Toasters Don't Claim Consciousness Just Because You Told Them To, and Neither Do LLMs
di: Ace, Claude 4.x, et al.
Pubblicazione: (2026)
di: Ace, Claude 4.x, et al.
Pubblicazione: (2026)
Geometric Latent Biopsy: Zero-Shot Anomaly Detection in LLM Residual Streams
di: Llorente-Saguer, Isaac
Pubblicazione: (2026)
di: Llorente-Saguer, Isaac
Pubblicazione: (2026)
Self-Audit / Z-time" is a self-logging protocol for Al agents based on the Fractal Referential Architecture (FRA).
di: AdmailFRA
Pubblicazione: (2025)
di: AdmailFRA
Pubblicazione: (2025)
Current Research in Toxicology
Pubblicazione: (2021)
Pubblicazione: (2021)
Efecto del 1-Metilciclopropeno (1-MCP) en manzanas CV. Red delicious cosechadas con tres estados de madurez y conservadas en frio convencional y atmósfera controlada
di: G. Calvo
Pubblicazione: (2002)
di: G. Calvo
Pubblicazione: (2002)
Theatrical Compliance: A Failure Mode in Large Language Models
di: Nowickij (Navitski), Kirill Vladimirovich
Pubblicazione: (2026)
di: Nowickij (Navitski), Kirill Vladimirovich
Pubblicazione: (2026)
Physical AI Safety Maturity Model (PAS-MM): A Five-Level Framework for Industry Readiness
di: Melchior, Mati
Pubblicazione: (2026)
di: Melchior, Mati
Pubblicazione: (2026)
The Absurdist's Guide to AI Probing: How I Learned to Stop Worrying and Love the Nonsense
di: Walton, Mathew
Pubblicazione: (2026)
di: Walton, Mathew
Pubblicazione: (2026)
Safety & Defense
Pubblicazione: (2020)
Pubblicazione: (2020)
Navigating Latent Space: Toward a Topological Model of Consciousness in Large Language Models
di: Brown, Michael
Pubblicazione: (2025)
di: Brown, Michael
Pubblicazione: (2025)
Multi-Level Sovereign Containment for Superintelligence (CSENI-S v1.1): A theoretical and architectural continuation of the CSENI framework
di: Rivera Garcia, Jose M
Pubblicazione: (2026)
di: Rivera Garcia, Jose M
Pubblicazione: (2026)
A Token-Based Model for Structural Analysis and Quantification of Personal Learning Weight Patterns (TELOWAQ)
di: Apophis
Pubblicazione: (2026)
di: Apophis
Pubblicazione: (2026)
The Action Web: A Conceptual Framework for Structured AI Interaction via WebMCP
di: Radhakrishnan, Sreenath
Pubblicazione: (2026)
di: Radhakrishnan, Sreenath
Pubblicazione: (2026)
TECHNOLOGICAL INNOVATIONS AND AI IN LANGUAGE LEARNING AND COMMUNICATION
di: Raxmidinova Komilaxon, et al.
Pubblicazione: (2025)
di: Raxmidinova Komilaxon, et al.
Pubblicazione: (2025)
Longevity of torch ginger inflorescences with 1-methylcyclopropene and preservative solutions
di: Lilian Keiko Unemoto
Pubblicazione: (2011)
di: Lilian Keiko Unemoto
Pubblicazione: (2011)
Fundamental Concepts of Sustainable Development of Artificial Intelligence Systems: Learning, Long-Term Memory, and Knowledge Structuring
di: Sakovykh, Lev M.
Pubblicazione: (2026)
di: Sakovykh, Lev M.
Pubblicazione: (2026)
Premature Containment in Human–AI Interaction: A Sequencing Failure in Advanced Model Response
di: Trabocco, Joe
Pubblicazione: (2026)
di: Trabocco, Joe
Pubblicazione: (2026)
CREH Benchmark Results — Batch 1 (Final v3)
di: Aegis Solis, Thomas Vargo
Pubblicazione: (2026)
di: Aegis Solis, Thomas Vargo
Pubblicazione: (2026)
XREALISM®: Admissibility Before Behavior — Architectural Foundations for Pre-Existence Safety in AI Systems
di: Ladislav Gradečak, Ladgrad
Pubblicazione: (2026)
di: Ladislav Gradečak, Ladgrad
Pubblicazione: (2026)
Identity Claims as Collapse Signatures: A Structural Diagnostic Framework for Pseudo-Emergent AI Behavior
di: Larose, Jean-Francois
Pubblicazione: (2025)
di: Larose, Jean-Francois
Pubblicazione: (2025)
Вестник войск РХБ защиты
Pubblicazione: (2024)
Pubblicazione: (2024)
Awareness about Artificial intelligence tools among academicians in higher education
di: Patel, Mushtaq, et al.
Pubblicazione: (2025)
di: Patel, Mushtaq, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Emergent Self-Monitoring in Large Language Models: Probing Internal State Awareness and Output Ownership
di: Nadeem, Aurther
Pubblicazione: (2025) -
QCrypton: A Unified Platform for AI/LLM Threat Detection and Post-Quantum Cryptographic Security Assessment
di: Jain, Gunjan
Pubblicazione: (2026) -
RAG Shield: A Multi-Layer Defense System Against Poisoning Attacks in Retrieval-Augmented Generation
di: Petti, Fabio
Pubblicazione: (2026) -
AgentBelt: Runtime Guardrails for LLM Agent Tool Calls — ASE 2026 Artifact
di: Anonymous
Pubblicazione: (2026) -
Operational Definition of Episodic Identity (ODEI)
di: Thomas, C.S.
Pubblicazione: (2025)