From Patching to Preventing: Architecting Intrinsic Jailbreak Resistance in Foundation Models
Fuente:
Zenodo
Salvato in:
| Autori principali: | Revista, Zen, IA, 10 |
|---|---|
| Natura: | Recurso digital |
| Pubblicazione: |
Zenodo
2025
|
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Emergent Goal Concordance: Architecting Self-Correcting AI Alignment Systems
di: Revista, Zen, et al.
Pubblicazione: (2025)
di: Revista, Zen, et al.
Pubblicazione: (2025)
Data Quality Cascades in AI: Characterizing, Mitigating, and Preventing Error Propagation
di: Revista, Zen, et al.
Pubblicazione: (2025)
di: Revista, Zen, et al.
Pubblicazione: (2025)
The AI Alignment Loop: Iterative Self-Correction for Robust and Generalizable Models
di: Revista, Zen, et al.
Pubblicazione: (2025)
di: Revista, Zen, et al.
Pubblicazione: (2025)
Unmasking Causal Representations: A Novel Masking Paradigm for Explainable Language Models
di: Revista, Zen, et al.
Pubblicazione: (2025)
di: Revista, Zen, et al.
Pubblicazione: (2025)
AI-Powered Data Cleaning: Revolutionizing Data Quality and Trust Through Generative Models
di: Revista, Zen, et al.
Pubblicazione: (2025)
di: Revista, Zen, et al.
Pubblicazione: (2025)
A Unified Performance-Cost-Efficiency Model for Large-Scale AI Training on GPU and TPU Accelerators
di: Revista, Zen, et al.
Pubblicazione: (2025)
di: Revista, Zen, et al.
Pubblicazione: (2025)
Co-evolving Policies and Values for Generalizable and Aligned AI
di: Revista, Zen, et al.
Pubblicazione: (2025)
di: Revista, Zen, et al.
Pubblicazione: (2025)
Adaptive Information Granularity: A Unified Learning Framework for Sparse and Dense Representations
di: Revista, Zen, et al.
Pubblicazione: (2025)
di: Revista, Zen, et al.
Pubblicazione: (2025)
Beyond Rectification: Reassessing Activation Function Geometry for Enhanced Neural Network Performance
di: Revista, Zen, et al.
Pubblicazione: (2025)
di: Revista, Zen, et al.
Pubblicazione: (2025)
Intelligent Vector Databases: A Self-Optimizing Framework for Context-Aware Semantic Retrieval
di: Revista, Zen, et al.
Pubblicazione: (2025)
di: Revista, Zen, et al.
Pubblicazione: (2025)
Meta-SARSA: Learning Adaptive On-Policy Exploration Strategies
di: Revista, Zen, et al.
Pubblicazione: (2025)
di: Revista, Zen, et al.
Pubblicazione: (2025)
Unmasking the Trojan Horse: Provable Detection and Mitigation of Deceptive Alignment in AI Systems
di: Revista, Zen, et al.
Pubblicazione: (2025)
di: Revista, Zen, et al.
Pubblicazione: (2025)
Adaptive Semantic Chunking for Enhanced Contextual Fidelity in Long-Document RAG
di: Revista, Zen, et al.
Pubblicazione: (2025)
di: Revista, Zen, et al.
Pubblicazione: (2025)
Gradient Manifolds: Navigating Complex Loss Landscapes for Enhanced AI Generalization
di: Revista, Zen, et al.
Pubblicazione: (2025)
di: Revista, Zen, et al.
Pubblicazione: (2025)
Adaptive Step Sizes and Implicit Regularization: Decoding the Generalization Landscape of Gradient Optimizers
di: Revista, Zen, et al.
Pubblicazione: (2025)
di: Revista, Zen, et al.
Pubblicazione: (2025)
Beyond Quadratic: Sublinear Attention via Learnable Orthogonal Projections
di: Revista, Zen, et al.
Pubblicazione: (2025)
di: Revista, Zen, et al.
Pubblicazione: (2025)
Beyond Benchmarks: The Qualitative Imperative in Human-Centered AI Evaluation
di: Revista, Zen, et al.
Pubblicazione: (2025)
di: Revista, Zen, et al.
Pubblicazione: (2025)
Meta-Corrigibility: Architectures for Self-Modifying AI with Enduring Human Oversight
di: Revista, Zen, et al.
Pubblicazione: (2025)
di: Revista, Zen, et al.
Pubblicazione: (2025)
Unveiling AI Decision-Making: A Comprehensive Framework for Interpretable Methods and Explainable AI
di: Revista, Zen, et al.
Pubblicazione: (2025)
di: Revista, Zen, et al.
Pubblicazione: (2025)
Harmonizing Heterogeneity: Unified Embedding Spaces for Generalist AI
di: Revista, Zen, et al.
Pubblicazione: (2025)
di: Revista, Zen, et al.
Pubblicazione: (2025)
Normative Engineering of AI: Leveraging Inner Product Geometry for Robustness and Alignment
di: Revista, Zen, et al.
Pubblicazione: (2025)
di: Revista, Zen, et al.
Pubblicazione: (2025)
Extreme Few-Shot Learning: Beyond Exemplars to Generalizable Abstractions
di: Revista, Zen, et al.
Pubblicazione: (2025)
di: Revista, Zen, et al.
Pubblicazione: (2025)
Neuro-Symbolic Scene Graph Reasoning for Explainable Vision
di: Revista, Zen, et al.
Pubblicazione: (2025)
di: Revista, Zen, et al.
Pubblicazione: (2025)
AI Training Observability: A Comprehensive Framework for Real-Time Monitoring, Diagnosis, and Optimization
di: Revista, Zen, et al.
Pubblicazione: (2025)
di: Revista, Zen, et al.
Pubblicazione: (2025)
AI's Achilles Heel: The Critical Role of Data Validation in Robust and Trustworthy Systems
di: Revista, Zen, et al.
Pubblicazione: (2025)
di: Revista, Zen, et al.
Pubblicazione: (2025)
Meta-Calculus: Learning Differentiable Optimization Rules for AI
di: Revista, Zen, et al.
Pubblicazione: (2025)
di: Revista, Zen, et al.
Pubblicazione: (2025)
Adaptive Early Exits: Bridging Accuracy and Efficiency in Deep Learning via Resource-Aware Optimization
di: Revista, Zen, et al.
Pubblicazione: (2025)
di: Revista, Zen, et al.
Pubblicazione: (2025)
Bridging Locality and Globality: Hierarchical Transformer Architectures for Infinite Context
di: Revista, Zen, et al.
Pubblicazione: (2025)
di: Revista, Zen, et al.
Pubblicazione: (2025)
Architects of Dominion: Violence, Literacy, and the Neo-Assyrian Imperium
di: Revista, Zen, et al.
Pubblicazione: (2025)
di: Revista, Zen, et al.
Pubblicazione: (2025)
The Intrinsic Kernel Dimension of Deep Learning Generalization
di: Revista, Zen, et al.
Pubblicazione: (2025)
di: Revista, Zen, et al.
Pubblicazione: (2025)
Elementary Toposes as Foundations for Synthetic Higher Categories
di: Revista, Zen, et al.
Pubblicazione: (2025)
di: Revista, Zen, et al.
Pubblicazione: (2025)
The Intrinsic Supermassive Black Hole Mass-Spin Demographics: A Unified Census from X-ray and Radio AGN Populations
di: Revista, Zen, et al.
Pubblicazione: (2025)
di: Revista, Zen, et al.
Pubblicazione: (2025)
The Exact Structure of Triangulated Categories: Unveiling Abelian Foundations
di: Revista, Zen, et al.
Pubblicazione: (2025)
di: Revista, Zen, et al.
Pubblicazione: (2025)
The Cosmopolitan Polis: Greek Identity, Mobility, and the Foundations of Human Universalism
di: Revista, Zen, et al.
Pubblicazione: (2025)
di: Revista, Zen, et al.
Pubblicazione: (2025)
Rough Measure Theory: A Pathwise Foundation for Stochastic Analysis
di: Revista, Zen, et al.
Pubblicazione: (2025)
di: Revista, Zen, et al.
Pubblicazione: (2025)
Spectral Geometry of Commutative Rings: A Higher Grothendieck Foundation
di: Revista, Zen, et al.
Pubblicazione: (2026)
di: Revista, Zen, et al.
Pubblicazione: (2026)
Forging the Modern: The First Industrial Revolution and the Material Foundations of a New Epoch, 1760-1840
di: Revista, Zen, et al.
Pubblicazione: (2025)
di: Revista, Zen, et al.
Pubblicazione: (2025)
The Collective Aperture: From Cosmic Origins to Biosignatures with Space Observatories
di: Revista, Zen, et al.
Pubblicazione: (2025)
di: Revista, Zen, et al.
Pubblicazione: (2025)
From Self-Positing to World-Will: A Genealogy of Subjectivity in German Idealism
di: Revista, Zen, et al.
Pubblicazione: (2025)
di: Revista, Zen, et al.
Pubblicazione: (2025)
From X-rays to Exoplanets: The Multi-Decade Legacy of Orbital Observatories
di: Revista, Zen, et al.
Pubblicazione: (2025)
di: Revista, Zen, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Emergent Goal Concordance: Architecting Self-Correcting AI Alignment Systems
di: Revista, Zen, et al.
Pubblicazione: (2025) -
Data Quality Cascades in AI: Characterizing, Mitigating, and Preventing Error Propagation
di: Revista, Zen, et al.
Pubblicazione: (2025) -
The AI Alignment Loop: Iterative Self-Correction for Robust and Generalizable Models
di: Revista, Zen, et al.
Pubblicazione: (2025) -
Unmasking Causal Representations: A Novel Masking Paradigm for Explainable Language Models
di: Revista, Zen, et al.
Pubblicazione: (2025) -
AI-Powered Data Cleaning: Revolutionizing Data Quality and Trust Through Generative Models
di: Revista, Zen, et al.
Pubblicazione: (2025)