Boiling the Frog: A Multi-Turn Benchmark for Agentic Safety
Fuente:
arXiv
Salvato in:
| Autori principali: | Bisconti, Piercosma, Prandi, Matteo, Pierucci, Federico, Sartore, Federico, Panai, Enrico, Caroli, Laura, Zhu, Yue, Smith, Adam Leon, Nannini, Luca, Galisai, Marcello, Cifani, Susanna, Giarrusso, Francesco, Syrnikov, Marcantonio Bracale, Nardi, Daniele |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Agentic Microphysics: A Manifesto for Generative AI Safety
di: Pierucci, Federico, et al.
Pubblicazione: (2026)
di: Pierucci, Federico, et al.
Pubblicazione: (2026)
Adversarial Humanities Benchmark: Results on Stylistic Robustness in Frontier Model Safety
di: Galisai, Marcello, et al.
Pubblicazione: (2026)
di: Galisai, Marcello, et al.
Pubblicazione: (2026)
Adversarial Poetry as a Universal Single-Turn Jailbreak Mechanism in Large Language Models
di: Bisconti, Piercosma, et al.
Pubblicazione: (2025)
di: Bisconti, Piercosma, et al.
Pubblicazione: (2025)
Beyond Single-Agent Safety: A Taxonomy of Risks in LLM-to-LLM Interactions
di: Bisconti, Piercosma, et al.
Pubblicazione: (2025)
di: Bisconti, Piercosma, et al.
Pubblicazione: (2025)
Institutional AI: A Governance Framework for Distributional AGI Safety
di: Pierucci, Federico, et al.
Pubblicazione: (2026)
di: Pierucci, Federico, et al.
Pubblicazione: (2026)
Institutional AI: Governing LLM Collusion in Multi-Agent Cournot Markets via Public Governance Graphs
di: Syrnikov, Marcantonio Bracale, et al.
Pubblicazione: (2026)
di: Syrnikov, Marcantonio Bracale, et al.
Pubblicazione: (2026)
From Adversarial Poetry to Adversarial Tales: An Interpretability Research Agenda
di: Bisconti, Piercosma, et al.
Pubblicazione: (2025)
di: Bisconti, Piercosma, et al.
Pubblicazione: (2025)
Bench-2-CoP: Can We Trust Benchmarking for EU AI Compliance?
di: Prandi, Matteo, et al.
Pubblicazione: (2025)
di: Prandi, Matteo, et al.
Pubblicazione: (2025)
Metaphor Is Not All Attention Needs
di: Sorokoletova, Olga, et al.
Pubblicazione: (2026)
di: Sorokoletova, Olga, et al.
Pubblicazione: (2026)
Standards for trustworthy AI in the European Union: technical rationale, structural challenges, and an implementation path
di: Bisconti, Piercosma, et al.
Pubblicazione: (2026)
di: Bisconti, Piercosma, et al.
Pubblicazione: (2026)
AI Agents Under EU Law
di: Nannini, Luca, et al.
Pubblicazione: (2026)
di: Nannini, Luca, et al.
Pubblicazione: (2026)
The Boiling-Frog Problem of Physics Education
di: Kortemeyer, Gerd
Pubblicazione: (2025)
di: Kortemeyer, Gerd
Pubblicazione: (2025)
A Participatory Strategy for AI Ethics in Education and Rehabilitation grounded in the Capability Approach
di: Cesaroni, Valeria, et al.
Pubblicazione: (2025)
di: Cesaroni, Valeria, et al.
Pubblicazione: (2025)
Guarding the Guardrails: A Taxonomy-Driven Approach to Jailbreak Detection
di: Giarrusso, Francesco, et al.
Pubblicazione: (2025)
di: Giarrusso, Francesco, et al.
Pubblicazione: (2025)
Learning from Mistakes: Can LLM Self-Recover after Misalignment?
di: Sorokoletova, Olga E., et al.
Pubblicazione: (2026)
di: Sorokoletova, Olga E., et al.
Pubblicazione: (2026)
Equilibrium and Pricing in Consumer Networks with Nonlinear Utilities: An Online Shape-Constrained Learning Approach
di: Bracale, Daniele, et al.
Pubblicazione: (2026)
di: Bracale, Daniele, et al.
Pubblicazione: (2026)
Gradually Compacting Large Language Models for Reasoning Like a Boiling Frog
di: Zhao, Yiran, et al.
Pubblicazione: (2026)
di: Zhao, Yiran, et al.
Pubblicazione: (2026)
Adaptive Multimodal Agents-Based Framework for Automatic Workflow Execution
di: Cifani, Susanna, et al.
Pubblicazione: (2026)
di: Cifani, Susanna, et al.
Pubblicazione: (2026)
It's Not The Plane -- It's The Pilot: A Framework for Cognitive-Activated AI-Augmentation to Avoid the Boiling Frog Problem
di: Kuhn, Jochen, et al.
Pubblicazione: (2026)
di: Kuhn, Jochen, et al.
Pubblicazione: (2026)
The Boiling Frog Threshold: Criticality and Blindness in World Model-Based Anomaly Detection Under Gradual Drift
di: Hong, Zhe
Pubblicazione: (2026)
di: Hong, Zhe
Pubblicazione: (2026)
Descripción morfológica de amebas testadas del género Arcella sp., a través del uso de técnicas multiples
di: Karen Bracale
Pubblicazione: (2019)
di: Karen Bracale
Pubblicazione: (2019)
íCuantos inconvenientes!
di: Sartore Joel
Pubblicazione: (2000)
di: Sartore Joel
Pubblicazione: (2000)
Do Finite Density Effects Jeopardize Axion Nucleophobia in Supernovae?
di: Di Luzio, Luca, et al.
Pubblicazione: (2024)
di: Di Luzio, Luca, et al.
Pubblicazione: (2024)
Shaping Chirality via Stereoselective, Organocatalytic [4+2] Cycloadditions involving Heterocyclic ortho‐Quinodimethanes
di: Enrico Marcantonio, et al.
Pubblicazione: (2024)
di: Enrico Marcantonio, et al.
Pubblicazione: (2024)
Cuerpos (semi)vestidos y subjetividades de la moda en la esfera digital
di: Victoria Nannini
Pubblicazione: (2020)
di: Victoria Nannini
Pubblicazione: (2020)
Il Discorso di Moda. Le reviste femminili dal 1960
di: Victoria Nannini
Pubblicazione: (2020)
di: Victoria Nannini
Pubblicazione: (2020)
Online Price Competition under Generalized Linear Demands
di: Bracale, Daniele, et al.
Pubblicazione: (2025)
di: Bracale, Daniele, et al.
Pubblicazione: (2025)
Learning the Distribution Map in Reverse Causal Performative Prediction
di: Bracale, Daniele, et al.
Pubblicazione: (2024)
di: Bracale, Daniele, et al.
Pubblicazione: (2024)
Revenue Maximization Under Sequential Price Competition Via The Estimation Of s-Concave Demand Functions
di: Bracale, Daniele, et al.
Pubblicazione: (2025)
di: Bracale, Daniele, et al.
Pubblicazione: (2025)
Large-width functional asymptotics for deep Gaussian neural networks
di: Bracale, Daniele, et al.
Pubblicazione: (2021)
di: Bracale, Daniele, et al.
Pubblicazione: (2021)
Infinite-channel deep stable convolutional neural networks
di: Bracale, Daniele, et al.
Pubblicazione: (2021)
di: Bracale, Daniele, et al.
Pubblicazione: (2021)
Diffusion properties of small-scale fractional transport models
di: Cifani, Paolo, et al.
Pubblicazione: (2025)
di: Cifani, Paolo, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Agentic Microphysics: A Manifesto for Generative AI Safety
di: Pierucci, Federico, et al.
Pubblicazione: (2026) -
Adversarial Humanities Benchmark: Results on Stylistic Robustness in Frontier Model Safety
di: Galisai, Marcello, et al.
Pubblicazione: (2026) -
Adversarial Poetry as a Universal Single-Turn Jailbreak Mechanism in Large Language Models
di: Bisconti, Piercosma, et al.
Pubblicazione: (2025) -
Beyond Single-Agent Safety: A Taxonomy of Risks in LLM-to-LLM Interactions
di: Bisconti, Piercosma, et al.
Pubblicazione: (2025) -
Institutional AI: A Governance Framework for Distributional AGI Safety
di: Pierucci, Federico, et al.
Pubblicazione: (2026)