Why Does Agentic Safety Fail to Generalize Across Tasks?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Slutzky, Yonatan, Alexander, Yotam, Slor, Tomer, Nagel, Yoav, Cohen, Nadav |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
The Implicit Bias of Structured State Space Models Can Be Poisoned With Clean Labels
par: Slutzky, Yonatan, et autres
Publié: (2024)
par: Slutzky, Yonatan, et autres
Publié: (2024)
Do Neural Networks Need Gradient Descent to Generalize? A Theoretical Study
par: Alexander, Yotam, et autres
Publié: (2025)
par: Alexander, Yotam, et autres
Publié: (2025)
Outcome-Based RL Provably Leads Transformers to Reason, but Only With the Right Data
par: Ran-Milo, Yuval, et autres
Publié: (2026)
par: Ran-Milo, Yuval, et autres
Publié: (2026)
Deep Learning for Optical Misalignment Diagnostics in Multi-Lens Imaging Systems
par: Slor, Tomer, et autres
Publié: (2025)
par: Slor, Tomer, et autres
Publié: (2025)
What Makes Data Suitable for a Locally Connected Neural Network? A Necessary and Sufficient Condition Based on Quantum Entanglement
par: Alexander, Yotam, et autres
Publié: (2023)
par: Alexander, Yotam, et autres
Publié: (2023)
On the Expressive Power of Sparse Geometric MPNNs
par: Sverdlov, Yonatan, et autres
Publié: (2024)
par: Sverdlov, Yonatan, et autres
Publié: (2024)
Implicit Bias of Policy Gradient in Linear Quadratic Control: Extrapolation to Unseen Initial States
par: Razin, Noam, et autres
Publié: (2024)
par: Razin, Noam, et autres
Publié: (2024)
NnD: Diffusion-based Generation of Physically-Nonnegative Objects
par: Torem, Nadav, et autres
Publié: (2025)
par: Torem, Nadav, et autres
Publié: (2025)
Cluster Frequency Conformal Prediction for Local Coverage
par: Lavi, Tomer, et autres
Publié: (2026)
par: Lavi, Tomer, et autres
Publié: (2026)
Trajectory-Based Difficulty Scoring for Reliable Learning on Tabular Data
par: Lavi, Tomer, et autres
Publié: (2026)
par: Lavi, Tomer, et autres
Publié: (2026)
Clustered Calibration: Representation-Aware Probability Calibration via Learned Subpopulations
par: Lavi, Tomer, et autres
Publié: (2025)
par: Lavi, Tomer, et autres
Publié: (2025)
Lecture Notes on Linear Neural Networks: A Tale of Optimization and Generalization in Deep Learning
par: Cohen, Nadav, et autres
Publié: (2024)
par: Cohen, Nadav, et autres
Publié: (2024)
When and How to Canonize: A Generalization Perspective
par: Sverdlov, Yonatan, et autres
Publié: (2026)
par: Sverdlov, Yonatan, et autres
Publié: (2026)
Revisiting Multi-Permutation Equivariance through the Lens of Irreducible Representations
par: Sverdlov, Yonatan, et autres
Publié: (2024)
par: Sverdlov, Yonatan, et autres
Publié: (2024)
Why Domain Generalization Fail? A View of Necessity and Sufficiency
par: Vuong, Long-Tung, et autres
Publié: (2025)
par: Vuong, Long-Tung, et autres
Publié: (2025)
Mamba Knockout for Unraveling Factual Information Flow
par: Endy, Nir, et autres
Publié: (2025)
par: Endy, Nir, et autres
Publié: (2025)
Adaptation Odyssey in LLMs: Why Does Additional Pretraining Sometimes Fail to Improve?
par: Öncel, Fırat, et autres
Publié: (2024)
par: Öncel, Fırat, et autres
Publié: (2024)
Generative Myopia: Why Diffusion Models Fail at Structure
par: Siami, Milad
Publié: (2025)
par: Siami, Milad
Publié: (2025)
BXRL: Behavior-Explainable Reinforcement Learning
par: Rachum, Ram, et autres
Publié: (2026)
par: Rachum, Ram, et autres
Publié: (2026)
Monotone and Separable Set Functions: Characterizations and Neural Models
par: Sarangi, Soutrik, et autres
Publié: (2025)
par: Sarangi, Soutrik, et autres
Publié: (2025)
FSW-GNN: A Bi-Lipschitz WL-Equivalent Graph Neural Network
par: Sverdlov, Yonatan, et autres
Publié: (2024)
par: Sverdlov, Yonatan, et autres
Publié: (2024)
Short-Range Oversquashing
par: Mishayev, Yaaqov, et autres
Publié: (2025)
par: Mishayev, Yaaqov, et autres
Publié: (2025)
Why Model Selection Fails in Time Series Forecasting: An Empirical Study of Instability Across Data Regimes
par: Akinci, Tahir Cetin, et autres
Publié: (2026)
par: Akinci, Tahir Cetin, et autres
Publié: (2026)
Why Do Safety Guardrails Degrade Across Languages?
par: Zhang, Max, et autres
Publié: (2026)
par: Zhang, Max, et autres
Publié: (2026)
Inertial Navigation Meets Deep Learning: A Survey of Current Trends and Future Directions
par: Cohen, Nadav, et autres
Publié: (2023)
par: Cohen, Nadav, et autres
Publié: (2023)
Tools Fail: Detecting Silent Errors in Faulty Tools
par: Sun, Jimin, et autres
Publié: (2024)
par: Sun, Jimin, et autres
Publié: (2024)
Failing to Explore: Language Models on Interactive Tasks
par: JafariRaviz, Mahdi, et autres
Publié: (2026)
par: JafariRaviz, Mahdi, et autres
Publié: (2026)
In-context Learning and Gradient Descent Revisited
par: Deutch, Gilad, et autres
Publié: (2023)
par: Deutch, Gilad, et autres
Publié: (2023)
Why Attention Fails: The Degeneration of Transformers into MLPs in Time Series Forecasting
par: Liang, Zida, et autres
Publié: (2025)
par: Liang, Zida, et autres
Publié: (2025)
When Explanations Lie: Why Many Modified BP Attributions Fail
par: Sixt, Leon, et autres
Publié: (2019)
par: Sixt, Leon, et autres
Publié: (2019)
Conditional Balance: Improving Multi-Conditioning Trade-Offs in Image Generation
par: Cohen, Nadav Z., et autres
Publié: (2024)
par: Cohen, Nadav Z., et autres
Publié: (2024)
Gradient Starvation in Binary-Reward GRPO: Why Group-Mean Centering Fails and Why the Simplest Fix Works
par: Nie, Wenhua, et autres
Publié: (2026)
par: Nie, Wenhua, et autres
Publié: (2026)
Why Do More Experts Fail? A Theoretical Analysis of Model Merging
par: Wang, Zijing, et autres
Publié: (2025)
par: Wang, Zijing, et autres
Publié: (2025)
Why Smooth Stability Assumptions Fail for ReLU Learning
par: Katende, Ronald
Publié: (2025)
par: Katende, Ronald
Publié: (2025)
Why Do Transformers Fail to Forecast Time Series In-Context?
par: Zhou, Yufa, et autres
Publié: (2025)
par: Zhou, Yufa, et autres
Publié: (2025)
SINR-Aware Deep Reinforcement Learning for Distributed Dynamic Channel Allocation in Cognitive Interference Networks
par: Cohen, Yaniv, et autres
Publié: (2024)
par: Cohen, Yaniv, et autres
Publié: (2024)
Improved Distribution Estimation in $\ell_\infty$
par: Cohen, Doron, et autres
Publié: (2026)
par: Cohen, Doron, et autres
Publié: (2026)
Consensus is Not Verification: Why Crowd Wisdom Strategies Fail for LLM Truthfulness
par: Denisov-Blanch, Yegor, et autres
Publié: (2026)
par: Denisov-Blanch, Yegor, et autres
Publié: (2026)
Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention
par: Qiu, Haiquan, et autres
Publié: (2025)
par: Qiu, Haiquan, et autres
Publié: (2025)
Substance Beats Style: Why Beginning Students Fail to Code with LLMs
par: Lucchetti, Francesca, et autres
Publié: (2024)
par: Lucchetti, Francesca, et autres
Publié: (2024)
Documents similaires
-
The Implicit Bias of Structured State Space Models Can Be Poisoned With Clean Labels
par: Slutzky, Yonatan, et autres
Publié: (2024) -
Do Neural Networks Need Gradient Descent to Generalize? A Theoretical Study
par: Alexander, Yotam, et autres
Publié: (2025) -
Outcome-Based RL Provably Leads Transformers to Reason, but Only With the Right Data
par: Ran-Milo, Yuval, et autres
Publié: (2026) -
Deep Learning for Optical Misalignment Diagnostics in Multi-Lens Imaging Systems
par: Slor, Tomer, et autres
Publié: (2025) -
What Makes Data Suitable for a Locally Connected Neural Network? A Necessary and Sufficient Condition Based on Quantum Entanglement
par: Alexander, Yotam, et autres
Publié: (2023)