Safety Pretraining: Toward the Next Generation of Safe AI
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Maini, Pratyush, Goyal, Sachin, Sam, Dylan, Robey, Alex, Savani, Yash, Jiang, Yiding, Zou, Andy, Fredrikson, Matt, Lipton, Zacharcy C., Kolter, J. Zico |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
When Should We Introduce Safety Interventions During Pretraining?
par: Sam, Dylan, et autres
Publié: (2026)
par: Sam, Dylan, et autres
Publié: (2026)
Evaluating Language Model Reasoning about Confidential Information
par: Sam, Dylan, et autres
Publié: (2025)
par: Sam, Dylan, et autres
Publié: (2025)
T-MARS: Improving Visual Representations by Circumventing Text Feature Learning
par: Maini, Pratyush, et autres
Publié: (2023)
par: Maini, Pratyush, et autres
Publié: (2023)
Scaling Laws for Data Filtering -- Data Curation cannot be Compute Agnostic
par: Goyal, Sachin, et autres
Publié: (2024)
par: Goyal, Sachin, et autres
Publié: (2024)
Understanding Hallucinations in Diffusion Models through Mode Interpolation
par: Aithal, Sumukh K, et autres
Publié: (2024)
par: Aithal, Sumukh K, et autres
Publié: (2024)
Diffusing Differentiable Representations
par: Savani, Yash, et autres
Publié: (2024)
par: Savani, Yash, et autres
Publié: (2024)
TOFU: A Task of Fictitious Unlearning for LLMs
par: Maini, Pratyush, et autres
Publié: (2024)
par: Maini, Pratyush, et autres
Publié: (2024)
Rethinking LLM Memorization through the Lens of Adversarial Compression
par: Schwarzschild, Avi, et autres
Publié: (2024)
par: Schwarzschild, Avi, et autres
Publié: (2024)
Adversarial Attacks on Robotic Vision Language Action Models
par: Jones, Eliot Krzysztof, et autres
Publié: (2025)
par: Jones, Eliot Krzysztof, et autres
Publié: (2025)
Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning
par: Xu, Yixuan Even, et autres
Publié: (2025)
par: Xu, Yixuan Even, et autres
Publié: (2025)
Antidistillation Fingerprinting
par: Xu, Yixuan Even, et autres
Publié: (2026)
par: Xu, Yixuan Even, et autres
Publié: (2026)
Antidistillation Sampling
par: Savani, Yash, et autres
Publié: (2025)
par: Savani, Yash, et autres
Publié: (2025)
OpenUnlearning: Accelerating LLM Unlearning via Unified Benchmarking of Methods and Metrics
par: Dorna, Vineeth, et autres
Publié: (2025)
par: Dorna, Vineeth, et autres
Publié: (2025)
Predicting the Performance of Black-box LLMs through Follow-up Queries
par: Sam, Dylan, et autres
Publié: (2025)
par: Sam, Dylan, et autres
Publié: (2025)
Context-Parametric Inversion: Why Instruction Finetuning Can Worsen Context Reliance
par: Goyal, Sachin, et autres
Publié: (2024)
par: Goyal, Sachin, et autres
Publié: (2024)
D-REX: A Benchmark for Detecting Deceptive Reasoning in Large Language Models
par: Krishna, Satyapriya, et autres
Publié: (2025)
par: Krishna, Satyapriya, et autres
Publié: (2025)
Improving Alignment and Robustness with Circuit Breakers
par: Zou, Andy, et autres
Publié: (2024)
par: Zou, Andy, et autres
Publié: (2024)
Inference Optimal VLMs Need Fewer Visual Tokens and More Parameters
par: Li, Kevin Y., et autres
Publié: (2024)
par: Li, Kevin Y., et autres
Publié: (2024)
Finetuning CLIP to Reason about Pairwise Differences
par: Sam, Dylan, et autres
Publié: (2024)
par: Sam, Dylan, et autres
Publié: (2024)
Toward Understanding the Transferability of Adversarial Suffixes in Large Language Models
par: Ball, Sarah, et autres
Publié: (2025)
par: Ball, Sarah, et autres
Publié: (2025)
Looking beyond the next token
par: Thankaraj, Abitha, et autres
Publié: (2025)
par: Thankaraj, Abitha, et autres
Publié: (2025)
Transferable Adversarial Attacks on Black-Box Vision-Language Models
par: Hu, Kai, et autres
Publié: (2025)
par: Hu, Kai, et autres
Publié: (2025)
Bayesian Neural Networks with Domain Knowledge Priors
par: Sam, Dylan, et autres
Publié: (2024)
par: Sam, Dylan, et autres
Publié: (2024)
Adaptive Data Optimization: Dynamic Sample Selection with Scaling Laws
par: Jiang, Yiding, et autres
Publié: (2024)
par: Jiang, Yiding, et autres
Publié: (2024)
Mimetic Initialization of MLPs
par: Trockman, Asher, et autres
Publié: (2026)
par: Trockman, Asher, et autres
Publié: (2026)
AcceleratedLiNGAM: Learning Causal DAGs at the speed of GPUs
par: Akinwande, Victor, et autres
Publié: (2024)
par: Akinwande, Victor, et autres
Publié: (2024)
Peeking Behind Closed Doors: Risks of LLM Evaluation by Private Data Curators
par: Bansal, Hritik, et autres
Publié: (2025)
par: Bansal, Hritik, et autres
Publié: (2025)
AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents
par: Andriushchenko, Maksym, et autres
Publié: (2024)
par: Andriushchenko, Maksym, et autres
Publié: (2024)
Comparing AI Agents to Cybersecurity Professionals in Real-World Penetration Testing
par: Lin, Justin W., et autres
Publié: (2025)
par: Lin, Justin W., et autres
Publié: (2025)
FUSE-ing Language Models: Zero-Shot Adapter Discovery for Prompt Optimization Across Tokenizers
par: Williams, Joshua Nathaniel, et autres
Publié: (2024)
par: Williams, Joshua Nathaniel, et autres
Publié: (2024)
Equilibrium Reasoners: Learning Attractors Enables Scalable Reasoning
par: Huang, Benhao, et autres
Publié: (2026)
par: Huang, Benhao, et autres
Publié: (2026)
Why is SAM Robust to Label Noise?
par: Baek, Christina, et autres
Publié: (2024)
par: Baek, Christina, et autres
Publié: (2024)
Automated Black-box Prompt Engineering for Personalized Text-to-Image Generation
par: He, Yutong, et autres
Publié: (2024)
par: He, Yutong, et autres
Publié: (2024)
Computing Low-Entropy Couplings for Large-Support Distributions
par: Sokota, Samuel, et autres
Publié: (2024)
par: Sokota, Samuel, et autres
Publié: (2024)
Security Challenges in AI Agent Deployment: Insights from a Large Scale Public Competition
par: Zou, Andy, et autres
Publié: (2025)
par: Zou, Andy, et autres
Publié: (2025)
From Entropy to Epiplexity: Rethinking Information for Computationally Bounded Intelligence
par: Finzi, Marc, et autres
Publié: (2026)
par: Finzi, Marc, et autres
Publié: (2026)
Defining and measuring homicide rates for birth cohorts: Methodological and theoretical challenges and solutions
par: Jason Robey, et autres
Publié: (2025)
par: Jason Robey, et autres
Publié: (2025)
One-Step Diffusion Distillation via Deep Equilibrium Models
par: Geng, Zhengyang, et autres
Publié: (2023)
par: Geng, Zhengyang, et autres
Publié: (2023)
STAMP Your Content: Proving Dataset Membership via Watermarked Rephrasings
par: Rastogi, Saksham, et autres
Publié: (2025)
par: Rastogi, Saksham, et autres
Publié: (2025)
Existing Large Language Model Unlearning Evaluations Are Inconclusive
par: Feng, Zhili, et autres
Publié: (2025)
par: Feng, Zhili, et autres
Publié: (2025)
Documents similaires
-
When Should We Introduce Safety Interventions During Pretraining?
par: Sam, Dylan, et autres
Publié: (2026) -
Evaluating Language Model Reasoning about Confidential Information
par: Sam, Dylan, et autres
Publié: (2025) -
T-MARS: Improving Visual Representations by Circumventing Text Feature Learning
par: Maini, Pratyush, et autres
Publié: (2023) -
Scaling Laws for Data Filtering -- Data Curation cannot be Compute Agnostic
par: Goyal, Sachin, et autres
Publié: (2024) -
Understanding Hallucinations in Diffusion Models through Mode Interpolation
par: Aithal, Sumukh K, et autres
Publié: (2024)