Position: AI Safety Requires Effective Controllability
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Yige, Feng, Yunhao, Sun, Jun |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Position: Intelligent Science Laboratory Requires the Integration of Cognitive and Embodied AI
par: Zhang, Sha, et autres
Publié: (2025)
par: Zhang, Sha, et autres
Publié: (2025)
Q-MLLM: Vector Quantization for Robust Multimodal Large Language Model Security
par: Zhao, Wei, et autres
Publié: (2025)
par: Zhao, Wei, et autres
Publié: (2025)
Do Influence Functions Work on Large Language Models?
par: Li, Zhe, et autres
Publié: (2024)
par: Li, Zhe, et autres
Publié: (2024)
Position: Require Frontier AI Labs To Release Small "Analog" Models
par: Upadhyay, Shriyash, et autres
Publié: (2025)
par: Upadhyay, Shriyash, et autres
Publié: (2025)
Defending Large Language Models Against Jailbreak Attacks via Layer-specific Editing
par: Zhao, Wei, et autres
Publié: (2024)
par: Zhao, Wei, et autres
Publié: (2024)
Controllable Safety Alignment: Inference-Time Adaptation to Diverse Safety Requirements
par: Zhang, Jingyu, et autres
Publié: (2024)
par: Zhang, Jingyu, et autres
Publié: (2024)
Position: Human-Centric AI Requires a Minimum Viable Level of Human Understanding
par: Lin, Fangzhou, et autres
Publié: (2026)
par: Lin, Fangzhou, et autres
Publié: (2026)
BackdoorLLM: A Comprehensive Benchmark for Backdoor Attacks and Defenses on Large Language Models
par: Li, Yige, et autres
Publié: (2024)
par: Li, Yige, et autres
Publié: (2024)
Position: Embodied AI Requires a Privacy-Utility Trade-off
par: Fan, Xiaoliang, et autres
Publié: (2026)
par: Fan, Xiaoliang, et autres
Publié: (2026)
Position: AI Safety Must Embrace an Antifragile Perspective
par: Jin, Ming, et autres
Publié: (2025)
par: Jin, Ming, et autres
Publié: (2025)
Where Did It Go Wrong? Attributing Undesirable LLM Behaviors via Representation Gradient Tracing
par: Li, Zhe, et autres
Publié: (2025)
par: Li, Zhe, et autres
Publié: (2025)
Unleashing the Unseen: Harnessing Benign Datasets for Jailbreaking Large Language Models
par: Zhao, Wei, et autres
Publié: (2024)
par: Zhao, Wei, et autres
Publié: (2024)
AgentHazard: A Benchmark for Evaluating Harmful Behavior in Computer-Use Agents
par: Feng, Yunhao, et autres
Publié: (2026)
par: Feng, Yunhao, et autres
Publié: (2026)
Dataset Safety in Autonomous Driving: Requirements, Risks, and Assurance
par: Abbaspour, Alireza, et autres
Publié: (2025)
par: Abbaspour, Alireza, et autres
Publié: (2025)
Building Effective Safety Guardrails in AI Education Tools
par: Clark, Hannah-Beth, et autres
Publié: (2025)
par: Clark, Hannah-Beth, et autres
Publié: (2025)
Zero-Shot Defense Against Toxic Images via Inherent Multimodal Alignment in LVLMs
par: Zhao, Wei, et autres
Publié: (2025)
par: Zhao, Wei, et autres
Publié: (2025)
BackdoorAgent: A Unified Framework for Backdoor Attacks on LLM-based Agents
par: Feng, Yunhao, et autres
Publié: (2026)
par: Feng, Yunhao, et autres
Publié: (2026)
Position: Agentic AI System Is a Foreseeable Pathway to AGI
par: Liao, Junwei, et autres
Publié: (2026)
par: Liao, Junwei, et autres
Publié: (2026)
Position: Safety and Fairness in Agentic AI Depend on Interaction Topology, Not on Model Scale or Alignment
par: Bajaj, Tanav Singh, et autres
Publié: (2026)
par: Bajaj, Tanav Singh, et autres
Publié: (2026)
Engineering Safety Requirements for Autonomous Driving with Large Language Models
par: Nouri, Ali, et autres
Publié: (2024)
par: Nouri, Ali, et autres
Publié: (2024)
CROW: Eliminating Backdoors from Large Language Models via Internal Consistency Regularization
par: Min, Nay Myat, et autres
Publié: (2024)
par: Min, Nay Myat, et autres
Publié: (2024)
Why AI Safety Requires Uncertainty, Incomplete Preferences, and Non-Archimedean Utilities
par: Benavoli, Alessio, et autres
Publié: (2025)
par: Benavoli, Alessio, et autres
Publié: (2025)
Defining Explainable AI for Requirements Analysis
par: Sheh, Raymond, et autres
Publié: (2026)
par: Sheh, Raymond, et autres
Publié: (2026)
Foundational Analysis of Safety Engineering Requirements (SAFER)
par: Chemo, Noga, et autres
Publié: (2026)
par: Chemo, Noga, et autres
Publié: (2026)
Adaptive Content Restriction for Large Language Models via Suffix Optimization
par: Li, Yige, et autres
Publié: (2025)
par: Li, Yige, et autres
Publié: (2025)
Position: Retire the "Positive Backdoor" Label -- Secret Alignment Requires Strict and Systematic Evaluation
par: Li, Jianwei, et autres
Publié: (2026)
par: Li, Jianwei, et autres
Publié: (2026)
AnyAttack: Towards Large-scale Self-supervised Adversarial Attacks on Vision-language Models
par: Zhang, Jiaming, et autres
Publié: (2024)
par: Zhang, Jiaming, et autres
Publié: (2024)
Negative as Positive: Enhancing Out-of-distribution Generalization for Graph Contrastive Learning
par: Wang, Zixu, et autres
Publié: (2024)
par: Wang, Zixu, et autres
Publié: (2024)
A New Perspective On AI Safety Through Control Theory Methodologies
par: Ullrich, Lars, et autres
Publié: (2025)
par: Ullrich, Lars, et autres
Publié: (2025)
AGrail: A Lifelong Agent Guardrail with Effective and Adaptive Safety Detection
par: Luo, Weidi, et autres
Publié: (2025)
par: Luo, Weidi, et autres
Publié: (2025)
NeurIPS Should Require Reproducibility Standards for Frontier AI Safety Claims
par: Vishwarupe, Varad, et autres
Publié: (2026)
par: Vishwarupe, Varad, et autres
Publié: (2026)
AIR: Improving Agent Safety through Incident Response
par: Xiao, Zibo, et autres
Publié: (2026)
par: Xiao, Zibo, et autres
Publié: (2026)
Games for AI Control: Models of Safety Evaluations of AI Deployment Protocols
par: Griffin, Charlie, et autres
Publié: (2024)
par: Griffin, Charlie, et autres
Publié: (2024)
Engaging with AI: How Interface Design Shapes Human-AI Collaboration in High-Stakes Decision-Making
par: Chen, Zichen, et autres
Publié: (2025)
par: Chen, Zichen, et autres
Publié: (2025)
Position: State-of-the-Art Claims Require State-of-the-Art Evidence
par: Oh, YongKyung
Publié: (2026)
par: Oh, YongKyung
Publié: (2026)
Responsible Agentic AI Requires Explicit Provenance
par: Hu, Jinwei, et autres
Publié: (2026)
par: Hu, Jinwei, et autres
Publié: (2026)
AutoBackdoor: Automating Backdoor Attacks via LLM Agents
par: Li, Yige, et autres
Publié: (2025)
par: Li, Yige, et autres
Publié: (2025)
AI2-Active Safety: AI-enabled Interaction-aware Active Safety Analysis with Vehicle Dynamics
par: Wu, Keshu, et autres
Publié: (2025)
par: Wu, Keshu, et autres
Publié: (2025)
LinSATNet: The Positive Linear Satisfiability Neural Networks
par: Wang, Runzhong, et autres
Publié: (2024)
par: Wang, Runzhong, et autres
Publié: (2024)
Preventing the Collapse of Peer Review Requires Verification-First AI
par: You, Lei, et autres
Publié: (2026)
par: You, Lei, et autres
Publié: (2026)
Documents similaires
-
Position: Intelligent Science Laboratory Requires the Integration of Cognitive and Embodied AI
par: Zhang, Sha, et autres
Publié: (2025) -
Q-MLLM: Vector Quantization for Robust Multimodal Large Language Model Security
par: Zhao, Wei, et autres
Publié: (2025) -
Do Influence Functions Work on Large Language Models?
par: Li, Zhe, et autres
Publié: (2024) -
Position: Require Frontier AI Labs To Release Small "Analog" Models
par: Upadhyay, Shriyash, et autres
Publié: (2025) -
Defending Large Language Models Against Jailbreak Attacks via Layer-specific Editing
par: Zhao, Wei, et autres
Publié: (2024)