Position: AI Safety Requires Effective Controllability
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Yige, Feng, Yunhao, Sun, Jun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Position: Intelligent Science Laboratory Requires the Integration of Cognitive and Embodied AI
di: Zhang, Sha, et al.
Pubblicazione: (2025)
di: Zhang, Sha, et al.
Pubblicazione: (2025)
Q-MLLM: Vector Quantization for Robust Multimodal Large Language Model Security
di: Zhao, Wei, et al.
Pubblicazione: (2025)
di: Zhao, Wei, et al.
Pubblicazione: (2025)
Do Influence Functions Work on Large Language Models?
di: Li, Zhe, et al.
Pubblicazione: (2024)
di: Li, Zhe, et al.
Pubblicazione: (2024)
Position: Require Frontier AI Labs To Release Small "Analog" Models
di: Upadhyay, Shriyash, et al.
Pubblicazione: (2025)
di: Upadhyay, Shriyash, et al.
Pubblicazione: (2025)
Defending Large Language Models Against Jailbreak Attacks via Layer-specific Editing
di: Zhao, Wei, et al.
Pubblicazione: (2024)
di: Zhao, Wei, et al.
Pubblicazione: (2024)
Controllable Safety Alignment: Inference-Time Adaptation to Diverse Safety Requirements
di: Zhang, Jingyu, et al.
Pubblicazione: (2024)
di: Zhang, Jingyu, et al.
Pubblicazione: (2024)
Position: Human-Centric AI Requires a Minimum Viable Level of Human Understanding
di: Lin, Fangzhou, et al.
Pubblicazione: (2026)
di: Lin, Fangzhou, et al.
Pubblicazione: (2026)
BackdoorLLM: A Comprehensive Benchmark for Backdoor Attacks and Defenses on Large Language Models
di: Li, Yige, et al.
Pubblicazione: (2024)
di: Li, Yige, et al.
Pubblicazione: (2024)
Position: Embodied AI Requires a Privacy-Utility Trade-off
di: Fan, Xiaoliang, et al.
Pubblicazione: (2026)
di: Fan, Xiaoliang, et al.
Pubblicazione: (2026)
Position: AI Safety Must Embrace an Antifragile Perspective
di: Jin, Ming, et al.
Pubblicazione: (2025)
di: Jin, Ming, et al.
Pubblicazione: (2025)
Where Did It Go Wrong? Attributing Undesirable LLM Behaviors via Representation Gradient Tracing
di: Li, Zhe, et al.
Pubblicazione: (2025)
di: Li, Zhe, et al.
Pubblicazione: (2025)
Unleashing the Unseen: Harnessing Benign Datasets for Jailbreaking Large Language Models
di: Zhao, Wei, et al.
Pubblicazione: (2024)
di: Zhao, Wei, et al.
Pubblicazione: (2024)
AgentHazard: A Benchmark for Evaluating Harmful Behavior in Computer-Use Agents
di: Feng, Yunhao, et al.
Pubblicazione: (2026)
di: Feng, Yunhao, et al.
Pubblicazione: (2026)
Dataset Safety in Autonomous Driving: Requirements, Risks, and Assurance
di: Abbaspour, Alireza, et al.
Pubblicazione: (2025)
di: Abbaspour, Alireza, et al.
Pubblicazione: (2025)
Building Effective Safety Guardrails in AI Education Tools
di: Clark, Hannah-Beth, et al.
Pubblicazione: (2025)
di: Clark, Hannah-Beth, et al.
Pubblicazione: (2025)
Zero-Shot Defense Against Toxic Images via Inherent Multimodal Alignment in LVLMs
di: Zhao, Wei, et al.
Pubblicazione: (2025)
di: Zhao, Wei, et al.
Pubblicazione: (2025)
BackdoorAgent: A Unified Framework for Backdoor Attacks on LLM-based Agents
di: Feng, Yunhao, et al.
Pubblicazione: (2026)
di: Feng, Yunhao, et al.
Pubblicazione: (2026)
Position: Agentic AI System Is a Foreseeable Pathway to AGI
di: Liao, Junwei, et al.
Pubblicazione: (2026)
di: Liao, Junwei, et al.
Pubblicazione: (2026)
Position: Safety and Fairness in Agentic AI Depend on Interaction Topology, Not on Model Scale or Alignment
di: Bajaj, Tanav Singh, et al.
Pubblicazione: (2026)
di: Bajaj, Tanav Singh, et al.
Pubblicazione: (2026)
Engineering Safety Requirements for Autonomous Driving with Large Language Models
di: Nouri, Ali, et al.
Pubblicazione: (2024)
di: Nouri, Ali, et al.
Pubblicazione: (2024)
CROW: Eliminating Backdoors from Large Language Models via Internal Consistency Regularization
di: Min, Nay Myat, et al.
Pubblicazione: (2024)
di: Min, Nay Myat, et al.
Pubblicazione: (2024)
Why AI Safety Requires Uncertainty, Incomplete Preferences, and Non-Archimedean Utilities
di: Benavoli, Alessio, et al.
Pubblicazione: (2025)
di: Benavoli, Alessio, et al.
Pubblicazione: (2025)
Defining Explainable AI for Requirements Analysis
di: Sheh, Raymond, et al.
Pubblicazione: (2026)
di: Sheh, Raymond, et al.
Pubblicazione: (2026)
Foundational Analysis of Safety Engineering Requirements (SAFER)
di: Chemo, Noga, et al.
Pubblicazione: (2026)
di: Chemo, Noga, et al.
Pubblicazione: (2026)
Adaptive Content Restriction for Large Language Models via Suffix Optimization
di: Li, Yige, et al.
Pubblicazione: (2025)
di: Li, Yige, et al.
Pubblicazione: (2025)
Position: Retire the "Positive Backdoor" Label -- Secret Alignment Requires Strict and Systematic Evaluation
di: Li, Jianwei, et al.
Pubblicazione: (2026)
di: Li, Jianwei, et al.
Pubblicazione: (2026)
AnyAttack: Towards Large-scale Self-supervised Adversarial Attacks on Vision-language Models
di: Zhang, Jiaming, et al.
Pubblicazione: (2024)
di: Zhang, Jiaming, et al.
Pubblicazione: (2024)
Negative as Positive: Enhancing Out-of-distribution Generalization for Graph Contrastive Learning
di: Wang, Zixu, et al.
Pubblicazione: (2024)
di: Wang, Zixu, et al.
Pubblicazione: (2024)
A New Perspective On AI Safety Through Control Theory Methodologies
di: Ullrich, Lars, et al.
Pubblicazione: (2025)
di: Ullrich, Lars, et al.
Pubblicazione: (2025)
AGrail: A Lifelong Agent Guardrail with Effective and Adaptive Safety Detection
di: Luo, Weidi, et al.
Pubblicazione: (2025)
di: Luo, Weidi, et al.
Pubblicazione: (2025)
NeurIPS Should Require Reproducibility Standards for Frontier AI Safety Claims
di: Vishwarupe, Varad, et al.
Pubblicazione: (2026)
di: Vishwarupe, Varad, et al.
Pubblicazione: (2026)
AIR: Improving Agent Safety through Incident Response
di: Xiao, Zibo, et al.
Pubblicazione: (2026)
di: Xiao, Zibo, et al.
Pubblicazione: (2026)
Games for AI Control: Models of Safety Evaluations of AI Deployment Protocols
di: Griffin, Charlie, et al.
Pubblicazione: (2024)
di: Griffin, Charlie, et al.
Pubblicazione: (2024)
Engaging with AI: How Interface Design Shapes Human-AI Collaboration in High-Stakes Decision-Making
di: Chen, Zichen, et al.
Pubblicazione: (2025)
di: Chen, Zichen, et al.
Pubblicazione: (2025)
Position: State-of-the-Art Claims Require State-of-the-Art Evidence
di: Oh, YongKyung
Pubblicazione: (2026)
di: Oh, YongKyung
Pubblicazione: (2026)
Responsible Agentic AI Requires Explicit Provenance
di: Hu, Jinwei, et al.
Pubblicazione: (2026)
di: Hu, Jinwei, et al.
Pubblicazione: (2026)
AutoBackdoor: Automating Backdoor Attacks via LLM Agents
di: Li, Yige, et al.
Pubblicazione: (2025)
di: Li, Yige, et al.
Pubblicazione: (2025)
AI2-Active Safety: AI-enabled Interaction-aware Active Safety Analysis with Vehicle Dynamics
di: Wu, Keshu, et al.
Pubblicazione: (2025)
di: Wu, Keshu, et al.
Pubblicazione: (2025)
LinSATNet: The Positive Linear Satisfiability Neural Networks
di: Wang, Runzhong, et al.
Pubblicazione: (2024)
di: Wang, Runzhong, et al.
Pubblicazione: (2024)
Preventing the Collapse of Peer Review Requires Verification-First AI
di: You, Lei, et al.
Pubblicazione: (2026)
di: You, Lei, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Position: Intelligent Science Laboratory Requires the Integration of Cognitive and Embodied AI
di: Zhang, Sha, et al.
Pubblicazione: (2025) -
Q-MLLM: Vector Quantization for Robust Multimodal Large Language Model Security
di: Zhao, Wei, et al.
Pubblicazione: (2025) -
Do Influence Functions Work on Large Language Models?
di: Li, Zhe, et al.
Pubblicazione: (2024) -
Position: Require Frontier AI Labs To Release Small "Analog" Models
di: Upadhyay, Shriyash, et al.
Pubblicazione: (2025) -
Defending Large Language Models Against Jailbreak Attacks via Layer-specific Editing
di: Zhao, Wei, et al.
Pubblicazione: (2024)