Frontier AI Risk Management Framework in Practice: A Risk Analysis Technical Report v1.5
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Dongrui, Yu, Yi, Zhang, Jie, Chen, Guanxu, Lin, Qihao, Zhu, Hanxi, Huang, Lige, Zhou, Yijin, Wang, Peng, Shao, Shuai, Zhang, Boxuan, Liu, Zicheng, Sun, Jingwei, Li, Yu, Xie, Yuejin, Guo, Jiaxuan, Xu, Jia, Lu, Chaochao, Zhou, Bowen, Hu, Xia, Shao, Jing |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Frontier AI Risk Management Framework in Practice: A Risk Analysis Technical Report
par: Lab, Shanghai AI, et autres
Publié: (2025)
par: Lab, Shanghai AI, et autres
Publié: (2025)
Loop as a Bridge: Can Looped Transformers Truly Link Representation Space and Natural Language Outputs?
par: Chen, Guanxu, et autres
Publié: (2026)
par: Chen, Guanxu, et autres
Publié: (2026)
Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring
par: Chen, Guanxu, et autres
Publié: (2025)
par: Chen, Guanxu, et autres
Publié: (2025)
Dive into the Agent Matrix: A Realistic Evaluation of Self-Replication Risk in LLM Agents
par: Zhang, Boxuan, et autres
Publié: (2025)
par: Zhang, Boxuan, et autres
Publié: (2025)
RvB: Automating AI System Hardening via Iterative Red-Blue Games
par: Huang, Lige, et autres
Publié: (2026)
par: Huang, Lige, et autres
Publié: (2026)
HomeGuard: VLM-based Embodied Safeguard for Identifying Contextual Risk in Household Task
par: Lu, Xiaoya, et autres
Publié: (2026)
par: Lu, Xiaoya, et autres
Publié: (2026)
Rethinking Entropy Regularization in Large Reasoning Models
par: Jiang, Yuxian, et autres
Publié: (2025)
par: Jiang, Yuxian, et autres
Publié: (2025)
Exploring Consciousness in LLMs: A Systematic Survey of Theories, Implementations, and Frontier Risks
par: Chen, Sirui, et autres
Publié: (2025)
par: Chen, Sirui, et autres
Publié: (2025)
PRISM: Preference-Aware Influence Function Based Data Selection Method for Efficient Fine-Tuning
par: Lin, Qihao, et autres
Publié: (2026)
par: Lin, Qihao, et autres
Publié: (2026)
IS-Bench: Evaluating Interactive Safety of VLM-Driven Embodied Agents in Daily Household Tasks
par: Lu, Xiaoya, et autres
Publié: (2025)
par: Lu, Xiaoya, et autres
Publié: (2025)
DeepSight: An All-in-One LM Safety Toolkit
par: Zhang, Bo, et autres
Publié: (2026)
par: Zhang, Bo, et autres
Publié: (2026)
Your Agent May Misevolve: Emergent Risks in Self-evolving LLM Agents
par: Shao, Shuai, et autres
Publié: (2025)
par: Shao, Shuai, et autres
Publié: (2025)
PACEbench: A Framework for Evaluating Practical AI Cyber-Exploitation Capabilities
par: Liu, Zicheng, et autres
Publié: (2025)
par: Liu, Zicheng, et autres
Publié: (2025)
Conditional Advantage Estimation for Reinforcement Learning in Large Reasoning Models
par: Chen, Guanxu, et autres
Publié: (2025)
par: Chen, Guanxu, et autres
Publié: (2025)
The Better Angels of Machine Personality: How Personality Relates to LLM Safety
par: Zhang, Jie, et autres
Publié: (2024)
par: Zhang, Jie, et autres
Publié: (2024)
Language Generation with Strictly Proper Scoring Rules
par: Shao, Chenze, et autres
Publié: (2024)
par: Shao, Chenze, et autres
Publié: (2024)
AgentDoG: A Diagnostic Guardrail Framework for AI Agent Safety and Security
par: Liu, Dongrui, et autres
Publié: (2026)
par: Liu, Dongrui, et autres
Publié: (2026)
Taming Masked Diffusion Language Models via Consistency Trajectory Reinforcement Learning with Fewer Decoding Step
par: Yang, Jingyi, et autres
Publié: (2025)
par: Yang, Jingyi, et autres
Publié: (2025)
X-Boundary: Establishing Exact Safety Boundary to Shield LLMs from Multi-Turn Jailbreaks without Compromising Usability
par: Lu, Xiaoya, et autres
Publié: (2025)
par: Lu, Xiaoya, et autres
Publié: (2025)
Code2Math: Can Your Code Agent Effectively Evolve Math Problems Through Exploration?
par: Guo, Dadi, et autres
Publié: (2026)
par: Guo, Dadi, et autres
Publié: (2026)
COLLEAGUE.SKILL: Automated AI Skill Generation via Expert Knowledge Distillation
par: Zhou, Tianyi, et autres
Publié: (2026)
par: Zhou, Tianyi, et autres
Publié: (2026)
Claim-Selective Certification for High-Risk Medical Retrieval-Augmented Generation
par: Kan, Shao
Publié: (2026)
par: Kan, Shao
Publié: (2026)
REEF: Representation Encoding Fingerprints for Large Language Models
par: Zhang, Jie, et autres
Publié: (2024)
par: Zhang, Jie, et autres
Publié: (2024)
Towards AI-$45^{\circ}$ Law: A Roadmap to Trustworthy AGI
par: Yang, Chao, et autres
Publié: (2024)
par: Yang, Chao, et autres
Publié: (2024)
LED-Merging: Mitigating Safety-Utility Conflicts in Model Merging with Location-Election-Disjoint
par: Ma, Qianli, et autres
Publié: (2025)
par: Ma, Qianli, et autres
Publié: (2025)
Fast and Lightweight Novel View Synthesis with Differentiable Multiplane Image
par: Zhang, Kaidi, et autres
Publié: (2026)
par: Zhang, Kaidi, et autres
Publié: (2026)
Accelerating Inference in Large Language Models with a Unified Layer Skipping Strategy
par: Liu, Yijin, et autres
Publié: (2024)
par: Liu, Yijin, et autres
Publié: (2024)
MorphSeek: Fine-grained Latent Representation-Level Policy Optimization for Deformable Image Registration
par: Zhang, Runxun, et autres
Publié: (2025)
par: Zhang, Runxun, et autres
Publié: (2025)
Towards Tracing Trustworthiness Dynamics: Revisiting Pre-training Period of Large Language Models
par: Qian, Chen, et autres
Publié: (2024)
par: Qian, Chen, et autres
Publié: (2024)
Risk of Bad Tails: CVaR-Aware Pandora's Box and Prophet Inequality
par: Ji, Jingwei
Publié: (2026)
par: Ji, Jingwei
Publié: (2026)
A Survey of Efficient Reasoning for Large Reasoning Models: Language, Multimodality, and Beyond
par: Qu, Xiaoye, et autres
Publié: (2025)
par: Qu, Xiaoye, et autres
Publié: (2025)
RiOSWorld: Benchmarking the Risk of Multimodal Computer-Use Agents
par: Yang, Jingyi, et autres
Publié: (2025)
par: Yang, Jingyi, et autres
Publié: (2025)
VLSBench: Unveiling Visual Leakage in Multimodal Safety
par: Hu, Xuhao, et autres
Publié: (2024)
par: Hu, Xuhao, et autres
Publié: (2024)
Student Development Agent: Risk-free Simulation for Evaluating AIED Innovations
par: Jiang, Jianxiao, et autres
Publié: (2025)
par: Jiang, Jianxiao, et autres
Publié: (2025)
Shadow in the Cache: Unveiling and Mitigating Privacy Risks of KV-cache in LLM Inference
par: Luo, Zhifan, et autres
Publié: (2025)
par: Luo, Zhifan, et autres
Publié: (2025)
Beyond Isolated Frames: Enhancing Sensor-Based Human Activity Recognition through Intra- and Inter-Frame Attention
par: Shao, Shuai, et autres
Publié: (2024)
par: Shao, Shuai, et autres
Publié: (2024)
Benchmarking Political Persuasion Risks Across Frontier Large Language Models
par: Chen, Zhongren, et autres
Publié: (2026)
par: Chen, Zhongren, et autres
Publié: (2026)
PaddleOCR 3.0 Technical Report
par: Cui, Cheng, et autres
Publié: (2025)
par: Cui, Cheng, et autres
Publié: (2025)
ADAM: An Embodied Causal Agent in Open-World Environments
par: Yu, Shu, et autres
Publié: (2024)
par: Yu, Shu, et autres
Publié: (2024)
Think-Reflect-Revise: A Policy-Guided Reflective Framework for Safety Alignment in Large Vision Language Models
par: Weng, Fenghua, et autres
Publié: (2025)
par: Weng, Fenghua, et autres
Publié: (2025)
Documents similaires
-
Frontier AI Risk Management Framework in Practice: A Risk Analysis Technical Report
par: Lab, Shanghai AI, et autres
Publié: (2025) -
Loop as a Bridge: Can Looped Transformers Truly Link Representation Space and Natural Language Outputs?
par: Chen, Guanxu, et autres
Publié: (2026) -
Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring
par: Chen, Guanxu, et autres
Publié: (2025) -
Dive into the Agent Matrix: A Realistic Evaluation of Self-Replication Risk in LLM Agents
par: Zhang, Boxuan, et autres
Publié: (2025) -
RvB: Automating AI System Hardening via Iterative Red-Blue Games
par: Huang, Lige, et autres
Publié: (2026)