SafePred: A Predictive Guardrail for Computer-Using Agents via World Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Yurun, Liao, Zeyi, Yin, Ping, Xie, Taotao, Yin, Keting, Zhang, Shengyu |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Graph2Eval: Automatic Multimodal Task Generation for Agents via Knowledge Graphs
par: Chen, Yurun, et autres
Publié: (2025)
par: Chen, Yurun, et autres
Publié: (2025)
HarmonyGuard: Toward Safety and Utility in Web Agents via Adaptive Policy Enhancement and Dual-Objective Optimization
par: Chen, Yurun, et autres
Publié: (2025)
par: Chen, Yurun, et autres
Publié: (2025)
Reinforce LLM Reasoning through Multi-Agent Reflection
par: Yuan, Yurun, et autres
Publié: (2025)
par: Yuan, Yurun, et autres
Publié: (2025)
Evaluating the Robustness of Multimodal Agents Against Active Environmental Injection Attacks
par: Chen, Yurun, et autres
Publié: (2025)
par: Chen, Yurun, et autres
Publié: (2025)
Breaking the Capability Ceiling of LLM Post-Training by Reintroducing Markov States
par: Yuan, Yurun, et autres
Publié: (2026)
par: Yuan, Yurun, et autres
Publié: (2026)
OmniPred: Language Models as Universal Regressors
par: Song, Xingyou, et autres
Publié: (2024)
par: Song, Xingyou, et autres
Publié: (2024)
OS Agents: A Survey on MLLM-based Agents for General Computing Devices Use
par: Hu, Xueyu, et autres
Publié: (2025)
par: Hu, Xueyu, et autres
Publié: (2025)
Trajectory Bellman Residual Minimization: A Simple Value-Based Method for LLM Reasoning
par: Yuan, Yurun, et autres
Publié: (2025)
par: Yuan, Yurun, et autres
Publié: (2025)
Personalized Federated Learning with Adaptive Feature Aggregation and Knowledge Transfer
par: Yin, Keting, et autres
Publié: (2024)
par: Yin, Keting, et autres
Publié: (2024)
Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion
par: Lv, Zheqi, et autres
Publié: (2025)
par: Lv, Zheqi, et autres
Publié: (2025)
OnePred: Next-Query Prediction via Recursive Intent Memory in Multi-Turn Conversations
par: Chen, Jiangwang, et autres
Publié: (2026)
par: Chen, Jiangwang, et autres
Publié: (2026)
WebGuard: Building a Generalizable Guardrail for Web Agents
par: Zheng, Boyuan, et autres
Publié: (2025)
par: Zheng, Boyuan, et autres
Publié: (2025)
Legal Judgment Reimagined: PredEx and the Rise of Intelligent AI Interpretation in Indian Courts
par: Nigam, Shubham Kumar, et autres
Publié: (2024)
par: Nigam, Shubham Kumar, et autres
Publié: (2024)
Unsupervised Distance Metric Learning for Anomaly Detection Over Multivariate Time Series
par: Yuan, Hanyang, et autres
Publié: (2024)
par: Yuan, Hanyang, et autres
Publié: (2024)
Safe: Enhancing Mathematical Reasoning in Large Language Models via Retrospective Step-aware Formal Verification
par: Liu, Chengwu, et autres
Publié: (2025)
par: Liu, Chengwu, et autres
Publié: (2025)
Building a Foundational Guardrail for General Agentic Systems via Synthetic Data
par: Huang, Yue, et autres
Publié: (2025)
par: Huang, Yue, et autres
Publié: (2025)
AttributionBench: How Hard is Automatic Attribution Evaluation?
par: Li, Yifei, et autres
Publié: (2024)
par: Li, Yifei, et autres
Publié: (2024)
TraceSafe: A Systematic Assessment of LLM Guardrails on Multi-Step Tool-Calling Trajectories
par: Chen, Yen-Shan, et autres
Publié: (2026)
par: Chen, Yen-Shan, et autres
Publié: (2026)
BARRED: Synthetic Training of Custom Policy Guardrails via Asymmetric Debate
par: Mazza, Arnon, et autres
Publié: (2026)
par: Mazza, Arnon, et autres
Publié: (2026)
Toward Consistent World Models with Multi-Token Prediction and Latent Semantic Enhancement
par: Zhong, Qimin, et autres
Publié: (2026)
par: Zhong, Qimin, et autres
Publié: (2026)
Unified Multi-Task Learning & Model Fusion for Efficient Language Model Guardrailing
par: Neill, James O', et autres
Publié: (2025)
par: Neill, James O', et autres
Publié: (2025)
Lightweight Safety Guardrails via Synthetic Data and RL-guided Adversarial Training
par: Ilin, Aleksei, et autres
Publié: (2025)
par: Ilin, Aleksei, et autres
Publié: (2025)
Noise Injection Systemically Degrades Large Language Model Safety Guardrails
par: Shahani, Prithviraj Singh, et autres
Publié: (2025)
par: Shahani, Prithviraj Singh, et autres
Publié: (2025)
Why Do Safety Guardrails Degrade Across Languages?
par: Zhang, Max, et autres
Publié: (2026)
par: Zhang, Max, et autres
Publié: (2026)
Compute-Constrained Data Selection
par: Yin, Junjie Oscar, et autres
Publié: (2024)
par: Yin, Junjie Oscar, et autres
Publié: (2024)
CONSCENDI: A Contrastive and Scenario-Guided Distillation Approach to Guardrail Models for Virtual Assistants
par: Sun, Albert Yu, et autres
Publié: (2023)
par: Sun, Albert Yu, et autres
Publié: (2023)
World-Model-Augmented Web Agents with Action Correction
par: Shen, Zhouzhou, et autres
Publié: (2026)
par: Shen, Zhouzhou, et autres
Publié: (2026)
SafeWorld: Geo-Diverse Safety Alignment
par: Yin, Da, et autres
Publié: (2024)
par: Yin, Da, et autres
Publié: (2024)
LoRA-Guard: Parameter-Efficient Guardrail Adaptation for Content Moderation of Large Language Models
par: Elesedy, Hayder, et autres
Publié: (2024)
par: Elesedy, Hayder, et autres
Publié: (2024)
UniGuard: Towards Universal Safety Guardrails for Jailbreak Attacks on Multimodal Large Language Models
par: Oh, Sejoon, et autres
Publié: (2024)
par: Oh, Sejoon, et autres
Publié: (2024)
Identifying Features Associated with Bias Against 93 Stigmatized Groups in Language Models and Guardrail Model Safety Mitigation
par: Gueorguieva, Anna-Maria, et autres
Publié: (2025)
par: Gueorguieva, Anna-Maria, et autres
Publié: (2025)
AMAQ: Adaptive Mixed-bit Activation Quantization for Collaborative Parameter Efficient Fine-tuning
par: Song, Yurun, et autres
Publié: (2025)
par: Song, Yurun, et autres
Publié: (2025)
Understanding World or Predicting Future? A Comprehensive Survey of World Models
par: Ding, Jingtao, et autres
Publié: (2024)
par: Ding, Jingtao, et autres
Publié: (2024)
IAA: Inner-Adaptor Architecture Empowers Frozen Large Language Model with Multimodal Capabilities
par: Wang, Bin, et autres
Publié: (2024)
par: Wang, Bin, et autres
Publié: (2024)
AgentDoG: A Diagnostic Guardrail Framework for AI Agent Safety and Security
par: Liu, Dongrui, et autres
Publié: (2026)
par: Liu, Dongrui, et autres
Publié: (2026)
ComPO: Preference Alignment via Comparison Oracles
par: Chen, Peter, et autres
Publié: (2025)
par: Chen, Peter, et autres
Publié: (2025)
ModelingAgent: Bridging LLMs and Mathematical Modeling for Real-World Challenges
par: Qian, Cheng, et autres
Publié: (2025)
par: Qian, Cheng, et autres
Publié: (2025)
ThinkGuard: Deliberative Slow Thinking Leads to Cautious Guardrails
par: Wen, Xiaofei, et autres
Publié: (2025)
par: Wen, Xiaofei, et autres
Publié: (2025)
Current Agents Fail to Leverage World Model as Tool for Foresight
par: Qian, Cheng, et autres
Publié: (2026)
par: Qian, Cheng, et autres
Publié: (2026)
SafeArena: Evaluating the Safety of Autonomous Web Agents
par: Tur, Ada Defne, et autres
Publié: (2025)
par: Tur, Ada Defne, et autres
Publié: (2025)
Documents similaires
-
Graph2Eval: Automatic Multimodal Task Generation for Agents via Knowledge Graphs
par: Chen, Yurun, et autres
Publié: (2025) -
HarmonyGuard: Toward Safety and Utility in Web Agents via Adaptive Policy Enhancement and Dual-Objective Optimization
par: Chen, Yurun, et autres
Publié: (2025) -
Reinforce LLM Reasoning through Multi-Agent Reflection
par: Yuan, Yurun, et autres
Publié: (2025) -
Evaluating the Robustness of Multimodal Agents Against Active Environmental Injection Attacks
par: Chen, Yurun, et autres
Publié: (2025) -
Breaking the Capability Ceiling of LLM Post-Training by Reintroducing Markov States
par: Yuan, Yurun, et autres
Publié: (2026)