SafeMCP: Proactive Power Regulation for LLM Agent Defense via Environment-Grounded Look-Ahead Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Lichao, Ren, Zhaoxing, Yang, Tianzhuo, Ji, Jiaming, Liu, Chi Harold, Yang, Yaodong, Dai, Juntao |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Game-Theoretic Negotiation Framework for Cross-Cultural Consensus in LLMs
par: Zhang, Guoxi, et autres
Publié: (2025)
par: Zhang, Guoxi, et autres
Publié: (2025)
Sequence to Sequence Reward Modeling: Improving RLHF by Language Feedback
par: Zhou, Jiayi, et autres
Publié: (2024)
par: Zhou, Jiayi, et autres
Publié: (2024)
VISA: Value Injection via Shielded Adaptation for Personalized LLM Alignment
par: Chen, Jiawei, et autres
Publié: (2026)
par: Chen, Jiawei, et autres
Publié: (2026)
SafeLawBench: Towards Safe Alignment of Large Language Models
par: Cao, Chuxue, et autres
Publié: (2025)
par: Cao, Chuxue, et autres
Publié: (2025)
SafeMT: Multi-turn Safety for Multimodal Language Models
par: Zhu, Han, et autres
Publié: (2025)
par: Zhu, Han, et autres
Publié: (2025)
SafeDreamer: Safe Reinforcement Learning with World Models
par: Huang, Weidong, et autres
Publié: (2023)
par: Huang, Weidong, et autres
Publié: (2023)
ThinkPatterns-21k: A Systematic Study on the Impact of Thinking Patterns in LLMs
par: Wen, Pengcheng, et autres
Publié: (2025)
par: Wen, Pengcheng, et autres
Publié: (2025)
SafeSora: Towards Safety Alignment of Text2Video Generation via a Human Preference Dataset
par: Dai, Josef, et autres
Publié: (2024)
par: Dai, Josef, et autres
Publié: (2024)
SafeEditor: Unified MLLM for Efficient Post-hoc T2I Safety Editing
par: Zhang, Ruiyang, et autres
Publié: (2025)
par: Zhang, Ruiyang, et autres
Publié: (2025)
Look-Ahead Reasoning on Learning Platforms
par: Zhu, Haiqing, et autres
Publié: (2025)
par: Zhu, Haiqing, et autres
Publié: (2025)
Stable Reasoning, Unstable Responses: Mitigating LLM Deception via Stability Asymmetry
par: Zhang, Guoxi, et autres
Publié: (2026)
par: Zhang, Guoxi, et autres
Publié: (2026)
PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference
par: Ji, Jiaming, et autres
Publié: (2024)
par: Ji, Jiaming, et autres
Publié: (2024)
Look One Step Ahead: Forward-Looking Incentive Design with Strategic Privacy for Proactive Service Provisioning over Air-Ground Integrated Edge Networks
par: Wu, Sicheng, et autres
Publié: (2026)
par: Wu, Sicheng, et autres
Publié: (2026)
Align Once, Benefit Multilingually: Enforcing Multilingual Consistency for LLM Safety Alignment
par: Bu, Yuyan, et autres
Publié: (2026)
par: Bu, Yuyan, et autres
Publié: (2026)
SPADE-Bench: Evaluating Spontaneous Strategic Deception in Agents via Plan-Action Divergence
par: Bu, Yuyan, et autres
Publié: (2026)
par: Bu, Yuyan, et autres
Publié: (2026)
VLA-Arena: An Open-Source Framework for Benchmarking Vision-Language-Action Models
par: Zhang, Borong, et autres
Publié: (2025)
par: Zhang, Borong, et autres
Publié: (2025)
SAE-V: Interpreting Multimodal Models for Enhanced Alignment
par: Lou, Hantao, et autres
Publié: (2025)
par: Lou, Hantao, et autres
Publié: (2025)
Stream Aligner: Efficient Sentence-Level Alignment via Distribution Induction
par: Lou, Hantao, et autres
Publié: (2025)
par: Lou, Hantao, et autres
Publié: (2025)
Aligner: Efficient Alignment by Learning to Correct
par: Ji, Jiaming, et autres
Publié: (2024)
par: Ji, Jiaming, et autres
Publié: (2024)
ProgressGym: Alignment with a Millennium of Moral Progress
par: Qiu, Tianyi, et autres
Publié: (2024)
par: Qiu, Tianyi, et autres
Publié: (2024)
No Labels, No Look-Ahead: Unsupervised Online Video Stabilization with Classical Priors
par: Liu, Tao, et autres
Publié: (2026)
par: Liu, Tao, et autres
Publié: (2026)
Language Models Resist Alignment: Evidence From Data Compression
par: Ji, Jiaming, et autres
Publié: (2024)
par: Ji, Jiaming, et autres
Publié: (2024)
Look Ahead Text Understanding and LLM Stitching
par: Jiang, Junlin Julian, et autres
Publié: (2024)
par: Jiang, Junlin Julian, et autres
Publié: (2024)
What, Whether and How? Unveiling Process Reward Models for Thinking with Images Reasoning
par: Zhou, Yujin, et autres
Publié: (2026)
par: Zhou, Yujin, et autres
Publié: (2026)
MiraBench: Evaluating Action-Conditioned Reliability in Robotic World Models
par: Yang, Tianzhuo, et autres
Publié: (2026)
par: Yang, Tianzhuo, et autres
Publié: (2026)
Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation
par: Dai, Juntao, et autres
Publié: (2024)
par: Dai, Juntao, et autres
Publié: (2024)
Discovering Self-Regulated Learning Patterns in Chatbot-Powered Education Environment
par: Lyu, Yilin, et autres
Publié: (2025)
par: Lyu, Yilin, et autres
Publié: (2025)
Think Before You Prune: Selective Self-Generated Calibration for Pruning Large Reasoning Models
par: Xiang, Yang, et autres
Publié: (2025)
par: Xiang, Yang, et autres
Publié: (2025)
Look-Ahead Screening Rules for the Lasso
par: Larsson, Johan
Publié: (2021)
par: Larsson, Johan
Publié: (2021)
Look-Ahead and Look-Back Flows: Training-Free Image Generation with Trajectory Smoothing
par: Luo, Yan, et autres
Publié: (2026)
par: Luo, Yan, et autres
Publié: (2026)
Look Ahead or Look Around? A Theoretical Comparison Between Autoregressive and Masked Pretraining
par: Zhang, Qi, et autres
Publié: (2024)
par: Zhang, Qi, et autres
Publié: (2024)
Look-Ahead-Bench: a Standardized Benchmark of Look-ahead Bias in Point-in-Time LLMs for Finance
par: Benhenda, Mostapha
Publié: (2026)
par: Benhenda, Mostapha
Publié: (2026)
Towards Proactive Defense Against Cyber Cognitive Attacks
par: Rushing, Bonnie, et autres
Publié: (2025)
par: Rushing, Bonnie, et autres
Publié: (2025)
DeContext as Defense: Safe Image Editing in Diffusion Transformers
par: Shen, Linghui, et autres
Publié: (2025)
par: Shen, Linghui, et autres
Publié: (2025)
Local Look-Ahead Guidance via Verifier-in-the-Loop for Automated Theorem Proving
par: Rajaee, Sara, et autres
Publié: (2025)
par: Rajaee, Sara, et autres
Publié: (2025)
A Design Trajectory Map of Human-AI Collaborative Reinforcement Learning Systems: Survey and Taxonomy
par: Li, Zhaoxing
Publié: (2024)
par: Li, Zhaoxing
Publié: (2024)
LookAhead Tuning: Safer Language Models via Partial Answer Previews
par: Liu, Kangwei, et autres
Publié: (2025)
par: Liu, Kangwei, et autres
Publié: (2025)
When Is Thinking Enough? Early Exit via Sufficiency Assessment for Efficient Reasoning
par: Xiang, Yang, et autres
Publié: (2026)
par: Xiang, Yang, et autres
Publié: (2026)
Unlocking the Future: Exploring Look-Ahead Planning Mechanistic Interpretability in Large Language Models
par: Men, Tianyi, et autres
Publié: (2024)
par: Men, Tianyi, et autres
Publié: (2024)
CogniAlign: Survivability-Grounded Multi-Agent Moral Reasoning for Safe and Transparent AI
par: Ali, Hasin Jawad, et autres
Publié: (2025)
par: Ali, Hasin Jawad, et autres
Publié: (2025)
Documents similaires
-
A Game-Theoretic Negotiation Framework for Cross-Cultural Consensus in LLMs
par: Zhang, Guoxi, et autres
Publié: (2025) -
Sequence to Sequence Reward Modeling: Improving RLHF by Language Feedback
par: Zhou, Jiayi, et autres
Publié: (2024) -
VISA: Value Injection via Shielded Adaptation for Personalized LLM Alignment
par: Chen, Jiawei, et autres
Publié: (2026) -
SafeLawBench: Towards Safe Alignment of Large Language Models
par: Cao, Chuxue, et autres
Publié: (2025) -
SafeMT: Multi-turn Safety for Multimodal Language Models
par: Zhu, Han, et autres
Publié: (2025)