Kelp: A Streaming Safeguard for Large Models via Latent Dynamics-Guided Risk Detection
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Xiaodan, Wu, Mengjie, Zhu, Yao, Lv, Yunna, Chen, YueFeng, Chen, Cen, Guo, Jianmei, Xue, Hui |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency
par: Zhao, Shiji, et autres
Publié: (2025)
par: Zhao, Shiji, et autres
Publié: (2025)
Dynamic Guided and Domain Applicable Safeguards for Enhanced Security in Large Language Models
par: Luo, Weidi, et autres
Publié: (2024)
par: Luo, Weidi, et autres
Publié: (2024)
ConsisGuard: Aligning Safety Deliberation with Policy Enforcement in LLM Guardrails
par: Wang, Yan, et autres
Publié: (2026)
par: Wang, Yan, et autres
Publié: (2026)
LGD-Net: Latent-Guided Dual-Stream Network for HER2 Scoring with Task-Specific Domain Knowledge
par: Zhu, Peide, et autres
Publié: (2026)
par: Zhu, Peide, et autres
Publié: (2026)
GATES: Cost-aware Dynamic Workflow Scheduling via Graph Attention Networks and Evolution Strategy
par: Shen, Ya, et autres
Publié: (2025)
par: Shen, Ya, et autres
Publié: (2025)
MRJ-Agent: An Effective Jailbreak Agent for Multi-Round Dialogue
par: Wang, Fengxiang, et autres
Publié: (2024)
par: Wang, Fengxiang, et autres
Publié: (2024)
Video Anomaly Detection and Explanation via Large Language Models
par: Lv, Hui, et autres
Publié: (2024)
par: Lv, Hui, et autres
Publié: (2024)
Low‐cost and easy‐to‐embed 7‐bit 360° phase shifter with transitions for large‐scale phased arrays
par: MeiCheng Liu, et autres
Publié: (2024)
par: MeiCheng Liu, et autres
Publié: (2024)
Prediction of Unmanned Surface Vessel Motion Attitude Based on CEEMDAN-PSO-SVM
par: Geng, Zhuoya, et autres
Publié: (2024)
par: Geng, Zhuoya, et autres
Publié: (2024)
Inference on Dynamic Spatial Autoregressive Models with Change Point Detection
par: Cen, Zetai, et autres
Publié: (2024)
par: Cen, Zetai, et autres
Publié: (2024)
SafeAgent: Safeguarding LLM Agents via an Automated Risk Simulator
par: Zhou, Xueyang, et autres
Publié: (2025)
par: Zhou, Xueyang, et autres
Publié: (2025)
Make the Most of Everything: Further Considerations on Disrupting Diffusion-based Customization
par: Tang, Long, et autres
Publié: (2025)
par: Tang, Long, et autres
Publié: (2025)
SentinelNet: Safeguarding Multi-Agent Collaboration Through Credit-Based Dynamic Threat Detection
par: Feng, Yang, et autres
Publié: (2025)
par: Feng, Yang, et autres
Publié: (2025)
StreamUni: Achieving Streaming Speech Translation with a Unified Large Speech-Language Model
par: Guo, Shoutao, et autres
Publié: (2025)
par: Guo, Shoutao, et autres
Publié: (2025)
DyEdgeGAT: Dynamic Edge via Graph Attention for Early Fault Detection in IIoT Systems
par: Zhao, Mengjie, et autres
Publié: (2023)
par: Zhao, Mengjie, et autres
Publié: (2023)
TraceMark-LDM: Authenticatable Watermarking for Latent Diffusion Models via Binary-Guided Rearrangement
par: Luo, Wenhao, et autres
Publié: (2025)
par: Luo, Wenhao, et autres
Publié: (2025)
Comprehensive Assessment and Analysis for NSFW Content Erasure in Text-to-Image Diffusion Models
par: Chen, Die, et autres
Publié: (2025)
par: Chen, Die, et autres
Publié: (2025)
SARSteer: Safeguarding Large Audio-Language Models via Safe-Ablated Refusal Steering
par: Lin, Weilin, et autres
Publié: (2025)
par: Lin, Weilin, et autres
Publié: (2025)
NExT-Guard: Training-Free Streaming Safeguard without Token-Level Labels
par: Fang, Junfeng, et autres
Publié: (2026)
par: Fang, Junfeng, et autres
Publié: (2026)
Merging Beyond: Streaming LLM Updates via Activation-Guided Rotations
par: Yao, Yuxuan, et autres
Publié: (2026)
par: Yao, Yuxuan, et autres
Publié: (2026)
RapGuard: Safeguarding Multimodal Large Language Models via Rationale-aware Defensive Prompting
par: Jiang, Yilei, et autres
Publié: (2024)
par: Jiang, Yilei, et autres
Publié: (2024)
Kelp temperature tolerance
par: Wright, Luka Seamus
Publié: (2023)
par: Wright, Luka Seamus
Publié: (2023)
Safety-Critical Traffic Simulation with Guided Latent Diffusion Model
par: Peng, Mingxing, et autres
Publié: (2025)
par: Peng, Mingxing, et autres
Publié: (2025)
Towards Generalizable PDE Dynamics Forecasting via Physics-Guided Invariant Learning
par: Li, Siyang, et autres
Publié: (2025)
par: Li, Siyang, et autres
Publié: (2025)
Cost-Aware Dynamic Cloud Workflow Scheduling using Self-Attention and Evolutionary Reinforcement Learning
par: Shen, Ya, et autres
Publié: (2024)
par: Shen, Ya, et autres
Publié: (2024)
Learning Symbolic Model-Agnostic Loss Functions via Meta-Learning
par: Raymond, Christian, et autres
Publié: (2022)
par: Raymond, Christian, et autres
Publié: (2022)
Reward Guided Latent Consistency Distillation
par: Li, Jiachen, et autres
Publié: (2024)
par: Li, Jiachen, et autres
Publié: (2024)
Take Fake as Real: Realistic-like Robust Black-box Adversarial Attack to Evade AIGC Detection
par: Xie, Caiyun, et autres
Publié: (2024)
par: Xie, Caiyun, et autres
Publié: (2024)
CORA: Conformal Risk-Controlled Agents for Safeguarded Mobile GUI Automation
par: Feng, Yushi, et autres
Publié: (2026)
par: Feng, Yushi, et autres
Publié: (2026)
JLT: Clean-Latent Prediction in Latent Diffusion Transformers
par: Fu, Funing, et autres
Publié: (2026)
par: Fu, Funing, et autres
Publié: (2026)
Label-Guided Prompt for Multi-label Few-shot Aspect Category Detection
par: Guan, ChaoFeng, et autres
Publié: (2024)
par: Guan, ChaoFeng, et autres
Publié: (2024)
SALLIE: Safeguarding Against Latent Language & Image Exploits
par: Azov, Guy, et autres
Publié: (2026)
par: Azov, Guy, et autres
Publié: (2026)
Libra: Large Chinese-based Safeguard for AI Content
par: Chen, Ziyang, et autres
Publié: (2025)
par: Chen, Ziyang, et autres
Publié: (2025)
Computer Security-Risks, Threats, and Safeguards.
par: Ekhaml, Leticia
Publié: (2001)
par: Ekhaml, Leticia
Publié: (2001)
Harnessing Sunshine: A Dynamic Spillover Analysis of the Diversification Effects of China's Photovoltaic Weather Index
par: Yu Wei, et autres
Publié: (2026)
par: Yu Wei, et autres
Publié: (2026)
Mechanisms underlining Kelp (Saccharina japonica) adaptation to relative high seawater temperature.
par: Guo, Li, et autres
Publié: (2025)
par: Guo, Li, et autres
Publié: (2025)
Risks of AI Scientists: Prioritizing Safeguarding Over Autonomy
par: Tang, Xiangru, et autres
Publié: (2024)
par: Tang, Xiangru, et autres
Publié: (2024)
Evaluating Chinese Large Language Models: The Influence of Persona Assignment on Stereotypes and Safeguards
par: Liu, Geng, et autres
Publié: (2025)
par: Liu, Geng, et autres
Publié: (2025)
Refiner: Data Refining against Gradient Leakage Attacks in Federated Learning
par: Fan, Mingyuan, et autres
Publié: (2022)
par: Fan, Mingyuan, et autres
Publié: (2022)
Transferability Bound Theory: Exploring Relationship between Adversarial Transferability and Flatness
par: Fan, Mingyuan, et autres
Publié: (2023)
par: Fan, Mingyuan, et autres
Publié: (2023)
Documents similaires
-
Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency
par: Zhao, Shiji, et autres
Publié: (2025) -
Dynamic Guided and Domain Applicable Safeguards for Enhanced Security in Large Language Models
par: Luo, Weidi, et autres
Publié: (2024) -
ConsisGuard: Aligning Safety Deliberation with Policy Enforcement in LLM Guardrails
par: Wang, Yan, et autres
Publié: (2026) -
LGD-Net: Latent-Guided Dual-Stream Network for HER2 Scoring with Task-Specific Domain Knowledge
par: Zhu, Peide, et autres
Publié: (2026) -
GATES: Cost-aware Dynamic Workflow Scheduling via Graph Attention Networks and Evolution Strategy
par: Shen, Ya, et autres
Publié: (2025)