TRAP: Targeted Redirecting of Agentic Preferences
Fuente:
arXiv
Saved in:
| Main Authors: | Kang, Hangoo, Yeon, Jehyeok, Singh, Gagandeep |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Quantitative Certification of Agentic Tool Selection
by: Yeon, Jehyeok, et al.
Published: (2025)
by: Yeon, Jehyeok, et al.
Published: (2025)
TRACE: Capability-Targeted Agentic Training
by: Kang, Hangoo, et al.
Published: (2026)
by: Kang, Hangoo, et al.
Published: (2026)
Stochastic Monkeys at Play: Random Augmentations Cheaply Break LLM Safety Alignment
by: Vega, Jason, et al.
Published: (2024)
by: Vega, Jason, et al.
Published: (2024)
It's a TRAP! Task-Redirecting Agent Persuasion Benchmark for Web Agents
by: Korgul, Karolina, et al.
Published: (2025)
by: Korgul, Karolina, et al.
Published: (2025)
Graph-Regularized Sparse Autoencoders for LLM Safety Steering
by: Yeon, Jehyeok, et al.
Published: (2025)
by: Yeon, Jehyeok, et al.
Published: (2025)
Matching Ranks Over Probability Yields Truly Deep Safety Alignment
by: Vega, Jason, et al.
Published: (2025)
by: Vega, Jason, et al.
Published: (2025)
Re-Mask and Redirect: Exploiting Denoising Irreversibility in Diffusion Language Models
by: Singh, Arth
Published: (2026)
by: Singh, Arth
Published: (2026)
TRAP: Targeted Random Adversarial Prompt Honeypot for Black-Box Identification
by: Gubri, Martin, et al.
Published: (2024)
by: Gubri, Martin, et al.
Published: (2024)
SafeRedirect: Defeating Internal Safety Collapse via Task-Completion Redirection in Frontier LLMs
by: Pan, Chao, et al.
Published: (2026)
by: Pan, Chao, et al.
Published: (2026)
Data Shifts Hurt CoT: A Theoretical Study
by: Yin, Lang, et al.
Published: (2025)
by: Yin, Lang, et al.
Published: (2025)
Probabilistic Trust Intervals for Out of Distribution Detection
by: Singh, Gagandeep, et al.
Published: (2021)
by: Singh, Gagandeep, et al.
Published: (2021)
LLM Unlearning via Neural Activation Redirection
by: Shen, William F., et al.
Published: (2025)
by: Shen, William F., et al.
Published: (2025)
Robust Answers, Fragile Logic: Probing the Decoupling Hypothesis in LLM Reasoning
by: Jiang, Enyi, et al.
Published: (2025)
by: Jiang, Enyi, et al.
Published: (2025)
Designing Ethical Learning for Agentic AI: Toegye Yi Hwang's Ethical Emotion Regulation Framework
by: Kim, Ji Yeon
Published: (2026)
by: Kim, Ji Yeon
Published: (2026)
Universal Black-Box Reward Poisoning Attack against Offline Reinforcement Learning
by: Xu, Yinglun, et al.
Published: (2024)
by: Xu, Yinglun, et al.
Published: (2024)
Reward Bias Substitution: Single-Axis Bias Mitigations Redirect Optimization Pressure
by: Lamparth, Max, et al.
Published: (2026)
by: Lamparth, Max, et al.
Published: (2026)
Learning a Pessimistic Reward Model in RLHF
by: Xu, Yinglun, et al.
Published: (2025)
by: Xu, Yinglun, et al.
Published: (2025)
SynCode: LLM Generation with Grammar Augmentation
by: Ugare, Shubham, et al.
Published: (2024)
by: Ugare, Shubham, et al.
Published: (2024)
TRAP: Tail-aware Ranking Attack for World-Model Planning
by: Duan, Siyuan, et al.
Published: (2026)
by: Duan, Siyuan, et al.
Published: (2026)
Entropy Guided Diversification and Preference Elicitation in Agentic Recommendation Systems
by: Tran, Dat, et al.
Published: (2026)
by: Tran, Dat, et al.
Published: (2026)
Specification Generation for Neural Networks in Systems
by: Chaudhary, Isha, et al.
Published: (2024)
by: Chaudhary, Isha, et al.
Published: (2024)
Formal Synthesis of Certifiably Robust Neural Lyapunov-Barrier Certificates
by: Wang, Chengxiao, et al.
Published: (2026)
by: Wang, Chengxiao, et al.
Published: (2026)
RecNet: Self-Evolving Preference Propagation for Agentic Recommender Systems
by: Li, Bingqian, et al.
Published: (2026)
by: Li, Bingqian, et al.
Published: (2026)
3D Gaussian and Diffusion-Based Gaze Redirection
by: Panchalingam, Abiram, et al.
Published: (2025)
by: Panchalingam, Abiram, et al.
Published: (2025)
Certifying Knowledge Comprehension in LLMs
by: Chaudhary, Isha, et al.
Published: (2024)
by: Chaudhary, Isha, et al.
Published: (2024)
Two-Step Offline Preference-Based Reinforcement Learning with Constrained Actions
by: Xu, Yinglun, et al.
Published: (2023)
by: Xu, Yinglun, et al.
Published: (2023)
HCVR Scene Generation: High Compatibility Virtual Reality Environment Generation for Extended Redirected Walking
by: Zhang, Yiran, et al.
Published: (2026)
by: Zhang, Yiran, et al.
Published: (2026)
Anyprefer: An Agentic Framework for Preference Data Synthesis
by: Zhou, Yiyang, et al.
Published: (2025)
by: Zhou, Yiyang, et al.
Published: (2025)
BEAVER: An Efficient Deterministic LLM Verifier
by: Suresh, Tarun, et al.
Published: (2025)
by: Suresh, Tarun, et al.
Published: (2025)
Position: Safety and Fairness in Agentic AI Depend on Interaction Topology, Not on Model Scale or Alignment
by: Bajaj, Tanav Singh, et al.
Published: (2026)
by: Bajaj, Tanav Singh, et al.
Published: (2026)
TargetCall: Eliminating the Wasted Computation in Basecalling via Pre-Basecalling Filtering
by: Cavlak, Meryem Banu, et al.
Published: (2022)
by: Cavlak, Meryem Banu, et al.
Published: (2022)
Tool Preferences in Agentic LLMs are Unreliable
by: Faghih, Kazem, et al.
Published: (2025)
by: Faghih, Kazem, et al.
Published: (2025)
E-MMKGR: A Unified Multimodal Knowledge Graph Framework for E-commerce Applications
by: Kang, Jiwoo, et al.
Published: (2026)
by: Kang, Jiwoo, et al.
Published: (2026)
MedRedFlag: Investigating how LLMs Redirect Misconceptions in Real-World Health Communication
by: Sambara, Sraavya, et al.
Published: (2026)
by: Sambara, Sraavya, et al.
Published: (2026)
VISOR: Visual Input-based Steering for Output Redirection in Vision-Language Models
by: Phute, Mansi, et al.
Published: (2025)
by: Phute, Mansi, et al.
Published: (2025)
Bypassing the Safety Training of Open-Source LLMs with Priming Attacks
by: Vega, Jason, et al.
Published: (2023)
by: Vega, Jason, et al.
Published: (2023)
Can LLMs Capture Human Preferences?
by: Goli, Ali, et al.
Published: (2023)
by: Goli, Ali, et al.
Published: (2023)
Certifying Counterfactual Bias in LLMs
by: Chaudhary, Isha, et al.
Published: (2024)
by: Chaudhary, Isha, et al.
Published: (2024)
Agentic Reasoning and Tool Integration for LLMs via Reinforcement Learning
by: Singh, Joykirat, et al.
Published: (2025)
by: Singh, Joykirat, et al.
Published: (2025)
Roll Your Eyes: Gaze Redirection via Explicit 3D Eyeball Rotation
by: Choi, YoungChan, et al.
Published: (2025)
by: Choi, YoungChan, et al.
Published: (2025)
Similar Items
-
Quantitative Certification of Agentic Tool Selection
by: Yeon, Jehyeok, et al.
Published: (2025) -
TRACE: Capability-Targeted Agentic Training
by: Kang, Hangoo, et al.
Published: (2026) -
Stochastic Monkeys at Play: Random Augmentations Cheaply Break LLM Safety Alignment
by: Vega, Jason, et al.
Published: (2024) -
It's a TRAP! Task-Redirecting Agent Persuasion Benchmark for Web Agents
by: Korgul, Karolina, et al.
Published: (2025) -
Graph-Regularized Sparse Autoencoders for LLM Safety Steering
by: Yeon, Jehyeok, et al.
Published: (2025)