SafeSearch: Do Not Trade Safety for Utility in LLM Search Agents
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhan, Qiusi, Budiman-Chan, Angeline, Zayed, Abdelrahman, Guo, Xingzhi, Kang, Daniel, Kim, Joo-Kyung |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SafeSearch: Automated Red-Teaming of LLM-Based Search Agents
di: Dong, Jianshuo, et al.
Pubblicazione: (2025)
di: Dong, Jianshuo, et al.
Pubblicazione: (2025)
InjecAgent: Benchmarking Indirect Prompt Injections in Tool-Integrated Large Language Model Agents
di: Zhan, Qiusi, et al.
Pubblicazione: (2024)
di: Zhan, Qiusi, et al.
Pubblicazione: (2024)
Do Biased Models Have Biased Thoughts?
di: Rajwal, Swati, et al.
Pubblicazione: (2025)
di: Rajwal, Swati, et al.
Pubblicazione: (2025)
The Rise of Darkness: Safety-Utility Trade-Offs in Role-Playing Dialogue Agents
di: Tang, Yihong, et al.
Pubblicazione: (2025)
di: Tang, Yihong, et al.
Pubblicazione: (2025)
Removing RLHF Protections in GPT-4 via Fine-Tuning
di: Zhan, Qiusi, et al.
Pubblicazione: (2023)
di: Zhan, Qiusi, et al.
Pubblicazione: (2023)
Exploring Safety-Utility Trade-Offs in Personalized Language Models
di: Vijjini, Anvesh Rao, et al.
Pubblicazione: (2024)
di: Vijjini, Anvesh Rao, et al.
Pubblicazione: (2024)
Where to Search: Measure the Prior-Structured Search Space of LLM Agents
di: Song, Zhuo-Yang
Pubblicazione: (2025)
di: Song, Zhuo-Yang
Pubblicazione: (2025)
AI-LieDar: Examine the Trade-off Between Utility and Truthfulness in LLM Agents
di: Su, Zhe, et al.
Pubblicazione: (2024)
di: Su, Zhe, et al.
Pubblicazione: (2024)
AgentSquare: Automatic LLM Agent Search in Modular Design Space
di: Shang, Yu, et al.
Pubblicazione: (2024)
di: Shang, Yu, et al.
Pubblicazione: (2024)
Why Don't Prompt-Based Fairness Metrics Correlate?
di: Zayed, Abdelrahman, et al.
Pubblicazione: (2024)
di: Zayed, Abdelrahman, et al.
Pubblicazione: (2024)
Should We Attend More or Less? Modulating Attention for Fairness
di: Zayed, Abdelrahman, et al.
Pubblicazione: (2023)
di: Zayed, Abdelrahman, et al.
Pubblicazione: (2023)
Hierarchies over Vector Space: Orienting Word and Graph Embeddings
di: Guo, Xingzhi, et al.
Pubblicazione: (2022)
di: Guo, Xingzhi, et al.
Pubblicazione: (2022)
EvolveSearch: An Iterative Self-Evolving Search Agent
di: Zhang, Dingchu, et al.
Pubblicazione: (2025)
di: Zhang, Dingchu, et al.
Pubblicazione: (2025)
WaterSearch: Exploring Seed Pooling for Improving the Quality-Detectability Trade-off in LLM Watermarking
di: Lin, Yukang, et al.
Pubblicazione: (2025)
di: Lin, Yukang, et al.
Pubblicazione: (2025)
II-MMR: Identifying and Improving Multi-modal Multi-hop Reasoning in Visual Question Answering
di: Kil, Jihyung, et al.
Pubblicazione: (2024)
di: Kil, Jihyung, et al.
Pubblicazione: (2024)
AgentSwift: Efficient LLM Agent Design via Value-guided Hierarchical Search
di: Li, Yu, et al.
Pubblicazione: (2025)
di: Li, Yu, et al.
Pubblicazione: (2025)
BEAT: Visual Backdoor Attacks on VLM-based Embodied Agents via Contrastive Trigger Learning
di: Zhan, Qiusi, et al.
Pubblicazione: (2025)
di: Zhan, Qiusi, et al.
Pubblicazione: (2025)
Mitigating the Safety-utility Trade-off in LLM Alignment via Adaptive Safe Context Learning
di: Wang, Yanbo, et al.
Pubblicazione: (2026)
di: Wang, Yanbo, et al.
Pubblicazione: (2026)
Agent-SafetyBench: Evaluating the Safety of LLM Agents
di: Zhang, Zhexin, et al.
Pubblicazione: (2024)
di: Zhang, Zhexin, et al.
Pubblicazione: (2024)
When Is Enough Not Enough? Illusory Completion in Search Agents
di: Ko, Dayoon, et al.
Pubblicazione: (2026)
di: Ko, Dayoon, et al.
Pubblicazione: (2026)
Generative Subgraph Retrieval for Knowledge Graph-Grounded Dialog Generation
di: Park, Jinyoung, et al.
Pubblicazione: (2024)
di: Park, Jinyoung, et al.
Pubblicazione: (2024)
When Agents Trade: Live Multi-Market Trading Benchmark for LLM Agents
di: Qian, Lingfei, et al.
Pubblicazione: (2025)
di: Qian, Lingfei, et al.
Pubblicazione: (2025)
ZeroSearch: Incentivize the Search Capability of LLMs without Searching
di: Sun, Hao, et al.
Pubblicazione: (2025)
di: Sun, Hao, et al.
Pubblicazione: (2025)
LLM Tree Search
di: Wilson, Dylan
Pubblicazione: (2024)
di: Wilson, Dylan
Pubblicazione: (2024)
Searching for Privacy Risks in LLM Agents via Simulation
di: Zhang, Yanzhe, et al.
Pubblicazione: (2025)
di: Zhang, Yanzhe, et al.
Pubblicazione: (2025)
SE-Search: Self-Evolving Search Agent via Memory and Dense Reward
di: Li, Jian, et al.
Pubblicazione: (2026)
di: Li, Jian, et al.
Pubblicazione: (2026)
LLM Agents Improve Semantic Code Search
di: Jain, Sarthak, et al.
Pubblicazione: (2024)
di: Jain, Sarthak, et al.
Pubblicazione: (2024)
Expanding Search Space with Diverse Prompting Agents: An Efficient Sampling Approach for LLM Mathematical Reasoning
di: Lee, Gisang, et al.
Pubblicazione: (2024)
di: Lee, Gisang, et al.
Pubblicazione: (2024)
SearchLLM: Detecting LLM Paraphrased Text by Measuring the Similarity with Regeneration of the Candidate Source via Search Engine
di: Nguyen-Son, Hoang-Quoc, et al.
Pubblicazione: (2026)
di: Nguyen-Son, Hoang-Quoc, et al.
Pubblicazione: (2026)
LiteSearch: Efficacious Tree Search for LLM
di: Wang, Ante, et al.
Pubblicazione: (2024)
di: Wang, Ante, et al.
Pubblicazione: (2024)
R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning
di: Zhao, Qingfei, et al.
Pubblicazione: (2025)
di: Zhao, Qingfei, et al.
Pubblicazione: (2025)
Safe-Embed: Unveiling the Safety-Critical Knowledge of Sentence Encoders
di: Kim, Jinseok, et al.
Pubblicazione: (2024)
di: Kim, Jinseok, et al.
Pubblicazione: (2024)
LLM Agents can Autonomously Hack Websites
di: Fang, Richard, et al.
Pubblicazione: (2024)
di: Fang, Richard, et al.
Pubblicazione: (2024)
Advancing LLM Safe Alignment with Safety Representation Ranking
di: Du, Tianqi, et al.
Pubblicazione: (2025)
di: Du, Tianqi, et al.
Pubblicazione: (2025)
Quantifying the Utility of User Simulators for Building Collaborative LLM Assistants
di: Suh, Joseph, et al.
Pubblicazione: (2026)
di: Suh, Joseph, et al.
Pubblicazione: (2026)
Tree Search for Language Model Agents
di: Koh, Jing Yu, et al.
Pubblicazione: (2024)
di: Koh, Jing Yu, et al.
Pubblicazione: (2024)
Adaptive Attacks Break Defenses Against Indirect Prompt Injection Attacks on LLM Agents
di: Zhan, Qiusi, et al.
Pubblicazione: (2025)
di: Zhan, Qiusi, et al.
Pubblicazione: (2025)
CriticSearch: Fine-Grained Credit Assignment for Search Agents via a Retrospective Critic
di: Zhang, Yaocheng, et al.
Pubblicazione: (2025)
di: Zhang, Yaocheng, et al.
Pubblicazione: (2025)
The Good, the Bad and the Constructive: Automatically Measuring Peer Review's Utility for Authors
di: Sadallah, Abdelrahman, et al.
Pubblicazione: (2025)
di: Sadallah, Abdelrahman, et al.
Pubblicazione: (2025)
Rethinking Layer Redundancy: Calibration Matters More Than Search in LLM Depth Pruning
di: Kim, Minkyu, et al.
Pubblicazione: (2026)
di: Kim, Minkyu, et al.
Pubblicazione: (2026)
Documenti analoghi
-
SafeSearch: Automated Red-Teaming of LLM-Based Search Agents
di: Dong, Jianshuo, et al.
Pubblicazione: (2025) -
InjecAgent: Benchmarking Indirect Prompt Injections in Tool-Integrated Large Language Model Agents
di: Zhan, Qiusi, et al.
Pubblicazione: (2024) -
Do Biased Models Have Biased Thoughts?
di: Rajwal, Swati, et al.
Pubblicazione: (2025) -
The Rise of Darkness: Safety-Utility Trade-Offs in Role-Playing Dialogue Agents
di: Tang, Yihong, et al.
Pubblicazione: (2025) -
Removing RLHF Protections in GPT-4 via Fine-Tuning
di: Zhan, Qiusi, et al.
Pubblicazione: (2023)