Can Editing LLMs Inject Harm?
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Canyu, Huang, Baixiang, Li, Zekun, Chen, Zhaorun, Lai, Shiyang, Xu, Xiongxiao, Gu, Jia-Chen, Gu, Jindong, Yao, Huaxiu, Xiao, Chaowei, Yan, Xifeng, Wang, William Yang, Torr, Philip, Song, Dawn, Shu, Kai |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Can Knowledge Editing Really Correct Hallucinations?
di: Huang, Baixiang, et al.
Pubblicazione: (2024)
di: Huang, Baixiang, et al.
Pubblicazione: (2024)
Can Large Language Models Identify Authorship?
di: Huang, Baixiang, et al.
Pubblicazione: (2024)
di: Huang, Baixiang, et al.
Pubblicazione: (2024)
Authorship Attribution in the Era of LLMs: Problems, Methodologies, and Challenges
di: Huang, Baixiang, et al.
Pubblicazione: (2024)
di: Huang, Baixiang, et al.
Pubblicazione: (2024)
SST: Multi-Scale Hybrid Mamba-Transformer Experts for Time Series Forecasting
di: Xu, Xiongxiao, et al.
Pubblicazione: (2024)
di: Xu, Xiongxiao, et al.
Pubblicazione: (2024)
MetaGAD: Meta Representation Adaptation for Few-Shot Graph Anomaly Detection
di: Xu, Xiongxiao, et al.
Pubblicazione: (2023)
di: Xu, Xiongxiao, et al.
Pubblicazione: (2023)
Can Large Language Model Agents Simulate Human Trust Behavior?
di: Xie, Chengxing, et al.
Pubblicazione: (2024)
di: Xie, Chengxing, et al.
Pubblicazione: (2024)
Privacy-Aware Decoding: Mitigating Privacy Leakage of Large Language Models in Retrieval-Augmented Generation
di: Wang, Haoran, et al.
Pubblicazione: (2025)
di: Wang, Haoran, et al.
Pubblicazione: (2025)
Can LLM-Generated Misinformation Be Detected?
di: Chen, Canyu, et al.
Pubblicazione: (2023)
di: Chen, Canyu, et al.
Pubblicazione: (2023)
Deep Research Brings Deeper Harm
di: Chen, Shuo, et al.
Pubblicazione: (2025)
di: Chen, Shuo, et al.
Pubblicazione: (2025)
Can Multimodal LLMs Perform Time Series Anomaly Detection?
di: Xu, Xiongxiao, et al.
Pubblicazione: (2025)
di: Xu, Xiongxiao, et al.
Pubblicazione: (2025)
Can an Individual Manipulate the Collective Decisions of Multi-Agents?
di: Liu, Fengyuan, et al.
Pubblicazione: (2025)
di: Liu, Fengyuan, et al.
Pubblicazione: (2025)
Can Knowledge-Graph-based Retrieval Augmented Generation Really Retrieve What You Need?
di: Yu, Junchi, et al.
Pubblicazione: (2025)
di: Yu, Junchi, et al.
Pubblicazione: (2025)
Taxonomy-Guided Zero-Shot Recommendations with LLMs
di: Liang, Yueqing, et al.
Pubblicazione: (2024)
di: Liang, Yueqing, et al.
Pubblicazione: (2024)
As Firm As Their Foundations: Can open-sourced foundation models be used to create adversarial examples for downstream tasks?
di: Hu, Anjun, et al.
Pubblicazione: (2024)
di: Hu, Anjun, et al.
Pubblicazione: (2024)
AgentPoison: Red-teaming LLM Agents via Poisoning Memory or Knowledge Bases
di: Chen, Zhaorun, et al.
Pubblicazione: (2024)
di: Chen, Zhaorun, et al.
Pubblicazione: (2024)
LLM Jailbreak Detection for (Almost) Free!
di: Chen, Guorui, et al.
Pubblicazione: (2025)
di: Chen, Guorui, et al.
Pubblicazione: (2025)
Model Editing as a Double-Edged Sword: Steering Agent Ethical Behavior Toward Beneficence or Harm
di: Huang, Baixiang, et al.
Pubblicazione: (2025)
di: Huang, Baixiang, et al.
Pubblicazione: (2025)
A Guardrail for Safety Preservation: When Safety-Sensitive Subspace Meets Harmful-Resistant Null-Space
di: Zhang, Bingjie, et al.
Pubblicazione: (2025)
di: Zhang, Bingjie, et al.
Pubblicazione: (2025)
An Image Is Worth 1000 Lies: Adversarial Transferability across Prompts on Vision-Language Models
di: Luo, Haochen, et al.
Pubblicazione: (2024)
di: Luo, Haochen, et al.
Pubblicazione: (2024)
Influencer Backdoor Attack on Semantic Segmentation
di: Lan, Haoheng, et al.
Pubblicazione: (2023)
di: Lan, Haoheng, et al.
Pubblicazione: (2023)
Can Multimodal Large Language Models Truly Perform Multimodal In-Context Learning?
di: Chen, Shuo, et al.
Pubblicazione: (2023)
di: Chen, Shuo, et al.
Pubblicazione: (2023)
Benchmarking Open-ended Audio Dialogue Understanding for Large Audio-Language Models
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
Reimagining Safety Alignment with An Image
di: Xia, Yifan, et al.
Pubblicazione: (2025)
di: Xia, Yifan, et al.
Pubblicazione: (2025)
Latent Guard: a Safety Framework for Text-to-image Generation
di: Liu, Runtao, et al.
Pubblicazione: (2024)
di: Liu, Runtao, et al.
Pubblicazione: (2024)
ClinicalBench: Can LLMs Beat Traditional ML Models in Clinical Prediction?
di: Chen, Canyu, et al.
Pubblicazione: (2024)
di: Chen, Canyu, et al.
Pubblicazione: (2024)
UltraEdit: Training-, Subject-, and Memory-Free Lifelong Editing in Language Models
di: Gu, Xiaojie, et al.
Pubblicazione: (2025)
di: Gu, Xiaojie, et al.
Pubblicazione: (2025)
PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs
di: Wu, Yixuan, et al.
Pubblicazione: (2025)
di: Wu, Yixuan, et al.
Pubblicazione: (2025)
Self-Discovering Interpretable Diffusion Latent Directions for Responsible Text-to-Image Generation
di: Li, Hang, et al.
Pubblicazione: (2023)
di: Li, Hang, et al.
Pubblicazione: (2023)
Which Model Generated This Image? A Model-Agnostic Approach for Origin Attribution
di: Liu, Fengyuan, et al.
Pubblicazione: (2024)
di: Liu, Fengyuan, et al.
Pubblicazione: (2024)
Model Editing Harms General Abilities of Large Language Models: Regularization to the Rescue
di: Gu, Jia-Chen, et al.
Pubblicazione: (2024)
di: Gu, Jia-Chen, et al.
Pubblicazione: (2024)
HALC: Object Hallucination Reduction via Adaptive Focal-Contrast Decoding
di: Chen, Zhaorun, et al.
Pubblicazione: (2024)
di: Chen, Zhaorun, et al.
Pubblicazione: (2024)
TraceDet: Hallucination Detection from the Decoding Trace of Diffusion Large Language Models
di: Chang, Shenxu, et al.
Pubblicazione: (2025)
di: Chang, Shenxu, et al.
Pubblicazione: (2025)
Improving Adversarial Transferability via Model Alignment
di: Ma, Avery, et al.
Pubblicazione: (2023)
di: Ma, Avery, et al.
Pubblicazione: (2023)
Towards Effective Model Editing for LLM Personalization
di: Huang, Baixiang, et al.
Pubblicazione: (2025)
di: Huang, Baixiang, et al.
Pubblicazione: (2025)
Multimodal Pragmatic Jailbreak on Text-to-image Models
di: Liu, Tong, et al.
Pubblicazione: (2024)
di: Liu, Tong, et al.
Pubblicazione: (2024)
A Survey on Responsible Generative AI: What to Generate and What Not
di: Gu, Jindong
Pubblicazione: (2024)
di: Gu, Jindong
Pubblicazione: (2024)
Inducing High Energy-Latency of Large Vision-Language Models with Verbose Images
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
Energy-Latency Manipulation of Multi-modal Large Language Models via Verbose Samples
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models
di: Xing, Songlong, et al.
Pubblicazione: (2026)
di: Xing, Songlong, et al.
Pubblicazione: (2026)
Hidden Persuaders: LLMs' Political Leaning and Their Influence on Voters
di: Potter, Yujin, et al.
Pubblicazione: (2024)
di: Potter, Yujin, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Can Knowledge Editing Really Correct Hallucinations?
di: Huang, Baixiang, et al.
Pubblicazione: (2024) -
Can Large Language Models Identify Authorship?
di: Huang, Baixiang, et al.
Pubblicazione: (2024) -
Authorship Attribution in the Era of LLMs: Problems, Methodologies, and Challenges
di: Huang, Baixiang, et al.
Pubblicazione: (2024) -
SST: Multi-Scale Hybrid Mamba-Transformer Experts for Time Series Forecasting
di: Xu, Xiongxiao, et al.
Pubblicazione: (2024) -
MetaGAD: Meta Representation Adaptation for Few-Shot Graph Anomaly Detection
di: Xu, Xiongxiao, et al.
Pubblicazione: (2023)