On Prompt-Driven Safeguarding for Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zheng, Chujie, Yin, Fan, Zhou, Hao, Meng, Fandong, Zhou, Jie, Chang, Kai-Wei, Huang, Minlie, Peng, Nanyun |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Large Language Models Are Not Robust Multiple Choice Selectors
von: Zheng, Chujie, et al.
Veröffentlicht: (2023)
von: Zheng, Chujie, et al.
Veröffentlicht: (2023)
Model Extrapolation Expedites Alignment
von: Zheng, Chujie, et al.
Veröffentlicht: (2024)
von: Zheng, Chujie, et al.
Veröffentlicht: (2024)
Beyond Next Token Prediction: Patch-Level Training for Large Language Models
von: Shao, Chenze, et al.
Veröffentlicht: (2024)
von: Shao, Chenze, et al.
Veröffentlicht: (2024)
TEAL: Tokenize and Embed ALL for Multi-modal Large Language Models
von: Yang, Zhen, et al.
Veröffentlicht: (2023)
von: Yang, Zhen, et al.
Veröffentlicht: (2023)
LLM-A*: Large Language Model Enhanced Incremental Heuristic Search on Path Planning
von: Meng, Silin, et al.
Veröffentlicht: (2024)
von: Meng, Silin, et al.
Veröffentlicht: (2024)
Continuous Autoregressive Language Models
von: Shao, Chenze, et al.
Veröffentlicht: (2025)
von: Shao, Chenze, et al.
Veröffentlicht: (2025)
TasTe: Teaching Large Language Models to Translate through Self-Reflection
von: Wang, Yutong, et al.
Veröffentlicht: (2024)
von: Wang, Yutong, et al.
Veröffentlicht: (2024)
CSCD-NS: a Chinese Spelling Check Dataset for Native Speakers
von: Hu, Yong, et al.
Veröffentlicht: (2022)
von: Hu, Yong, et al.
Veröffentlicht: (2022)
DeepTrans: Deep Reasoning Translation via Reinforcement Learning
von: Wang, Jiaan, et al.
Veröffentlicht: (2025)
von: Wang, Jiaan, et al.
Veröffentlicht: (2025)
ExTrans: Multilingual Deep Reasoning Translation via Exemplar-Enhanced Reinforcement Learning
von: Wang, Jiaan, et al.
Veröffentlicht: (2025)
von: Wang, Jiaan, et al.
Veröffentlicht: (2025)
MiniPLM: Knowledge Distillation for Pre-Training Language Models
von: Gu, Yuxian, et al.
Veröffentlicht: (2024)
von: Gu, Yuxian, et al.
Veröffentlicht: (2024)
MiniLLM: On-Policy Distillation of Large Language Models
von: Gu, Yuxian, et al.
Veröffentlicht: (2023)
von: Gu, Yuxian, et al.
Veröffentlicht: (2023)
An Empirical Study of Many-to-Many Summarization with Large Language Models
von: Wang, Jiaan, et al.
Veröffentlicht: (2025)
von: Wang, Jiaan, et al.
Veröffentlicht: (2025)
DACO: Towards Application-Driven and Comprehensive Data Analysis via Code Generation
von: Wu, Xueqing, et al.
Veröffentlicht: (2024)
von: Wu, Xueqing, et al.
Veröffentlicht: (2024)
SafeWorld: Geo-Diverse Safety Alignment
von: Yin, Da, et al.
Veröffentlicht: (2024)
von: Yin, Da, et al.
Veröffentlicht: (2024)
Comparing Bad Apples to Good Oranges: Aligning Large Language Models via Joint Preference Optimization
von: Bansal, Hritik, et al.
Veröffentlicht: (2024)
von: Bansal, Hritik, et al.
Veröffentlicht: (2024)
Retrieval-Augmented Machine Translation with Unstructured Knowledge
von: Wang, Jiaan, et al.
Veröffentlicht: (2024)
von: Wang, Jiaan, et al.
Veröffentlicht: (2024)
EAG: Extract and Generate Multi-way Aligned Corpus for Complete Multi-lingual Neural Machine Translation
von: Xu, Yulin, et al.
Veröffentlicht: (2022)
von: Xu, Yulin, et al.
Veröffentlicht: (2022)
DRT: Deep Reasoning Translation via Long Chain-of-Thought
von: Wang, Jiaan, et al.
Veröffentlicht: (2024)
von: Wang, Jiaan, et al.
Veröffentlicht: (2024)
A Dual-Space Framework for General Knowledge Distillation of Large Language Models
von: Zhang, Xue, et al.
Veröffentlicht: (2025)
von: Zhang, Xue, et al.
Veröffentlicht: (2025)
Unsupervised Information Refinement Training of Large Language Models for Retrieval-Augmented Generation
von: Xu, Shicheng, et al.
Veröffentlicht: (2024)
von: Xu, Shicheng, et al.
Veröffentlicht: (2024)
LLaVE: Large Language and Vision Embedding Models with Hardness-Weighted Contrastive Learning
von: Lan, Zhibin, et al.
Veröffentlicht: (2025)
von: Lan, Zhibin, et al.
Veröffentlicht: (2025)
Evaluating Human Alignment and Model Faithfulness of LLM Rationale
von: Fayyaz, Mohsen, et al.
Veröffentlicht: (2024)
von: Fayyaz, Mohsen, et al.
Veröffentlicht: (2024)
DeepEdit: Knowledge Editing as Decoding with Constraints
von: Wang, Yiwei, et al.
Veröffentlicht: (2024)
von: Wang, Yiwei, et al.
Veröffentlicht: (2024)
Sysformer: Safeguarding Frozen Large Language Models with Adaptive System Prompts
von: Sharma, Kartik, et al.
Veröffentlicht: (2025)
von: Sharma, Kartik, et al.
Veröffentlicht: (2025)
LCS: A Language Converter Strategy for Zero-Shot Neural Machine Translation
von: Sun, Zengkui, et al.
Veröffentlicht: (2024)
von: Sun, Zengkui, et al.
Veröffentlicht: (2024)
Beyond Facts: Benchmarking Distributional Reading Comprehension in Large Language Models
von: Guo, Pei-Fu, et al.
Veröffentlicht: (2026)
von: Guo, Pei-Fu, et al.
Veröffentlicht: (2026)
Cross-Lingual Knowledge Editing in Large Language Models
von: Wang, Jiaan, et al.
Veröffentlicht: (2023)
von: Wang, Jiaan, et al.
Veröffentlicht: (2023)
DeepRAG: Thinking to Retrieve Step by Step for Large Language Models
von: Guan, Xinyan, et al.
Veröffentlicht: (2025)
von: Guan, Xinyan, et al.
Veröffentlicht: (2025)
Translatotron-V(ison): An End-to-End Model for In-Image Machine Translation
von: Lan, Zhibin, et al.
Veröffentlicht: (2024)
von: Lan, Zhibin, et al.
Veröffentlicht: (2024)
General learned delegation by clones
von: Li, Darren, et al.
Veröffentlicht: (2026)
von: Li, Darren, et al.
Veröffentlicht: (2026)
AVG-LLaVA: An Efficient Large Multimodal Model with Adaptive Visual Granularity
von: Lan, Zhibin, et al.
Veröffentlicht: (2024)
von: Lan, Zhibin, et al.
Veröffentlicht: (2024)
Gradient Co-occurrence Analysis for Detecting Unsafe Prompts in Large Language Models
von: Yang, Jingyuan, et al.
Veröffentlicht: (2025)
von: Yang, Jingyuan, et al.
Veröffentlicht: (2025)
ExpertPrompting: Instructing Large Language Models to be Distinguished Experts
von: Xu, Benfeng, et al.
Veröffentlicht: (2023)
von: Xu, Benfeng, et al.
Veröffentlicht: (2023)
Revealing Behavioral Plasticity in Large Language Models: A Token-Conditional Perspective
von: Mao, Liyuan, et al.
Veröffentlicht: (2026)
von: Mao, Liyuan, et al.
Veröffentlicht: (2026)
Are Large Language Models Good Prompt Optimizers?
von: Ma, Ruotian, et al.
Veröffentlicht: (2024)
von: Ma, Ruotian, et al.
Veröffentlicht: (2024)
An Empirical Study on Prompt Compression for Large Language Models
von: Zhang, Zheng, et al.
Veröffentlicht: (2025)
von: Zhang, Zheng, et al.
Veröffentlicht: (2025)
scReader: Prompting Large Language Models to Interpret scRNA-seq Data
von: Li, Cong, et al.
Veröffentlicht: (2024)
von: Li, Cong, et al.
Veröffentlicht: (2024)
Understanding the Dilemma of Unlearning for Large Language Models
von: Zhang, Qingjie, et al.
Veröffentlicht: (2025)
von: Zhang, Qingjie, et al.
Veröffentlicht: (2025)
Training-Free Test-Time Contrastive Learning for Large Language Models
von: Zheng, Kaiwen, et al.
Veröffentlicht: (2026)
von: Zheng, Kaiwen, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Large Language Models Are Not Robust Multiple Choice Selectors
von: Zheng, Chujie, et al.
Veröffentlicht: (2023) -
Model Extrapolation Expedites Alignment
von: Zheng, Chujie, et al.
Veröffentlicht: (2024) -
Beyond Next Token Prediction: Patch-Level Training for Large Language Models
von: Shao, Chenze, et al.
Veröffentlicht: (2024) -
TEAL: Tokenize and Embed ALL for Multi-modal Large Language Models
von: Yang, Zhen, et al.
Veröffentlicht: (2023) -
LLM-A*: Large Language Model Enhanced Incremental Heuristic Search on Path Planning
von: Meng, Silin, et al.
Veröffentlicht: (2024)