Adaptive Content Restriction for Large Language Models via Suffix Optimization
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Yige, Jiang, Peihai, Sun, Jun, Shu, Peng, Liu, Tianming, Xiang, Zhen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Backdoor Token Unlearning: Exposing and Defending Backdoors in Pretrained Language Models
di: Jiang, Peihai, et al.
Pubblicazione: (2025)
di: Jiang, Peihai, et al.
Pubblicazione: (2025)
Do Influence Functions Work on Large Language Models?
di: Li, Zhe, et al.
Pubblicazione: (2024)
di: Li, Zhe, et al.
Pubblicazione: (2024)
Unleashing the Unseen: Harnessing Benign Datasets for Jailbreaking Large Language Models
di: Zhao, Wei, et al.
Pubblicazione: (2024)
di: Zhao, Wei, et al.
Pubblicazione: (2024)
CROW: Eliminating Backdoors from Large Language Models via Internal Consistency Regularization
di: Min, Nay Myat, et al.
Pubblicazione: (2024)
di: Min, Nay Myat, et al.
Pubblicazione: (2024)
Toward Understanding the Transferability of Adversarial Suffixes in Large Language Models
di: Ball, Sarah, et al.
Pubblicazione: (2025)
di: Ball, Sarah, et al.
Pubblicazione: (2025)
QueEn: A Large Language Model for Quechua-English Translation
di: Chen, Junhao, et al.
Pubblicazione: (2024)
di: Chen, Junhao, et al.
Pubblicazione: (2024)
Radiology-GPT: A Large Language Model for Radiology
di: Liu, Zhengliang, et al.
Pubblicazione: (2023)
di: Liu, Zhengliang, et al.
Pubblicazione: (2023)
Opportunities and Challenges of Large Language Models for Low-Resource Languages in Humanities Research
di: Zhong, Tianyang, et al.
Pubblicazione: (2024)
di: Zhong, Tianyang, et al.
Pubblicazione: (2024)
MGH Radiology Llama: A Llama 3 70B Model for Radiology
di: Shi, Yucheng, et al.
Pubblicazione: (2024)
di: Shi, Yucheng, et al.
Pubblicazione: (2024)
Legal Evalutions and Challenges of Large Language Models
di: Wang, Jiaqi, et al.
Pubblicazione: (2024)
di: Wang, Jiaqi, et al.
Pubblicazione: (2024)
Internal Safety Collapse in Frontier Large Language Models
di: Wu, Yutao, et al.
Pubblicazione: (2026)
di: Wu, Yutao, et al.
Pubblicazione: (2026)
Refine Knowledge of Large Language Models via Adaptive Contrastive Learning
di: Li, Yinghui, et al.
Pubblicazione: (2025)
di: Li, Yinghui, et al.
Pubblicazione: (2025)
MAPO: Boosting Large Language Model Performance with Model-Adaptive Prompt Optimization
di: Chen, Yuyan, et al.
Pubblicazione: (2024)
di: Chen, Yuyan, et al.
Pubblicazione: (2024)
Scalable In-Context Learning on Tabular Data via Retrieval-Augmented Large Language Models
di: Wen, Xumeng, et al.
Pubblicazione: (2025)
di: Wen, Xumeng, et al.
Pubblicazione: (2025)
Large Language Models for Manufacturing
di: Li, Yiwei, et al.
Pubblicazione: (2024)
di: Li, Yiwei, et al.
Pubblicazione: (2024)
Where Did It Go Wrong? Attributing Undesirable LLM Behaviors via Representation Gradient Tracing
di: Li, Zhe, et al.
Pubblicazione: (2025)
di: Li, Zhe, et al.
Pubblicazione: (2025)
Evaluating and Optimizing Educational Content with Large Language Model Judgments
di: He-Yueya, Joy, et al.
Pubblicazione: (2024)
di: He-Yueya, Joy, et al.
Pubblicazione: (2024)
BlueSuffix: Reinforced Blue Teaming for Vision-Language Models Against Jailbreak Attacks
di: Zhao, Yunhan, et al.
Pubblicazione: (2024)
di: Zhao, Yunhan, et al.
Pubblicazione: (2024)
GP-GPT: Large Language Model for Gene-Phenotype Mapping
di: Lyu, Yanjun, et al.
Pubblicazione: (2024)
di: Lyu, Yanjun, et al.
Pubblicazione: (2024)
Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation
di: Zhuang, Jun, et al.
Pubblicazione: (2025)
di: Zhuang, Jun, et al.
Pubblicazione: (2025)
Dynamic Adaptive Optimization for Effective Sentiment Analysis Fine-Tuning on Large Language Models
di: Ding, Hongcheng, et al.
Pubblicazione: (2024)
di: Ding, Hongcheng, et al.
Pubblicazione: (2024)
Assessing Large Language Models in Mechanical Engineering Education: A Study on Mechanics-Focused Conceptual Understanding
di: Tian, Jie, et al.
Pubblicazione: (2024)
di: Tian, Jie, et al.
Pubblicazione: (2024)
Route to Rome Attack: Directing LLM Routers to Expensive Models via Adversarial Suffix Optimization
di: Tang, Haochun, et al.
Pubblicazione: (2026)
di: Tang, Haochun, et al.
Pubblicazione: (2026)
Do Large Language Models Need a Content Delivery Network?
di: Cheng, Yihua, et al.
Pubblicazione: (2024)
di: Cheng, Yihua, et al.
Pubblicazione: (2024)
ToolNet: Connecting Large Language Models with Massive Tools via Tool Graph
di: Liu, Xukun, et al.
Pubblicazione: (2024)
di: Liu, Xukun, et al.
Pubblicazione: (2024)
AD-GPT: Large Language Models in Alzheimer's Disease
di: Liu, Ziyu, et al.
Pubblicazione: (2025)
di: Liu, Ziyu, et al.
Pubblicazione: (2025)
Gradient-Adaptive Policy Optimization: Towards Multi-Objective Alignment of Large Language Models
di: Li, Chengao, et al.
Pubblicazione: (2025)
di: Li, Chengao, et al.
Pubblicazione: (2025)
Catching Chameleons: Detecting Evolving Disinformation Generated using Large Language Models
di: Jiang, Bohan, et al.
Pubblicazione: (2024)
di: Jiang, Bohan, et al.
Pubblicazione: (2024)
Optimizing Psychological Counseling with Instruction-Tuned Large Language Models
di: Li, Wenjie, et al.
Pubblicazione: (2024)
di: Li, Wenjie, et al.
Pubblicazione: (2024)
Adaptive Pruning for Large Language Models with Structural Importance Awareness
di: Zheng, Haotian, et al.
Pubblicazione: (2024)
di: Zheng, Haotian, et al.
Pubblicazione: (2024)
Zero-Shot Defense Against Toxic Images via Inherent Multimodal Alignment in LVLMs
di: Zhao, Wei, et al.
Pubblicazione: (2025)
di: Zhao, Wei, et al.
Pubblicazione: (2025)
Automatic Adaptation Rule Optimization via Large Language Models
di: Ishimizu, Yusei, et al.
Pubblicazione: (2024)
di: Ishimizu, Yusei, et al.
Pubblicazione: (2024)
SAM Decoding: Speculative Decoding via Suffix Automaton
di: Hu, Yuxuan, et al.
Pubblicazione: (2024)
di: Hu, Yuxuan, et al.
Pubblicazione: (2024)
LBM: Hierarchical Large Auto-Bidding Model via Reasoning and Acting
di: Li, Yewen, et al.
Pubblicazione: (2026)
di: Li, Yewen, et al.
Pubblicazione: (2026)
AdamMeme: Adaptively Probe the Reasoning Capacity of Multimodal Large Language Models on Harmfulness
di: Chen, Zixin, et al.
Pubblicazione: (2025)
di: Chen, Zixin, et al.
Pubblicazione: (2025)
Leveraging Computerized Adaptive Testing for Cost-effective Evaluation of Large Language Models in Medical Benchmarking
di: Zheng, Tianpeng, et al.
Pubblicazione: (2026)
di: Zheng, Tianpeng, et al.
Pubblicazione: (2026)
IROTE: Human-like Traits Elicitation of Large Language Model via In-Context Self-Reflective Optimization
di: Bai, Yuzhuo, et al.
Pubblicazione: (2025)
di: Bai, Yuzhuo, et al.
Pubblicazione: (2025)
Reasoning before Comparison: LLM-Enhanced Semantic Similarity Metrics for Domain Specialized Text Analysis
di: Xu, Shaochen, et al.
Pubblicazione: (2024)
di: Xu, Shaochen, et al.
Pubblicazione: (2024)
Adaptive Tool Use in Large Language Models with Meta-Cognition Trigger
di: Li, Wenjun, et al.
Pubblicazione: (2025)
di: Li, Wenjun, et al.
Pubblicazione: (2025)
SynDec: A Synthesize-then-Decode Approach for Arbitrary Textual Style Transfer via Large Language Models
di: Sun, Han, et al.
Pubblicazione: (2025)
di: Sun, Han, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Backdoor Token Unlearning: Exposing and Defending Backdoors in Pretrained Language Models
di: Jiang, Peihai, et al.
Pubblicazione: (2025) -
Do Influence Functions Work on Large Language Models?
di: Li, Zhe, et al.
Pubblicazione: (2024) -
Unleashing the Unseen: Harnessing Benign Datasets for Jailbreaking Large Language Models
di: Zhao, Wei, et al.
Pubblicazione: (2024) -
CROW: Eliminating Backdoors from Large Language Models via Internal Consistency Regularization
di: Min, Nay Myat, et al.
Pubblicazione: (2024) -
Toward Understanding the Transferability of Adversarial Suffixes in Large Language Models
di: Ball, Sarah, et al.
Pubblicazione: (2025)