Tiny Refinements Elicit Resilience: Toward Efficient Prefix-Model Against LLM Red-Teaming
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Jiaxu, Yin, Xiangyu, Wu, Sihao, Wang, Jianhong, Fang, Meng, Yi, Xinping, Huang, Xiaowei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Robust RL with LLM-Driven Data Synthesis and Policy Adaptation for Autonomous Driving
di: Wu, Sihao, et al.
Pubblicazione: (2024)
di: Wu, Sihao, et al.
Pubblicazione: (2024)
Continuous Geometry-Aware Graph Diffusion via Hyperbolic Neural PDE
di: Liu, Jiaxu, et al.
Pubblicazione: (2024)
di: Liu, Jiaxu, et al.
Pubblicazione: (2024)
DeepHGCN: Toward Deeper Hyperbolic Graph Convolutional Networks
di: Liu, Jiaxu, et al.
Pubblicazione: (2023)
di: Liu, Jiaxu, et al.
Pubblicazione: (2023)
Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models
di: Wu, Sihao, et al.
Pubblicazione: (2025)
di: Wu, Sihao, et al.
Pubblicazione: (2025)
TroubleLLM: Align to Red Team Expert
di: Xu, Zhuoer, et al.
Pubblicazione: (2024)
di: Xu, Zhuoer, et al.
Pubblicazione: (2024)
Against The Achilles' Heel: A Survey on Red Teaming for Generative Models
di: Lin, Lizhi, et al.
Pubblicazione: (2024)
di: Lin, Lizhi, et al.
Pubblicazione: (2024)
Prefix Text as a Yarn: Eliciting Non-English Alignment in Foundation Language Model
di: Zhan, Runzhe, et al.
Pubblicazione: (2024)
di: Zhan, Runzhe, et al.
Pubblicazione: (2024)
Automated Progressive Red Teaming
di: Jiang, Bojian, et al.
Pubblicazione: (2024)
di: Jiang, Bojian, et al.
Pubblicazione: (2024)
Tiny Model, Big Logic: Diversity-Driven Optimization Elicits Large-Model Reasoning Ability in VibeThinker-1.5B
di: Xu, Sen, et al.
Pubblicazione: (2025)
di: Xu, Sen, et al.
Pubblicazione: (2025)
PrefixQuant: Eliminating Outliers by Prefixed Tokens for Large Language Models Quantization
di: Chen, Mengzhao, et al.
Pubblicazione: (2024)
di: Chen, Mengzhao, et al.
Pubblicazione: (2024)
RedTopic: Toward Topic-Diverse Red Teaming of Large Language Models
di: Ding, Jiale, et al.
Pubblicazione: (2025)
di: Ding, Jiale, et al.
Pubblicazione: (2025)
LLM-TOPLA: Efficient LLM Ensemble by Maximising Diversity
di: Tekin, Selim Furkan, et al.
Pubblicazione: (2024)
di: Tekin, Selim Furkan, et al.
Pubblicazione: (2024)
Symplectic Structure-Aware Hamiltonian (Graph) Embeddings
di: Liu, Jiaxu, et al.
Pubblicazione: (2023)
di: Liu, Jiaxu, et al.
Pubblicazione: (2023)
Red Teaming Visual Language Models
di: Li, Mukai, et al.
Pubblicazione: (2024)
di: Li, Mukai, et al.
Pubblicazione: (2024)
One Refiner to Unlock Them All: Inference-Time Reasoning Elicitation via Reinforcement Query Refinement
di: Zhou, Yixiao, et al.
Pubblicazione: (2026)
di: Zhou, Yixiao, et al.
Pubblicazione: (2026)
Detecting Prefix Bias in LLM-based Reward Models
di: Kumar, Ashwin, et al.
Pubblicazione: (2025)
di: Kumar, Ashwin, et al.
Pubblicazione: (2025)
TeamLLM: A Human-Like Team-Oriented Collaboration Framework for Multi-Step Contextualized Tasks
di: Wang, Xiangyu, et al.
Pubblicazione: (2026)
di: Wang, Xiangyu, et al.
Pubblicazione: (2026)
STAR-Teaming: A Strategy-Response Multiplex Network Approach to Automated LLM Red Teaming
di: Jung, MinJae, et al.
Pubblicazione: (2026)
di: Jung, MinJae, et al.
Pubblicazione: (2026)
Prompt Optimization and Evaluation for LLM Automated Red Teaming
di: Freenor, Michael, et al.
Pubblicazione: (2025)
di: Freenor, Michael, et al.
Pubblicazione: (2025)
Red Teaming Language Models for Processing Contradictory Dialogues
di: Wen, Xiaofei, et al.
Pubblicazione: (2024)
di: Wen, Xiaofei, et al.
Pubblicazione: (2024)
RedTWIZ: Diverse LLM Red Teaming via Adaptive Attack Planning
di: Horal, Artur, et al.
Pubblicazione: (2025)
di: Horal, Artur, et al.
Pubblicazione: (2025)
FALCON: Fine-grained Activation Manipulation by Contrastive Orthogonal Unalignment for Large Language Model
di: Hu, Jinwei, et al.
Pubblicazione: (2025)
di: Hu, Jinwei, et al.
Pubblicazione: (2025)
Path-Consistency with Prefix Enhancement for Efficient Inference in LLMs
di: Zhu, Jiace, et al.
Pubblicazione: (2024)
di: Zhu, Jiace, et al.
Pubblicazione: (2024)
SIRAJ: Diverse and Efficient Red-Teaming for LLM Agents via Distilled Structured Reasoning
di: Zhou, Kaiwen, et al.
Pubblicazione: (2025)
di: Zhou, Kaiwen, et al.
Pubblicazione: (2025)
Towards Red Teaming in Multimodal and Multilingual Translation
di: Ropers, Christophe, et al.
Pubblicazione: (2024)
di: Ropers, Christophe, et al.
Pubblicazione: (2024)
Integrating Object Detection Modality into Visual Language Model for Enhanced Autonomous Driving Agent
di: He, Linfeng, et al.
Pubblicazione: (2024)
di: He, Linfeng, et al.
Pubblicazione: (2024)
Gradient-Based Language Model Red Teaming
di: Wichers, Nevan, et al.
Pubblicazione: (2024)
di: Wichers, Nevan, et al.
Pubblicazione: (2024)
Self-Control of LLM Behaviors by Compressing Suffix Gradient into Prefix Controller
di: Cai, Min, et al.
Pubblicazione: (2024)
di: Cai, Min, et al.
Pubblicazione: (2024)
SafeSearch: Automated Red-Teaming of LLM-Based Search Agents
di: Dong, Jianshuo, et al.
Pubblicazione: (2025)
di: Dong, Jianshuo, et al.
Pubblicazione: (2025)
Resource Consumption Red-Teaming for Large Vision-Language Models
di: Gao, Haoran, et al.
Pubblicazione: (2025)
di: Gao, Haoran, et al.
Pubblicazione: (2025)
Speech Prefix-Tuning with RNNT Loss for Improving LLM Predictions
di: Baskar, Murali Karthick, et al.
Pubblicazione: (2024)
di: Baskar, Murali Karthick, et al.
Pubblicazione: (2024)
HateTinyLLM : Hate Speech Detection Using Tiny Large Language Models
di: Sen, Tanmay, et al.
Pubblicazione: (2024)
di: Sen, Tanmay, et al.
Pubblicazione: (2024)
From Large to Tiny: Distilling and Refining Mathematical Expertise for Math Word Problems with Weakly Supervision
di: Lin, Qingwen, et al.
Pubblicazione: (2024)
di: Lin, Qingwen, et al.
Pubblicazione: (2024)
Towards Infinite-Long Prefix in Transformer
di: Liang, Yingyu, et al.
Pubblicazione: (2024)
di: Liang, Yingyu, et al.
Pubblicazione: (2024)
CeTAD: Towards Certified Toxicity-Aware Distance in Vision Language Models
di: Yin, Xiangyu, et al.
Pubblicazione: (2025)
di: Yin, Xiangyu, et al.
Pubblicazione: (2025)
Toxicity Red-Teaming: Benchmarking LLM Safety in Singapore's Low-Resource Languages
di: Hu, Yujia, et al.
Pubblicazione: (2025)
di: Hu, Yujia, et al.
Pubblicazione: (2025)
PAT: Accelerating LLM Decoding via Prefix-Aware Attention with Resource Efficient Multi-Tile Kernel
di: Yi, Jinjun, et al.
Pubblicazione: (2025)
di: Yi, Jinjun, et al.
Pubblicazione: (2025)
Adaptive Instruction Composition for Automated LLM Red-Teaming
di: Zymet, Jesse, et al.
Pubblicazione: (2026)
di: Zymet, Jesse, et al.
Pubblicazione: (2026)
Red-Bandit: Test-Time Adaptation for LLM Red-Teaming via Bandit-Guided LoRA Experts
di: Ziakas, Christos, et al.
Pubblicazione: (2025)
di: Ziakas, Christos, et al.
Pubblicazione: (2025)
HintMR: Eliciting Stronger Mathematical Reasoning in Small Language Models
di: Hossain, Jawad, et al.
Pubblicazione: (2026)
di: Hossain, Jawad, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Robust RL with LLM-Driven Data Synthesis and Policy Adaptation for Autonomous Driving
di: Wu, Sihao, et al.
Pubblicazione: (2024) -
Continuous Geometry-Aware Graph Diffusion via Hyperbolic Neural PDE
di: Liu, Jiaxu, et al.
Pubblicazione: (2024) -
DeepHGCN: Toward Deeper Hyperbolic Graph Convolutional Networks
di: Liu, Jiaxu, et al.
Pubblicazione: (2023) -
Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models
di: Wu, Sihao, et al.
Pubblicazione: (2025) -
TroubleLLM: Align to Red Team Expert
di: Xu, Zhuoer, et al.
Pubblicazione: (2024)