Steer Model beyond Assistant: Controlling System Prompt Strength via Contrastive Decoding
Fuente:
arXiv
Salvato in:
| Autori principali: | Dong, Yijiang River, Hu, Tiancheng, Hui, Zheng, Collier, Nigel |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Can LLM be a Personalized Judge?
di: Dong, Yijiang River, et al.
Pubblicazione: (2024)
di: Dong, Yijiang River, et al.
Pubblicazione: (2024)
When Personalization Meets Reality: A Multi-Faceted Analysis of Personalized Preference Learning
di: Dong, Yijiang River, et al.
Pubblicazione: (2025)
di: Dong, Yijiang River, et al.
Pubblicazione: (2025)
TRIDENT: Benchmarking LLM Safety in Finance, Medicine, and Law
di: Hui, Zheng, et al.
Pubblicazione: (2025)
di: Hui, Zheng, et al.
Pubblicazione: (2025)
Value of Information: A Framework for Human-Agent Communication
di: Dong, Yijiang River, et al.
Pubblicazione: (2026)
di: Dong, Yijiang River, et al.
Pubblicazione: (2026)
Privacy-R1: Privacy-Aware Multi-LLM Agent Collaboration via Reinforcement Learning
di: Hui, Zheng, et al.
Pubblicazione: (2025)
di: Hui, Zheng, et al.
Pubblicazione: (2025)
iNews: A Multimodal Dataset for Modeling Personalized Affective Responses to News
di: Hu, Tiancheng, et al.
Pubblicazione: (2025)
di: Hu, Tiancheng, et al.
Pubblicazione: (2025)
Confidence Estimation for LLMs in Multi-turn Interactions
di: Zhang, Caiqi, et al.
Pubblicazione: (2026)
di: Zhang, Caiqi, et al.
Pubblicazione: (2026)
Quantifying the Persona Effect in LLM Simulations
di: Hu, Tiancheng, et al.
Pubblicazione: (2024)
di: Hu, Tiancheng, et al.
Pubblicazione: (2024)
Navigating the Alignment-Calibration Trade-off: A Pareto-Superior Frontier via Model Merging
di: Hu, Tiancheng, et al.
Pubblicazione: (2025)
di: Hu, Tiancheng, et al.
Pubblicazione: (2025)
Attention Instruction: Amplifying Attention in the Middle via Prompting
di: Zhang, Meiru, et al.
Pubblicazione: (2024)
di: Zhang, Meiru, et al.
Pubblicazione: (2024)
500xCompressor: Generalized Prompt Compression for Large Language Models
di: Li, Zongqian, et al.
Pubblicazione: (2024)
di: Li, Zongqian, et al.
Pubblicazione: (2024)
A Survey on Prompt Tuning
di: Li, Zongqian, et al.
Pubblicazione: (2025)
di: Li, Zongqian, et al.
Pubblicazione: (2025)
Prompt Compression for Large Language Models: A Survey
di: Li, Zongqian, et al.
Pubblicazione: (2024)
di: Li, Zongqian, et al.
Pubblicazione: (2024)
PT-MoE: An Efficient Finetuning Framework for Integrating Mixture-of-Experts into Prompt Tuning
di: Li, Zongqian, et al.
Pubblicazione: (2025)
di: Li, Zongqian, et al.
Pubblicazione: (2025)
Generative Language Models Exhibit Social Identity Biases
di: Hu, Tiancheng, et al.
Pubblicazione: (2023)
di: Hu, Tiancheng, et al.
Pubblicazione: (2023)
Beyond the Final Layer: Intermediate Representations for Better Multilingual Calibration in Large Language Models
di: Zhou, Ej, et al.
Pubblicazione: (2025)
di: Zhou, Ej, et al.
Pubblicazione: (2025)
SimBench: Benchmarking the Ability of Large Language Models to Simulate Human Behaviors
di: Hu, Tiancheng, et al.
Pubblicazione: (2025)
di: Hu, Tiancheng, et al.
Pubblicazione: (2025)
UNDIAL: Self-Distillation with Adjusted Logits for Robust Unlearning in Large Language Models
di: Dong, Yijiang River, et al.
Pubblicazione: (2024)
di: Dong, Yijiang River, et al.
Pubblicazione: (2024)
PiVe: Prompting with Iterative Verification Improving Graph-based Generative Capability of LLMs
di: Han, Jiuzhou, et al.
Pubblicazione: (2023)
di: Han, Jiuzhou, et al.
Pubblicazione: (2023)
COFFEE: A Contrastive Oracle-Free Framework for Event Extraction
di: Zhang, Meiru, et al.
Pubblicazione: (2023)
di: Zhang, Meiru, et al.
Pubblicazione: (2023)
Improving Word Translation via Two-Stage Contrastive Learning
di: Li, Yaoyiran, et al.
Pubblicazione: (2022)
di: Li, Yaoyiran, et al.
Pubblicazione: (2022)
Unlocking Decoding-time Controllability: Gradient-Free Multi-Objective Alignment with Contrastive Prompts
di: Fu, Tingchen, et al.
Pubblicazione: (2024)
di: Fu, Tingchen, et al.
Pubblicazione: (2024)
Time to Revist Exact Match
di: Abbood, Auss, et al.
Pubblicazione: (2025)
di: Abbood, Auss, et al.
Pubblicazione: (2025)
Contrastive Prompting Enhances Sentence Embeddings in LLMs through Inference-Time Steering
di: Cheng, Zifeng, et al.
Pubblicazione: (2025)
di: Cheng, Zifeng, et al.
Pubblicazione: (2025)
Multi-agent AI systems outperform human teams in creativity
di: Hu, Tiancheng, et al.
Pubblicazione: (2026)
di: Hu, Tiancheng, et al.
Pubblicazione: (2026)
Towards Understanding Steering Strength
di: Taimeskhanov, Magamed, et al.
Pubblicazione: (2026)
di: Taimeskhanov, Magamed, et al.
Pubblicazione: (2026)
Speculative Contrastive Decoding
di: Yuan, Hongyi, et al.
Pubblicazione: (2023)
di: Yuan, Hongyi, et al.
Pubblicazione: (2023)
Fusion Steering: Prompt-Specific Activation Control
di: Chang, Waldemar, et al.
Pubblicazione: (2025)
di: Chang, Waldemar, et al.
Pubblicazione: (2025)
CoSteer: Collaborative Decoding-Time Personalization via Local Delta Steering
di: Lv, Hang, et al.
Pubblicazione: (2025)
di: Lv, Hang, et al.
Pubblicazione: (2025)
ReasonGraph: Visualisation of Reasoning Paths
di: Li, Zongqian, et al.
Pubblicazione: (2025)
di: Li, Zongqian, et al.
Pubblicazione: (2025)
All Roads Lead to Rome: Graph-Based Confidence Estimation for Large Language Model Reasoning
di: Zhang, Caiqi, et al.
Pubblicazione: (2025)
di: Zhang, Caiqi, et al.
Pubblicazione: (2025)
LUQ: Long-text Uncertainty Quantification for LLMs
di: Zhang, Caiqi, et al.
Pubblicazione: (2024)
di: Zhang, Caiqi, et al.
Pubblicazione: (2024)
Unlocking Structure Measuring: Introducing PDD, an Automatic Metric for Positional Discourse Coherence
di: Liu, Yinhong, et al.
Pubblicazione: (2024)
di: Liu, Yinhong, et al.
Pubblicazione: (2024)
TOAD: Task-Oriented Automatic Dialogs with Diverse Response Styles
di: Liu, Yinhong, et al.
Pubblicazione: (2024)
di: Liu, Yinhong, et al.
Pubblicazione: (2024)
Gradient-Controlled Decoding: A Safety Guardrail for LLMs with Dual-Anchor Steering
di: Chiniya, Purva, et al.
Pubblicazione: (2026)
di: Chiniya, Purva, et al.
Pubblicazione: (2026)
Mitigating Hallucinations of Large Language Models in Medical Information Extraction via Contrastive Decoding
di: Xu, Derong, et al.
Pubblicazione: (2024)
di: Xu, Derong, et al.
Pubblicazione: (2024)
Conformity in Large Language Models
di: Zhu, Xiaochen, et al.
Pubblicazione: (2024)
di: Zhu, Xiaochen, et al.
Pubblicazione: (2024)
ROSE Doesn't Do That: Boosting the Safety of Instruction-Tuned Large Language Models with Reverse Prompt Contrastive Decoding
di: Zhong, Qihuang, et al.
Pubblicazione: (2024)
di: Zhong, Qihuang, et al.
Pubblicazione: (2024)
Generalization or Memorization: Dynamic Decoding for Mode Steering
di: Zhang, Xuanming
Pubblicazione: (2025)
di: Zhang, Xuanming
Pubblicazione: (2025)
Personalized Text Generation with Contrastive Activation Steering
di: Zhang, Jinghao, et al.
Pubblicazione: (2025)
di: Zhang, Jinghao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Can LLM be a Personalized Judge?
di: Dong, Yijiang River, et al.
Pubblicazione: (2024) -
When Personalization Meets Reality: A Multi-Faceted Analysis of Personalized Preference Learning
di: Dong, Yijiang River, et al.
Pubblicazione: (2025) -
TRIDENT: Benchmarking LLM Safety in Finance, Medicine, and Law
di: Hui, Zheng, et al.
Pubblicazione: (2025) -
Value of Information: A Framework for Human-Agent Communication
di: Dong, Yijiang River, et al.
Pubblicazione: (2026) -
Privacy-R1: Privacy-Aware Multi-LLM Agent Collaboration via Reinforcement Learning
di: Hui, Zheng, et al.
Pubblicazione: (2025)