Context Engineering for Trustworthiness: Rescorla Wagner Steering Under Mixed and Inappropriate Contexts
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Rushi, Liu, Jiateng, Qian, Cheng, Shen, Yifan, Pan, Yanzhou, Xu, Zhaozhuo, Abbasi, Ahmed, Ji, Heng, Zhang, Denghui |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ISACL: Internal State Analyzer for Copyrighted Training Data Leakage
por: Zhang, Guangwei, et al.
Publicado: (2025)
por: Zhang, Guangwei, et al.
Publicado: (2025)
Augmenting Interface Usability Heuristics for Reliable Computer-Use Agents
por: Liu, Jiateng, et al.
Publicado: (2026)
por: Liu, Jiateng, et al.
Publicado: (2026)
Sensitivity Meets Sparsity: The Impact of Extremely Sparse Parameter Patterns on Theory-of-Mind of Large Language Models
por: Wu, Yuheng, et al.
Publicado: (2025)
por: Wu, Yuheng, et al.
Publicado: (2025)
Do LLMs Know to Respect Copyright Notice?
por: Xu, Jialiang, et al.
Publicado: (2024)
por: Xu, Jialiang, et al.
Publicado: (2024)
DEL-ToM: Inference-Time Scaling for Theory-of-Mind Reasoning via Dynamic Epistemic Logic
por: Wu, Yuheng, et al.
Publicado: (2025)
por: Wu, Yuheng, et al.
Publicado: (2025)
Copyright Detective: A Forensic System to Evidence LLMs Flickering Copyright Leakage Risks
por: Zhang, Guangwei, et al.
Publicado: (2026)
por: Zhang, Guangwei, et al.
Publicado: (2026)
Atomic Reasoning for Scientific Table Claim Verification
por: Zhang, Yuji, et al.
Publicado: (2025)
por: Zhang, Yuji, et al.
Publicado: (2025)
Monadic Context Engineering
por: Zhang, Yifan, et al.
Publicado: (2025)
por: Zhang, Yifan, et al.
Publicado: (2025)
Measuring Copyright Risks of Large Language Model via Partial Information Probing
por: Zhao, Weijie, et al.
Publicado: (2024)
por: Zhao, Weijie, et al.
Publicado: (2024)
Automating Financial Statement Audits with Large Language Models
por: Wang, Rushi, et al.
Publicado: (2025)
por: Wang, Rushi, et al.
Publicado: (2025)
Language Steering for Multilingual In-Context Learning
por: Kirtane, Neeraja, et al.
Publicado: (2026)
por: Kirtane, Neeraja, et al.
Publicado: (2026)
Context Engineering 2.0: The Context of Context Engineering
por: Hua, Qishuo, et al.
Publicado: (2025)
por: Hua, Qishuo, et al.
Publicado: (2025)
Beyond Reactive Safety: Risk-Aware LLM Alignment via Long-Horizon Simulation
por: Sun, Chenkai, et al.
Publicado: (2025)
por: Sun, Chenkai, et al.
Publicado: (2025)
LLMSteer: Improving Long-Context LLM Inference by Steering Attention on Reused Contexts
por: Gu, Zhuohan, et al.
Publicado: (2024)
por: Gu, Zhuohan, et al.
Publicado: (2024)
Context Steering: Controllable Personalization at Inference Time
por: He, Jerry Zhi-Yang, et al.
Publicado: (2024)
por: He, Jerry Zhi-Yang, et al.
Publicado: (2024)
Haystack Engineering: Context Engineering for Heterogeneous and Agentic Long-Context Evaluation
por: Li, Mufei, et al.
Publicado: (2025)
por: Li, Mufei, et al.
Publicado: (2025)
Conversational Context Classification: A Representation Engineering Approach
por: Pan, Jonathan
Publicado: (2026)
por: Pan, Jonathan
Publicado: (2026)
Contexting as Recommendation: Evolutionary Collaborative Filtering for Context Engineering
por: Zhu, Jiachen, et al.
Publicado: (2026)
por: Zhu, Jiachen, et al.
Publicado: (2026)
Steering Multimodal Large Language Models Decoding for Context-Aware Safety
por: Liu, Zheyuan, et al.
Publicado: (2025)
por: Liu, Zheyuan, et al.
Publicado: (2025)
Psychological Steering in LLMs: An Evaluation of Effectiveness and Trustworthiness
por: Banayeeanzade, Amin, et al.
Publicado: (2025)
por: Banayeeanzade, Amin, et al.
Publicado: (2025)
EVEDIT: Event-based Knowledge Editing with Deductive Editing Boundaries
por: Liu, Jiateng, et al.
Publicado: (2024)
por: Liu, Jiateng, et al.
Publicado: (2024)
OSExpert: Computer-Use Agents Learning Professional Skills via Exploration
por: Liu, Jiateng, et al.
Publicado: (2026)
por: Liu, Jiateng, et al.
Publicado: (2026)
Identifying Cooperative Personalities in Multi-agent Contexts through Personality Steering with Representation Engineering
por: Ong, Kenneth J. K., et al.
Publicado: (2025)
por: Ong, Kenneth J. K., et al.
Publicado: (2025)
COMPASS: Context-Modulated PID Attention Steering System for Hallucination Mitigation
por: Sahay, Kenji, et al.
Publicado: (2025)
por: Sahay, Kenji, et al.
Publicado: (2025)
Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models
por: Zhang, Qizheng, et al.
Publicado: (2025)
por: Zhang, Qizheng, et al.
Publicado: (2025)
LongReason: A Synthetic Long-Context Reasoning Benchmark via Context Expansion
por: Ling, Zhan, et al.
Publicado: (2025)
por: Ling, Zhan, et al.
Publicado: (2025)
SafeSwitch: Steering Unsafe LLM Behavior via Internal Activation Signals
por: Han, Peixuan, et al.
Publicado: (2025)
por: Han, Peixuan, et al.
Publicado: (2025)
OpenGenAlign: A Preference Dataset and Benchmark for Trustworthy Reward Modeling in Open-Ended, Long-Context Generation
por: Zhang, Hanning, et al.
Publicado: (2025)
por: Zhang, Hanning, et al.
Publicado: (2025)
A Global Context Mechanism for Sequence Labeling
por: Xu, Conglei, et al.
Publicado: (2023)
por: Xu, Conglei, et al.
Publicado: (2023)
SpecSteer: Synergizing Local Context and Global Reasoning for Efficient Personalized Generation
por: Lv, Hang, et al.
Publicado: (2026)
por: Lv, Hang, et al.
Publicado: (2026)
Rethinking Visual Neglect: Steering via Context-Preference for MLLM Hallucination Mitigation
por: Wu, Jingwen, et al.
Publicado: (2026)
por: Wu, Jingwen, et al.
Publicado: (2026)
ALinFiK: Learning to Approximate Linearized Future Influence Kernel for Scalable Third-Party LLM Data Valuation
por: Pan, Yanzhou, et al.
Publicado: (2025)
por: Pan, Yanzhou, et al.
Publicado: (2025)
COLD-Steer: Steering Large Language Models via In-Context One-step Learning Dynamics
por: Sharma, Kartik, et al.
Publicado: (2026)
por: Sharma, Kartik, et al.
Publicado: (2026)
Understanding Emergent In-Context Learning from a Kernel Regression Perspective
por: Han, Chi, et al.
Publicado: (2023)
por: Han, Chi, et al.
Publicado: (2023)
MiCRo: Mixture Modeling and Context-aware Routing for Personalized Preference Learning
por: Shen, Jingyan, et al.
Publicado: (2025)
por: Shen, Jingyan, et al.
Publicado: (2025)
Sentinel: Decoding Context Utilization via Attention Probing for Efficient LLM Context Compression
por: Zhang, Yong, et al.
Publicado: (2025)
por: Zhang, Yong, et al.
Publicado: (2025)
Fix the Structural Bottleneck: Context Compression via Explicit Information Transmission
por: Ye, Jiangnan, et al.
Publicado: (2026)
por: Ye, Jiangnan, et al.
Publicado: (2026)
Steering Vector Fields for Context-Aware Inference-Time Control in Large Language Models
por: Li, Jiaqian, et al.
Publicado: (2026)
por: Li, Jiaqian, et al.
Publicado: (2026)
Local and Global Contexts for Conversation
por: Lin, Zuoquan, et al.
Publicado: (2024)
por: Lin, Zuoquan, et al.
Publicado: (2024)
Belief Dynamics Reveal the Dual Nature of In-Context Learning and Activation Steering
por: Bigelow, Eric, et al.
Publicado: (2025)
por: Bigelow, Eric, et al.
Publicado: (2025)
Ejemplares similares
-
ISACL: Internal State Analyzer for Copyrighted Training Data Leakage
por: Zhang, Guangwei, et al.
Publicado: (2025) -
Augmenting Interface Usability Heuristics for Reliable Computer-Use Agents
por: Liu, Jiateng, et al.
Publicado: (2026) -
Sensitivity Meets Sparsity: The Impact of Extremely Sparse Parameter Patterns on Theory-of-Mind of Large Language Models
por: Wu, Yuheng, et al.
Publicado: (2025) -
Do LLMs Know to Respect Copyright Notice?
por: Xu, Jialiang, et al.
Publicado: (2024) -
DEL-ToM: Inference-Time Scaling for Theory-of-Mind Reasoning via Dynamic Epistemic Logic
por: Wu, Yuheng, et al.
Publicado: (2025)