Latent Personality Alignment: Improving Harmlessness Without Mentioning Harms
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Le, Linh, Williams-King, David, Merzouk, Mohamed Amine, Kamanda, Aton, Oberman, Adam |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Can Safety Fine-Tuning Be More Principled? Lessons Learned from Cybersecurity
par: Williams-King, David, et autres
Publié: (2025)
par: Williams-King, David, et autres
Publié: (2025)
SciDMT: A Large-Scale Corpus for Detecting Scientific Mentions
par: Pan, Huitong, et autres
Publié: (2024)
par: Pan, Huitong, et autres
Publié: (2024)
Behavioural Analysis of Alignment Faking
par: Hadida, Nathaniel Mitrani, et autres
Publié: (2026)
par: Hadida, Nathaniel Mitrani, et autres
Publié: (2026)
RomanLens: The Role Of Latent Romanization In Multilinguality In LLMs
par: Saji, Alan, et autres
Publié: (2025)
par: Saji, Alan, et autres
Publié: (2025)
IdentifyMe: A Challenging Long-Context Mention Resolution Benchmark for LLMs
par: Manikantan, Kawshik, et autres
Publié: (2024)
par: Manikantan, Kawshik, et autres
Publié: (2024)
Adaptive Interviewing for Persona Simulation in LLMs: Evidence-Grounded Reasoning Improves Decision Alignment
par: Su, Ruoxi, et autres
Publié: (2026)
par: Su, Ruoxi, et autres
Publié: (2026)
Large Language Models as Oracles for Ontology Alignment
par: Lushnei, Sviatoslav, et autres
Publié: (2025)
par: Lushnei, Sviatoslav, et autres
Publié: (2025)
Text-Based Approaches to Item Difficulty Modeling in Large-Scale Assessments: A Systematic Review
par: Peters, Sydney, et autres
Publié: (2025)
par: Peters, Sydney, et autres
Publié: (2025)
Adversarial DPO: Harnessing Harmful Data for Reducing Toxicity with Minimal Impact on Coherence and Evasiveness in Dialogue Agents
par: Kim, San, et autres
Publié: (2024)
par: Kim, San, et autres
Publié: (2024)
Latent Planning Emerges with Scale
par: Hanna, Michael, et autres
Publié: (2026)
par: Hanna, Michael, et autres
Publié: (2026)
A dataset of questions on decision-theoretic reasoning in Newcomb-like problems
par: Oesterheld, Caspar, et autres
Publié: (2024)
par: Oesterheld, Caspar, et autres
Publié: (2024)
Breaking Free Transformer Models: Task-specific Context Attribution Promises Improved Generalizability Without Fine-tuning Pre-trained LLMs
par: Tytarenko, Stepan, et autres
Publié: (2024)
par: Tytarenko, Stepan, et autres
Publié: (2024)
ScrapMem: A Bio-inspired Framework for On-device Personalized Agent Memory via Optical Forgetting
par: Chang, Jiale, et autres
Publié: (2026)
par: Chang, Jiale, et autres
Publié: (2026)
Entropy-Based Measurement of Value Drift and Alignment Work in Large Language Models
par: Fadli, Samih
Publié: (2025)
par: Fadli, Samih
Publié: (2025)
RLM-on-KG: Heuristics First, LLMs When Needed: Adaptive Retrieval Control over Mention Graphs for Scattered Evidence
par: Volpini, Andrea, et autres
Publié: (2026)
par: Volpini, Andrea, et autres
Publié: (2026)
xInv: Explainable Optimization of Inverse Problems
par: Memery, Sean, et autres
Publié: (2025)
par: Memery, Sean, et autres
Publié: (2025)
Uncovering Latent Human Wellbeing in Language Model Embeddings
par: Freire, Pedro, et autres
Publié: (2024)
par: Freire, Pedro, et autres
Publié: (2024)
Super Suffixes: Bypassing Text Generation Alignment and Guard Models Simultaneously
par: Adiletta, Andrew, et autres
Publié: (2025)
par: Adiletta, Andrew, et autres
Publié: (2025)
PrivacyBench: A Conversational Benchmark for Evaluating Privacy in Personalized AI
par: Mukhopadhyay, Srija, et autres
Publié: (2025)
par: Mukhopadhyay, Srija, et autres
Publié: (2025)
Detecting Hallucinations in Graph Retrieval-Augmented Generation via Attention Patterns and Semantic Alignment
par: Li, Shanghao, et autres
Publié: (2025)
par: Li, Shanghao, et autres
Publié: (2025)
RIDE: Enhancing Large Language Model Alignment through Restyled In-Context Learning Demonstration Exemplars
par: Hua, Yuncheng, et autres
Publié: (2025)
par: Hua, Yuncheng, et autres
Publié: (2025)
Harmful Intent as a Geometrically Recoverable Feature of LLM Residual Streams
par: Llorente-Saguer, Isaac
Publié: (2026)
par: Llorente-Saguer, Isaac
Publié: (2026)
Evaluating the Efficacy of Hybrid Deep Learning Models in Distinguishing AI-Generated Text
par: Oketunji, Abiodun Finbarrs
Publié: (2023)
par: Oketunji, Abiodun Finbarrs
Publié: (2023)
Exemplar Retrieval Without Overhypothesis Induction: Limits of Distributional Sequence Learning in Early Word Learning
par: Cacioli, Jon-Paul
Publié: (2026)
par: Cacioli, Jon-Paul
Publié: (2026)
SOCIA-Nabla: Textual Gradient Meets Multi-Agent Orchestration for Automated Simulator Generation
par: Hua, Yuncheng, et autres
Publié: (2025)
par: Hua, Yuncheng, et autres
Publié: (2025)
ALAS: A Stateful Multi-LLM Agent Framework for Disruption-Aware Planning
par: Chang, Edward Y., et autres
Publié: (2025)
par: Chang, Edward Y., et autres
Publié: (2025)
Evaluating Steering Techniques using Human Similarity Judgments
par: Studdiford, Zach, et autres
Publié: (2025)
par: Studdiford, Zach, et autres
Publié: (2025)
Unlocking the Wisdom of Large Language Models: An Introduction to The Path to Artificial General Intelligence
par: Chang, Edward Y.
Publié: (2024)
par: Chang, Edward Y.
Publié: (2024)
Reasoning-Based AI for Startup Evaluation (R.A.I.S.E.): A Memory-Augmented, Multi-Step Decision Framework
par: Preuveneers, Jack, et autres
Publié: (2025)
par: Preuveneers, Jack, et autres
Publié: (2025)
Understanding LLM Evaluator Behavior: A Structured Multi-Evaluator Framework for Merchant Risk Assessment
par: Wang, Liang, et autres
Publié: (2026)
par: Wang, Liang, et autres
Publié: (2026)
RADD: Retrieval-Augmented Discrete Diffusion for Multi-Modal Knowledge Graph Completion
par: Niu, Guanglin, et autres
Publié: (2026)
par: Niu, Guanglin, et autres
Publié: (2026)
Quantifying Self-Preservation Bias in Large Language Models
par: Migliarini, Matteo, et autres
Publié: (2026)
par: Migliarini, Matteo, et autres
Publié: (2026)
Evaluating Relational Reasoning in LLMs with REL
par: Fesser, Lukas, et autres
Publié: (2026)
par: Fesser, Lukas, et autres
Publié: (2026)
KACE: Knowledge-Adaptive Context Engineering for Mathematical Reasoning
par: Parashar, Jayant, et autres
Publié: (2026)
par: Parashar, Jayant, et autres
Publié: (2026)
RAudit: A Blind Auditing Protocol for Large Language Model Reasoning
par: Chang, Edward Y., et autres
Publié: (2026)
par: Chang, Edward Y., et autres
Publié: (2026)
Towards ethical multimodal systems
par: Roger, Alexis, et autres
Publié: (2023)
par: Roger, Alexis, et autres
Publié: (2023)
AI-Powered Annotation Pipelines for Stabilizing Large Language Models: A Human-AI Synergy Approach
par: Pathak, Gangesh, et autres
Publié: (2025)
par: Pathak, Gangesh, et autres
Publié: (2025)
LLMs are Capable of Misaligned Behavior Under Explicit Prohibition and Surveillance
par: Ivanov, Igor
Publié: (2025)
par: Ivanov, Igor
Publié: (2025)
ToolWeaver: Weaving Collaborative Semantics for Scalable Tool Use in Large Language Models
par: Fang, Bowen, et autres
Publié: (2026)
par: Fang, Bowen, et autres
Publié: (2026)
PersistBench: When Should Long-Term Memories Be Forgotten by LLMs?
par: Pulipaka, Sidharth, et autres
Publié: (2026)
par: Pulipaka, Sidharth, et autres
Publié: (2026)
Documents similaires
-
Can Safety Fine-Tuning Be More Principled? Lessons Learned from Cybersecurity
par: Williams-King, David, et autres
Publié: (2025) -
SciDMT: A Large-Scale Corpus for Detecting Scientific Mentions
par: Pan, Huitong, et autres
Publié: (2024) -
Behavioural Analysis of Alignment Faking
par: Hadida, Nathaniel Mitrani, et autres
Publié: (2026) -
RomanLens: The Role Of Latent Romanization In Multilinguality In LLMs
par: Saji, Alan, et autres
Publié: (2025) -
IdentifyMe: A Challenging Long-Context Mention Resolution Benchmark for LLMs
par: Manikantan, Kawshik, et autres
Publié: (2024)