Representation Engineering for Large-Language Models: Survey and Research Challenges
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Bartoszcze, Lukasz, Munshi, Sarthak, Sukidi, Bryan, Yen, Jennifer, Yang, Zejia, Williams-King, David, Le, Linh, Asuzu, Kosi, Maple, Carsten |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Representation Noising: A Defence Mechanism Against Harmful Finetuning
par: Rosati, Domenic, et autres
Publié: (2024)
par: Rosati, Domenic, et autres
Publié: (2024)
Immunization against harmful fine-tuning attacks
par: Rosati, Domenic, et autres
Publié: (2024)
par: Rosati, Domenic, et autres
Publié: (2024)
Can Safety Fine-Tuning Be More Principled? Lessons Learned from Cybersecurity
par: Williams-King, David, et autres
Publié: (2025)
par: Williams-King, David, et autres
Publié: (2025)
Taxonomy, Opportunities, and Challenges of Representation Engineering for Large Language Models
par: Wehner, Jan, et autres
Publié: (2025)
par: Wehner, Jan, et autres
Publié: (2025)
Individualised Counterfactual Examples Using Conformal Prediction Intervals
par: Adams, James M., et autres
Publié: (2025)
par: Adams, James M., et autres
Publié: (2025)
Single-Configuration Attack Success Rate Is Not Enough: Jailbreak Evaluations Should Report Distributional Attack Success
par: Maple, Carsten, et autres
Publié: (2026)
par: Maple, Carsten, et autres
Publié: (2026)
Faithful or Fabricated? A Causal Framework for Rationalization Bias in LLM Judges
par: Tapwal, Riya, et autres
Publié: (2026)
par: Tapwal, Riya, et autres
Publié: (2026)
PRISM: Generation-Time Detection and Mitigation of Secret Leakage in Multi-Agent LLM Pipelines
par: Tapwal, Riya, et autres
Publié: (2026)
par: Tapwal, Riya, et autres
Publié: (2026)
Justified Evidence Collection for Argument-based AI Fairness Assurance
par: Sabuncuoglu, Alpay, et autres
Publié: (2025)
par: Sabuncuoglu, Alpay, et autres
Publié: (2025)
Towards Robust Federated Analytics via Differentially Private Measurements of Statistical Heterogeneity
par: Scott, Mary, et autres
Publié: (2024)
par: Scott, Mary, et autres
Publié: (2024)
Private Federated Multiclass Post-hoc Calibration
par: Maddock, Samuel, et autres
Publié: (2025)
par: Maddock, Samuel, et autres
Publié: (2025)
FLAIM: AIM-based Synthetic Data Generation in the Federated Setting
par: Maddock, Samuel, et autres
Publié: (2023)
par: Maddock, Samuel, et autres
Publié: (2023)
DriveSafe: A Hierarchical Risk Taxonomy for Safety-Critical LLM-Based Driving Assistants
par: Kumar, Abhishek, et autres
Publié: (2026)
par: Kumar, Abhishek, et autres
Publié: (2026)
Audio Computer-Assisted Self Interview Compared to Traditional Interview in an HIV-Related Behavioral Survey in Vietnam
par: Linh Cu Le
Publié: (2012)
par: Linh Cu Le
Publié: (2012)
Latent Personality Alignment: Improving Harmlessness Without Mentioning Harms
par: Le, Linh, et autres
Publié: (2026)
par: Le, Linh, et autres
Publié: (2026)
Threat, Risk and Mitigation Taxonomy for Digital Identity Systems
par: SHEIK, AL TARIQ, et autres
Publié: (2024)
par: SHEIK, AL TARIQ, et autres
Publié: (2024)
LearnedCache: An eBPF-Integrated Perceptron-Based Eviction Policy for the Linux Page Cache
par: Qi, Zejia
Publié: (2026)
par: Qi, Zejia
Publié: (2026)
Towards Smart Healthcare: Challenges and Opportunities in IoT and ML
par: Saifuzzaman, Munshi, et autres
Publié: (2023)
par: Saifuzzaman, Munshi, et autres
Publié: (2023)
Large Language Models and the Rationalist Empiricist Debate
par: King, David
Publié: (2024)
par: King, David
Publié: (2024)
Differentially Private Health Tokens for Estimating COVID-19 Risk
par: Butler, David, et autres
Publié: (2020)
par: Butler, David, et autres
Publié: (2020)
Data-Agnostic Face Image Synthesis Detection Using Bayesian CNNs
par: Leyva, Roberto, et autres
Publié: (2024)
par: Leyva, Roberto, et autres
Publié: (2024)
Operationalising Artificial Intelligence Bills of Materials (AIBOMs) for Verifiable AI Provenance and Lifecycle Assurance
par: Radanliev, Petar, et autres
Publié: (2026)
par: Radanliev, Petar, et autres
Publié: (2026)
Distributed, communication-efficient, and differentially private estimation of KL divergence
par: Scott, Mary, et autres
Publié: (2024)
par: Scott, Mary, et autres
Publié: (2024)
SBOMs into Agentic AIBOMs: Schema Extensions, Agentic Orchestration, and Reproducibility Evaluation
par: Radanliev, Petar, et autres
Publié: (2026)
par: Radanliev, Petar, et autres
Publié: (2026)
Field-Localized Forgery Detection for Digital Identity Documents
par: Kumar, Abhishek, et autres
Publié: (2026)
par: Kumar, Abhishek, et autres
Publié: (2026)
Detecting Face Synthesis Using a Concealed Fusion Model
par: Leyva, Roberto, et autres
Publié: (2024)
par: Leyva, Roberto, et autres
Publié: (2024)
SRA: Span Representation Alignment for Large Language Model Distillation
par: Dao, Quoc Phong, et autres
Publié: (2026)
par: Dao, Quoc Phong, et autres
Publié: (2026)
acad_recuperation_joueurs_exclus_fr-ca
par: Maple, Kevon
Publié: (2026)
par: Maple, Kevon
Publié: (2026)
acad_self_excluded_player_recovery_en-ca
par: Maple, Kevon
Publié: (2026)
par: Maple, Kevon
Publié: (2026)
acad_dispute_resolution_handbook_bilingual_fr-ca
par: Maple, Kevon
Publié: (2026)
par: Maple, Kevon
Publié: (2026)
acad_rg_resource_compendium_bilingual_fr-ca
par: Maple, Kevon
Publié: (2026)
par: Maple, Kevon
Publié: (2026)
acad_withdrawal_caps_high_rollers_en-ca
par: Maple, Kevon
Publié: (2026)
par: Maple, Kevon
Publié: (2026)
acad_trustpilot_casinos_quebecois_fr-ca
par: Maple, Kevon
Publié: (2026)
par: Maple, Kevon
Publié: (2026)
Refugee Reception in Southern Africa
par: Maple, Nicholas
Publié: (2024)
par: Maple, Nicholas
Publié: (2024)
Manifold of Failure: Behavioral Attraction Basins in Language Models
par: Munshi, Sarthak, et autres
Publié: (2026)
par: Munshi, Sarthak, et autres
Publié: (2026)
Empirical and Sustainability Aspects of Software Engineering Research in the Era of Large Language Models: A Reflection
par: Williams, David, et autres
Publié: (2025)
par: Williams, David, et autres
Publié: (2025)
ACSE-Eval: Can LLMs threat model real-world cloud infrastructure?
par: Munshi, Sarthak, et autres
Publié: (2025)
par: Munshi, Sarthak, et autres
Publié: (2025)
Software Engineering for Large Language Models: Research Status, Challenges and the Road Ahead
par: Rao, Hongzhou, et autres
Publié: (2025)
par: Rao, Hongzhou, et autres
Publié: (2025)
A Game-Theoretic Approach for PMU Deployment Against False Data Injection Attacks
par: Maleki, Sajjad, et autres
Publié: (2024)
par: Maleki, Sajjad, et autres
Publié: (2024)
A privacy preserving querying mechanism with high utility for electric vehicles
par: Atmaca, Ugur Ilker, et autres
Publié: (2022)
par: Atmaca, Ugur Ilker, et autres
Publié: (2022)
Documents similaires
-
Representation Noising: A Defence Mechanism Against Harmful Finetuning
par: Rosati, Domenic, et autres
Publié: (2024) -
Immunization against harmful fine-tuning attacks
par: Rosati, Domenic, et autres
Publié: (2024) -
Can Safety Fine-Tuning Be More Principled? Lessons Learned from Cybersecurity
par: Williams-King, David, et autres
Publié: (2025) -
Taxonomy, Opportunities, and Challenges of Representation Engineering for Large Language Models
par: Wehner, Jan, et autres
Publié: (2025) -
Individualised Counterfactual Examples Using Conformal Prediction Intervals
par: Adams, James M., et autres
Publié: (2025)