Taxonomy, Opportunities, and Challenges of Representation Engineering for Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Wehner, Jan, Abdelnabi, Sahar, Tan, Daniel, Krueger, David, Fritz, Mario |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Cooperation, Competition, and Maliciousness: LLM-Stakeholders Interactive Negotiation
por: Abdelnabi, Sahar, et al.
Publicado: (2023)
por: Abdelnabi, Sahar, et al.
Publicado: (2023)
Can LLMs Separate Instructions From Data? And What Do We Even Mean By That?
por: Zverev, Egor, et al.
Publicado: (2024)
por: Zverev, Egor, et al.
Publicado: (2024)
AutoML in the Age of Large Language Models: Current Challenges, Future Opportunities and Risks
por: Tornede, Alexander, et al.
Publicado: (2023)
por: Tornede, Alexander, et al.
Publicado: (2023)
Context-Aware Reasoning On Parametric Knowledge for Inferring Causal Variables
por: Sheth, Ivaxi, et al.
Publicado: (2024)
por: Sheth, Ivaxi, et al.
Publicado: (2024)
Large Language Model-Enhanced Algorithm Selection: Towards Comprehensive Algorithm Representation
por: Wu, Xingyu, et al.
Publicado: (2023)
por: Wu, Xingyu, et al.
Publicado: (2023)
Decomposing and Measuring Evaluation Awareness
por: Li, Changling, et al.
Publicado: (2026)
por: Li, Changling, et al.
Publicado: (2026)
A Taxonomy of Stereotype Content in Large Language Models
por: Nicolas, Gandalf, et al.
Publicado: (2024)
por: Nicolas, Gandalf, et al.
Publicado: (2024)
The Hawthorne Effect in Reasoning Models: Evaluating and Steering Test Awareness
por: Abdelnabi, Sahar, et al.
Publicado: (2025)
por: Abdelnabi, Sahar, et al.
Publicado: (2025)
Improving Reasoning Performance in Large Language Models via Representation Engineering
por: Højer, Bertram, et al.
Publicado: (2025)
por: Højer, Bertram, et al.
Publicado: (2025)
Understanding Survey Paper Taxonomy about Large Language Models via Graph Representation Learning
por: Zhuang, Jun, et al.
Publicado: (2024)
por: Zhuang, Jun, et al.
Publicado: (2024)
Quantifying Feature Space Universality Across Large Language Models via Sparse Autoencoders
por: Lan, Michael, et al.
Publicado: (2024)
por: Lan, Michael, et al.
Publicado: (2024)
Representation Noising: A Defence Mechanism Against Harmful Finetuning
por: Rosati, Domenic, et al.
Publicado: (2024)
por: Rosati, Domenic, et al.
Publicado: (2024)
On the Origins of Linear Representations in Large Language Models
por: Jiang, Yibo, et al.
Publicado: (2024)
por: Jiang, Yibo, et al.
Publicado: (2024)
A Security Risk Taxonomy for Prompt-Based Interaction With Large Language Models
por: Derner, Erik, et al.
Publicado: (2023)
por: Derner, Erik, et al.
Publicado: (2023)
The Geometry of Tokens in Internal Representations of Large Language Models
por: Viswanathan, Karthik, et al.
Publicado: (2025)
por: Viswanathan, Karthik, et al.
Publicado: (2025)
SelfCheck-Eval: A Multi-Module Framework for Zero-Resource Hallucination Detection in Large Language Models
por: Muhammed, Diyana, et al.
Publicado: (2025)
por: Muhammed, Diyana, et al.
Publicado: (2025)
Foundational Challenges in Assuring Alignment and Safety of Large Language Models
por: Anwar, Usman, et al.
Publicado: (2024)
por: Anwar, Usman, et al.
Publicado: (2024)
Stress-Testing Capability Elicitation With Password-Locked Models
por: Greenblatt, Ryan, et al.
Publicado: (2024)
por: Greenblatt, Ryan, et al.
Publicado: (2024)
InnerThoughts: Disentangling Representations and Predictions in Large Language Models
por: Chételat, Didier, et al.
Publicado: (2025)
por: Chételat, Didier, et al.
Publicado: (2025)
Can Large Language Models Generalize Procedures Across Representations?
por: Lin, Fangru, et al.
Publicado: (2026)
por: Lin, Fangru, et al.
Publicado: (2026)
Knowledge-Driven Feature Selection and Engineering for Genotype Data with Large Language Models
por: Lee, Joseph, et al.
Publicado: (2024)
por: Lee, Joseph, et al.
Publicado: (2024)
A Theory of Response Sampling in LLMs: Part Descriptive and Part Prescriptive
por: Sivaprasad, Sarath, et al.
Publicado: (2024)
por: Sivaprasad, Sarath, et al.
Publicado: (2024)
Factuality Challenges in the Era of Large Language Models
por: Augenstein, Isabelle, et al.
Publicado: (2023)
por: Augenstein, Isabelle, et al.
Publicado: (2023)
Code Simulation Challenges for Large Language Models
por: La Malfa, Emanuele, et al.
Publicado: (2024)
por: La Malfa, Emanuele, et al.
Publicado: (2024)
Large Language Models Encode Semantics and Alignment in Linearly Separable Representations
por: Saglam, Baturay, et al.
Publicado: (2025)
por: Saglam, Baturay, et al.
Publicado: (2025)
Feature Alignment and Representation Transfer in Knowledge Distillation for Large Language Models
por: Yang, Junjie, et al.
Publicado: (2025)
por: Yang, Junjie, et al.
Publicado: (2025)
Sparse-Autoencoder-Guided Internal Representation Unlearning for Large Language Models
por: Yamashita, Tomoya, et al.
Publicado: (2025)
por: Yamashita, Tomoya, et al.
Publicado: (2025)
Parameter-Efficient Tuning Large Language Models for Graph Representation Learning
por: Zhu, Qi, et al.
Publicado: (2024)
por: Zhu, Qi, et al.
Publicado: (2024)
Does Representation Matter? Exploring Intermediate Layers in Large Language Models
por: Skean, Oscar, et al.
Publicado: (2024)
por: Skean, Oscar, et al.
Publicado: (2024)
Disentangled Representation Learning with Large Language Models for Text-Attributed Graphs
por: Qin, Yijian, et al.
Publicado: (2023)
por: Qin, Yijian, et al.
Publicado: (2023)
Massive Editing for Large Language Models via Meta Learning
por: Tan, Chenmien, et al.
Publicado: (2023)
por: Tan, Chenmien, et al.
Publicado: (2023)
Survey on Large Language Model-Enhanced Reinforcement Learning: Concept, Taxonomy, and Methods
por: Cao, Yuji, et al.
Publicado: (2024)
por: Cao, Yuji, et al.
Publicado: (2024)
Steering Language Models With Activation Engineering
por: Turner, Alexander Matt, et al.
Publicado: (2023)
por: Turner, Alexander Matt, et al.
Publicado: (2023)
LABOR-LLM: Language-Based Occupational Representations with Large Language Models
por: Athey, Susan, et al.
Publicado: (2024)
por: Athey, Susan, et al.
Publicado: (2024)
Multi-Lingual Malaysian Embedding: Leveraging Large Language Models for Semantic Representations
por: Zolkepli, Husein, et al.
Publicado: (2024)
por: Zolkepli, Husein, et al.
Publicado: (2024)
Hyperbolic Multimodal Representation Learning for Biological Taxonomies
por: Gong, ZeMing, et al.
Publicado: (2025)
por: Gong, ZeMing, et al.
Publicado: (2025)
Representation Bending for Large Language Model Safety
por: Yousefpour, Ashkan, et al.
Publicado: (2025)
por: Yousefpour, Ashkan, et al.
Publicado: (2025)
AI Agents May Always Fall for Prompt Injections
por: Abdelnabi, Sahar, et al.
Publicado: (2026)
por: Abdelnabi, Sahar, et al.
Publicado: (2026)
Wordflow: Social Prompt Engineering for Large Language Models
por: Wang, Zijie J., et al.
Publicado: (2024)
por: Wang, Zijie J., et al.
Publicado: (2024)
DebateBench: A Challenging Long Context Reasoning Benchmark For Large Language Models
por: Tiwari, Utkarsh, et al.
Publicado: (2025)
por: Tiwari, Utkarsh, et al.
Publicado: (2025)
Ejemplares similares
-
Cooperation, Competition, and Maliciousness: LLM-Stakeholders Interactive Negotiation
por: Abdelnabi, Sahar, et al.
Publicado: (2023) -
Can LLMs Separate Instructions From Data? And What Do We Even Mean By That?
por: Zverev, Egor, et al.
Publicado: (2024) -
AutoML in the Age of Large Language Models: Current Challenges, Future Opportunities and Risks
por: Tornede, Alexander, et al.
Publicado: (2023) -
Context-Aware Reasoning On Parametric Knowledge for Inferring Causal Variables
por: Sheth, Ivaxi, et al.
Publicado: (2024) -
Large Language Model-Enhanced Algorithm Selection: Towards Comprehensive Algorithm Representation
por: Wu, Xingyu, et al.
Publicado: (2023)