Dissecting Persona-Driven Reasoning in Language Models via Activation Patching
Fuente:
arXiv
Guardado en:
| Autores principales: | Poonia, Ansh, Jain, Maeghal |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Towards Best Practices of Activation Patching in Language Models: Metrics and Methods
por: Zhang, Fred, et al.
Publicado: (2023)
por: Zhang, Fred, et al.
Publicado: (2023)
Measuring the Depth of LLM Unlearning via Activation Patching
por: Lee, Jaeung, et al.
Publicado: (2026)
por: Lee, Jaeung, et al.
Publicado: (2026)
Personas as a Way to Model Truthfulness in Language Models
por: Joshi, Nitish, et al.
Publicado: (2023)
por: Joshi, Nitish, et al.
Publicado: (2023)
MMLU-SR: A Benchmark for Stress-Testing Reasoning Capability of Large Language Models
por: Wang, Wentian, et al.
Publicado: (2024)
por: Wang, Wentian, et al.
Publicado: (2024)
Persona-driven Simulation of Voting Behavior in the European Parliament with Large Language Models
por: Kreutner, Maximilian, et al.
Publicado: (2025)
por: Kreutner, Maximilian, et al.
Publicado: (2025)
Learning to Reason with Mixture of Tokens
por: Jain, Adit, et al.
Publicado: (2025)
por: Jain, Adit, et al.
Publicado: (2025)
Reasoning Elicitation in Language Models via Counterfactual Feedback
por: Hüyük, Alihan, et al.
Publicado: (2024)
por: Hüyük, Alihan, et al.
Publicado: (2024)
Are Small Language Models Ready to Compete with Large Language Models for Practical Applications?
por: Sinha, Neelabh, et al.
Publicado: (2024)
por: Sinha, Neelabh, et al.
Publicado: (2024)
PersonaGym: Evaluating Persona Agents and LLMs
por: Samuel, Vinay, et al.
Publicado: (2024)
por: Samuel, Vinay, et al.
Publicado: (2024)
Efficient Reasoning for Large Reasoning Language Models via Certainty-Guided Reflection Suppression
por: Huang, Jiameng, et al.
Publicado: (2025)
por: Huang, Jiameng, et al.
Publicado: (2025)
Beyond Next Token Prediction: Patch-Level Training for Large Language Models
por: Shao, Chenze, et al.
Publicado: (2024)
por: Shao, Chenze, et al.
Publicado: (2024)
Mitigating Hallucinations in Large Language Models via Causal Reasoning
por: Li, Yuangang, et al.
Publicado: (2025)
por: Li, Yuangang, et al.
Publicado: (2025)
Reasoning Models Don't Always Say What They Think
por: Chen, Yanda, et al.
Publicado: (2025)
por: Chen, Yanda, et al.
Publicado: (2025)
PortLLM: Personalizing Evolving Large Language Models with Training-Free and Portable Model Patches
por: Khan, Rana Muhammad Shahroz, et al.
Publicado: (2024)
por: Khan, Rana Muhammad Shahroz, et al.
Publicado: (2024)
Communicating Activations Between Language Model Agents
por: Ramesh, Vignav, et al.
Publicado: (2025)
por: Ramesh, Vignav, et al.
Publicado: (2025)
Endogenous Resistance to Activation Steering in Language Models
por: McKenzie, Alex, et al.
Publicado: (2026)
por: McKenzie, Alex, et al.
Publicado: (2026)
Improving Reasoning Performance in Large Language Models via Representation Engineering
por: Højer, Bertram, et al.
Publicado: (2025)
por: Højer, Bertram, et al.
Publicado: (2025)
Hallucination is Inevitable: An Innate Limitation of Large Language Models
por: Xu, Ziwei, et al.
Publicado: (2024)
por: Xu, Ziwei, et al.
Publicado: (2024)
One-Pass to Reason: Token Duplication and Block-Sparse Mask for Efficient Fine-Tuning on Multi-Turn Reasoning
por: Goru, Ritesh, et al.
Publicado: (2025)
por: Goru, Ritesh, et al.
Publicado: (2025)
Mitigating Over-Refusal in Aligned Large Language Models via Inference-Time Activation Energy
por: Jiang, Eric Hanchen, et al.
Publicado: (2025)
por: Jiang, Eric Hanchen, et al.
Publicado: (2025)
Variational Reasoning for Language Models
por: Zhou, Xiangxin, et al.
Publicado: (2025)
por: Zhou, Xiangxin, et al.
Publicado: (2025)
Reasoning Planning for Language Models
por: Nguyen, Bao, et al.
Publicado: (2025)
por: Nguyen, Bao, et al.
Publicado: (2025)
Large Language and Reasoning Models are Shallow Disjunctive Reasoners
por: Khalid, Irtaza, et al.
Publicado: (2025)
por: Khalid, Irtaza, et al.
Publicado: (2025)
Spectral Editing of Activations for Large Language Model Alignment
por: Qiu, Yifu, et al.
Publicado: (2024)
por: Qiu, Yifu, et al.
Publicado: (2024)
Circuit Insights: Towards Interpretability Beyond Activations
por: Golimblevskaia, Elena, et al.
Publicado: (2025)
por: Golimblevskaia, Elena, et al.
Publicado: (2025)
Tracing Uncertainty in Language Model "Reasoning"
por: Grünefeld, Nils, et al.
Publicado: (2026)
por: Grünefeld, Nils, et al.
Publicado: (2026)
Large Language Model Reasoning Failures
por: Song, Peiyang, et al.
Publicado: (2026)
por: Song, Peiyang, et al.
Publicado: (2026)
Persona-Coded Poly-Encoder: Persona-Guided Multi-Stream Conversational Sentence Scoring
por: Liu, Junfeng, et al.
Publicado: (2023)
por: Liu, Junfeng, et al.
Publicado: (2023)
HAPO: Training Language Models to Reason Concisely via History-Aware Policy Optimization
por: Huang, Chengyu, et al.
Publicado: (2025)
por: Huang, Chengyu, et al.
Publicado: (2025)
Auto-Evolve: Enhancing Large Language Model's Performance via Self-Reasoning Framework
por: Aswani, Krishna, et al.
Publicado: (2024)
por: Aswani, Krishna, et al.
Publicado: (2024)
Take a Step Back: Evoking Reasoning via Abstraction in Large Language Models
por: Zheng, Huaixiu Steven, et al.
Publicado: (2023)
por: Zheng, Huaixiu Steven, et al.
Publicado: (2023)
Deliberative Alignment: Reasoning Enables Safer Language Models
por: Guan, Melody Y., et al.
Publicado: (2024)
por: Guan, Melody Y., et al.
Publicado: (2024)
Improving Instruction-Following in Language Models through Activation Steering
por: Stolfo, Alessandro, et al.
Publicado: (2024)
por: Stolfo, Alessandro, et al.
Publicado: (2024)
Polynomial Composition Activations: Unleashing the Dynamics of Large Language Models
por: Zhuo, Zhijian, et al.
Publicado: (2024)
por: Zhuo, Zhijian, et al.
Publicado: (2024)
Why Do Multilingual Reasoning Gaps Emerge in Reasoning Language Models?
por: Kang, Deokhyung, et al.
Publicado: (2025)
por: Kang, Deokhyung, et al.
Publicado: (2025)
ORION: Teaching Language Models to Reason Efficiently in the Language of Thought
por: Tanmay, Kumar, et al.
Publicado: (2025)
por: Tanmay, Kumar, et al.
Publicado: (2025)
Is Active Persona Inference Necessary for Aligning Small Models to Personal Preferences?
por: Tang, Zilu, et al.
Publicado: (2025)
por: Tang, Zilu, et al.
Publicado: (2025)
AgentMath: Empowering Mathematical Reasoning for Large Language Models via Tool-Augmented Agent
por: Luo, Haipeng, et al.
Publicado: (2025)
por: Luo, Haipeng, et al.
Publicado: (2025)
CosmicFish-HRM: Adaptive Reasoning via Hierarchical Recurrent Mechanisms in Compact Language Models
por: Lakkapragada, Venkat Akhil
Publicado: (2026)
por: Lakkapragada, Venkat Akhil
Publicado: (2026)
WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct
por: Luo, Haipeng, et al.
Publicado: (2023)
por: Luo, Haipeng, et al.
Publicado: (2023)
Ejemplares similares
-
Towards Best Practices of Activation Patching in Language Models: Metrics and Methods
por: Zhang, Fred, et al.
Publicado: (2023) -
Measuring the Depth of LLM Unlearning via Activation Patching
por: Lee, Jaeung, et al.
Publicado: (2026) -
Personas as a Way to Model Truthfulness in Language Models
por: Joshi, Nitish, et al.
Publicado: (2023) -
MMLU-SR: A Benchmark for Stress-Testing Reasoning Capability of Large Language Models
por: Wang, Wentian, et al.
Publicado: (2024) -
Persona-driven Simulation of Voting Behavior in the European Parliament with Large Language Models
por: Kreutner, Maximilian, et al.
Publicado: (2025)