Evaluating the Prompt Steerability of Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Miehling, Erik, Desmond, Michael, Ramamurthy, Karthikeyan Natesan, Daly, Elizabeth M., Dognin, Pierre, Rios, Jesus, Bouneffouf, Djallel, Liu, Miao |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Language Models in Dialogue: Conversational Maxims for Human-AI Interactions
by: Miehling, Erik, et al.
Published: (2024)
by: Miehling, Erik, et al.
Published: (2024)
AI Steerability 360: A Toolkit for Steering Large Language Models
by: Miehling, Erik, et al.
Published: (2026)
by: Miehling, Erik, et al.
Published: (2026)
COMPASS: Computational Mapping of Patient-Therapist Alliance Strategies with Language Modeling
by: Lin, Baihan, et al.
Published: (2024)
by: Lin, Baihan, et al.
Published: (2024)
EvalAssist: A Human-Centered Tool for LLM-as-a-Judge
by: Ashktorab, Zahra, et al.
Published: (2025)
by: Ashktorab, Zahra, et al.
Published: (2025)
Programming Refusal with Conditional Activation Steering
by: Lee, Bruce W., et al.
Published: (2024)
by: Lee, Bruce W., et al.
Published: (2024)
Cross-Lingual Prompt Steerability: Towards Accurate and Robust LLM Behavior across Languages
by: Zhang, Lechen, et al.
Published: (2025)
by: Zhang, Lechen, et al.
Published: (2025)
SteerEval: A Framework for Evaluating Steerability with Natural Language Profiles for Recommendation
by: Zhou, Joyce, et al.
Published: (2026)
by: Zhou, Joyce, et al.
Published: (2026)
Generate, Evaluate, Iterate: Synthetic Data for Human-in-the-Loop Refinement of LLM Judges
by: Do, Hyo Jin, et al.
Published: (2025)
by: Do, Hyo Jin, et al.
Published: (2025)
A Systematic Review on Prompt Engineering in Large Language Models for K-12 STEM Education
by: Chen, Eason, et al.
Published: (2024)
by: Chen, Eason, et al.
Published: (2024)
Sparsity May Be All You Need: Sparse Random Parameter Adaptation
by: Rios, Jesus, et al.
Published: (2025)
by: Rios, Jesus, et al.
Published: (2025)
EvalLM: Interactive Evaluation of Large Language Model Prompts on User-Defined Criteria
by: Kim, Tae Soo, et al.
Published: (2023)
by: Kim, Tae Soo, et al.
Published: (2023)
Mitigating Misalignment Contagion by Steering with Implicit Traits
by: Chang, Maria, et al.
Published: (2026)
by: Chang, Maria, et al.
Published: (2026)
Autonomous Prompt Engineering in Large Language Models
by: Kepel, Daan, et al.
Published: (2024)
by: Kepel, Daan, et al.
Published: (2024)
Evaluating the Usage of African-American Vernacular English in Large Language Models
by: Dunlap, Deja, et al.
Published: (2026)
by: Dunlap, Deja, et al.
Published: (2026)
PALLM: Evaluating and Enhancing PALLiative Care Conversations with Large Language Models
by: Wang, Zhiyuan, et al.
Published: (2024)
by: Wang, Zhiyuan, et al.
Published: (2024)
Ranking Large Language Models without Ground Truth
by: Dhurandhar, Amit, et al.
Published: (2024)
by: Dhurandhar, Amit, et al.
Published: (2024)
An Expert Schema for Evaluating Large Language Model Errors in Scholarly Question-Answering Systems
by: Martin-Boyle, Anna, et al.
Published: (2026)
by: Martin-Boyle, Anna, et al.
Published: (2026)
Toward Automated Qualitative Analysis: Leveraging Large Language Models for Tutoring Dialogue Evaluation
by: Gu, Megan, et al.
Published: (2025)
by: Gu, Megan, et al.
Published: (2025)
Social Skill Training with Large Language Models
by: Yang, Diyi, et al.
Published: (2024)
by: Yang, Diyi, et al.
Published: (2024)
Evaluating Telugu Proficiency in Large Language Models_ A Comparative Analysis of ChatGPT and Gemini
by: Kishore, Katikela Sreeharsha, et al.
Published: (2024)
by: Kishore, Katikela Sreeharsha, et al.
Published: (2024)
Evaluation Of P300 Speller Performance Using Large Language Models Along With Cross-Subject Training
by: Parthasarathy, Nithin, et al.
Published: (2024)
by: Parthasarathy, Nithin, et al.
Published: (2024)
Evaluating Large Language Models in Theory of Mind Tasks
by: Kosinski, Michal
Published: (2023)
by: Kosinski, Michal
Published: (2023)
Towards a Design Guideline for RPA Evaluation: A Survey of Large Language Model-Based Role-Playing Agents
by: Chen, Chaoran, et al.
Published: (2025)
by: Chen, Chaoran, et al.
Published: (2025)
A Systematic Survey of Prompt Engineering in Large Language Models: Techniques and Applications
by: Sahoo, Pranab, et al.
Published: (2024)
by: Sahoo, Pranab, et al.
Published: (2024)
Multi-turn Evaluation of Anthropomorphic Behaviours in Large Language Models
by: Ibrahim, Lujain, et al.
Published: (2025)
by: Ibrahim, Lujain, et al.
Published: (2025)
Decomposed Prompting to Answer Questions on a Course Discussion Board
by: Jaipersaud, Brandon, et al.
Published: (2024)
by: Jaipersaud, Brandon, et al.
Published: (2024)
Exploring Prompt Engineering Practices in the Enterprise
by: Desmond, Michael, et al.
Published: (2024)
by: Desmond, Michael, et al.
Published: (2024)
Are Humans as Brittle as Large Language Models?
by: Li, Jiahui, et al.
Published: (2025)
by: Li, Jiahui, et al.
Published: (2025)
Visualization Literacy of Multimodal Large Language Models: A Comparative Study
by: Li, Zhimin, et al.
Published: (2024)
by: Li, Zhimin, et al.
Published: (2024)
StressPrompt: Does Stress Impact Large Language Models and Human Performance Similarly?
by: Shen, Guobin, et al.
Published: (2024)
by: Shen, Guobin, et al.
Published: (2024)
An Evaluation of Estimative Uncertainty in Large Language Models
by: Tang, Zhisheng, et al.
Published: (2024)
by: Tang, Zhisheng, et al.
Published: (2024)
Large Language Models Pass the Turing Test
by: Jones, Cameron R., et al.
Published: (2025)
by: Jones, Cameron R., et al.
Published: (2025)
Large Language Models for Depression Recognition in Spoken Language Integrating Psychological Knowledge
by: Li, Yupei, et al.
Published: (2025)
by: Li, Yupei, et al.
Published: (2025)
A Systematic Review on the Evaluation of Large Language Models in Theory of Mind Tasks
by: Sarıtaş, Karahan, et al.
Published: (2025)
by: Sarıtaş, Karahan, et al.
Published: (2025)
On the Reliability of Large Language Models to Misinformed and Demographically-Informed Prompts
by: Aremu, Toluwani, et al.
Published: (2024)
by: Aremu, Toluwani, et al.
Published: (2024)
Augmenting a Large Language Model with a Combination of Text and Visual Data for Conversational Visualization of Global Geospatial Data
by: Mena, Omar, et al.
Published: (2025)
by: Mena, Omar, et al.
Published: (2025)
Leveraging Large Language Models for Identifying Knowledge Components
by: Wang, Canwen, et al.
Published: (2025)
by: Wang, Canwen, et al.
Published: (2025)
Large Language Models for Virtual Human Gesture Selection
by: Torshizi, Parisa Ghanad, et al.
Published: (2025)
by: Torshizi, Parisa Ghanad, et al.
Published: (2025)
Towards Valid Student Simulation with Large Language Models
by: Yuan, Zhihao, et al.
Published: (2026)
by: Yuan, Zhihao, et al.
Published: (2026)
Evaluating Large Language Models in Analysing Classroom Dialogue
by: Long, Yun, et al.
Published: (2024)
by: Long, Yun, et al.
Published: (2024)
Similar Items
-
Language Models in Dialogue: Conversational Maxims for Human-AI Interactions
by: Miehling, Erik, et al.
Published: (2024) -
AI Steerability 360: A Toolkit for Steering Large Language Models
by: Miehling, Erik, et al.
Published: (2026) -
COMPASS: Computational Mapping of Patient-Therapist Alliance Strategies with Language Modeling
by: Lin, Baihan, et al.
Published: (2024) -
EvalAssist: A Human-Centered Tool for LLM-as-a-Judge
by: Ashktorab, Zahra, et al.
Published: (2025) -
Programming Refusal with Conditional Activation Steering
by: Lee, Bruce W., et al.
Published: (2024)