Measuring and Controlling Instruction (In)Stability in Language Model Dialogs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Kenneth, Liu, Tianle, Bashkansky, Naomi, Bau, David, Viégas, Fernanda, Pfister, Hanspeter, Wattenberg, Martin |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Emergent World Representations: Exploring a Sequence Model Trained on a Synthetic Task
par: Li, Kenneth, et autres
Publié: (2022)
par: Li, Kenneth, et autres
Publié: (2022)
Inference-Time Intervention: Eliciting Truthful Answers from a Language Model
par: Li, Kenneth, et autres
Publié: (2023)
par: Li, Kenneth, et autres
Publié: (2023)
Dialogue Action Tokens: Steering Language Models in Goal-Directed Dialogue with a Multi-Turn Planner
par: Li, Kenneth, et autres
Publié: (2024)
par: Li, Kenneth, et autres
Publié: (2024)
When Bad Data Leads to Good Models
par: Li, Kenneth, et autres
Publié: (2025)
par: Li, Kenneth, et autres
Publié: (2025)
Relational Composition in Neural Networks: A Survey and Call to Action
par: Wattenberg, Martin, et autres
Publié: (2024)
par: Wattenberg, Martin, et autres
Publié: (2024)
What Does it Mean for a Neural Network to Learn a "World Model"?
par: Li, Kenneth, et autres
Publié: (2025)
par: Li, Kenneth, et autres
Publié: (2025)
The Geometry of Self-Verification in a Task-Specific Reasoning Model
par: Lee, Andrew, et autres
Publié: (2025)
par: Lee, Andrew, et autres
Publié: (2025)
Can Interpretation Predict Behavior on Unseen Data?
par: Li, Victoria R., et autres
Publié: (2025)
par: Li, Victoria R., et autres
Publié: (2025)
Shared Global and Local Geometry of Language Model Embeddings
par: Lee, Andrew, et autres
Publié: (2025)
par: Lee, Andrew, et autres
Publié: (2025)
Discovering Forbidden Topics in Language Models
par: Rager, Can, et autres
Publié: (2025)
par: Rager, Can, et autres
Publié: (2025)
Measuring Progress in Dictionary Learning for Language Model Interpretability with Board Game Models
par: Karvonen, Adam, et autres
Publié: (2024)
par: Karvonen, Adam, et autres
Publié: (2024)
LLäMmlein: Transparent, Compact and Competitive German-Only Language Models from Scratch
par: Pfister, Jan, et autres
Publié: (2024)
par: Pfister, Jan, et autres
Publié: (2024)
Towards a Zero-Data, Controllable, Adaptive Dialog System
par: Väth, Dirk, et autres
Publié: (2024)
par: Väth, Dirk, et autres
Publié: (2024)
Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Models
par: Marks, Samuel, et autres
Publié: (2024)
par: Marks, Samuel, et autres
Publié: (2024)
Large Language Models as Tool Makers
par: Cai, Tianle, et autres
Publié: (2023)
par: Cai, Tianle, et autres
Publié: (2023)
Tree of Attributes Prompt Learning for Vision-Language Models
par: Ding, Tong, et autres
Publié: (2024)
par: Ding, Tong, et autres
Publié: (2024)
Why Can't Transformers Learn Multiplication? Reverse-Engineering Reveals Long-Range Dependency Pitfalls
par: Bai, Xiaoyan, et autres
Publié: (2025)
par: Bai, Xiaoyan, et autres
Publié: (2025)
Learning from Relevant Subgoals in Successful Dialogs using Iterative Training for Task-oriented Dialog Systems
par: Kaiser, Magdalena, et autres
Publié: (2024)
par: Kaiser, Magdalena, et autres
Publié: (2024)
From Language Modeling to Instruction Following: Understanding the Behavior Shift in LLMs after Instruction Tuning
par: Wu, Xuansheng, et autres
Publié: (2023)
par: Wu, Xuansheng, et autres
Publié: (2023)
Instruction Mining: Instruction Data Selection for Tuning Large Language Models
par: Cao, Yihan, et autres
Publié: (2023)
par: Cao, Yihan, et autres
Publié: (2023)
GPT-2 Through the Lens of Vector Symbolic Architectures
par: Knittel, Johannes, et autres
Publié: (2024)
par: Knittel, Johannes, et autres
Publié: (2024)
Dialog2Flow: Pre-training Soft-Contrastive Action-Driven Sentence Embeddings for Automatic Dialog Flow Extraction
par: Burdisso, Sergio, et autres
Publié: (2024)
par: Burdisso, Sergio, et autres
Publié: (2024)
Optimizing Instructions and Demonstrations for Multi-Stage Language Model Programs
par: Opsahl-Ong, Krista, et autres
Publié: (2024)
par: Opsahl-Ong, Krista, et autres
Publié: (2024)
Large Language Models Generate Harmful Content Using a Distinct, Unified Mechanism
par: Orgad, Hadas, et autres
Publié: (2026)
par: Orgad, Hadas, et autres
Publié: (2026)
Communicating Activations Between Language Model Agents
par: Ramesh, Vignav, et autres
Publié: (2025)
par: Ramesh, Vignav, et autres
Publié: (2025)
Instruction-tuned Language Models are Better Knowledge Learners
par: Jiang, Zhengbao, et autres
Publié: (2024)
par: Jiang, Zhengbao, et autres
Publié: (2024)
Instruction Tuning for Large Language Models: A Survey
par: Zhang, Shengyu, et autres
Publié: (2023)
par: Zhang, Shengyu, et autres
Publié: (2023)
Nevermind: Instruction Override and Moderation in Large Language Models
par: Kim, Edward
Publié: (2024)
par: Kim, Edward
Publié: (2024)
What Causes Polysemanticity? An Alternative Origin Story of Mixed Selectivity from Incidental Causes
par: Lecomte, Victor, et autres
Publié: (2023)
par: Lecomte, Victor, et autres
Publié: (2023)
Conifer: Improving Complex Constrained Instruction-Following Ability of Large Language Models
par: Sun, Haoran, et autres
Publié: (2024)
par: Sun, Haoran, et autres
Publié: (2024)
Small Language Models: Survey, Measurements, and Insights
par: Lu, Zhenyan, et autres
Publié: (2024)
par: Lu, Zhenyan, et autres
Publié: (2024)
An Empirical Study on Context Length for Open-Domain Dialog Generation
par: Shen, Xinyi, et autres
Publié: (2024)
par: Shen, Xinyi, et autres
Publié: (2024)
Conversational Tree Search: A New Hybrid Dialog Task
par: Väth, Dirk, et autres
Publié: (2023)
par: Väth, Dirk, et autres
Publié: (2023)
CaLM: Contrasting Large and Small Language Models to Verify Grounded Generation
par: Hsu, I-Hung, et autres
Publié: (2024)
par: Hsu, I-Hung, et autres
Publié: (2024)
CodecLM: Aligning Language Models with Tailored Synthetic Data
par: Wang, Zifeng, et autres
Publié: (2024)
par: Wang, Zifeng, et autres
Publié: (2024)
Improving Instruction-Following in Language Models through Activation Steering
par: Stolfo, Alessandro, et autres
Publié: (2024)
par: Stolfo, Alessandro, et autres
Publié: (2024)
Federated Data-Efficient Instruction Tuning for Large Language Models
par: Qin, Zhen, et autres
Publié: (2024)
par: Qin, Zhen, et autres
Publié: (2024)
SFTMix: Elevating Language Model Instruction Tuning with Mixup Recipe
par: Xiao, Yuxin, et autres
Publié: (2024)
par: Xiao, Yuxin, et autres
Publié: (2024)
Instruction Following by Principled Boosting Attention of Large Language Models
par: Guardieiro, Vitoria, et autres
Publié: (2025)
par: Guardieiro, Vitoria, et autres
Publié: (2025)
Reward Collapse in Aligning Large Language Models
par: Song, Ziang, et autres
Publié: (2023)
par: Song, Ziang, et autres
Publié: (2023)
Documents similaires
-
Emergent World Representations: Exploring a Sequence Model Trained on a Synthetic Task
par: Li, Kenneth, et autres
Publié: (2022) -
Inference-Time Intervention: Eliciting Truthful Answers from a Language Model
par: Li, Kenneth, et autres
Publié: (2023) -
Dialogue Action Tokens: Steering Language Models in Goal-Directed Dialogue with a Multi-Turn Planner
par: Li, Kenneth, et autres
Publié: (2024) -
When Bad Data Leads to Good Models
par: Li, Kenneth, et autres
Publié: (2025) -
Relational Composition in Neural Networks: A Survey and Call to Action
par: Wattenberg, Martin, et autres
Publié: (2024)