Inference-Time Intervention: Eliciting Truthful Answers from a Language Model
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Kenneth, Patel, Oam, Viégas, Fernanda, Pfister, Hanspeter, Wattenberg, Martin |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Measuring and Controlling Instruction (In)Stability in Language Model Dialogs
par: Li, Kenneth, et autres
Publié: (2024)
par: Li, Kenneth, et autres
Publié: (2024)
Emergent World Representations: Exploring a Sequence Model Trained on a Synthetic Task
par: Li, Kenneth, et autres
Publié: (2022)
par: Li, Kenneth, et autres
Publié: (2022)
Dialogue Action Tokens: Steering Language Models in Goal-Directed Dialogue with a Multi-Turn Planner
par: Li, Kenneth, et autres
Publié: (2024)
par: Li, Kenneth, et autres
Publié: (2024)
When Bad Data Leads to Good Models
par: Li, Kenneth, et autres
Publié: (2025)
par: Li, Kenneth, et autres
Publié: (2025)
What Does it Mean for a Neural Network to Learn a "World Model"?
par: Li, Kenneth, et autres
Publié: (2025)
par: Li, Kenneth, et autres
Publié: (2025)
Relational Composition in Neural Networks: A Survey and Call to Action
par: Wattenberg, Martin, et autres
Publié: (2024)
par: Wattenberg, Martin, et autres
Publié: (2024)
Shared Global and Local Geometry of Language Model Embeddings
par: Lee, Andrew, et autres
Publié: (2025)
par: Lee, Andrew, et autres
Publié: (2025)
Graph Elicitation for Guiding Multi-Step Reasoning in Large Language Models
par: Park, Jinyoung, et autres
Publié: (2023)
par: Park, Jinyoung, et autres
Publié: (2023)
Eliciting Language Model Behaviors with Investigator Agents
par: Li, Xiang Lisa, et autres
Publié: (2025)
par: Li, Xiang Lisa, et autres
Publié: (2025)
Synergy-of-Thoughts: Eliciting Efficient Reasoning in Hybrid Language Models
par: Shang, Yu, et autres
Publié: (2024)
par: Shang, Yu, et autres
Publié: (2024)
TruthX: Alleviating Hallucinations by Editing Large Language Models in Truthful Space
par: Zhang, Shaolei, et autres
Publié: (2024)
par: Zhang, Shaolei, et autres
Publié: (2024)
Eliciting Latent Knowledge from Quirky Language Models
par: Mallen, Alex, et autres
Publié: (2023)
par: Mallen, Alex, et autres
Publié: (2023)
On Eliciting Syntax from Language Models via Hashing
par: Wang, Yiran, et autres
Publié: (2024)
par: Wang, Yiran, et autres
Publié: (2024)
Reasoning Elicitation in Language Models via Counterfactual Feedback
par: Hüyük, Alihan, et autres
Publié: (2024)
par: Hüyük, Alihan, et autres
Publié: (2024)
$T^2$ of Thoughts: Temperature Tree Elicits Reasoning in Large Language Models
par: Cai, Chengkun, et autres
Publié: (2024)
par: Cai, Chengkun, et autres
Publié: (2024)
The Geometry of Self-Verification in a Task-Specific Reasoning Model
par: Lee, Andrew, et autres
Publié: (2025)
par: Lee, Andrew, et autres
Publié: (2025)
Personas as a Way to Model Truthfulness in Language Models
par: Joshi, Nitish, et autres
Publié: (2023)
par: Joshi, Nitish, et autres
Publié: (2023)
Self-Training Elicits Concise Reasoning in Large Language Models
par: Munkhbat, Tergel, et autres
Publié: (2025)
par: Munkhbat, Tergel, et autres
Publié: (2025)
Designing a Dashboard for Transparency and Control of Conversational AI
par: Chen, Yida, et autres
Publié: (2024)
par: Chen, Yida, et autres
Publié: (2024)
LLäMmlein: Transparent, Compact and Competitive German-Only Language Models from Scratch
par: Pfister, Jan, et autres
Publié: (2024)
par: Pfister, Jan, et autres
Publié: (2024)
Ranking Large Language Models without Ground Truth
par: Dhurandhar, Amit, et autres
Publié: (2024)
par: Dhurandhar, Amit, et autres
Publié: (2024)
Causality Elicitation from Large Language Models
par: Kameyama, Takashi, et autres
Publié: (2026)
par: Kameyama, Takashi, et autres
Publié: (2026)
Can Interpretation Predict Behavior on Unseen Data?
par: Li, Victoria R., et autres
Publié: (2025)
par: Li, Victoria R., et autres
Publié: (2025)
Data Cartography for Detecting Memorization Hotspots and Guiding Data Interventions in Generative Models
par: Patel, Laksh, et autres
Publié: (2025)
par: Patel, Laksh, et autres
Publié: (2025)
Tree of Attributes Prompt Learning for Vision-Language Models
par: Ding, Tong, et autres
Publié: (2024)
par: Ding, Tong, et autres
Publié: (2024)
Answer Matching Outperforms Multiple Choice for Language Model Evaluation
par: Chandak, Nikhil, et autres
Publié: (2025)
par: Chandak, Nikhil, et autres
Publié: (2025)
Chronotome: Real-Time Topic Modeling for Streaming Embedding Spaces
par: Lim, Matte, et autres
Publié: (2025)
par: Lim, Matte, et autres
Publié: (2025)
Overthinking the Truth: Understanding how Language Models Process False Demonstrations
par: Halawi, Danny, et autres
Publié: (2023)
par: Halawi, Danny, et autres
Publié: (2023)
Machine Bullshit: Characterizing the Emergent Disregard for Truth in Large Language Models
par: Liang, Kaiqu, et autres
Publié: (2025)
par: Liang, Kaiqu, et autres
Publié: (2025)
Adaptive Elicitation of Latent Information Using Natural Language
par: Wang, Jimmy, et autres
Publié: (2025)
par: Wang, Jimmy, et autres
Publié: (2025)
Rewarding Intellectual Humility Learning When Not To Answer In Large Language Models
par: Jha, Abha, et autres
Publié: (2026)
par: Jha, Abha, et autres
Publié: (2026)
Steering Safely or Off a Cliff? Rethinking Specificity and Robustness in Inference-Time Interventions
par: Goyal, Navita, et autres
Publié: (2026)
par: Goyal, Navita, et autres
Publié: (2026)
Communicating Activations Between Language Model Agents
par: Ramesh, Vignav, et autres
Publié: (2025)
par: Ramesh, Vignav, et autres
Publié: (2025)
Incentivizing Truthful Language Models via Peer Elicitation Games
par: Chen, Baiting, et autres
Publié: (2025)
par: Chen, Baiting, et autres
Publié: (2025)
ILRR: Inference-Time Steering Method for Masked Diffusion Language Models
par: Avrahami, Eden, et autres
Publié: (2026)
par: Avrahami, Eden, et autres
Publié: (2026)
Explicit Diversity Conditions for Effective Question Answer Generation with Large Language Models
par: Yadav, Vikas, et autres
Publié: (2024)
par: Yadav, Vikas, et autres
Publié: (2024)
Proving that Cryptic Crossword Clue Answers are Correct
par: Andrews, Martin, et autres
Publié: (2024)
par: Andrews, Martin, et autres
Publié: (2024)
Hallucination to Truth: A Review of Fact-Checking and Factuality Evaluation in Large Language Models
par: Rahman, Subhey Sadi, et autres
Publié: (2025)
par: Rahman, Subhey Sadi, et autres
Publié: (2025)
Inference-Time Scaling for Generalist Reward Modeling
par: Liu, Zijun, et autres
Publié: (2025)
par: Liu, Zijun, et autres
Publié: (2025)
Promote, Suppress, Iterate: How Language Models Answer One-to-Many Factual Queries
par: Yan, Tianyi Lorena, et autres
Publié: (2025)
par: Yan, Tianyi Lorena, et autres
Publié: (2025)
Documents similaires
-
Measuring and Controlling Instruction (In)Stability in Language Model Dialogs
par: Li, Kenneth, et autres
Publié: (2024) -
Emergent World Representations: Exploring a Sequence Model Trained on a Synthetic Task
par: Li, Kenneth, et autres
Publié: (2022) -
Dialogue Action Tokens: Steering Language Models in Goal-Directed Dialogue with a Multi-Turn Planner
par: Li, Kenneth, et autres
Publié: (2024) -
When Bad Data Leads to Good Models
par: Li, Kenneth, et autres
Publié: (2025) -
What Does it Mean for a Neural Network to Learn a "World Model"?
par: Li, Kenneth, et autres
Publié: (2025)