Non-Linear Inference Time Intervention: Improving LLM Truthfulness
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hoscilowicz, Jakub, Wiacek, Adam, Chojnacki, Jan, Cieslak, Adam, Michon, Leszek, Urbanevych, Vitalii, Janicki, Artur |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Can We Use Probing to Better Understand Fine-tuning and Knowledge Distillation of the BERT NLU?
par: Hościłowicz, Jakub, et autres
Publié: (2023)
par: Hościłowicz, Jakub, et autres
Publié: (2023)
Adversarial Confusion Attack: Disrupting Multimodal Large Language Models
par: Hoscilowicz, Jakub, et autres
Publié: (2025)
par: Hoscilowicz, Jakub, et autres
Publié: (2025)
ClickAgent: Enhancing UI Location Capabilities of Autonomous Agents
par: Hoscilowicz, Jakub, et autres
Publié: (2024)
par: Hoscilowicz, Jakub, et autres
Publié: (2024)
Large Language Models as Carriers of Hidden Messages
par: Hoscilowicz, Jakub, et autres
Publié: (2024)
par: Hoscilowicz, Jakub, et autres
Publié: (2024)
Large Language Models for Expansion of Spoken Language Understanding Systems to New Languages
par: Hoscilowicz, Jakub, et autres
Publié: (2024)
par: Hoscilowicz, Jakub, et autres
Publié: (2024)
Inference-Time Intervention: Eliciting Truthful Answers from a Language Model
par: Li, Kenneth, et autres
Publié: (2023)
par: Li, Kenneth, et autres
Publié: (2023)
Steerability of Instrumental-Convergence Tendencies in LLMs
par: Hoscilowicz, Jakub
Publié: (2026)
par: Hoscilowicz, Jakub
Publié: (2026)
Real-Time Energy Measurement for Non-Intrusive Well-Being Monitoring of Elderly People -- a Case Study
par: Brzozowski, Mateusz, et autres
Publié: (2024)
par: Brzozowski, Mateusz, et autres
Publié: (2024)
Robustly Improving LLM Fairness in Realistic Settings via Interpretability
par: Karvonen, Adam, et autres
Publié: (2025)
par: Karvonen, Adam, et autres
Publié: (2025)
LLM Dataset Inference: Did you train on my dataset?
par: Maini, Pratyush, et autres
Publié: (2024)
par: Maini, Pratyush, et autres
Publié: (2024)
E-LDA: Toward Interpretable LDA Topic Models with Strong Guarantees in Logarithmic Parallel Time
par: Breuer, Adam
Publié: (2025)
par: Breuer, Adam
Publié: (2025)
Beyond Steering Vector: Flow-based Activation Steering for Inference-Time Intervention
par: Jin, Zehao, et autres
Publié: (2026)
par: Jin, Zehao, et autres
Publié: (2026)
TruthFlow: Truthful LLM Generation via Representation Flow Correction
par: Wang, Hanyu, et autres
Publié: (2025)
par: Wang, Hanyu, et autres
Publié: (2025)
LLM Knowledge is Brittle: Truthfulness Representations Rely on Superficial Resemblance
par: Haller, Patrick, et autres
Publié: (2025)
par: Haller, Patrick, et autres
Publié: (2025)
Interpretable Predictability-Based AI Text Detection: A Replication Study
par: Skurla, Adam, et autres
Publié: (2026)
par: Skurla, Adam, et autres
Publié: (2026)
The Boy Who Survived: Removing Harry Potter from an LLM is harder than reported
par: Shostack, Adam
Publié: (2024)
par: Shostack, Adam
Publié: (2024)
Prompt Compression with Context-Aware Sentence Encoding for Fast and Improved LLM Inference
par: Liskavets, Barys, et autres
Publié: (2024)
par: Liskavets, Barys, et autres
Publié: (2024)
LLMSteer: Improving Long-Context LLM Inference by Steering Attention on Reused Contexts
par: Gu, Zhuohan, et autres
Publié: (2024)
par: Gu, Zhuohan, et autres
Publié: (2024)
How Reliable are Causal Probing Interventions?
par: Canby, Marc, et autres
Publié: (2024)
par: Canby, Marc, et autres
Publié: (2024)
Pruning Weights but Not Truth: Safeguarding Truthfulness While Pruning LLMs
par: Fu, Yao, et autres
Publié: (2025)
par: Fu, Yao, et autres
Publié: (2025)
On Non-interactive Evaluation of Animal Communication Translators
par: Paradise, Orr, et autres
Publié: (2025)
par: Paradise, Orr, et autres
Publié: (2025)
Reactive Transformer (RxT) -- Stateful Real-Time Processing for Event-Driven Reactive Language Models
par: Filipek, Adam
Publié: (2025)
par: Filipek, Adam
Publié: (2025)
Boundary-targeted Membership Inference Attacks on Safety Classifiers
par: Hughes, Anthony, et autres
Publié: (2026)
par: Hughes, Anthony, et autres
Publié: (2026)
mcdok at SemEval-2026 Task 13: Finetuning LLMs for Detection of Machine-Generated Code
par: Skurla, Adam, et autres
Publié: (2026)
par: Skurla, Adam, et autres
Publié: (2026)
TensorBLEU: Vectorized GPU-based BLEU Score Implementation for Per-Sentence In-Training Evaluation
par: Filipek, Adam
Publié: (2025)
par: Filipek, Adam
Publié: (2025)
Sparse Query Attention (SQA): A Computationally Efficient Attention Mechanism with Query Heads Reduction
par: Filipek, Adam
Publié: (2025)
par: Filipek, Adam
Publié: (2025)
Emergent World Models and Latent Variable Estimation in Chess-Playing Language Models
par: Karvonen, Adam
Publié: (2024)
par: Karvonen, Adam
Publié: (2024)
Steering Safely or Off a Cliff? Rethinking Specificity and Robustness in Inference-Time Interventions
par: Goyal, Navita, et autres
Publié: (2026)
par: Goyal, Navita, et autres
Publié: (2026)
Communication Compression for Tensor Parallel LLM Inference
par: Hansen-Palmus, Jan, et autres
Publié: (2024)
par: Hansen-Palmus, Jan, et autres
Publié: (2024)
References Improve LLM Alignment in Non-Verifiable Domains
par: Shi, Kejian, et autres
Publié: (2026)
par: Shi, Kejian, et autres
Publié: (2026)
Self-Improving LLM Agents at Test-Time
par: Acikgoz, Emre Can, et autres
Publié: (2025)
par: Acikgoz, Emre Can, et autres
Publié: (2025)
The Truth Lies Somewhere in the Middle (of the Generated Tokens)
par: Wang, Sophie L., et autres
Publié: (2026)
par: Wang, Sophie L., et autres
Publié: (2026)
Universal Model Routing for Efficient LLM Inference
par: Jitkrittum, Wittawat, et autres
Publié: (2025)
par: Jitkrittum, Wittawat, et autres
Publié: (2025)
TruthRL: Incentivizing Truthful LLMs via Reinforcement Learning
par: Wei, Zhepei, et autres
Publié: (2025)
par: Wei, Zhepei, et autres
Publié: (2025)
PITA: Preference-Guided Inference-Time Alignment for LLM Post-Training
par: Bobbili, Sarat Chandra, et autres
Publié: (2025)
par: Bobbili, Sarat Chandra, et autres
Publié: (2025)
Compressing LLMs: The Truth is Rarely Pure and Never Simple
par: Jaiswal, Ajay, et autres
Publié: (2023)
par: Jaiswal, Ajay, et autres
Publié: (2023)
pyvene: A Library for Understanding and Improving PyTorch Models via Interventions
par: Wu, Zhengxuan, et autres
Publié: (2024)
par: Wu, Zhengxuan, et autres
Publié: (2024)
Faster LLM Inference via Sequential Monte Carlo
par: Emara, Yahya, et autres
Publié: (2026)
par: Emara, Yahya, et autres
Publié: (2026)
CHAI: Clustered Head Attention for Efficient LLM Inference
par: Agarwal, Saurabh, et autres
Publié: (2024)
par: Agarwal, Saurabh, et autres
Publié: (2024)
Cascade Speculative Drafting for Even Faster LLM Inference
par: Chen, Ziyi, et autres
Publié: (2023)
par: Chen, Ziyi, et autres
Publié: (2023)
Documents similaires
-
Can We Use Probing to Better Understand Fine-tuning and Knowledge Distillation of the BERT NLU?
par: Hościłowicz, Jakub, et autres
Publié: (2023) -
Adversarial Confusion Attack: Disrupting Multimodal Large Language Models
par: Hoscilowicz, Jakub, et autres
Publié: (2025) -
ClickAgent: Enhancing UI Location Capabilities of Autonomous Agents
par: Hoscilowicz, Jakub, et autres
Publié: (2024) -
Large Language Models as Carriers of Hidden Messages
par: Hoscilowicz, Jakub, et autres
Publié: (2024) -
Large Language Models for Expansion of Spoken Language Understanding Systems to New Languages
par: Hoscilowicz, Jakub, et autres
Publié: (2024)