Eliciting Latent Knowledge from Quirky Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Mallen, Alex, Brumley, Madeline, Kharchenko, Julia, Belrose, Nora |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Mechanistic Anomaly Detection for "Quirky" Language Models
di: Johnston, David O., et al.
Pubblicazione: (2025)
di: Johnston, David O., et al.
Pubblicazione: (2025)
Balancing Label Quantity and Quality for Scalable Elicitation
di: Mallen, Alex, et al.
Pubblicazione: (2024)
di: Mallen, Alex, et al.
Pubblicazione: (2024)
Automatically Interpreting Millions of Features in Large Language Models
di: Paulo, Gonçalo, et al.
Pubblicazione: (2024)
di: Paulo, Gonçalo, et al.
Pubblicazione: (2024)
Does Transformer Interpretability Transfer to RNNs?
di: Paulo, Gonçalo, et al.
Pubblicazione: (2024)
di: Paulo, Gonçalo, et al.
Pubblicazione: (2024)
Adaptive Elicitation of Latent Information Using Natural Language
di: Wang, Jimmy, et al.
Pubblicazione: (2025)
di: Wang, Jimmy, et al.
Pubblicazione: (2025)
On Eliciting Syntax from Language Models via Hashing
di: Wang, Yiran, et al.
Pubblicazione: (2024)
di: Wang, Yiran, et al.
Pubblicazione: (2024)
Discovering Latent Knowledge in Language Models Without Supervision
di: Burns, Collin, et al.
Pubblicazione: (2022)
di: Burns, Collin, et al.
Pubblicazione: (2022)
Eliciting Language Model Behaviors with Investigator Agents
di: Li, Xiang Lisa, et al.
Pubblicazione: (2025)
di: Li, Xiang Lisa, et al.
Pubblicazione: (2025)
Partially Rewriting a Transformer in Natural Language
di: Paulo, Gonçalo, et al.
Pubblicazione: (2025)
di: Paulo, Gonçalo, et al.
Pubblicazione: (2025)
Causality Elicitation from Large Language Models
di: Kameyama, Takashi, et al.
Pubblicazione: (2026)
di: Kameyama, Takashi, et al.
Pubblicazione: (2026)
Reasoning Elicitation in Language Models via Counterfactual Feedback
di: Hüyük, Alihan, et al.
Pubblicazione: (2024)
di: Hüyük, Alihan, et al.
Pubblicazione: (2024)
Self-Training Elicits Concise Reasoning in Large Language Models
di: Munkhbat, Tergel, et al.
Pubblicazione: (2025)
di: Munkhbat, Tergel, et al.
Pubblicazione: (2025)
Synergy-of-Thoughts: Eliciting Efficient Reasoning in Hybrid Language Models
di: Shang, Yu, et al.
Pubblicazione: (2024)
di: Shang, Yu, et al.
Pubblicazione: (2024)
Inference-Time Intervention: Eliciting Truthful Answers from a Language Model
di: Li, Kenneth, et al.
Pubblicazione: (2023)
di: Li, Kenneth, et al.
Pubblicazione: (2023)
Censored LLMs as a Natural Testbed for Secret Knowledge Elicitation
di: Casademunt, Helena, et al.
Pubblicazione: (2026)
di: Casademunt, Helena, et al.
Pubblicazione: (2026)
Graph Elicitation for Guiding Multi-Step Reasoning in Large Language Models
di: Park, Jinyoung, et al.
Pubblicazione: (2023)
di: Park, Jinyoung, et al.
Pubblicazione: (2023)
$T^2$ of Thoughts: Temperature Tree Elicits Reasoning in Large Language Models
di: Cai, Chengkun, et al.
Pubblicazione: (2024)
di: Cai, Chengkun, et al.
Pubblicazione: (2024)
Examining Two Hop Reasoning Through Information Content Scaling
di: Johnston, David, et al.
Pubblicazione: (2025)
di: Johnston, David, et al.
Pubblicazione: (2025)
REALISTA: Realistic Latent Adversarial Attacks that Elicit LLM Hallucinations
di: Liang, Buyun, et al.
Pubblicazione: (2026)
di: Liang, Buyun, et al.
Pubblicazione: (2026)
Chain-of-Defensive-Thought: Structured Reasoning Elicits Robustness in Large Language Models against Reference Corruption
di: Wang, Wenxiao, et al.
Pubblicazione: (2025)
di: Wang, Wenxiao, et al.
Pubblicazione: (2025)
LatentBreak: Jailbreaking Large Language Models through Latent Space Feedback
di: Mura, Raffaele, et al.
Pubblicazione: (2025)
di: Mura, Raffaele, et al.
Pubblicazione: (2025)
Fairer Preferences Elicit Improved Human-Aligned Large Language Model Judgments
di: Zhou, Han, et al.
Pubblicazione: (2024)
di: Zhou, Han, et al.
Pubblicazione: (2024)
Online Rubrics Elicitation from Pairwise Comparisons
di: Rezaei, MohammadHossein, et al.
Pubblicazione: (2025)
di: Rezaei, MohammadHossein, et al.
Pubblicazione: (2025)
Large Language Models Explore by Latent Distilling
di: Zeng, Yuanhao, et al.
Pubblicazione: (2026)
di: Zeng, Yuanhao, et al.
Pubblicazione: (2026)
From Literal to Liberal: A Meta-Prompting Framework for Eliciting Human-Aligned Exception Handling in Large Language Models
di: Khan, Imran
Pubblicazione: (2025)
di: Khan, Imran
Pubblicazione: (2025)
Latent Concept Disentanglement in Transformer-based Language Models
di: Hong, Guan Zhe, et al.
Pubblicazione: (2025)
di: Hong, Guan Zhe, et al.
Pubblicazione: (2025)
Latent Principle Discovery for Language Model Self-Improvement
di: Ramji, Keshav, et al.
Pubblicazione: (2025)
di: Ramji, Keshav, et al.
Pubblicazione: (2025)
Eliciting In-context Retrieval and Reasoning for Long-context Large Language Models
di: Qiu, Yifu, et al.
Pubblicazione: (2025)
di: Qiu, Yifu, et al.
Pubblicazione: (2025)
Evaluating the Limits of Large Language Models in Multilingual Legal Reasoning
di: Ioannou, Antreas, et al.
Pubblicazione: (2025)
di: Ioannou, Antreas, et al.
Pubblicazione: (2025)
DiLaDiff: Distilled Latent-Augmented Diffusion for Language Modeling
di: Lemercier, Jean-Marie, et al.
Pubblicazione: (2026)
di: Lemercier, Jean-Marie, et al.
Pubblicazione: (2026)
The Depth Ceiling: On the Limits of Large Language Models in Discovering Latent Planning
di: Xu, Yi, et al.
Pubblicazione: (2026)
di: Xu, Yi, et al.
Pubblicazione: (2026)
Language Bottleneck Models for Qualitative Knowledge State Modeling
di: Berthon, Antonin, et al.
Pubblicazione: (2025)
di: Berthon, Antonin, et al.
Pubblicazione: (2025)
Training Language Models on the Knowledge Graph: Insights on Hallucinations and Their Detectability
di: Hron, Jiri, et al.
Pubblicazione: (2024)
di: Hron, Jiri, et al.
Pubblicazione: (2024)
Weak-to-Strong Elicitation via Mismatched Wrong Drafts
di: Deng, Wei
Pubblicazione: (2026)
di: Deng, Wei
Pubblicazione: (2026)
Verbal Process Supervision Elicits Better Coding Agents
di: Chen, Hao-Yuan, et al.
Pubblicazione: (2025)
di: Chen, Hao-Yuan, et al.
Pubblicazione: (2025)
Delta Knowledge Distillation for Large Language Models
di: Cao, Yihan, et al.
Pubblicazione: (2025)
di: Cao, Yihan, et al.
Pubblicazione: (2025)
Knowledge Boundary Discovery for Large Language Models
di: Wang, Ziquan, et al.
Pubblicazione: (2026)
di: Wang, Ziquan, et al.
Pubblicazione: (2026)
Meanings and Feelings of Large Language Models: Observability of Latent States in Generative AI
di: Liu, Tian Yu, et al.
Pubblicazione: (2024)
di: Liu, Tian Yu, et al.
Pubblicazione: (2024)
H-Probes: Extracting Hierarchical Structures From Latent Representations of Language Models
di: Dawes, Cutter, et al.
Pubblicazione: (2026)
di: Dawes, Cutter, et al.
Pubblicazione: (2026)
Discovering Hierarchical Latent Capabilities of Language Models via Causal Representation Learning
di: Jin, Jikai, et al.
Pubblicazione: (2025)
di: Jin, Jikai, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Mechanistic Anomaly Detection for "Quirky" Language Models
di: Johnston, David O., et al.
Pubblicazione: (2025) -
Balancing Label Quantity and Quality for Scalable Elicitation
di: Mallen, Alex, et al.
Pubblicazione: (2024) -
Automatically Interpreting Millions of Features in Large Language Models
di: Paulo, Gonçalo, et al.
Pubblicazione: (2024) -
Does Transformer Interpretability Transfer to RNNs?
di: Paulo, Gonçalo, et al.
Pubblicazione: (2024) -
Adaptive Elicitation of Latent Information Using Natural Language
di: Wang, Jimmy, et al.
Pubblicazione: (2025)