Stress-Testing Capability Elicitation With Password-Locked Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Greenblatt, Ryan, Roger, Fabien, Krasheninnikov, Dmitrii, Krueger, David |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Fresh in memory: Training-order recency is linearly encoded in language model activations
par: Krasheninnikov, Dmitrii, et autres
Publié: (2025)
par: Krasheninnikov, Dmitrii, et autres
Publié: (2025)
Steering Language Models with Weight Arithmetic
par: Fierro, Constanza, et autres
Publié: (2025)
par: Fierro, Constanza, et autres
Publié: (2025)
Causal Language Modeling Can Elicit Search and Reasoning Capabilities on Logic Puzzles
par: Shah, Kulin, et autres
Publié: (2024)
par: Shah, Kulin, et autres
Publié: (2024)
Beyond Forgetting: Machine Unlearning Elicits Controllable Side Behaviors and Capabilities
par: Dang, Tien, et autres
Publié: (2026)
par: Dang, Tien, et autres
Publié: (2026)
Zero-to-Strong Generalization: Eliciting Strong Capabilities of Large Language Models Iteratively without Gold Labels
par: Liu, Chaoqun, et autres
Publié: (2024)
par: Liu, Chaoqun, et autres
Publié: (2024)
Implicit meta-learning may lead language models to trust more reliable sources
par: Krasheninnikov, Dmitrii, et autres
Publié: (2023)
par: Krasheninnikov, Dmitrii, et autres
Publié: (2023)
MMLU-SR: A Benchmark for Stress-Testing Reasoning Capability of Large Language Models
par: Wang, Wentian, et autres
Publié: (2024)
par: Wang, Wentian, et autres
Publié: (2024)
AutoElicit: Using Large Language Models for Expert Prior Elicitation in Predictive Modelling
par: Capstick, Alexander, et autres
Publié: (2024)
par: Capstick, Alexander, et autres
Publié: (2024)
AI Control: Improving Safety Despite Intentional Subversion
par: Greenblatt, Ryan, et autres
Publié: (2023)
par: Greenblatt, Ryan, et autres
Publié: (2023)
Diversity of Thought Elicits Stronger Reasoning Capabilities in Multi-Agent Debate Frameworks
par: Hegazy, Mahmood
Publié: (2024)
par: Hegazy, Mahmood
Publié: (2024)
All Code, No Thought: Current Language Models Struggle to Reason in Ciphered Language
par: Guo, Shiyuan, et autres
Publié: (2025)
par: Guo, Shiyuan, et autres
Publié: (2025)
Understanding (Un)Reliability of Steering Vectors in Language Models
par: Braun, Joschka, et autres
Publié: (2025)
par: Braun, Joschka, et autres
Publié: (2025)
Comparing Bottom-Up and Top-Down Steering Approaches on In-Context Learning Tasks
par: Brumley, Madeline, et autres
Publié: (2024)
par: Brumley, Madeline, et autres
Publié: (2024)
Defining and Characterizing Reward Hacking
par: Skalse, Joar, et autres
Publié: (2022)
par: Skalse, Joar, et autres
Publié: (2022)
Taxonomy, Opportunities, and Challenges of Representation Engineering for Large Language Models
par: Wehner, Jan, et autres
Publié: (2025)
par: Wehner, Jan, et autres
Publié: (2025)
Eliciting Harmful Capabilities by Fine-Tuning On Safeguarded Outputs
par: Kaunismaa, Jackson, et autres
Publié: (2026)
par: Kaunismaa, Jackson, et autres
Publié: (2026)
Eliciting Behaviors in Multi-Turn Conversations
par: Huang, Jing, et autres
Publié: (2025)
par: Huang, Jing, et autres
Publié: (2025)
Activation Control for Efficiently Eliciting Long Chain-of-thought Ability of Language Models
par: Zhao, Zekai, et autres
Publié: (2025)
par: Zhao, Zekai, et autres
Publié: (2025)
SteerConf: Steering LLMs for Confidence Elicitation
par: Zhou, Ziang, et autres
Publié: (2025)
par: Zhou, Ziang, et autres
Publié: (2025)
Eliciting Language Model Behaviors with Investigator Agents
par: Li, Xiang Lisa, et autres
Publié: (2025)
par: Li, Xiang Lisa, et autres
Publié: (2025)
Text-Based Detection of On-Hold Scripts in Contact Center Calls
par: Galimzianov, Dmitrii, et autres
Publié: (2024)
par: Galimzianov, Dmitrii, et autres
Publié: (2024)
Direction-Flipped Influence Audits Reveal Hidden Structure in Moral Choices of LLMs
par: Blandfort, Phil, et autres
Publié: (2026)
par: Blandfort, Phil, et autres
Publié: (2026)
On Eliciting Syntax from Language Models via Hashing
par: Wang, Yiran, et autres
Publié: (2024)
par: Wang, Yiran, et autres
Publié: (2024)
Reasoning Elicitation in Language Models via Counterfactual Feedback
par: Hüyük, Alihan, et autres
Publié: (2024)
par: Hüyük, Alihan, et autres
Publié: (2024)
Eliciting Latent Knowledge from Quirky Language Models
par: Mallen, Alex, et autres
Publié: (2023)
par: Mallen, Alex, et autres
Publié: (2023)
Causality Elicitation from Large Language Models
par: Kameyama, Takashi, et autres
Publié: (2026)
par: Kameyama, Takashi, et autres
Publié: (2026)
Synergy-of-Thoughts: Eliciting Efficient Reasoning in Hybrid Language Models
par: Shang, Yu, et autres
Publié: (2024)
par: Shang, Yu, et autres
Publié: (2024)
Revisiting the Test-Time Scaling of o1-like Models: Do they Truly Possess Test-Time Scaling Capabilities?
par: Zeng, Zhiyuan, et autres
Publié: (2025)
par: Zeng, Zhiyuan, et autres
Publié: (2025)
Self-Training Elicits Concise Reasoning in Large Language Models
par: Munkhbat, Tergel, et autres
Publié: (2025)
par: Munkhbat, Tergel, et autres
Publié: (2025)
Investigating Symbolic Capabilities of Large Language Models
par: Dave, Neisarg, et autres
Publié: (2024)
par: Dave, Neisarg, et autres
Publié: (2024)
How Do LLMs Persuade? Linear Probes Can Uncover Persuasion Dynamics in Multi-Turn Conversations
par: Jaipersaud, Brandon, et autres
Publié: (2025)
par: Jaipersaud, Brandon, et autres
Publié: (2025)
Stress-Testing Long-Context Language Models with Lifelong ICL and Task Haystack
par: Xu, Xiaoyue, et autres
Publié: (2024)
par: Xu, Xiaoyue, et autres
Publié: (2024)
$T^2$ of Thoughts: Temperature Tree Elicits Reasoning in Large Language Models
par: Cai, Chengkun, et autres
Publié: (2024)
par: Cai, Chengkun, et autres
Publié: (2024)
Graph Elicitation for Guiding Multi-Step Reasoning in Large Language Models
par: Park, Jinyoung, et autres
Publié: (2023)
par: Park, Jinyoung, et autres
Publié: (2023)
Confidence Elicitation: A New Attack Vector for Large Language Models
par: Formento, Brian, et autres
Publié: (2025)
par: Formento, Brian, et autres
Publié: (2025)
Language models are better than humans at next-token prediction
par: Shlegeris, Buck, et autres
Publié: (2022)
par: Shlegeris, Buck, et autres
Publié: (2022)
Alignment faking in large language models
par: Greenblatt, Ryan, et autres
Publié: (2024)
par: Greenblatt, Ryan, et autres
Publié: (2024)
SECA: Semantically Equivalent and Coherent Attacks for Eliciting LLM Hallucinations
par: Liang, Buyun, et autres
Publié: (2025)
par: Liang, Buyun, et autres
Publié: (2025)
Crosslingual Capabilities and Knowledge Barriers in Multilingual Large Language Models
par: Chua, Lynn, et autres
Publié: (2024)
par: Chua, Lynn, et autres
Publié: (2024)
Prometheus: Inducing Fine-grained Evaluation Capability in Language Models
par: Kim, Seungone, et autres
Publié: (2023)
par: Kim, Seungone, et autres
Publié: (2023)
Documents similaires
-
Fresh in memory: Training-order recency is linearly encoded in language model activations
par: Krasheninnikov, Dmitrii, et autres
Publié: (2025) -
Steering Language Models with Weight Arithmetic
par: Fierro, Constanza, et autres
Publié: (2025) -
Causal Language Modeling Can Elicit Search and Reasoning Capabilities on Logic Puzzles
par: Shah, Kulin, et autres
Publié: (2024) -
Beyond Forgetting: Machine Unlearning Elicits Controllable Side Behaviors and Capabilities
par: Dang, Tien, et autres
Publié: (2026) -
Zero-to-Strong Generalization: Eliciting Strong Capabilities of Large Language Models Iteratively without Gold Labels
par: Liu, Chaoqun, et autres
Publié: (2024)