Self-Steering Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Grand, Gabriel, Tenenbaum, Joshua B., Mansinghka, Vikash K., Lew, Alexander K., Andreas, Jacob |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Loose LIPS Sink Ships: Asking Questions in Battleship with Language-Informed Program Sampling
di: Grand, Gabriel, et al.
Pubblicazione: (2024)
di: Grand, Gabriel, et al.
Pubblicazione: (2024)
Understanding Epistemic Language with a Language-augmented Bayesian Theory of Mind
di: Ying, Lance, et al.
Pubblicazione: (2024)
di: Ying, Lance, et al.
Pubblicazione: (2024)
Pragmatic Instruction Following and Goal Assistance via Cooperative Language-Guided Inverse Planning
di: Zhi-Xuan, Tan, et al.
Pubblicazione: (2024)
di: Zhi-Xuan, Tan, et al.
Pubblicazione: (2024)
Grounding Language about Belief in a Bayesian Theory-of-Mind
di: Ying, Lance, et al.
Pubblicazione: (2024)
di: Ying, Lance, et al.
Pubblicazione: (2024)
Shoot First, Ask Questions Later? Building Rational Agents that Explore and Act Like People
di: Grand, Gabriel, et al.
Pubblicazione: (2025)
di: Grand, Gabriel, et al.
Pubblicazione: (2025)
Syntactic and Semantic Control of Large Language Models via Sequential Monte Carlo
di: Loula, João, et al.
Pubblicazione: (2025)
di: Loula, João, et al.
Pubblicazione: (2025)
LILO: Learning Interpretable Libraries by Compressing and Documenting Code
di: Grand, Gabriel, et al.
Pubblicazione: (2023)
di: Grand, Gabriel, et al.
Pubblicazione: (2023)
Infinite Ends from Finite Samples: Open-Ended Goal Inference as Top-Down Bayesian Filtering of Bottom-Up Proposals
di: Zhi-Xuan, Tan, et al.
Pubblicazione: (2024)
di: Zhi-Xuan, Tan, et al.
Pubblicazione: (2024)
Fast Controlled Generation from Language Models with Adaptive Weighted Rejection Sampling
di: Lipkin, Benjamin, et al.
Pubblicazione: (2025)
di: Lipkin, Benjamin, et al.
Pubblicazione: (2025)
Code-enabled language models can outperform reasoning models on diverse tasks
di: Zhang, Cedegao E., et al.
Pubblicazione: (2025)
di: Zhang, Cedegao E., et al.
Pubblicazione: (2025)
Modeling Open-World Cognition as On-Demand Synthesis of Probabilistic Models
di: Wong, Lionel, et al.
Pubblicazione: (2025)
di: Wong, Lionel, et al.
Pubblicazione: (2025)
Probabilistic Programming with Programmable Variational Inference
di: Becker, McCoy R., et al.
Pubblicazione: (2024)
di: Becker, McCoy R., et al.
Pubblicazione: (2024)
Language and Experience: A Computational Model of Social Learning in Complex Tasks
di: Colas, Cédric, et al.
Pubblicazione: (2025)
di: Colas, Cédric, et al.
Pubblicazione: (2025)
Belief Attribution as Mental Explanation: The Role of Accuracy, Informativity, and Causality
di: Ying, Lance, et al.
Pubblicazione: (2025)
di: Ying, Lance, et al.
Pubblicazione: (2025)
Steering Awareness: Detecting Activation Steering from Within
di: Rivera, Joshua Fonseca, et al.
Pubblicazione: (2025)
di: Rivera, Joshua Fonseca, et al.
Pubblicazione: (2025)
Hypothesis-Driven Theory-of-Mind Reasoning for Large Language Models
di: Kim, Hyunwoo, et al.
Pubblicazione: (2025)
di: Kim, Hyunwoo, et al.
Pubblicazione: (2025)
Steering When Necessary: Flexible Steering Large Language Models with Backtracking
di: Cheng, Zifeng, et al.
Pubblicazione: (2025)
di: Cheng, Zifeng, et al.
Pubblicazione: (2025)
Multiagent Finetuning: Self Improvement with Diverse Reasoning Chains
di: Subramaniam, Vighnesh, et al.
Pubblicazione: (2025)
di: Subramaniam, Vighnesh, et al.
Pubblicazione: (2025)
LINC: A Neurosymbolic Approach for Logical Reasoning by Combining Language Models with First-Order Logic Provers
di: Olausson, Theo X., et al.
Pubblicazione: (2023)
di: Olausson, Theo X., et al.
Pubblicazione: (2023)
On the Limitations of Steering in Language Model Alignment
di: Niranjan, Chebrolu, et al.
Pubblicazione: (2025)
di: Niranjan, Chebrolu, et al.
Pubblicazione: (2025)
Elements of World Knowledge (EWoK): A Cognition-Inspired Framework for Evaluating Basic World Knowledge in Language Models
di: Ivanova, Anna A., et al.
Pubblicazione: (2024)
di: Ivanova, Anna A., et al.
Pubblicazione: (2024)
Learning Linear Attention in Polynomial Time
di: Yau, Morris, et al.
Pubblicazione: (2024)
di: Yau, Morris, et al.
Pubblicazione: (2024)
Chopping Trees: Semantic Similarity Based Dynamic Pruning for Tree-of-Thought Reasoning
di: Kim, Joongho, et al.
Pubblicazione: (2025)
di: Kim, Joongho, et al.
Pubblicazione: (2025)
Probing and Steering Evaluation Awareness of Language Models
di: Nguyen, Jord, et al.
Pubblicazione: (2025)
di: Nguyen, Jord, et al.
Pubblicazione: (2025)
Activation Scaling for Steering and Interpreting Language Models
di: Stoehr, Niklas, et al.
Pubblicazione: (2024)
di: Stoehr, Niklas, et al.
Pubblicazione: (2024)
CogSteer: Cognition-Inspired Selective Layer Intervention for Efficiently Steering Large Language Models
di: Wang, Xintong, et al.
Pubblicazione: (2024)
di: Wang, Xintong, et al.
Pubblicazione: (2024)
GenMatter: Perceiving Physical Objects with Generative Matter Models
di: Li, Eric, et al.
Pubblicazione: (2026)
di: Li, Eric, et al.
Pubblicazione: (2026)
Compositional Steering of Large Language Models with Steering Tokens
di: Radevski, Gorjan, et al.
Pubblicazione: (2026)
di: Radevski, Gorjan, et al.
Pubblicazione: (2026)
Language-Informed Synthesis of Rational Agent Models for Grounded Theory-of-Mind Reasoning On-The-Fly
di: Ying, Lance, et al.
Pubblicazione: (2025)
di: Ying, Lance, et al.
Pubblicazione: (2025)
Prompt-Based Value Steering of Large Language Models
di: Abbo, Giulio Antonio, et al.
Pubblicazione: (2025)
di: Abbo, Giulio Antonio, et al.
Pubblicazione: (2025)
Cross-Lingual Activation Steering for Multilingual Language Models
di: Pokharel, Rhitabrat, et al.
Pubblicazione: (2026)
di: Pokharel, Rhitabrat, et al.
Pubblicazione: (2026)
Steering Large Language Models to Evaluate and Amplify Creativity
di: Olson, Matthew Lyle, et al.
Pubblicazione: (2024)
di: Olson, Matthew Lyle, et al.
Pubblicazione: (2024)
Evaluating Language Models' Evaluations of Games
di: Collins, Katherine M., et al.
Pubblicazione: (2025)
di: Collins, Katherine M., et al.
Pubblicazione: (2025)
Steering Evaluation-Aware Language Models to Act Like They Are Deployed
di: Hua, Tim Tian, et al.
Pubblicazione: (2025)
di: Hua, Tim Tian, et al.
Pubblicazione: (2025)
RepIt: Steering Language Models with Concept-Specific Refusal Vectors
di: Siu, Vincent, et al.
Pubblicazione: (2025)
di: Siu, Vincent, et al.
Pubblicazione: (2025)
Steering Language Models Before They Speak: Logit-Level Interventions
di: An, Hyeseon, et al.
Pubblicazione: (2026)
di: An, Hyeseon, et al.
Pubblicazione: (2026)
DLM-SWAI: Steering Diffusion Language Models Before They Unmask
di: An, Hyeseon, et al.
Pubblicazione: (2026)
di: An, Hyeseon, et al.
Pubblicazione: (2026)
Tradeoffs Between Alignment and Helpfulness in Language Models with Steering Methods
di: Wolf, Yotam, et al.
Pubblicazione: (2024)
di: Wolf, Yotam, et al.
Pubblicazione: (2024)
On Effects of Steering Latent Representation for Large Language Model Unlearning
di: Huu-Tien, Dang, et al.
Pubblicazione: (2024)
di: Huu-Tien, Dang, et al.
Pubblicazione: (2024)
Evaluating Large Vision-and-Language Models on Children's Mathematical Olympiads
di: Cherian, Anoop, et al.
Pubblicazione: (2024)
di: Cherian, Anoop, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Loose LIPS Sink Ships: Asking Questions in Battleship with Language-Informed Program Sampling
di: Grand, Gabriel, et al.
Pubblicazione: (2024) -
Understanding Epistemic Language with a Language-augmented Bayesian Theory of Mind
di: Ying, Lance, et al.
Pubblicazione: (2024) -
Pragmatic Instruction Following and Goal Assistance via Cooperative Language-Guided Inverse Planning
di: Zhi-Xuan, Tan, et al.
Pubblicazione: (2024) -
Grounding Language about Belief in a Bayesian Theory-of-Mind
di: Ying, Lance, et al.
Pubblicazione: (2024) -
Shoot First, Ask Questions Later? Building Rational Agents that Explore and Act Like People
di: Grand, Gabriel, et al.
Pubblicazione: (2025)