Eliciting Language Model Behaviors with Investigator Agents
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Xiang Lisa, Chowdhury, Neil, Johnson, Daniel D., Hashimoto, Tatsunori, Liang, Percy, Schwettmann, Sarah, Steinhardt, Jacob |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Predictive Concept Decoders: Training Scalable End-to-End Interpretability Assistants
di: Huang, Vincent, et al.
Pubblicazione: (2025)
di: Huang, Vincent, et al.
Pubblicazione: (2025)
Language Model Circuits Are Sparse in the Neuron Basis
di: Arora, Aryaman, et al.
Pubblicazione: (2026)
di: Arora, Aryaman, et al.
Pubblicazione: (2026)
Language Models with Conformal Factuality Guarantees
di: Mohri, Christopher, et al.
Pubblicazione: (2024)
di: Mohri, Christopher, et al.
Pubblicazione: (2024)
Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators
di: Dubois, Yann, et al.
Pubblicazione: (2024)
di: Dubois, Yann, et al.
Pubblicazione: (2024)
How do Language Models Bind Entities in Context?
di: Feng, Jiahai, et al.
Pubblicazione: (2023)
di: Feng, Jiahai, et al.
Pubblicazione: (2023)
On the Learnability of Watermarks for Language Models
di: Gu, Chenchen, et al.
Pubblicazione: (2023)
di: Gu, Chenchen, et al.
Pubblicazione: (2023)
Evaluating Self-Supervised Learning via Risk Decomposition
di: Dubois, Yann, et al.
Pubblicazione: (2023)
di: Dubois, Yann, et al.
Pubblicazione: (2023)
Observational Scaling Laws and the Predictability of Language Model Performance
di: Ruan, Yangjun, et al.
Pubblicazione: (2024)
di: Ruan, Yangjun, et al.
Pubblicazione: (2024)
Linguistic Calibration of Long-Form Generations
di: Band, Neil, et al.
Pubblicazione: (2024)
di: Band, Neil, et al.
Pubblicazione: (2024)
Reasoning to Learn from Latent Thoughts
di: Ruan, Yangjun, et al.
Pubblicazione: (2025)
di: Ruan, Yangjun, et al.
Pubblicazione: (2025)
Overthinking the Truth: Understanding how Language Models Process False Demonstrations
di: Halawi, Danny, et al.
Pubblicazione: (2023)
di: Halawi, Danny, et al.
Pubblicazione: (2023)
s1: Simple test-time scaling
di: Muennighoff, Niklas, et al.
Pubblicazione: (2025)
di: Muennighoff, Niklas, et al.
Pubblicazione: (2025)
Auditing Prompt Caching in Language Model APIs
di: Gu, Chenchen, et al.
Pubblicazione: (2025)
di: Gu, Chenchen, et al.
Pubblicazione: (2025)
Synthetic continued pretraining
di: Yang, Zitong, et al.
Pubblicazione: (2024)
di: Yang, Zitong, et al.
Pubblicazione: (2024)
Discovering Latent Knowledge in Language Models Without Supervision
di: Burns, Collin, et al.
Pubblicazione: (2022)
di: Burns, Collin, et al.
Pubblicazione: (2022)
Graph-based Uncertainty Metrics for Long-form Language Model Outputs
di: Jiang, Mingjian, et al.
Pubblicazione: (2024)
di: Jiang, Mingjian, et al.
Pubblicazione: (2024)
Feedback Loops With Language Models Drive In-Context Reward Hacking
di: Pan, Alexander, et al.
Pubblicazione: (2024)
di: Pan, Alexander, et al.
Pubblicazione: (2024)
Explaining Datasets in Words: Statistical Models with Natural Language Parameters
di: Zhong, Ruiqi, et al.
Pubblicazione: (2024)
di: Zhong, Ruiqi, et al.
Pubblicazione: (2024)
Which Attention Heads Matter for In-Context Learning?
di: Yin, Kayo, et al.
Pubblicazione: (2025)
di: Yin, Kayo, et al.
Pubblicazione: (2025)
Training Language Models to Explain Their Own Computations
di: Li, Belinda Z., et al.
Pubblicazione: (2025)
di: Li, Belinda Z., et al.
Pubblicazione: (2025)
Benchmarking Distributional Alignment of Large Language Models
di: Meister, Nicole, et al.
Pubblicazione: (2024)
di: Meister, Nicole, et al.
Pubblicazione: (2024)
AlpacaFarm: A Simulation Framework for Methods that Learn from Human Feedback
di: Dubois, Yann, et al.
Pubblicazione: (2023)
di: Dubois, Yann, et al.
Pubblicazione: (2023)
Robust Distortion-free Watermarks for Language Models
di: Kuditipudi, Rohith, et al.
Pubblicazione: (2023)
di: Kuditipudi, Rohith, et al.
Pubblicazione: (2023)
Approaching Human-Level Forecasting with Language Models
di: Halawi, Danny, et al.
Pubblicazione: (2024)
di: Halawi, Danny, et al.
Pubblicazione: (2024)
On the Entropy Calibration of Language Models
di: Cao, Steven, et al.
Pubblicazione: (2025)
di: Cao, Steven, et al.
Pubblicazione: (2025)
Iterative Label Refinement Matters More than Preference Optimization under Weak Supervision
di: Ye, Yaowen, et al.
Pubblicazione: (2025)
di: Ye, Yaowen, et al.
Pubblicazione: (2025)
VibeCheck: Discover and Quantify Qualitative Differences in Large Language Models
di: Dunlap, Lisa, et al.
Pubblicazione: (2024)
di: Dunlap, Lisa, et al.
Pubblicazione: (2024)
Learning a Generative Meta-Model of LLM Activations
di: Luo, Grace, et al.
Pubblicazione: (2026)
di: Luo, Grace, et al.
Pubblicazione: (2026)
Agentic Adversarial QA for Improving Domain-Specific LLMs
di: Grari, Vincent, et al.
Pubblicazione: (2026)
di: Grari, Vincent, et al.
Pubblicazione: (2026)
Nearest Neighbor Normalization Improves Multimodal Retrieval
di: Chowdhury, Neil, et al.
Pubblicazione: (2024)
di: Chowdhury, Neil, et al.
Pubblicazione: (2024)
Synthetic Data for any Differentiable Target
di: Thrush, Tristan, et al.
Pubblicazione: (2026)
di: Thrush, Tristan, et al.
Pubblicazione: (2026)
Identifying the Risks of LM Agents with an LM-Emulated Sandbox
di: Ruan, Yangjun, et al.
Pubblicazione: (2023)
di: Ruan, Yangjun, et al.
Pubblicazione: (2023)
Can LLMs Generate Novel Research Ideas? A Large-Scale Human Study with 100+ NLP Researchers
di: Si, Chenglei, et al.
Pubblicazione: (2024)
di: Si, Chenglei, et al.
Pubblicazione: (2024)
The Ideation-Execution Gap: Execution Outcomes of LLM-Generated versus Human Research Ideas
di: Si, Chenglei, et al.
Pubblicazione: (2025)
di: Si, Chenglei, et al.
Pubblicazione: (2025)
On Eliciting Syntax from Language Models via Hashing
di: Wang, Yiran, et al.
Pubblicazione: (2024)
di: Wang, Yiran, et al.
Pubblicazione: (2024)
Eliciting Latent Knowledge from Quirky Language Models
di: Mallen, Alex, et al.
Pubblicazione: (2023)
di: Mallen, Alex, et al.
Pubblicazione: (2023)
Reasoning Elicitation in Language Models via Counterfactual Feedback
di: Hüyük, Alihan, et al.
Pubblicazione: (2024)
di: Hüyük, Alihan, et al.
Pubblicazione: (2024)
Towards Execution-Grounded Automated AI Research
di: Si, Chenglei, et al.
Pubblicazione: (2026)
di: Si, Chenglei, et al.
Pubblicazione: (2026)
Causality Elicitation from Large Language Models
di: Kameyama, Takashi, et al.
Pubblicazione: (2026)
di: Kameyama, Takashi, et al.
Pubblicazione: (2026)
Self-Training Elicits Concise Reasoning in Large Language Models
di: Munkhbat, Tergel, et al.
Pubblicazione: (2025)
di: Munkhbat, Tergel, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Predictive Concept Decoders: Training Scalable End-to-End Interpretability Assistants
di: Huang, Vincent, et al.
Pubblicazione: (2025) -
Language Model Circuits Are Sparse in the Neuron Basis
di: Arora, Aryaman, et al.
Pubblicazione: (2026) -
Language Models with Conformal Factuality Guarantees
di: Mohri, Christopher, et al.
Pubblicazione: (2024) -
Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators
di: Dubois, Yann, et al.
Pubblicazione: (2024) -
How do Language Models Bind Entities in Context?
di: Feng, Jiahai, et al.
Pubblicazione: (2023)