Unsupervised Elicitation of Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Wen, Jiaxin, Ankner, Zachary, Somani, Arushi, Hase, Peter, Marks, Samuel, Goldman-Wetzler, Jacob, Petrini, Linda, Sleight, Henry, Burns, Collin, He, He, Feng, Shi, Perez, Ethan, Leike, Jan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Inverse Scaling in Test-Time Compute
di: Gema, Aryo Pradipta, et al.
Pubblicazione: (2025)
di: Gema, Aryo Pradipta, et al.
Pubblicazione: (2025)
Beyond Data Filtering: Knowledge Localization for Capability Removal in LLMs
di: Shilov, Igor, et al.
Pubblicazione: (2025)
di: Shilov, Igor, et al.
Pubblicazione: (2025)
Reasoning Models Don't Always Say What They Think
di: Chen, Yanda, et al.
Pubblicazione: (2025)
di: Chen, Yanda, et al.
Pubblicazione: (2025)
Speeding up and reducing memory usage for scientific machine learning via mixed precision
di: Hayford, Joel, et al.
Pubblicazione: (2024)
di: Hayford, Joel, et al.
Pubblicazione: (2024)
Vid3D: Synthesis of Dynamic 3D Scenes using 2D Video Diffusion
di: Parthasarathy, Rishab, et al.
Pubblicazione: (2024)
di: Parthasarathy, Rishab, et al.
Pubblicazione: (2024)
Adaptive Deployment of Untrusted LLMs Reduces Distributed Threats
di: Wen, Jiaxin, et al.
Pubblicazione: (2024)
di: Wen, Jiaxin, et al.
Pubblicazione: (2024)
Believe It or Not: How Deeply do LLMs Believe Implanted Facts?
di: Slocum, Stewart, et al.
Pubblicazione: (2025)
di: Slocum, Stewart, et al.
Pubblicazione: (2025)
Unsupervised decoding of encoded reasoning using language model interpretability
di: Fang, Ching, et al.
Pubblicazione: (2025)
di: Fang, Ching, et al.
Pubblicazione: (2025)
Gradient Routing: Masking Gradients to Localize Computation in Neural Networks
di: Cloud, Alex, et al.
Pubblicazione: (2024)
di: Cloud, Alex, et al.
Pubblicazione: (2024)
Language Models Learn to Mislead Humans via RLHF
di: Wen, Jiaxin, et al.
Pubblicazione: (2024)
di: Wen, Jiaxin, et al.
Pubblicazione: (2024)
Rapid Response: Mitigating LLM Jailbreaks with a Few Examples
di: Peng, Alwin, et al.
Pubblicazione: (2024)
di: Peng, Alwin, et al.
Pubblicazione: (2024)
Ethos des literarischen Schreibens
di: Hase, Jan
Pubblicazione: (2024)
di: Hase, Jan
Pubblicazione: (2024)
Feminist mental health activism in England c. 1968–95. By K.Mahoney, Manchester: Manchester University Press. 2023. pp. 280. £85.00 (cloth), £85.00 (ebk). ISBN: 9781526162267
di: Sara Wetzler
Pubblicazione: (2024)
di: Sara Wetzler
Pubblicazione: (2024)
Fight Books in Comparative Perspective. An Introduction
di: Sixt Wetzler
Pubblicazione: (2020)
di: Sixt Wetzler
Pubblicazione: (2020)
Paul Bowman, Mythologies of Martial Arts (Martial Arts Studies, 2), London/New York: Rowman and Littlefield, 2017, xxiii + 186 p.
di: Sixt Wetzler
Pubblicazione: (2017)
di: Sixt Wetzler
Pubblicazione: (2017)
“Your Kung Fu is very good, Master Fiore!” Asian and European fight books in comparison
di: Sixt Wetzler
Pubblicazione: (2016)
di: Sixt Wetzler
Pubblicazione: (2016)
All Code, No Thought: Current Language Models Struggle to Reason in Ciphered Language
di: Guo, Shiyuan, et al.
Pubblicazione: (2025)
di: Guo, Shiyuan, et al.
Pubblicazione: (2025)
The LLM Has Left The Chat: Evidence of Bail Preferences in Large Language Models
di: Ensign, Danielle, et al.
Pubblicazione: (2025)
di: Ensign, Danielle, et al.
Pubblicazione: (2025)
Eliciting Secret Knowledge from Language Models
di: Cywiński, Bartosz, et al.
Pubblicazione: (2025)
di: Cywiński, Bartosz, et al.
Pubblicazione: (2025)
Towards Safeguarding LLM Fine-tuning APIs against Cipher Attacks
di: Youstra, Jack, et al.
Pubblicazione: (2025)
di: Youstra, Jack, et al.
Pubblicazione: (2025)
The Hot Mess of AI: How Does Misalignment Scale With Model Intelligence and Task Complexity?
di: Hägele, Alexander, et al.
Pubblicazione: (2026)
di: Hägele, Alexander, et al.
Pubblicazione: (2026)
Censored LLMs as a Natural Testbed for Secret Knowledge Elicitation
di: Casademunt, Helena, et al.
Pubblicazione: (2026)
di: Casademunt, Helena, et al.
Pubblicazione: (2026)
Discovering Latent Knowledge in Language Models Without Supervision
di: Burns, Collin, et al.
Pubblicazione: (2022)
di: Burns, Collin, et al.
Pubblicazione: (2022)
Critique-out-Loud Reward Models
di: Ankner, Zachary, et al.
Pubblicazione: (2024)
di: Ankner, Zachary, et al.
Pubblicazione: (2024)
Dynamic Masking Rate Schedules for MLM Pretraining
di: Ankner, Zachary, et al.
Pubblicazione: (2023)
di: Ankner, Zachary, et al.
Pubblicazione: (2023)
No Difference in Pullout Strength Between a Bio‐inductive Implant and a Semitendinosus Tendon Graft in a Biomechanical Study of Medial Patellofemoral Ligament Repair Augmentation
di: Austin Wetzler, et al.
Pubblicazione: (2024)
di: Austin Wetzler, et al.
Pubblicazione: (2024)
SMIXAE: Towards Unsupervised Manifold Discovery in Language Models
di: Francel, Collin
Pubblicazione: (2026)
di: Francel, Collin
Pubblicazione: (2026)
The Impact of Acquisition on Product Quality in the Console Gaming Industry
di: Somani, Shivam
Pubblicazione: (2024)
di: Somani, Shivam
Pubblicazione: (2024)
Towards Verifiable Transformers: Solver-Checkable Circuit Explanations
di: Somani, Neel
Pubblicazione: (2026)
di: Somani, Neel
Pubblicazione: (2026)
Limit-Computable Grains of Truth for Arbitrary Computable Extensive-Form (Un)Known Games
di: Wyeth, Cole, et al.
Pubblicazione: (2025)
di: Wyeth, Cole, et al.
Pubblicazione: (2025)
Excess Description Length of Learning Generalizable Predictors
di: Donoway, Elizabeth, et al.
Pubblicazione: (2026)
di: Donoway, Elizabeth, et al.
Pubblicazione: (2026)
A High-Order Conformal FEM for Multidimensional Nonlinear Collisional Breakage Equations: Analysis and Computation
di: Arushi, Arushi, et al.
Pubblicazione: (2026)
di: Arushi, Arushi, et al.
Pubblicazione: (2026)
Hydra: Sequentially-Dependent Draft Heads for Medusa Decoding
di: Ankner, Zachary, et al.
Pubblicazione: (2024)
di: Ankner, Zachary, et al.
Pubblicazione: (2024)
Perplexed by Perplexity: Perplexity-Based Data Pruning With Small Reference Models
di: Ankner, Zachary, et al.
Pubblicazione: (2024)
di: Ankner, Zachary, et al.
Pubblicazione: (2024)
Causal Preference Elicitation
di: Bonilla, Edwin V., et al.
Pubblicazione: (2026)
di: Bonilla, Edwin V., et al.
Pubblicazione: (2026)
Unsupervised Elicitation of Moral Values from Language Models
di: Alizadeh, Meysam, et al.
Pubblicazione: (2026)
di: Alizadeh, Meysam, et al.
Pubblicazione: (2026)
Exploring Mentorship, Roles, and Professional Development Needs of K-12 School Librarians in the Greater DC Area: A Mixed Methods Approach
di: Flordeliza Linda Cadiz Marks
Pubblicazione: (2024)
di: Flordeliza Linda Cadiz Marks
Pubblicazione: (2024)
(Non-)Conserved Currents and Cosmological Correlators
di: Sleight, Charlotte, et al.
Pubblicazione: (2025)
di: Sleight, Charlotte, et al.
Pubblicazione: (2025)
Celestial Holography Revisited
di: Sleight, Charlotte, et al.
Pubblicazione: (2023)
di: Sleight, Charlotte, et al.
Pubblicazione: (2023)
Predicting Empirical AI Research Outcomes with Language Models
di: Wen, Jiaxin, et al.
Pubblicazione: (2025)
di: Wen, Jiaxin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Inverse Scaling in Test-Time Compute
di: Gema, Aryo Pradipta, et al.
Pubblicazione: (2025) -
Beyond Data Filtering: Knowledge Localization for Capability Removal in LLMs
di: Shilov, Igor, et al.
Pubblicazione: (2025) -
Reasoning Models Don't Always Say What They Think
di: Chen, Yanda, et al.
Pubblicazione: (2025) -
Speeding up and reducing memory usage for scientific machine learning via mixed precision
di: Hayford, Joel, et al.
Pubblicazione: (2024) -
Vid3D: Synthesis of Dynamic 3D Scenes using 2D Video Diffusion
di: Parthasarathy, Rishab, et al.
Pubblicazione: (2024)