How Open Must Language Models be to Enable Reliable Scientific Inference?
Fuente:
arXiv
Guardado en:
| Autores principales: | Michaelov, James A., Arnett, Catherine, Chang, Tyler A., Rivière, Pamela D., Taylor, Samuel M., Jones, Cameron R., Trott, Sean, Levy, Roger P., Bergen, Benjamin K., Altman, Micah |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Language Statistics and False Belief Reasoning: Evidence from 41 Open-Weight LMs
por: Trott, Sean, et al.
Publicado: (2026)
por: Trott, Sean, et al.
Publicado: (2026)
Different Tokenization Schemes Lead to Comparable Performance in Spanish Number Agreement
por: Arnett, Catherine, et al.
Publicado: (2024)
por: Arnett, Catherine, et al.
Publicado: (2024)
Revenge of the Fallen? Recurrent Models Match Transformers at Predicting Human Language Comprehension Metrics
por: Michaelov, James A., et al.
Publicado: (2024)
por: Michaelov, James A., et al.
Publicado: (2024)
On the Acquisition of Shared Grammatical Representations in Bilingual Language Models
por: Arnett, Catherine, et al.
Publicado: (2025)
por: Arnett, Catherine, et al.
Publicado: (2025)
Disaggregation Reveals Hidden Training Dynamics: The Case of Agreement Attraction
por: Michaelov, James A., et al.
Publicado: (2025)
por: Michaelov, James A., et al.
Publicado: (2025)
Capacity Constraints and the Multilingual Penalty for Lexical Disambiguation
por: Trott, Sean, et al.
Publicado: (2026)
por: Trott, Sean, et al.
Publicado: (2026)
Measuring and Modifying the Readability of English Texts with GPT-4
por: Trott, Sean, et al.
Publicado: (2024)
por: Trott, Sean, et al.
Publicado: (2024)
Start Making Sense(s): A Developmental Probe of Attention Specialization Using Lexical Ambiguity
por: Rivière, Pamela D., et al.
Publicado: (2025)
por: Rivière, Pamela D., et al.
Publicado: (2025)
Language Model Behavioral Phases are Consistent Across Architecture, Training Data, and Scale
por: Michaelov, James A., et al.
Publicado: (2025)
por: Michaelov, James A., et al.
Publicado: (2025)
A Bit of a Problem: Measurement Disparities in Dataset Sizes Across Languages
por: Arnett, Catherine, et al.
Publicado: (2024)
por: Arnett, Catherine, et al.
Publicado: (2024)
N-gram-like Language Models Predict Reading Time Best
por: Michaelov, James A., et al.
Publicado: (2026)
por: Michaelov, James A., et al.
Publicado: (2026)
Emergent inabilities? Inverse scaling over the course of pretraining
por: Michaelov, James A., et al.
Publicado: (2023)
por: Michaelov, James A., et al.
Publicado: (2023)
Open research questions on information and technology in global and domestic politics-Beyond "E-" / Micah Altman, Kenneth Rogerson
por: Altman, Micah
Publicado: (2005)
por: Altman, Micah
Publicado: (2005)
Evaluating Contextualized Representations of (Spanish) Ambiguous Words: A New Lexical Resource and Empirical Analysis
por: Rivière, Pamela D., et al.
Publicado: (2024)
por: Rivière, Pamela D., et al.
Publicado: (2024)
Why do language models perform worse for morphologically complex languages?
por: Arnett, Catherine, et al.
Publicado: (2024)
por: Arnett, Catherine, et al.
Publicado: (2024)
Goldfish: Monolingual Language Models for 350 Languages
por: Chang, Tyler A., et al.
Publicado: (2024)
por: Chang, Tyler A., et al.
Publicado: (2024)
Explaining and Mitigating Crosslingual Tokenizer Inequities
por: Arnett, Catherine, et al.
Publicado: (2025)
por: Arnett, Catherine, et al.
Publicado: (2025)
The Academic Climate Problem: Why Women Leave Higher Ed and What Leaders Must Change
por: Autumn A. Arnett
Publicado: (2026)
por: Autumn A. Arnett
Publicado: (2026)
Not quite Sherlock Holmes: Language model predictions do not reliably differentiate impossible from improbable events
por: Michaelov, James A., et al.
Publicado: (2025)
por: Michaelov, James A., et al.
Publicado: (2025)
Toward a Theory of Generalizability in LLM Mechanistic Interpretability Research
por: Trott, Sean
Publicado: (2025)
por: Trott, Sean
Publicado: (2025)
Turing Jest: Distributional Semantics and One‐Line Jokes
por: Sean Trott, et al.
Publicado: (2025)
por: Sean Trott, et al.
Publicado: (2025)
Does GPT-4 pass the Turing test?
por: Jones, Cameron R., et al.
Publicado: (2023)
por: Jones, Cameron R., et al.
Publicado: (2023)
Lies, Damned Lies, and Distributional Language Statistics: Persuasion and Deception with Large Language Models
por: Jones, Cameron R., et al.
Publicado: (2024)
por: Jones, Cameron R., et al.
Publicado: (2024)
Large Language Models Pass the Turing Test
por: Jones, Cameron R., et al.
Publicado: (2025)
por: Jones, Cameron R., et al.
Publicado: (2025)
People cannot distinguish GPT-4 from a human in a Turing test
por: Jones, Cameron R., et al.
Publicado: (2024)
por: Jones, Cameron R., et al.
Publicado: (2024)
Opinion: How to double down on DEI at your institution
por: Autumn A. Arnett
Publicado: (2025)
por: Autumn A. Arnett
Publicado: (2025)
Opinion: How to double down on DEI at your institution
por: Autumn A. Arnett
Publicado: (2025)
por: Autumn A. Arnett
Publicado: (2025)
How to Do Diversity When You Can't Say Diversity
por: Autumn A. Arnett
Publicado: (2025)
por: Autumn A. Arnett
Publicado: (2025)
GPT-4 is judged more human than humans in displaced and inverted Turing tests
por: Rathi, Ishika, et al.
Publicado: (2024)
por: Rathi, Ishika, et al.
Publicado: (2024)
Toxicity of the Commons: Curating Open-Source Pre-Training Data
por: Arnett, Catherine, et al.
Publicado: (2024)
por: Arnett, Catherine, et al.
Publicado: (2024)
Column: How to do diversity when you can’t say diversity
por: Autumn A. Arnett
Publicado: (2025)
por: Autumn A. Arnett
Publicado: (2025)
The Public Mapping Project
por: McDonald, Michael P., et al.
Publicado: (2023)
por: McDonald, Michael P., et al.
Publicado: (2023)
Advancement Services Must Embrace AI—Not Apologize for It
por: Pamela Mitchell
Publicado: (2025)
por: Pamela Mitchell
Publicado: (2025)
Leading without the script: How a first‐gen president rewrites what higher ed can be
por: Autumn A. Arnett
Publicado: (2026)
por: Autumn A. Arnett
Publicado: (2026)
Leading Without the Script: How a First‐Gen President Rewrites What Higher Ed Can Be
por: Autumn A. Arnett
Publicado: (2026)
por: Autumn A. Arnett
Publicado: (2026)
Leading without the Script: How a First‐Gen President Rewrites What Higher Ed Can Be
por: Autumn A. Arnett
Publicado: (2026)
por: Autumn A. Arnett
Publicado: (2026)
Leading without the Script: How a First‐Gen President Rewrites What Higher Ed Can Be
por: Autumn A. Arnett
Publicado: (2025)
por: Autumn A. Arnett
Publicado: (2025)
Do language models capture implied discourse meanings? An investigation with exhaustivity implicatures of Korean morphology
por: Shin, Hagyeong, et al.
Publicado: (2024)
por: Shin, Hagyeong, et al.
Publicado: (2024)
Do Large Language Models Exhibit Spontaneous Rational Deception?
por: Taylor, Samuel M., et al.
Publicado: (2025)
por: Taylor, Samuel M., et al.
Publicado: (2025)
Bigram Subnetworks: Mapping to Next Tokens in Transformer Language Models
por: Chang, Tyler A., et al.
Publicado: (2025)
por: Chang, Tyler A., et al.
Publicado: (2025)
Ejemplares similares
-
Language Statistics and False Belief Reasoning: Evidence from 41 Open-Weight LMs
por: Trott, Sean, et al.
Publicado: (2026) -
Different Tokenization Schemes Lead to Comparable Performance in Spanish Number Agreement
por: Arnett, Catherine, et al.
Publicado: (2024) -
Revenge of the Fallen? Recurrent Models Match Transformers at Predicting Human Language Comprehension Metrics
por: Michaelov, James A., et al.
Publicado: (2024) -
On the Acquisition of Shared Grammatical Representations in Bilingual Language Models
por: Arnett, Catherine, et al.
Publicado: (2025) -
Disaggregation Reveals Hidden Training Dynamics: The Case of Agreement Attraction
por: Michaelov, James A., et al.
Publicado: (2025)