RepliBench: Evaluating the Autonomous Replication Capabilities of Language Model Agents
Fuente:
arXiv
Salvato in:
| Autori principali: | Black, Sid, Stickland, Asa Cooper, Pencharz, Jake, Sourbut, Oliver, Schmatz, Michael, Bailey, Jay, Matthews, Ollie, Millwood, Ben, Remedios, Alex, Cooney, Alan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
More Capable, Less Cooperative? When LLMs Fail At Zero-Cost Collaboration
di: Yadav, Advait, et al.
Pubblicazione: (2026)
di: Yadav, Advait, et al.
Pubblicazione: (2026)
Do Large Language Models Know What They Are Capable Of?
di: Barkan, Casey O., et al.
Pubblicazione: (2025)
di: Barkan, Casey O., et al.
Pubblicazione: (2025)
Async Control: Stress-testing Asynchronous Control Measures for LLM Agents
di: Stickland, Asa Cooper, et al.
Pubblicazione: (2025)
di: Stickland, Asa Cooper, et al.
Pubblicazione: (2025)
Does Unlearning Truly Unlearn? A Black Box Evaluation of LLM Unlearning Methods
di: Doshi, Jai, et al.
Pubblicazione: (2024)
di: Doshi, Jai, et al.
Pubblicazione: (2024)
Why Do Language Model Agents Whistleblow?
di: Agrawal, Kushal, et al.
Pubblicazione: (2025)
di: Agrawal, Kushal, et al.
Pubblicazione: (2025)
Future Events as Backdoor Triggers: Investigating Temporal Vulnerabilities in LLMs
di: Price, Sara, et al.
Pubblicazione: (2024)
di: Price, Sara, et al.
Pubblicazione: (2024)
Steering Without Side Effects: Improving Post-Deployment Control of Language Models
di: Stickland, Asa Cooper, et al.
Pubblicazione: (2024)
di: Stickland, Asa Cooper, et al.
Pubblicazione: (2024)
MonitoringBench: Semi-Automated Red-Teaming for Agent Monitoring
di: Jotautaitė, Monika, et al.
Pubblicazione: (2026)
di: Jotautaitė, Monika, et al.
Pubblicazione: (2026)
Cooperation and Control in Delegation Games
di: Sourbut, Oliver, et al.
Pubblicazione: (2024)
di: Sourbut, Oliver, et al.
Pubblicazione: (2024)
The Reversal Curse: LLMs trained on "A is B" fail to learn "B is A"
di: Berglund, Lukas, et al.
Pubblicazione: (2023)
di: Berglund, Lukas, et al.
Pubblicazione: (2023)
Propensity Inference: Environmental Contributors to LLM Behaviour
di: Järviniemi, Olli, et al.
Pubblicazione: (2026)
di: Järviniemi, Olli, et al.
Pubblicazione: (2026)
Age determination of sediment core SHEHEREE, Sheheree Bog, Ireland
di: Cooney, T
Pubblicazione: (2018)
di: Cooney, T
Pubblicazione: (2018)
ReplicationBench: Can AI Agents Replicate Astrophysics Research Papers?
di: Ye, Christine, et al.
Pubblicazione: (2025)
di: Ye, Christine, et al.
Pubblicazione: (2025)
ReplicatorBench: Benchmarking LLM Agents for Replicability in Social and Behavioral Sciences
di: Nguyen, Bang, et al.
Pubblicazione: (2026)
di: Nguyen, Bang, et al.
Pubblicazione: (2026)
Summing Up the Facts: Additive Mechanisms Behind Factual Recall in LLMs
di: Chughtai, Bilal, et al.
Pubblicazione: (2024)
di: Chughtai, Bilal, et al.
Pubblicazione: (2024)
MojitoProcessor: Postprocessing tools for LISA Mojito L01 data
di: Burke, Ollie
Pubblicazione: (2026)
di: Burke, Ollie
Pubblicazione: (2026)
MojitoProcessor
di: Burke, Ollie
Pubblicazione: (2026)
di: Burke, Ollie
Pubblicazione: (2026)
MojitoProcessor
di: Burke, Ollie
Pubblicazione: (2026)
di: Burke, Ollie
Pubblicazione: (2026)
Automatic Detection of Dark Ship-to-Ship Transfers using Deep Learning and Satellite Imagery
di: Ballinger, Ollie
Pubblicazione: (2024)
di: Ballinger, Ollie
Pubblicazione: (2024)
The moduli space of multi-monopoles on a Riemann surface
di: Thakar, Ollie
Pubblicazione: (2025)
di: Thakar, Ollie
Pubblicazione: (2025)
Open Access Battle Damage Detection via Pixel-Wise T-Test on Sentinel-1 Imagery
di: Ballinger, Ollie
Pubblicazione: (2024)
di: Ballinger, Ollie
Pubblicazione: (2024)
Entropy-Minimizing Diffeomorphisms on a $G_2$-Manifold
di: Thakar, Ollie
Pubblicazione: (2026)
di: Thakar, Ollie
Pubblicazione: (2026)
Combinatorial Proofs of Properties of Double-Point Enhanced Grid Homology
di: Thakar, Ollie
Pubblicazione: (2022)
di: Thakar, Ollie
Pubblicazione: (2022)
PaperBench: Evaluating AI's Ability to Replicate AI Research
di: Starace, Giulio, et al.
Pubblicazione: (2025)
di: Starace, Giulio, et al.
Pubblicazione: (2025)
Linguistic Uncertainty and Reply Engagement on X: A Cross-Domain Replication of the Uncertainty-Reply Asymmetry
di: Soufan, Mohamed
Pubblicazione: (2026)
di: Soufan, Mohamed
Pubblicazione: (2026)
Between‐ and Within‐Person Associations Between Serum Lipids and Adolescent Depressive Symptoms
di: Erika M. Manczak, et al.
Pubblicazione: (2025)
di: Erika M. Manczak, et al.
Pubblicazione: (2025)
Farmer Protests and Income Developments in the EU
di: Alan Matthews
Pubblicazione: (2024)
di: Alan Matthews
Pubblicazione: (2024)
Promoting Sustainable Agri‐food Trade: What the EU Can Do
di: Alan Matthews
Pubblicazione: (2026)
di: Alan Matthews
Pubblicazione: (2026)
Paper XXXVIII - Early-Universe Boundary Conditions under Empirically Constrained Operational Spacetime
di: Cooney, Paul
Pubblicazione: (2025)
di: Cooney, Paul
Pubblicazione: (2025)
The Certification Manifold - Dark Matter, Dispersion, and Cross-Channel Consistency
di: Cooney, Paul
Pubblicazione: (2026)
di: Cooney, Paul
Pubblicazione: (2026)
Paper XXVI - Cepheid Period Calibration in History-Dependent Operational Time
di: Cooney, Paul
Pubblicazione: (2025)
di: Cooney, Paul
Pubblicazione: (2025)
Quantum Mechanics Without Geometry
di: Cooney, Paul
Pubblicazione: (2026)
di: Cooney, Paul
Pubblicazione: (2026)
Paper XXXIII - Strong Gravitational Lensing Time Delays and Operational Time-Distance Structure
di: Cooney, Paul
Pubblicazione: (2025)
di: Cooney, Paul
Pubblicazione: (2025)
The Certification Budget of the Universe: Inflation, Dark Energy, and Gauge-Sector Expiry from a Decaying Accessibility Ceiling
di: Cooney, Paul
Pubblicazione: (2026)
di: Cooney, Paul
Pubblicazione: (2026)
Paper XI - Operational Time Regulation from Ordered Dynamics
di: Cooney, Paul
Pubblicazione: (2025)
di: Cooney, Paul
Pubblicazione: (2025)
A screened time-drag scalar field: percent-level late-time growth and the cosmic radio dipole excess
di: Cooney, Paul
Pubblicazione: (2025)
di: Cooney, Paul
Pubblicazione: (2025)
Frame Dissolution, the Certification Ceiling, and Observable Deformations
di: Cooney, Paul
Pubblicazione: (2026)
di: Cooney, Paul
Pubblicazione: (2026)
Frame Dissolution and the Planck Ceiling
di: Cooney, Paul
Pubblicazione: (2026)
di: Cooney, Paul
Pubblicazione: (2026)
Paper IV — Local Interactions and Potentials from Operational Locality
di: Cooney, Paul
Pubblicazione: (2025)
di: Cooney, Paul
Pubblicazione: (2025)
La caza de trofeos, la conservación y los medios de subsistencia rurales La caza de trofeos, la conservación y los medios de subsistencia rurales
di: Cooney, Rosie
Pubblicazione: (2016)
di: Cooney, Rosie
Pubblicazione: (2016)
Documenti analoghi
-
More Capable, Less Cooperative? When LLMs Fail At Zero-Cost Collaboration
di: Yadav, Advait, et al.
Pubblicazione: (2026) -
Do Large Language Models Know What They Are Capable Of?
di: Barkan, Casey O., et al.
Pubblicazione: (2025) -
Async Control: Stress-testing Asynchronous Control Measures for LLM Agents
di: Stickland, Asa Cooper, et al.
Pubblicazione: (2025) -
Does Unlearning Truly Unlearn? A Black Box Evaluation of LLM Unlearning Methods
di: Doshi, Jai, et al.
Pubblicazione: (2024) -
Why Do Language Model Agents Whistleblow?
di: Agrawal, Kushal, et al.
Pubblicazione: (2025)