SOCK: A Benchmark for Measuring Self-Replication in Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Chavarria, Justin, Raizada, Rohan, White, Justin, Alhetairshi, Eyad |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Guidance is All You Need: Temperature-Guided Reasoning in Large Language Models
by: Gomaa, Eyad, et al.
Published: (2024)
by: Gomaa, Eyad, et al.
Published: (2024)
OR-Bench: An Over-Refusal Benchmark for Large Language Models
by: Cui, Justin, et al.
Published: (2024)
by: Cui, Justin, et al.
Published: (2024)
Position: Theory of Mind Benchmarks are Broken for Large Language Models
by: Riemer, Matthew, et al.
Published: (2024)
by: Riemer, Matthew, et al.
Published: (2024)
GuessingGame: Measuring the Informativeness of Open-Ended Questions in Large Language Models
by: Hutson, Dylan, et al.
Published: (2025)
by: Hutson, Dylan, et al.
Published: (2025)
Quantifying Label-Induced Bias in Large Language Model Self- and Cross-Evaluations
by: Saraf, Muskan, et al.
Published: (2025)
by: Saraf, Muskan, et al.
Published: (2025)
PoliticsBench: Benchmarking Political Values in Large Language Models with Multi-Turn Roleplay
by: Khetan, Rohan, et al.
Published: (2026)
by: Khetan, Rohan, et al.
Published: (2026)
Investigating Persuasion Techniques in Arabic: An Empirical Study Leveraging Large Language Models
by: Alzahrani, Abdurahmman, et al.
Published: (2024)
by: Alzahrani, Abdurahmman, et al.
Published: (2024)
Beyond Output Correctness: Benchmarking and Evaluating Large Language Model Reasoning in Coding Tasks
by: Li, Yuangang, et al.
Published: (2026)
by: Li, Yuangang, et al.
Published: (2026)
Promises, Outlooks and Challenges of Diffusion Language Modeling
by: Deschenaux, Justin, et al.
Published: (2024)
by: Deschenaux, Justin, et al.
Published: (2024)
Pencil Puzzle Bench: A Benchmark for Multi-Step Verifiable Reasoning
by: Waugh, Justin
Published: (2026)
by: Waugh, Justin
Published: (2026)
Tractable Asymmetric Verification for Large Language Models via Deterministic Replicability
by: Chong, Zan-Kai, et al.
Published: (2025)
by: Chong, Zan-Kai, et al.
Published: (2025)
Language Model Council: Democratically Benchmarking Foundation Models on Highly Subjective Tasks
by: Zhao, Justin, et al.
Published: (2024)
by: Zhao, Justin, et al.
Published: (2024)
Measuring and Benchmarking Large Language Models' Capabilities to Generate Persuasive Language
by: Pauli, Amalie Brogaard, et al.
Published: (2024)
by: Pauli, Amalie Brogaard, et al.
Published: (2024)
GLaMoR: Consistency Checking of OWL Ontologies using Graph Language Models
by: Mücke, Justin, et al.
Published: (2025)
by: Mücke, Justin, et al.
Published: (2025)
Atari-GPT: Benchmarking Multimodal Large Language Models as Low-Level Policies in Atari Games
by: Waytowich, Nicholas R., et al.
Published: (2024)
by: Waytowich, Nicholas R., et al.
Published: (2024)
SPILDL: A Scalable and Parallel Inductive Learner in Description Logic
by: Algahtani, Eyad
Published: (2024)
by: Algahtani, Eyad
Published: (2024)
Self-Tuning Sparse Attention: Multi-Fidelity Hyperparameter Optimization for Transformer Acceleration
by: Dev, Arundhathi, et al.
Published: (2026)
by: Dev, Arundhathi, et al.
Published: (2026)
Measuring what Matters: Construct Validity in Large Language Model Benchmarks
by: Bean, Andrew M., et al.
Published: (2025)
by: Bean, Andrew M., et al.
Published: (2025)
Data Generation Using Large Language Models for Text Classification: An Empirical Case Study
by: Li, Yinheng, et al.
Published: (2024)
by: Li, Yinheng, et al.
Published: (2024)
Dynamic Code Orchestration: Harnessing the Power of Large Language Models for Adaptive Script Execution
by: Del Vecchio, Justin, et al.
Published: (2024)
by: Del Vecchio, Justin, et al.
Published: (2024)
A Survey on Uncertainty Quantification of Large Language Models: Taxonomy, Open Research Challenges, and Future Directions
by: Shorinwa, Ola, et al.
Published: (2024)
by: Shorinwa, Ola, et al.
Published: (2024)
Measuring the Measurers: Quality Evaluation of Hallucination Benchmarks for Large Vision-Language Models
by: Yan, Bei, et al.
Published: (2024)
by: Yan, Bei, et al.
Published: (2024)
ReplicatorBench: Benchmarking LLM Agents for Replicability in Social and Behavioral Sciences
by: Nguyen, Bang, et al.
Published: (2026)
by: Nguyen, Bang, et al.
Published: (2026)
HT-HEDL: High-Throughput Hypothesis Evaluation in Description Logic
by: Algahtani, Eyad
Published: (2024)
by: Algahtani, Eyad
Published: (2024)
Measuring Physical-World Privacy Awareness of Large Language Models: An Evaluation Benchmark
by: Shen, Xinjie, et al.
Published: (2025)
by: Shen, Xinjie, et al.
Published: (2025)
Evaluating Large Language Models for automatic analysis of teacher simulations
by: de-Fitero-Dominguez, David, et al.
Published: (2024)
by: de-Fitero-Dominguez, David, et al.
Published: (2024)
Towards Large Language Models that Benefit for All: Benchmarking Group Fairness in Reward Models
by: Song, Kefan, et al.
Published: (2025)
by: Song, Kefan, et al.
Published: (2025)
A Deep Dive Into Large Language Model Code Generation Mistakes: What and Why?
by: Chen, QiHong, et al.
Published: (2024)
by: Chen, QiHong, et al.
Published: (2024)
Benchmarking Reasoning Robustness in Large Language Models
by: Yu, Tong, et al.
Published: (2025)
by: Yu, Tong, et al.
Published: (2025)
Enterprise Large Language Model Evaluation Benchmark
by: Wang, Liya, et al.
Published: (2025)
by: Wang, Liya, et al.
Published: (2025)
Guided Discrete Diffusion for Constraint Satisfaction Problems
by: Jung, Justin
Published: (2025)
by: Jung, Justin
Published: (2025)
AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models
by: Lee, Jaeho, et al.
Published: (2025)
by: Lee, Jaeho, et al.
Published: (2025)
ConceptMath: A Bilingual Concept-wise Benchmark for Measuring Mathematical Reasoning of Large Language Models
by: Wu, Yanan, et al.
Published: (2024)
by: Wu, Yanan, et al.
Published: (2024)
Rationality Check! Benchmarking the Rationality of Large Language Models
by: Zhou, Zhilun, et al.
Published: (2025)
by: Zhou, Zhilun, et al.
Published: (2025)
Rethinking and Benchmarking Large Language Models for Graph Reasoning
by: Hu, Yuwei, et al.
Published: (2025)
by: Hu, Yuwei, et al.
Published: (2025)
Chinese Labor Law Large Language Model Benchmark
by: Lan, Zixun, et al.
Published: (2026)
by: Lan, Zixun, et al.
Published: (2026)
Into the Unknown: Self-Learning Large Language Models
by: Ferdinan, Teddy, et al.
Published: (2024)
by: Ferdinan, Teddy, et al.
Published: (2024)
Internalized Self-Correction for Large Language Models
by: Upadhyaya, Nishanth, et al.
Published: (2024)
by: Upadhyaya, Nishanth, et al.
Published: (2024)
PENDULUM: A Benchmark for Assessing Sycophancy in Multimodal Large Language Models
by: Rahman, A. B. M. Ashikur, et al.
Published: (2025)
by: Rahman, A. B. M. Ashikur, et al.
Published: (2025)
PetroBench: A Benchmark for Large Language Models in Petroleum Engineering
by: Wang, Xiang, et al.
Published: (2026)
by: Wang, Xiang, et al.
Published: (2026)
Similar Items
-
Guidance is All You Need: Temperature-Guided Reasoning in Large Language Models
by: Gomaa, Eyad, et al.
Published: (2024) -
OR-Bench: An Over-Refusal Benchmark for Large Language Models
by: Cui, Justin, et al.
Published: (2024) -
Position: Theory of Mind Benchmarks are Broken for Large Language Models
by: Riemer, Matthew, et al.
Published: (2024) -
GuessingGame: Measuring the Informativeness of Open-Ended Questions in Large Language Models
by: Hutson, Dylan, et al.
Published: (2025) -
Quantifying Label-Induced Bias in Large Language Model Self- and Cross-Evaluations
by: Saraf, Muskan, et al.
Published: (2025)