The KoLMogorov Test: Compression by Code Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yoran, Ori, Zheng, Kunhao, Gloeckle, Fabian, Gehring, Jonas, Synnaeve, Gabriel, Cohen, Taco |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
What Makes Large Language Models Reason in (Multi-Turn) Code Generation?
par: Zheng, Kunhao, et autres
Publié: (2024)
par: Zheng, Kunhao, et autres
Publié: (2024)
RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning
par: Gehring, Jonas, et autres
Publié: (2024)
par: Gehring, Jonas, et autres
Publié: (2024)
Extrapolative Weight Averaging Reveals Correctness-Efficiency Frontiers in Code RL
par: Zheng, Kunhao, et autres
Publié: (2026)
par: Zheng, Kunhao, et autres
Publié: (2026)
Better & Faster Large Language Models via Multi-token Prediction
par: Gloeckle, Fabian, et autres
Publié: (2024)
par: Gloeckle, Fabian, et autres
Publié: (2024)
Making Retrieval-Augmented Language Models Robust to Irrelevant Context
par: Yoran, Ori, et autres
Publié: (2023)
par: Yoran, Ori, et autres
Publié: (2023)
Self-Execution Simulation Improves Coding Models
par: Maimon, Gallil, et autres
Publié: (2026)
par: Maimon, Gallil, et autres
Publié: (2026)
Preventing Rogue Agents Improves Multi-Agent Collaboration
par: Barbi, Ohav, et autres
Publié: (2025)
par: Barbi, Ohav, et autres
Publié: (2025)
WybeCoder: Verified Imperative Code Generation
par: Gloeckle, Fabian, et autres
Publié: (2026)
par: Gloeckle, Fabian, et autres
Publié: (2026)
From Loops to Oops: Fallback Behaviors of Language Models Under Uncertainty
par: Ivgi, Maor, et autres
Publié: (2024)
par: Ivgi, Maor, et autres
Publié: (2024)
A Deep Dive into Scaling RL for Code Generation with Synthetic Data and Curricula
par: Sancaktar, Cansu, et autres
Publié: (2026)
par: Sancaktar, Cansu, et autres
Publié: (2026)
BigO(Bench) -- Can LLMs Generate Code with Controlled Time and Space Complexity?
par: Chambon, Pierre, et autres
Publié: (2025)
par: Chambon, Pierre, et autres
Publié: (2025)
Code Llama: Open Foundation Models for Code
par: Rozière, Baptiste, et autres
Publié: (2023)
par: Rozière, Baptiste, et autres
Publié: (2023)
Soft Policy Optimization: Online Off-Policy RL for Sequence Models
par: Cohen, Taco, et autres
Publié: (2025)
par: Cohen, Taco, et autres
Publié: (2025)
LMEnt: A Suite for Analyzing Knowledge in Language Models from Pretraining Data to Representations
par: Gottesman, Daniela, et autres
Publié: (2025)
par: Gottesman, Daniela, et autres
Publié: (2025)
AssistantBench: Can Web Agents Solve Realistic and Time-Consuming Tasks?
par: Yoran, Ori, et autres
Publié: (2024)
par: Yoran, Ori, et autres
Publié: (2024)
Getting the most out of your tokenizer for pre-training and domain adaptation
par: Dagan, Gautier, et autres
Publié: (2024)
par: Dagan, Gautier, et autres
Publié: (2024)
Answering Questions by Meta-Reasoning over Multiple Chains of Thought
par: Yoran, Ori, et autres
Publié: (2023)
par: Yoran, Ori, et autres
Publié: (2023)
The Larger the Better? Improved LLM Code-Generation via Budget Reallocation
par: Hassid, Michael, et autres
Publié: (2024)
par: Hassid, Michael, et autres
Publié: (2024)
Meta Large Language Model Compiler: Foundation Models of Compiler Optimization
par: Cummins, Chris, et autres
Publié: (2024)
par: Cummins, Chris, et autres
Publié: (2024)
Toward Training Superintelligent Software Agents through Self-Play SWE-RL
par: Wei, Yuxiang, et autres
Publié: (2025)
par: Wei, Yuxiang, et autres
Publié: (2025)
Don't Overthink it. Preferring Shorter Thinking Chains for Improved LLM Reasoning
par: Hassid, Michael, et autres
Publié: (2025)
par: Hassid, Michael, et autres
Publié: (2025)
Measuring the Effect of Transcription Noise on Downstream Language Understanding Tasks
par: Shapira, Ori, et autres
Publié: (2025)
par: Shapira, Ori, et autres
Publié: (2025)
Towards a Neural Debugger for Python
par: Beck, Maximilian, et autres
Publié: (2026)
par: Beck, Maximilian, et autres
Publié: (2026)
CodeIt: Self-Improving Language Models with Prioritized Hindsight Replay
par: Butt, Natasha, et autres
Publié: (2024)
par: Butt, Natasha, et autres
Publié: (2024)
Optimizing Language Models for Inference Time Objectives using Reinforcement Learning
par: Tang, Yunhao, et autres
Publié: (2025)
par: Tang, Yunhao, et autres
Publié: (2025)
Scaling Test-Time Compute for Agentic Coding
par: Kim, Joongwon, et autres
Publié: (2026)
par: Kim, Joongwon, et autres
Publié: (2026)
Is Compression Really Linear with Code Intelligence?
par: Xuyang, Shijie, et autres
Publié: (2025)
par: Xuyang, Shijie, et autres
Publié: (2025)
Assessing LLM Text Detection in Educational Contexts: Does Human Contribution Affect Detection?
par: Gehring, Lukas, et autres
Publié: (2025)
par: Gehring, Lukas, et autres
Publié: (2025)
Open Ko-LLM Leaderboard: Evaluating Large Language Models in Korean with Ko-H5 Benchmark
par: Park, Chanjun, et autres
Publié: (2024)
par: Park, Chanjun, et autres
Publié: (2024)
KoBALT: Korean Benchmark For Advanced Linguistic Tasks
par: Shin, Hyopil, et autres
Publié: (2025)
par: Shin, Hyopil, et autres
Publié: (2025)
Rethinking Verification for LLM Code Generation: From Generation to Testing
par: Ma, Zihan, et autres
Publié: (2025)
par: Ma, Zihan, et autres
Publié: (2025)
How Many Code and Test Cases Are Enough? Evaluating Test Cases Generation from a Binary-Matrix Perspective
par: Luo, Xianzhen, et autres
Publié: (2025)
par: Luo, Xianzhen, et autres
Publié: (2025)
LILO: Learning Interpretable Libraries by Compressing and Documenting Code
par: Grand, Gabriel, et autres
Publié: (2023)
par: Grand, Gabriel, et autres
Publié: (2023)
Fine-Tuning Pre-Trained Code Models for AI-Generated Code Detection
par: Ispas, Jany-Gabriel, et autres
Publié: (2026)
par: Ispas, Jany-Gabriel, et autres
Publié: (2026)
CodeGENCAT: Generative Computerized Adaptive Testing for Open-ended Coding Problems
par: Feng, Wanyong, et autres
Publié: (2026)
par: Feng, Wanyong, et autres
Publié: (2026)
KoRe: Compact Knowledge Representations for Large Language Models
par: Cavicchini, Davide, et autres
Publié: (2026)
par: Cavicchini, Davide, et autres
Publié: (2026)
TriBench-Ko: Evaluating LLM Risks in Judicial Workflows
par: Lee, Haesung, et autres
Publié: (2026)
par: Lee, Haesung, et autres
Publié: (2026)
Information Types in Product Reviews
par: Shapira, Ori, et autres
Publié: (2025)
par: Shapira, Ori, et autres
Publié: (2025)
SWE-bench Multimodal: Do AI Systems Generalize to Visual Software Domains?
par: Yang, John, et autres
Publié: (2024)
par: Yang, John, et autres
Publié: (2024)
CodeComp: Structural KV Cache Compression for Agentic Coding
par: Chen, Qiujiang, et autres
Publié: (2026)
par: Chen, Qiujiang, et autres
Publié: (2026)
Documents similaires
-
What Makes Large Language Models Reason in (Multi-Turn) Code Generation?
par: Zheng, Kunhao, et autres
Publié: (2024) -
RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning
par: Gehring, Jonas, et autres
Publié: (2024) -
Extrapolative Weight Averaging Reveals Correctness-Efficiency Frontiers in Code RL
par: Zheng, Kunhao, et autres
Publié: (2026) -
Better & Faster Large Language Models via Multi-token Prediction
par: Gloeckle, Fabian, et autres
Publié: (2024) -
Making Retrieval-Augmented Language Models Robust to Irrelevant Context
par: Yoran, Ori, et autres
Publié: (2023)