LongCodeBench: Evaluating Coding LLMs at 1M Context Windows
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Rando, Stefano, Romani, Luca, Sampieri, Alessio, Franco, Luca, Yang, John, Kyuragi, Yuta, Galasso, Fabio, Hashimoto, Tatsunori |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SeRpEnt: Selective Resampling for Expressive State Space Models
par: Rando, Stefano, et autres
Publié: (2025)
par: Rando, Stefano, et autres
Publié: (2025)
CaTS-Bench: Can Language Models Describe Time Series?
par: Zhou, Luca, et autres
Publié: (2025)
par: Zhou, Luca, et autres
Publié: (2025)
CodeMixBench: Evaluating Code-Mixing Capabilities of LLMs Across 18 Languages
par: Yang, Yilun, et autres
Publié: (2025)
par: Yang, Yilun, et autres
Publié: (2025)
Length-Aware Motion Synthesis via Latent Diffusion
par: Sampieri, Alessio, et autres
Publié: (2024)
par: Sampieri, Alessio, et autres
Publié: (2024)
Social EgoMesh Estimation
par: Scofano, Luca, et autres
Publié: (2024)
par: Scofano, Luca, et autres
Publié: (2024)
MolViBench: Evaluating LLMs on Molecular Vibe Coding
par: Li, Jiatong, et autres
Publié: (2026)
par: Li, Jiatong, et autres
Publié: (2026)
About latent roles in forecasting players in team sports
par: Scofano, Luca, et autres
Publié: (2023)
par: Scofano, Luca, et autres
Publié: (2023)
PerfCodeBench: Benchmarking LLMs for System-Level High-Performance Code Optimization
par: Jing, Huihao, et autres
Publié: (2026)
par: Jing, Huihao, et autres
Publié: (2026)
Can LLMs Generate Novel Research Ideas? A Large-Scale Human Study with 100+ NLP Researchers
par: Si, Chenglei, et autres
Publié: (2024)
par: Si, Chenglei, et autres
Publié: (2024)
RepoQA: Evaluating Long Context Code Understanding
par: Liu, Jiawei, et autres
Publié: (2024)
par: Liu, Jiawei, et autres
Publié: (2024)
Learning When to Attend: Conditional Memory Access for Long-Context LLMs
par: Choudhary, Sakshi, et autres
Publié: (2026)
par: Choudhary, Sakshi, et autres
Publié: (2026)
LongCodeZip: Compress Long Context for Code Language Models
par: Shi, Yuling, et autres
Publié: (2025)
par: Shi, Yuling, et autres
Publié: (2025)
Linguistic Calibration of Long-Form Generations
par: Band, Neil, et autres
Publié: (2024)
par: Band, Neil, et autres
Publié: (2024)
Language Models with Conformal Factuality Guarantees
par: Mohri, Christopher, et autres
Publié: (2024)
par: Mohri, Christopher, et autres
Publié: (2024)
LongGenBench: Benchmarking Long-Form Generation in Long Context LLMs
par: Wu, Yuhao, et autres
Publié: (2024)
par: Wu, Yuhao, et autres
Publié: (2024)
LLMs for Science: Usage for Code Generation and Data Analysis
par: Nejjar, Mohamed, et autres
Publié: (2023)
par: Nejjar, Mohamed, et autres
Publié: (2023)
NL2Repo-Bench: Towards Long-Horizon Repository Generation Evaluation of Coding Agents
par: Ding, Jingzhe, et autres
Publié: (2025)
par: Ding, Jingzhe, et autres
Publié: (2025)
Following the Human Thread in Social Navigation
par: Scofano, Luca, et autres
Publié: (2024)
par: Scofano, Luca, et autres
Publié: (2024)
Putting It All into Context: Simplifying Agents with LCLMs
par: Jiang, Mingjian, et autres
Publié: (2025)
par: Jiang, Mingjian, et autres
Publié: (2025)
Evaluating and Aligning CodeLLMs on Human Preference
par: Yang, Jian, et autres
Publié: (2024)
par: Yang, Jian, et autres
Publié: (2024)
Evaluation of Code LLMs on Geospatial Code Generation
par: Gramacki, Piotr, et autres
Publié: (2024)
par: Gramacki, Piotr, et autres
Publié: (2024)
ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code
par: Hua, Tianyu, et autres
Publié: (2025)
par: Hua, Tianyu, et autres
Publié: (2025)
CS3-Bench: Evaluating and Enhancing Speech-to-Speech LLMs for Mandarin-English Code-Switching
par: Liu, Heyang, et autres
Publié: (2025)
par: Liu, Heyang, et autres
Publié: (2025)
CodeMixBench: Evaluating Large Language Models on Code Generation with Code-Mixed Prompts
par: Sheokand, Manik, et autres
Publié: (2025)
par: Sheokand, Manik, et autres
Publié: (2025)
Hierarchical Context Pruning: Optimizing Real-World Code Completion with Repository-Level Pretrained Code LLMs
par: Zhang, Lei, et autres
Publié: (2024)
par: Zhang, Lei, et autres
Publié: (2024)
The Extractive-Abstractive Spectrum: Uncovering Verifiability Trade-offs in LLM Generations
par: Worledge, Theodora, et autres
Publié: (2024)
par: Worledge, Theodora, et autres
Publié: (2024)
CoRet: Improved Retriever for Code Editing
par: Fehr, Fabio, et autres
Publié: (2025)
par: Fehr, Fabio, et autres
Publié: (2025)
EvoCodeBench: An Evolving Code Generation Benchmark with Domain-Specific Evaluations
par: Li, Jia, et autres
Publié: (2024)
par: Li, Jia, et autres
Publié: (2024)
ExecRepoBench: Multi-level Executable Code Completion Evaluation
par: Yang, Jian, et autres
Publié: (2024)
par: Yang, Jian, et autres
Publié: (2024)
CatCode: A Comprehensive Evaluation Framework for LLMs On the Mixture of Code and Text
par: Lin, Zhenru, et autres
Publié: (2024)
par: Lin, Zhenru, et autres
Publié: (2024)
100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?
par: Yang, Wang, et autres
Publié: (2025)
par: Yang, Wang, et autres
Publié: (2025)
Coding Agents are Effective Long-Context Processors
par: Cao, Weili, et autres
Publié: (2026)
par: Cao, Weili, et autres
Publié: (2026)
Agentic Adversarial QA for Improving Domain-Specific LLMs
par: Grari, Vincent, et autres
Publié: (2026)
par: Grari, Vincent, et autres
Publié: (2026)
Benchmarking Distributional Alignment of Large Language Models
par: Meister, Nicole, et autres
Publié: (2024)
par: Meister, Nicole, et autres
Publié: (2024)
Understanding Finetuning for Factual Knowledge Extraction
par: Ghosal, Gaurav, et autres
Publié: (2024)
par: Ghosal, Gaurav, et autres
Publié: (2024)
Improving Pretraining Data Using Perplexity Correlations
par: Thrush, Tristan, et autres
Publié: (2024)
par: Thrush, Tristan, et autres
Publié: (2024)
Extending LLMs' Context Window with 100 Samples
par: Zhang, Yikai, et autres
Publié: (2024)
par: Zhang, Yikai, et autres
Publié: (2024)
Evaluating In-Context Learning of Libraries for Code Generation
par: Patel, Arkil, et autres
Publié: (2023)
par: Patel, Arkil, et autres
Publié: (2023)
Characterizing Information Shared by Participants to Coding Challenges: The Case of Advent of Code
par: Cauteruccio, Francesco, et autres
Publié: (2024)
par: Cauteruccio, Francesco, et autres
Publié: (2024)
Evaluating Long Range Dependency Handling in Code Generation LLMs
par: Assogba, Yannick, et autres
Publié: (2024)
par: Assogba, Yannick, et autres
Publié: (2024)
Documents similaires
-
SeRpEnt: Selective Resampling for Expressive State Space Models
par: Rando, Stefano, et autres
Publié: (2025) -
CaTS-Bench: Can Language Models Describe Time Series?
par: Zhou, Luca, et autres
Publié: (2025) -
CodeMixBench: Evaluating Code-Mixing Capabilities of LLMs Across 18 Languages
par: Yang, Yilun, et autres
Publié: (2025) -
Length-Aware Motion Synthesis via Latent Diffusion
par: Sampieri, Alessio, et autres
Publié: (2024) -
Social EgoMesh Estimation
par: Scofano, Luca, et autres
Publié: (2024)