LongCodeBench: Evaluating Coding LLMs at 1M Context Windows
Fuente:
arXiv
Guardado en:
| Autores principales: | Rando, Stefano, Romani, Luca, Sampieri, Alessio, Franco, Luca, Yang, John, Kyuragi, Yuta, Galasso, Fabio, Hashimoto, Tatsunori |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SeRpEnt: Selective Resampling for Expressive State Space Models
por: Rando, Stefano, et al.
Publicado: (2025)
por: Rando, Stefano, et al.
Publicado: (2025)
CaTS-Bench: Can Language Models Describe Time Series?
por: Zhou, Luca, et al.
Publicado: (2025)
por: Zhou, Luca, et al.
Publicado: (2025)
CodeMixBench: Evaluating Code-Mixing Capabilities of LLMs Across 18 Languages
por: Yang, Yilun, et al.
Publicado: (2025)
por: Yang, Yilun, et al.
Publicado: (2025)
Length-Aware Motion Synthesis via Latent Diffusion
por: Sampieri, Alessio, et al.
Publicado: (2024)
por: Sampieri, Alessio, et al.
Publicado: (2024)
Social EgoMesh Estimation
por: Scofano, Luca, et al.
Publicado: (2024)
por: Scofano, Luca, et al.
Publicado: (2024)
MolViBench: Evaluating LLMs on Molecular Vibe Coding
por: Li, Jiatong, et al.
Publicado: (2026)
por: Li, Jiatong, et al.
Publicado: (2026)
About latent roles in forecasting players in team sports
por: Scofano, Luca, et al.
Publicado: (2023)
por: Scofano, Luca, et al.
Publicado: (2023)
PerfCodeBench: Benchmarking LLMs for System-Level High-Performance Code Optimization
por: Jing, Huihao, et al.
Publicado: (2026)
por: Jing, Huihao, et al.
Publicado: (2026)
Can LLMs Generate Novel Research Ideas? A Large-Scale Human Study with 100+ NLP Researchers
por: Si, Chenglei, et al.
Publicado: (2024)
por: Si, Chenglei, et al.
Publicado: (2024)
RepoQA: Evaluating Long Context Code Understanding
por: Liu, Jiawei, et al.
Publicado: (2024)
por: Liu, Jiawei, et al.
Publicado: (2024)
Learning When to Attend: Conditional Memory Access for Long-Context LLMs
por: Choudhary, Sakshi, et al.
Publicado: (2026)
por: Choudhary, Sakshi, et al.
Publicado: (2026)
LongCodeZip: Compress Long Context for Code Language Models
por: Shi, Yuling, et al.
Publicado: (2025)
por: Shi, Yuling, et al.
Publicado: (2025)
Linguistic Calibration of Long-Form Generations
por: Band, Neil, et al.
Publicado: (2024)
por: Band, Neil, et al.
Publicado: (2024)
Language Models with Conformal Factuality Guarantees
por: Mohri, Christopher, et al.
Publicado: (2024)
por: Mohri, Christopher, et al.
Publicado: (2024)
LongGenBench: Benchmarking Long-Form Generation in Long Context LLMs
por: Wu, Yuhao, et al.
Publicado: (2024)
por: Wu, Yuhao, et al.
Publicado: (2024)
LLMs for Science: Usage for Code Generation and Data Analysis
por: Nejjar, Mohamed, et al.
Publicado: (2023)
por: Nejjar, Mohamed, et al.
Publicado: (2023)
NL2Repo-Bench: Towards Long-Horizon Repository Generation Evaluation of Coding Agents
por: Ding, Jingzhe, et al.
Publicado: (2025)
por: Ding, Jingzhe, et al.
Publicado: (2025)
Following the Human Thread in Social Navigation
por: Scofano, Luca, et al.
Publicado: (2024)
por: Scofano, Luca, et al.
Publicado: (2024)
Putting It All into Context: Simplifying Agents with LCLMs
por: Jiang, Mingjian, et al.
Publicado: (2025)
por: Jiang, Mingjian, et al.
Publicado: (2025)
Evaluating and Aligning CodeLLMs on Human Preference
por: Yang, Jian, et al.
Publicado: (2024)
por: Yang, Jian, et al.
Publicado: (2024)
Evaluation of Code LLMs on Geospatial Code Generation
por: Gramacki, Piotr, et al.
Publicado: (2024)
por: Gramacki, Piotr, et al.
Publicado: (2024)
ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code
por: Hua, Tianyu, et al.
Publicado: (2025)
por: Hua, Tianyu, et al.
Publicado: (2025)
CS3-Bench: Evaluating and Enhancing Speech-to-Speech LLMs for Mandarin-English Code-Switching
por: Liu, Heyang, et al.
Publicado: (2025)
por: Liu, Heyang, et al.
Publicado: (2025)
CodeMixBench: Evaluating Large Language Models on Code Generation with Code-Mixed Prompts
por: Sheokand, Manik, et al.
Publicado: (2025)
por: Sheokand, Manik, et al.
Publicado: (2025)
Hierarchical Context Pruning: Optimizing Real-World Code Completion with Repository-Level Pretrained Code LLMs
por: Zhang, Lei, et al.
Publicado: (2024)
por: Zhang, Lei, et al.
Publicado: (2024)
The Extractive-Abstractive Spectrum: Uncovering Verifiability Trade-offs in LLM Generations
por: Worledge, Theodora, et al.
Publicado: (2024)
por: Worledge, Theodora, et al.
Publicado: (2024)
CoRet: Improved Retriever for Code Editing
por: Fehr, Fabio, et al.
Publicado: (2025)
por: Fehr, Fabio, et al.
Publicado: (2025)
EvoCodeBench: An Evolving Code Generation Benchmark with Domain-Specific Evaluations
por: Li, Jia, et al.
Publicado: (2024)
por: Li, Jia, et al.
Publicado: (2024)
ExecRepoBench: Multi-level Executable Code Completion Evaluation
por: Yang, Jian, et al.
Publicado: (2024)
por: Yang, Jian, et al.
Publicado: (2024)
CatCode: A Comprehensive Evaluation Framework for LLMs On the Mixture of Code and Text
por: Lin, Zhenru, et al.
Publicado: (2024)
por: Lin, Zhenru, et al.
Publicado: (2024)
100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?
por: Yang, Wang, et al.
Publicado: (2025)
por: Yang, Wang, et al.
Publicado: (2025)
Coding Agents are Effective Long-Context Processors
por: Cao, Weili, et al.
Publicado: (2026)
por: Cao, Weili, et al.
Publicado: (2026)
Agentic Adversarial QA for Improving Domain-Specific LLMs
por: Grari, Vincent, et al.
Publicado: (2026)
por: Grari, Vincent, et al.
Publicado: (2026)
Benchmarking Distributional Alignment of Large Language Models
por: Meister, Nicole, et al.
Publicado: (2024)
por: Meister, Nicole, et al.
Publicado: (2024)
Understanding Finetuning for Factual Knowledge Extraction
por: Ghosal, Gaurav, et al.
Publicado: (2024)
por: Ghosal, Gaurav, et al.
Publicado: (2024)
Improving Pretraining Data Using Perplexity Correlations
por: Thrush, Tristan, et al.
Publicado: (2024)
por: Thrush, Tristan, et al.
Publicado: (2024)
Extending LLMs' Context Window with 100 Samples
por: Zhang, Yikai, et al.
Publicado: (2024)
por: Zhang, Yikai, et al.
Publicado: (2024)
Evaluating In-Context Learning of Libraries for Code Generation
por: Patel, Arkil, et al.
Publicado: (2023)
por: Patel, Arkil, et al.
Publicado: (2023)
Characterizing Information Shared by Participants to Coding Challenges: The Case of Advent of Code
por: Cauteruccio, Francesco, et al.
Publicado: (2024)
por: Cauteruccio, Francesco, et al.
Publicado: (2024)
Evaluating Long Range Dependency Handling in Code Generation LLMs
por: Assogba, Yannick, et al.
Publicado: (2024)
por: Assogba, Yannick, et al.
Publicado: (2024)
Ejemplares similares
-
SeRpEnt: Selective Resampling for Expressive State Space Models
por: Rando, Stefano, et al.
Publicado: (2025) -
CaTS-Bench: Can Language Models Describe Time Series?
por: Zhou, Luca, et al.
Publicado: (2025) -
CodeMixBench: Evaluating Code-Mixing Capabilities of LLMs Across 18 Languages
por: Yang, Yilun, et al.
Publicado: (2025) -
Length-Aware Motion Synthesis via Latent Diffusion
por: Sampieri, Alessio, et al.
Publicado: (2024) -
Social EgoMesh Estimation
por: Scofano, Luca, et al.
Publicado: (2024)