Do Papers Tell the Whole Story? A Benchmark and Framework for Uncovering Hidden Implementation Gaps in Bioinformatics
Fuente:
arXiv
Guardado en:
| Autores principales: | Xu, Tianxiang, Zhu, Xiaoyan, Lai, Xin, Dang, Sizhe, Lian, Xin, Cheng, Hangyu, Wang, Jiayin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
BioDefect: The First Dataset for Defect Detection in Bioinformatics Software
por: Xu, Tianxiang, et al.
Publicado: (2026)
por: Xu, Tianxiang, et al.
Publicado: (2026)
Does Pass Rate Tell the Whole Story? Evaluating Design Constraint Compliance in LLM-based Issue Resolution
por: Yu, Kai, et al.
Publicado: (2026)
por: Yu, Kai, et al.
Publicado: (2026)
Uncovering Weaknesses in Neural Code Generation
por: Lian, Xiaoli, et al.
Publicado: (2024)
por: Lian, Xiaoli, et al.
Publicado: (2024)
Verify Implementation Equivalence of Large Models
por: Zhan, Qi, et al.
Publicado: (2026)
por: Zhan, Qi, et al.
Publicado: (2026)
Uncovering Hidden Inclusions of Vulnerable Dependencies in Real-World Java Projects
por: Schott, Stefan, et al.
Publicado: (2026)
por: Schott, Stefan, et al.
Publicado: (2026)
Proxion: Uncovering Hidden Proxy Smart Contracts for Finding Collision Vulnerabilities in Ethereum
por: Chen, Cheng-Kang, et al.
Publicado: (2024)
por: Chen, Cheng-Kang, et al.
Publicado: (2024)
A novel instance‐based method for cross‐project just‐in‐time defect prediction
por: Xiaoyan Zhu, et al.
Publicado: (2024)
por: Xiaoyan Zhu, et al.
Publicado: (2024)
Revolutionizing Newcomers' Onboarding Process in OSS Communities: The Future AI Mentor
por: Tan, Xin, et al.
Publicado: (2025)
por: Tan, Xin, et al.
Publicado: (2025)
Position Paper: Programming Language Techniques for Bridging LLM Code Generation Semantic Gaps
por: Du, Yalong, et al.
Publicado: (2025)
por: Du, Yalong, et al.
Publicado: (2025)
Defects4Log: Benchmarking LLMs for Logging Code Defect Detection and Reasoning
por: Wang, Xin, et al.
Publicado: (2025)
por: Wang, Xin, et al.
Publicado: (2025)
Assessing and Advancing Benchmarks for Evaluating Large Language Models in Software Engineering Tasks
por: Hu, Xing, et al.
Publicado: (2025)
por: Hu, Xing, et al.
Publicado: (2025)
FEA-Bench: A Benchmark for Evaluating Repository-Level Code Generation for Feature Implementation
por: Li, Wei, et al.
Publicado: (2025)
por: Li, Wei, et al.
Publicado: (2025)
Securing High-Concurrency Ticket Sales: A Framework Based on Microservice
por: Zhang, Zhiyong, et al.
Publicado: (2025)
por: Zhang, Zhiyong, et al.
Publicado: (2025)
From Prompt to Pipeline: Large Language Models for Scientific Workflow Development in Bioinformatics
por: Alam, Khairul, et al.
Publicado: (2025)
por: Alam, Khairul, et al.
Publicado: (2025)
FuzzySQL: Uncovering Hidden Vulnerabilities in DBMS Special Features with LLM-Driven Fuzzing
por: Chen, Yongxin, et al.
Publicado: (2026)
por: Chen, Yongxin, et al.
Publicado: (2026)
Bridging the Gap Between Domain-specific Frameworks and Multiple Hardware Devices
por: Wen, Xu, et al.
Publicado: (2024)
por: Wen, Xu, et al.
Publicado: (2024)
RustRepoTrans: Repository-level Code Translation Benchmark Targeting Rust
por: Ou, Guangsheng, et al.
Publicado: (2024)
por: Ou, Guangsheng, et al.
Publicado: (2024)
RepoTransAgent: Multi-Agent LLM Framework for Repository-Aware Code Translation
por: Guan, Ziqi, et al.
Publicado: (2025)
por: Guan, Ziqi, et al.
Publicado: (2025)
A Benchmarking Framework for Model Datasets
por: Glaser, Philipp-Lorenz, et al.
Publicado: (2026)
por: Glaser, Philipp-Lorenz, et al.
Publicado: (2026)
CoReQA: Uncovering Potentials of Language Models in Code Repository Question Answering
por: Chen, Jialiang, et al.
Publicado: (2025)
por: Chen, Jialiang, et al.
Publicado: (2025)
Pros and Cons! Evaluating ChatGPT on Software Vulnerability
por: Yin, Xin
Publicado: (2024)
por: Yin, Xin
Publicado: (2024)
A Benchmark for Evaluating Repository-Level Code Agents with Intermediate Reasoning on Feature Addition Task
por: Liu, Shuhan, et al.
Publicado: (2026)
por: Liu, Shuhan, et al.
Publicado: (2026)
A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback
por: Duan, Guoliang, et al.
Publicado: (2025)
por: Duan, Guoliang, et al.
Publicado: (2025)
RepoMod-Bench: A Benchmark for Code Repository Modernization via Implementation-Agnostic Testing
por: Li, Xuefeng, et al.
Publicado: (2026)
por: Li, Xuefeng, et al.
Publicado: (2026)
A Unified, Cross-Platform Framework for Automatic GUI and Plugin Generation in Structural Bioinformatics and Beyond
por: Guo, Sikao, et al.
Publicado: (2026)
por: Guo, Sikao, et al.
Publicado: (2026)
SEALing the Gap: A Reference Framework for LLM Inference Carbon Estimation via Multi-Benchmark Driven Embodiment
por: Pathania, Priyavanshi, et al.
Publicado: (2026)
por: Pathania, Priyavanshi, et al.
Publicado: (2026)
XTrace: A Non-Invasive Dynamic Tracing Framework for Android Applications in Production
por: Hu, Qi, et al.
Publicado: (2025)
por: Hu, Qi, et al.
Publicado: (2025)
Designing and Implementing Robust Test Automation Frameworks using Cucumber BDD and Java
por: Srinivas, Srikanth, et al.
Publicado: (2025)
por: Srinivas, Srikanth, et al.
Publicado: (2025)
Beyond Pass/Fail: The Story of Learning-Based Testing
por: Rahman, Sheikh Md. Mushfiqur, et al.
Publicado: (2025)
por: Rahman, Sheikh Md. Mushfiqur, et al.
Publicado: (2025)
Hidden Licensing Risks in the LLMware Ecosystem
por: Wang, Bo, et al.
Publicado: (2026)
por: Wang, Bo, et al.
Publicado: (2026)
ComplexCodeEval: A Benchmark for Evaluating Large Code Models on More Complex Code
por: Feng, Jia, et al.
Publicado: (2024)
por: Feng, Jia, et al.
Publicado: (2024)
SolEval: Benchmarking Large Language Models for Repository-level Solidity Code Generation
por: Peng, Zhiyuan, et al.
Publicado: (2025)
por: Peng, Zhiyuan, et al.
Publicado: (2025)
CodeFlowBench: A Multi-turn, Iterative Benchmark for Complex Code Generation
por: Wang, Sizhe, et al.
Publicado: (2025)
por: Wang, Sizhe, et al.
Publicado: (2025)
MIRAGE: Online LLM Simulation for Microservice Dependency Testing
por: Zhang, XinRan
Publicado: (2026)
por: Zhang, XinRan
Publicado: (2026)
LLM-Guided Issue Generation from Uncovered Code Segments
por: Pressato, Diany, et al.
Publicado: (2026)
por: Pressato, Diany, et al.
Publicado: (2026)
Bridging Bug Localization and Issue Fixing: A Hierarchical Localization Framework Leveraging Large Language Models
por: Chang, Jianming, et al.
Publicado: (2025)
por: Chang, Jianming, et al.
Publicado: (2025)
Automating Android Build Repair: Bridging the Reasoning-Execution Gap in LLM Agents with Domain-Specific Tools
por: Son, Ha Min, et al.
Publicado: (2025)
por: Son, Ha Min, et al.
Publicado: (2025)
AndroidControl-Curated: Revealing the True Potential of GUI Agents through Benchmark Purification
por: Leung, Ho Fai, et al.
Publicado: (2025)
por: Leung, Ho Fai, et al.
Publicado: (2025)
AutoMerge: Search-Based Model Merging Framework for Effective Model Reuse
por: Lu, You, et al.
Publicado: (2026)
por: Lu, You, et al.
Publicado: (2026)
Lyra: A Benchmark for Turducken-Style Code Generation
por: Liang, Qingyuan, et al.
Publicado: (2021)
por: Liang, Qingyuan, et al.
Publicado: (2021)
Ejemplares similares
-
BioDefect: The First Dataset for Defect Detection in Bioinformatics Software
por: Xu, Tianxiang, et al.
Publicado: (2026) -
Does Pass Rate Tell the Whole Story? Evaluating Design Constraint Compliance in LLM-based Issue Resolution
por: Yu, Kai, et al.
Publicado: (2026) -
Uncovering Weaknesses in Neural Code Generation
por: Lian, Xiaoli, et al.
Publicado: (2024) -
Verify Implementation Equivalence of Large Models
por: Zhan, Qi, et al.
Publicado: (2026) -
Uncovering Hidden Inclusions of Vulnerable Dependencies in Real-World Java Projects
por: Schott, Stefan, et al.
Publicado: (2026)