From Charts to Code: A Hierarchical Benchmark for Multimodal Models
Fuente:
arXiv
Saved in:
| Main Authors: | Tang, Jiahao, Zhao, Henry Hengyuan, Wu, Lijian, Zhang, Zijian, Tao, Yifei, Mao, Dongxing, Wan, Yang, Tan, Jingru, Zeng, Min, Li, Min, Wang, Alex Jinpeng |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Chart2Code-MoLA: Efficient Multi-Modal Code Generation via Adaptive Expert Routing
by: Wang, Yifei, et al.
Published: (2025)
by: Wang, Yifei, et al.
Published: (2025)
From Code to Correctness: Closing the Last Mile of Code Generation with Hierarchical Debugging
by: Shi, Yuling, et al.
Published: (2024)
by: Shi, Yuling, et al.
Published: (2024)
COFFE: A Code Efficiency Benchmark for Code Generation
by: Peng, Yun, et al.
Published: (2025)
by: Peng, Yun, et al.
Published: (2025)
R2Code: A Self-Reflective LLM Framework for Requirements-to-Code Traceability
by: Wang, Yifei, et al.
Published: (2026)
by: Wang, Yifei, et al.
Published: (2026)
AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators
by: Chou, Jason, et al.
Published: (2025)
by: Chou, Jason, et al.
Published: (2025)
Figma2Code: Automating Multimodal Design to Code in the Wild
by: Gui, Yi, et al.
Published: (2026)
by: Gui, Yi, et al.
Published: (2026)
OmniGIRL: A Multilingual and Multimodal Benchmark for GitHub Issue Resolution
by: Guo, Lianghong, et al.
Published: (2025)
by: Guo, Lianghong, et al.
Published: (2025)
A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback
by: Duan, Guoliang, et al.
Published: (2025)
by: Duan, Guoliang, et al.
Published: (2025)
Benchmarking and Studying the LLM-based Code Review
by: Zeng, Zhengran, et al.
Published: (2025)
by: Zeng, Zhengran, et al.
Published: (2025)
Function-to-Style Guidance of LLMs for Code Translation
by: Zhang, Longhui, et al.
Published: (2025)
by: Zhang, Longhui, et al.
Published: (2025)
LONGCODEU: Benchmarking Long-Context Language Models on Long Code Understanding
by: Li, Jia, et al.
Published: (2025)
by: Li, Jia, et al.
Published: (2025)
UICopilot: Automating UI Synthesis via Hierarchical Code Generation from Webpage Designs
by: Gui, Yi, et al.
Published: (2025)
by: Gui, Yi, et al.
Published: (2025)
Benchmarking Multimodal LLMs on Code Generation for Complex Interactive Webpages
by: Wu, Fan, et al.
Published: (2026)
by: Wu, Fan, et al.
Published: (2026)
Demystifying and Assessing Code Understandability in Java Decompilation
by: Qin, Ruixin, et al.
Published: (2024)
by: Qin, Ruixin, et al.
Published: (2024)
RedCode: Risky Code Execution and Generation Benchmark for Code Agents
by: Guo, Chengquan, et al.
Published: (2024)
by: Guo, Chengquan, et al.
Published: (2024)
Enhancing Code LLMs with Reinforcement Learning in Code Generation: A Survey
by: Wang, Junqiao, et al.
Published: (2024)
by: Wang, Junqiao, et al.
Published: (2024)
Structured Safety Auditing for Balancing Code Correctness and Content Safety in LLM-Generated Code
by: Tan, Honghao, et al.
Published: (2026)
by: Tan, Honghao, et al.
Published: (2026)
Hybrid Privacy Policy-Code Consistency Check using Knowledge Graphs and LLMs
by: Mao, Zhenyu, et al.
Published: (2025)
by: Mao, Zhenyu, et al.
Published: (2025)
A Large-Scale Empirical Study of AI-Generated Code in Real-World Repositories
by: Mao, Tianhao, et al.
Published: (2026)
by: Mao, Tianhao, et al.
Published: (2026)
CodeBenchGen: Creating Scalable Execution-based Code Generation Benchmarks
by: Xie, Yiqing, et al.
Published: (2024)
by: Xie, Yiqing, et al.
Published: (2024)
MBFL-DKMR: Improving Mutation-based Fault Localization through Denoising-based Kill Matrix Refinement
by: Liu, Hengyuan, et al.
Published: (2025)
by: Liu, Hengyuan, et al.
Published: (2025)
GRACE: Graph-Guided Repository-Aware Code Completion through Hierarchical Code Fusion
by: Wang, Xingliang, et al.
Published: (2025)
by: Wang, Xingliang, et al.
Published: (2025)
MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios
by: Huang, Jinyang, et al.
Published: (2025)
by: Huang, Jinyang, et al.
Published: (2025)
Charting The Evolution of Solidity Error Handling
by: Mitropoulos, Charalambos, et al.
Published: (2024)
by: Mitropoulos, Charalambos, et al.
Published: (2024)
ProSoftArena: Benchmarking Hierarchical Capabilities of Multimodal Agents in Professional Software Environments
by: Ai, Jiaxin, et al.
Published: (2025)
by: Ai, Jiaxin, et al.
Published: (2025)
ComplexCodeEval: A Benchmark for Evaluating Large Code Models on More Complex Code
by: Feng, Jia, et al.
Published: (2024)
by: Feng, Jia, et al.
Published: (2024)
CoderEval: A Benchmark of Pragmatic Code Generation with Generative Pre-trained Models
by: Yu, Hao, et al.
Published: (2023)
by: Yu, Hao, et al.
Published: (2023)
SWE Context Bench: A Benchmark for Context Learning in Coding
by: Zhu, Jiayuan, et al.
Published: (2026)
by: Zhu, Jiayuan, et al.
Published: (2026)
CodeMMLU: A Multi-Task Benchmark for Assessing Code Understanding & Reasoning Capabilities of CodeLLMs
by: Manh, Dung Nguyen, et al.
Published: (2024)
by: Manh, Dung Nguyen, et al.
Published: (2024)
Development and Benchmarking of Multilingual Code Clone Detector
by: Zhu, Wenqing, et al.
Published: (2024)
by: Zhu, Wenqing, et al.
Published: (2024)
CRQBench: A Benchmark of Code Reasoning Questions
by: Dinella, Elizabeth, et al.
Published: (2024)
by: Dinella, Elizabeth, et al.
Published: (2024)
SWE-Bench+: Enhanced Coding Benchmark for LLMs
by: Aleithan, Reem, et al.
Published: (2024)
by: Aleithan, Reem, et al.
Published: (2024)
An Empirical Study of False Negatives and Positives of Static Code Analyzers From the Perspective of Historical Issues
by: Cui, Han, et al.
Published: (2024)
by: Cui, Han, et al.
Published: (2024)
LibEvolutionEval: A Benchmark and Study for Version-Specific Code Generation
by: Kuhar, Sachit, et al.
Published: (2024)
by: Kuhar, Sachit, et al.
Published: (2024)
Goedel-Code-Prover: Hierarchical Proof Search for Open State-of-the-Art Code Verification
by: Li, Zenan, et al.
Published: (2026)
by: Li, Zenan, et al.
Published: (2026)
Hierarchical Evaluation of Software Design Capabilities of Large Language Models of Code
by: Saad, Mootez, et al.
Published: (2025)
by: Saad, Mootez, et al.
Published: (2025)
ChartMark: A Structured Grammar for Chart Annotation
by: Chen, Yiyu, et al.
Published: (2025)
by: Chen, Yiyu, et al.
Published: (2025)
Deep Learning for Code Intelligence: Survey, Benchmark and Toolkit
by: Wan, Yao, et al.
Published: (2023)
by: Wan, Yao, et al.
Published: (2023)
CLARC: C/C++ Benchmark for Robust Code Search
by: Wang, Kaicheng, et al.
Published: (2026)
by: Wang, Kaicheng, et al.
Published: (2026)
A Benchmark for Localizing Code and Non-Code Issues in Software Projects
by: Zhang, Zejun, et al.
Published: (2025)
by: Zhang, Zejun, et al.
Published: (2025)
Similar Items
-
Chart2Code-MoLA: Efficient Multi-Modal Code Generation via Adaptive Expert Routing
by: Wang, Yifei, et al.
Published: (2025) -
From Code to Correctness: Closing the Last Mile of Code Generation with Hierarchical Debugging
by: Shi, Yuling, et al.
Published: (2024) -
COFFE: A Code Efficiency Benchmark for Code Generation
by: Peng, Yun, et al.
Published: (2025) -
R2Code: A Self-Reflective LLM Framework for Requirements-to-Code Traceability
by: Wang, Yifei, et al.
Published: (2026) -
AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators
by: Chou, Jason, et al.
Published: (2025)