InteractScience: Programmatic and Visually-Grounded Evaluation of Interactive Scientific Demonstration Code Generation
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, Qiaosheng, Liu, Yang, Li, Lei, Chen, Kai, Guo, Qipeng, Cheng, Gong, Yuan, Fei |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
JanusCoder: Towards a Foundational Visual-Programmatic Interface for Code Intelligence
by: Sun, Qiushi, et al.
Published: (2025)
by: Sun, Qiushi, et al.
Published: (2025)
CodeEvo: Interaction-Driven Synthesis of Code-centric Data through Hybrid and Iterative Feedback
by: Sun, Qiushi, et al.
Published: (2025)
by: Sun, Qiushi, et al.
Published: (2025)
ArtifactsBench: Bridging the Visual-Interactive Gap in LLM Code Generation Evaluation
by: Zhang, Chenchen, et al.
Published: (2025)
by: Zhang, Chenchen, et al.
Published: (2025)
Rethinking Scientific Modeling: Toward Physically Consistent and Simulation-Executable Programmatic Generation
by: Jiang, Yongqing, et al.
Published: (2026)
by: Jiang, Yongqing, et al.
Published: (2026)
Evaluating the Effectiveness and Efficiency of Demonstration Retrievers in RAG for Coding Tasks
by: He, Pengfei, et al.
Published: (2024)
by: He, Pengfei, et al.
Published: (2024)
LLM-Based Test-Driven Interactive Code Generation: User Study and Empirical Evaluation
by: Fakhoury, Sarah, et al.
Published: (2024)
by: Fakhoury, Sarah, et al.
Published: (2024)
CFCEval: Evaluating Security Aspects in Code Generated by Large Language Models
by: Cheng, Cheng, et al.
Published: (2025)
by: Cheng, Cheng, et al.
Published: (2025)
Benchmarking Multimodal LLMs on Code Generation for Complex Interactive Webpages
by: Wu, Fan, et al.
Published: (2026)
by: Wu, Fan, et al.
Published: (2026)
ChangePrism: Visualizing the Essence of Code Changes
by: Chen, Lei, et al.
Published: (2025)
by: Chen, Lei, et al.
Published: (2025)
BenchCAD: A Comprehensive, Industry-Standard Benchmark for Programmatic CAD
by: Zhang, Haozhe, et al.
Published: (2026)
by: Zhang, Haozhe, et al.
Published: (2026)
PSD2Code: Automated Front-End Code Generation from Design Files via Multimodal Large Language Models
by: Chen, Yongxi, et al.
Published: (2025)
by: Chen, Yongxi, et al.
Published: (2025)
ZeroCoder: Can LLMs Improve Code Generation Without Ground-Truth Supervision?
by: Fan, Lishui, et al.
Published: (2026)
by: Fan, Lishui, et al.
Published: (2026)
UnitCoder: Scalable Iterative Code Synthesis with Unit Test Guidance
by: Ma, Yichuan, et al.
Published: (2025)
by: Ma, Yichuan, et al.
Published: (2025)
An Empirical Study of Interaction Smells in Multi-Turn Human-LLM Collaborative Code Generation
by: Zhang, Binquan, et al.
Published: (2026)
by: Zhang, Binquan, et al.
Published: (2026)
Synthesizing Efficient and Permissive Programmatic Runtime Shields for Neural Policies
by: Shi, Jieke, et al.
Published: (2024)
by: Shi, Jieke, et al.
Published: (2024)
SPROUT: an Interactive Authoring Tool for Generating Programming Tutorials with the Visualization of Large Language Models
by: Liu, Yihan, et al.
Published: (2023)
by: Liu, Yihan, et al.
Published: (2023)
Toward Automated and Trustworthy Scientific Analysis and Visualization with LLM-Generated Code
by: Chakroborti, Apu Kumar, et al.
Published: (2025)
by: Chakroborti, Apu Kumar, et al.
Published: (2025)
V-GameGym: Visual Game Generation for Code Large Language Models
by: Zhang, Wei, et al.
Published: (2025)
by: Zhang, Wei, et al.
Published: (2025)
SolContractEval: A Benchmark for Evaluating Contract-Level Solidity Code Generation
by: Ye, Zhifan, et al.
Published: (2025)
by: Ye, Zhifan, et al.
Published: (2025)
Revisiting Code Debloating with Ground Truth-based Evaluation
by: Bilal, Muhammad, et al.
Published: (2026)
by: Bilal, Muhammad, et al.
Published: (2026)
From Mirage to Grounding: Towards Reliable Multimodal Circuit-to-Verilog Code Generation
by: Yang, Guang, et al.
Published: (2026)
by: Yang, Guang, et al.
Published: (2026)
CodeIF-Bench: Evaluating Instruction-Following Capabilities of Large Language Models in Interactive Code Generation
by: Wang, Peiding, et al.
Published: (2025)
by: Wang, Peiding, et al.
Published: (2025)
GeoJSEval: An Automated Evaluation Framework for Large Language Models on JavaScript-Based Geospatial Computation and Visualization Code Generation
by: Chen, Guanyu, et al.
Published: (2025)
by: Chen, Guanyu, et al.
Published: (2025)
Demonstration Attack against In-Context Learning for Code Intelligence
by: Ge, Yifei, et al.
Published: (2024)
by: Ge, Yifei, et al.
Published: (2024)
ConAIR:Consistency-Augmented Iterative Interaction Framework to Enhance the Reliability of Code Generation
by: Dong, Jinhao, et al.
Published: (2024)
by: Dong, Jinhao, et al.
Published: (2024)
What Makes Good In-context Demonstrations for Code Intelligence Tasks with LLMs?
by: Gao, Shuzheng, et al.
Published: (2023)
by: Gao, Shuzheng, et al.
Published: (2023)
Less is More: DocString Compression in Code Generation
by: Yang, Guang, et al.
Published: (2024)
by: Yang, Guang, et al.
Published: (2024)
Can LLMs Solve Science or Just Write Code? Evaluating Quantum Solver Generation
by: Baresi, Luciano, et al.
Published: (2026)
by: Baresi, Luciano, et al.
Published: (2026)
DSCodeBench: A Realistic Benchmark for Data Science Code Generation
by: Ouyang, Shuyin, et al.
Published: (2025)
by: Ouyang, Shuyin, et al.
Published: (2025)
Toward Inclusive AI-Driven Development: Exploring Gender Differences in Code Generation Tool Interactions
by: Basha, Manaal, et al.
Published: (2025)
by: Basha, Manaal, et al.
Published: (2025)
Comment Traps: How Defective Commented-out Code Augment Defects in AI-Assisted Code Generation
by: Huang, Yuan, et al.
Published: (2025)
by: Huang, Yuan, et al.
Published: (2025)
Contextualized Code Pretraining for Code Generation
by: Liu, Chen, et al.
Published: (2026)
by: Liu, Chen, et al.
Published: (2026)
Exploring Code Comprehension in Scientific Programming: Preliminary Insights from Research Scientists
by: Chen, Alyssia, et al.
Published: (2025)
by: Chen, Alyssia, et al.
Published: (2025)
Evaluating Code Reasoning Abilities of Large Language Models Under Real-World Settings
by: Liu, Changshu, et al.
Published: (2025)
by: Liu, Changshu, et al.
Published: (2025)
A Survey on Evaluating Large Language Models in Code Generation Tasks
by: Chen, Liguo, et al.
Published: (2024)
by: Chen, Liguo, et al.
Published: (2024)
A Novel Taxonomy and Classification Scheme for Code Smell Interactions
by: Gupta, Ruchin, et al.
Published: (2025)
by: Gupta, Ruchin, et al.
Published: (2025)
Coding-PTMs: How to Find Optimal Code Pre-trained Models for Code Embedding in Vulnerability Detection?
by: Zhao, Yu, et al.
Published: (2024)
by: Zhao, Yu, et al.
Published: (2024)
SpecEval: Evaluating Code Comprehension in Large Language Models via Program Specifications
by: Ma, Lezhi, et al.
Published: (2024)
by: Ma, Lezhi, et al.
Published: (2024)
Interaction2Code: Benchmarking MLLM-based Interactive Webpage Code Generation from Interactive Prototyping
by: Xiao, Jingyu, et al.
Published: (2024)
by: Xiao, Jingyu, et al.
Published: (2024)
Modular Layout Synthesis (MLS): Front-end Code via Structure Normalization and Constrained Generation
by: Liu, Chong, et al.
Published: (2025)
by: Liu, Chong, et al.
Published: (2025)
Similar Items
-
JanusCoder: Towards a Foundational Visual-Programmatic Interface for Code Intelligence
by: Sun, Qiushi, et al.
Published: (2025) -
CodeEvo: Interaction-Driven Synthesis of Code-centric Data through Hybrid and Iterative Feedback
by: Sun, Qiushi, et al.
Published: (2025) -
ArtifactsBench: Bridging the Visual-Interactive Gap in LLM Code Generation Evaluation
by: Zhang, Chenchen, et al.
Published: (2025) -
Rethinking Scientific Modeling: Toward Physically Consistent and Simulation-Executable Programmatic Generation
by: Jiang, Yongqing, et al.
Published: (2026) -
Evaluating the Effectiveness and Efficiency of Demonstration Retrievers in RAG for Coding Tasks
by: He, Pengfei, et al.
Published: (2024)