WebCompass: Towards Multimodal Web Coding Evaluation for Code Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Lei, Xinping, Che, Xinyu, Xiong, Junqi, Zhang, Chenchen, Huang, Yukai, Zhou, Chenyu, Huang, Haoyang, Liu, Minghao, Zhu, Letian, Ye, Hongyi, Hao, Jinhua, Deng, Ken, Zhan, Zizheng, Li, Han, Li, Dailin, Yao, Yifan, Sun, Ming, Zhang, Zhaoxiang, Liu, Jiaheng |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SWE-Compass: Towards Unified Evaluation of Agentic Coding Abilities for Large Language Models
by: Xu, Jingxuan, et al.
Published: (2025)
by: Xu, Jingxuan, et al.
Published: (2025)
CodeTracer: Towards Traceable Agent States
by: Li, Han, et al.
Published: (2026)
by: Li, Han, et al.
Published: (2026)
ReLook: Vision-Grounded RL with a Multimodal LLM Critic for Agentic Web Coding
by: Li, Yuhang, et al.
Published: (2025)
by: Li, Yuhang, et al.
Published: (2025)
R2C2-Coder: Enhancing and Benchmarking Real-world Repository-level Code Completion Abilities of Code Large Language Models
by: Deng, Ken, et al.
Published: (2024)
by: Deng, Ken, et al.
Published: (2024)
MMG2Skill: Can Agents Distill In-the-Wild Guides into Self-Evolving Skills?
by: Che, Xinyu, et al.
Published: (2026)
by: Che, Xinyu, et al.
Published: (2026)
Multi-task Just Recognizable Difference for Video Coding for Machines: Database, Model, and Coding Application
by: Liu, Junqi, et al.
Published: (2026)
by: Liu, Junqi, et al.
Published: (2026)
OASIS: Order-Augmented Strategy for Improved Code Search
by: Gao, Zuchen, et al.
Published: (2025)
by: Gao, Zuchen, et al.
Published: (2025)
Solvita: Enhancing Large Language Models for Competitive Programming via Agentic Evolution
by: Li, Han, et al.
Published: (2026)
by: Li, Han, et al.
Published: (2026)
Prompt-based Code Completion via Multi-Retrieval Augmented Generation
by: Tan, Hanzhuo, et al.
Published: (2024)
by: Tan, Hanzhuo, et al.
Published: (2024)
Vibe AIGC: A New Paradigm for Content Generation via Agentic Orchestration
by: Liu, Jiaheng, et al.
Published: (2026)
by: Liu, Jiaheng, et al.
Published: (2026)
Reusing Legacy Code in WebAssembly: Key Challenges of Cross-Compilation and Code Semantics Preservation
by: Baradaran, Sara, et al.
Published: (2024)
by: Baradaran, Sara, et al.
Published: (2024)
CodeCriticBench: A Holistic Code Critique Benchmark for Large Language Models
by: Zhang, Alexander, et al.
Published: (2025)
by: Zhang, Alexander, et al.
Published: (2025)
Multilingual Multimodal Software Developer for Code Generation
by: Chai, Linzheng, et al.
Published: (2025)
by: Chai, Linzheng, et al.
Published: (2025)
Sketch2Code: Evaluating Vision-Language Models for Interactive Web Design Prototyping
by: Li, Ryan, et al.
Published: (2024)
by: Li, Ryan, et al.
Published: (2024)
OpenCoder: The Open Cookbook for Top-Tier Code Large Language Models
by: Huang, Siming, et al.
Published: (2024)
by: Huang, Siming, et al.
Published: (2024)
Clifford-Deformed Compass Codes
by: Campos, Julie A., et al.
Published: (2024)
by: Campos, Julie A., et al.
Published: (2024)
Memorize or Generalize? Evaluating LLM Code Generation with Code Rewriting
by: Zhang, Lizhe, et al.
Published: (2025)
by: Zhang, Lizhe, et al.
Published: (2025)
Unlocking the conversion of Web Screenshots into HTML Code with the WebSight Dataset
by: Laurençon, Hugo, et al.
Published: (2024)
by: Laurençon, Hugo, et al.
Published: (2024)
WebCode2M: A Real-World Dataset for Code Generation from Webpage Designs
by: Gui, Yi, et al.
Published: (2024)
by: Gui, Yi, et al.
Published: (2024)
IFEvalCode: Controlled Code Generation
by: Yang, Jian, et al.
Published: (2025)
by: Yang, Jian, et al.
Published: (2025)
Detecting the Root Cause Code Lines in Bug-Fixing Commits by Heterogeneous Graph Learning
by: Ji, Liguo, et al.
Published: (2025)
by: Ji, Liguo, et al.
Published: (2025)
Effective Directed Fuzzing with Hierarchical Scheduling for Web Vulnerability Detection
by: Lin, Zihan, et al.
Published: (2025)
by: Lin, Zihan, et al.
Published: (2025)
Web2Code: A Large-scale Webpage-to-Code Dataset and Evaluation Framework for Multimodal LLMs
by: Yun, Sukmin, et al.
Published: (2024)
by: Yun, Sukmin, et al.
Published: (2024)
WebSailor: Navigating Super-human Reasoning for Web Agent
by: Li, Kuan, et al.
Published: (2025)
by: Li, Kuan, et al.
Published: (2025)
WebUIBench: A Comprehensive Benchmark for Evaluating Multimodal Large Language Models in WebUI-to-Code
by: Lin, Zhiyu, et al.
Published: (2025)
by: Lin, Zhiyu, et al.
Published: (2025)
Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks
by: Xu, Kai, et al.
Published: (2025)
by: Xu, Kai, et al.
Published: (2025)
T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation
by: Cao, Zhe, et al.
Published: (2025)
by: Cao, Zhe, et al.
Published: (2025)
CodeCompass: Navigating the Navigation Paradox in Agentic Code Intelligence
by: Paipuru, Tarakanath
Published: (2026)
by: Paipuru, Tarakanath
Published: (2026)
Interrogating Design Homogenization in Web Vibe Coding
by: Shin, Donghoon, et al.
Published: (2026)
by: Shin, Donghoon, et al.
Published: (2026)
HiPO: Hybrid Policy Optimization for Dynamic Reasoning in LLMs
by: Deng, Ken, et al.
Published: (2025)
by: Deng, Ken, et al.
Published: (2025)
WIST: Web-Grounded Iterative Self-Play Tree for Domain-Targeted Reasoning Improvement
by: Li, Fangyuan, et al.
Published: (2026)
by: Li, Fangyuan, et al.
Published: (2026)
WebCoach: Self-Evolving Web Agents with Cross-Session Memory Guidance
by: Liu, Genglin, et al.
Published: (2025)
by: Liu, Genglin, et al.
Published: (2025)
Research on WebAssembly Runtimes: A Survey
by: Zhang, Yixuan, et al.
Published: (2024)
by: Zhang, Yixuan, et al.
Published: (2024)
WebApp1K: A Practical Code-Generation Benchmark for Web App Development
by: Cui, Yi
Published: (2024)
by: Cui, Yi
Published: (2024)
ArtifactsBench: Bridging the Visual-Interactive Gap in LLM Code Generation Evaluation
by: Zhang, Chenchen, et al.
Published: (2025)
by: Zhang, Chenchen, et al.
Published: (2025)
CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment
by: Jiang, Xue, et al.
Published: (2025)
by: Jiang, Xue, et al.
Published: (2025)
Compass-Thinker-7B Technical Report
by: Zeng, Anxiang, et al.
Published: (2025)
by: Zeng, Anxiang, et al.
Published: (2025)
Coding with Eyes: Visual Feedback Unlocks Reliable GUI Code Generating and Debugging
by: Liu, Zhilin, et al.
Published: (2026)
by: Liu, Zhilin, et al.
Published: (2026)
NoCodeGPT: A No-Code Interface for Building Web Apps with Language Models
by: Monteiro, Mauricio, et al.
Published: (2023)
by: Monteiro, Mauricio, et al.
Published: (2023)
NoCodeGPT: A No‐Code Interface for Building Web Apps With Language Models
by: Mauricio Monteiro, et al.
Published: (2025)
by: Mauricio Monteiro, et al.
Published: (2025)
Similar Items
-
SWE-Compass: Towards Unified Evaluation of Agentic Coding Abilities for Large Language Models
by: Xu, Jingxuan, et al.
Published: (2025) -
CodeTracer: Towards Traceable Agent States
by: Li, Han, et al.
Published: (2026) -
ReLook: Vision-Grounded RL with a Multimodal LLM Critic for Agentic Web Coding
by: Li, Yuhang, et al.
Published: (2025) -
R2C2-Coder: Enhancing and Benchmarking Real-world Repository-level Code Completion Abilities of Code Large Language Models
by: Deng, Ken, et al.
Published: (2024) -
MMG2Skill: Can Agents Distill In-the-Wild Guides into Self-Evolving Skills?
by: Che, Xinyu, et al.
Published: (2026)