WAFFLE: Finetuning Multi-Modal Models for Automated Front-End Development
Fuente:
arXiv
Saved in:
| Main Authors: | Liang, Shanchao, Jiang, Nan, Qian, Shangshu, Tan, Lin |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
FronTalk: Benchmarking Front-End Development as Conversational Code Generation with Multi-Modal Feedback
by: Wu, Xueqing, et al.
Published: (2025)
by: Wu, Xueqing, et al.
Published: (2025)
Can Language Models Replace Programmers for Coding? REPOCOD Says 'Not Yet'
by: Liang, Shanchao, et al.
Published: (2024)
by: Liang, Shanchao, et al.
Published: (2024)
ChartMimic: Evaluating LMM's Cross-Modal Reasoning Capability via Chart-to-Code Generation
by: Yang, Cheng, et al.
Published: (2024)
by: Yang, Cheng, et al.
Published: (2024)
FullStack-Agent: Enhancing Agentic Full-Stack Web Coding via Development-Oriented Testing and Repository Back-Translation
by: Lu, Zimu, et al.
Published: (2026)
by: Lu, Zimu, et al.
Published: (2026)
ComfyUI-R1: Exploring Reasoning Models for Workflow Generation
by: Xu, Zhenran, et al.
Published: (2025)
by: Xu, Zhenran, et al.
Published: (2025)
MMCode: Benchmarking Multimodal Large Language Models for Code Generation with Visually Rich Programming Problems
by: Li, Kaixin, et al.
Published: (2024)
by: Li, Kaixin, et al.
Published: (2024)
Docling Technical Report
by: Auer, Christoph, et al.
Published: (2024)
by: Auer, Christoph, et al.
Published: (2024)
Docling: An Efficient Open-Source Toolkit for AI-driven Document Conversion
by: Livathinos, Nikolaos, et al.
Published: (2025)
by: Livathinos, Nikolaos, et al.
Published: (2025)
AURORA: Navigating UI Tarpits via Automated Neural Screen Understanding
by: Khan, Safwat Ali, et al.
Published: (2024)
by: Khan, Safwat Ali, et al.
Published: (2024)
Benchmarking Image Perturbations for Testing Automated Driving Assistance Systems
by: Lambertenghi, Stefano Carlo, et al.
Published: (2025)
by: Lambertenghi, Stefano Carlo, et al.
Published: (2025)
CUARewardBench: A Benchmark for Evaluating Reward Models on Computer-using Agent
by: Lin, Haojia, et al.
Published: (2025)
by: Lin, Haojia, et al.
Published: (2025)
Can Vision-Language Models Handle Long-Context Code? An Empirical Study on Visual Compression
by: Zhong, Jianping, et al.
Published: (2026)
by: Zhong, Jianping, et al.
Published: (2026)
ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents
by: Meng, Fanqing, et al.
Published: (2026)
by: Meng, Fanqing, et al.
Published: (2026)
DILLEMA: Diffusion and Large Language Models for Multi-Modal Augmentation
by: Baresi, Luciano, et al.
Published: (2025)
by: Baresi, Luciano, et al.
Published: (2025)
DreamFactory: Pioneering Multi-Scene Long Video Generation with a Multi-Agent Framework
by: Xie, Zhifei, et al.
Published: (2024)
by: Xie, Zhifei, et al.
Published: (2024)
Do Existing Testing Tools Really Uncover Gender Bias in Text-to-Image Models?
by: Lyu, Yunbo, et al.
Published: (2025)
by: Lyu, Yunbo, et al.
Published: (2025)
VISTA: An End-to-End Benchmark for Visual Spec-to-Web-App Coding Agents
by: Guo, JunJia, et al.
Published: (2026)
by: Guo, JunJia, et al.
Published: (2026)
JanusCoder: Towards a Foundational Visual-Programmatic Interface for Code Intelligence
by: Sun, Qiushi, et al.
Published: (2025)
by: Sun, Qiushi, et al.
Published: (2025)
New Job, New Gender? Measuring the Social Bias in Image Generation Models
by: Wang, Wenxuan, et al.
Published: (2024)
by: Wang, Wenxuan, et al.
Published: (2024)
SVRepair: Structured Visual Reasoning for Automated Program Repair
by: Tang, Xiaoxuan, et al.
Published: (2026)
by: Tang, Xiaoxuan, et al.
Published: (2026)
ROMAN: Reward-Orchestrated Multi-Head Attention Network for Autonomous Driving System Testing
by: Chi, Jianlei, et al.
Published: (2026)
by: Chi, Jianlei, et al.
Published: (2026)
Evaluating and Enhancing Segmentation Model Robustness with Metamorphic Testing
by: Mzoughi, Seif, et al.
Published: (2025)
by: Mzoughi, Seif, et al.
Published: (2025)
Foundation Models in Remote Sensing: Evolving from Unimodality to Multimodality
by: Hong, Danfeng, et al.
Published: (2026)
by: Hong, Danfeng, et al.
Published: (2026)
Investigating Traffic Accident Detection Using Multimodal Large Language Models
by: Skender, Ilhan, et al.
Published: (2025)
by: Skender, Ilhan, et al.
Published: (2025)
DD-CAM: Minimal Sufficient Explanations for Vision Models Using Delta Debugging
by: Khadka, Krishna, et al.
Published: (2026)
by: Khadka, Krishna, et al.
Published: (2026)
GUing: A Mobile GUI Search Engine using a Vision-Language Model
by: Wei, Jialiang, et al.
Published: (2024)
by: Wei, Jialiang, et al.
Published: (2024)
Spatial Priming Outperforms Semantic Prompting: A Grid-Based Approach to Improving LLM Accuracy on Chart Data Extraction
by: Lazarev, Andrei, et al.
Published: (2026)
by: Lazarev, Andrei, et al.
Published: (2026)
MotorEase: Automated Detection of Motor Impairment Accessibility Issues in Mobile App UIs
by: Krishnavajjala, Arun, et al.
Published: (2024)
by: Krishnavajjala, Arun, et al.
Published: (2024)
GPA: Learning GUI Process Automation from Demonstrations
by: Zhao, Zirui, et al.
Published: (2026)
by: Zhao, Zirui, et al.
Published: (2026)
Automating Crash Diagram Generation Using Vision-Language Models: A Case Study on Multi-Lane Roundabouts
by: Lu, Xiao, et al.
Published: (2026)
by: Lu, Xiao, et al.
Published: (2026)
CSnake: Detecting Self-Sustaining Cascading Failure via Causal Stitching of Fault Propagations
by: Qian, Shangshu, et al.
Published: (2025)
by: Qian, Shangshu, et al.
Published: (2025)
Natural Adversaries: Fuzzing Autonomous Vehicles with Realistic Roadside Object Placements
by: Sun, Yang, et al.
Published: (2024)
by: Sun, Yang, et al.
Published: (2024)
VEglue: Testing Visual Entailment Systems via Object-Aligned Joint Erasing
by: Chang, Zhiyuan, et al.
Published: (2024)
by: Chang, Zhiyuan, et al.
Published: (2024)
A Plausibility Study of Using Augmented Reality in the Ventriculoperitoneal Shunt Operations
by: Dorji, Tandin, et al.
Published: (2024)
by: Dorji, Tandin, et al.
Published: (2024)
VideoGameBunny: Towards vision assistants for video games
by: Taesiri, Mohammad Reza, et al.
Published: (2024)
by: Taesiri, Mohammad Reza, et al.
Published: (2024)
SWAN -- Enabling Fast and Mobile Histopathology Image Annotation through Swipeable Interfaces
by: Banerjee, Sweta, et al.
Published: (2025)
by: Banerjee, Sweta, et al.
Published: (2025)
Technical Report for Argoverse2 Scenario Mining Challenges on Iterative Error Correction and Spatially-Aware Prompting
by: Chen, Yifei, et al.
Published: (2025)
by: Chen, Yifei, et al.
Published: (2025)
Cross-Breed Pig Identification Using Auricular Vein Pattern Recognition: A Machine Learning Approach for Small-Scale Farming Applications
by: Nsengiyumvaa, Emmanuel, et al.
Published: (2025)
by: Nsengiyumvaa, Emmanuel, et al.
Published: (2025)
How Far Can VLMs Go for Visual Bug Detection? Studying 19,738 Keyframes from 41 Hours of Gameplay Videos
by: Lu, Wentao, et al.
Published: (2026)
by: Lu, Wentao, et al.
Published: (2026)
Earth Embeddings as Products: Taxonomy, Ecosystem, and Standardized Access
by: Fang, Heng, et al.
Published: (2026)
by: Fang, Heng, et al.
Published: (2026)
Similar Items
-
FronTalk: Benchmarking Front-End Development as Conversational Code Generation with Multi-Modal Feedback
by: Wu, Xueqing, et al.
Published: (2025) -
Can Language Models Replace Programmers for Coding? REPOCOD Says 'Not Yet'
by: Liang, Shanchao, et al.
Published: (2024) -
ChartMimic: Evaluating LMM's Cross-Modal Reasoning Capability via Chart-to-Code Generation
by: Yang, Cheng, et al.
Published: (2024) -
FullStack-Agent: Enhancing Agentic Full-Stack Web Coding via Development-Oriented Testing and Repository Back-Translation
by: Lu, Zimu, et al.
Published: (2026) -
ComfyUI-R1: Exploring Reasoning Models for Workflow Generation
by: Xu, Zhenran, et al.
Published: (2025)