Web2Code: A Large-scale Webpage-to-Code Dataset and Evaluation Framework for Multimodal LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yun, Sukmin, Lin, Haokun, Thushara, Rusiru, Bhat, Mohammad Qazim, Wang, Yongxin, Jiang, Zutao, Deng, Mingkai, Wang, Jinhong, Tao, Tianhua, Li, Junbo, Li, Haonan, Nakov, Preslav, Baldwin, Timothy, Liu, Zhengzhong, Xing, Eric P., Liang, Xiaodan, Shen, Zhiqiang |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CoDet-M4: Detecting Machine-Generated Code in Multi-Lingual, Multi-Generator and Multi-Domain Settings
par: Orel, Daniil, et autres
Publié: (2025)
par: Orel, Daniil, et autres
Publié: (2025)
Crystal: Illuminating LLM Abilities on Language and Code
par: Tao, Tianhua, et autres
Publié: (2024)
par: Tao, Tianhua, et autres
Publié: (2024)
Arabic Dataset for LLM Safeguard Evaluation
par: Ashraf, Yasser, et autres
Publié: (2024)
par: Ashraf, Yasser, et autres
Publié: (2024)
Detecting Propaganda Techniques in Code-Switched Social Media Text
par: Salman, Muhammad Umar, et autres
Publié: (2023)
par: Salman, Muhammad Umar, et autres
Publié: (2023)
$\texttt{Droid}$: A Resource Suite for AI-Generated Code Detection
par: Orel, Daniil, et autres
Publié: (2025)
par: Orel, Daniil, et autres
Publié: (2025)
WebCode2M: A Real-World Dataset for Code Generation from Webpage Designs
par: Gui, Yi, et autres
Publié: (2024)
par: Gui, Yi, et autres
Publié: (2024)
Thermo-VL: Extending Vision-Language Models to Thermal Infrared Perception
par: Thushara, Rusiru, et autres
Publié: (2026)
par: Thushara, Rusiru, et autres
Publié: (2026)
Rethinking STS and NLI in Large Language Models
par: Wang, Yuxia, et autres
Publié: (2023)
par: Wang, Yuxia, et autres
Publié: (2023)
A Chinese Dataset for Evaluating the Safeguards in Large Language Models
par: Wang, Yuxia, et autres
Publié: (2024)
par: Wang, Yuxia, et autres
Publié: (2024)
COMMUNITYNOTES: A Dataset for Exploring the Helpfulness of Fact-Checking Explanations
par: Xing, Rui, et autres
Publié: (2025)
par: Xing, Rui, et autres
Publié: (2025)
MM-WebAgent: A Hierarchical Multimodal Web Agent for Webpage Generation
par: Li, Yan, et autres
Publié: (2026)
par: Li, Yan, et autres
Publié: (2026)
Loki: An Open-Source Tool for Fact Verification
par: Li, Haonan, et autres
Publié: (2024)
par: Li, Haonan, et autres
Publié: (2024)
FMI_SU_Yotkova_Kastreva at SemEval-2026 Task 13: Lightweight Detection of LLM-Generated Code via Stylometric Signals
par: Yotkova, Elitsa, et autres
Publié: (2026)
par: Yotkova, Elitsa, et autres
Publié: (2026)
Interaction2Code: Benchmarking MLLM-based Interactive Webpage Code Generation from Interactive Prototyping
par: Xiao, Jingyu, et autres
Publié: (2024)
par: Xiao, Jingyu, et autres
Publié: (2024)
UnsafeChain: Enhancing Reasoning Model Safety via Hard Cases
par: Tomar, Raj Vardhan, et autres
Publié: (2025)
par: Tomar, Raj Vardhan, et autres
Publié: (2025)
How Does Prefix Matter in Reasoning Model Tuning?
par: Tomar, Raj Vardhan, et autres
Publié: (2026)
par: Tomar, Raj Vardhan, et autres
Publié: (2026)
DUAL-Bench: Measuring Over-Refusal and Robustness in Vision-Language Models
par: Ren, Kaixuan, et autres
Publié: (2025)
par: Ren, Kaixuan, et autres
Publié: (2025)
Large Language Models are Few-Shot Training Example Generators: A Case Study in Fallacy Recognition
par: Alhindi, Tariq, et autres
Publié: (2023)
par: Alhindi, Tariq, et autres
Publié: (2023)
MuDRiC: Multi-Dialect Reasoning for Arabic Commonsense Validation
par: Elozeiri, Kareem, et autres
Publié: (2025)
par: Elozeiri, Kareem, et autres
Publié: (2025)
SimuScene: Training and Benchmarking Code Generation to Simulate Physical Scenarios
par: Wang, Yanan, et autres
Publié: (2026)
par: Wang, Yanan, et autres
Publié: (2026)
Can Machines Resonate with Humans? Evaluating the Emotional and Empathic Comprehension of LMs
par: Manzoor, Muhammad Arslan, et autres
Publié: (2024)
par: Manzoor, Muhammad Arslan, et autres
Publié: (2024)
EXAMS-V: A Multi-Discipline Multilingual Multimodal Exam Benchmark for Evaluating Vision Language Models
par: Das, Rocktim Jyoti, et autres
Publié: (2024)
par: Das, Rocktim Jyoti, et autres
Publié: (2024)
Cross-Cultural Transfer of Commonsense Reasoning in LLMs: Evidence from the Arab World
par: Almheiri, Saeed, et autres
Publié: (2025)
par: Almheiri, Saeed, et autres
Publié: (2025)
Beyond the Crowd: LLM-Augmented Community Notes for Governing Health Misinformation
par: Wu, Jiaying, et autres
Publié: (2025)
par: Wu, Jiaying, et autres
Publié: (2025)
From Chaos to Clarity: Claim Normalization to Empower Fact-Checking
par: Sundriyal, Megha, et autres
Publié: (2023)
par: Sundriyal, Megha, et autres
Publié: (2023)
Adapting Fake News Detection to the Era of Large Language Models
par: Su, Jinyan, et autres
Publié: (2023)
par: Su, Jinyan, et autres
Publié: (2023)
MemeMQA: Multimodal Question Answering for Memes via Rationale-Based Inferencing
par: Agarwal, Siddhant, et autres
Publié: (2024)
par: Agarwal, Siddhant, et autres
Publié: (2024)
ProductWebGen: Benchmarking Multimodal Product Webpage Generation
par: Liu, Zhihong, et autres
Publié: (2026)
par: Liu, Zhihong, et autres
Publié: (2026)
HALF: Harm-Aware LLM Fairness Evaluation Aligned with Deployment
par: Mekky, Ali, et autres
Publié: (2025)
par: Mekky, Ali, et autres
Publié: (2025)
Data-Informed Global Sparseness in Attention Mechanisms for Deep Neural Networks
par: Rugina, Ileana, et autres
Publié: (2020)
par: Rugina, Ileana, et autres
Publié: (2020)
Exploring Language Model Generalization in Low-Resource Extractive QA
par: Sengupta, Saptarshi, et autres
Publié: (2024)
par: Sengupta, Saptarshi, et autres
Publié: (2024)
Better with Experience: Self-Evolving LLM Agents for Evidence-Grounded Health Community Notes
par: Fu, Zihang, et autres
Publié: (2026)
par: Fu, Zihang, et autres
Publié: (2026)
ConspirED: A Dataset for Cognitive Traits of Conspiracy Theories and Large Language Model Safety
par: Bates, Luke, et autres
Publié: (2025)
par: Bates, Luke, et autres
Publié: (2025)
UNCERTAINTY-LINE: Length-Invariant Estimation of Uncertainty for Large Language Models
par: Vashurin, Roman, et autres
Publié: (2025)
par: Vashurin, Roman, et autres
Publié: (2025)
Missci: Reconstructing Fallacies in Misrepresented Science
par: Glockner, Max, et autres
Publié: (2024)
par: Glockner, Max, et autres
Publié: (2024)
Grounding Fallacies Misrepresenting Scientific Publications in Evidence
par: Glockner, Max, et autres
Publié: (2024)
par: Glockner, Max, et autres
Publié: (2024)
An Analytical Emotion Framework of Rumour Threads on Social Media
par: Xing, Rui, et autres
Publié: (2025)
par: Xing, Rui, et autres
Publié: (2025)
VFace: A Training-Free Approach for Diffusion-Based Video Face Swapping
par: Baliah, Sanoojan, et autres
Publié: (2026)
par: Baliah, Sanoojan, et autres
Publié: (2026)
Multimodal Large Language Models to Support Real-World Fact-Checking
par: Geng, Jiahui, et autres
Publié: (2024)
par: Geng, Jiahui, et autres
Publié: (2024)
Between Underthinking and Overthinking: An Empirical Study of Reasoning Length and correctness in LLMs
par: Su, Jinyan, et autres
Publié: (2025)
par: Su, Jinyan, et autres
Publié: (2025)
Documents similaires
-
CoDet-M4: Detecting Machine-Generated Code in Multi-Lingual, Multi-Generator and Multi-Domain Settings
par: Orel, Daniil, et autres
Publié: (2025) -
Crystal: Illuminating LLM Abilities on Language and Code
par: Tao, Tianhua, et autres
Publié: (2024) -
Arabic Dataset for LLM Safeguard Evaluation
par: Ashraf, Yasser, et autres
Publié: (2024) -
Detecting Propaganda Techniques in Code-Switched Social Media Text
par: Salman, Muhammad Umar, et autres
Publié: (2023) -
$\texttt{Droid}$: A Resource Suite for AI-Generated Code Detection
par: Orel, Daniil, et autres
Publié: (2025)