Vision2Code: A Multi-Domain Benchmark for Evaluating Image-to-Code Generation
Fuente:
arXiv
Saved in:
| Main Authors: | Periasami, Ajay Vikram, Wang, Junlin, Dhingra, Bhuwan |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Vision and Language Integration for Domain Generalization
by: Wang, Yanmei, et al.
Published: (2025)
by: Wang, Yanmei, et al.
Published: (2025)
Do Vision Foundation Models Enhance Domain Generalization in Medical Image Segmentation?
by: Cekmeceli, Kerem, et al.
Published: (2024)
by: Cekmeceli, Kerem, et al.
Published: (2024)
Transitive Vision-Language Prompt Learning for Domain Generalization
by: Wang, Liyuan, et al.
Published: (2024)
by: Wang, Liyuan, et al.
Published: (2024)
Multiple Code Hashing for Efficient Image Retrieval
by: Li, Ming-Wei, et al.
Published: (2020)
by: Li, Ming-Wei, et al.
Published: (2020)
Roboflow100-VL: A Multi-Domain Object Detection Benchmark for Vision-Language Models
by: Robicheaux, Peter, et al.
Published: (2025)
by: Robicheaux, Peter, et al.
Published: (2025)
Evaluating Self-Supervised Learning in Medical Imaging: A Benchmark for Robustness, Generalizability, and Multi-Domain Impact
by: Bundele, Valay, et al.
Published: (2024)
by: Bundele, Valay, et al.
Published: (2024)
Real2Code: Reconstruct Articulated Objects via Code Generation
by: Mandi, Zhao, et al.
Published: (2024)
by: Mandi, Zhao, et al.
Published: (2024)
Benchmarking Diversity in Image Generation via Attribute-Conditional Human Evaluation
by: Albuquerque, Isabela, et al.
Published: (2025)
by: Albuquerque, Isabela, et al.
Published: (2025)
Holistic Unlearning Benchmark: A Multi-Faceted Evaluation for Text-to-Image Diffusion Model Unlearning
by: Moon, Saemi, et al.
Published: (2024)
by: Moon, Saemi, et al.
Published: (2024)
Multi-Task Learning with Additive U-Net for Image Denoising and Classification
by: Lakkavalli, Vikram, et al.
Published: (2026)
by: Lakkavalli, Vikram, et al.
Published: (2026)
INR-Bench: A Unified Benchmark for Implicit Neural Representations in Multi-Domain Regression and Reconstruction
by: Li, Linfei, et al.
Published: (2025)
by: Li, Linfei, et al.
Published: (2025)
FronTalk: Benchmarking Front-End Development as Conversational Code Generation with Multi-Modal Feedback
by: Wu, Xueqing, et al.
Published: (2025)
by: Wu, Xueqing, et al.
Published: (2025)
Evaluating Feature Attribution Methods in the Image Domain
by: Gevaert, Arne, et al.
Published: (2022)
by: Gevaert, Arne, et al.
Published: (2022)
CustomText: Customized Textual Image Generation using Diffusion Models
by: Paliwal, Shubham, et al.
Published: (2024)
by: Paliwal, Shubham, et al.
Published: (2024)
Unifying Generation and Compression: Ultra-low bitrate Image Coding Via Multi-stage Transformer
by: Xue, Naifu, et al.
Published: (2024)
by: Xue, Naifu, et al.
Published: (2024)
Benchmarking Counterfactual Image Generation
by: Melistas, Thomas, et al.
Published: (2024)
by: Melistas, Thomas, et al.
Published: (2024)
Text-Guided Semantic Image Encoder
by: Thirukovalluru, Raghuveer, et al.
Published: (2025)
by: Thirukovalluru, Raghuveer, et al.
Published: (2025)
Pseudo Multi-Source Domain Generalization: Bridging the Gap Between Single and Multi-Source Domain Generalization
by: Enomoto, Shohei
Published: (2025)
by: Enomoto, Shohei
Published: (2025)
PracticalDG: Perturbation Distillation on Vision-Language Models for Hybrid Domain Generalization
by: Chen, Zining, et al.
Published: (2024)
by: Chen, Zining, et al.
Published: (2024)
SpatiaLQA: A Benchmark for Evaluating Spatial Logical Reasoning in Vision-Language Models
by: Xie, Yuechen, et al.
Published: (2026)
by: Xie, Yuechen, et al.
Published: (2026)
Modality-Balanced Collaborative Distillation for Multi-Modal Domain Generalization
by: Wang, Xiaohan, et al.
Published: (2025)
by: Wang, Xiaohan, et al.
Published: (2025)
Benchmarking OCR Pipelines with Adaptive Enhancement for Multi-Domain Retail Bill Digitization
by: Gaikwad, Vijaysinh
Published: (2026)
by: Gaikwad, Vijaysinh
Published: (2026)
Benchmarking Vision, Language, & Action Models in Procedurally Generated, Open Ended Action Environments
by: Guruprasad, Pranav, et al.
Published: (2025)
by: Guruprasad, Pranav, et al.
Published: (2025)
Towards a Better Evaluation of Out-of-Domain Generalization
by: Hwang, Duhun, et al.
Published: (2024)
by: Hwang, Duhun, et al.
Published: (2024)
Vision Foundation Models in Remote Sensing: A Survey
by: Lu, Siqi, et al.
Published: (2024)
by: Lu, Siqi, et al.
Published: (2024)
ImagiNet: A Multi-Content Benchmark for Synthetic Image Detection
by: Boychev, Delyan, et al.
Published: (2024)
by: Boychev, Delyan, et al.
Published: (2024)
Localized PCA-Net Neural Operators for Scalable Solution Reconstruction of Elliptic PDEs
by: Dhingra, Mrigank, et al.
Published: (2025)
by: Dhingra, Mrigank, et al.
Published: (2025)
Code and Pixels: Multi-Modal Contrastive Pre-training for Enhanced Tabular Data Analysis
by: Roy, Kankana, et al.
Published: (2025)
by: Roy, Kankana, et al.
Published: (2025)
A Comprehensive Assessment Benchmark for Rigorously Evaluating Deep Learning Image Classifiers
by: Spratling, Michael W.
Published: (2023)
by: Spratling, Michael W.
Published: (2023)
UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation
by: Wang, Jiayun, et al.
Published: (2026)
by: Wang, Jiayun, et al.
Published: (2026)
Noise-Aware Generalization: Robustness to In-Domain Noise and Out-of-Domain Generalization
by: Wang, Siqi, et al.
Published: (2025)
by: Wang, Siqi, et al.
Published: (2025)
Grounding Bodily Awareness in Visual Representations for Efficient Policy Learning
by: Wang, Junlin, et al.
Published: (2025)
by: Wang, Junlin, et al.
Published: (2025)
Hallucination-Aware Multimodal Benchmark for Gastrointestinal Image Analysis with Large Vision-Language Models
by: Khanal, Bidur, et al.
Published: (2025)
by: Khanal, Bidur, et al.
Published: (2025)
Benchmarking Predictive Coding Networks -- Made Simple
by: Pinchetti, Luca, et al.
Published: (2024)
by: Pinchetti, Luca, et al.
Published: (2024)
Towards Large Model Feature Coding
by: Pang, Youwei, et al.
Published: (2026)
by: Pang, Youwei, et al.
Published: (2026)
Pancakes: Consistent Multi-Protocol Image Segmentation Across Biomedical Domains
by: Rakic, Marianne, et al.
Published: (2025)
by: Rakic, Marianne, et al.
Published: (2025)
Matricial Free Energy as a Gaussianizing Regularizer: Enhancing Autoencoders for Gaussian Code Generation
by: Sonthalia, Rishi, et al.
Published: (2025)
by: Sonthalia, Rishi, et al.
Published: (2025)
Benchmarking Convolutional, Transformer, Hybrid, and Vision Language Models for Multi Disease Retinal Screening
by: Dey, Durjoy, et al.
Published: (2026)
by: Dey, Durjoy, et al.
Published: (2026)
U2-BENCH: Benchmarking Large Vision-Language Models on Ultrasound Understanding
by: Le, Anjie, et al.
Published: (2025)
by: Le, Anjie, et al.
Published: (2025)
SPoRC-VIST: A Benchmark for Evaluating Generative Natural Narrative in Vision-Language Models
by: Zeng, Yunlin
Published: (2026)
by: Zeng, Yunlin
Published: (2026)
Similar Items
-
Vision and Language Integration for Domain Generalization
by: Wang, Yanmei, et al.
Published: (2025) -
Do Vision Foundation Models Enhance Domain Generalization in Medical Image Segmentation?
by: Cekmeceli, Kerem, et al.
Published: (2024) -
Transitive Vision-Language Prompt Learning for Domain Generalization
by: Wang, Liyuan, et al.
Published: (2024) -
Multiple Code Hashing for Efficient Image Retrieval
by: Li, Ming-Wei, et al.
Published: (2020) -
Roboflow100-VL: A Multi-Domain Object Detection Benchmark for Vision-Language Models
by: Robicheaux, Peter, et al.
Published: (2025)