Omni-I2C: A Holistic Benchmark for High-Fidelity Image-to-Code Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhou, Jiawei, Zhang, Chi, Feng, Xiang, Zhang, Qiming, Qiu, Haibo, He, Lihuo, Ye, Dengpan, Gao, Xinbo, Zhang, Jing |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Seirênes: Adversarial Self-Play with Evolving Distractions for LLM Reasoning
par: Zhang, Chi, et autres
Publié: (2026)
par: Zhang, Chi, et autres
Publié: (2026)
CognitionCapturerPro: Towards High-Fidelity Visual Decoding from EEG/MEG via Multi-modal Information and Asymmetric Alignment
par: Zhang, Kaifan, et autres
Publié: (2026)
par: Zhang, Kaifan, et autres
Publié: (2026)
AI-Generated Image Quality Assessment Based on Task-Specific Prompt and Multi-Granularity Similarity
par: Xia, Jili, et autres
Publié: (2024)
par: Xia, Jili, et autres
Publié: (2024)
Boosting Temporal Sentence Grounding via Causal Inference
par: Tang, Kefan, et autres
Publié: (2025)
par: Tang, Kefan, et autres
Publié: (2025)
Trinity Detector:text-assisted and attention mechanisms based spectral fusion for diffusion generation image detection
par: Song, Jiawei, et autres
Publié: (2024)
par: Song, Jiawei, et autres
Publié: (2024)
Unleashing the Power of Generic Segmentation Models: A Simple Baseline for Infrared Small Target Detection
par: Zhang, Mingjin, et autres
Publié: (2024)
par: Zhang, Mingjin, et autres
Publié: (2024)
InstructVEdit: A Holistic Approach for Instructional Video Editing
par: Zhang, Chi, et autres
Publié: (2025)
par: Zhang, Chi, et autres
Publié: (2025)
CognitionCapturer: Decoding Visual Stimuli From Human EEG Signal With Multimodal Information
par: Zhang, Kaifan, et autres
Publié: (2024)
par: Zhang, Kaifan, et autres
Publié: (2024)
HyperAlign: Hyperbolic Entailment Cones for Adaptive Text-to-Image Alignment Assessment
par: Chen, Wenzhi, et autres
Publié: (2026)
par: Chen, Wenzhi, et autres
Publié: (2026)
Towards Adaptive Open-Set Object Detection via Category-Level Collaboration Knowledge Mining
par: Ji, Yuqi, et autres
Publié: (2026)
par: Ji, Yuqi, et autres
Publié: (2026)
DeepSketcher: Internalizing Visual Manipulation for Multimodal Reasoning
par: Zhang, Chi, et autres
Publié: (2025)
par: Zhang, Chi, et autres
Publié: (2025)
FCA2: Frame Compression-Aware Autoencoder for Modular and Fast Compressed Video Super-Resolution
par: Wang, Zhaoyang, et autres
Publié: (2025)
par: Wang, Zhaoyang, et autres
Publié: (2025)
EyeSim-VQA: A Free-Energy-Guided Eye Simulation Framework for Video Quality Assessment
par: Wang, Zhaoyang, et autres
Publié: (2025)
par: Wang, Zhaoyang, et autres
Publié: (2025)
A Multi-annotated and Multi-modal Dataset for Wide-angle Video Quality Assessment
par: Hu, Bo, et autres
Publié: (2025)
par: Hu, Bo, et autres
Publié: (2025)
CodeCriticBench: A Holistic Code Critique Benchmark for Large Language Models
par: Zhang, Alexander, et autres
Publié: (2025)
par: Zhang, Alexander, et autres
Publié: (2025)
StyleMark: A Robust Watermarking Method for Art Style Images Against Black-Box Arbitrary Style Transfer
par: Zhang, Yunming, et autres
Publié: (2024)
par: Zhang, Yunming, et autres
Publié: (2024)
OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models
par: Jia, Mengdi, et autres
Publié: (2025)
par: Jia, Mengdi, et autres
Publié: (2025)
YOLOA: Real-Time Affordance Detection via LLM Adapter
par: Ji, Yuqi, et autres
Publié: (2025)
par: Ji, Yuqi, et autres
Publié: (2025)
Perceptual-Evidence Anchored Reinforced Learning for Multimodal Reasoning
par: Zhang, Chi, et autres
Publié: (2025)
par: Zhang, Chi, et autres
Publié: (2025)
MLEP: Multi-granularity Local Entropy Patterns for Universal AI-generated Image Detection
par: Yuan, Lin, et autres
Publié: (2025)
par: Yuan, Lin, et autres
Publié: (2025)
Efficient and High-Fidelity Omni Modality Retrieval
par: Huynh, Chuong, et autres
Publié: (2026)
par: Huynh, Chuong, et autres
Publié: (2026)
OmniPlay: Benchmarking Omni-Modal Models on Omni-Modal Game Playing
par: Bie, Fuqing, et autres
Publié: (2025)
par: Bie, Fuqing, et autres
Publié: (2025)
Few-Shot Medical Image Segmentation with High-Fidelity Prototypes
par: Tang, Song, et autres
Publié: (2024)
par: Tang, Song, et autres
Publié: (2024)
OmniVDiff: Omni Controllable Video Diffusion for Generation and Understanding
par: Xi, Dianbing, et autres
Publié: (2025)
par: Xi, Dianbing, et autres
Publié: (2025)
Human Simulacra: Benchmarking the Personification of Large Language Models
par: Xie, Qiuejie, et autres
Publié: (2024)
par: Xie, Qiuejie, et autres
Publié: (2024)
Take Fake as Real: Realistic-like Robust Black-box Adversarial Attack to Evade AIGC Detection
par: Xie, Caiyun, et autres
Publié: (2024)
par: Xie, Caiyun, et autres
Publié: (2024)
VideoOdyssey: A Benchmark for Ultra-Long-Context and Omni-Modal Video Understanding
par: He, Haichen, et autres
Publié: (2026)
par: He, Haichen, et autres
Publié: (2026)
HiFi-Syn: Hierarchical Granularity Discrimination for High-Fidelity Synthesis of MR Images with Structure Preservation
par: Yu, Ziqi, et autres
Publié: (2023)
par: Yu, Ziqi, et autres
Publié: (2023)
High-Fidelity Generative Audio Compression at 0.275kbps
par: Ma, Hao, et autres
Publié: (2026)
par: Ma, Hao, et autres
Publié: (2026)
OmniShotCut: Holistic Relational Shot Boundary Detection with Shot-Query Transformer
par: Wang, Boyang, et autres
Publié: (2026)
par: Wang, Boyang, et autres
Publié: (2026)
DocScope: Benchmarking Verifiable Reasoning for Trustworthy Long-Document Understanding
par: Feng, Xiang, et autres
Publié: (2026)
par: Feng, Xiang, et autres
Publié: (2026)
OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs
par: Zhang, Yiman, et autres
Publié: (2025)
par: Zhang, Yiman, et autres
Publié: (2025)
BabelBench: An Omni Benchmark for Code-Driven Analysis of Multimodal and Multistructured Data
par: Wang, Xuwu, et autres
Publié: (2024)
par: Wang, Xuwu, et autres
Publié: (2024)
EduGuardBench: A Holistic Benchmark for Evaluating the Pedagogical Fidelity and Adversarial Safety of LLMs as Simulated Teachers
par: Jiang, Yilin, et autres
Publié: (2025)
par: Jiang, Yilin, et autres
Publié: (2025)
Omni-DeepSearch: A Benchmark for Audio-Driven Omni-Modal Deep Search
par: Yu, Tao, et autres
Publié: (2026)
par: Yu, Tao, et autres
Publié: (2026)
TEAM: Temporal Adversarial Examples Attack Model against Network Intrusion Detection System Applied to RNN
par: Liu, Ziyi, et autres
Publié: (2024)
par: Liu, Ziyi, et autres
Publié: (2024)
AVT2-DWF: Improving Deepfake Detection with Audio-Visual Fusion and Dynamic Weighting Strategies
par: Wang, Rui, et autres
Publié: (2024)
par: Wang, Rui, et autres
Publié: (2024)
Holistic Evaluation of State-of-the-Art LLMs for Code Generation
par: Zhang, Le, et autres
Publié: (2025)
par: Zhang, Le, et autres
Publié: (2025)
LookBench: A Live and Holistic Open Benchmark for Fashion Image Retrieval
par: ai, Gensmo., et autres
Publié: (2026)
par: ai, Gensmo., et autres
Publié: (2026)
OmniGUI: Benchmarking GUI Agents in Omni-Modal Smartphone Environments
par: Henry, Felix, et autres
Publié: (2026)
par: Henry, Felix, et autres
Publié: (2026)
Documents similaires
-
Seirênes: Adversarial Self-Play with Evolving Distractions for LLM Reasoning
par: Zhang, Chi, et autres
Publié: (2026) -
CognitionCapturerPro: Towards High-Fidelity Visual Decoding from EEG/MEG via Multi-modal Information and Asymmetric Alignment
par: Zhang, Kaifan, et autres
Publié: (2026) -
AI-Generated Image Quality Assessment Based on Task-Specific Prompt and Multi-Granularity Similarity
par: Xia, Jili, et autres
Publié: (2024) -
Boosting Temporal Sentence Grounding via Causal Inference
par: Tang, Kefan, et autres
Publié: (2025) -
Trinity Detector:text-assisted and attention mechanisms based spectral fusion for diffusion generation image detection
par: Song, Jiawei, et autres
Publié: (2024)