IW-Bench: Evaluating Large Multimodal Models for Converting Image-to-Web
Fuente:
arXiv
Salvato in:
| Autori principali: | Guo, Hongcheng, Zhang, Wei, Chen, Junhao, Gu, Yaonan, Yang, Jian, Du, Junjia, Cao, Shaosheng, Hui, Binyuan, Liu, Tianyu, Ma, Jianxin, Zhou, Chang, Li, Zhoujun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Cluster-Driven Expert Pruning for Mixture-of-Experts Large Language Models
di: Guo, Hongcheng, et al.
Pubblicazione: (2025)
di: Guo, Hongcheng, et al.
Pubblicazione: (2025)
SNS-Bench-VL: Benchmarking Multimodal Large Language Models in Social Networking Services
di: Guo, Hongcheng, et al.
Pubblicazione: (2025)
di: Guo, Hongcheng, et al.
Pubblicazione: (2025)
Pet-Bench: Benchmarking the Abilities of Large Language Models as E-Pets in Social Network Services
di: Guo, Hongcheng, et al.
Pubblicazione: (2025)
di: Guo, Hongcheng, et al.
Pubblicazione: (2025)
DependEval: Benchmarking LLMs for Repository Dependency Understanding
di: Du, Junjia, et al.
Pubblicazione: (2025)
di: Du, Junjia, et al.
Pubblicazione: (2025)
H2HTalk: Evaluating Large Language Models as Emotional Companion
di: Wang, Boyang, et al.
Pubblicazione: (2025)
di: Wang, Boyang, et al.
Pubblicazione: (2025)
Redefining Machine Translation on Social Network Services with Large Language Models
di: Guo, Hongcheng, et al.
Pubblicazione: (2025)
di: Guo, Hongcheng, et al.
Pubblicazione: (2025)
Mitigating Hallucinations in Large Vision-Language Models by Adaptively Constraining Information Flow
di: Bai, Jiaqi, et al.
Pubblicazione: (2025)
di: Bai, Jiaqi, et al.
Pubblicazione: (2025)
CodeIF: Benchmarking the Instruction-Following Capabilities of Large Language Models for Code Generation
di: Yan, Kaiwen, et al.
Pubblicazione: (2025)
di: Yan, Kaiwen, et al.
Pubblicazione: (2025)
ExecRepoBench: Multi-level Executable Code Completion Evaluation
di: Yang, Jian, et al.
Pubblicazione: (2024)
di: Yang, Jian, et al.
Pubblicazione: (2024)
PCA-Bench: Evaluating Multimodal Large Language Models in Perception-Cognition-Action Chain
di: Chen, Liang, et al.
Pubblicazione: (2024)
di: Chen, Liang, et al.
Pubblicazione: (2024)
m3P: Towards Multimodal Multilingual Translation with Multimodal Prompt
di: Yang, Jian, et al.
Pubblicazione: (2024)
di: Yang, Jian, et al.
Pubblicazione: (2024)
UniCoder: Scaling Code Large Language Model via Universal Code
di: Sun, Tao, et al.
Pubblicazione: (2024)
di: Sun, Tao, et al.
Pubblicazione: (2024)
RotBench: Evaluating Multimodal Large Language Models on Identifying Image Rotation
di: Niu, Tianyi, et al.
Pubblicazione: (2025)
di: Niu, Tianyi, et al.
Pubblicazione: (2025)
MIRAGE: Exploring How Large Language Models Perform in Complex Social Interactive Environments
di: Cai, Yin, et al.
Pubblicazione: (2025)
di: Cai, Yin, et al.
Pubblicazione: (2025)
Large Language Models Meet Symbolic Provers for Logical Reasoning Evaluation
di: Qi, Chengwen, et al.
Pubblicazione: (2025)
di: Qi, Chengwen, et al.
Pubblicazione: (2025)
MRAG-Bench: Vision-Centric Evaluation for Retrieval-Augmented Multimodal Models
di: Hu, Wenbo, et al.
Pubblicazione: (2024)
di: Hu, Wenbo, et al.
Pubblicazione: (2024)
MDIT-Bench: Evaluating the Dual-Implicit Toxicity in Large Multimodal Models
di: Jin, Bohan, et al.
Pubblicazione: (2025)
di: Jin, Bohan, et al.
Pubblicazione: (2025)
ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document Reconstruction
di: Guo, Zichun, et al.
Pubblicazione: (2026)
di: Guo, Zichun, et al.
Pubblicazione: (2026)
Actial: Activate Spatial Reasoning Ability of Multimodal Large Language Models
di: Zhan, Xiaoyu, et al.
Pubblicazione: (2025)
di: Zhan, Xiaoyu, et al.
Pubblicazione: (2025)
Synthesizing Text-to-SQL Data from Weak and Strong LLMs
di: Yang, Jiaxi, et al.
Pubblicazione: (2024)
di: Yang, Jiaxi, et al.
Pubblicazione: (2024)
MM-SafetyBench: A Benchmark for Safety Evaluation of Multimodal Large Language Models
di: Liu, Xin, et al.
Pubblicazione: (2023)
di: Liu, Xin, et al.
Pubblicazione: (2023)
Efficient Multimodal 3D Object Detector via Instance-Level Contrastive Distillation
di: Su, Zhuoqun, et al.
Pubblicazione: (2025)
di: Su, Zhuoqun, et al.
Pubblicazione: (2025)
A Value Mapping Virtual Staining Framework for Large-scale Histological Imaging
di: Wang, Junjia, et al.
Pubblicazione: (2025)
di: Wang, Junjia, et al.
Pubblicazione: (2025)
II-Bench: An Image Implication Understanding Benchmark for Multimodal Large Language Models
di: Liu, Ziqiang, et al.
Pubblicazione: (2024)
di: Liu, Ziqiang, et al.
Pubblicazione: (2024)
SimpleVQA: Multimodal Factuality Evaluation for Multimodal Large Language Models
di: Cheng, Xianfu, et al.
Pubblicazione: (2025)
di: Cheng, Xianfu, et al.
Pubblicazione: (2025)
Greit-HRNet: Grouped Lightweight High-Resolution Network for Human Pose Estimation
di: Han, Junjia
Pubblicazione: (2024)
di: Han, Junjia
Pubblicazione: (2024)
IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs
di: Ma, David, et al.
Pubblicazione: (2025)
di: Ma, David, et al.
Pubblicazione: (2025)
VocalBench-DF: A Benchmark for Evaluating Speech LLM Robustness to Disfluency
di: Liu, Hongcheng, et al.
Pubblicazione: (2025)
di: Liu, Hongcheng, et al.
Pubblicazione: (2025)
StyleBench: Evaluating thinking styles in Large Language Models
di: Guo, Junyu, et al.
Pubblicazione: (2025)
di: Guo, Junyu, et al.
Pubblicazione: (2025)
T2IW: Joint Text to Image & Watermark Generation
di: Liu, An-An, et al.
Pubblicazione: (2023)
di: Liu, An-An, et al.
Pubblicazione: (2023)
CompBench: Benchmarking Complex Instruction-guided Image Editing
di: Jia, Bohan, et al.
Pubblicazione: (2025)
di: Jia, Bohan, et al.
Pubblicazione: (2025)
Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models
di: Huang, Wenxuan, et al.
Pubblicazione: (2025)
di: Huang, Wenxuan, et al.
Pubblicazione: (2025)
Dynamic-LLaVA: Efficient Multimodal Large Language Models via Dynamic Vision-language Context Sparsification
di: Huang, Wenxuan, et al.
Pubblicazione: (2024)
di: Huang, Wenxuan, et al.
Pubblicazione: (2024)
Multimodal RewardBench 2: Evaluating Omni Reward Models for Interleaved Text and Image
di: Hu, Yushi, et al.
Pubblicazione: (2025)
di: Hu, Yushi, et al.
Pubblicazione: (2025)
AesBench: An Expert Benchmark for Multimodal Large Language Models on Image Aesthetics Perception
di: Huang, Yipo, et al.
Pubblicazione: (2024)
di: Huang, Yipo, et al.
Pubblicazione: (2024)
Anonymous Pricing in Large Markets
di: Jin, Yaonan, et al.
Pubblicazione: (2026)
di: Jin, Yaonan, et al.
Pubblicazione: (2026)
MMR: Evaluating Reading Ability of Large Multimodal Models
di: Chen, Jian, et al.
Pubblicazione: (2024)
di: Chen, Jian, et al.
Pubblicazione: (2024)
VisualAgentBench: Towards Large Multimodal Models as Visual Foundation Agents
di: Liu, Xiao, et al.
Pubblicazione: (2024)
di: Liu, Xiao, et al.
Pubblicazione: (2024)
IFEvalCode: Controlled Code Generation
di: Yang, Jian, et al.
Pubblicazione: (2025)
di: Yang, Jian, et al.
Pubblicazione: (2025)
AesBiasBench: Evaluating Bias and Alignment in Multimodal Language Models for Personalized Image Aesthetic Assessment
di: Li, Kun, et al.
Pubblicazione: (2025)
di: Li, Kun, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Cluster-Driven Expert Pruning for Mixture-of-Experts Large Language Models
di: Guo, Hongcheng, et al.
Pubblicazione: (2025) -
SNS-Bench-VL: Benchmarking Multimodal Large Language Models in Social Networking Services
di: Guo, Hongcheng, et al.
Pubblicazione: (2025) -
Pet-Bench: Benchmarking the Abilities of Large Language Models as E-Pets in Social Network Services
di: Guo, Hongcheng, et al.
Pubblicazione: (2025) -
DependEval: Benchmarking LLMs for Repository Dependency Understanding
di: Du, Junjia, et al.
Pubblicazione: (2025) -
H2HTalk: Evaluating Large Language Models as Emotional Companion
di: Wang, Boyang, et al.
Pubblicazione: (2025)