VGBench: Evaluating Large Language Models on Vector Graphics Understanding and Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zou, Bocheng, Cai, Mu, Zhang, Jianrui, Lee, Yong Jae |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Leveraging Large Language Models for Scalable Vector Graphics-Driven Image Understanding
par: Cai, Mu, et autres
Publié: (2023)
par: Cai, Mu, et autres
Publié: (2023)
Vinoground: Scrutinizing LMMs over Dense Temporal Reasoning with Short Videos
par: Zhang, Jianrui, et autres
Publié: (2024)
par: Zhang, Jianrui, et autres
Publié: (2024)
CounterCurate: Enhancing Physical and Semantic Visio-Linguistic Compositional Reasoning via Counterfactual Examples
par: Zhang, Jianrui, et autres
Publié: (2024)
par: Zhang, Jianrui, et autres
Publié: (2024)
TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models
par: Cai, Mu, et autres
Publié: (2024)
par: Cai, Mu, et autres
Publié: (2024)
See, Hear, and Understand: Benchmarking Audiovisual Human Speech Understanding in Multimodal Large Language Models
par: Nguyen, Le Thien Phuc, et autres
Publié: (2025)
par: Nguyen, Le Thien Phuc, et autres
Publié: (2025)
ViP-LLaVA: Making Large Multimodal Models Understand Arbitrary Visual Prompts
par: Cai, Mu, et autres
Publié: (2023)
par: Cai, Mu, et autres
Publié: (2023)
Matryoshka Multimodal Models
par: Cai, Mu, et autres
Publié: (2024)
par: Cai, Mu, et autres
Publié: (2024)
Unified Spatio-Temporal Token Scoring for Efficient Video VLMs
par: Zhang, Jianrui, et autres
Publié: (2026)
par: Zhang, Jianrui, et autres
Publié: (2026)
Can Large Language Models Understand Symbolic Graphics Programs?
par: Qiu, Zeju, et autres
Publié: (2024)
par: Qiu, Zeju, et autres
Publié: (2024)
Reasoning-Augmented Representations for Multimodal Retrieval
par: Zhang, Jianrui, et autres
Publié: (2026)
par: Zhang, Jianrui, et autres
Publié: (2026)
SVGen: Interpretable Vector Graphics Generation with Large Language Models
par: Wang, Feiyu, et autres
Publié: (2025)
par: Wang, Feiyu, et autres
Publié: (2025)
UniSVG: A Unified Dataset for Vector Graphic Understanding and Generation with Multimodal Large Language Models
par: Li, Jinke, et autres
Publié: (2025)
par: Li, Jinke, et autres
Publié: (2025)
Graphic-Design-Bench: A Comprehensive Benchmark for Evaluating AI on Graphic Design Tasks
par: Deganutti, Adrienne, et autres
Publié: (2026)
par: Deganutti, Adrienne, et autres
Publié: (2026)
Interpolating Video-LLMs: Toward Longer-sequence LMMs in a Training-free Manner
par: Shang, Yuzhang, et autres
Publié: (2024)
par: Shang, Yuzhang, et autres
Publié: (2024)
Interpreting Attention Heads for Image-to-Text Information Flow in Large Vision-Language Models
par: Kim, Jinyeong, et autres
Publié: (2025)
par: Kim, Jinyeong, et autres
Publié: (2025)
LatticeWorld: A Multimodal Large Language Model-Empowered Framework for Interactive Complex World Generation
par: Duan, Yinglin, et autres
Publié: (2025)
par: Duan, Yinglin, et autres
Publié: (2025)
Diagnosing and Mitigating Modality Interference in Multimodal Large Language Models
par: Cai, Rui, et autres
Publié: (2025)
par: Cai, Rui, et autres
Publié: (2025)
Do Language Models Understand Time?
par: Ding, Xi, et autres
Publié: (2024)
par: Ding, Xi, et autres
Publié: (2024)
Retrieval Visual Contrastive Decoding to Mitigate Object Hallucinations in Large Vision-Language Models
par: Lee, Jihoon, et autres
Publié: (2025)
par: Lee, Jihoon, et autres
Publié: (2025)
Unsolvable Problem Detection: Robust Understanding Evaluation for Large Multimodal Models
par: Miyai, Atsuyuki, et autres
Publié: (2024)
par: Miyai, Atsuyuki, et autres
Publié: (2024)
Evaluating Hallucination in Large Vision-Language Models based on Context-Aware Object Similarities
par: Datta, Shounak, et autres
Publié: (2025)
par: Datta, Shounak, et autres
Publié: (2025)
RadAlign: Advancing Radiology Report Generation with Vision-Language Concept Alignment
par: Gu, Difei, et autres
Publié: (2025)
par: Gu, Difei, et autres
Publié: (2025)
Automatically Generating Visual Hallucination Test Cases for Multimodal Large Language Models
par: Liu, Zhongye, et autres
Publié: (2024)
par: Liu, Zhongye, et autres
Publié: (2024)
DMQ: Dissecting Outliers of Diffusion Models for Post-Training Quantization
par: Lee, Dongyeun, et autres
Publié: (2025)
par: Lee, Dongyeun, et autres
Publié: (2025)
Anatomy-VLM: A Fine-grained Vision-Language Model for Medical Interpretation
par: Gu, Difei, et autres
Publié: (2025)
par: Gu, Difei, et autres
Publié: (2025)
ChatGPT Encounters Morphing Attack Detection: Zero-Shot MAD with Multi-Modal Large Language Models and General Vision Models
par: Zhang, Haoyu, et autres
Publié: (2025)
par: Zhang, Haoyu, et autres
Publié: (2025)
Exploring the Transferability of Visual Prompting for Multimodal Large Language Models
par: Zhang, Yichi, et autres
Publié: (2024)
par: Zhang, Yichi, et autres
Publié: (2024)
Exploring Perceptual Limitation of Multimodal Large Language Models
par: Zhang, Jiarui, et autres
Publié: (2024)
par: Zhang, Jiarui, et autres
Publié: (2024)
ConVis: Contrastive Decoding with Hallucination Visualization for Mitigating Hallucinations in Multimodal Large Language Models
par: Park, Yeji, et autres
Publié: (2024)
par: Park, Yeji, et autres
Publié: (2024)
Transferable Model-agnostic Vision-Language Model Adaptation for Efficient Weak-to-Strong Generalization
par: Park, Jihwan, et autres
Publié: (2025)
par: Park, Jihwan, et autres
Publié: (2025)
LLM4SGG: Large Language Models for Weakly Supervised Scene Graph Generation
par: Kim, Kibum, et autres
Publié: (2023)
par: Kim, Kibum, et autres
Publié: (2023)
Understanding Retrieval-Augmented Task Adaptation for Vision-Language Models
par: Ming, Yifei, et autres
Publié: (2024)
par: Ming, Yifei, et autres
Publié: (2024)
TopoPerception: A Shortcut-Free Evaluation of Global Visual Perception in Large Vision-Language Models
par: Zhou, Wenhao, et autres
Publié: (2025)
par: Zhou, Wenhao, et autres
Publié: (2025)
NeuroVLM-Bench: Evaluation of Vision-Enabled Large Language Models for Clinical Reasoning in Neurological Disorders
par: Dineva, Katarina Trojachanec, et autres
Publié: (2026)
par: Dineva, Katarina Trojachanec, et autres
Publié: (2026)
DivPrune: Diversity-based Visual Token Pruning for Large Multimodal Models
par: Alvar, Saeed Ranjbar, et autres
Publié: (2025)
par: Alvar, Saeed Ranjbar, et autres
Publié: (2025)
Nemesis: Normalizing the Soft-prompt Vectors of Vision-Language Models
par: Fu, Shuai, et autres
Publié: (2024)
par: Fu, Shuai, et autres
Publié: (2024)
CHARTOM: A Visual Theory-of-Mind Benchmark for LLMs on Misleading Charts
par: Bharti, Shubham, et autres
Publié: (2024)
par: Bharti, Shubham, et autres
Publié: (2024)
Understanding the Role of Hallucination in Reinforcement Post-Training of Multimodal Reasoning Models
par: Zhang, Gengwei, et autres
Publié: (2026)
par: Zhang, Gengwei, et autres
Publié: (2026)
Understanding the Fine-Grained Knowledge Capabilities of Vision-Language Models
par: Ghosh, Dhruba, et autres
Publié: (2026)
par: Ghosh, Dhruba, et autres
Publié: (2026)
SPoRC-VIST: A Benchmark for Evaluating Generative Natural Narrative in Vision-Language Models
par: Zeng, Yunlin
Publié: (2026)
par: Zeng, Yunlin
Publié: (2026)
Documents similaires
-
Leveraging Large Language Models for Scalable Vector Graphics-Driven Image Understanding
par: Cai, Mu, et autres
Publié: (2023) -
Vinoground: Scrutinizing LMMs over Dense Temporal Reasoning with Short Videos
par: Zhang, Jianrui, et autres
Publié: (2024) -
CounterCurate: Enhancing Physical and Semantic Visio-Linguistic Compositional Reasoning via Counterfactual Examples
par: Zhang, Jianrui, et autres
Publié: (2024) -
TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models
par: Cai, Mu, et autres
Publié: (2024) -
See, Hear, and Understand: Benchmarking Audiovisual Human Speech Understanding in Multimodal Large Language Models
par: Nguyen, Le Thien Phuc, et autres
Publié: (2025)