Image2Struct: Benchmarking Structure Extraction for Vision-Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Roberts, Josselin Somerville, Lee, Tony, Wong, Chi Heem, Yasunaga, Michihiro, Mai, Yifan, Liang, Percy |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
VHELM: A Holistic Evaluation of Vision Language Models
by: Lee, Tony, et al.
Published: (2024)
by: Lee, Tony, et al.
Published: (2024)
Multimodal RewardBench: Holistic Evaluation of Reward Models for Vision Language Models
by: Yasunaga, Michihiro, et al.
Published: (2025)
by: Yasunaga, Michihiro, et al.
Published: (2025)
CAT: Content-Adaptive Image Tokenization
by: Shen, Junhong, et al.
Published: (2025)
by: Shen, Junhong, et al.
Published: (2025)
StructRe: Rewriting for Structured Shape Modeling
by: Wang, Jiepeng, et al.
Published: (2023)
by: Wang, Jiepeng, et al.
Published: (2023)
StructXLIP: Enhancing Vision-language Models with Multimodal Structural Cues
by: Ruan, Zanxi, et al.
Published: (2026)
by: Ruan, Zanxi, et al.
Published: (2026)
StructDiff: A Structure-Preserving and Spatially Controllable Diffusion Model for Single-Image Generation
by: He, Yinxi, et al.
Published: (2026)
by: He, Yinxi, et al.
Published: (2026)
StructCore: Structure-Aware Image-Level Scoring for Training-Free Unsupervised Anomaly Detection
by: Chae, Joongwon, et al.
Published: (2026)
by: Chae, Joongwon, et al.
Published: (2026)
StructSR: Refuse Spurious Details in Real-World Image Super-Resolution
by: Li, Yachao, et al.
Published: (2025)
by: Li, Yachao, et al.
Published: (2025)
StructSAM: Structure- and Spectrum-Preserving Token Merging for Segment Anything Models
by: Nguyen, Duy M. H., et al.
Published: (2026)
by: Nguyen, Duy M. H., et al.
Published: (2026)
MMSpec: Benchmarking Speculative Decoding for Vision-Language Models
by: Shen, Hui, et al.
Published: (2026)
by: Shen, Hui, et al.
Published: (2026)
Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model
by: Zhou, Chunting, et al.
Published: (2024)
by: Zhou, Chunting, et al.
Published: (2024)
MemLens: Benchmarking Multimodal Long-Term Memory in Large Vision-Language Models
by: Ren, Xiyu, et al.
Published: (2026)
by: Ren, Xiyu, et al.
Published: (2026)
Language-based Image Colorization: A Benchmark and Beyond
by: Li, Yifan, et al.
Published: (2025)
by: Li, Yifan, et al.
Published: (2025)
StructLDM: Structured Latent Diffusion for 3D Human Generation
by: Hu, Tao, et al.
Published: (2024)
by: Hu, Tao, et al.
Published: (2024)
Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success
by: Kim, Moo Jin, et al.
Published: (2025)
by: Kim, Moo Jin, et al.
Published: (2025)
ConStruct: Structural Distillation of Foundation Models for Prototype-Based Weakly Supervised Histopathology Segmentation
by: Le, Khang, et al.
Published: (2025)
by: Le, Khang, et al.
Published: (2025)
Locality Alignment Improves Vision-Language Models
by: Covert, Ian, et al.
Published: (2024)
by: Covert, Ian, et al.
Published: (2024)
Bridging Different Language Models and Generative Vision Models for Text-to-Image Generation
by: Zhao, Shihao, et al.
Published: (2024)
by: Zhao, Shihao, et al.
Published: (2024)
SPEX: A Vision-Language Model for Land Cover Extraction on Spectral Remote Sensing Images
by: Si, Dongchen, et al.
Published: (2025)
by: Si, Dongchen, et al.
Published: (2025)
StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval
by: Wang, Shaokun, et al.
Published: (2026)
by: Wang, Shaokun, et al.
Published: (2026)
SPARK: Multi-Vision Sensor Perception and Reasoning Benchmark for Large-scale Vision-Language Models
by: Yu, Youngjoon, et al.
Published: (2024)
by: Yu, Youngjoon, et al.
Published: (2024)
Prompt Triage: Structured Optimization Enhances Vision-Language Model Performance on Medical Imaging Benchmarks
by: Singhvi, Arnav, et al.
Published: (2025)
by: Singhvi, Arnav, et al.
Published: (2025)
StructDiff: Structure-aware Diffusion Model for 3D Fine-grained Medical Image Synthesis
by: Xia, Jiahao, et al.
Published: (2025)
by: Xia, Jiahao, et al.
Published: (2025)
VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents
by: Barzelay, Udi, et al.
Published: (2026)
by: Barzelay, Udi, et al.
Published: (2026)
StructInbet: Integrating Explicit Structural Guidance into Inbetween Frame Generation
by: Pan, Zhenglin, et al.
Published: (2025)
by: Pan, Zhenglin, et al.
Published: (2025)
SAR2Struct: Extracting 3D Semantic Structural Representation of Aircraft Targets from Single-View SAR Image
by: Yue, Ziyu, et al.
Published: (2025)
by: Yue, Ziyu, et al.
Published: (2025)
StructLayoutFormer:Conditional Structured Layout Generation via Structure Serialization and Disentanglement
by: Hu, Xin, et al.
Published: (2025)
by: Hu, Xin, et al.
Published: (2025)
StructVPR++: Distill Structural and Semantic Knowledge with Weighting Samples for Visual Place Recognition
by: Shen, Yanqing, et al.
Published: (2025)
by: Shen, Yanqing, et al.
Published: (2025)
SARLANG-1M: A Benchmark for Vision-Language Modeling in SAR Image Understanding
by: Wei, Yimin, et al.
Published: (2025)
by: Wei, Yimin, et al.
Published: (2025)
HoliSafe: Holistic Safety Benchmarking and Modeling for Vision-Language Model
by: Lee, Youngwan, et al.
Published: (2025)
by: Lee, Youngwan, et al.
Published: (2025)
Few-Shot Learning from Gigapixel Images via Hierarchical Vision-Language Alignment and Modeling
by: Wong, Bryan, et al.
Published: (2025)
by: Wong, Bryan, et al.
Published: (2025)
VTEdit-Bench: A Comprehensive Benchmark for Multi-Reference Image Editing Models in Virtual Try-On
by: Liang, Xiaoye, et al.
Published: (2026)
by: Liang, Xiaoye, et al.
Published: (2026)
Abstract 3D Perception for Spatial Intelligence in Vision-Language Models
by: Liu, Yifan, et al.
Published: (2025)
by: Liu, Yifan, et al.
Published: (2025)
Vision Language Models as Values Detectors
by: Abbo, Giulio Antonio, et al.
Published: (2025)
by: Abbo, Giulio Antonio, et al.
Published: (2025)
MMLongBench: Benchmarking Long-Context Vision-Language Models Effectively and Thoroughly
by: Wang, Zhaowei, et al.
Published: (2025)
by: Wang, Zhaowei, et al.
Published: (2025)
StructBiHOI: Structured Articulation Modeling for Long--Horizon Bimanual Hand--Object Interaction Generation
by: Wang, Zhi, et al.
Published: (2026)
by: Wang, Zhi, et al.
Published: (2026)
Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: A Comprehensive Evaluation
by: Yu, Hong-Tao, et al.
Published: (2025)
by: Yu, Hong-Tao, et al.
Published: (2025)
Benchmarking Large Vision-Language Models via Directed Scene Graph for Comprehensive Image Captioning
by: Lu, Fan, et al.
Published: (2024)
by: Lu, Fan, et al.
Published: (2024)
ARCH2S: Dataset, Benchmark and Challenges for Learning Exterior Architectural Structures from Point Clouds
by: Cheung, Ka Lung, et al.
Published: (2024)
by: Cheung, Ka Lung, et al.
Published: (2024)
Enhancing Representation in Medical Vision-Language Foundation Models via Multi-Scale Information Extraction Techniques
by: Huang, Weijian, et al.
Published: (2024)
by: Huang, Weijian, et al.
Published: (2024)
Similar Items
-
VHELM: A Holistic Evaluation of Vision Language Models
by: Lee, Tony, et al.
Published: (2024) -
Multimodal RewardBench: Holistic Evaluation of Reward Models for Vision Language Models
by: Yasunaga, Michihiro, et al.
Published: (2025) -
CAT: Content-Adaptive Image Tokenization
by: Shen, Junhong, et al.
Published: (2025) -
StructRe: Rewriting for Structured Shape Modeling
by: Wang, Jiepeng, et al.
Published: (2023) -
StructXLIP: Enhancing Vision-language Models with Multimodal Structural Cues
by: Ruan, Zanxi, et al.
Published: (2026)