Robust Diagram Reasoning: A Framework for Enhancing LVLM Performance on Visually Perturbed Scientific Diagrams
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhou, Minghao, Souza, Rafael, Hu, Yaqian, Che, Luming |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
OmniSch: A Multimodal PCB Schematic Benchmark For Structured Diagram Visual Reasoning
por: Lu, Taiting, et al.
Publicado: (2026)
por: Lu, Taiting, et al.
Publicado: (2026)
DRAGON: A Benchmark for Evidence-Grounded Visual Reasoning over Diagrams
por: Iyengar, Anirudh Iyengar Kaniyar Narayana, et al.
Publicado: (2026)
por: Iyengar, Anirudh Iyengar Kaniyar Narayana, et al.
Publicado: (2026)
SciFlow-Bench: Evaluating Structure-Aware Scientific Diagram Generation via Inverse Parsing
por: Zhang, Tong, et al.
Publicado: (2026)
por: Zhang, Tong, et al.
Publicado: (2026)
DIAGRAMS: A Review Framework for Reasoning-Level Attribution in Diagram QA
por: Iyengar, Anirudh Iyengar Kaniyar Narayana, et al.
Publicado: (2026)
por: Iyengar, Anirudh Iyengar Kaniyar Narayana, et al.
Publicado: (2026)
Math Blind: Failures in Diagram Understanding Undermine Reasoning in MLLMs
por: Sun, Yanpeng, et al.
Publicado: (2025)
por: Sun, Yanpeng, et al.
Publicado: (2025)
Hierarchical Contextual Grounding LVLM: Enhancing Fine-Grained Visual-Language Understanding with Robust Grounding
por: Guo, Leilei, et al.
Publicado: (2025)
por: Guo, Leilei, et al.
Publicado: (2025)
Fooling the LVLM Judges: Visual Biases in LVLM-Based Evaluation
por: Hwang, Yerin, et al.
Publicado: (2025)
por: Hwang, Yerin, et al.
Publicado: (2025)
Diagram Formalization Enhanced Multi-Modal Geometry Problem Solver
por: Zhang, Zeren, et al.
Publicado: (2024)
por: Zhang, Zeren, et al.
Publicado: (2024)
Diagram-Driven Course Questions Generation
por: Zhang, Xinyu, et al.
Publicado: (2024)
por: Zhang, Xinyu, et al.
Publicado: (2024)
RxnCaption: Reformulating Reaction Diagram Parsing as Visual Prompt Guided Captioning
por: Song, Jiahe, et al.
Publicado: (2025)
por: Song, Jiahe, et al.
Publicado: (2025)
HumanEval-V: Benchmarking High-Level Visual Reasoning with Complex Diagrams in Coding Tasks
por: Zhang, Fengji, et al.
Publicado: (2024)
por: Zhang, Fengji, et al.
Publicado: (2024)
Fighting Hallucinations with Counterfactuals: Diffusion-Guided Perturbations for LVLM Hallucination Suppression
por: Dastmalchi, Hamidreza, et al.
Publicado: (2026)
por: Dastmalchi, Hamidreza, et al.
Publicado: (2026)
Molecular Identifier Visual Prompt and Verifiable Reinforcement Learning for Chemical Reaction Diagram Parsing
por: Song, Jiahe, et al.
Publicado: (2026)
por: Song, Jiahe, et al.
Publicado: (2026)
Soft Anisotropic Diagrams for Differentiable Image Representation
por: Iinbor, Laki, et al.
Publicado: (2026)
por: Iinbor, Laki, et al.
Publicado: (2026)
Temporally Grounding Instructional Diagrams in Unconstrained Videos
por: Zhang, Jiahao, et al.
Publicado: (2024)
por: Zhang, Jiahao, et al.
Publicado: (2024)
Historical Astronomical Diagrams Decomposition in Geometric Primitives
por: Kalleli, Syrine, et al.
Publicado: (2024)
por: Kalleli, Syrine, et al.
Publicado: (2024)
ReasonGrounder: LVLM-Guided Hierarchical Feature Splatting for Open-Vocabulary 3D Visual Grounding and Reasoning
por: Liu, Zhenyang, et al.
Publicado: (2025)
por: Liu, Zhenyang, et al.
Publicado: (2025)
GenAI-DrawIO-Creator: A Framework for Automated Diagram Generation
por: Yu, Jinze, et al.
Publicado: (2026)
por: Yu, Jinze, et al.
Publicado: (2026)
EvoDiagram: Agentic Editable Diagram Creation via Design Expertise Evolution
por: Wang, Tianfu, et al.
Publicado: (2026)
por: Wang, Tianfu, et al.
Publicado: (2026)
Aligning Step-by-Step Instructional Diagrams to Video Demonstrations
por: Zhang, Jiahao, et al.
Publicado: (2023)
por: Zhang, Jiahao, et al.
Publicado: (2023)
Bridging Semantics and Geometry: A Decoupled LVLM-SAM Framework for Reasoning Segmentation in Optical Remote Sensing
por: Zhang, Xu, et al.
Publicado: (2025)
por: Zhang, Xu, et al.
Publicado: (2025)
TTVD: Towards a Geometric Framework for Test-Time Adaptation Based on Voronoi Diagram
por: Lei, Mingxi, et al.
Publicado: (2024)
por: Lei, Mingxi, et al.
Publicado: (2024)
GeoSDF: Plane Geometry Diagram Synthesis via Signed Distance Field
por: Zhang, Chengrui, et al.
Publicado: (2025)
por: Zhang, Chengrui, et al.
Publicado: (2025)
Structure Diagram Recognition in Financial Announcements
por: Qiao, Meixuan, et al.
Publicado: (2023)
por: Qiao, Meixuan, et al.
Publicado: (2023)
Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward
por: Fan, Zhiyuan, et al.
Publicado: (2025)
por: Fan, Zhiyuan, et al.
Publicado: (2025)
Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers
por: Zhao, Yilun, et al.
Publicado: (2025)
por: Zhao, Yilun, et al.
Publicado: (2025)
From Engineering Diagrams to Graphs: Digitizing P&IDs with Transformers
por: Stürmer, Jan Marius, et al.
Publicado: (2024)
por: Stürmer, Jan Marius, et al.
Publicado: (2024)
Visual Language Model as a Judge for Object Detection in Industrial Diagrams
por: Ghosh, Sanjukta
Publicado: (2025)
por: Ghosh, Sanjukta
Publicado: (2025)
POPEN: Preference-Based Optimization and Ensemble for LVLM-Based Reasoning Segmentation
por: Zhu, Lanyun, et al.
Publicado: (2025)
por: Zhu, Lanyun, et al.
Publicado: (2025)
LVLM-empowered Multi-modal Representation Learning for Visual Place Recognition
por: Wang, Teng, et al.
Publicado: (2024)
por: Wang, Teng, et al.
Publicado: (2024)
MagicGeo: Training-Free Text-Guided Geometric Diagram Generation
por: Wang, Junxiao, et al.
Publicado: (2025)
por: Wang, Junxiao, et al.
Publicado: (2025)
ChemScraper: Leveraging PDF Graphics Instructions for Molecular Diagram Parsing
por: Shah, Ayush Kumar, et al.
Publicado: (2023)
por: Shah, Ayush Kumar, et al.
Publicado: (2023)
Enginuity: Building an Open Multi-Domain Dataset of Complex Engineering Diagrams
por: Seefried, Ethan, et al.
Publicado: (2026)
por: Seefried, Ethan, et al.
Publicado: (2026)
LAVID: An Agentic LVLM Framework for Diffusion-Generated Video Detection
por: Liu, Qingyuan, et al.
Publicado: (2025)
por: Liu, Qingyuan, et al.
Publicado: (2025)
Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling
por: Movva, Prahitha, et al.
Publicado: (2025)
por: Movva, Prahitha, et al.
Publicado: (2025)
Vision Remember: Recovering Visual Information in Efficient LVLM with Vision Feature Resampling
por: Feng, Ze, et al.
Publicado: (2025)
por: Feng, Ze, et al.
Publicado: (2025)
GeoLoom: High-quality Geometric Diagram Generation from Textual Input
por: Wei, Xiaojing, et al.
Publicado: (2025)
por: Wei, Xiaojing, et al.
Publicado: (2025)
Manual-PA: Learning 3D Part Assembly from Instruction Diagrams
por: Zhang, Jiahao, et al.
Publicado: (2024)
por: Zhang, Jiahao, et al.
Publicado: (2024)
Geoparsing: Diagram Parsing for Plane and Solid Geometry with a Unified Formal Language
por: Wang, Peijie, et al.
Publicado: (2026)
por: Wang, Peijie, et al.
Publicado: (2026)
Pseudo Contrastive Learning for Diagram Comprehension in Multimodal Models
por: Sasaki, Hiroshi
Publicado: (2026)
por: Sasaki, Hiroshi
Publicado: (2026)
Ejemplares similares
-
OmniSch: A Multimodal PCB Schematic Benchmark For Structured Diagram Visual Reasoning
por: Lu, Taiting, et al.
Publicado: (2026) -
DRAGON: A Benchmark for Evidence-Grounded Visual Reasoning over Diagrams
por: Iyengar, Anirudh Iyengar Kaniyar Narayana, et al.
Publicado: (2026) -
SciFlow-Bench: Evaluating Structure-Aware Scientific Diagram Generation via Inverse Parsing
por: Zhang, Tong, et al.
Publicado: (2026) -
DIAGRAMS: A Review Framework for Reasoning-Level Attribution in Diagram QA
por: Iyengar, Anirudh Iyengar Kaniyar Narayana, et al.
Publicado: (2026) -
Math Blind: Failures in Diagram Understanding Undermine Reasoning in MLLMs
por: Sun, Yanpeng, et al.
Publicado: (2025)