Salvato in:
| Autori principali: | Zhang, Tong, Lin, Honglin, Liu, Zhou, Chen, Chong, Zhang, Wentao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2602.09809 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SciFlow: Empowering Lightweight Optical Flow Models with Self-Cleaning Iterations
di: Lin, Jamie Menjay, et al.
Pubblicazione: (2024)
di: Lin, Jamie Menjay, et al.
Pubblicazione: (2024)
HiSciBench: A Hierarchical Multi-disciplinary Benchmark for Scientific Intelligence from Reading to Discovery
di: Zhang, Yaping, et al.
Pubblicazione: (2025)
di: Zhang, Yaping, et al.
Pubblicazione: (2025)
ParseBench: A Document Parsing Benchmark for AI Agents
di: Zhang, Boyang, et al.
Pubblicazione: (2026)
di: Zhang, Boyang, et al.
Pubblicazione: (2026)
Geoparsing: Diagram Parsing for Plane and Solid Geometry with a Unified Formal Language
di: Wang, Peijie, et al.
Pubblicazione: (2026)
di: Wang, Peijie, et al.
Pubblicazione: (2026)
LongInsightBench: A Comprehensive Benchmark for Evaluating Omni-Modal Models on Human-Centric Long-Video Understanding
di: Han, ZhaoYang, et al.
Pubblicazione: (2025)
di: Han, ZhaoYang, et al.
Pubblicazione: (2025)
SciVQR: A Multidisciplinary Multimodal Benchmark for Advanced Scientific Reasoning Evaluation
di: Guo, Longteng, et al.
Pubblicazione: (2026)
di: Guo, Longteng, et al.
Pubblicazione: (2026)
SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
di: Deng, Andong, et al.
Pubblicazione: (2025)
di: Deng, Andong, et al.
Pubblicazione: (2025)
DOCR-Inspector: Fine-Grained and Automated Evaluation of Document Parsing with VLM
di: Zhang, Qintong, et al.
Pubblicazione: (2025)
di: Zhang, Qintong, et al.
Pubblicazione: (2025)
Scientific Graphics Program Synthesis via Dual Self-Consistency Reinforcement Learning
di: Lin, Juekai, et al.
Pubblicazione: (2026)
di: Lin, Juekai, et al.
Pubblicazione: (2026)
Robust Diagram Reasoning: A Framework for Enhancing LVLM Performance on Visually Perturbed Scientific Diagrams
di: Zhou, Minghao, et al.
Pubblicazione: (2025)
di: Zhou, Minghao, et al.
Pubblicazione: (2025)
RoomPilot: Controllable Indoor Scene Synthesis via Multimodal Semantic Parsing
di: Chen, Wentang, et al.
Pubblicazione: (2025)
di: Chen, Wentang, et al.
Pubblicazione: (2025)
ChemScraper: Leveraging PDF Graphics Instructions for Molecular Diagram Parsing
di: Shah, Ayush Kumar, et al.
Pubblicazione: (2023)
di: Shah, Ayush Kumar, et al.
Pubblicazione: (2023)
RxnCaption: Reformulating Reaction Diagram Parsing as Visual Prompt Guided Captioning
di: Song, Jiahe, et al.
Pubblicazione: (2025)
di: Song, Jiahe, et al.
Pubblicazione: (2025)
Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding
di: Yin, Kun, et al.
Pubblicazione: (2026)
di: Yin, Kun, et al.
Pubblicazione: (2026)
MMFineReason: Closing the Multimodal Reasoning Gap via Open Data-Centric Methods
di: Lin, Honglin, et al.
Pubblicazione: (2026)
di: Lin, Honglin, et al.
Pubblicazione: (2026)
S-RRG-Bench: Structured Radiology Report Generation with Fine-Grained Evaluation Framework
di: Li, Yingshu, et al.
Pubblicazione: (2025)
di: Li, Yingshu, et al.
Pubblicazione: (2025)
3DGen-Bench: Comprehensive Benchmark Suite for 3D Generative Models
di: Zhang, Yuhan, et al.
Pubblicazione: (2025)
di: Zhang, Yuhan, et al.
Pubblicazione: (2025)
IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering
di: Liu, Parker, et al.
Pubblicazione: (2025)
di: Liu, Parker, et al.
Pubblicazione: (2025)
SciFigDetect: A Benchmark for AI-Generated Scientific Figure Detection
di: Hu, You, et al.
Pubblicazione: (2026)
di: Hu, You, et al.
Pubblicazione: (2026)
Towards Real-World Document Parsing via Realistic Scene Synthesis and Document-Aware Training
di: Li, Gengluo, et al.
Pubblicazione: (2026)
di: Li, Gengluo, et al.
Pubblicazione: (2026)
OCRGenBench: A Comprehensive Benchmark for Evaluating OCR Generative Capabilities
di: Zhang, Peirong, et al.
Pubblicazione: (2025)
di: Zhang, Peirong, et al.
Pubblicazione: (2025)
MonkeyOCR: Document Parsing with a Structure-Recognition-Relation Triplet Paradigm
di: Li, Zhang, et al.
Pubblicazione: (2025)
di: Li, Zhang, et al.
Pubblicazione: (2025)
Taking A Closer Look at Interacting Objects: Interaction-Aware Open Vocabulary Scene Graph Generation
di: Li, Lin, et al.
Pubblicazione: (2025)
di: Li, Lin, et al.
Pubblicazione: (2025)
TechImage-Bench: Rubric-Based Evaluation for Technical Image Generation
di: Ni, Minheng, et al.
Pubblicazione: (2025)
di: Ni, Minheng, et al.
Pubblicazione: (2025)
SciDraw-6K: A Multilingual Scientific Illustration Dataset Generated by Google Gemini
di: Chen, Davie
Pubblicazione: (2026)
di: Chen, Davie
Pubblicazione: (2026)
Document Parsing Unveiled: Techniques, Challenges, and Prospects for Structured Information Extraction
di: Zhang, Qintong, et al.
Pubblicazione: (2024)
di: Zhang, Qintong, et al.
Pubblicazione: (2024)
CreatiParser: Generative Image Parsing of Raster Graphic Designs into Editable Layers
di: Chen, Weidong, et al.
Pubblicazione: (2026)
di: Chen, Weidong, et al.
Pubblicazione: (2026)
Molecular Identifier Visual Prompt and Verifiable Reinforcement Learning for Chemical Reaction Diagram Parsing
di: Song, Jiahe, et al.
Pubblicazione: (2026)
di: Song, Jiahe, et al.
Pubblicazione: (2026)
SciPostLayoutTree: A Dataset for Structural Analysis of Scientific Posters
di: Tanaka, Shohei, et al.
Pubblicazione: (2025)
di: Tanaka, Shohei, et al.
Pubblicazione: (2025)
AgenticOCR: Parsing Only What You Need for Efficient Retrieval-Augmented Generation
di: Wang, Zhengren, et al.
Pubblicazione: (2026)
di: Wang, Zhengren, et al.
Pubblicazione: (2026)
Diagram-Driven Course Questions Generation
di: Zhang, Xinyu, et al.
Pubblicazione: (2024)
di: Zhang, Xinyu, et al.
Pubblicazione: (2024)
SridBench: Benchmark of Scientific Research Illustration Drawing of Image Generation Model
di: Chang, Yifan, et al.
Pubblicazione: (2025)
di: Chang, Yifan, et al.
Pubblicazione: (2025)
OmniDocBench: Benchmarking Diverse PDF Document Parsing with Comprehensive Annotations
di: Ouyang, Linke, et al.
Pubblicazione: (2024)
di: Ouyang, Linke, et al.
Pubblicazione: (2024)
Layout-Aware Parsing Meets Efficient LLMs: A Unified, Scalable Framework for Resume Information Extraction and Evaluation
di: Zhu, Fanwei, et al.
Pubblicazione: (2025)
di: Zhu, Fanwei, et al.
Pubblicazione: (2025)
Artifact-Bench: Evaluating MLLMs on Detecting and Assessing the Artifacts of AI-Generated Videos
di: Tang, Yuqi, et al.
Pubblicazione: (2026)
di: Tang, Yuqi, et al.
Pubblicazione: (2026)
KPM-Bench: A Kinematic Parsing Motion Benchmark for Fine-grained Motion-centric Video Understanding
di: Lin, Boda, et al.
Pubblicazione: (2026)
di: Lin, Boda, et al.
Pubblicazione: (2026)
Qwen-Image-Bench: From Generation to Creation in Text-to-Image Evaluation
di: Li, Niantong, et al.
Pubblicazione: (2026)
di: Li, Niantong, et al.
Pubblicazione: (2026)
Occlusion-Aware Deep Convolutional Neural Network via Homogeneous Tanh-transforms for Face Parsing
di: Qiua, Jianhua, et al.
Pubblicazione: (2023)
di: Qiua, Jianhua, et al.
Pubblicazione: (2023)
Real5-OmniDocBench: A Full-Scale Physical Reconstruction Benchmark for Robust Document Parsing in the Wild
di: Zhou, Changda, et al.
Pubblicazione: (2026)
di: Zhou, Changda, et al.
Pubblicazione: (2026)
SceneParser: Hierarchical Scene Parsing for Visual Semantics Understanding
di: Xu, Pengxin, et al.
Pubblicazione: (2026)
di: Xu, Pengxin, et al.
Pubblicazione: (2026)
Documenti analoghi
-
SciFlow: Empowering Lightweight Optical Flow Models with Self-Cleaning Iterations
di: Lin, Jamie Menjay, et al.
Pubblicazione: (2024) -
HiSciBench: A Hierarchical Multi-disciplinary Benchmark for Scientific Intelligence from Reading to Discovery
di: Zhang, Yaping, et al.
Pubblicazione: (2025) -
ParseBench: A Document Parsing Benchmark for AI Agents
di: Zhang, Boyang, et al.
Pubblicazione: (2026) -
Geoparsing: Diagram Parsing for Plane and Solid Geometry with a Unified Formal Language
di: Wang, Peijie, et al.
Pubblicazione: (2026) -
LongInsightBench: A Comprehensive Benchmark for Evaluating Omni-Modal Models on Human-Centric Long-Video Understanding
di: Han, ZhaoYang, et al.
Pubblicazione: (2025)