Salvato in:
| Autori principali: | Yi, Zhihang, Zhao, Jian, Lv, Jiancheng, Wang, Tao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2602.10138 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ChartNet: A Million-Scale, High-Quality Multimodal Dataset for Robust Chart Understanding
di: Kondic, Jovana, et al.
Pubblicazione: (2026)
di: Kondic, Jovana, et al.
Pubblicazione: (2026)
ChartMoE: Mixture of Diversely Aligned Expert Connector for Chart Understanding
di: Xu, Zhengzhuo, et al.
Pubblicazione: (2024)
di: Xu, Zhengzhuo, et al.
Pubblicazione: (2024)
On Pre-training of Multimodal Language Models Customized for Chart Understanding
di: Fan, Wan-Cyuan, et al.
Pubblicazione: (2024)
di: Fan, Wan-Cyuan, et al.
Pubblicazione: (2024)
From Pixels to Insights: A Survey on Automatic Chart Understanding in the Era of Large Foundation Models
di: Huang, Kung-Hsiang, et al.
Pubblicazione: (2024)
di: Huang, Kung-Hsiang, et al.
Pubblicazione: (2024)
In-Depth and In-Breadth: Pre-training Multimodal Language Models Customized for Comprehensive Chart Understanding
di: Fan, Wan-Cyuan, et al.
Pubblicazione: (2025)
di: Fan, Wan-Cyuan, et al.
Pubblicazione: (2025)
VOILA: Evaluation of MLLMs For Perceptual Understanding and Analogical Reasoning
di: Yilmaz, Nilay, et al.
Pubblicazione: (2025)
di: Yilmaz, Nilay, et al.
Pubblicazione: (2025)
ChartInsights: Evaluating Multimodal Large Language Models for Low-Level Chart Question Answering
di: Wu, Yifan, et al.
Pubblicazione: (2024)
di: Wu, Yifan, et al.
Pubblicazione: (2024)
PP-DocBee2: Improved Baselines with Efficient Data for Multimodal Document Understanding
di: Huang, Kui, et al.
Pubblicazione: (2025)
di: Huang, Kui, et al.
Pubblicazione: (2025)
Mitigating Object Hallucinations in MLLMs via Multi-Frequency Perturbations
di: Li, Shuo, et al.
Pubblicazione: (2025)
di: Li, Shuo, et al.
Pubblicazione: (2025)
ChartHal: A Fine-grained Framework Evaluating Hallucination of Large Vision Language Models in Chart Understanding
di: Wang, Xingqi, et al.
Pubblicazione: (2025)
di: Wang, Xingqi, et al.
Pubblicazione: (2025)
PP-DocBee: Improving Multimodal Document Understanding Through a Bag of Tricks
di: Ni, Feng, et al.
Pubblicazione: (2025)
di: Ni, Feng, et al.
Pubblicazione: (2025)
Can MLLMs Understand the Deep Implication Behind Chinese Images?
di: Zhang, Chenhao, et al.
Pubblicazione: (2024)
di: Zhang, Chenhao, et al.
Pubblicazione: (2024)
AskChart: Universal Chart Understanding through Textual Enhancement
di: Yang, Xudong, et al.
Pubblicazione: (2024)
di: Yang, Xudong, et al.
Pubblicazione: (2024)
MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs
di: Fu, Chaoyou, et al.
Pubblicazione: (2024)
di: Fu, Chaoyou, et al.
Pubblicazione: (2024)
VideoScaffold: Elastic-Scale Visual Hierarchies for Streaming Video Understanding in MLLMs
di: Zheng, Naishan, et al.
Pubblicazione: (2025)
di: Zheng, Naishan, et al.
Pubblicazione: (2025)
ChartCap: Mitigating Hallucination of Dense Chart Captioning
di: Lim, Junyoung, et al.
Pubblicazione: (2025)
di: Lim, Junyoung, et al.
Pubblicazione: (2025)
MLLMs Know Where to Look: Training-free Perception of Small Visual Details with Multimodal LLMs
di: Zhang, Jiarui, et al.
Pubblicazione: (2025)
di: Zhang, Jiarui, et al.
Pubblicazione: (2025)
ChartGemma: Visual Instruction-tuning for Chart Reasoning in the Wild
di: Masry, Ahmed, et al.
Pubblicazione: (2024)
di: Masry, Ahmed, et al.
Pubblicazione: (2024)
Why Vision Language Models Struggle with Visual Arithmetic? Towards Enhanced Chart and Geometry Understanding
di: Huang, Kung-Hsiang, et al.
Pubblicazione: (2025)
di: Huang, Kung-Hsiang, et al.
Pubblicazione: (2025)
Test-Time Matching: Unlocking Compositional Reasoning in Multimodal Models
di: Zhu, Yinglun, et al.
Pubblicazione: (2025)
di: Zhu, Yinglun, et al.
Pubblicazione: (2025)
Advancing Object Detection in Transportation with Multimodal Large Language Models (MLLMs): A Comprehensive Review and Empirical Testing
di: Ashqar, Huthaifa I., et al.
Pubblicazione: (2024)
di: Ashqar, Huthaifa I., et al.
Pubblicazione: (2024)
A Survey on Agentic Multimodal Large Language Models
di: Yao, Huanjin, et al.
Pubblicazione: (2025)
di: Yao, Huanjin, et al.
Pubblicazione: (2025)
VLSU: Mapping the Limits of Joint Multimodal Understanding for AI Safety
di: Palaskar, Shruti, et al.
Pubblicazione: (2025)
di: Palaskar, Shruti, et al.
Pubblicazione: (2025)
A Survey on Benchmarks of Multimodal Large Language Models
di: Li, Jian, et al.
Pubblicazione: (2024)
di: Li, Jian, et al.
Pubblicazione: (2024)
GRIT: Teaching MLLMs to Think with Images
di: Fan, Yue, et al.
Pubblicazione: (2025)
di: Fan, Yue, et al.
Pubblicazione: (2025)
MULTI: Multimodal Understanding Leaderboard with Text and Images
di: Zhu, Zichen, et al.
Pubblicazione: (2024)
di: Zhu, Zichen, et al.
Pubblicazione: (2024)
VIR-Bench: Evaluating Geospatial and Temporal Understanding of MLLMs via Travel Video Itinerary Reconstruction
di: Wang, Hao, et al.
Pubblicazione: (2025)
di: Wang, Hao, et al.
Pubblicazione: (2025)
Large Multimodal Agents: A Survey
di: Xie, Junlin, et al.
Pubblicazione: (2024)
di: Xie, Junlin, et al.
Pubblicazione: (2024)
MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI
di: Yao, Huanjin, et al.
Pubblicazione: (2025)
di: Yao, Huanjin, et al.
Pubblicazione: (2025)
MANTA: Cross-Modal Semantic Alignment and Information-Theoretic Optimization for Long-form Multimodal Understanding
di: Zhong, Ziqi, et al.
Pubblicazione: (2025)
di: Zhong, Ziqi, et al.
Pubblicazione: (2025)
PCA-Bench: Evaluating Multimodal Large Language Models in Perception-Cognition-Action Chain
di: Chen, Liang, et al.
Pubblicazione: (2024)
di: Chen, Liang, et al.
Pubblicazione: (2024)
SUDER: Self-Improving Unified Large Multimodal Models for Understanding and Generation with Dual Self-Rewards
di: Hong, Jixiang, et al.
Pubblicazione: (2025)
di: Hong, Jixiang, et al.
Pubblicazione: (2025)
On the Limits of Token Reduction for Efficient Unified Vision Language Training
di: Chen, Siyi, et al.
Pubblicazione: (2026)
di: Chen, Siyi, et al.
Pubblicazione: (2026)
Real-Time Multimodal Cognitive Assistant for Emergency Medical Services
di: Weerasinghe, Keshara, et al.
Pubblicazione: (2024)
di: Weerasinghe, Keshara, et al.
Pubblicazione: (2024)
Grasp Any Region: Towards Precise, Contextual Pixel Understanding for Multimodal LLMs
di: Wang, Haochen, et al.
Pubblicazione: (2025)
di: Wang, Haochen, et al.
Pubblicazione: (2025)
Cube Bench: A Benchmark for Spatial Visual Reasoning in MLLMs
di: Anand, Dhruv, et al.
Pubblicazione: (2025)
di: Anand, Dhruv, et al.
Pubblicazione: (2025)
AdaCodec: A Predictive Visual Code for Video MLLMs
di: Hou, Haowen, et al.
Pubblicazione: (2026)
di: Hou, Haowen, et al.
Pubblicazione: (2026)
LEMON: How Well Do MLLMs Perform Temporal Multimodal Understanding on Instructional Videos?
di: Yu, Zhuang, et al.
Pubblicazione: (2026)
di: Yu, Zhuang, et al.
Pubblicazione: (2026)
SIMPLOT: Enhancing Chart Question Answering by Distilling Essentials
di: Kim, Wonjoong, et al.
Pubblicazione: (2024)
di: Kim, Wonjoong, et al.
Pubblicazione: (2024)
JanusFlow: Harmonizing Autoregression and Rectified Flow for Unified Multimodal Understanding and Generation
di: Ma, Yiyang, et al.
Pubblicazione: (2024)
di: Ma, Yiyang, et al.
Pubblicazione: (2024)
Documenti analoghi
-
ChartNet: A Million-Scale, High-Quality Multimodal Dataset for Robust Chart Understanding
di: Kondic, Jovana, et al.
Pubblicazione: (2026) -
ChartMoE: Mixture of Diversely Aligned Expert Connector for Chart Understanding
di: Xu, Zhengzhuo, et al.
Pubblicazione: (2024) -
On Pre-training of Multimodal Language Models Customized for Chart Understanding
di: Fan, Wan-Cyuan, et al.
Pubblicazione: (2024) -
From Pixels to Insights: A Survey on Automatic Chart Understanding in the Era of Large Foundation Models
di: Huang, Kung-Hsiang, et al.
Pubblicazione: (2024) -
In-Depth and In-Breadth: Pre-training Multimodal Language Models Customized for Comprehensive Chart Understanding
di: Fan, Wan-Cyuan, et al.
Pubblicazione: (2025)