PP-DocBee: Improving Multimodal Document Understanding Through a Bag of Tricks
Fuente:
arXiv
Salvato in:
| Autori principali: | Ni, Feng, Huang, Kui, Lu, Yao, Lv, Wenyu, Wang, Guanzhong, Chen, Zeyu, Liu, Yi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PP-DocBee2: Improved Baselines with Efficient Data for Multimodal Document Understanding
di: Huang, Kui, et al.
Pubblicazione: (2025)
di: Huang, Kui, et al.
Pubblicazione: (2025)
RT-DETRv2: Improved Baseline with Bag-of-Freebies for Real-Time Detection Transformer
di: Lv, Wenyu, et al.
Pubblicazione: (2024)
di: Lv, Wenyu, et al.
Pubblicazione: (2024)
DocScope: Benchmarking Verifiable Reasoning for Trustworthy Long-Document Understanding
di: Feng, Xiang, et al.
Pubblicazione: (2026)
di: Feng, Xiang, et al.
Pubblicazione: (2026)
SUDER: Self-Improving Unified Large Multimodal Models for Understanding and Generation with Dual Self-Rewards
di: Hong, Jixiang, et al.
Pubblicazione: (2025)
di: Hong, Jixiang, et al.
Pubblicazione: (2025)
MMLongBench-Doc: Benchmarking Long-context Document Understanding with Visualizations
di: Ma, Yubo, et al.
Pubblicazione: (2024)
di: Ma, Yubo, et al.
Pubblicazione: (2024)
Docopilot: Improving Multimodal Models for Document-Level Understanding
di: Duan, Yuchen, et al.
Pubblicazione: (2025)
di: Duan, Yuchen, et al.
Pubblicazione: (2025)
Bag of Tricks to Boost Adversarial Transferability
di: Zhang, Zeliang, et al.
Pubblicazione: (2024)
di: Zhang, Zeliang, et al.
Pubblicazione: (2024)
DocAtlas: Multilingual Document Understanding Across 80+ Languages
di: Heakl, Ahmed, et al.
Pubblicazione: (2026)
di: Heakl, Ahmed, et al.
Pubblicazione: (2026)
DocKD: Knowledge Distillation from LLMs for Open-World Document Understanding Models
di: Kim, Sungnyun, et al.
Pubblicazione: (2024)
di: Kim, Sungnyun, et al.
Pubblicazione: (2024)
InstructDoc: A Dataset for Zero-Shot Generalization of Visual Document Understanding with Instructions
di: Tanaka, Ryota, et al.
Pubblicazione: (2024)
di: Tanaka, Ryota, et al.
Pubblicazione: (2024)
DocLens : A Tool-Augmented Multi-Agent Framework for Long Visual Document Understanding
di: Zhu, Dawei, et al.
Pubblicazione: (2025)
di: Zhu, Dawei, et al.
Pubblicazione: (2025)
DocReward: A Document Reward Model for Structuring and Stylizing
di: Liu, Junpeng, et al.
Pubblicazione: (2025)
di: Liu, Junpeng, et al.
Pubblicazione: (2025)
Pushing the Limits of Sparsity: A Bag of Tricks for Extreme Pruning
di: Li, Andy, et al.
Pubblicazione: (2024)
di: Li, Andy, et al.
Pubblicazione: (2024)
Trick-GS: A Balanced Bag of Tricks for Efficient Gaussian Splatting
di: Armagan, Anil, et al.
Pubblicazione: (2025)
di: Armagan, Anil, et al.
Pubblicazione: (2025)
Cross-Lingual SynthDocs: A Large-Scale Synthetic Corpus for Any to Arabic OCR and Document Understanding
di: Al-Homoud, Haneen, et al.
Pubblicazione: (2025)
di: Al-Homoud, Haneen, et al.
Pubblicazione: (2025)
Bag of Tricks for Subverting Reasoning-based Safety Guardrails
di: Chen, Shuo, et al.
Pubblicazione: (2025)
di: Chen, Shuo, et al.
Pubblicazione: (2025)
Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs
di: Liu, Chris Yuhao, et al.
Pubblicazione: (2024)
di: Liu, Chris Yuhao, et al.
Pubblicazione: (2024)
BACON: Improving Clarity of Image Captions via Bag-of-Concept Graphs
di: Yang, Zhantao, et al.
Pubblicazione: (2024)
di: Yang, Zhantao, et al.
Pubblicazione: (2024)
Bag of Tricks: Benchmarking of Jailbreak Attacks on LLMs
di: Xu, Zhao, et al.
Pubblicazione: (2024)
di: Xu, Zhao, et al.
Pubblicazione: (2024)
DocSum: Domain-Adaptive Pre-training for Document Abstractive Summarization
di: Chau, Phan Phuong Mai, et al.
Pubblicazione: (2024)
di: Chau, Phan Phuong Mai, et al.
Pubblicazione: (2024)
Doc-PP: Document Policy Preservation Benchmark for Large Vision-Language Models
di: Jang, Haeun, et al.
Pubblicazione: (2026)
di: Jang, Haeun, et al.
Pubblicazione: (2026)
Pop-Up Distractions Reveal Bag-of-Events Behavior in Video Large Language Models
di: Chew, Oscar, et al.
Pubblicazione: (2026)
di: Chew, Oscar, et al.
Pubblicazione: (2026)
Effective Training Data Synthesis for Improving MLLM Chart Understanding
di: Yang, Yuwei, et al.
Pubblicazione: (2025)
di: Yang, Yuwei, et al.
Pubblicazione: (2025)
DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding
di: Feng, Hao, et al.
Pubblicazione: (2023)
di: Feng, Hao, et al.
Pubblicazione: (2023)
Optimizing Multispectral Object Detection: A Bag of Tricks and Comprehensive Benchmarks
di: Zhou, Chen, et al.
Pubblicazione: (2024)
di: Zhou, Chen, et al.
Pubblicazione: (2024)
Dr. DocBench: A Comprehensive Benchmark for Expert-Level and Difficult Document Parsing
di: Yang, Minglai, et al.
Pubblicazione: (2026)
di: Yang, Minglai, et al.
Pubblicazione: (2026)
A Bag of Tricks for Few-Shot Class-Incremental Learning
di: Roy, Shuvendu, et al.
Pubblicazione: (2024)
di: Roy, Shuvendu, et al.
Pubblicazione: (2024)
Exploring the Role of Explicit Temporal Modeling in Multimodal Large Language Models for Video Understanding
di: Li, Yun, et al.
Pubblicazione: (2025)
di: Li, Yun, et al.
Pubblicazione: (2025)
Scaling Beyond Context: A Survey of Multimodal Retrieval-Augmented Generation for Document Understanding
di: Gao, Sensen, et al.
Pubblicazione: (2025)
di: Gao, Sensen, et al.
Pubblicazione: (2025)
DocSplit: A Comprehensive Benchmark Dataset and Evaluation Approach for Document Packet Recognition and Splitting
di: Islam, Md Mofijul, et al.
Pubblicazione: (2026)
di: Islam, Md Mofijul, et al.
Pubblicazione: (2026)
Multimodal Information Fusion for Chart Understanding: A Survey of MLLMs -- Evolution, Limitations, and Cognitive Enhancement
di: Yi, Zhihang, et al.
Pubblicazione: (2026)
di: Yi, Zhihang, et al.
Pubblicazione: (2026)
3MVRD: Multimodal Multi-task Multi-teacher Visually-Rich Form Document Understanding
di: Ding, Yihao, et al.
Pubblicazione: (2024)
di: Ding, Yihao, et al.
Pubblicazione: (2024)
A Bag of Tricks for Efficient Implicit Neural Point Clouds
di: Hahlbohm, Florian, et al.
Pubblicazione: (2025)
di: Hahlbohm, Florian, et al.
Pubblicazione: (2025)
ContraDoc: Understanding Self-Contradictions in Documents with Large Language Models
di: Li, Jierui, et al.
Pubblicazione: (2023)
di: Li, Jierui, et al.
Pubblicazione: (2023)
TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding
di: Ren, Shuhuai, et al.
Pubblicazione: (2023)
di: Ren, Shuhuai, et al.
Pubblicazione: (2023)
SPD-Faith Bench: Diagnosing and Improving Faithfulness in Chain-of-Thought for Multimodal Large Language Models
di: Lv, Weijiang, et al.
Pubblicazione: (2026)
di: Lv, Weijiang, et al.
Pubblicazione: (2026)
Hierarchical Multimodal Pre-training for Visually Rich Webpage Understanding
di: Xu, Hongshen, et al.
Pubblicazione: (2024)
di: Xu, Hongshen, et al.
Pubblicazione: (2024)
DocSLM: A Small Vision-Language Model for Long Multimodal Document Understanding
di: Hannan, Tanveer, et al.
Pubblicazione: (2025)
di: Hannan, Tanveer, et al.
Pubblicazione: (2025)
MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark
di: Yue, Xiang, et al.
Pubblicazione: (2024)
di: Yue, Xiang, et al.
Pubblicazione: (2024)
DocMEdit: Towards Document-Level Model Editing
di: Zeng, Li, et al.
Pubblicazione: (2025)
di: Zeng, Li, et al.
Pubblicazione: (2025)
Documenti analoghi
-
PP-DocBee2: Improved Baselines with Efficient Data for Multimodal Document Understanding
di: Huang, Kui, et al.
Pubblicazione: (2025) -
RT-DETRv2: Improved Baseline with Bag-of-Freebies for Real-Time Detection Transformer
di: Lv, Wenyu, et al.
Pubblicazione: (2024) -
DocScope: Benchmarking Verifiable Reasoning for Trustworthy Long-Document Understanding
di: Feng, Xiang, et al.
Pubblicazione: (2026) -
SUDER: Self-Improving Unified Large Multimodal Models for Understanding and Generation with Dual Self-Rewards
di: Hong, Jixiang, et al.
Pubblicazione: (2025) -
MMLongBench-Doc: Benchmarking Long-context Document Understanding with Visualizations
di: Ma, Yubo, et al.
Pubblicazione: (2024)