PP-DocBee: Improving Multimodal Document Understanding Through a Bag of Tricks
Fuente:
arXiv
Guardado en:
| Autores principales: | Ni, Feng, Huang, Kui, Lu, Yao, Lv, Wenyu, Wang, Guanzhong, Chen, Zeyu, Liu, Yi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
PP-DocBee2: Improved Baselines with Efficient Data for Multimodal Document Understanding
por: Huang, Kui, et al.
Publicado: (2025)
por: Huang, Kui, et al.
Publicado: (2025)
RT-DETRv2: Improved Baseline with Bag-of-Freebies for Real-Time Detection Transformer
por: Lv, Wenyu, et al.
Publicado: (2024)
por: Lv, Wenyu, et al.
Publicado: (2024)
DocScope: Benchmarking Verifiable Reasoning for Trustworthy Long-Document Understanding
por: Feng, Xiang, et al.
Publicado: (2026)
por: Feng, Xiang, et al.
Publicado: (2026)
SUDER: Self-Improving Unified Large Multimodal Models for Understanding and Generation with Dual Self-Rewards
por: Hong, Jixiang, et al.
Publicado: (2025)
por: Hong, Jixiang, et al.
Publicado: (2025)
MMLongBench-Doc: Benchmarking Long-context Document Understanding with Visualizations
por: Ma, Yubo, et al.
Publicado: (2024)
por: Ma, Yubo, et al.
Publicado: (2024)
Docopilot: Improving Multimodal Models for Document-Level Understanding
por: Duan, Yuchen, et al.
Publicado: (2025)
por: Duan, Yuchen, et al.
Publicado: (2025)
Bag of Tricks to Boost Adversarial Transferability
por: Zhang, Zeliang, et al.
Publicado: (2024)
por: Zhang, Zeliang, et al.
Publicado: (2024)
DocAtlas: Multilingual Document Understanding Across 80+ Languages
por: Heakl, Ahmed, et al.
Publicado: (2026)
por: Heakl, Ahmed, et al.
Publicado: (2026)
DocKD: Knowledge Distillation from LLMs for Open-World Document Understanding Models
por: Kim, Sungnyun, et al.
Publicado: (2024)
por: Kim, Sungnyun, et al.
Publicado: (2024)
InstructDoc: A Dataset for Zero-Shot Generalization of Visual Document Understanding with Instructions
por: Tanaka, Ryota, et al.
Publicado: (2024)
por: Tanaka, Ryota, et al.
Publicado: (2024)
DocLens : A Tool-Augmented Multi-Agent Framework for Long Visual Document Understanding
por: Zhu, Dawei, et al.
Publicado: (2025)
por: Zhu, Dawei, et al.
Publicado: (2025)
DocReward: A Document Reward Model for Structuring and Stylizing
por: Liu, Junpeng, et al.
Publicado: (2025)
por: Liu, Junpeng, et al.
Publicado: (2025)
Pushing the Limits of Sparsity: A Bag of Tricks for Extreme Pruning
por: Li, Andy, et al.
Publicado: (2024)
por: Li, Andy, et al.
Publicado: (2024)
Trick-GS: A Balanced Bag of Tricks for Efficient Gaussian Splatting
por: Armagan, Anil, et al.
Publicado: (2025)
por: Armagan, Anil, et al.
Publicado: (2025)
Cross-Lingual SynthDocs: A Large-Scale Synthetic Corpus for Any to Arabic OCR and Document Understanding
por: Al-Homoud, Haneen, et al.
Publicado: (2025)
por: Al-Homoud, Haneen, et al.
Publicado: (2025)
Bag of Tricks for Subverting Reasoning-based Safety Guardrails
por: Chen, Shuo, et al.
Publicado: (2025)
por: Chen, Shuo, et al.
Publicado: (2025)
Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs
por: Liu, Chris Yuhao, et al.
Publicado: (2024)
por: Liu, Chris Yuhao, et al.
Publicado: (2024)
BACON: Improving Clarity of Image Captions via Bag-of-Concept Graphs
por: Yang, Zhantao, et al.
Publicado: (2024)
por: Yang, Zhantao, et al.
Publicado: (2024)
Bag of Tricks: Benchmarking of Jailbreak Attacks on LLMs
por: Xu, Zhao, et al.
Publicado: (2024)
por: Xu, Zhao, et al.
Publicado: (2024)
DocSum: Domain-Adaptive Pre-training for Document Abstractive Summarization
por: Chau, Phan Phuong Mai, et al.
Publicado: (2024)
por: Chau, Phan Phuong Mai, et al.
Publicado: (2024)
Doc-PP: Document Policy Preservation Benchmark for Large Vision-Language Models
por: Jang, Haeun, et al.
Publicado: (2026)
por: Jang, Haeun, et al.
Publicado: (2026)
Pop-Up Distractions Reveal Bag-of-Events Behavior in Video Large Language Models
por: Chew, Oscar, et al.
Publicado: (2026)
por: Chew, Oscar, et al.
Publicado: (2026)
Effective Training Data Synthesis for Improving MLLM Chart Understanding
por: Yang, Yuwei, et al.
Publicado: (2025)
por: Yang, Yuwei, et al.
Publicado: (2025)
DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding
por: Feng, Hao, et al.
Publicado: (2023)
por: Feng, Hao, et al.
Publicado: (2023)
Optimizing Multispectral Object Detection: A Bag of Tricks and Comprehensive Benchmarks
por: Zhou, Chen, et al.
Publicado: (2024)
por: Zhou, Chen, et al.
Publicado: (2024)
Dr. DocBench: A Comprehensive Benchmark for Expert-Level and Difficult Document Parsing
por: Yang, Minglai, et al.
Publicado: (2026)
por: Yang, Minglai, et al.
Publicado: (2026)
A Bag of Tricks for Few-Shot Class-Incremental Learning
por: Roy, Shuvendu, et al.
Publicado: (2024)
por: Roy, Shuvendu, et al.
Publicado: (2024)
Exploring the Role of Explicit Temporal Modeling in Multimodal Large Language Models for Video Understanding
por: Li, Yun, et al.
Publicado: (2025)
por: Li, Yun, et al.
Publicado: (2025)
Scaling Beyond Context: A Survey of Multimodal Retrieval-Augmented Generation for Document Understanding
por: Gao, Sensen, et al.
Publicado: (2025)
por: Gao, Sensen, et al.
Publicado: (2025)
DocSplit: A Comprehensive Benchmark Dataset and Evaluation Approach for Document Packet Recognition and Splitting
por: Islam, Md Mofijul, et al.
Publicado: (2026)
por: Islam, Md Mofijul, et al.
Publicado: (2026)
Multimodal Information Fusion for Chart Understanding: A Survey of MLLMs -- Evolution, Limitations, and Cognitive Enhancement
por: Yi, Zhihang, et al.
Publicado: (2026)
por: Yi, Zhihang, et al.
Publicado: (2026)
3MVRD: Multimodal Multi-task Multi-teacher Visually-Rich Form Document Understanding
por: Ding, Yihao, et al.
Publicado: (2024)
por: Ding, Yihao, et al.
Publicado: (2024)
A Bag of Tricks for Efficient Implicit Neural Point Clouds
por: Hahlbohm, Florian, et al.
Publicado: (2025)
por: Hahlbohm, Florian, et al.
Publicado: (2025)
ContraDoc: Understanding Self-Contradictions in Documents with Large Language Models
por: Li, Jierui, et al.
Publicado: (2023)
por: Li, Jierui, et al.
Publicado: (2023)
TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding
por: Ren, Shuhuai, et al.
Publicado: (2023)
por: Ren, Shuhuai, et al.
Publicado: (2023)
SPD-Faith Bench: Diagnosing and Improving Faithfulness in Chain-of-Thought for Multimodal Large Language Models
por: Lv, Weijiang, et al.
Publicado: (2026)
por: Lv, Weijiang, et al.
Publicado: (2026)
Hierarchical Multimodal Pre-training for Visually Rich Webpage Understanding
por: Xu, Hongshen, et al.
Publicado: (2024)
por: Xu, Hongshen, et al.
Publicado: (2024)
DocSLM: A Small Vision-Language Model for Long Multimodal Document Understanding
por: Hannan, Tanveer, et al.
Publicado: (2025)
por: Hannan, Tanveer, et al.
Publicado: (2025)
MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark
por: Yue, Xiang, et al.
Publicado: (2024)
por: Yue, Xiang, et al.
Publicado: (2024)
DocMEdit: Towards Document-Level Model Editing
por: Zeng, Li, et al.
Publicado: (2025)
por: Zeng, Li, et al.
Publicado: (2025)
Ejemplares similares
-
PP-DocBee2: Improved Baselines with Efficient Data for Multimodal Document Understanding
por: Huang, Kui, et al.
Publicado: (2025) -
RT-DETRv2: Improved Baseline with Bag-of-Freebies for Real-Time Detection Transformer
por: Lv, Wenyu, et al.
Publicado: (2024) -
DocScope: Benchmarking Verifiable Reasoning for Trustworthy Long-Document Understanding
por: Feng, Xiang, et al.
Publicado: (2026) -
SUDER: Self-Improving Unified Large Multimodal Models for Understanding and Generation with Dual Self-Rewards
por: Hong, Jixiang, et al.
Publicado: (2025) -
MMLongBench-Doc: Benchmarking Long-context Document Understanding with Visualizations
por: Ma, Yubo, et al.
Publicado: (2024)