TabPedia: Towards Comprehensive Visual Table Understanding with Concept Synergy
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhao, Weichao, Feng, Hao, Liu, Qi, Tang, Jingqun, Wei, Shu, Wu, Binghong, Liao, Lei, Ye, Yongjie, Liu, Hao, Zhou, Wengang, Li, Houqiang, Huang, Can |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding
par: Feng, Hao, et autres
Publié: (2023)
par: Feng, Hao, et autres
Publié: (2023)
Harmonizing Visual Text Comprehension and Generation
par: Zhao, Zhen, et autres
Publié: (2024)
par: Zhao, Zhen, et autres
Publié: (2024)
A Bounding Box is Worth One Token: Interleaving Layout and Text in a Large Language Model for Document Understanding
par: Lu, Jinghui, et autres
Publié: (2024)
par: Lu, Jinghui, et autres
Publié: (2024)
Uni-Sign: Toward Unified Sign Language Understanding at Scale
par: Li, Zecheng, et autres
Publié: (2025)
par: Li, Zecheng, et autres
Publié: (2025)
WildDoc: How Far Are We from Achieving Comprehensive and Robust Document Understanding in the Wild?
par: Wang, An-Lan, et autres
Publié: (2025)
par: Wang, An-Lan, et autres
Publié: (2025)
Scaling up Multimodal Pre-training for Sign Language Understanding
par: Zhou, Wengang, et autres
Publié: (2024)
par: Zhou, Wengang, et autres
Publié: (2024)
Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting
par: Feng, Hao, et autres
Publié: (2025)
par: Feng, Hao, et autres
Publié: (2025)
AdaptVision: Dynamic Input Scaling in MLLMs for Versatile Scene Understanding
par: Wang, Yonghui, et autres
Publié: (2024)
par: Wang, Yonghui, et autres
Publié: (2024)
RoFIR: Robust Fisheye Image Rectification Framework Impervious to Optical Center Deviation
par: Liao, Zhaokang, et autres
Publié: (2024)
par: Liao, Zhaokang, et autres
Publié: (2024)
TextSquare: Scaling up Text-Centric Visual Instruction Tuning
par: Tang, Jingqun, et autres
Publié: (2024)
par: Tang, Jingqun, et autres
Publié: (2024)
DocR1: Evidence Page-Guided GRPO for Multi-Page Document Understanding
par: Xiong, Junyu, et autres
Publié: (2025)
par: Xiong, Junyu, et autres
Publié: (2025)
GaussNav: Gaussian Splatting for Visual Navigation
par: Lei, Xiaohan, et autres
Publié: (2024)
par: Lei, Xiaohan, et autres
Publié: (2024)
Exploiting GPT-4 Vision for Zero-shot Point Cloud Understanding
par: Sun, Qi, et autres
Publié: (2024)
par: Sun, Qi, et autres
Publié: (2024)
StepVAR: Structure-Texture Guided Pruning for Visual Autoregressive Models
par: Liu, Keli, et autres
Publié: (2026)
par: Liu, Keli, et autres
Publié: (2026)
Multi-modal In-Context Learning Makes an Ego-evolving Scene Text Recognizer
par: Zhao, Zhen, et autres
Publié: (2023)
par: Zhao, Zhen, et autres
Publié: (2023)
Self-Supervised Representation Learning with Spatial-Temporal Consistency for Sign Language Recognition
par: Zhao, Weichao, et autres
Publié: (2024)
par: Zhao, Weichao, et autres
Publié: (2024)
Exploiting Spatial-Temporal Context for Interacting Hand Reconstruction on Monocular RGB Video
par: Zhao, Weichao, et autres
Publié: (2023)
par: Zhao, Weichao, et autres
Publié: (2023)
Revisiting Shadow Detection from a Vision-Language Perspective
par: Wang, Yonghui, et autres
Publié: (2026)
par: Wang, Yonghui, et autres
Publié: (2026)
Semi-Supervised Spoken Language Glossification
par: Yao, Huijie, et autres
Publié: (2024)
par: Yao, Huijie, et autres
Publié: (2024)
TextCoT: Zoom In for Enhanced Multimodal Text-Rich Image Understanding
par: Luan, Bozhi, et autres
Publié: (2024)
par: Luan, Bozhi, et autres
Publié: (2024)
Self-supervised Hierarchical Visual Reasoning with World Model
par: Xu, Yuanfei, et autres
Publié: (2026)
par: Xu, Yuanfei, et autres
Publié: (2026)
MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering
par: Tang, Jingqun, et autres
Publié: (2024)
par: Tang, Jingqun, et autres
Publié: (2024)
Multi-Cue Adaptive Visual Token Pruning for Large Vision-Language Models
par: Luan, Bozhi, et autres
Publié: (2025)
par: Luan, Bozhi, et autres
Publié: (2025)
MASA: Motion-aware Masked Autoencoder with Semantic Alignment for Sign Language Recognition
par: Zhao, Weichao, et autres
Publié: (2024)
par: Zhao, Weichao, et autres
Publié: (2024)
Text-Animator: Controllable Visual Text Video Generation
par: Liu, Lin, et autres
Publié: (2024)
par: Liu, Lin, et autres
Publié: (2024)
DeepEraser: Deep Iterative Context Mining for Generic Text Eraser
par: Feng, Hao, et autres
Publié: (2024)
par: Feng, Hao, et autres
Publié: (2024)
BoolQuestions: Does Dense Retrieval Understand Boolean Logic in Language?
par: Zhang, Zongmeng, et autres
Publié: (2024)
par: Zhang, Zongmeng, et autres
Publié: (2024)
PediaBench: A Comprehensive Chinese Pediatric Dataset for Benchmarking Large Language Models
par: Zhang, Qian, et autres
Publié: (2024)
par: Zhang, Qian, et autres
Publié: (2024)
Progressive Multi-modal Conditional Prompt Tuning
par: Qiu, Xiaoyu, et autres
Publié: (2024)
par: Qiu, Xiaoyu, et autres
Publié: (2024)
MotionRL: Align Text-to-Motion Generation to Human Preferences with Multi-Reward Reinforcement Learning
par: Liu, Xiaoyang, et autres
Publié: (2024)
par: Liu, Xiaoyang, et autres
Publié: (2024)
MCTBench: Multimodal Cognition towards Text-Rich Visual Scenes Benchmark
par: Shan, Bin, et autres
Publié: (2024)
par: Shan, Bin, et autres
Publié: (2024)
Vision as LoRA
par: Wang, Han, et autres
Publié: (2025)
par: Wang, Han, et autres
Publié: (2025)
Recurrent Generic Contour-based Instance Segmentation with Progressive Learning
par: Feng, Hao, et autres
Publié: (2023)
par: Feng, Hao, et autres
Publié: (2023)
OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning
par: Fu, Ling, et autres
Publié: (2024)
par: Fu, Ling, et autres
Publié: (2024)
LaneTCA: Enhancing Video Lane Detection with Temporal Context Aggregation
par: Zhou, Keyi, et autres
Publié: (2024)
par: Zhou, Keyi, et autres
Publié: (2024)
Forest2Seq: Revitalizing Order Prior for Sequential Indoor Scene Synthesis
par: Sun, Qi, et autres
Publié: (2024)
par: Sun, Qi, et autres
Publié: (2024)
Structural Action Transformer for 3D Dexterous Manipulation
par: Lei, Xiaohan, et autres
Publié: (2026)
par: Lei, Xiaohan, et autres
Publié: (2026)
Instance-aware Exploration-Verification-Exploitation for Instance ImageGoal Navigation
par: Lei, Xiaohan, et autres
Publié: (2024)
par: Lei, Xiaohan, et autres
Publié: (2024)
Primary-Fine Decoupling for Action Generation in Robotic Imitation
par: Lei, Xiaohan, et autres
Publié: (2026)
par: Lei, Xiaohan, et autres
Publié: (2026)
TextPecker: Rewarding Structural Anomaly Quantification for Enhancing Visual Text Rendering
par: Zhu, Hanshen, et autres
Publié: (2026)
par: Zhu, Hanshen, et autres
Publié: (2026)
Documents similaires
-
DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding
par: Feng, Hao, et autres
Publié: (2023) -
Harmonizing Visual Text Comprehension and Generation
par: Zhao, Zhen, et autres
Publié: (2024) -
A Bounding Box is Worth One Token: Interleaving Layout and Text in a Large Language Model for Document Understanding
par: Lu, Jinghui, et autres
Publié: (2024) -
Uni-Sign: Toward Unified Sign Language Understanding at Scale
par: Li, Zecheng, et autres
Publié: (2025) -
WildDoc: How Far Are We from Achieving Comprehensive and Robust Document Understanding in the Wild?
par: Wang, An-Lan, et autres
Publié: (2025)