TabPedia: Towards Comprehensive Visual Table Understanding with Concept Synergy
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhao, Weichao, Feng, Hao, Liu, Qi, Tang, Jingqun, Wei, Shu, Wu, Binghong, Liao, Lei, Ye, Yongjie, Liu, Hao, Zhou, Wengang, Li, Houqiang, Huang, Can |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding
por: Feng, Hao, et al.
Publicado: (2023)
por: Feng, Hao, et al.
Publicado: (2023)
Harmonizing Visual Text Comprehension and Generation
por: Zhao, Zhen, et al.
Publicado: (2024)
por: Zhao, Zhen, et al.
Publicado: (2024)
A Bounding Box is Worth One Token: Interleaving Layout and Text in a Large Language Model for Document Understanding
por: Lu, Jinghui, et al.
Publicado: (2024)
por: Lu, Jinghui, et al.
Publicado: (2024)
Uni-Sign: Toward Unified Sign Language Understanding at Scale
por: Li, Zecheng, et al.
Publicado: (2025)
por: Li, Zecheng, et al.
Publicado: (2025)
WildDoc: How Far Are We from Achieving Comprehensive and Robust Document Understanding in the Wild?
por: Wang, An-Lan, et al.
Publicado: (2025)
por: Wang, An-Lan, et al.
Publicado: (2025)
Scaling up Multimodal Pre-training for Sign Language Understanding
por: Zhou, Wengang, et al.
Publicado: (2024)
por: Zhou, Wengang, et al.
Publicado: (2024)
Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting
por: Feng, Hao, et al.
Publicado: (2025)
por: Feng, Hao, et al.
Publicado: (2025)
AdaptVision: Dynamic Input Scaling in MLLMs for Versatile Scene Understanding
por: Wang, Yonghui, et al.
Publicado: (2024)
por: Wang, Yonghui, et al.
Publicado: (2024)
RoFIR: Robust Fisheye Image Rectification Framework Impervious to Optical Center Deviation
por: Liao, Zhaokang, et al.
Publicado: (2024)
por: Liao, Zhaokang, et al.
Publicado: (2024)
TextSquare: Scaling up Text-Centric Visual Instruction Tuning
por: Tang, Jingqun, et al.
Publicado: (2024)
por: Tang, Jingqun, et al.
Publicado: (2024)
DocR1: Evidence Page-Guided GRPO for Multi-Page Document Understanding
por: Xiong, Junyu, et al.
Publicado: (2025)
por: Xiong, Junyu, et al.
Publicado: (2025)
GaussNav: Gaussian Splatting for Visual Navigation
por: Lei, Xiaohan, et al.
Publicado: (2024)
por: Lei, Xiaohan, et al.
Publicado: (2024)
Exploiting GPT-4 Vision for Zero-shot Point Cloud Understanding
por: Sun, Qi, et al.
Publicado: (2024)
por: Sun, Qi, et al.
Publicado: (2024)
StepVAR: Structure-Texture Guided Pruning for Visual Autoregressive Models
por: Liu, Keli, et al.
Publicado: (2026)
por: Liu, Keli, et al.
Publicado: (2026)
Multi-modal In-Context Learning Makes an Ego-evolving Scene Text Recognizer
por: Zhao, Zhen, et al.
Publicado: (2023)
por: Zhao, Zhen, et al.
Publicado: (2023)
Self-Supervised Representation Learning with Spatial-Temporal Consistency for Sign Language Recognition
por: Zhao, Weichao, et al.
Publicado: (2024)
por: Zhao, Weichao, et al.
Publicado: (2024)
Exploiting Spatial-Temporal Context for Interacting Hand Reconstruction on Monocular RGB Video
por: Zhao, Weichao, et al.
Publicado: (2023)
por: Zhao, Weichao, et al.
Publicado: (2023)
Revisiting Shadow Detection from a Vision-Language Perspective
por: Wang, Yonghui, et al.
Publicado: (2026)
por: Wang, Yonghui, et al.
Publicado: (2026)
Semi-Supervised Spoken Language Glossification
por: Yao, Huijie, et al.
Publicado: (2024)
por: Yao, Huijie, et al.
Publicado: (2024)
TextCoT: Zoom In for Enhanced Multimodal Text-Rich Image Understanding
por: Luan, Bozhi, et al.
Publicado: (2024)
por: Luan, Bozhi, et al.
Publicado: (2024)
Self-supervised Hierarchical Visual Reasoning with World Model
por: Xu, Yuanfei, et al.
Publicado: (2026)
por: Xu, Yuanfei, et al.
Publicado: (2026)
MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering
por: Tang, Jingqun, et al.
Publicado: (2024)
por: Tang, Jingqun, et al.
Publicado: (2024)
Multi-Cue Adaptive Visual Token Pruning for Large Vision-Language Models
por: Luan, Bozhi, et al.
Publicado: (2025)
por: Luan, Bozhi, et al.
Publicado: (2025)
MASA: Motion-aware Masked Autoencoder with Semantic Alignment for Sign Language Recognition
por: Zhao, Weichao, et al.
Publicado: (2024)
por: Zhao, Weichao, et al.
Publicado: (2024)
Text-Animator: Controllable Visual Text Video Generation
por: Liu, Lin, et al.
Publicado: (2024)
por: Liu, Lin, et al.
Publicado: (2024)
DeepEraser: Deep Iterative Context Mining for Generic Text Eraser
por: Feng, Hao, et al.
Publicado: (2024)
por: Feng, Hao, et al.
Publicado: (2024)
BoolQuestions: Does Dense Retrieval Understand Boolean Logic in Language?
por: Zhang, Zongmeng, et al.
Publicado: (2024)
por: Zhang, Zongmeng, et al.
Publicado: (2024)
PediaBench: A Comprehensive Chinese Pediatric Dataset for Benchmarking Large Language Models
por: Zhang, Qian, et al.
Publicado: (2024)
por: Zhang, Qian, et al.
Publicado: (2024)
Progressive Multi-modal Conditional Prompt Tuning
por: Qiu, Xiaoyu, et al.
Publicado: (2024)
por: Qiu, Xiaoyu, et al.
Publicado: (2024)
MotionRL: Align Text-to-Motion Generation to Human Preferences with Multi-Reward Reinforcement Learning
por: Liu, Xiaoyang, et al.
Publicado: (2024)
por: Liu, Xiaoyang, et al.
Publicado: (2024)
MCTBench: Multimodal Cognition towards Text-Rich Visual Scenes Benchmark
por: Shan, Bin, et al.
Publicado: (2024)
por: Shan, Bin, et al.
Publicado: (2024)
Vision as LoRA
por: Wang, Han, et al.
Publicado: (2025)
por: Wang, Han, et al.
Publicado: (2025)
Recurrent Generic Contour-based Instance Segmentation with Progressive Learning
por: Feng, Hao, et al.
Publicado: (2023)
por: Feng, Hao, et al.
Publicado: (2023)
OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning
por: Fu, Ling, et al.
Publicado: (2024)
por: Fu, Ling, et al.
Publicado: (2024)
LaneTCA: Enhancing Video Lane Detection with Temporal Context Aggregation
por: Zhou, Keyi, et al.
Publicado: (2024)
por: Zhou, Keyi, et al.
Publicado: (2024)
Forest2Seq: Revitalizing Order Prior for Sequential Indoor Scene Synthesis
por: Sun, Qi, et al.
Publicado: (2024)
por: Sun, Qi, et al.
Publicado: (2024)
Structural Action Transformer for 3D Dexterous Manipulation
por: Lei, Xiaohan, et al.
Publicado: (2026)
por: Lei, Xiaohan, et al.
Publicado: (2026)
Instance-aware Exploration-Verification-Exploitation for Instance ImageGoal Navigation
por: Lei, Xiaohan, et al.
Publicado: (2024)
por: Lei, Xiaohan, et al.
Publicado: (2024)
Primary-Fine Decoupling for Action Generation in Robotic Imitation
por: Lei, Xiaohan, et al.
Publicado: (2026)
por: Lei, Xiaohan, et al.
Publicado: (2026)
TextPecker: Rewarding Structural Anomaly Quantification for Enhancing Visual Text Rendering
por: Zhu, Hanshen, et al.
Publicado: (2026)
por: Zhu, Hanshen, et al.
Publicado: (2026)
Ejemplares similares
-
DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding
por: Feng, Hao, et al.
Publicado: (2023) -
Harmonizing Visual Text Comprehension and Generation
por: Zhao, Zhen, et al.
Publicado: (2024) -
A Bounding Box is Worth One Token: Interleaving Layout and Text in a Large Language Model for Document Understanding
por: Lu, Jinghui, et al.
Publicado: (2024) -
Uni-Sign: Toward Unified Sign Language Understanding at Scale
por: Li, Zecheng, et al.
Publicado: (2025) -
WildDoc: How Far Are We from Achieving Comprehensive and Robust Document Understanding in the Wild?
por: Wang, An-Lan, et al.
Publicado: (2025)