UniTabNet: Bridging Vision and Language Models for Enhanced Table Structure Recognition
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Zhenrong, Liu, Shuhang, Hu, Pengfei, Ma, Jiefeng, Du, Jun, Zhang, Jianshu, Hu, Yu |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
See then Tell: Enhancing Key Information Extraction with Vision Grounding
by: Liu, Shuhang, et al.
Published: (2024)
by: Liu, Shuhang, et al.
Published: (2024)
Bidirectional Trained Tree-Structured Decoder for Handwritten Mathematical Expression Recognition
by: Cheng, Hanbo, et al.
Published: (2023)
by: Cheng, Hanbo, et al.
Published: (2023)
Skeleton and Font Generation Network for Zero-shot Chinese Character Generation
by: Xue, Mobai, et al.
Published: (2025)
by: Xue, Mobai, et al.
Published: (2025)
RFL: Simplifying Chemical Structure Recognition with Ring-Free Language
by: Chang, Qikai, et al.
Published: (2024)
by: Chang, Qikai, et al.
Published: (2024)
SEMv2: Table Separation Line Detection Based on Instance Segmentation
by: Zhang, Zhenrong, et al.
Published: (2023)
by: Zhang, Zhenrong, et al.
Published: (2023)
SEMv3: A Fast and Robust Approach to Table Separation Line Detection
by: Qin, Chunxia, et al.
Published: (2024)
by: Qin, Chunxia, et al.
Published: (2024)
DocMamba: Efficient Document Pre-training with State Space Model
by: Hu, Pengfei, et al.
Published: (2024)
by: Hu, Pengfei, et al.
Published: (2024)
SRFUND: A Multi-Granularity Hierarchical Structure Reconstruction Benchmark in Form Understanding
by: Ma, Jiefeng, et al.
Published: (2024)
by: Ma, Jiefeng, et al.
Published: (2024)
PRM-BAS: Enhancing Multimodal Reasoning through PRM-guided Beam Annealing Search
by: Hu, Pengfei, et al.
Published: (2025)
by: Hu, Pengfei, et al.
Published: (2025)
MMC: Iterative Refinement of VLM Reasoning via MCTS-based Multimodal Critique
by: Liu, Shuhang, et al.
Published: (2025)
by: Liu, Shuhang, et al.
Published: (2025)
UniVRSE: Unified Vision-conditioned Response Semantic Entropy for Hallucination Detection in Medical Vision-Language Models
by: Liao, Zehui, et al.
Published: (2025)
by: Liao, Zehui, et al.
Published: (2025)
Enhancing the Geometric Problem-Solving Ability of Multimodal LLMs via Symbolic-Neural Integration
by: Pan, Yicheng, et al.
Published: (2025)
by: Pan, Yicheng, et al.
Published: (2025)
BasicAVSR: Arbitrary-Scale Video Super-Resolution via Image Priors and Enhanced Motion Compensation
by: Shang, Wei, et al.
Published: (2025)
by: Shang, Wei, et al.
Published: (2025)
DAWN: Dynamic Frame Avatar with Non-autoregressive Diffusion Framework for Talking Head Video Generation
by: Cheng, Hanbo, et al.
Published: (2024)
by: Cheng, Hanbo, et al.
Published: (2024)
EvoCut: Multi-Layer Evolution-Aware Visual Token Compression for Efficient Large Vision-Language Models
by: Lu, Hongyu, et al.
Published: (2026)
by: Lu, Hongyu, et al.
Published: (2026)
Uni-MuMER: Unified Multi-Task Fine-Tuning of Vision-Language Model for Handwritten Mathematical Expression Recognition
by: Li, Yu, et al.
Published: (2025)
by: Li, Yu, et al.
Published: (2025)
TabSniper: Towards Accurate Table Detection & Structure Recognition for Bank Statements
by: Trivedi, Abhishek, et al.
Published: (2024)
by: Trivedi, Abhishek, et al.
Published: (2024)
UniQA: Unified Vision-Language Pre-training for Image Quality and Aesthetic Assessment
by: Zhou, Hantao, et al.
Published: (2024)
by: Zhou, Hantao, et al.
Published: (2024)
Compound Expression Recognition via Large Vision-Language Models
by: Yu, Jun, et al.
Published: (2025)
by: Yu, Jun, et al.
Published: (2025)
UniHM: Unified Dexterous Hand Manipulation with Vision Language Model
by: Zhang, Zhenhao, et al.
Published: (2026)
by: Zhang, Zhenhao, et al.
Published: (2026)
Turning Adaptation into Assets: Cross-Domain Bridging for Online Vision-Language Navigation
by: Hu, Zixuan, et al.
Published: (2026)
by: Hu, Zixuan, et al.
Published: (2026)
Exploring Diverse Representations for Open Set Recognition
by: Wang, Yu, et al.
Published: (2024)
by: Wang, Yu, et al.
Published: (2024)
BA-Net: Bridge Attention in Deep Neural Networks
by: Zhang, Ronghui, et al.
Published: (2024)
by: Zhang, Ronghui, et al.
Published: (2024)
S-GRPO: Unified Post-Training for Large Vision-Language Models
by: Yan, Yuming, et al.
Published: (2026)
by: Yan, Yuming, et al.
Published: (2026)
Vision and Intention Boost Large Language Model in Long-Term Action Anticipation
by: Cao, Congqi, et al.
Published: (2025)
by: Cao, Congqi, et al.
Published: (2025)
TRivia: Self-supervised Fine-tuning of Vision-Language Models for Table Recognition
by: Zhang, Junyuan, et al.
Published: (2025)
by: Zhang, Junyuan, et al.
Published: (2025)
InstructTable: Improving Table Structure Recognition Through Instructions
by: Chen, Boming, et al.
Published: (2026)
by: Chen, Boming, et al.
Published: (2026)
UniFashion: A Unified Vision-Language Model for Multimodal Fashion Retrieval and Generation
by: Zhao, Xiangyu, et al.
Published: (2024)
by: Zhao, Xiangyu, et al.
Published: (2024)
Structured Observation Language for Efficient and Generalizable Vision-Language Navigation
by: Peng, Daojie, et al.
Published: (2026)
by: Peng, Daojie, et al.
Published: (2026)
VL-Uncertainty: Detecting Hallucination in Large Vision-Language Model via Uncertainty Estimation
by: Zhang, Ruiyang, et al.
Published: (2024)
by: Zhang, Ruiyang, et al.
Published: (2024)
PROGRESSLM: Towards Progress Reasoning in Vision-Language Models
by: Zhang, Jianshu, et al.
Published: (2026)
by: Zhang, Jianshu, et al.
Published: (2026)
Uni-RS: A Spatially Faithful Unified Understanding and Generation Model for Remote Sensing
by: Zhang, Weiyu, et al.
Published: (2026)
by: Zhang, Weiyu, et al.
Published: (2026)
Bridging Visual Representation and Reinforcement Learning from Verifiable Rewards in Large Vision-Language Models
by: Han, Yuhang, et al.
Published: (2026)
by: Han, Yuhang, et al.
Published: (2026)
KPL: Training-Free Medical Knowledge Mining of Vision-Language Models
by: Liu, Jiaxiang, et al.
Published: (2025)
by: Liu, Jiaxiang, et al.
Published: (2025)
UniFormer: Unifying Convolution and Self-attention for Visual Recognition
by: Li, Kunchang, et al.
Published: (2022)
by: Li, Kunchang, et al.
Published: (2022)
PP-FormulaNet: Bridging Accuracy and Efficiency in Advanced Formula Recognition
by: Liu, Hongen, et al.
Published: (2025)
by: Liu, Hongen, et al.
Published: (2025)
KAConvNet: Kolmogorov-Arnold Convolutional Networks for Vision Recognition
by: Liu, Zhaoxiang, et al.
Published: (2026)
by: Liu, Zhaoxiang, et al.
Published: (2026)
Unleashing the Potential of SAM2 for Biomedical Images and Videos: A Survey
by: Zhang, Yichi, et al.
Published: (2024)
by: Zhang, Yichi, et al.
Published: (2024)
WeMMU: Enhanced Bridging of Vision-Language Models and Diffusion Models via Noisy Query Tokens
by: Yang, Jian, et al.
Published: (2025)
by: Yang, Jian, et al.
Published: (2025)
BEV$^2$PR: BEV-Enhanced Visual Place Recognition with Structural Cues
by: Ge, Fudong, et al.
Published: (2024)
by: Ge, Fudong, et al.
Published: (2024)
Similar Items
-
See then Tell: Enhancing Key Information Extraction with Vision Grounding
by: Liu, Shuhang, et al.
Published: (2024) -
Bidirectional Trained Tree-Structured Decoder for Handwritten Mathematical Expression Recognition
by: Cheng, Hanbo, et al.
Published: (2023) -
Skeleton and Font Generation Network for Zero-shot Chinese Character Generation
by: Xue, Mobai, et al.
Published: (2025) -
RFL: Simplifying Chemical Structure Recognition with Ring-Free Language
by: Chang, Qikai, et al.
Published: (2024) -
SEMv2: Table Separation Line Detection Based on Instance Segmentation
by: Zhang, Zhenrong, et al.
Published: (2023)