TDATR: Improving End-to-End Table Recognition via Table Detail-Aware Learning and Cell-Level Visual Alignment
Fuente:
arXiv
Guardado en:
| Autores principales: | Qin, Chunxia, Liu, Chenyu, Xia, Pengcheng, Du, Jun, Yin, Baocai, Yin, Bing, Liu, Cong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Col-OLHTR: A Novel Framework for Multimodal Online Handwritten Text Recognition
por: Liu, Chenyu, et al.
Publicado: (2025)
por: Liu, Chenyu, et al.
Publicado: (2025)
NAMER: Non-Autoregressive Modeling for Handwritten Mathematical Expression Recognition
por: Liu, Chenyu, et al.
Publicado: (2024)
por: Liu, Chenyu, et al.
Publicado: (2024)
Exploring Part-Informed Visual-Language Learning for Person Re-Identification
por: Lin, Yin, et al.
Publicado: (2023)
por: Lin, Yin, et al.
Publicado: (2023)
Binary-Gaussian: Compact and Progressive Representation for 3D Gaussian Segmentation
por: Yang, An, et al.
Publicado: (2025)
por: Yang, An, et al.
Publicado: (2025)
SEMv2: Table Separation Line Detection Based on Instance Segmentation
por: Zhang, Zhenrong, et al.
Publicado: (2023)
por: Zhang, Zhenrong, et al.
Publicado: (2023)
Quality-Aware End-to-End Audio-Visual Neural Speaker Diarization
por: He, Mao-Kui, et al.
Publicado: (2024)
por: He, Mao-Kui, et al.
Publicado: (2024)
SEMv3: A Fast and Robust Approach to Table Separation Line Detection
por: Qin, Chunxia, et al.
Publicado: (2024)
por: Qin, Chunxia, et al.
Publicado: (2024)
StyleSpeaker: Audio-Enhanced Fine-Grained Style Modeling for Speech-Driven 3D Facial Animation
por: Yang, An, et al.
Publicado: (2025)
por: Yang, An, et al.
Publicado: (2025)
REST: Diffusion-based Real-time End-to-end Streaming Talking Head Generation via ID-Context Caching and Asynchronous Streaming Distillation
por: Wang, Haotian, et al.
Publicado: (2025)
por: Wang, Haotian, et al.
Publicado: (2025)
1DFormer: a Transformer Architecture Learning 1D Landmark Representations for Facial Landmark Tracking
por: Yin, Shi, et al.
Publicado: (2023)
por: Yin, Shi, et al.
Publicado: (2023)
Hi-SAM: Marrying Segment Anything Model for Hierarchical Text Segmentation
por: Ye, Maoyuan, et al.
Publicado: (2024)
por: Ye, Maoyuan, et al.
Publicado: (2024)
WebAgent-R1: Training Web Agents via End-to-End Multi-Turn Reinforcement Learning
por: Wei, Zhepei, et al.
Publicado: (2025)
por: Wei, Zhepei, et al.
Publicado: (2025)
Codebook-Centric Deep Hashing: End-to-End Joint Learning of Semantic Hash Centers and Neural Hash Function
por: Yin, Shuo, et al.
Publicado: (2025)
por: Yin, Shuo, et al.
Publicado: (2025)
End‐to‐End Attention‐Enhanced Transformer for Image Captioning in Biomimetic Wearable Devices
por: Yongyang Yin, et al.
Publicado: (2025)
por: Yongyang Yin, et al.
Publicado: (2025)
VSD-MOT: End-to-End Multi-Object Tracking in Low-Quality Video Scenes Guided by Visual Semantic Distillation
por: Du, Jun
Publicado: (2026)
por: Du, Jun
Publicado: (2026)
U-DECN: End-to-End Underwater Object Detection ConvNet with Improved DeNoising Training
por: Liu, Zhuoyan, et al.
Publicado: (2024)
por: Liu, Zhuoyan, et al.
Publicado: (2024)
CoreUnlearn: Rethinking Concept Unlearning through Disentangled Component-Level Erasure in Text-guided Diffusion Models
por: Zhao, Mengnan, et al.
Publicado: (2026)
por: Zhao, Mengnan, et al.
Publicado: (2026)
Joint Learning Global-Local Speaker Classification to Enhance End-to-End Speaker Diarization and Recognition
por: Dai, Yuhang, et al.
Publicado: (2026)
por: Dai, Yuhang, et al.
Publicado: (2026)
Boosting End-to-End Database Isolation Checking via Mini-Transactions (Extended Version)
por: Wei, Hengfeng, et al.
Publicado: (2025)
por: Wei, Hengfeng, et al.
Publicado: (2025)
Towards End-to-End Alignment of User Satisfaction via Questionnaire in Video Recommendation
por: Li, Na, et al.
Publicado: (2026)
por: Li, Na, et al.
Publicado: (2026)
End-to-End Chess Recognition
por: Masouris, Athanasios, et al.
Publicado: (2023)
por: Masouris, Athanasios, et al.
Publicado: (2023)
DeepFRC: An End-to-End Deep Learning Model for Functional Registration and Classification
por: Jiang, Siyuan, et al.
Publicado: (2025)
por: Jiang, Siyuan, et al.
Publicado: (2025)
RecoverFormer: End-to-End Contact-Aware Recovery for Humanoid Robots
por: Liu, Zihui
Publicado: (2026)
por: Liu, Zihui
Publicado: (2026)
USAD: End-to-End Human Activity Recognition via Diffusion Model with Spatiotemporal Attention
por: Xiao, Hang, et al.
Publicado: (2025)
por: Xiao, Hang, et al.
Publicado: (2025)
End-to-End Visual Autonomous Parking via Control-Aided Attention
por: Chen, Chao, et al.
Publicado: (2025)
por: Chen, Chao, et al.
Publicado: (2025)
MAP: End-to-End Autonomous Driving with Map-Assisted Planning
por: Yin, Huilin, et al.
Publicado: (2025)
por: Yin, Huilin, et al.
Publicado: (2025)
Bridging Perception and Planning: Towards End-to-End Planning for Signal Temporal Logic Tasks
por: Ye, Bowen, et al.
Publicado: (2025)
por: Ye, Bowen, et al.
Publicado: (2025)
EVE: Towards End-to-End Video Subtitle Extraction with Vision-Language Models
por: Yu, Haiyang, et al.
Publicado: (2025)
por: Yu, Haiyang, et al.
Publicado: (2025)
Continual Learning for Monolingual End-to-End Automatic Speech Recognition
por: Eeckt, Steven Vander, et al.
Publicado: (2021)
por: Eeckt, Steven Vander, et al.
Publicado: (2021)
State-Conditional Adversarial Learning: An Off-Policy Visual Domain Transfer Method for End-to-End Imitation Learning
por: Liu, Yuxiang, et al.
Publicado: (2025)
por: Liu, Yuxiang, et al.
Publicado: (2025)
Embodied Escaping: End-to-End Reinforcement Learning for Robot Navigation in Narrow Environment
por: Zheng, Han, et al.
Publicado: (2025)
por: Zheng, Han, et al.
Publicado: (2025)
Towards Fully Decoupled End-to-End Person Search
por: Zhang, Pengcheng, et al.
Publicado: (2023)
por: Zhang, Pengcheng, et al.
Publicado: (2023)
Spatially Visual Perception for End-to-End Robotic Learning
por: Davies, Travis, et al.
Publicado: (2024)
por: Davies, Travis, et al.
Publicado: (2024)
SpeakerLM: End-to-End Versatile Speaker Diarization and Recognition with Multimodal Large Language Models
por: Yin, Han, et al.
Publicado: (2025)
por: Yin, Han, et al.
Publicado: (2025)
Training Multi-Image Vision Agents via End2End Reinforcement Learning
por: Dong, Chengqi, et al.
Publicado: (2025)
por: Dong, Chengqi, et al.
Publicado: (2025)
LP-LLM: End-to-End Real-World Degraded License Plate Text Recognition via Large Multimodal Models
por: Gong, Haoyan, et al.
Publicado: (2026)
por: Gong, Haoyan, et al.
Publicado: (2026)
End-to-End Learning for SLP-Based ISAC Systems
por: Zheng, Yixian, et al.
Publicado: (2024)
por: Zheng, Yixian, et al.
Publicado: (2024)
DiagramNet: An End-to-End Recognition Framework and Dataset for Non-Standard System-Level Diagrams
por: Lou, Jincheng, et al.
Publicado: (2026)
por: Lou, Jincheng, et al.
Publicado: (2026)
End-to-End Photodissociation Dynamics of Energized H$_2$COO
por: Yin, Cangtao, et al.
Publicado: (2025)
por: Yin, Cangtao, et al.
Publicado: (2025)
End-to-End On-Device Quantization-Aware Training for LLMs at Inference Cost
por: Tan, Qitao, et al.
Publicado: (2025)
por: Tan, Qitao, et al.
Publicado: (2025)
Ejemplares similares
-
Col-OLHTR: A Novel Framework for Multimodal Online Handwritten Text Recognition
por: Liu, Chenyu, et al.
Publicado: (2025) -
NAMER: Non-Autoregressive Modeling for Handwritten Mathematical Expression Recognition
por: Liu, Chenyu, et al.
Publicado: (2024) -
Exploring Part-Informed Visual-Language Learning for Person Re-Identification
por: Lin, Yin, et al.
Publicado: (2023) -
Binary-Gaussian: Compact and Progressive Representation for 3D Gaussian Segmentation
por: Yang, An, et al.
Publicado: (2025) -
SEMv2: Table Separation Line Detection Based on Instance Segmentation
por: Zhang, Zhenrong, et al.
Publicado: (2023)