VGTS: Visually Guided Text Spotting for Novel Categories in Historical Manuscripts
Fuente:
arXiv
Salvato in:
| Autori principali: | Hu, Wenbo, Zhan, Hongjian, Ma, Xinchen, Liu, Cong, Yin, Bing, Lu, Yue |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Probabilistic Dating of Historical Manuscripts via Evidential Deep Regression on Visual Script Features
di: Chodavarapu, Ranjith
Pubblicazione: (2026)
di: Chodavarapu, Ranjith
Pubblicazione: (2026)
PriorCLIP: Visual Prior Guided Vision-Language Model for Remote Sensing Image-Text Retrieval
di: Pan, Jiancheng, et al.
Pubblicazione: (2024)
di: Pan, Jiancheng, et al.
Pubblicazione: (2024)
Handwritten Text Recognition of Historical Manuscripts Using Transformer-Based Models
di: Meoded, Erez
Pubblicazione: (2025)
di: Meoded, Erez
Pubblicazione: (2025)
LAGO: Language-Guided Adaptive Object-Region Focus for Zero-Shot Visual-Text Alignment
di: Hu, Junyi, et al.
Pubblicazione: (2026)
di: Hu, Junyi, et al.
Pubblicazione: (2026)
TDATR: Improving End-to-End Table Recognition via Table Detail-Aware Learning and Cell-Level Visual Alignment
di: Qin, Chunxia, et al.
Pubblicazione: (2026)
di: Qin, Chunxia, et al.
Pubblicazione: (2026)
DeepScan: A Training-Free Framework for Visually Grounded Reasoning in Large Vision-Language Models
di: Li, Yangfu, et al.
Pubblicazione: (2026)
di: Li, Yangfu, et al.
Pubblicazione: (2026)
SigFormer: Sparse Signal-Guided Transformer for Multi-Modal Human Action Segmentation
di: Liu, Qi, et al.
Pubblicazione: (2023)
di: Liu, Qi, et al.
Pubblicazione: (2023)
Text-Enhanced Panoptic Symbol Spotting in CAD Drawings
di: Liu, Xianlin, et al.
Pubblicazione: (2025)
di: Liu, Xianlin, et al.
Pubblicazione: (2025)
Why 1 + 1 < 1 in Visual Token Pruning: Beyond Naive Integration via Multi-Objective Balanced Covering
di: Li, Yangfu, et al.
Pubblicazione: (2025)
di: Li, Yangfu, et al.
Pubblicazione: (2025)
Parrot Captions Teach CLIP to Spot Text
di: Lin, Yiqi, et al.
Pubblicazione: (2023)
di: Lin, Yiqi, et al.
Pubblicazione: (2023)
Hyper-Local Deformable Transformers for Text Spotting on Historical Maps
di: Lin, Yijun, et al.
Pubblicazione: (2025)
di: Lin, Yijun, et al.
Pubblicazione: (2025)
Boosting the Transferability of Adversarial Examples via Local Mixup and Adaptive Step Size
di: Liu, Junlin, et al.
Pubblicazione: (2024)
di: Liu, Junlin, et al.
Pubblicazione: (2024)
DNTextSpotter: Arbitrary-Shaped Scene Text Spotting via Improved Denoising Training
di: Xie, Yu, et al.
Pubblicazione: (2024)
di: Xie, Yu, et al.
Pubblicazione: (2024)
Text2Seg: Remote Sensing Image Semantic Segmentation via Text-Guided Visual Foundation Models
di: Zhang, Jielu, et al.
Pubblicazione: (2023)
di: Zhang, Jielu, et al.
Pubblicazione: (2023)
Category Query Learning for Human-Object Interaction Classification
di: Xie, Chi, et al.
Pubblicazione: (2023)
di: Xie, Chi, et al.
Pubblicazione: (2023)
Low-Data Classification of Historical Music Manuscripts: A Few-Shot Learning Approach
di: Shatri, Elona, et al.
Pubblicazione: (2024)
di: Shatri, Elona, et al.
Pubblicazione: (2024)
InstructOCR: Instruction Boosting Scene Text Spotting
di: Duan, Chen, et al.
Pubblicazione: (2024)
di: Duan, Chen, et al.
Pubblicazione: (2024)
GloTSFormer: Global Video Text Spotting Transformer
di: Wang, Han, et al.
Pubblicazione: (2024)
di: Wang, Han, et al.
Pubblicazione: (2024)
Powerful Teachers Matter: Text-Guided Multi-view Knowledge Distillation with Visual Prior Enhancement
di: Zhang, Xin, et al.
Pubblicazione: (2026)
di: Zhang, Xin, et al.
Pubblicazione: (2026)
ROVER: Routing Object-Centric Visual Evidence for Grounded Multi-Image Reasoning
di: Lv, Guannan, et al.
Pubblicazione: (2026)
di: Lv, Guannan, et al.
Pubblicazione: (2026)
SLIP: Structural-aware Language-Image Pretraining for Vision-Language Alignment
di: Lu, Wenbo
Pubblicazione: (2025)
di: Lu, Wenbo
Pubblicazione: (2025)
Empowering Backbone Models for Visual Text Generation with Input Granularity Control and Glyph-Aware Training
di: Li, Wenbo, et al.
Pubblicazione: (2024)
di: Li, Wenbo, et al.
Pubblicazione: (2024)
Exploring Part-Informed Visual-Language Learning for Person Re-Identification
di: Lin, Yin, et al.
Pubblicazione: (2023)
di: Lin, Yin, et al.
Pubblicazione: (2023)
AlignVAR: Towards Globally Consistent Visual Autoregression for Image Super-Resolution
di: Liu, Cencen, et al.
Pubblicazione: (2026)
di: Liu, Cencen, et al.
Pubblicazione: (2026)
Training-Free Text-Guided Image Editing with Visual Autoregressive Model
di: Wang, Yufei, et al.
Pubblicazione: (2025)
di: Wang, Yufei, et al.
Pubblicazione: (2025)
WeCromCL: Weakly Supervised Cross-Modality Contrastive Learning for Transcription-only Supervised Text Spotting
di: Wu, Jingjing, et al.
Pubblicazione: (2024)
di: Wu, Jingjing, et al.
Pubblicazione: (2024)
Finer-CAM: Spotting the Difference Reveals Finer Details for Visual Explanation
di: Zhang, Ziheng, et al.
Pubblicazione: (2025)
di: Zhang, Ziheng, et al.
Pubblicazione: (2025)
Enhancing Text-to-Image Diffusion Transformer via Split-Text Conditioning
di: Zhang, Yu, et al.
Pubblicazione: (2025)
di: Zhang, Yu, et al.
Pubblicazione: (2025)
GlyphBanana: Advancing Precise Text Rendering Through Agentic Workflows
di: Yan, Zexuan, et al.
Pubblicazione: (2026)
di: Yan, Zexuan, et al.
Pubblicazione: (2026)
Direction-Oriented Visual-semantic Embedding Model for Remote Sensing Image-text Retrieval
di: Ma, Qing, et al.
Pubblicazione: (2023)
di: Ma, Qing, et al.
Pubblicazione: (2023)
DecomPose: Disentangling Cross-Category Optimization Contention for Category-Level 6D Object Pose Estimation
di: Gao, Yifan, et al.
Pubblicazione: (2026)
di: Gao, Yifan, et al.
Pubblicazione: (2026)
Instruction-Guided Visual Masking
di: Zheng, Jinliang, et al.
Pubblicazione: (2024)
di: Zheng, Jinliang, et al.
Pubblicazione: (2024)
MASTER: Multimodal Segmentation with Text Prompts
di: Liu, Fuyang, et al.
Pubblicazione: (2025)
di: Liu, Fuyang, et al.
Pubblicazione: (2025)
Scaling Down Text Encoders of Text-to-Image Diffusion Models
di: Wang, Lifu, et al.
Pubblicazione: (2025)
di: Wang, Lifu, et al.
Pubblicazione: (2025)
IFAdapter: Instance Feature Control for Grounded Text-to-Image Generation
di: Wu, Yinwei, et al.
Pubblicazione: (2024)
di: Wu, Yinwei, et al.
Pubblicazione: (2024)
Spot the Difference: A Novel Task for Embodied Agents in Changing Environments
di: Landi, Federico, et al.
Pubblicazione: (2022)
di: Landi, Federico, et al.
Pubblicazione: (2022)
Col-OLHTR: A Novel Framework for Multimodal Online Handwritten Text Recognition
di: Liu, Chenyu, et al.
Pubblicazione: (2025)
di: Liu, Chenyu, et al.
Pubblicazione: (2025)
Visual Text Compression as Measure Transport
di: Tang, Lv, et al.
Pubblicazione: (2026)
di: Tang, Lv, et al.
Pubblicazione: (2026)
OmniPrism: Learning Disentangled Visual Concept for Image Generation
di: Li, Yangyang, et al.
Pubblicazione: (2024)
di: Li, Yangyang, et al.
Pubblicazione: (2024)
HDBN: A Novel Hybrid Dual-branch Network for Robust Skeleton-based Action Recognition
di: Liu, Jinfu, et al.
Pubblicazione: (2024)
di: Liu, Jinfu, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Probabilistic Dating of Historical Manuscripts via Evidential Deep Regression on Visual Script Features
di: Chodavarapu, Ranjith
Pubblicazione: (2026) -
PriorCLIP: Visual Prior Guided Vision-Language Model for Remote Sensing Image-Text Retrieval
di: Pan, Jiancheng, et al.
Pubblicazione: (2024) -
Handwritten Text Recognition of Historical Manuscripts Using Transformer-Based Models
di: Meoded, Erez
Pubblicazione: (2025) -
LAGO: Language-Guided Adaptive Object-Region Focus for Zero-Shot Visual-Text Alignment
di: Hu, Junyi, et al.
Pubblicazione: (2026) -
TDATR: Improving End-to-End Table Recognition via Table Detail-Aware Learning and Cell-Level Visual Alignment
di: Qin, Chunxia, et al.
Pubblicazione: (2026)