GoMatching: A Simple Baseline for Video Text Spotting via Long and Short Term Matching
Fuente:
arXiv
Guardado en:
| Autores principales: | He, Haibin, Ye, Maoyuan, Zhang, Jing, Liu, Juhua, Du, Bo, Tao, Dacheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
GoMatching++: Parameter- and Data-Efficient Arbitrary-Shaped Video Text Spotting and Benchmarking
por: He, Haibin, et al.
Publicado: (2025)
por: He, Haibin, et al.
Publicado: (2025)
VTAgent: Agentic Keyframe Anchoring for Evidence-Aware Video TextVQA
por: He, Haibin, et al.
Publicado: (2026)
por: He, Haibin, et al.
Publicado: (2026)
DeepSolo++: Let Transformer Decoder with Explicit Points Solo for Multilingual Text Spotting
por: Ye, Maoyuan, et al.
Publicado: (2023)
por: Ye, Maoyuan, et al.
Publicado: (2023)
Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?
por: He, Haibin, et al.
Publicado: (2025)
por: He, Haibin, et al.
Publicado: (2025)
LogicOCR: Do Your Large Multimodal Models Excel at Logical Reasoning on Text-Rich Images?
por: Ye, Maoyuan, et al.
Publicado: (2025)
por: Ye, Maoyuan, et al.
Publicado: (2025)
Hi-SAM: Marrying Segment Anything Model for Hierarchical Text Segmentation
por: Ye, Maoyuan, et al.
Publicado: (2024)
por: Ye, Maoyuan, et al.
Publicado: (2024)
ET-SAM: Efficient Point Prompt Prediction in SAM for Unified Scene Text Detection and Layout Analysis
por: Zhang, Xike, et al.
Publicado: (2026)
por: Zhang, Xike, et al.
Publicado: (2026)
Adapting Segment Anything Model for Power Transmission Corridor Hazard Segmentation
por: Chen, Hang, et al.
Publicado: (2025)
por: Chen, Hang, et al.
Publicado: (2025)
Rethink Sparse Signals for Pose-guided Text-to-image Generation
por: Xuan, Wenjie, et al.
Publicado: (2025)
por: Xuan, Wenjie, et al.
Publicado: (2025)
SFA: Scan, Focus, and Amplify toward Guidance-aware Answering for Video TextVQA
por: He, Haibin, et al.
Publicado: (2025)
por: He, Haibin, et al.
Publicado: (2025)
SimpleMatch: A Simple and Strong Baseline for Semantic Correspondence
por: Jin, Hailing, et al.
Publicado: (2026)
por: Jin, Hailing, et al.
Publicado: (2026)
Match Stereo Videos via Bidirectional Alignment
por: Jing, Junpeng, et al.
Publicado: (2024)
por: Jing, Junpeng, et al.
Publicado: (2024)
Match-Stereo-Videos: Bidirectional Alignment for Consistent Dynamic Stereo Matching
por: Jing, Junpeng, et al.
Publicado: (2024)
por: Jing, Junpeng, et al.
Publicado: (2024)
Learn to Think: Improving Multimodal Reasoning through Vision-Aware Self-Improvement Training
por: Zhong, Qihuang, et al.
Publicado: (2026)
por: Zhong, Qihuang, et al.
Publicado: (2026)
FlowLong: Inference-time Long Video Generation via Manifold-constrained Tweedie Matching
por: Park, Jangho, et al.
Publicado: (2026)
por: Park, Jangho, et al.
Publicado: (2026)
Stereo Any Video: Temporally Consistent Stereo Matching
por: Jing, Junpeng, et al.
Publicado: (2025)
por: Jing, Junpeng, et al.
Publicado: (2025)
Hear the Scene: Audio-Enhanced Text Spotting
por: Li, Jing, et al.
Publicado: (2024)
por: Li, Jing, et al.
Publicado: (2024)
When ControlNet Meets Inexplicit Masks: A Case Study of ControlNet on its Contour-following Ability
por: Xuan, Wenjie, et al.
Publicado: (2024)
por: Xuan, Wenjie, et al.
Publicado: (2024)
PointCloud-Text Matching: Benchmark Datasets and a Baseline
por: Feng, Yanglin, et al.
Publicado: (2024)
por: Feng, Yanglin, et al.
Publicado: (2024)
SimInversion: A Simple Framework for Inversion-Based Text-to-Image Editing
por: Qian, Qi, et al.
Publicado: (2024)
por: Qian, Qi, et al.
Publicado: (2024)
SimpleGVR: A Simple Baseline for Latent-Cascaded Video Super-Resolution
por: Xie, Liangbin, et al.
Publicado: (2025)
por: Xie, Liangbin, et al.
Publicado: (2025)
Addressing the ID-Matching Challenge in Long Video Captioning
por: Yang, Zhantao, et al.
Publicado: (2025)
por: Yang, Zhantao, et al.
Publicado: (2025)
A Strong Baseline for Point Cloud Registration via Direct Superpoints Matching
por: Gupta, Aniket, et al.
Publicado: (2023)
por: Gupta, Aniket, et al.
Publicado: (2023)
3D Lane Detection from Front or Surround-View using Joint-Modeling & Matching
por: Zhou, Haibin, et al.
Publicado: (2024)
por: Zhou, Haibin, et al.
Publicado: (2024)
Out of Length Text Recognition with Sub-String Matching
por: Du, Yongkun, et al.
Publicado: (2024)
por: Du, Yongkun, et al.
Publicado: (2024)
Unified Unsupervised Anomaly Detection via Matching Cost Filtering
por: Zhang, Zhe, et al.
Publicado: (2025)
por: Zhang, Zhe, et al.
Publicado: (2025)
MUJICA: Reforming SISR Models for PBR Material Super-Resolution via Cross-Map Attention
por: Du, Xin, et al.
Publicado: (2025)
por: Du, Xin, et al.
Publicado: (2025)
Match-Any-Events: Zero-Shot Motion-Robust Feature Matching Across Wide Baselines for Event Cameras
por: Zhang, Ruijun, et al.
Publicado: (2026)
por: Zhang, Ruijun, et al.
Publicado: (2026)
VidMuse: A Simple Video-to-Music Generation Framework with Long-Short-Term Modeling
por: Tian, Zeyue, et al.
Publicado: (2024)
por: Tian, Zeyue, et al.
Publicado: (2024)
Text-Guided Mixup Towards Long-Tailed Image Categorization
por: Franklin, Richard, et al.
Publicado: (2024)
por: Franklin, Richard, et al.
Publicado: (2024)
Match4Annotate: Propagating Sparse Video Annotations via Implicit Neural Feature Matching
por: Zhang, Zhuorui, et al.
Publicado: (2026)
por: Zhang, Zhuorui, et al.
Publicado: (2026)
Video Individual Counting With Implicit One-to-Many Matching
por: Zhu, Xuhui, et al.
Publicado: (2025)
por: Zhu, Xuhui, et al.
Publicado: (2025)
MatchAttention: Matching the Relative Positions for High-Resolution Cross-View Matching
por: Yan, Tingman, et al.
Publicado: (2025)
por: Yan, Tingman, et al.
Publicado: (2025)
SimBase: A Simple Baseline for Temporal Video Grounding
por: Bao, Peijun, et al.
Publicado: (2024)
por: Bao, Peijun, et al.
Publicado: (2024)
OpenStereo: A Comprehensive Benchmark for Stereo Matching and Strong Baseline
por: Guo, Xianda, et al.
Publicado: (2023)
por: Guo, Xianda, et al.
Publicado: (2023)
RFL-CDNet: Towards Accurate Change Detection via Richer Feature Learning
por: Gan, Yuhang, et al.
Publicado: (2024)
por: Gan, Yuhang, et al.
Publicado: (2024)
Accelerating Video Diffusion Models via Distribution Matching
por: Zhu, Yuanzhi, et al.
Publicado: (2024)
por: Zhu, Yuanzhi, et al.
Publicado: (2024)
FLUX-Text: A Simple and Advanced Diffusion Transformer Baseline for Scene Text Editing
por: Lan, Rui, et al.
Publicado: (2025)
por: Lan, Rui, et al.
Publicado: (2025)
PolarMAE: Efficient Fetal Ultrasound Pre-training via Semantic Screening and Polar-Guided Masking
por: Lv, Meng, et al.
Publicado: (2026)
por: Lv, Meng, et al.
Publicado: (2026)
DcMatch: Unsupervised Multi-Shape Matching with Dual-Level Consistency
por: Ye, Tianwei, et al.
Publicado: (2025)
por: Ye, Tianwei, et al.
Publicado: (2025)
Ejemplares similares
-
GoMatching++: Parameter- and Data-Efficient Arbitrary-Shaped Video Text Spotting and Benchmarking
por: He, Haibin, et al.
Publicado: (2025) -
VTAgent: Agentic Keyframe Anchoring for Evidence-Aware Video TextVQA
por: He, Haibin, et al.
Publicado: (2026) -
DeepSolo++: Let Transformer Decoder with Explicit Points Solo for Multilingual Text Spotting
por: Ye, Maoyuan, et al.
Publicado: (2023) -
Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?
por: He, Haibin, et al.
Publicado: (2025) -
LogicOCR: Do Your Large Multimodal Models Excel at Logical Reasoning on Text-Rich Images?
por: Ye, Maoyuan, et al.
Publicado: (2025)