LOGO: Video Text Spotting with Language Collaboration and Glyph Perception Model
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Hongen, Sun, Di, Wang, Jiahao, Liu, Yi, Pan, Gang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
GlyphMastero: A Glyph Encoder for High-Fidelity Scene Text Editing
por: Wang, Tong, et al.
Publicado: (2025)
por: Wang, Tong, et al.
Publicado: (2025)
WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing
por: Zhang, Hui, et al.
Publicado: (2026)
por: Zhang, Hui, et al.
Publicado: (2026)
CBDiff:Conditional Bernoulli Diffusion Models for Image Forgery Localization
por: Lei, Zhou, et al.
Publicado: (2025)
por: Lei, Zhou, et al.
Publicado: (2025)
PP-FormulaNet: Bridging Accuracy and Efficiency in Advanced Formula Recognition
por: Liu, Hongen, et al.
Publicado: (2025)
por: Liu, Hongen, et al.
Publicado: (2025)
FashionLOGO: Prompting Multimodal Large Language Models for Fashion Logo Embeddings
por: Wang, Zhen, et al.
Publicado: (2023)
por: Wang, Zhen, et al.
Publicado: (2023)
UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis
por: Wang, Yuanrui, et al.
Publicado: (2025)
por: Wang, Yuanrui, et al.
Publicado: (2025)
GlyphDraw2: Automatic Generation of Complex Glyph Posters with Diffusion Models and Large Language Models
por: Ma, Jian, et al.
Publicado: (2024)
por: Ma, Jian, et al.
Publicado: (2024)
GlyphPrinter: Region-Grouped Direct Preference Optimization for Glyph-Accurate Visual Text Rendering
por: Shuai, Xincheng, et al.
Publicado: (2026)
por: Shuai, Xincheng, et al.
Publicado: (2026)
LOGO: A Long-Form Video Dataset for Group Action Quality Assessment
por: Zhang, Shiyi, et al.
Publicado: (2024)
por: Zhang, Shiyi, et al.
Publicado: (2024)
Glyph-ByT5: A Customized Text Encoder for Accurate Visual Text Rendering
por: Liu, Zeyu, et al.
Publicado: (2024)
por: Liu, Zeyu, et al.
Publicado: (2024)
FreeText: Training-Free Text Rendering in Diffusion Transformers via Attention Localization and Spectral Glyph Injection
por: Zhang, Ruiqiang, et al.
Publicado: (2026)
por: Zhang, Ruiqiang, et al.
Publicado: (2026)
TextBlockV2: Towards Precise-Detection-Free Scene Text Spotting with Pre-trained Language Model
por: Lyu, Jiahao, et al.
Publicado: (2024)
por: Lyu, Jiahao, et al.
Publicado: (2024)
DiffInk: Glyph- and Style-Aware Latent Diffusion Transformer for Text to Online Handwriting Generation
por: Pan, Wei, et al.
Publicado: (2025)
por: Pan, Wei, et al.
Publicado: (2025)
Glyph: Scaling Context Windows via Visual-Text Compression
por: Cheng, Jiale, et al.
Publicado: (2025)
por: Cheng, Jiale, et al.
Publicado: (2025)
AnyArtisticGlyph: Multilingual Controllable Artistic Glyph Generation
por: Lu, Xiongbo, et al.
Publicado: (2025)
por: Lu, Xiongbo, et al.
Publicado: (2025)
TextMaster: A Unified Framework for Realistic Text Editing via Glyph-Style Dual-Control
por: Yan, Zhenyu, et al.
Publicado: (2024)
por: Yan, Zhenyu, et al.
Publicado: (2024)
FF-LOGO: Cross-Modality Point Cloud Registration with Feature Filtering and Local to Global Optimization
por: Ma, Nan, et al.
Publicado: (2023)
por: Ma, Nan, et al.
Publicado: (2023)
Glyph-ByT5-v2: A Strong Aesthetic Baseline for Accurate Multilingual Visual Text Rendering
por: Liu, Zeyu, et al.
Publicado: (2024)
por: Liu, Zeyu, et al.
Publicado: (2024)
GLDesigner: Leveraging Multi-Modal LLMs as Designer for Enhanced Aesthetic Text Glyph Layouts
por: He, Junwen, et al.
Publicado: (2024)
por: He, Junwen, et al.
Publicado: (2024)
Training-Free Occluded Text Rendering via Glyph Priors and Attention-Guided Semantic Blending
por: Hou, Jingqi, et al.
Publicado: (2026)
por: Hou, Jingqi, et al.
Publicado: (2026)
Empowering Backbone Models for Visual Text Generation with Input Granularity Control and Glyph-Aware Training
por: Li, Wenbo, et al.
Publicado: (2024)
por: Li, Wenbo, et al.
Publicado: (2024)
GoMatching++: Parameter- and Data-Efficient Arbitrary-Shaped Video Text Spotting and Benchmarking
por: He, Haibin, et al.
Publicado: (2025)
por: He, Haibin, et al.
Publicado: (2025)
GlyphPattern: An Abstract Pattern Recognition Benchmark for Vision-Language Models
por: Wu, Zixuan, et al.
Publicado: (2024)
por: Wu, Zixuan, et al.
Publicado: (2024)
HDGlyph: A Hierarchical Disentangled Glyph-Based Framework for Long-Tail Text Rendering in Diffusion Models
por: Zhuang, Shuhan, et al.
Publicado: (2025)
por: Zhuang, Shuhan, et al.
Publicado: (2025)
CoST: Efficient Collaborative Perception From Unified Spatiotemporal Perspective
por: Tang, Zongheng, et al.
Publicado: (2025)
por: Tang, Zongheng, et al.
Publicado: (2025)
GloTSFormer: Global Video Text Spotting Transformer
por: Wang, Han, et al.
Publicado: (2024)
por: Wang, Han, et al.
Publicado: (2024)
Decoupling Layout from Glyph in Online Chinese Handwriting Generation
por: Ren, Min-Si, et al.
Publicado: (2024)
por: Ren, Min-Si, et al.
Publicado: (2024)
Restore Text First, Enhance Image Later: Two-Stage Scene Text Image Super-Resolution with Glyph Structure Guidance
por: Luo, Minxing, et al.
Publicado: (2025)
por: Luo, Minxing, et al.
Publicado: (2025)
Text Is MASS: Modeling as Stochastic Embedding for Text-Video Retrieval
por: Wang, Jiamian, et al.
Publicado: (2024)
por: Wang, Jiamian, et al.
Publicado: (2024)
GlyphBanana: Advancing Precise Text Rendering Through Agentic Workflows
por: Yan, Zexuan, et al.
Publicado: (2026)
por: Yan, Zexuan, et al.
Publicado: (2026)
GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration
por: Huang, Kaiyi, et al.
Publicado: (2024)
por: Huang, Kaiyi, et al.
Publicado: (2024)
Navigation Instruction Generation with BEV Perception and Large Language Models
por: Fan, Sheng, et al.
Publicado: (2024)
por: Fan, Sheng, et al.
Publicado: (2024)
GoMatching: A Simple Baseline for Video Text Spotting via Long and Short Term Matching
por: He, Haibin, et al.
Publicado: (2024)
por: He, Haibin, et al.
Publicado: (2024)
Enhancing Video Large Language Models with Structured Multi-Video Collaborative Reasoning
por: He, Zhihao, et al.
Publicado: (2025)
por: He, Zhihao, et al.
Publicado: (2025)
Hyper-Local Deformable Transformers for Text Spotting on Historical Maps
por: Lin, Yijun, et al.
Publicado: (2025)
por: Lin, Yijun, et al.
Publicado: (2025)
LRANet++: Low-Rank Approximation Network for Accurate and Efficient Text Spotting
por: Su, Yuchen, et al.
Publicado: (2025)
por: Su, Yuchen, et al.
Publicado: (2025)
SwinTextSpotter v2: Towards Better Synergy for Scene Text Spotting
por: Huang, Mingxin, et al.
Publicado: (2024)
por: Huang, Mingxin, et al.
Publicado: (2024)
Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis
por: Su, Tongtong, et al.
Publicado: (2025)
por: Su, Tongtong, et al.
Publicado: (2025)
PP-OCRv5: A Specialized 5M-Parameter Model Rivaling Billion-Parameter Vision-Language Models on OCR Tasks
por: Cui, Cheng, et al.
Publicado: (2026)
por: Cui, Cheng, et al.
Publicado: (2026)
Stroke Modeling Enables Vectorized Character Generation with Large Vectorized Glyph Model
por: Zhang, Xinyue, et al.
Publicado: (2025)
por: Zhang, Xinyue, et al.
Publicado: (2025)
Ejemplares similares
-
GlyphMastero: A Glyph Encoder for High-Fidelity Scene Text Editing
por: Wang, Tong, et al.
Publicado: (2025) -
WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing
por: Zhang, Hui, et al.
Publicado: (2026) -
CBDiff:Conditional Bernoulli Diffusion Models for Image Forgery Localization
por: Lei, Zhou, et al.
Publicado: (2025) -
PP-FormulaNet: Bridging Accuracy and Efficiency in Advanced Formula Recognition
por: Liu, Hongen, et al.
Publicado: (2025) -
FashionLOGO: Prompting Multimodal Large Language Models for Fashion Logo Embeddings
por: Wang, Zhen, et al.
Publicado: (2023)