GloTSFormer: Global Video Text Spotting Transformer
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Han, Wang, Yanjie, Li, Yang, Huang, Can |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GloSoFarID: Global multispectral dataset for Solar Farm IDentification in satellite imagery
par: Yang, Zhiyuan, et autres
Publié: (2024)
par: Yang, Zhiyuan, et autres
Publié: (2024)
Parrot Captions Teach CLIP to Spot Text
par: Lin, Yiqi, et autres
Publié: (2023)
par: Lin, Yiqi, et autres
Publié: (2023)
InstructOCR: Instruction Boosting Scene Text Spotting
par: Duan, Chen, et autres
Publié: (2024)
par: Duan, Chen, et autres
Publié: (2024)
Text-Enhanced Panoptic Symbol Spotting in CAD Drawings
par: Liu, Xianlin, et autres
Publié: (2025)
par: Liu, Xianlin, et autres
Publié: (2025)
SpotEdit: Selective Region Editing in Diffusion Transformers
par: Qin, Zhibin, et autres
Publié: (2025)
par: Qin, Zhibin, et autres
Publié: (2025)
Multi-Scale Temporal Difference Transformer for Video-Text Retrieval
par: Wang, Ni, et autres
Publié: (2024)
par: Wang, Ni, et autres
Publié: (2024)
Global Context Compression with Interleaved Vision-Text Transformation
par: Jiao, Dian, et autres
Publié: (2026)
par: Jiao, Dian, et autres
Publié: (2026)
Snap Video: Scaled Spatiotemporal Transformers for Text-to-Video Synthesis
par: Menapace, Willi, et autres
Publié: (2024)
par: Menapace, Willi, et autres
Publié: (2024)
OpenSDI: Spotting Diffusion-Generated Images in the Open World
par: Wang, Yabin, et autres
Publié: (2025)
par: Wang, Yabin, et autres
Publié: (2025)
SViTT-Ego: A Sparse Video-Text Transformer for Egocentric Video
par: Valdez, Hector A., et autres
Publié: (2024)
par: Valdez, Hector A., et autres
Publié: (2024)
Edge Approximation Text Detector
par: Yang, Chuang, et autres
Publié: (2025)
par: Yang, Chuang, et autres
Publié: (2025)
Synergistic Global-space Camera and Human Reconstruction from Videos
par: Zhao, Yizhou, et autres
Publié: (2024)
par: Zhao, Yizhou, et autres
Publié: (2024)
Enhancing Text-to-Image Diffusion Transformer via Split-Text Conditioning
par: Zhang, Yu, et autres
Publié: (2025)
par: Zhang, Yu, et autres
Publié: (2025)
SANA-Video: Efficient Video Generation with Block Linear Diffusion Transformer
par: Chen, Junsong, et autres
Publié: (2025)
par: Chen, Junsong, et autres
Publié: (2025)
Gather and Trace: Rethinking Video TextVQA from an Instance-oriented Perspective
par: Zhang, Yan, et autres
Publié: (2025)
par: Zhang, Yan, et autres
Publié: (2025)
BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations
par: Feng, Weixi, et autres
Publié: (2025)
par: Feng, Weixi, et autres
Publié: (2025)
VGTS: Visually Guided Text Spotting for Novel Categories in Historical Manuscripts
par: Hu, Wenbo, et autres
Publié: (2023)
par: Hu, Wenbo, et autres
Publié: (2023)
HawkEye: Training Video-Text LLMs for Grounding Text in Videos
par: Wang, Yueqian, et autres
Publié: (2024)
par: Wang, Yueqian, et autres
Publié: (2024)
RelayFormer: A Unified Local-Global Attention Framework for Scalable Image and Video Manipulation Localization
par: Huang, Wen, et autres
Publié: (2025)
par: Huang, Wen, et autres
Publié: (2025)
xGen-VideoSyn-1: High-fidelity Text-to-Video Synthesis with Compressed Representations
par: Qin, Can, et autres
Publié: (2024)
par: Qin, Can, et autres
Publié: (2024)
StyleGuard: Preventing Text-to-Image-Model-based Style Mimicry Attacks by Style Perturbations
par: Li, Yanjie, et autres
Publié: (2025)
par: Li, Yanjie, et autres
Publié: (2025)
SeqBench: Benchmarking Sequential Narrative Generation in Text-to-Video Models
par: Tang, Zhengxu, et autres
Publié: (2025)
par: Tang, Zhengxu, et autres
Publié: (2025)
StyleCrafter: Enhancing Stylized Text-to-Video Generation with Style Adapter
par: Liu, Gongye, et autres
Publié: (2023)
par: Liu, Gongye, et autres
Publié: (2023)
TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation
par: Feng, Weixi, et autres
Publié: (2024)
par: Feng, Weixi, et autres
Publié: (2024)
Video Text Preservation with Synthetic Text-Rich Videos
par: Liu, Ziyang, et autres
Publié: (2025)
par: Liu, Ziyang, et autres
Publié: (2025)
TextMamba: Scene Text Detector with Mamba
par: Zhao, Qiyan, et autres
Publié: (2025)
par: Zhao, Qiyan, et autres
Publié: (2025)
DNTextSpotter: Arbitrary-Shaped Scene Text Spotting via Improved Denoising Training
par: Xie, Yu, et autres
Publié: (2024)
par: Xie, Yu, et autres
Publié: (2024)
FAIRT2V: Training-Free Debiasing for Text-to-Video Diffusion Models
par: Zhong, Haonan, et autres
Publié: (2026)
par: Zhong, Haonan, et autres
Publié: (2026)
BadVideo: Stealthy Backdoor Attack against Text-to-Video Generation
par: Wang, Ruotong, et autres
Publié: (2025)
par: Wang, Ruotong, et autres
Publié: (2025)
TextEditBench: Evaluating Reasoning-aware Text Editing Beyond Rendering
par: Gui, Rui, et autres
Publié: (2025)
par: Gui, Rui, et autres
Publié: (2025)
Instant Preference Alignment for Text-to-Image Diffusion Models
par: Li, Yang, et autres
Publié: (2025)
par: Li, Yang, et autres
Publié: (2025)
Dual-IPO: Dual-Iterative Preference Optimization for Text-to-Video Generation
par: Yang, Xiaomeng, et autres
Publié: (2025)
par: Yang, Xiaomeng, et autres
Publié: (2025)
Progressive Image Restoration via Text-Conditioned Video Generation
par: Kang, Peng, et autres
Publié: (2025)
par: Kang, Peng, et autres
Publié: (2025)
UniCombine: Unified Multi-Conditional Combination with Diffusion Transformer
par: Wang, Haoxuan, et autres
Publié: (2025)
par: Wang, Haoxuan, et autres
Publié: (2025)
Audio-centric Video Understanding Benchmark without Text Shortcut
par: Yang, Yudong, et autres
Publié: (2025)
par: Yang, Yudong, et autres
Publié: (2025)
DisCa: Accelerating Video Diffusion Transformers with Distillation-Compatible Learnable Feature Caching
par: Zou, Chang, et autres
Publié: (2026)
par: Zou, Chang, et autres
Publié: (2026)
FIFO-Diffusion: Generating Infinite Videos from Text without Training
par: Kim, Jihwan, et autres
Publié: (2024)
par: Kim, Jihwan, et autres
Publié: (2024)
SPHERE: Unveiling Spatial Blind Spots in Vision-Language Models Through Hierarchical Evaluation
par: Zhang, Wenyu, et autres
Publié: (2024)
par: Zhang, Wenyu, et autres
Publié: (2024)
VC4VG: Optimizing Video Captions for Text-to-Video Generation
par: Du, Yang, et autres
Publié: (2025)
par: Du, Yang, et autres
Publié: (2025)
TGBFormer: Transformer-GraphFormer Blender Network for Video Object Detection
par: Qi, Qiang, et autres
Publié: (2025)
par: Qi, Qiang, et autres
Publié: (2025)
Documents similaires
-
GloSoFarID: Global multispectral dataset for Solar Farm IDentification in satellite imagery
par: Yang, Zhiyuan, et autres
Publié: (2024) -
Parrot Captions Teach CLIP to Spot Text
par: Lin, Yiqi, et autres
Publié: (2023) -
InstructOCR: Instruction Boosting Scene Text Spotting
par: Duan, Chen, et autres
Publié: (2024) -
Text-Enhanced Panoptic Symbol Spotting in CAD Drawings
par: Liu, Xianlin, et autres
Publié: (2025) -
SpotEdit: Selective Region Editing in Diffusion Transformers
par: Qin, Zhibin, et autres
Publié: (2025)