Hear the Scene: Audio-Enhanced Text Spotting
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Jing, Wang, Bo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Efficiently Leveraging Linguistic Priors for Scene Text Spotting
por: Nguyen, Nguyen, et al.
Publicado: (2024)
por: Nguyen, Nguyen, et al.
Publicado: (2024)
InstructOCR: Instruction Boosting Scene Text Spotting
por: Duan, Chen, et al.
Publicado: (2024)
por: Duan, Chen, et al.
Publicado: (2024)
SwinTextSpotter v2: Towards Better Synergy for Scene Text Spotting
por: Huang, Mingxin, et al.
Publicado: (2024)
por: Huang, Mingxin, et al.
Publicado: (2024)
Diving into the Depths of Spotting Text in Multi-Domain Noisy Scenes
por: Das, Alloy, et al.
Publicado: (2023)
por: Das, Alloy, et al.
Publicado: (2023)
FastTextSpotter: A High-Efficiency Transformer for Multilingual Scene Text Spotting
por: Das, Alloy, et al.
Publicado: (2024)
por: Das, Alloy, et al.
Publicado: (2024)
TextBlockV2: Towards Precise-Detection-Free Scene Text Spotting with Pre-trained Language Model
por: Lyu, Jiahao, et al.
Publicado: (2024)
por: Lyu, Jiahao, et al.
Publicado: (2024)
TextInPlace: Indoor Visual Place Recognition in Repetitive Structures with Scene Text Spotting and Verification
por: Tao, Huaqi, et al.
Publicado: (2025)
por: Tao, Huaqi, et al.
Publicado: (2025)
ODM: A Text-Image Further Alignment Pre-training Approach for Scene Text Detection and Spotting
por: Duan, Chen, et al.
Publicado: (2024)
por: Duan, Chen, et al.
Publicado: (2024)
Inverse-like Antagonistic Scene Text Spotting via Reading-Order Estimation and Dynamic Sampling
por: Zhang, Shi-Xue, et al.
Publicado: (2024)
por: Zhang, Shi-Xue, et al.
Publicado: (2024)
GoMatching++: Parameter- and Data-Efficient Arbitrary-Shaped Video Text Spotting and Benchmarking
por: He, Haibin, et al.
Publicado: (2025)
por: He, Haibin, et al.
Publicado: (2025)
Do You Need Text Rectification? Soft Attention Mask Embedding for Rectification-Free Scene Text Spotting
por: Colombo, Antonio, et al.
Publicado: (2026)
por: Colombo, Antonio, et al.
Publicado: (2026)
Ensemble Learning for Vietnamese Scene Text Spotting in Urban Environments
por: Nguyen, Hieu, et al.
Publicado: (2024)
por: Nguyen, Hieu, et al.
Publicado: (2024)
When Semantics Mislead Vision: Mitigating Large Multimodal Models Hallucinations in Scene Text Spotting and Understanding
por: Shu, Yan, et al.
Publicado: (2025)
por: Shu, Yan, et al.
Publicado: (2025)
DeepSolo++: Let Transformer Decoder with Explicit Points Solo for Multilingual Text Spotting
por: Ye, Maoyuan, et al.
Publicado: (2023)
por: Ye, Maoyuan, et al.
Publicado: (2023)
GoMatching: A Simple Baseline for Video Text Spotting via Long and Short Term Matching
por: He, Haibin, et al.
Publicado: (2024)
por: He, Haibin, et al.
Publicado: (2024)
Text-Enhanced Panoptic Symbol Spotting in CAD Drawings
por: Liu, Xianlin, et al.
Publicado: (2025)
por: Liu, Xianlin, et al.
Publicado: (2025)
SG-Adapter: Enhancing Text-to-Image Generation with Scene Graph Guidance
por: Shen, Guibao, et al.
Publicado: (2024)
por: Shen, Guibao, et al.
Publicado: (2024)
Block-level Text Spotting with LLMs
por: Bannur, Ganesh, et al.
Publicado: (2024)
por: Bannur, Ganesh, et al.
Publicado: (2024)
AudioScenic: Audio-Driven Video Scene Editing
por: Shen, Kaixin, et al.
Publicado: (2024)
por: Shen, Kaixin, et al.
Publicado: (2024)
DNTextSpotter: Arbitrary-Shaped Scene Text Spotting via Improved Denoising Training
por: Xie, Yu, et al.
Publicado: (2024)
por: Xie, Yu, et al.
Publicado: (2024)
Mamba-Enhanced Text-Audio-Video Alignment Network for Emotion Recognition in Conversations
por: Li, Xinran, et al.
Publicado: (2024)
por: Li, Xinran, et al.
Publicado: (2024)
AV-Unified: A Unified Framework for Audio-visual Scene Understanding
por: Li, Guangyao, et al.
Publicado: (2026)
por: Li, Guangyao, et al.
Publicado: (2026)
Lips Are Lying: Spotting the Temporal Inconsistency between Audio and Visual in Lip-Syncing DeepFakes
por: Liu, Weifeng, et al.
Publicado: (2024)
por: Liu, Weifeng, et al.
Publicado: (2024)
GloTSFormer: Global Video Text Spotting Transformer
por: Wang, Han, et al.
Publicado: (2024)
por: Wang, Han, et al.
Publicado: (2024)
Parrot Captions Teach CLIP to Spot Text
por: Lin, Yiqi, et al.
Publicado: (2023)
por: Lin, Yiqi, et al.
Publicado: (2023)
Watermark Text Pattern Spotting in Document Images
por: Krubiński, Mateusz, et al.
Publicado: (2024)
por: Krubiński, Mateusz, et al.
Publicado: (2024)
Text2NeRF: Text-Driven 3D Scene Generation with Neural Radiance Fields
por: Zhang, Jingbo, et al.
Publicado: (2023)
por: Zhang, Jingbo, et al.
Publicado: (2023)
Unifying Global and Local Scene Entities Modelling for Precise Action Spotting
por: Tran, Kim Hoang, et al.
Publicado: (2024)
por: Tran, Kim Hoang, et al.
Publicado: (2024)
Partial Scene Text Retrieval
por: Wang, Hao, et al.
Publicado: (2024)
por: Wang, Hao, et al.
Publicado: (2024)
Bridging the Gap Between End-to-End and Two-Step Text Spotting
por: Huang, Mingxin, et al.
Publicado: (2024)
por: Huang, Mingxin, et al.
Publicado: (2024)
LOGO: Video Text Spotting with Language Collaboration and Glyph Perception Model
por: Liu, Hongen, et al.
Publicado: (2024)
por: Liu, Hongen, et al.
Publicado: (2024)
TextSculptor: Training and Benchmarking Scene Text Editing
por: Lin, Yiheng, et al.
Publicado: (2026)
por: Lin, Yiheng, et al.
Publicado: (2026)
Hearing Hands: Generating Sounds from Physical Interactions in 3D Scenes
por: Dou, Yiming, et al.
Publicado: (2025)
por: Dou, Yiming, et al.
Publicado: (2025)
Text-Pass Filter: An Efficient Scene Text Detector
por: Yang, Chuang, et al.
Publicado: (2026)
por: Yang, Chuang, et al.
Publicado: (2026)
MELDAE: A Framework for Micro-Expression Spotting, Detection, and Automatic Evaluation in In-the-Wild Conversational Scenes
por: Feng, Yigui, et al.
Publicado: (2025)
por: Feng, Yigui, et al.
Publicado: (2025)
Does Hearing Help Seeing? Investigating Audio-Video Joint Denoising for Video Generation
por: Wu, Jianzong, et al.
Publicado: (2025)
por: Wu, Jianzong, et al.
Publicado: (2025)
SceneTracker: Long-term Scene Flow Estimation Network
por: Wang, Bo, et al.
Publicado: (2024)
por: Wang, Bo, et al.
Publicado: (2024)
AuralSAM2: Enabling SAM2 Hear Through Pyramid Audio-Visual Feature Prompting
por: Liu, Yuyuan, et al.
Publicado: (2025)
por: Liu, Yuyuan, et al.
Publicado: (2025)
Restore Text First, Enhance Image Later: Two-Stage Scene Text Image Super-Resolution with Glyph Structure Guidance
por: Luo, Minxing, et al.
Publicado: (2025)
por: Luo, Minxing, et al.
Publicado: (2025)
Hyper-Local Deformable Transformers for Text Spotting on Historical Maps
por: Lin, Yijun, et al.
Publicado: (2025)
por: Lin, Yijun, et al.
Publicado: (2025)
Ejemplares similares
-
Efficiently Leveraging Linguistic Priors for Scene Text Spotting
por: Nguyen, Nguyen, et al.
Publicado: (2024) -
InstructOCR: Instruction Boosting Scene Text Spotting
por: Duan, Chen, et al.
Publicado: (2024) -
SwinTextSpotter v2: Towards Better Synergy for Scene Text Spotting
por: Huang, Mingxin, et al.
Publicado: (2024) -
Diving into the Depths of Spotting Text in Multi-Domain Noisy Scenes
por: Das, Alloy, et al.
Publicado: (2023) -
FastTextSpotter: A High-Efficiency Transformer for Multilingual Scene Text Spotting
por: Das, Alloy, et al.
Publicado: (2024)