Seeing Text in the Dark: Algorithm and Benchmark
Fuente:
arXiv
Guardado en:
| Autores principales: | Xu, Chengpei, Fu, Hao, Ma, Long, Jia, Wenjing, Zhang, Chengqi, Xia, Feng, Ai, Xiaoyu, Li, Binghao, Zhang, Wenjie |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MorphText: Deep Morphology Regularized Arbitrary-shape Scene Text Detection
por: Xu, Chengpei, et al.
Publicado: (2024)
por: Xu, Chengpei, et al.
Publicado: (2024)
TAVGBench: Benchmarking Text to Audible-Video Generation
por: Mao, Yuxin, et al.
Publicado: (2024)
por: Mao, Yuxin, et al.
Publicado: (2024)
LMM4Edit: Benchmarking and Evaluating Multimodal Image Editing with LMMs
por: Xu, Zitong, et al.
Publicado: (2025)
por: Xu, Zitong, et al.
Publicado: (2025)
Prompt-aware of Frame Sampling for Efficient Text-Video Retrieval
por: Zhang, Deyu, et al.
Publicado: (2025)
por: Zhang, Deyu, et al.
Publicado: (2025)
CBVS: A Large-Scale Chinese Image-Text Benchmark for Real-World Short Video Search Scenarios
por: Qiao, Xiangshuo, et al.
Publicado: (2024)
por: Qiao, Xiangshuo, et al.
Publicado: (2024)
Follow-Your-MultiPose: Tuning-Free Multi-Character Text-to-Video Generation via Pose Guidance
por: Zhang, Beiyuan, et al.
Publicado: (2024)
por: Zhang, Beiyuan, et al.
Publicado: (2024)
Towards Better Dental AI: A Multimodal Benchmark and Instruction Dataset for Panoramic X-ray Analysis
por: Hao, Jing, et al.
Publicado: (2025)
por: Hao, Jing, et al.
Publicado: (2025)
PFB-Diff: Progressive Feature Blending Diffusion for Text-driven Image Editing
por: Huang, Wenjing, et al.
Publicado: (2023)
por: Huang, Wenjing, et al.
Publicado: (2023)
Hand1000: Generating Realistic Hands from Text with Only 1,000 Images
por: Zhang, Haozhuo, et al.
Publicado: (2024)
por: Zhang, Haozhuo, et al.
Publicado: (2024)
TR-DETR: Task-Reciprocal Transformer for Joint Moment Retrieval and Highlight Detection
por: Sun, Hao, et al.
Publicado: (2024)
por: Sun, Hao, et al.
Publicado: (2024)
MagicAnime: A Hierarchically Annotated, Multimodal and Multitasking Dataset with Benchmarks for Cartoon Animation Generation
por: Xu, Shuolin, et al.
Publicado: (2025)
por: Xu, Shuolin, et al.
Publicado: (2025)
TextBraTS: Text-Guided Volumetric Brain Tumor Segmentation with Innovative Dataset Development and Fusion Module Exploration
por: Shi, Xiaoyu, et al.
Publicado: (2025)
por: Shi, Xiaoyu, et al.
Publicado: (2025)
UniPT: Universal Parallel Tuning for Transfer Learning with Efficient Parameter and Memory
por: Diao, Haiwen, et al.
Publicado: (2023)
por: Diao, Haiwen, et al.
Publicado: (2023)
Beyond Walking: A Large-Scale Image-Text Benchmark for Text-based Person Anomaly Search
por: Yang, Shuyu, et al.
Publicado: (2024)
por: Yang, Shuyu, et al.
Publicado: (2024)
Text-Only Data Synthesis for Vision Language Model Training
por: Yu, Xiaomin, et al.
Publicado: (2025)
por: Yu, Xiaomin, et al.
Publicado: (2025)
SHERL: Synthesizing High Accuracy and Efficient Memory for Resource-Limited Transfer Learning
por: Diao, Haiwen, et al.
Publicado: (2024)
por: Diao, Haiwen, et al.
Publicado: (2024)
MMSD3.0: A Multi-Image Benchmark for Real-World Multimodal Sarcasm Detection
por: Zhao, Haochen, et al.
Publicado: (2025)
por: Zhao, Haochen, et al.
Publicado: (2025)
Context Guided Transformer Entropy Modeling for Video Compression
por: Tong, Junlong, et al.
Publicado: (2025)
por: Tong, Junlong, et al.
Publicado: (2025)
HABD: a houma alliance book ancient handwritten character recognition database
por: Yuan, Xiaoyu, et al.
Publicado: (2024)
por: Yuan, Xiaoyu, et al.
Publicado: (2024)
Seeing Culture: A Benchmark for Visual Reasoning and Grounding
por: Satar, Burak, et al.
Publicado: (2025)
por: Satar, Burak, et al.
Publicado: (2025)
Towards Natural Language-Guided Drones: GeoText-1652 Benchmark with Spatial Relation Matching
por: Chu, Meng, et al.
Publicado: (2023)
por: Chu, Meng, et al.
Publicado: (2023)
LongInsightBench: A Comprehensive Benchmark for Evaluating Omni-Modal Models on Human-Centric Long-Video Understanding
por: Han, ZhaoYang, et al.
Publicado: (2025)
por: Han, ZhaoYang, et al.
Publicado: (2025)
G-Refine: A General Quality Refiner for Text-to-Image Generation
por: Li, Chunyi, et al.
Publicado: (2024)
por: Li, Chunyi, et al.
Publicado: (2024)
DanceCamAnimator: Keyframe-Based Controllable 3D Dance Camera Synthesis
por: Wang, Zixuan, et al.
Publicado: (2024)
por: Wang, Zixuan, et al.
Publicado: (2024)
Arena: A Patch-of-Interest ViT Inference Acceleration System for Edge-Assisted Video Analytics
por: Peng, Haosong, et al.
Publicado: (2024)
por: Peng, Haosong, et al.
Publicado: (2024)
PlanMoGPT: Flow-Enhanced Progressive Planning for Text to Motion Synthesis
por: Jin, Chuhao, et al.
Publicado: (2025)
por: Jin, Chuhao, et al.
Publicado: (2025)
SeeingSounds: Learning Audio-to-Visual Alignment via Text
por: Carnemolla, Simone, et al.
Publicado: (2025)
por: Carnemolla, Simone, et al.
Publicado: (2025)
GAOT: Generating Articulated Objects Through Text-Guided Diffusion Models
por: Sun, Hao, et al.
Publicado: (2025)
por: Sun, Hao, et al.
Publicado: (2025)
Revolutionizing Text-to-Image Retrieval as Autoregressive Token-to-Voken Generation
por: Li, Yongqi, et al.
Publicado: (2024)
por: Li, Yongqi, et al.
Publicado: (2024)
HarmonyIQA: Pioneering Benchmark and Model for Image Harmonization Quality Assessment
por: Xu, Zitong, et al.
Publicado: (2025)
por: Xu, Zitong, et al.
Publicado: (2025)
Querying Autonomous Vehicle Point Clouds: Enhanced by 3D Object Counting with CounterNet
por: Zhang, Xiaoyu, et al.
Publicado: (2025)
por: Zhang, Xiaoyu, et al.
Publicado: (2025)
On-the-Fly Object-aware Representative Point Selection in Point Cloud
por: Zhang, Xiaoyu, et al.
Publicado: (2025)
por: Zhang, Xiaoyu, et al.
Publicado: (2025)
A Hierarchical Compression Technique for 3D Gaussian Splatting Compression
por: Huang, He, et al.
Publicado: (2024)
por: Huang, He, et al.
Publicado: (2024)
MOC-3D: Manifold-Order Consistency for Text-to-3D Generation
por: Fan, Chenyang, et al.
Publicado: (2026)
por: Fan, Chenyang, et al.
Publicado: (2026)
Delving Deeper: Hierarchical Visual Perception for Robust Video-Text Retrieval
por: Xie, Zequn, et al.
Publicado: (2026)
por: Xie, Zequn, et al.
Publicado: (2026)
Agent Journey Beyond RGB: Hierarchical Semantic-Spatial Representation Enrichment for Vision-and-Language Navigation
por: Zhang, Xuesong, et al.
Publicado: (2024)
por: Zhang, Xuesong, et al.
Publicado: (2024)
Med-Banana-50K: A Cross-modality Large-Scale Dataset for Text-guided Medical Image Editing
por: Chen, Zhihui, et al.
Publicado: (2025)
por: Chen, Zhihui, et al.
Publicado: (2025)
Hierarchical Action Recognition: A Contrastive Video-Language Approach with Hierarchical Interactions
por: Zhang, Rui, et al.
Publicado: (2024)
por: Zhang, Rui, et al.
Publicado: (2024)
ROGLE: Robust Global-Local Alignment with Automated Region Supervision for Text-Based Person Search
por: Xie, Zequn, et al.
Publicado: (2026)
por: Xie, Zequn, et al.
Publicado: (2026)
Towards Training-free Multimodal Hate Localisation with Large Language Models
por: Sun, Yueming, et al.
Publicado: (2026)
por: Sun, Yueming, et al.
Publicado: (2026)
Ejemplares similares
-
MorphText: Deep Morphology Regularized Arbitrary-shape Scene Text Detection
por: Xu, Chengpei, et al.
Publicado: (2024) -
TAVGBench: Benchmarking Text to Audible-Video Generation
por: Mao, Yuxin, et al.
Publicado: (2024) -
LMM4Edit: Benchmarking and Evaluating Multimodal Image Editing with LMMs
por: Xu, Zitong, et al.
Publicado: (2025) -
Prompt-aware of Frame Sampling for Efficient Text-Video Retrieval
por: Zhang, Deyu, et al.
Publicado: (2025) -
CBVS: A Large-Scale Chinese Image-Text Benchmark for Real-World Short Video Search Scenarios
por: Qiao, Xiangshuo, et al.
Publicado: (2024)