Seeing Text in the Dark: Algorithm and Benchmark
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Xu, Chengpei, Fu, Hao, Ma, Long, Jia, Wenjing, Zhang, Chengqi, Xia, Feng, Ai, Xiaoyu, Li, Binghao, Zhang, Wenjie |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
MorphText: Deep Morphology Regularized Arbitrary-shape Scene Text Detection
von: Xu, Chengpei, et al.
Veröffentlicht: (2024)
von: Xu, Chengpei, et al.
Veröffentlicht: (2024)
TAVGBench: Benchmarking Text to Audible-Video Generation
von: Mao, Yuxin, et al.
Veröffentlicht: (2024)
von: Mao, Yuxin, et al.
Veröffentlicht: (2024)
LMM4Edit: Benchmarking and Evaluating Multimodal Image Editing with LMMs
von: Xu, Zitong, et al.
Veröffentlicht: (2025)
von: Xu, Zitong, et al.
Veröffentlicht: (2025)
Prompt-aware of Frame Sampling for Efficient Text-Video Retrieval
von: Zhang, Deyu, et al.
Veröffentlicht: (2025)
von: Zhang, Deyu, et al.
Veröffentlicht: (2025)
CBVS: A Large-Scale Chinese Image-Text Benchmark for Real-World Short Video Search Scenarios
von: Qiao, Xiangshuo, et al.
Veröffentlicht: (2024)
von: Qiao, Xiangshuo, et al.
Veröffentlicht: (2024)
Follow-Your-MultiPose: Tuning-Free Multi-Character Text-to-Video Generation via Pose Guidance
von: Zhang, Beiyuan, et al.
Veröffentlicht: (2024)
von: Zhang, Beiyuan, et al.
Veröffentlicht: (2024)
Towards Better Dental AI: A Multimodal Benchmark and Instruction Dataset for Panoramic X-ray Analysis
von: Hao, Jing, et al.
Veröffentlicht: (2025)
von: Hao, Jing, et al.
Veröffentlicht: (2025)
PFB-Diff: Progressive Feature Blending Diffusion for Text-driven Image Editing
von: Huang, Wenjing, et al.
Veröffentlicht: (2023)
von: Huang, Wenjing, et al.
Veröffentlicht: (2023)
Hand1000: Generating Realistic Hands from Text with Only 1,000 Images
von: Zhang, Haozhuo, et al.
Veröffentlicht: (2024)
von: Zhang, Haozhuo, et al.
Veröffentlicht: (2024)
TR-DETR: Task-Reciprocal Transformer for Joint Moment Retrieval and Highlight Detection
von: Sun, Hao, et al.
Veröffentlicht: (2024)
von: Sun, Hao, et al.
Veröffentlicht: (2024)
MagicAnime: A Hierarchically Annotated, Multimodal and Multitasking Dataset with Benchmarks for Cartoon Animation Generation
von: Xu, Shuolin, et al.
Veröffentlicht: (2025)
von: Xu, Shuolin, et al.
Veröffentlicht: (2025)
TextBraTS: Text-Guided Volumetric Brain Tumor Segmentation with Innovative Dataset Development and Fusion Module Exploration
von: Shi, Xiaoyu, et al.
Veröffentlicht: (2025)
von: Shi, Xiaoyu, et al.
Veröffentlicht: (2025)
UniPT: Universal Parallel Tuning for Transfer Learning with Efficient Parameter and Memory
von: Diao, Haiwen, et al.
Veröffentlicht: (2023)
von: Diao, Haiwen, et al.
Veröffentlicht: (2023)
Beyond Walking: A Large-Scale Image-Text Benchmark for Text-based Person Anomaly Search
von: Yang, Shuyu, et al.
Veröffentlicht: (2024)
von: Yang, Shuyu, et al.
Veröffentlicht: (2024)
Text-Only Data Synthesis for Vision Language Model Training
von: Yu, Xiaomin, et al.
Veröffentlicht: (2025)
von: Yu, Xiaomin, et al.
Veröffentlicht: (2025)
SHERL: Synthesizing High Accuracy and Efficient Memory for Resource-Limited Transfer Learning
von: Diao, Haiwen, et al.
Veröffentlicht: (2024)
von: Diao, Haiwen, et al.
Veröffentlicht: (2024)
MMSD3.0: A Multi-Image Benchmark for Real-World Multimodal Sarcasm Detection
von: Zhao, Haochen, et al.
Veröffentlicht: (2025)
von: Zhao, Haochen, et al.
Veröffentlicht: (2025)
Context Guided Transformer Entropy Modeling for Video Compression
von: Tong, Junlong, et al.
Veröffentlicht: (2025)
von: Tong, Junlong, et al.
Veröffentlicht: (2025)
HABD: a houma alliance book ancient handwritten character recognition database
von: Yuan, Xiaoyu, et al.
Veröffentlicht: (2024)
von: Yuan, Xiaoyu, et al.
Veröffentlicht: (2024)
Seeing Culture: A Benchmark for Visual Reasoning and Grounding
von: Satar, Burak, et al.
Veröffentlicht: (2025)
von: Satar, Burak, et al.
Veröffentlicht: (2025)
Towards Natural Language-Guided Drones: GeoText-1652 Benchmark with Spatial Relation Matching
von: Chu, Meng, et al.
Veröffentlicht: (2023)
von: Chu, Meng, et al.
Veröffentlicht: (2023)
LongInsightBench: A Comprehensive Benchmark for Evaluating Omni-Modal Models on Human-Centric Long-Video Understanding
von: Han, ZhaoYang, et al.
Veröffentlicht: (2025)
von: Han, ZhaoYang, et al.
Veröffentlicht: (2025)
G-Refine: A General Quality Refiner for Text-to-Image Generation
von: Li, Chunyi, et al.
Veröffentlicht: (2024)
von: Li, Chunyi, et al.
Veröffentlicht: (2024)
DanceCamAnimator: Keyframe-Based Controllable 3D Dance Camera Synthesis
von: Wang, Zixuan, et al.
Veröffentlicht: (2024)
von: Wang, Zixuan, et al.
Veröffentlicht: (2024)
Arena: A Patch-of-Interest ViT Inference Acceleration System for Edge-Assisted Video Analytics
von: Peng, Haosong, et al.
Veröffentlicht: (2024)
von: Peng, Haosong, et al.
Veröffentlicht: (2024)
PlanMoGPT: Flow-Enhanced Progressive Planning for Text to Motion Synthesis
von: Jin, Chuhao, et al.
Veröffentlicht: (2025)
von: Jin, Chuhao, et al.
Veröffentlicht: (2025)
SeeingSounds: Learning Audio-to-Visual Alignment via Text
von: Carnemolla, Simone, et al.
Veröffentlicht: (2025)
von: Carnemolla, Simone, et al.
Veröffentlicht: (2025)
GAOT: Generating Articulated Objects Through Text-Guided Diffusion Models
von: Sun, Hao, et al.
Veröffentlicht: (2025)
von: Sun, Hao, et al.
Veröffentlicht: (2025)
Revolutionizing Text-to-Image Retrieval as Autoregressive Token-to-Voken Generation
von: Li, Yongqi, et al.
Veröffentlicht: (2024)
von: Li, Yongqi, et al.
Veröffentlicht: (2024)
HarmonyIQA: Pioneering Benchmark and Model for Image Harmonization Quality Assessment
von: Xu, Zitong, et al.
Veröffentlicht: (2025)
von: Xu, Zitong, et al.
Veröffentlicht: (2025)
Querying Autonomous Vehicle Point Clouds: Enhanced by 3D Object Counting with CounterNet
von: Zhang, Xiaoyu, et al.
Veröffentlicht: (2025)
von: Zhang, Xiaoyu, et al.
Veröffentlicht: (2025)
On-the-Fly Object-aware Representative Point Selection in Point Cloud
von: Zhang, Xiaoyu, et al.
Veröffentlicht: (2025)
von: Zhang, Xiaoyu, et al.
Veröffentlicht: (2025)
A Hierarchical Compression Technique for 3D Gaussian Splatting Compression
von: Huang, He, et al.
Veröffentlicht: (2024)
von: Huang, He, et al.
Veröffentlicht: (2024)
MOC-3D: Manifold-Order Consistency for Text-to-3D Generation
von: Fan, Chenyang, et al.
Veröffentlicht: (2026)
von: Fan, Chenyang, et al.
Veröffentlicht: (2026)
Delving Deeper: Hierarchical Visual Perception for Robust Video-Text Retrieval
von: Xie, Zequn, et al.
Veröffentlicht: (2026)
von: Xie, Zequn, et al.
Veröffentlicht: (2026)
Agent Journey Beyond RGB: Hierarchical Semantic-Spatial Representation Enrichment for Vision-and-Language Navigation
von: Zhang, Xuesong, et al.
Veröffentlicht: (2024)
von: Zhang, Xuesong, et al.
Veröffentlicht: (2024)
Med-Banana-50K: A Cross-modality Large-Scale Dataset for Text-guided Medical Image Editing
von: Chen, Zhihui, et al.
Veröffentlicht: (2025)
von: Chen, Zhihui, et al.
Veröffentlicht: (2025)
Hierarchical Action Recognition: A Contrastive Video-Language Approach with Hierarchical Interactions
von: Zhang, Rui, et al.
Veröffentlicht: (2024)
von: Zhang, Rui, et al.
Veröffentlicht: (2024)
ROGLE: Robust Global-Local Alignment with Automated Region Supervision for Text-Based Person Search
von: Xie, Zequn, et al.
Veröffentlicht: (2026)
von: Xie, Zequn, et al.
Veröffentlicht: (2026)
Towards Training-free Multimodal Hate Localisation with Large Language Models
von: Sun, Yueming, et al.
Veröffentlicht: (2026)
von: Sun, Yueming, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
MorphText: Deep Morphology Regularized Arbitrary-shape Scene Text Detection
von: Xu, Chengpei, et al.
Veröffentlicht: (2024) -
TAVGBench: Benchmarking Text to Audible-Video Generation
von: Mao, Yuxin, et al.
Veröffentlicht: (2024) -
LMM4Edit: Benchmarking and Evaluating Multimodal Image Editing with LMMs
von: Xu, Zitong, et al.
Veröffentlicht: (2025) -
Prompt-aware of Frame Sampling for Efficient Text-Video Retrieval
von: Zhang, Deyu, et al.
Veröffentlicht: (2025) -
CBVS: A Large-Scale Chinese Image-Text Benchmark for Real-World Short Video Search Scenarios
von: Qiao, Xiangshuo, et al.
Veröffentlicht: (2024)