Salvato in:
| Autori principali: | Luo, Yang, Chen, Zhineng, Zhou, Peng, Wu, Zuxuan, Gao, Xieping, Jiang, Yu-Gang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2404.00680 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Out of Length Text Recognition with Sub-String Matching
di: Du, Yongkun, et al.
Pubblicazione: (2024)
di: Du, Yongkun, et al.
Pubblicazione: (2024)
LRANet++: Low-Rank Approximation Network for Accurate and Efficient Text Spotting
di: Su, Yuchen, et al.
Pubblicazione: (2025)
di: Su, Yuchen, et al.
Pubblicazione: (2025)
Distilling Knowledge from Heterogeneous Architectures for Semantic Segmentation
di: Huang, Yanglin, et al.
Pubblicazione: (2025)
di: Huang, Yanglin, et al.
Pubblicazione: (2025)
DreamMesh: Jointly Manipulating and Texturing Triangle Meshes for Text-to-3D Generation
di: Yang, Haibo, et al.
Pubblicazione: (2024)
di: Yang, Haibo, et al.
Pubblicazione: (2024)
Explicit Relational Reasoning Network for Scene Text Detection
di: Su, Yuchen, et al.
Pubblicazione: (2024)
di: Su, Yuchen, et al.
Pubblicazione: (2024)
Learning Accurate Segmentation Purely from Self-Supervision
di: You, Zuyao, et al.
Pubblicazione: (2026)
di: You, Zuyao, et al.
Pubblicazione: (2026)
CaTok: Taming Mean Flows for One-Dimensional Causal Image Tokenization
di: Chen, Yitong, et al.
Pubblicazione: (2026)
di: Chen, Yitong, et al.
Pubblicazione: (2026)
OmniTokenizer: A Joint Image-Video Tokenizer for Visual Generation
di: Wang, Junke, et al.
Pubblicazione: (2024)
di: Wang, Junke, et al.
Pubblicazione: (2024)
LRANet: Towards Accurate and Efficient Scene Text Detection with Low-Rank Approximation Network
di: Su, Yuchen, et al.
Pubblicazione: (2023)
di: Su, Yuchen, et al.
Pubblicazione: (2023)
CoMP: Continual Multimodal Pre-training for Vision Foundation Models
di: Chen, Yitong, et al.
Pubblicazione: (2025)
di: Chen, Yitong, et al.
Pubblicazione: (2025)
FreeEnhance: Tuning-Free Image Enhancement via Content-Consistent Noising-and-Denoising Process
di: Luo, Yang, et al.
Pubblicazione: (2024)
di: Luo, Yang, et al.
Pubblicazione: (2024)
Adaptive Retention & Correction: Test-Time Training for Continual Learning
di: Chen, Haoran, et al.
Pubblicazione: (2024)
di: Chen, Haoran, et al.
Pubblicazione: (2024)
Decoder Pre-Training with only Text for Scene Text Recognition
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
PromptFusion: Decoupling Stability and Plasticity for Continual Learning
di: Chen, Haoran, et al.
Pubblicazione: (2023)
di: Chen, Haoran, et al.
Pubblicazione: (2023)
Beyond Degradation Redundancy: Contrastive Prompt Learning for All-in-One Image Restoration
di: Wu, Gang, et al.
Pubblicazione: (2025)
di: Wu, Gang, et al.
Pubblicazione: (2025)
Multi-Prompt Alignment for Multi-Source Unsupervised Domain Adaptation
di: Chen, Haoran, et al.
Pubblicazione: (2022)
di: Chen, Haoran, et al.
Pubblicazione: (2022)
Achieving More with Less: Additive Prompt Tuning for Rehearsal-Free Class-Incremental Learning
di: Chen, Haoran, et al.
Pubblicazione: (2025)
di: Chen, Haoran, et al.
Pubblicazione: (2025)
Patch Ranking: Efficient CLIP by Learning to Rank Local Patches
di: Wu, Cheng-En, et al.
Pubblicazione: (2024)
di: Wu, Cheng-En, et al.
Pubblicazione: (2024)
GeoGS3D: Single-view 3D Reconstruction via Geometric-aware Diffusion Model and Gaussian Splatting
di: Feng, Qijun, et al.
Pubblicazione: (2024)
di: Feng, Qijun, et al.
Pubblicazione: (2024)
Attention Itself Could Retrieve.RetrieveVGGT: Training-Free Long Context Streaming 3D Reconstruction via Query-Key Similarity Retrieval
di: Zou, Zichen, et al.
Pubblicazione: (2026)
di: Zou, Zichen, et al.
Pubblicazione: (2026)
Daily-Omni: Towards Audio-Visual Reasoning with Temporal Alignment across Modalities
di: Zhou, Ziwei, et al.
Pubblicazione: (2025)
di: Zhou, Ziwei, et al.
Pubblicazione: (2025)
SVTRv2: CTC Beats Encoder-Decoder Models in Scene Text Recognition
di: Du, Yongkun, et al.
Pubblicazione: (2024)
di: Du, Yongkun, et al.
Pubblicazione: (2024)
Instruction-Guided Scene Text Recognition
di: Du, Yongkun, et al.
Pubblicazione: (2024)
di: Du, Yongkun, et al.
Pubblicazione: (2024)
GenRec: Unifying Video Generation and Recognition with Diffusion Models
di: Weng, Zejia, et al.
Pubblicazione: (2024)
di: Weng, Zejia, et al.
Pubblicazione: (2024)
Efficient Redundancy Reduction for Open-Vocabulary Semantic Segmentation
di: Chen, Lin, et al.
Pubblicazione: (2025)
di: Chen, Lin, et al.
Pubblicazione: (2025)
Multi-Prompt Progressive Alignment for Multi-Source Unsupervised Domain Adaptation
di: Chen, Haoran, et al.
Pubblicazione: (2025)
di: Chen, Haoran, et al.
Pubblicazione: (2025)
UniGen-1.5: Enhancing Image Generation and Editing through Reward Unification in Reinforcement Learning
di: Tian, Rui, et al.
Pubblicazione: (2025)
di: Tian, Rui, et al.
Pubblicazione: (2025)
Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization
di: Liu, Zhuohan, et al.
Pubblicazione: (2026)
di: Liu, Zhuohan, et al.
Pubblicazione: (2026)
AdvQDet: Detecting Query-Based Adversarial Attacks with Adversarial Contrastive Prompt Tuning
di: Wang, Xin, et al.
Pubblicazione: (2024)
di: Wang, Xin, et al.
Pubblicazione: (2024)
CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation
di: Zhang, Hui, et al.
Pubblicazione: (2024)
di: Zhang, Hui, et al.
Pubblicazione: (2024)
OmniVid: A Generative Framework for Universal Video Understanding
di: Wang, Junke, et al.
Pubblicazione: (2024)
di: Wang, Junke, et al.
Pubblicazione: (2024)
OmniTracker: Unifying Object Tracking by Tracking-with-Detection
di: Wang, Junke, et al.
Pubblicazione: (2023)
di: Wang, Junke, et al.
Pubblicazione: (2023)
DeepStack: Deeply Stacking Visual Tokens is Surprisingly Simple and Effective for LMMs
di: Meng, Lingchen, et al.
Pubblicazione: (2024)
di: Meng, Lingchen, et al.
Pubblicazione: (2024)
Comprehensive Multi-Modal Prototypes are Simple and Effective Classifiers for Vast-Vocabulary Object Detection
di: Chen, Yitong, et al.
Pubblicazione: (2024)
di: Chen, Yitong, et al.
Pubblicazione: (2024)
ArcFlow: Unleashing 2-Step Text-to-Image Generation via High-Precision Non-Linear Flow Distillation
di: Yang, Zihan, et al.
Pubblicazione: (2026)
di: Yang, Zihan, et al.
Pubblicazione: (2026)
ForgerySleuth: Empowering Multimodal Large Language Models for Image Manipulation Detection
di: Sun, Zhihao, et al.
Pubblicazione: (2024)
di: Sun, Zhihao, et al.
Pubblicazione: (2024)
BadPatch: Diffusion-Based Generation of Physical Adversarial Patches
di: Wang, Zhixiang, et al.
Pubblicazione: (2024)
di: Wang, Zhixiang, et al.
Pubblicazione: (2024)
DiffusionAD: Norm-guided One-step Denoising Diffusion for Anomaly Detection
di: Zhang, Hui, et al.
Pubblicazione: (2023)
di: Zhang, Hui, et al.
Pubblicazione: (2023)
MDiff4STR: Mask Diffusion Model for Scene Text Recognition
di: Du, Yongkun, et al.
Pubblicazione: (2025)
di: Du, Yongkun, et al.
Pubblicazione: (2025)
WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing
di: Zhang, Hui, et al.
Pubblicazione: (2026)
di: Zhang, Hui, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Out of Length Text Recognition with Sub-String Matching
di: Du, Yongkun, et al.
Pubblicazione: (2024) -
LRANet++: Low-Rank Approximation Network for Accurate and Efficient Text Spotting
di: Su, Yuchen, et al.
Pubblicazione: (2025) -
Distilling Knowledge from Heterogeneous Architectures for Semantic Segmentation
di: Huang, Yanglin, et al.
Pubblicazione: (2025) -
DreamMesh: Jointly Manipulating and Texturing Triangle Meshes for Text-to-3D Generation
di: Yang, Haibo, et al.
Pubblicazione: (2024) -
Explicit Relational Reasoning Network for Scene Text Detection
di: Su, Yuchen, et al.
Pubblicazione: (2024)