Guardado en:
| Autores principales: | Wang, Jiawei, Zhang, Shunchi, Hu, Kai, Ma, Chixiang, Zhong, Zhuoyao, Sun, Lei, Huo, Qiang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2401.09232 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Detect-Order-Construct: A Tree Construction based Approach for Hierarchical Document Structure Analysis
por: Wang, Jiawei, et al.
Publicado: (2024)
por: Wang, Jiawei, et al.
Publicado: (2024)
DLAFormer: An End-to-End Transformer For Document Layout Analysis
por: Wang, Jiawei, et al.
Publicado: (2024)
por: Wang, Jiawei, et al.
Publicado: (2024)
UniHDSA: A Unified Relation Prediction Approach for Hierarchical Document Structure Analysis
por: Wang, Jiawei, et al.
Publicado: (2025)
por: Wang, Jiawei, et al.
Publicado: (2025)
Aligning Information Capacity Between Vision and Language via Dense-to-Sparse Feature Distillation for Image-Text Matching
por: Liu, Yang, et al.
Publicado: (2025)
por: Liu, Yang, et al.
Publicado: (2025)
Explicit Relational Reasoning Network for Scene Text Detection
por: Su, Yuchen, et al.
Publicado: (2024)
por: Su, Yuchen, et al.
Publicado: (2024)
Towards Accurate Post-Training Quantization of Vision Transformers via Error Reduction
por: Zhong, Yunshan, et al.
Publicado: (2024)
por: Zhong, Yunshan, et al.
Publicado: (2024)
Mr. DETR++: Instructive Multi-Route Training for Detection Transformers with Mixture-of-Experts
por: Zhang, Chang-Bin, et al.
Publicado: (2024)
por: Zhang, Chang-Bin, et al.
Publicado: (2024)
Text-Guided Mixup Towards Long-Tailed Image Categorization
por: Franklin, Richard, et al.
Publicado: (2024)
por: Franklin, Richard, et al.
Publicado: (2024)
A Dynamic Transformer Network for Vehicle Detection
por: Tian, Chunwei, et al.
Publicado: (2025)
por: Tian, Chunwei, et al.
Publicado: (2025)
PCSR: Pseudo-label Consistency-Guided Sample Refinement for Noisy Correspondence Learning
por: Liu, Zhuoyao, et al.
Publicado: (2025)
por: Liu, Zhuoyao, et al.
Publicado: (2025)
Image-to-Image Translation with Diffusion Transformers and CLIP-Based Image Conditioning
por: Zhu, Qiang, et al.
Publicado: (2025)
por: Zhu, Qiang, et al.
Publicado: (2025)
YOLO-FDA: Integrating Hierarchical Attention and Detail Enhancement for Surface Defect Detection
por: Hu, Jiawei
Publicado: (2025)
por: Hu, Jiawei
Publicado: (2025)
Rethinking Structure Preservation in Text-Guided Image Editing with Visual Autoregressive Models
por: Xia, Tao, et al.
Publicado: (2026)
por: Xia, Tao, et al.
Publicado: (2026)
Dynamic and Compressive Adaptation of Transformers From Images to Videos
por: Zhang, Guozhen, et al.
Publicado: (2024)
por: Zhang, Guozhen, et al.
Publicado: (2024)
Aggregated Text Transformer for Scene Text Detection
por: Zhou, Zhao, et al.
Publicado: (2022)
por: Zhou, Zhao, et al.
Publicado: (2022)
Constrained Dynamic Gaussian Splatting
por: Zheng, Zihan, et al.
Publicado: (2026)
por: Zheng, Zihan, et al.
Publicado: (2026)
Controllable-LPMoE: Adapting to Challenging Object Segmentation via Dynamic Local Priors from Mixture-of-Experts
por: Sun, Yanguang, et al.
Publicado: (2025)
por: Sun, Yanguang, et al.
Publicado: (2025)
OCFER-Net: Recognizing Facial Expression in Online Learning System
por: Huo, Yi, et al.
Publicado: (2025)
por: Huo, Yi, et al.
Publicado: (2025)
RTGen: Generating Region-Text Pairs for Open-Vocabulary Object Detection
por: Chen, Fangyi, et al.
Publicado: (2024)
por: Chen, Fangyi, et al.
Publicado: (2024)
FreeText: Training-Free Text Rendering in Diffusion Transformers via Attention Localization and Spectral Glyph Injection
por: Zhang, Ruiqiang, et al.
Publicado: (2026)
por: Zhang, Ruiqiang, et al.
Publicado: (2026)
Lane Departure Accident Prevention in Foggy Conditions: A Prior-Guided Dynamic Feature Fusion Transformer Framework for Real-Time Lane Detection
por: Zhang, Ronghui, et al.
Publicado: (2025)
por: Zhang, Ronghui, et al.
Publicado: (2025)
CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder
por: Ma, Lichen, et al.
Publicado: (2024)
por: Ma, Lichen, et al.
Publicado: (2024)
TextBlockV2: Towards Precise-Detection-Free Scene Text Spotting with Pre-trained Language Model
por: Lyu, Jiahao, et al.
Publicado: (2024)
por: Lyu, Jiahao, et al.
Publicado: (2024)
VideoDirector: Precise Video Editing via Text-to-Video Models
por: Wang, Yukun, et al.
Publicado: (2024)
por: Wang, Yukun, et al.
Publicado: (2024)
Text-DiFuse: An Interactive Multi-Modal Image Fusion Framework based on Text-modulated Diffusion Model
por: Zhang, Hao, et al.
Publicado: (2024)
por: Zhang, Hao, et al.
Publicado: (2024)
MANTA: A Large-Scale Multi-View and Visual-Text Anomaly Detection Dataset for Tiny Objects
por: Fan, Lei, et al.
Publicado: (2024)
por: Fan, Lei, et al.
Publicado: (2024)
SemGeoMo: Dynamic Contextual Human Motion Generation with Semantic and Geometric Guidance
por: Cong, Peishan, et al.
Publicado: (2025)
por: Cong, Peishan, et al.
Publicado: (2025)
MultiColor: Image Colorization by Learning from Multiple Color Spaces
por: Du, Xiangcheng, et al.
Publicado: (2024)
por: Du, Xiangcheng, et al.
Publicado: (2024)
Layer-wise Instance Binding for Regional and Occlusion Control in Text-to-Image Diffusion Transformers
por: Chen, Ruidong, et al.
Publicado: (2026)
por: Chen, Ruidong, et al.
Publicado: (2026)
Exploiting Inter-sample and Inter-feature Relations in Dataset Distillation
por: Deng, Wenxiao, et al.
Publicado: (2024)
por: Deng, Wenxiao, et al.
Publicado: (2024)
Dynamic Attention Analysis for Backdoor Detection in Text-to-Image Diffusion Models
por: Wang, Zhongqi, et al.
Publicado: (2025)
por: Wang, Zhongqi, et al.
Publicado: (2025)
FLUX-Text: A Simple and Advanced Diffusion Transformer Baseline for Scene Text Editing
por: Lan, Rui, et al.
Publicado: (2025)
por: Lan, Rui, et al.
Publicado: (2025)
Length Matters: Length-Aware Transformer for Temporal Sentence Grounding
por: Wang, Yifan, et al.
Publicado: (2025)
por: Wang, Yifan, et al.
Publicado: (2025)
Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition
por: Lin, Tiancheng, et al.
Publicado: (2024)
por: Lin, Tiancheng, et al.
Publicado: (2024)
Block-level Text Spotting with LLMs
por: Bannur, Ganesh, et al.
Publicado: (2024)
por: Bannur, Ganesh, et al.
Publicado: (2024)
Task-Aware Dynamic Transformer for Efficient Arbitrary-Scale Image Super-Resolution
por: Xu, Tianyi, et al.
Publicado: (2024)
por: Xu, Tianyi, et al.
Publicado: (2024)
Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning
por: Zhang, Haoji, et al.
Publicado: (2025)
por: Zhang, Haoji, et al.
Publicado: (2025)
Dynamic Diffusion Transformer
por: Zhao, Wangbo, et al.
Publicado: (2024)
por: Zhao, Wangbo, et al.
Publicado: (2024)
Contrastive Learning-Driven Traffic Sign Perception: Multi-Modal Fusion of Text and Vision
por: Lu, Qiang, et al.
Publicado: (2025)
por: Lu, Qiang, et al.
Publicado: (2025)
PointMT: Efficient Point Cloud Analysis with Hybrid MLP-Transformer Architecture
por: Zheng, Qiang, et al.
Publicado: (2024)
por: Zheng, Qiang, et al.
Publicado: (2024)
Ejemplares similares
-
Detect-Order-Construct: A Tree Construction based Approach for Hierarchical Document Structure Analysis
por: Wang, Jiawei, et al.
Publicado: (2024) -
DLAFormer: An End-to-End Transformer For Document Layout Analysis
por: Wang, Jiawei, et al.
Publicado: (2024) -
UniHDSA: A Unified Relation Prediction Approach for Hierarchical Document Structure Analysis
por: Wang, Jiawei, et al.
Publicado: (2025) -
Aligning Information Capacity Between Vision and Language via Dense-to-Sparse Feature Distillation for Image-Text Matching
por: Liu, Yang, et al.
Publicado: (2025) -
Explicit Relational Reasoning Network for Scene Text Detection
por: Su, Yuchen, et al.
Publicado: (2024)