Enregistré dans:
| Auteurs principaux: | Long, Rujiao, Xing, Hangdi, Yang, Zhibo, Zheng, Qi, Yu, Zhi, Yao, Cong, Huang, Fei |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2401.01522 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
HIP: Hierarchical Point Modeling and Pre-training for Visual Information Extraction
par: Long, Rujiao, et autres
Publié: (2024)
par: Long, Rujiao, et autres
Publié: (2024)
WebRPG: Automatic Web Rendering Parameters Generation for Visual Presentation
par: Shao, Zirui, et autres
Publié: (2024)
par: Shao, Zirui, et autres
Publié: (2024)
OmniParser: A Unified Framework for Text Spotting, Key Information Extraction and Table Recognition
par: Wan, Jianqiang, et autres
Publié: (2024)
par: Wan, Jianqiang, et autres
Publié: (2024)
A Simple yet Effective Layout Token in Large Language Models for Document Understanding
par: Zhu, Zhaoqing, et autres
Publié: (2025)
par: Zhu, Zhaoqing, et autres
Publié: (2025)
Robust Fine-tuning for Pre-trained 3D Point Cloud Models
par: Zhang, Zhibo, et autres
Publié: (2024)
par: Zhang, Zhibo, et autres
Publié: (2024)
LORE: Lagrangian-Optimized Robust Embeddings for Visual Encoders
par: Khodabandeh, Borna, et autres
Publié: (2025)
par: Khodabandeh, Borna, et autres
Publié: (2025)
Revisiting Continual Semantic Segmentation with Pre-trained Vision Models
par: Zhang, Duzhen, et autres
Publié: (2025)
par: Zhang, Duzhen, et autres
Publié: (2025)
Platypus: A Generalized Specialist Model for Reading Text in Various Forms
par: Wang, Peng, et autres
Publié: (2024)
par: Wang, Peng, et autres
Publié: (2024)
SepFormer: Coarse-to-fine Separator Regression Network for Table Structure Recognition
par: Nguyen, Nam Quan, et autres
Publié: (2025)
par: Nguyen, Nam Quan, et autres
Publié: (2025)
HierCode: A Lightweight Hierarchical Codebook for Zero-shot Chinese Text Recognition
par: Zhang, Yuyi, et autres
Publié: (2024)
par: Zhang, Yuyi, et autres
Publié: (2024)
LORE: Latent Optimization for Precise Semantic Control in Rectified Flow-based Image Editing
par: Ouyang, Liangyang, et autres
Publié: (2025)
par: Ouyang, Liangyang, et autres
Publié: (2025)
Fake It Right: Injecting Anatomical Logic into Synthetic Supervised Pre-training for Medical Segmentation
par: Tang, Jiaqi, et autres
Publié: (2026)
par: Tang, Jiaqi, et autres
Publié: (2026)
Let ViT Speak: Generative Language-Image Pre-training
par: Fang, Yan, et autres
Publié: (2026)
par: Fang, Yan, et autres
Publié: (2026)
Long-Tailed Recognition on Binary Networks by Calibrating A Pre-trained Model
par: Kim, Jihun, et autres
Publié: (2024)
par: Kim, Jihun, et autres
Publié: (2024)
Micro-Expression Recognition by Motion Feature Extraction based on Pre-training
par: Li, Ruolin, et autres
Publié: (2024)
par: Li, Ruolin, et autres
Publié: (2024)
MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models
par: Zhang, Peng-Fei, et autres
Publié: (2025)
par: Zhang, Peng-Fei, et autres
Publié: (2025)
Deep Radar Inverse Sensor Models for Dynamic Occupancy Grid Maps
par: Wei, Zihang, et autres
Publié: (2023)
par: Wei, Zihang, et autres
Publié: (2023)
Self-Supervised Pre-Training for Table Structure Recognition Transformer
par: Peng, ShengYun, et autres
Publié: (2024)
par: Peng, ShengYun, et autres
Publié: (2024)
LayoutLLM: Layout Instruction Tuning with Large Language Models for Document Understanding
par: Luo, Chuwei, et autres
Publié: (2024)
par: Luo, Chuwei, et autres
Publié: (2024)
Visual Text Generation in the Wild
par: Zhu, Yuanzhi, et autres
Publié: (2024)
par: Zhu, Yuanzhi, et autres
Publié: (2024)
CoF: Coarse to Fine-Grained Image Understanding for Multi-modal Large Language Models
par: Wang, Yeyuan, et autres
Publié: (2024)
par: Wang, Yeyuan, et autres
Publié: (2024)
Universal Adversarial Perturbations for Vision-Language Pre-trained Models
par: Zhang, Peng-Fei, et autres
Publié: (2024)
par: Zhang, Peng-Fei, et autres
Publié: (2024)
Stylized Structural Patterns for Improved Neural Network Pre-training
par: Salehi, Farnood, et autres
Publié: (2025)
par: Salehi, Farnood, et autres
Publié: (2025)
Pre-training for Action Recognition with Automatically Generated Fractal Datasets
par: Svyezhentsev, Davyd, et autres
Publié: (2024)
par: Svyezhentsev, Davyd, et autres
Publié: (2024)
IPAD: Iterative, Parallel, and Diffusion-based Network for Scene Text Recognition
par: Yang, Xiaomeng, et autres
Publié: (2023)
par: Yang, Xiaomeng, et autres
Publié: (2023)
A Foundation Model for DAS Signal Recognition and Visual Prompt Tuning of the Pre-trained Model for Downstream Tasks
par: Gui, Kun, et autres
Publié: (2025)
par: Gui, Kun, et autres
Publié: (2025)
Multi-modal Multi-task Pre-training for Improved Point Cloud Understanding
par: Liu, Liwen, et autres
Publié: (2025)
par: Liu, Liwen, et autres
Publié: (2025)
Enhancing Pre-trained Representation Classifiability can Boost its Interpretability
par: Shen, Shufan, et autres
Publié: (2025)
par: Shen, Shufan, et autres
Publié: (2025)
Sparse Reasoning is Enough: Biological-Inspired Framework for Video Anomaly Detection with Large Pre-trained Models
par: Huang, He, et autres
Publié: (2025)
par: Huang, He, et autres
Publié: (2025)
ASPO: Adaptive Sentence-Level Preference Optimization for Fine-Grained Multimodal Reasoning
par: Wang, Yeyuan, et autres
Publié: (2025)
par: Wang, Yeyuan, et autres
Publié: (2025)
Accelerating Pre-training of Multimodal LLMs via Chain-of-Sight
par: Huang, Ziyuan, et autres
Publié: (2024)
par: Huang, Ziyuan, et autres
Publié: (2024)
Logos as a Well-Tempered Pre-train for Sign Language Recognition
par: Ovodov, Ilya, et autres
Publié: (2025)
par: Ovodov, Ilya, et autres
Publié: (2025)
AdFair-CLIP: Adversarial Fair Contrastive Language-Image Pre-training for Chest X-rays
par: Yi, Chenlang, et autres
Publié: (2025)
par: Yi, Chenlang, et autres
Publié: (2025)
GLID: Pre-training a Generalist Encoder-Decoder Vision Model
par: Liu, Jihao, et autres
Publié: (2024)
par: Liu, Jihao, et autres
Publié: (2024)
Downstream Transfer Attack: Adversarial Attacks on Downstream Models with Pre-trained Vision Transformers
par: Zheng, Weijie, et autres
Publié: (2024)
par: Zheng, Weijie, et autres
Publié: (2024)
ProcTag: Process Tagging for Assessing the Efficacy of Document Instruction Data
par: Shen, Yufan, et autres
Publié: (2024)
par: Shen, Yufan, et autres
Publié: (2024)
SR-Stereo & DAPE: Stepwise Regression and Pre-trained Edges for Practical Stereo Matching
par: Xiao, Weiqing, et autres
Publié: (2024)
par: Xiao, Weiqing, et autres
Publié: (2024)
Towards Seamless Adaptation of Pre-trained Models for Visual Place Recognition
par: Lu, Feng, et autres
Publié: (2024)
par: Lu, Feng, et autres
Publié: (2024)
Self-Supervised Pre-training with Symmetric Superimposition Modeling for Scene Text Recognition
par: Gao, Zuan, et autres
Publié: (2024)
par: Gao, Zuan, et autres
Publié: (2024)
BRAVEn: Improving Self-Supervised Pre-training for Visual and Auditory Speech Recognition
par: Haliassos, Alexandros, et autres
Publié: (2024)
par: Haliassos, Alexandros, et autres
Publié: (2024)
Documents similaires
-
HIP: Hierarchical Point Modeling and Pre-training for Visual Information Extraction
par: Long, Rujiao, et autres
Publié: (2024) -
WebRPG: Automatic Web Rendering Parameters Generation for Visual Presentation
par: Shao, Zirui, et autres
Publié: (2024) -
OmniParser: A Unified Framework for Text Spotting, Key Information Extraction and Table Recognition
par: Wan, Jianqiang, et autres
Publié: (2024) -
A Simple yet Effective Layout Token in Large Language Models for Document Understanding
par: Zhu, Zhaoqing, et autres
Publié: (2025) -
Robust Fine-tuning for Pre-trained 3D Point Cloud Models
par: Zhang, Zhibo, et autres
Publié: (2024)