Salvato in:
| Autori principali: | Long, Rujiao, Xing, Hangdi, Yang, Zhibo, Zheng, Qi, Yu, Zhi, Yao, Cong, Huang, Fei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2401.01522 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
HIP: Hierarchical Point Modeling and Pre-training for Visual Information Extraction
di: Long, Rujiao, et al.
Pubblicazione: (2024)
di: Long, Rujiao, et al.
Pubblicazione: (2024)
WebRPG: Automatic Web Rendering Parameters Generation for Visual Presentation
di: Shao, Zirui, et al.
Pubblicazione: (2024)
di: Shao, Zirui, et al.
Pubblicazione: (2024)
OmniParser: A Unified Framework for Text Spotting, Key Information Extraction and Table Recognition
di: Wan, Jianqiang, et al.
Pubblicazione: (2024)
di: Wan, Jianqiang, et al.
Pubblicazione: (2024)
A Simple yet Effective Layout Token in Large Language Models for Document Understanding
di: Zhu, Zhaoqing, et al.
Pubblicazione: (2025)
di: Zhu, Zhaoqing, et al.
Pubblicazione: (2025)
Robust Fine-tuning for Pre-trained 3D Point Cloud Models
di: Zhang, Zhibo, et al.
Pubblicazione: (2024)
di: Zhang, Zhibo, et al.
Pubblicazione: (2024)
LORE: Lagrangian-Optimized Robust Embeddings for Visual Encoders
di: Khodabandeh, Borna, et al.
Pubblicazione: (2025)
di: Khodabandeh, Borna, et al.
Pubblicazione: (2025)
Revisiting Continual Semantic Segmentation with Pre-trained Vision Models
di: Zhang, Duzhen, et al.
Pubblicazione: (2025)
di: Zhang, Duzhen, et al.
Pubblicazione: (2025)
Platypus: A Generalized Specialist Model for Reading Text in Various Forms
di: Wang, Peng, et al.
Pubblicazione: (2024)
di: Wang, Peng, et al.
Pubblicazione: (2024)
SepFormer: Coarse-to-fine Separator Regression Network for Table Structure Recognition
di: Nguyen, Nam Quan, et al.
Pubblicazione: (2025)
di: Nguyen, Nam Quan, et al.
Pubblicazione: (2025)
HierCode: A Lightweight Hierarchical Codebook for Zero-shot Chinese Text Recognition
di: Zhang, Yuyi, et al.
Pubblicazione: (2024)
di: Zhang, Yuyi, et al.
Pubblicazione: (2024)
LORE: Latent Optimization for Precise Semantic Control in Rectified Flow-based Image Editing
di: Ouyang, Liangyang, et al.
Pubblicazione: (2025)
di: Ouyang, Liangyang, et al.
Pubblicazione: (2025)
Fake It Right: Injecting Anatomical Logic into Synthetic Supervised Pre-training for Medical Segmentation
di: Tang, Jiaqi, et al.
Pubblicazione: (2026)
di: Tang, Jiaqi, et al.
Pubblicazione: (2026)
Let ViT Speak: Generative Language-Image Pre-training
di: Fang, Yan, et al.
Pubblicazione: (2026)
di: Fang, Yan, et al.
Pubblicazione: (2026)
Long-Tailed Recognition on Binary Networks by Calibrating A Pre-trained Model
di: Kim, Jihun, et al.
Pubblicazione: (2024)
di: Kim, Jihun, et al.
Pubblicazione: (2024)
Micro-Expression Recognition by Motion Feature Extraction based on Pre-training
di: Li, Ruolin, et al.
Pubblicazione: (2024)
di: Li, Ruolin, et al.
Pubblicazione: (2024)
MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models
di: Zhang, Peng-Fei, et al.
Pubblicazione: (2025)
di: Zhang, Peng-Fei, et al.
Pubblicazione: (2025)
Deep Radar Inverse Sensor Models for Dynamic Occupancy Grid Maps
di: Wei, Zihang, et al.
Pubblicazione: (2023)
di: Wei, Zihang, et al.
Pubblicazione: (2023)
Self-Supervised Pre-Training for Table Structure Recognition Transformer
di: Peng, ShengYun, et al.
Pubblicazione: (2024)
di: Peng, ShengYun, et al.
Pubblicazione: (2024)
LayoutLLM: Layout Instruction Tuning with Large Language Models for Document Understanding
di: Luo, Chuwei, et al.
Pubblicazione: (2024)
di: Luo, Chuwei, et al.
Pubblicazione: (2024)
Visual Text Generation in the Wild
di: Zhu, Yuanzhi, et al.
Pubblicazione: (2024)
di: Zhu, Yuanzhi, et al.
Pubblicazione: (2024)
CoF: Coarse to Fine-Grained Image Understanding for Multi-modal Large Language Models
di: Wang, Yeyuan, et al.
Pubblicazione: (2024)
di: Wang, Yeyuan, et al.
Pubblicazione: (2024)
Universal Adversarial Perturbations for Vision-Language Pre-trained Models
di: Zhang, Peng-Fei, et al.
Pubblicazione: (2024)
di: Zhang, Peng-Fei, et al.
Pubblicazione: (2024)
Stylized Structural Patterns for Improved Neural Network Pre-training
di: Salehi, Farnood, et al.
Pubblicazione: (2025)
di: Salehi, Farnood, et al.
Pubblicazione: (2025)
Pre-training for Action Recognition with Automatically Generated Fractal Datasets
di: Svyezhentsev, Davyd, et al.
Pubblicazione: (2024)
di: Svyezhentsev, Davyd, et al.
Pubblicazione: (2024)
IPAD: Iterative, Parallel, and Diffusion-based Network for Scene Text Recognition
di: Yang, Xiaomeng, et al.
Pubblicazione: (2023)
di: Yang, Xiaomeng, et al.
Pubblicazione: (2023)
A Foundation Model for DAS Signal Recognition and Visual Prompt Tuning of the Pre-trained Model for Downstream Tasks
di: Gui, Kun, et al.
Pubblicazione: (2025)
di: Gui, Kun, et al.
Pubblicazione: (2025)
Multi-modal Multi-task Pre-training for Improved Point Cloud Understanding
di: Liu, Liwen, et al.
Pubblicazione: (2025)
di: Liu, Liwen, et al.
Pubblicazione: (2025)
Enhancing Pre-trained Representation Classifiability can Boost its Interpretability
di: Shen, Shufan, et al.
Pubblicazione: (2025)
di: Shen, Shufan, et al.
Pubblicazione: (2025)
Sparse Reasoning is Enough: Biological-Inspired Framework for Video Anomaly Detection with Large Pre-trained Models
di: Huang, He, et al.
Pubblicazione: (2025)
di: Huang, He, et al.
Pubblicazione: (2025)
ASPO: Adaptive Sentence-Level Preference Optimization for Fine-Grained Multimodal Reasoning
di: Wang, Yeyuan, et al.
Pubblicazione: (2025)
di: Wang, Yeyuan, et al.
Pubblicazione: (2025)
Accelerating Pre-training of Multimodal LLMs via Chain-of-Sight
di: Huang, Ziyuan, et al.
Pubblicazione: (2024)
di: Huang, Ziyuan, et al.
Pubblicazione: (2024)
Logos as a Well-Tempered Pre-train for Sign Language Recognition
di: Ovodov, Ilya, et al.
Pubblicazione: (2025)
di: Ovodov, Ilya, et al.
Pubblicazione: (2025)
AdFair-CLIP: Adversarial Fair Contrastive Language-Image Pre-training for Chest X-rays
di: Yi, Chenlang, et al.
Pubblicazione: (2025)
di: Yi, Chenlang, et al.
Pubblicazione: (2025)
GLID: Pre-training a Generalist Encoder-Decoder Vision Model
di: Liu, Jihao, et al.
Pubblicazione: (2024)
di: Liu, Jihao, et al.
Pubblicazione: (2024)
Downstream Transfer Attack: Adversarial Attacks on Downstream Models with Pre-trained Vision Transformers
di: Zheng, Weijie, et al.
Pubblicazione: (2024)
di: Zheng, Weijie, et al.
Pubblicazione: (2024)
ProcTag: Process Tagging for Assessing the Efficacy of Document Instruction Data
di: Shen, Yufan, et al.
Pubblicazione: (2024)
di: Shen, Yufan, et al.
Pubblicazione: (2024)
SR-Stereo & DAPE: Stepwise Regression and Pre-trained Edges for Practical Stereo Matching
di: Xiao, Weiqing, et al.
Pubblicazione: (2024)
di: Xiao, Weiqing, et al.
Pubblicazione: (2024)
Towards Seamless Adaptation of Pre-trained Models for Visual Place Recognition
di: Lu, Feng, et al.
Pubblicazione: (2024)
di: Lu, Feng, et al.
Pubblicazione: (2024)
Self-Supervised Pre-training with Symmetric Superimposition Modeling for Scene Text Recognition
di: Gao, Zuan, et al.
Pubblicazione: (2024)
di: Gao, Zuan, et al.
Pubblicazione: (2024)
BRAVEn: Improving Self-Supervised Pre-training for Visual and Auditory Speech Recognition
di: Haliassos, Alexandros, et al.
Pubblicazione: (2024)
di: Haliassos, Alexandros, et al.
Pubblicazione: (2024)
Documenti analoghi
-
HIP: Hierarchical Point Modeling and Pre-training for Visual Information Extraction
di: Long, Rujiao, et al.
Pubblicazione: (2024) -
WebRPG: Automatic Web Rendering Parameters Generation for Visual Presentation
di: Shao, Zirui, et al.
Pubblicazione: (2024) -
OmniParser: A Unified Framework for Text Spotting, Key Information Extraction and Table Recognition
di: Wan, Jianqiang, et al.
Pubblicazione: (2024) -
A Simple yet Effective Layout Token in Large Language Models for Document Understanding
di: Zhu, Zhaoqing, et al.
Pubblicazione: (2025) -
Robust Fine-tuning for Pre-trained 3D Point Cloud Models
di: Zhang, Zhibo, et al.
Pubblicazione: (2024)