Visual Instruction Pretraining for Domain-Specific Foundation Models
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Yuxuan, Zhang, Yicheng, Tang, Wenhao, Dai, Yimian, Cheng, Ming-Ming, Li, Xiang, Yang, Jian |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SM3Det: A Unified Model for Multi-Modal Remote Sensing Object Detection
by: Li, Yuxuan, et al.
Published: (2024)
by: Li, Yuxuan, et al.
Published: (2024)
LSKNet: A Foundation Lightweight Backbone for Remote Sensing
by: Li, Yuxuan, et al.
Published: (2024)
by: Li, Yuxuan, et al.
Published: (2024)
DISTA-Net: Dynamic Closely-Spaced Infrared Small Target Unmixing
by: Han, Shengdong, et al.
Published: (2025)
by: Han, Shengdong, et al.
Published: (2025)
Unifying Heterogeneous Multi-Modal Remote Sensing Detection Via Language-Pivoted Pretraining
by: Li, Yuxuan, et al.
Published: (2026)
by: Li, Yuxuan, et al.
Published: (2026)
DenoDet V2: Phase-Amplitude Cross Denoising for SAR Object Detection
by: Ni, Kang, et al.
Published: (2025)
by: Ni, Kang, et al.
Published: (2025)
DenoDet: Attention as Deformable Multi-Subspace Feature Denoising for Target Detection in SAR Images
by: Dai, Yimian, et al.
Published: (2024)
by: Dai, Yimian, et al.
Published: (2024)
HazyDet: Open-Source Benchmark for Drone-View Object Detection with Depth-Cues in Hazy Scenes
by: Feng, Changfeng, et al.
Published: (2024)
by: Feng, Changfeng, et al.
Published: (2024)
A Simple Detector with Frame Dynamics is a Strong Tracker
by: Peng, Chenxu, et al.
Published: (2025)
by: Peng, Chenxu, et al.
Published: (2025)
RPCANet++: Deep Interpretable Robust PCA for Sparse Object Segmentation
by: Wu, Fengyi, et al.
Published: (2025)
by: Wu, Fengyi, et al.
Published: (2025)
Pick of the Bunch: Detecting Infrared Small Targets Beyond Hit-Miss Trade-Offs via Selective Rank-Aware Attention
by: Dai, Yimian, et al.
Published: (2024)
by: Dai, Yimian, et al.
Published: (2024)
AuxDet: Auxiliary Metadata Matters for Omni-Domain Infrared Small Target Detection
by: Shi, Yangting, et al.
Published: (2025)
by: Shi, Yangting, et al.
Published: (2025)
RSAR: Restricted State Angle Resolver and Rotated SAR Benchmark
by: Zhang, Xin, et al.
Published: (2025)
by: Zhang, Xin, et al.
Published: (2025)
Revisiting Data Challenges of Computational Pathology: A Pack-based Multiple Instance Learning Training Framework
by: Tang, Wenhao, et al.
Published: (2025)
by: Tang, Wenhao, et al.
Published: (2025)
WOW-Seg: A Word-free Open World Segmentation Model
by: Li, Danyang, et al.
Published: (2026)
by: Li, Danyang, et al.
Published: (2026)
Visual Question Answering Instruction: Unlocking Multimodal Large Language Model To Domain-Specific Visual Multitasks
by: Lee, Jusung, et al.
Published: (2024)
by: Lee, Jusung, et al.
Published: (2024)
Advancing Textual Prompt Learning with Anchored Attributes
by: Li, Zheng, et al.
Published: (2024)
by: Li, Zheng, et al.
Published: (2024)
MoCoLSK: Modality Conditioned High-Resolution Downscaling for Land Surface Temperature
by: Dai, Qun, et al.
Published: (2024)
by: Dai, Qun, et al.
Published: (2024)
Revisiting End-to-End Learning with Slide-level Supervision in Computational Pathology
by: Tang, Wenhao, et al.
Published: (2025)
by: Tang, Wenhao, et al.
Published: (2025)
CogVLM: Visual Expert for Pretrained Language Models
by: Wang, Weihan, et al.
Published: (2023)
by: Wang, Weihan, et al.
Published: (2023)
OddGridBench: Exposing the Lack of Fine-Grained Visual Discrepancy Sensitivity in Multimodal Large Language Models
by: Weng, Tengjin, et al.
Published: (2026)
by: Weng, Tengjin, et al.
Published: (2026)
Sparse Prior Is Not All You Need: When Differential Directionality Meets Saliency Coherence for Infrared Small Target Detection
by: Zhou, Fei, et al.
Published: (2024)
by: Zhou, Fei, et al.
Published: (2024)
Scaling Video Pretraining for Surgical Foundation Models
by: Lu, Sicheng, et al.
Published: (2026)
by: Lu, Sicheng, et al.
Published: (2026)
Multi-task Visual Grounding with Coarse-to-Fine Consistency Constraints
by: Dai, Ming, et al.
Published: (2025)
by: Dai, Ming, et al.
Published: (2025)
Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts
by: Li, Honglin, et al.
Published: (2024)
by: Li, Honglin, et al.
Published: (2024)
On Good Practices for Task-Specific Distillation of Large Pretrained Visual Models
by: Marrie, Juliette, et al.
Published: (2024)
by: Marrie, Juliette, et al.
Published: (2024)
ViSpeak: Visual Instruction Feedback in Streaming Videos
by: Fu, Shenghao, et al.
Published: (2025)
by: Fu, Shenghao, et al.
Published: (2025)
Strip R-CNN: Large Strip Convolution for Remote Sensing Object Detection
by: Yuan, Xinbin, et al.
Published: (2025)
by: Yuan, Xinbin, et al.
Published: (2025)
Scaling Dense Event-Stream Pretraining from Visual Foundation Models
by: Chen, Zhiwen, et al.
Published: (2026)
by: Chen, Zhiwen, et al.
Published: (2026)
Feature Re-Embedding: Towards Foundation Model-Level Performance in Computational Pathology
by: Tang, Wenhao, et al.
Published: (2024)
by: Tang, Wenhao, et al.
Published: (2024)
Osprey: Pixel Understanding with Visual Instruction Tuning
by: Yuan, Yuqian, et al.
Published: (2023)
by: Yuan, Yuqian, et al.
Published: (2023)
Rethinking Infrared Small Target Detection: A Foundation-Driven Efficient Paradigm
by: Yu, Chuang, et al.
Published: (2025)
by: Yu, Chuang, et al.
Published: (2025)
Clustering Guided Domain-Specific Pretrained Foundation Model Very High-Resolution Arctic Remote Sensing
by: Perera, Amal S., et al.
Published: (2026)
by: Perera, Amal S., et al.
Published: (2026)
Harvest Video Foundation Models via Efficient Post-Pretraining
by: Li, Yizhuo, et al.
Published: (2023)
by: Li, Yizhuo, et al.
Published: (2023)
Unbiased Region-Language Alignment for Open-Vocabulary Dense Prediction
by: Li, Yunheng, et al.
Published: (2024)
by: Li, Yunheng, et al.
Published: (2024)
SARDet-100K: Towards Open-Source Benchmark and ToolKit for Large-Scale SAR Object Detection
by: Li, Yuxuan, et al.
Published: (2024)
by: Li, Yuxuan, et al.
Published: (2024)
Generalizing to Unseen Domains in Diabetic Retinopathy with Disentangled Representations
by: Xia, Peng, et al.
Published: (2024)
by: Xia, Peng, et al.
Published: (2024)
CrystaL: Spontaneous Emergence of Visual Latents in MLLMs
by: Zhang, Yang, et al.
Published: (2026)
by: Zhang, Yang, et al.
Published: (2026)
Selective, Regularized, and Calibrated: Harnessing Vision Foundation Models for Cross-Domain Few-Shot Semantic Segmentation
by: Ma, Junyuan, et al.
Published: (2026)
by: Ma, Junyuan, et al.
Published: (2026)
Efficient Self-supervised Vision Pretraining with Local Masked Reconstruction
by: Chen, Jun, et al.
Published: (2022)
by: Chen, Jun, et al.
Published: (2022)
Event-based Tiny Object Detection: A Benchmark Dataset and Baseline
by: Chen, Nuo, et al.
Published: (2025)
by: Chen, Nuo, et al.
Published: (2025)
Similar Items
-
SM3Det: A Unified Model for Multi-Modal Remote Sensing Object Detection
by: Li, Yuxuan, et al.
Published: (2024) -
LSKNet: A Foundation Lightweight Backbone for Remote Sensing
by: Li, Yuxuan, et al.
Published: (2024) -
DISTA-Net: Dynamic Closely-Spaced Infrared Small Target Unmixing
by: Han, Shengdong, et al.
Published: (2025) -
Unifying Heterogeneous Multi-Modal Remote Sensing Detection Via Language-Pivoted Pretraining
by: Li, Yuxuan, et al.
Published: (2026) -
DenoDet V2: Phase-Amplitude Cross Denoising for SAR Object Detection
by: Ni, Kang, et al.
Published: (2025)