INST-IT: Boosting Instance Understanding via Explicit Visual Prompt Instruction Tuning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Peng, Wujian, Meng, Lingchen, Chen, Yitong, Xie, Yiweng, Liu, Yang, Gui, Tao, Xu, Hang, Qiu, Xipeng, Wu, Zuxuan, Jiang, Yu-Gang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
CoMP: Continual Multimodal Pre-training for Vision Foundation Models
von: Chen, Yitong, et al.
Veröffentlicht: (2025)
von: Chen, Yitong, et al.
Veröffentlicht: (2025)
Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization
von: Liu, Zhuohan, et al.
Veröffentlicht: (2026)
von: Liu, Zhuohan, et al.
Veröffentlicht: (2026)
CaTok: Taming Mean Flows for One-Dimensional Causal Image Tokenization
von: Chen, Yitong, et al.
Veröffentlicht: (2026)
von: Chen, Yitong, et al.
Veröffentlicht: (2026)
Synthesize, Diagnose, and Optimize: Towards Fine-Grained Vision-Language Understanding
von: Peng, Wujian, et al.
Veröffentlicht: (2023)
von: Peng, Wujian, et al.
Veröffentlicht: (2023)
Comprehensive Multi-Modal Prototypes are Simple and Effective Classifiers for Vast-Vocabulary Object Detection
von: Chen, Yitong, et al.
Veröffentlicht: (2024)
von: Chen, Yitong, et al.
Veröffentlicht: (2024)
FluxMem: Adaptive Hierarchical Memory for Streaming Video Understanding
von: Xie, Yiweng, et al.
Veröffentlicht: (2026)
von: Xie, Yiweng, et al.
Veröffentlicht: (2026)
MedINST: Meta Dataset of Biomedical Instructions
von: Han, Wenhan, et al.
Veröffentlicht: (2024)
von: Han, Wenhan, et al.
Veröffentlicht: (2024)
Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue
von: Lin, Xingyao, et al.
Veröffentlicht: (2025)
von: Lin, Xingyao, et al.
Veröffentlicht: (2025)
DeepStack: Deeply Stacking Visual Tokens is Surprisingly Simple and Effective for LMMs
von: Meng, Lingchen, et al.
Veröffentlicht: (2024)
von: Meng, Lingchen, et al.
Veröffentlicht: (2024)
Visual Instance-aware Prompt Tuning
von: Xiao, Xi, et al.
Veröffentlicht: (2025)
von: Xiao, Xi, et al.
Veröffentlicht: (2025)
FOCUS: Towards Universal Foreground Segmentation
von: You, Zuyao, et al.
Veröffentlicht: (2025)
von: You, Zuyao, et al.
Veröffentlicht: (2025)
SEGIC: Unleashing the Emergent Correspondence for In-Context Segmentation
von: Meng, Lingchen, et al.
Veröffentlicht: (2023)
von: Meng, Lingchen, et al.
Veröffentlicht: (2023)
Achieving More with Less: Additive Prompt Tuning for Rehearsal-Free Class-Incremental Learning
von: Chen, Haoran, et al.
Veröffentlicht: (2025)
von: Chen, Haoran, et al.
Veröffentlicht: (2025)
ForgerySleuth: Empowering Multimodal Large Language Models for Image Manipulation Detection
von: Sun, Zhihao, et al.
Veröffentlicht: (2024)
von: Sun, Zhihao, et al.
Veröffentlicht: (2024)
Multi-Prompt Alignment for Multi-Source Unsupervised Domain Adaptation
von: Chen, Haoran, et al.
Veröffentlicht: (2022)
von: Chen, Haoran, et al.
Veröffentlicht: (2022)
Boosting Visual Instruction Tuning with Self-Supervised Guidance
von: Sirko-Galouchenko, Sophia, et al.
Veröffentlicht: (2026)
von: Sirko-Galouchenko, Sophia, et al.
Veröffentlicht: (2026)
FRoM-W1: Towards General Humanoid Whole-Body Control with Language Instructions
von: Li, Peng, et al.
Veröffentlicht: (2026)
von: Li, Peng, et al.
Veröffentlicht: (2026)
Osprey: Pixel Understanding with Visual Instruction Tuning
von: Yuan, Yuqian, et al.
Veröffentlicht: (2023)
von: Yuan, Yuqian, et al.
Veröffentlicht: (2023)
Thinking with Deltas: Incentivizing Reinforcement Learning via Differential Visual Reasoning Policy
von: Gao, Shujian, et al.
Veröffentlicht: (2026)
von: Gao, Shujian, et al.
Veröffentlicht: (2026)
OmniTokenizer: A Joint Image-Video Tokenizer for Visual Generation
von: Wang, Junke, et al.
Veröffentlicht: (2024)
von: Wang, Junke, et al.
Veröffentlicht: (2024)
PromptFusion: Decoupling Stability and Plasticity for Continual Learning
von: Chen, Haoran, et al.
Veröffentlicht: (2023)
von: Chen, Haoran, et al.
Veröffentlicht: (2023)
ROSE Doesn't Do That: Boosting the Safety of Instruction-Tuned Large Language Models with Reverse Prompt Contrastive Decoding
von: Zhong, Qihuang, et al.
Veröffentlicht: (2024)
von: Zhong, Qihuang, et al.
Veröffentlicht: (2024)
Explicit Uncertainty Modeling for Active CLIP Adaptation with Dual Prompt Tuning
von: Wang, Qian-Wei, et al.
Veröffentlicht: (2026)
von: Wang, Qian-Wei, et al.
Veröffentlicht: (2026)
MINT: Boosting Audio-Language Model via Multi-Target Pre-Training and Instruction Tuning
von: Zhao, Hang, et al.
Veröffentlicht: (2024)
von: Zhao, Hang, et al.
Veröffentlicht: (2024)
Daily-Omni: Towards Audio-Visual Reasoning with Temporal Alignment across Modalities
von: Zhou, Ziwei, et al.
Veröffentlicht: (2025)
von: Zhou, Ziwei, et al.
Veröffentlicht: (2025)
Hint-before-Solving Prompting: Guiding LLMs to Effectively Utilize Encoded Knowledge
von: Fu, Jinlan, et al.
Veröffentlicht: (2024)
von: Fu, Jinlan, et al.
Veröffentlicht: (2024)
The NavINST Dataset for Multi-Sensor Autonomous Navigation
von: de Araujo, Paulo Ricardo Marques, et al.
Veröffentlicht: (2025)
von: de Araujo, Paulo Ricardo Marques, et al.
Veröffentlicht: (2025)
Multi-Prompt Progressive Alignment for Multi-Source Unsupervised Domain Adaptation
von: Chen, Haoran, et al.
Veröffentlicht: (2025)
von: Chen, Haoran, et al.
Veröffentlicht: (2025)
Embedded Visual Prompt Tuning
von: Zu, Wenqiang, et al.
Veröffentlicht: (2024)
von: Zu, Wenqiang, et al.
Veröffentlicht: (2024)
Enhancing Visible-Infrared Person Re-identification with Modality- and Instance-aware Visual Prompt Learning
von: Wu, Ruiqi, et al.
Veröffentlicht: (2024)
von: Wu, Ruiqi, et al.
Veröffentlicht: (2024)
AID: Adapting Image2Video Diffusion Models for Instruction-guided Video Prediction
von: Xing, Zhen, et al.
Veröffentlicht: (2024)
von: Xing, Zhen, et al.
Veröffentlicht: (2024)
Medical Image Understanding Improves Survival Prediction via Visual Instruction Tuning
von: Liu, Xixi, et al.
Veröffentlicht: (2026)
von: Liu, Xixi, et al.
Veröffentlicht: (2026)
Boosting Private Domain Understanding of Efficient MLLMs: A Tuning-free, Adaptive, Universal Prompt Optimization Framework
von: Liu, Jiang, et al.
Veröffentlicht: (2024)
von: Liu, Jiang, et al.
Veröffentlicht: (2024)
Explicit Visual Prompts for Visual Object Tracking
von: Shi, Liangtao, et al.
Veröffentlicht: (2024)
von: Shi, Liangtao, et al.
Veröffentlicht: (2024)
NAP-Tuning: Neural Augmented Prompt Tuning for Adversarially Robust Vision-Language Models
von: Zhang, Jiaming, et al.
Veröffentlicht: (2025)
von: Zhang, Jiaming, et al.
Veröffentlicht: (2025)
MetaMorph: Multimodal Understanding and Generation via Instruction Tuning
von: Tong, Shengbang, et al.
Veröffentlicht: (2024)
von: Tong, Shengbang, et al.
Veröffentlicht: (2024)
CVPT: Cross Visual Prompt Tuning
von: Huang, Lingyun, et al.
Veröffentlicht: (2024)
von: Huang, Lingyun, et al.
Veröffentlicht: (2024)
MouSi: Poly-Visual-Expert Vision-Language Models
von: Fan, Xiaoran, et al.
Veröffentlicht: (2024)
von: Fan, Xiaoran, et al.
Veröffentlicht: (2024)
INST-Sculpt: Interactive Stroke-based Neural SDF Sculpting
von: Rubab, Fizza, et al.
Veröffentlicht: (2025)
von: Rubab, Fizza, et al.
Veröffentlicht: (2025)
INST-Align: Implicit Neural Alignment for Spatial Transcriptomics via Canonical Expression Fields
von: Han, Bonian, et al.
Veröffentlicht: (2026)
von: Han, Bonian, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
CoMP: Continual Multimodal Pre-training for Vision Foundation Models
von: Chen, Yitong, et al.
Veröffentlicht: (2025) -
Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization
von: Liu, Zhuohan, et al.
Veröffentlicht: (2026) -
CaTok: Taming Mean Flows for One-Dimensional Causal Image Tokenization
von: Chen, Yitong, et al.
Veröffentlicht: (2026) -
Synthesize, Diagnose, and Optimize: Towards Fine-Grained Vision-Language Understanding
von: Peng, Wujian, et al.
Veröffentlicht: (2023) -
Comprehensive Multi-Modal Prototypes are Simple and Effective Classifiers for Vast-Vocabulary Object Detection
von: Chen, Yitong, et al.
Veröffentlicht: (2024)