INST-IT: Boosting Instance Understanding via Explicit Visual Prompt Instruction Tuning
Fuente:
arXiv
Salvato in:
| Autori principali: | Peng, Wujian, Meng, Lingchen, Chen, Yitong, Xie, Yiweng, Liu, Yang, Gui, Tao, Xu, Hang, Qiu, Xipeng, Wu, Zuxuan, Jiang, Yu-Gang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CoMP: Continual Multimodal Pre-training for Vision Foundation Models
di: Chen, Yitong, et al.
Pubblicazione: (2025)
di: Chen, Yitong, et al.
Pubblicazione: (2025)
Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization
di: Liu, Zhuohan, et al.
Pubblicazione: (2026)
di: Liu, Zhuohan, et al.
Pubblicazione: (2026)
CaTok: Taming Mean Flows for One-Dimensional Causal Image Tokenization
di: Chen, Yitong, et al.
Pubblicazione: (2026)
di: Chen, Yitong, et al.
Pubblicazione: (2026)
Synthesize, Diagnose, and Optimize: Towards Fine-Grained Vision-Language Understanding
di: Peng, Wujian, et al.
Pubblicazione: (2023)
di: Peng, Wujian, et al.
Pubblicazione: (2023)
Comprehensive Multi-Modal Prototypes are Simple and Effective Classifiers for Vast-Vocabulary Object Detection
di: Chen, Yitong, et al.
Pubblicazione: (2024)
di: Chen, Yitong, et al.
Pubblicazione: (2024)
FluxMem: Adaptive Hierarchical Memory for Streaming Video Understanding
di: Xie, Yiweng, et al.
Pubblicazione: (2026)
di: Xie, Yiweng, et al.
Pubblicazione: (2026)
MedINST: Meta Dataset of Biomedical Instructions
di: Han, Wenhan, et al.
Pubblicazione: (2024)
di: Han, Wenhan, et al.
Pubblicazione: (2024)
Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue
di: Lin, Xingyao, et al.
Pubblicazione: (2025)
di: Lin, Xingyao, et al.
Pubblicazione: (2025)
DeepStack: Deeply Stacking Visual Tokens is Surprisingly Simple and Effective for LMMs
di: Meng, Lingchen, et al.
Pubblicazione: (2024)
di: Meng, Lingchen, et al.
Pubblicazione: (2024)
Visual Instance-aware Prompt Tuning
di: Xiao, Xi, et al.
Pubblicazione: (2025)
di: Xiao, Xi, et al.
Pubblicazione: (2025)
FOCUS: Towards Universal Foreground Segmentation
di: You, Zuyao, et al.
Pubblicazione: (2025)
di: You, Zuyao, et al.
Pubblicazione: (2025)
SEGIC: Unleashing the Emergent Correspondence for In-Context Segmentation
di: Meng, Lingchen, et al.
Pubblicazione: (2023)
di: Meng, Lingchen, et al.
Pubblicazione: (2023)
Achieving More with Less: Additive Prompt Tuning for Rehearsal-Free Class-Incremental Learning
di: Chen, Haoran, et al.
Pubblicazione: (2025)
di: Chen, Haoran, et al.
Pubblicazione: (2025)
ForgerySleuth: Empowering Multimodal Large Language Models for Image Manipulation Detection
di: Sun, Zhihao, et al.
Pubblicazione: (2024)
di: Sun, Zhihao, et al.
Pubblicazione: (2024)
Multi-Prompt Alignment for Multi-Source Unsupervised Domain Adaptation
di: Chen, Haoran, et al.
Pubblicazione: (2022)
di: Chen, Haoran, et al.
Pubblicazione: (2022)
Boosting Visual Instruction Tuning with Self-Supervised Guidance
di: Sirko-Galouchenko, Sophia, et al.
Pubblicazione: (2026)
di: Sirko-Galouchenko, Sophia, et al.
Pubblicazione: (2026)
FRoM-W1: Towards General Humanoid Whole-Body Control with Language Instructions
di: Li, Peng, et al.
Pubblicazione: (2026)
di: Li, Peng, et al.
Pubblicazione: (2026)
Osprey: Pixel Understanding with Visual Instruction Tuning
di: Yuan, Yuqian, et al.
Pubblicazione: (2023)
di: Yuan, Yuqian, et al.
Pubblicazione: (2023)
Thinking with Deltas: Incentivizing Reinforcement Learning via Differential Visual Reasoning Policy
di: Gao, Shujian, et al.
Pubblicazione: (2026)
di: Gao, Shujian, et al.
Pubblicazione: (2026)
OmniTokenizer: A Joint Image-Video Tokenizer for Visual Generation
di: Wang, Junke, et al.
Pubblicazione: (2024)
di: Wang, Junke, et al.
Pubblicazione: (2024)
PromptFusion: Decoupling Stability and Plasticity for Continual Learning
di: Chen, Haoran, et al.
Pubblicazione: (2023)
di: Chen, Haoran, et al.
Pubblicazione: (2023)
ROSE Doesn't Do That: Boosting the Safety of Instruction-Tuned Large Language Models with Reverse Prompt Contrastive Decoding
di: Zhong, Qihuang, et al.
Pubblicazione: (2024)
di: Zhong, Qihuang, et al.
Pubblicazione: (2024)
Explicit Uncertainty Modeling for Active CLIP Adaptation with Dual Prompt Tuning
di: Wang, Qian-Wei, et al.
Pubblicazione: (2026)
di: Wang, Qian-Wei, et al.
Pubblicazione: (2026)
MINT: Boosting Audio-Language Model via Multi-Target Pre-Training and Instruction Tuning
di: Zhao, Hang, et al.
Pubblicazione: (2024)
di: Zhao, Hang, et al.
Pubblicazione: (2024)
Daily-Omni: Towards Audio-Visual Reasoning with Temporal Alignment across Modalities
di: Zhou, Ziwei, et al.
Pubblicazione: (2025)
di: Zhou, Ziwei, et al.
Pubblicazione: (2025)
Hint-before-Solving Prompting: Guiding LLMs to Effectively Utilize Encoded Knowledge
di: Fu, Jinlan, et al.
Pubblicazione: (2024)
di: Fu, Jinlan, et al.
Pubblicazione: (2024)
The NavINST Dataset for Multi-Sensor Autonomous Navigation
di: de Araujo, Paulo Ricardo Marques, et al.
Pubblicazione: (2025)
di: de Araujo, Paulo Ricardo Marques, et al.
Pubblicazione: (2025)
Multi-Prompt Progressive Alignment for Multi-Source Unsupervised Domain Adaptation
di: Chen, Haoran, et al.
Pubblicazione: (2025)
di: Chen, Haoran, et al.
Pubblicazione: (2025)
Embedded Visual Prompt Tuning
di: Zu, Wenqiang, et al.
Pubblicazione: (2024)
di: Zu, Wenqiang, et al.
Pubblicazione: (2024)
Enhancing Visible-Infrared Person Re-identification with Modality- and Instance-aware Visual Prompt Learning
di: Wu, Ruiqi, et al.
Pubblicazione: (2024)
di: Wu, Ruiqi, et al.
Pubblicazione: (2024)
AID: Adapting Image2Video Diffusion Models for Instruction-guided Video Prediction
di: Xing, Zhen, et al.
Pubblicazione: (2024)
di: Xing, Zhen, et al.
Pubblicazione: (2024)
Medical Image Understanding Improves Survival Prediction via Visual Instruction Tuning
di: Liu, Xixi, et al.
Pubblicazione: (2026)
di: Liu, Xixi, et al.
Pubblicazione: (2026)
Boosting Private Domain Understanding of Efficient MLLMs: A Tuning-free, Adaptive, Universal Prompt Optimization Framework
di: Liu, Jiang, et al.
Pubblicazione: (2024)
di: Liu, Jiang, et al.
Pubblicazione: (2024)
Explicit Visual Prompts for Visual Object Tracking
di: Shi, Liangtao, et al.
Pubblicazione: (2024)
di: Shi, Liangtao, et al.
Pubblicazione: (2024)
NAP-Tuning: Neural Augmented Prompt Tuning for Adversarially Robust Vision-Language Models
di: Zhang, Jiaming, et al.
Pubblicazione: (2025)
di: Zhang, Jiaming, et al.
Pubblicazione: (2025)
MetaMorph: Multimodal Understanding and Generation via Instruction Tuning
di: Tong, Shengbang, et al.
Pubblicazione: (2024)
di: Tong, Shengbang, et al.
Pubblicazione: (2024)
CVPT: Cross Visual Prompt Tuning
di: Huang, Lingyun, et al.
Pubblicazione: (2024)
di: Huang, Lingyun, et al.
Pubblicazione: (2024)
MouSi: Poly-Visual-Expert Vision-Language Models
di: Fan, Xiaoran, et al.
Pubblicazione: (2024)
di: Fan, Xiaoran, et al.
Pubblicazione: (2024)
INST-Sculpt: Interactive Stroke-based Neural SDF Sculpting
di: Rubab, Fizza, et al.
Pubblicazione: (2025)
di: Rubab, Fizza, et al.
Pubblicazione: (2025)
INST-Align: Implicit Neural Alignment for Spatial Transcriptomics via Canonical Expression Fields
di: Han, Bonian, et al.
Pubblicazione: (2026)
di: Han, Bonian, et al.
Pubblicazione: (2026)
Documenti analoghi
-
CoMP: Continual Multimodal Pre-training for Vision Foundation Models
di: Chen, Yitong, et al.
Pubblicazione: (2025) -
Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization
di: Liu, Zhuohan, et al.
Pubblicazione: (2026) -
CaTok: Taming Mean Flows for One-Dimensional Causal Image Tokenization
di: Chen, Yitong, et al.
Pubblicazione: (2026) -
Synthesize, Diagnose, and Optimize: Towards Fine-Grained Vision-Language Understanding
di: Peng, Wujian, et al.
Pubblicazione: (2023) -
Comprehensive Multi-Modal Prototypes are Simple and Effective Classifiers for Vast-Vocabulary Object Detection
di: Chen, Yitong, et al.
Pubblicazione: (2024)