INST-IT: Boosting Instance Understanding via Explicit Visual Prompt Instruction Tuning
Fuente:
arXiv
Guardado en:
| Autores principales: | Peng, Wujian, Meng, Lingchen, Chen, Yitong, Xie, Yiweng, Liu, Yang, Gui, Tao, Xu, Hang, Qiu, Xipeng, Wu, Zuxuan, Jiang, Yu-Gang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CoMP: Continual Multimodal Pre-training for Vision Foundation Models
por: Chen, Yitong, et al.
Publicado: (2025)
por: Chen, Yitong, et al.
Publicado: (2025)
Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization
por: Liu, Zhuohan, et al.
Publicado: (2026)
por: Liu, Zhuohan, et al.
Publicado: (2026)
CaTok: Taming Mean Flows for One-Dimensional Causal Image Tokenization
por: Chen, Yitong, et al.
Publicado: (2026)
por: Chen, Yitong, et al.
Publicado: (2026)
Synthesize, Diagnose, and Optimize: Towards Fine-Grained Vision-Language Understanding
por: Peng, Wujian, et al.
Publicado: (2023)
por: Peng, Wujian, et al.
Publicado: (2023)
Comprehensive Multi-Modal Prototypes are Simple and Effective Classifiers for Vast-Vocabulary Object Detection
por: Chen, Yitong, et al.
Publicado: (2024)
por: Chen, Yitong, et al.
Publicado: (2024)
FluxMem: Adaptive Hierarchical Memory for Streaming Video Understanding
por: Xie, Yiweng, et al.
Publicado: (2026)
por: Xie, Yiweng, et al.
Publicado: (2026)
MedINST: Meta Dataset of Biomedical Instructions
por: Han, Wenhan, et al.
Publicado: (2024)
por: Han, Wenhan, et al.
Publicado: (2024)
Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue
por: Lin, Xingyao, et al.
Publicado: (2025)
por: Lin, Xingyao, et al.
Publicado: (2025)
DeepStack: Deeply Stacking Visual Tokens is Surprisingly Simple and Effective for LMMs
por: Meng, Lingchen, et al.
Publicado: (2024)
por: Meng, Lingchen, et al.
Publicado: (2024)
Visual Instance-aware Prompt Tuning
por: Xiao, Xi, et al.
Publicado: (2025)
por: Xiao, Xi, et al.
Publicado: (2025)
FOCUS: Towards Universal Foreground Segmentation
por: You, Zuyao, et al.
Publicado: (2025)
por: You, Zuyao, et al.
Publicado: (2025)
SEGIC: Unleashing the Emergent Correspondence for In-Context Segmentation
por: Meng, Lingchen, et al.
Publicado: (2023)
por: Meng, Lingchen, et al.
Publicado: (2023)
Achieving More with Less: Additive Prompt Tuning for Rehearsal-Free Class-Incremental Learning
por: Chen, Haoran, et al.
Publicado: (2025)
por: Chen, Haoran, et al.
Publicado: (2025)
ForgerySleuth: Empowering Multimodal Large Language Models for Image Manipulation Detection
por: Sun, Zhihao, et al.
Publicado: (2024)
por: Sun, Zhihao, et al.
Publicado: (2024)
Multi-Prompt Alignment for Multi-Source Unsupervised Domain Adaptation
por: Chen, Haoran, et al.
Publicado: (2022)
por: Chen, Haoran, et al.
Publicado: (2022)
Boosting Visual Instruction Tuning with Self-Supervised Guidance
por: Sirko-Galouchenko, Sophia, et al.
Publicado: (2026)
por: Sirko-Galouchenko, Sophia, et al.
Publicado: (2026)
FRoM-W1: Towards General Humanoid Whole-Body Control with Language Instructions
por: Li, Peng, et al.
Publicado: (2026)
por: Li, Peng, et al.
Publicado: (2026)
Osprey: Pixel Understanding with Visual Instruction Tuning
por: Yuan, Yuqian, et al.
Publicado: (2023)
por: Yuan, Yuqian, et al.
Publicado: (2023)
Thinking with Deltas: Incentivizing Reinforcement Learning via Differential Visual Reasoning Policy
por: Gao, Shujian, et al.
Publicado: (2026)
por: Gao, Shujian, et al.
Publicado: (2026)
OmniTokenizer: A Joint Image-Video Tokenizer for Visual Generation
por: Wang, Junke, et al.
Publicado: (2024)
por: Wang, Junke, et al.
Publicado: (2024)
PromptFusion: Decoupling Stability and Plasticity for Continual Learning
por: Chen, Haoran, et al.
Publicado: (2023)
por: Chen, Haoran, et al.
Publicado: (2023)
ROSE Doesn't Do That: Boosting the Safety of Instruction-Tuned Large Language Models with Reverse Prompt Contrastive Decoding
por: Zhong, Qihuang, et al.
Publicado: (2024)
por: Zhong, Qihuang, et al.
Publicado: (2024)
Explicit Uncertainty Modeling for Active CLIP Adaptation with Dual Prompt Tuning
por: Wang, Qian-Wei, et al.
Publicado: (2026)
por: Wang, Qian-Wei, et al.
Publicado: (2026)
MINT: Boosting Audio-Language Model via Multi-Target Pre-Training and Instruction Tuning
por: Zhao, Hang, et al.
Publicado: (2024)
por: Zhao, Hang, et al.
Publicado: (2024)
Daily-Omni: Towards Audio-Visual Reasoning with Temporal Alignment across Modalities
por: Zhou, Ziwei, et al.
Publicado: (2025)
por: Zhou, Ziwei, et al.
Publicado: (2025)
Hint-before-Solving Prompting: Guiding LLMs to Effectively Utilize Encoded Knowledge
por: Fu, Jinlan, et al.
Publicado: (2024)
por: Fu, Jinlan, et al.
Publicado: (2024)
The NavINST Dataset for Multi-Sensor Autonomous Navigation
por: de Araujo, Paulo Ricardo Marques, et al.
Publicado: (2025)
por: de Araujo, Paulo Ricardo Marques, et al.
Publicado: (2025)
Multi-Prompt Progressive Alignment for Multi-Source Unsupervised Domain Adaptation
por: Chen, Haoran, et al.
Publicado: (2025)
por: Chen, Haoran, et al.
Publicado: (2025)
Embedded Visual Prompt Tuning
por: Zu, Wenqiang, et al.
Publicado: (2024)
por: Zu, Wenqiang, et al.
Publicado: (2024)
Enhancing Visible-Infrared Person Re-identification with Modality- and Instance-aware Visual Prompt Learning
por: Wu, Ruiqi, et al.
Publicado: (2024)
por: Wu, Ruiqi, et al.
Publicado: (2024)
AID: Adapting Image2Video Diffusion Models for Instruction-guided Video Prediction
por: Xing, Zhen, et al.
Publicado: (2024)
por: Xing, Zhen, et al.
Publicado: (2024)
Medical Image Understanding Improves Survival Prediction via Visual Instruction Tuning
por: Liu, Xixi, et al.
Publicado: (2026)
por: Liu, Xixi, et al.
Publicado: (2026)
Boosting Private Domain Understanding of Efficient MLLMs: A Tuning-free, Adaptive, Universal Prompt Optimization Framework
por: Liu, Jiang, et al.
Publicado: (2024)
por: Liu, Jiang, et al.
Publicado: (2024)
Explicit Visual Prompts for Visual Object Tracking
por: Shi, Liangtao, et al.
Publicado: (2024)
por: Shi, Liangtao, et al.
Publicado: (2024)
NAP-Tuning: Neural Augmented Prompt Tuning for Adversarially Robust Vision-Language Models
por: Zhang, Jiaming, et al.
Publicado: (2025)
por: Zhang, Jiaming, et al.
Publicado: (2025)
MetaMorph: Multimodal Understanding and Generation via Instruction Tuning
por: Tong, Shengbang, et al.
Publicado: (2024)
por: Tong, Shengbang, et al.
Publicado: (2024)
CVPT: Cross Visual Prompt Tuning
por: Huang, Lingyun, et al.
Publicado: (2024)
por: Huang, Lingyun, et al.
Publicado: (2024)
MouSi: Poly-Visual-Expert Vision-Language Models
por: Fan, Xiaoran, et al.
Publicado: (2024)
por: Fan, Xiaoran, et al.
Publicado: (2024)
INST-Sculpt: Interactive Stroke-based Neural SDF Sculpting
por: Rubab, Fizza, et al.
Publicado: (2025)
por: Rubab, Fizza, et al.
Publicado: (2025)
INST-Align: Implicit Neural Alignment for Spatial Transcriptomics via Canonical Expression Fields
por: Han, Bonian, et al.
Publicado: (2026)
por: Han, Bonian, et al.
Publicado: (2026)
Ejemplares similares
-
CoMP: Continual Multimodal Pre-training for Vision Foundation Models
por: Chen, Yitong, et al.
Publicado: (2025) -
Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization
por: Liu, Zhuohan, et al.
Publicado: (2026) -
CaTok: Taming Mean Flows for One-Dimensional Causal Image Tokenization
por: Chen, Yitong, et al.
Publicado: (2026) -
Synthesize, Diagnose, and Optimize: Towards Fine-Grained Vision-Language Understanding
por: Peng, Wujian, et al.
Publicado: (2023) -
Comprehensive Multi-Modal Prototypes are Simple and Effective Classifiers for Vast-Vocabulary Object Detection
por: Chen, Yitong, et al.
Publicado: (2024)