Instruction Tuning-free Visual Token Complement for Multimodal LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Dongsheng, Cui, Jiequan, Li, Miaoge, Lin, Wang, Chen, Bo, Zhang, Hanwang |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Project-Probe-Aggregate: Efficient Fine-Tuning for Group Robustness
par: Zhu, Beier, et autres
Publié: (2025)
par: Zhu, Beier, et autres
Publié: (2025)
Robust Fine-tuning of Zero-shot Models via Variance Reduction
par: Zhu, Beier, et autres
Publié: (2024)
par: Zhu, Beier, et autres
Publié: (2024)
Dynamic Multimodal Prototype Learning in Vision-Language Models
par: Zhu, Xingyu, et autres
Publié: (2025)
par: Zhu, Xingyu, et autres
Publié: (2025)
LoRA of Change: Learning to Generate LoRA for the Editing Instruction from A Single Before-After Image Pair
par: Song, Xue, et autres
Publié: (2024)
par: Song, Xue, et autres
Publié: (2024)
CARE Transformer: Mobile-Friendly Linear Visual Transformer via Decoupled Dual Interaction
par: Zhou, Yuan, et autres
Publié: (2024)
par: Zhou, Yuan, et autres
Publié: (2024)
Doubly Abductive Counterfactual Inference for Text-based Image Editing
par: Song, Xue, et autres
Publié: (2024)
par: Song, Xue, et autres
Publié: (2024)
Patch-Prompt Aligned Bayesian Prompt Tuning for Vision-Language Models
par: Liu, Xinyang, et autres
Publié: (2023)
par: Liu, Xinyang, et autres
Publié: (2023)
Pushing Rendering Boundaries: Hard Gaussian Splatting
par: Xu, Qingshan, et autres
Publié: (2024)
par: Xu, Qingshan, et autres
Publié: (2024)
STiTch: Semantic Transition and Transportation in Collaboration for Training-Free Zero-Shot Composed Image Retrieval
par: Li, Miaoge, et autres
Publié: (2026)
par: Li, Miaoge, et autres
Publié: (2026)
Learning to Instruct for Visual Instruction Tuning
par: Zhou, Zhihan, et autres
Publié: (2025)
par: Zhou, Zhihan, et autres
Publié: (2025)
Aligned Contrastive Loss for Long-Tailed Recognition
par: Ma, Jiali, et autres
Publié: (2025)
par: Ma, Jiali, et autres
Publié: (2025)
Classes Are Not Equal: An Empirical Study on Image Recognition Fairness
par: Cui, Jiequan, et autres
Publié: (2024)
par: Cui, Jiequan, et autres
Publié: (2024)
Decoupled Kullback-Leibler Divergence Loss
par: Cui, Jiequan, et autres
Publié: (2023)
par: Cui, Jiequan, et autres
Publié: (2023)
Generative Multimodal Pretraining with Discrete Diffusion Timestep Tokens
par: Pan, Kaihang, et autres
Publié: (2025)
par: Pan, Kaihang, et autres
Publié: (2025)
Fine-tuning Multimodal LLMs to Follow Zero-shot Demonstrative Instructions
par: Li, Juncheng, et autres
Publié: (2023)
par: Li, Juncheng, et autres
Publié: (2023)
Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning
par: li, Bonan, et autres
Publié: (2025)
par: li, Bonan, et autres
Publié: (2025)
Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts
par: Li, Honglin, et autres
Publié: (2024)
par: Li, Honglin, et autres
Publié: (2024)
Visual Instruction Tuning with Chain of Region-of-Interest
par: Chen, Yixin, et autres
Publié: (2025)
par: Chen, Yixin, et autres
Publié: (2025)
Towards Semantic Equivalence of Tokenization in Multimodal LLM
par: Wu, Shengqiong, et autres
Publié: (2024)
par: Wu, Shengqiong, et autres
Publié: (2024)
Multi-modal Instruction Tuned LLMs with Fine-grained Visual Perception
par: He, Junwen, et autres
Publié: (2024)
par: He, Junwen, et autres
Publié: (2024)
Reducing Class-Wise Performance Disparity via Margin Regularization
par: Zhu, Beier, et autres
Publié: (2026)
par: Zhu, Beier, et autres
Publié: (2026)
NeuSpring: Neural Spring Fields for Reconstruction and Simulation of Deformable Objects from Videos
par: Xu, Qingshan, et autres
Publié: (2025)
par: Xu, Qingshan, et autres
Publié: (2025)
PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering
par: Zhang, Xiaoman, et autres
Publié: (2023)
par: Zhang, Xiaoman, et autres
Publié: (2023)
TrimTokenator-LC: Towards Adaptive Visual Token Pruning for Large Multimodal Models with Long Contexts
par: Zhang, Hao, et autres
Publié: (2025)
par: Zhang, Hao, et autres
Publié: (2025)
Multimodal Instruction Tuning with Hybrid State Space Models
par: Zhou, Jianing, et autres
Publié: (2024)
par: Zhou, Jianing, et autres
Publié: (2024)
Token Activation Map to Visually Explain Multimodal LLMs
par: Li, Yi, et autres
Publié: (2025)
par: Li, Yi, et autres
Publié: (2025)
Multimodal Continual Instruction Tuning with Dynamic Gradient Guidance
par: Li, Songze, et autres
Publié: (2025)
par: Li, Songze, et autres
Publié: (2025)
Feature Complementation Architecture for Visual Place Recognition
par: Wang, Weiwei, et autres
Publié: (2025)
par: Wang, Weiwei, et autres
Publié: (2025)
Auto-Encoding Morph-Tokens for Multimodal LLM
par: Pan, Kaihang, et autres
Publié: (2024)
par: Pan, Kaihang, et autres
Publié: (2024)
Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning
par: Wang, Bohan, et autres
Publié: (2025)
par: Wang, Bohan, et autres
Publié: (2025)
Personalized Visual Instruction Tuning
par: Pi, Renjie, et autres
Publié: (2024)
par: Pi, Renjie, et autres
Publié: (2024)
Comparison Visual Instruction Tuning
par: Lin, Wei, et autres
Publié: (2024)
par: Lin, Wei, et autres
Publié: (2024)
Look Carefully: Adaptive Visual Reinforcements in Multimodal Large Language Models for Hallucination Mitigation
par: Zhu, Xingyu, et autres
Publié: (2026)
par: Zhu, Xingyu, et autres
Publié: (2026)
TsCA: On the Semantic Consistency Alignment via Conditional Transport for Compositional Zero-Shot Learning
par: Li, Miaoge, et autres
Publié: (2024)
par: Li, Miaoge, et autres
Publié: (2024)
MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale
par: Guo, Jarvis, et autres
Publié: (2024)
par: Guo, Jarvis, et autres
Publié: (2024)
Exploring Transferable Homogeneous Groups for Compositional Zero-Shot Learning
par: Rao, Zhijie, et autres
Publié: (2025)
par: Rao, Zhijie, et autres
Publié: (2025)
End-to-End Vision Tokenizer Tuning
par: Wang, Wenxuan, et autres
Publié: (2025)
par: Wang, Wenxuan, et autres
Publié: (2025)
TrimTokenator: Towards Adaptive Visual Token Pruning for Large Multimodal Models
par: Zhang, Hao, et autres
Publié: (2025)
par: Zhang, Hao, et autres
Publié: (2025)
TokenPacker: Efficient Visual Projector for Multimodal LLM
par: Li, Wentong, et autres
Publié: (2024)
par: Li, Wentong, et autres
Publié: (2024)
What Makes for Good Visual Instructions? Synthesizing Complex Visual Reasoning Instructions for Visual Instruction Tuning
par: Du, Yifan, et autres
Publié: (2023)
par: Du, Yifan, et autres
Publié: (2023)
Documents similaires
-
Project-Probe-Aggregate: Efficient Fine-Tuning for Group Robustness
par: Zhu, Beier, et autres
Publié: (2025) -
Robust Fine-tuning of Zero-shot Models via Variance Reduction
par: Zhu, Beier, et autres
Publié: (2024) -
Dynamic Multimodal Prototype Learning in Vision-Language Models
par: Zhu, Xingyu, et autres
Publié: (2025) -
LoRA of Change: Learning to Generate LoRA for the Editing Instruction from A Single Before-After Image Pair
par: Song, Xue, et autres
Publié: (2024) -
CARE Transformer: Mobile-Friendly Linear Visual Transformer via Decoupled Dual Interaction
par: Zhou, Yuan, et autres
Publié: (2024)