VisLingInstruct: Elevating Zero-Shot Learning in Multi-Modal Language Models with Autonomous Instruction Optimization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhu, Dongsheng, Tang, Xunzhu, Han, Weidong, Lu, Jinghui, Zhao, Yukun, Xing, Guoliang, Wang, Junfeng, Yin, Dawei |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Learning to Instruct for Visual Instruction Tuning
par: Zhou, Zhihan, et autres
Publié: (2025)
par: Zhou, Zhihan, et autres
Publié: (2025)
InstructDoc: A Dataset for Zero-Shot Generalization of Visual Document Understanding with Instructions
par: Tanaka, Ryota, et autres
Publié: (2024)
par: Tanaka, Ryota, et autres
Publié: (2024)
Toward Zero-Shot Instruction Following
par: Lou, Renze, et autres
Publié: (2023)
par: Lou, Renze, et autres
Publié: (2023)
Learning to Rebalance Multi-Modal Optimization by Adaptively Masking Subnetworks
par: Yang, Yang, et autres
Publié: (2024)
par: Yang, Yang, et autres
Publié: (2024)
InstructOCR: Instruction Boosting Scene Text Spotting
par: Duan, Chen, et autres
Publié: (2024)
par: Duan, Chen, et autres
Publié: (2024)
InverseCoder: Self-improving Instruction-Tuned Code LLMs with Inverse-Instruct
par: Wu, Yutong, et autres
Publié: (2024)
par: Wu, Yutong, et autres
Publié: (2024)
Agent Instructs Large Language Models to be General Zero-Shot Reasoners
par: Crispino, Nicholas, et autres
Publié: (2023)
par: Crispino, Nicholas, et autres
Publié: (2023)
Question-Instructed Visual Descriptions for Zero-Shot Video Question Answering
par: Romero, David, et autres
Publié: (2024)
par: Romero, David, et autres
Publié: (2024)
Text-Video Retrieval via Variational Multi-Modal Hypergraph Networks
par: Li, Qian, et autres
Publié: (2024)
par: Li, Qian, et autres
Publié: (2024)
InstructDubber: Instruction-based Alignment for Zero-shot Movie Dubbing
par: Zhang, Zhedong, et autres
Publié: (2025)
par: Zhang, Zhedong, et autres
Publié: (2025)
ReasonBridge: Efficient Reasoning Transfer from Closed to Open-Source Language Models
par: Zhong, Ziqi, et autres
Publié: (2025)
par: Zhong, Ziqi, et autres
Publié: (2025)
InstructAttribute: Fine-grained Object Attributes editing with Instruction
par: Yin, Xingxi, et autres
Publié: (2025)
par: Yin, Xingxi, et autres
Publié: (2025)
Instruct-Imagen: Image Generation with Multi-modal Instruction
par: Hu, Hexiang, et autres
Publié: (2024)
par: Hu, Hexiang, et autres
Publié: (2024)
InstructNav: Zero-shot System for Generic Instruction Navigation in Unexplored Environment
par: Long, Yuxing, et autres
Publié: (2024)
par: Long, Yuxing, et autres
Publié: (2024)
VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents
par: Yu, Shi, et autres
Publié: (2024)
par: Yu, Shi, et autres
Publié: (2024)
Show Less, Instruct More: Enriching Prompts with Definitions and Guidelines for Zero-Shot NER
par: Zamai, Andrew, et autres
Publié: (2024)
par: Zamai, Andrew, et autres
Publié: (2024)
Scaling Prompt Instructed Zero Shot Composed Image Retrieval with Image-Only Data
par: Duan, Yiqun, et autres
Publié: (2025)
par: Duan, Yiqun, et autres
Publié: (2025)
GRAF: Multi-turn Jailbreaking via Global Refinement and Active Fabrication
par: Tang, Hua, et autres
Publié: (2025)
par: Tang, Hua, et autres
Publié: (2025)
ZONE: Zero-Shot Instruction-Guided Local Editing
par: Li, Shanglin, et autres
Publié: (2023)
par: Li, Shanglin, et autres
Publié: (2023)
Diffusion-ES: Gradient-free Planning with Diffusion for Autonomous Driving and Zero-Shot Instruction Following
par: Yang, Brian, et autres
Publié: (2024)
par: Yang, Brian, et autres
Publié: (2024)
PartInstruct: Part-level Instruction Following for Fine-grained Robot Manipulation
par: Yin, Yifan, et autres
Publié: (2025)
par: Yin, Yifan, et autres
Publié: (2025)
InstructSAM: Segment Any Instance with Any Instructions
par: Yuan, Yuqian, et autres
Publié: (2026)
par: Yuan, Yuqian, et autres
Publié: (2026)
InstructBrush: Learning Attention-based Instruction Optimization for Image Editing
par: Zhao, Ruoyu, et autres
Publié: (2024)
par: Zhao, Ruoyu, et autres
Publié: (2024)
Multi-Modal Zero-Shot Prediction of Color Trajectories in Food Drying
par: Li, Shichen, et autres
Publié: (2025)
par: Li, Shichen, et autres
Publié: (2025)
Joint Flashback Adaptation for Forgetting-Resistant Instruction Tuning
par: Zhao, Yukun, et autres
Publié: (2025)
par: Zhao, Yukun, et autres
Publié: (2025)
Instruct-ReID: A Multi-purpose Person Re-identification Task with Instructions
par: He, Weizhen, et autres
Publié: (2023)
par: He, Weizhen, et autres
Publié: (2023)
LingVaria
Publié: (2021)
Publié: (2021)
ZeroGR: A Generalizable and Scalable Framework for Zero-Shot Generative Retrieval
par: Sun, Weiwei, et autres
Publié: (2025)
par: Sun, Weiwei, et autres
Publié: (2025)
Knowing What LLMs DO NOT Know: A Simple Yet Effective Self-Detection Method
par: Zhao, Yukun, et autres
Publié: (2023)
par: Zhao, Yukun, et autres
Publié: (2023)
Improving the Robustness of Large Language Models via Consistency Alignment
par: Zhao, Yukun, et autres
Publié: (2024)
par: Zhao, Yukun, et autres
Publié: (2024)
Text as Any-Modality for Zero-Shot Classification by Consistent Prompt Tuning
par: Wu, Xiangyu, et autres
Publié: (2025)
par: Wu, Xiangyu, et autres
Publié: (2025)
VisRL: Intention-Driven Visual Perception via Reinforced Reasoning
par: Chen, Zhangquan, et autres
Publié: (2025)
par: Chen, Zhangquan, et autres
Publié: (2025)
InstructEngine: Instruction-driven Text-to-Image Alignment
par: Lu, Xingyu, et autres
Publié: (2025)
par: Lu, Xingyu, et autres
Publié: (2025)
Coherent Zero-Shot Visual Instruction Generation
par: Phung, Quynh, et autres
Publié: (2024)
par: Phung, Quynh, et autres
Publié: (2024)
Can Large Language Models Detect Real-World Android Software Compliance Violations?
par: Zhang, Haoyi, et autres
Publié: (2025)
par: Zhang, Haoyi, et autres
Publié: (2025)
GDPR-Bench-Android: A Benchmark for Evaluating Automated GDPR Compliance Detection in Android
par: Ran, Huaijin, et autres
Publié: (2025)
par: Ran, Huaijin, et autres
Publié: (2025)
Deep Exploration of Cross-Lingual Zero-Shot Generalization in Instruction Tuning
par: Han, Janghoon, et autres
Publié: (2024)
par: Han, Janghoon, et autres
Publié: (2024)
InstructMol: Multi-Modal Integration for Building a Versatile and Reliable Molecular Assistant in Drug Discovery
par: Cao, He, et autres
Publié: (2023)
par: Cao, He, et autres
Publié: (2023)
Troika: Multi-Path Cross-Modal Traction for Compositional Zero-Shot Learning
par: Huang, Siteng, et autres
Publié: (2023)
par: Huang, Siteng, et autres
Publié: (2023)
CapS-Adapter: Caption-based MultiModal Adapter in Zero-Shot Classification
par: Wang, Qijie, et autres
Publié: (2024)
par: Wang, Qijie, et autres
Publié: (2024)
Documents similaires
-
Learning to Instruct for Visual Instruction Tuning
par: Zhou, Zhihan, et autres
Publié: (2025) -
InstructDoc: A Dataset for Zero-Shot Generalization of Visual Document Understanding with Instructions
par: Tanaka, Ryota, et autres
Publié: (2024) -
Toward Zero-Shot Instruction Following
par: Lou, Renze, et autres
Publié: (2023) -
Learning to Rebalance Multi-Modal Optimization by Adaptively Masking Subnetworks
par: Yang, Yang, et autres
Publié: (2024) -
InstructOCR: Instruction Boosting Scene Text Spotting
par: Duan, Chen, et autres
Publié: (2024)