Explanatory Instructions: Towards Unified Vision Tasks Understanding and Zero-shot Generalization
Fuente:
arXiv
Guardado en:
| Autores principales: | Shen, Yang, Wei, Xiu-Shen, Sun, Yifan, Song, Yuxin, Yuan, Tao, Jin, Jian, Xu, Heyang, Yao, Yazhou, Ding, Errui |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: A Comprehensive Evaluation
por: Yu, Hong-Tao, et al.
Publicado: (2025)
por: Yu, Hong-Tao, et al.
Publicado: (2025)
Anomagic: Crossmodal Prompt-driven Zero-shot Anomaly Generation
por: Jiang, Yuxin, et al.
Publicado: (2025)
por: Jiang, Yuxin, et al.
Publicado: (2025)
Autonomous Data Selection with Zero-shot Generative Classifiers for Mathematical Texts
por: Zhang, Yifan, et al.
Publicado: (2024)
por: Zhang, Yifan, et al.
Publicado: (2024)
UniFine: A Unified and Fine-grained Approach for Zero-shot Vision-Language Understanding
por: Wang, Zhecan, et al.
Publicado: (2023)
por: Wang, Zhecan, et al.
Publicado: (2023)
Gate-and-Merge: Zero-shot Compositional Personalization of Vision Language Models
por: Ding, Guodong, et al.
Publicado: (2026)
por: Ding, Guodong, et al.
Publicado: (2026)
Towards Understanding Generalization and Stability Gaps between Centralized and Decentralized Federated Learning
por: Sun, Yan, et al.
Publicado: (2023)
por: Sun, Yan, et al.
Publicado: (2023)
Exploiting GPT-4 Vision for Zero-shot Point Cloud Understanding
por: Sun, Qi, et al.
Publicado: (2024)
por: Sun, Qi, et al.
Publicado: (2024)
Zero-shot Object Navigation with Vision-Language Models Reasoning
por: Wen, Congcong, et al.
Publicado: (2024)
por: Wen, Congcong, et al.
Publicado: (2024)
Towards Unified Multi-granularity Text Detection with Interactive Attention
por: Wan, Xingyu, et al.
Publicado: (2024)
por: Wan, Xingyu, et al.
Publicado: (2024)
Towards Remote Sensing Change Detection with Neural Memory
por: Yang, Zhenyu, et al.
Publicado: (2026)
por: Yang, Zhenyu, et al.
Publicado: (2026)
PUGS: Zero-shot Physical Understanding with Gaussian Splatting
por: Shuai, Yinghao, et al.
Publicado: (2025)
por: Shuai, Yinghao, et al.
Publicado: (2025)
Diverse and Tailored Image Generation for Zero-shot Multi-label Classification
por: Zhang, Kaixin, et al.
Publicado: (2024)
por: Zhang, Kaixin, et al.
Publicado: (2024)
Efficient Token Compression for Vision Transformer with Spatial Information Preserved
por: Mao, Junzhu, et al.
Publicado: (2025)
por: Mao, Junzhu, et al.
Publicado: (2025)
OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion
por: Wang, Zhichao, et al.
Publicado: (2026)
por: Wang, Zhichao, et al.
Publicado: (2026)
SHIFT: An Interdisciplinary Framework for Scaffolding Human Attention and Understanding in Explanatory Tasks
por: Groß, André, et al.
Publicado: (2025)
por: Groß, André, et al.
Publicado: (2025)
Leveraging Cognitive States for Adaptive Scaffolding of Understanding in Explanatory Tasks in HRI
por: Groß, André, et al.
Publicado: (2025)
por: Groß, André, et al.
Publicado: (2025)
VisionLLaMA: A Unified LLaMA Backbone for Vision Tasks
por: Chu, Xiangxiang, et al.
Publicado: (2024)
por: Chu, Xiangxiang, et al.
Publicado: (2024)
A Zero-shot and Few-shot Study of Instruction-Finetuned Large Language Models Applied to Clinical and Biomedical Tasks
por: Labrak, Yanis, et al.
Publicado: (2023)
por: Labrak, Yanis, et al.
Publicado: (2023)
GPT4Vis: What Can GPT-4 Do for Zero-shot Visual Recognition?
por: Wu, Wenhao, et al.
Publicado: (2023)
por: Wu, Wenhao, et al.
Publicado: (2023)
Vision-Flan: Scaling Human-Labeled Tasks in Visual Instruction Tuning
por: Xu, Zhiyang, et al.
Publicado: (2024)
por: Xu, Zhiyang, et al.
Publicado: (2024)
Instruction Embedding: Latent Representations of Instructions Towards Task Identification
por: Li, Yiwei, et al.
Publicado: (2024)
por: Li, Yiwei, et al.
Publicado: (2024)
GET-Zero: Graph Embodiment Transformer for Zero-shot Embodiment Generalization
por: Patel, Austin, et al.
Publicado: (2024)
por: Patel, Austin, et al.
Publicado: (2024)
InstructDubber: Instruction-based Alignment for Zero-shot Movie Dubbing
por: Zhang, Zhedong, et al.
Publicado: (2025)
por: Zhang, Zhedong, et al.
Publicado: (2025)
Towards Zero-shot Point Cloud Anomaly Detection: A Multi-View Projection Framework
por: Cheng, Yuqi, et al.
Publicado: (2024)
por: Cheng, Yuqi, et al.
Publicado: (2024)
SkyEyeGPT: Unifying Remote Sensing Vision-Language Tasks via Instruction Tuning with Large Language Model
por: Zhan, Yang, et al.
Publicado: (2024)
por: Zhan, Yang, et al.
Publicado: (2024)
LaMI-DETR: Open-Vocabulary Detection with Language Model Instruction
por: Du, Penghui, et al.
Publicado: (2024)
por: Du, Penghui, et al.
Publicado: (2024)
ChartCards: A Chart-Metadata Generation Framework for Multi-Task Chart Understanding
por: Wu, Yifan, et al.
Publicado: (2025)
por: Wu, Yifan, et al.
Publicado: (2025)
Towards Understanding the Generalizability of Delayed Stochastic Gradient Descent
por: Deng, Xiaoge, et al.
Publicado: (2023)
por: Deng, Xiaoge, et al.
Publicado: (2023)
Contraction: a Unified Perspective of Correlation Decay and Zero-Freeness of 2-Spin Systems
por: Shao, Shuai, et al.
Publicado: (2019)
por: Shao, Shuai, et al.
Publicado: (2019)
Towards Fine-Grained Robustness: Attention-Guided Test-Time Prompt Tuning for Vision-Language Models
por: Hai, Jia-Wei, et al.
Publicado: (2026)
por: Hai, Jia-Wei, et al.
Publicado: (2026)
Latent Space Disentanglement in Diffusion Transformers Enables Precise Zero-shot Semantic Editing
por: Shuai, Zitao, et al.
Publicado: (2024)
por: Shuai, Zitao, et al.
Publicado: (2024)
InstructNav: Zero-shot System for Generic Instruction Navigation in Unexplored Environment
por: Long, Yuxing, et al.
Publicado: (2024)
por: Long, Yuxing, et al.
Publicado: (2024)
Towards Few-shot Out-of-Distribution Detection
por: Dong, Jiuqing, et al.
Publicado: (2023)
por: Dong, Jiuqing, et al.
Publicado: (2023)
Go to Zero: Towards Zero-shot Motion Generation with Million-scale Data
por: Fan, Ke, et al.
Publicado: (2025)
por: Fan, Ke, et al.
Publicado: (2025)
Conceptrol: Concept Control of Zero-shot Personalized Image Generation
por: He, Qiyuan, et al.
Publicado: (2025)
por: He, Qiyuan, et al.
Publicado: (2025)
Zero-shot Generalizable Incremental Learning for Vision-Language Object Detection
por: Deng, Jieren, et al.
Publicado: (2024)
por: Deng, Jieren, et al.
Publicado: (2024)
Patch-as-Decodable-Token: Towards Unified Multi-Modal Vision Tasks in MLLMs
por: Su, Yongyi, et al.
Publicado: (2025)
por: Su, Yongyi, et al.
Publicado: (2025)
Instance-adaptive Zero-shot Chain-of-Thought Prompting
por: Yuan, Xiaosong, et al.
Publicado: (2024)
por: Yuan, Xiaosong, et al.
Publicado: (2024)
Latent Space Disentanglement in Diffusion Transformers Enables Zero-shot Fine-grained Semantic Editing
por: Shuai, Zitao, et al.
Publicado: (2024)
por: Shuai, Zitao, et al.
Publicado: (2024)
TabPFN for Zero-shot Parametric Engineering Design Generation
por: Wang, Ke, et al.
Publicado: (2026)
por: Wang, Ke, et al.
Publicado: (2026)
Ejemplares similares
-
Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: A Comprehensive Evaluation
por: Yu, Hong-Tao, et al.
Publicado: (2025) -
Anomagic: Crossmodal Prompt-driven Zero-shot Anomaly Generation
por: Jiang, Yuxin, et al.
Publicado: (2025) -
Autonomous Data Selection with Zero-shot Generative Classifiers for Mathematical Texts
por: Zhang, Yifan, et al.
Publicado: (2024) -
UniFine: A Unified and Fine-grained Approach for Zero-shot Vision-Language Understanding
por: Wang, Zhecan, et al.
Publicado: (2023) -
Gate-and-Merge: Zero-shot Compositional Personalization of Vision Language Models
por: Ding, Guodong, et al.
Publicado: (2026)