From Static to Interactive: Adapting Visual in-Context Learners for User-Driven Tasks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Schmidt, Carlos, Reiß, Simon |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Conquering the Retina: Bringing Visual in-Context Learning to OCT
par: Negrini, Alessio, et autres
Publié: (2025)
par: Negrini, Alessio, et autres
Publié: (2025)
Is Visual in-Context Learning for Compositional Medical Tasks within Reach?
par: Reiß, Simon, et autres
Publié: (2025)
par: Reiß, Simon, et autres
Publié: (2025)
Probing Intrinsic Medical Task Relationships: A Contrastive Learning Perspective
par: Muth, Jonas, et autres
Publié: (2026)
par: Muth, Jonas, et autres
Publié: (2026)
GazeGen: Gaze-Driven User Interaction for Visual Content Generation
par: Hsieh, He-Yen, et autres
Publié: (2024)
par: Hsieh, He-Yen, et autres
Publié: (2024)
From Generalist to Specialist: Adapting Vision Language Models via Task-Specific Visual Instruction Tuning
par: Bai, Yang, et autres
Publié: (2024)
par: Bai, Yang, et autres
Publié: (2024)
From Static to Dynamic: Adapting Landmark-Aware Image Models for Facial Expression Recognition in Videos
par: Chen, Yin, et autres
Publié: (2023)
par: Chen, Yin, et autres
Publié: (2023)
Generative Multimodal Models are In-Context Learners
par: Sun, Quan, et autres
Publié: (2023)
par: Sun, Quan, et autres
Publié: (2023)
Video Diffusion Transformers are In-Context Learners
par: Fei, Zhengcong, et autres
Publié: (2024)
par: Fei, Zhengcong, et autres
Publié: (2024)
From Prediction to Explanation: Multimodal, Explainable, and Interactive Deepfake Detection Framework for Non-Expert Users
par: Tariq, Shahroz, et autres
Publié: (2025)
par: Tariq, Shahroz, et autres
Publié: (2025)
From CNN to CNN + RNN: Adapting Visualization Techniques for Time-Series Anomaly Detection
par: Poirier, Fabien
Publié: (2024)
par: Poirier, Fabien
Publié: (2024)
DINO-Tok: Adapting DINO for Visual Tokenizers
par: Jia, Mingkai, et autres
Publié: (2025)
par: Jia, Mingkai, et autres
Publié: (2025)
CaMML: Context-Aware Multimodal Learner for Large Models
par: Chen, Yixin, et autres
Publié: (2024)
par: Chen, Yixin, et autres
Publié: (2024)
Complexity Experts are Task-Discriminative Learners for Any Image Restoration
par: Zamfir, Eduard, et autres
Publié: (2024)
par: Zamfir, Eduard, et autres
Publié: (2024)
MoVA: Adapting Mixture of Vision Experts to Multimodal Context
par: Zong, Zhuofan, et autres
Publié: (2024)
par: Zong, Zhuofan, et autres
Publié: (2024)
From Snapshots to Symphonies: The Evolution of Protein Prediction from Static Structures to Generative Dynamics and Multimodal Interactions
par: Chen, Jingzhi, et autres
Publié: (2026)
par: Chen, Jingzhi, et autres
Publié: (2026)
Rejuvenating image-GPT as Strong Visual Representation Learners
par: Ren, Sucheng, et autres
Publié: (2023)
par: Ren, Sucheng, et autres
Publié: (2023)
VRSO: Visual-Centric Reconstruction for Static Object Annotation
par: Yu, Chenyao, et autres
Publié: (2024)
par: Yu, Chenyao, et autres
Publié: (2024)
Vision-Language In-Context Learning Driven Few-Shot Visual Inspection Model
par: Ueno, Shiryu, et autres
Publié: (2025)
par: Ueno, Shiryu, et autres
Publié: (2025)
Q-Adapt: Adapting LMM for Visual Quality Assessment with Progressive Instruction Tuning
par: Lu, Yiting, et autres
Publié: (2025)
par: Lu, Yiting, et autres
Publié: (2025)
T2T-VICL: Unlocking the Boundaries of Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs
par: Xia, Shao-Jun, et autres
Publié: (2025)
par: Xia, Shao-Jun, et autres
Publié: (2025)
User-Aware Prefix-Tuning is a Good Learner for Personalized Image Captioning
par: Wang, Xuan, et autres
Publié: (2023)
par: Wang, Xuan, et autres
Publié: (2023)
Adapt PointFormer: 3D Point Cloud Analysis via Adapting 2D Visual Transformers
par: Li, Mengke, et autres
Publié: (2024)
par: Li, Mengke, et autres
Publié: (2024)
AdaptCLIP: Adapting CLIP for Universal Visual Anomaly Detection
par: Gao, Bin-Bin, et autres
Publié: (2025)
par: Gao, Bin-Bin, et autres
Publié: (2025)
Enhancing Visual Forced Alignment with Local Context-Aware Feature Extraction and Multi-Task Learning
par: He, Yi, et autres
Publié: (2025)
par: He, Yi, et autres
Publié: (2025)
GMC: A General Framework of Multi-stage Context Learning and Utilization for Visual Detection Tasks
par: Wang, Xuan, et autres
Publié: (2024)
par: Wang, Xuan, et autres
Publié: (2024)
Self-Adapting Large Visual-Language Models to Edge Devices across Visual Modalities
par: Cai, Kaiwen, et autres
Publié: (2024)
par: Cai, Kaiwen, et autres
Publié: (2024)
Every Component Counts: Rethinking the Measure of Success for Medical Semantic Segmentation in Multi-Instance Segmentation Tasks
par: Jaus, Alexander, et autres
Publié: (2024)
par: Jaus, Alexander, et autres
Publié: (2024)
VIAssist: Adapting Multi-modal Large Language Models for Users with Visual Impairments
par: Yang, Bufang, et autres
Publié: (2024)
par: Yang, Bufang, et autres
Publié: (2024)
Exploring Task-Level Optimal Prompts for Visual In-Context Learning
par: Zhu, Yan, et autres
Publié: (2025)
par: Zhu, Yan, et autres
Publié: (2025)
FontCrafter: High-Fidelity Element-Driven Artistic Font Creation with Visual In-Context Generation
par: Luo, Wuyang, et autres
Publié: (2026)
par: Luo, Wuyang, et autres
Publié: (2026)
SGDM: Static-Guided Dynamic Module Make Stronger Visual Models
par: Xing, Wenjie, et autres
Publié: (2024)
par: Xing, Wenjie, et autres
Publié: (2024)
Visualizing the Invisible: Enhancing Radiologist Performance in Breast Mammography via Task-Driven Chromatic Encoding
par: Ye, Hui, et autres
Publié: (2026)
par: Ye, Hui, et autres
Publié: (2026)
ArcSin: Adaptive ranged cosine Similarity injected noise for Language-Driven Visual Tasks
par: Liu, Yang, et autres
Publié: (2024)
par: Liu, Yang, et autres
Publié: (2024)
Adapting Visual-Language Models for Generalizable Anomaly Detection in Medical Images
par: Huang, Chaoqin, et autres
Publié: (2024)
par: Huang, Chaoqin, et autres
Publié: (2024)
CLIP-VG: Self-paced Curriculum Adapting of CLIP for Visual Grounding
par: Xiao, Linhui, et autres
Publié: (2023)
par: Xiao, Linhui, et autres
Publié: (2023)
Unimodal and Multimodal Static Facial Expression Recognition for Virtual Reality Users with EmoHeVRDB
par: Ortmann, Thorben, et autres
Publié: (2024)
par: Ortmann, Thorben, et autres
Publié: (2024)
CLIP Brings Better Features to Visual Aesthetics Learners
par: Xu, Liwu, et autres
Publié: (2023)
par: Xu, Liwu, et autres
Publié: (2023)
VICR: Visual In-Context Restoration for Real-World Image Super-Resolution
par: Zhang, Qichang, et autres
Publié: (2026)
par: Zhang, Qichang, et autres
Publié: (2026)
Embodied-Reasoner: Synergizing Visual Search, Reasoning, and Action for Embodied Interactive Tasks
par: Zhang, Wenqi, et autres
Publié: (2025)
par: Zhang, Wenqi, et autres
Publié: (2025)
Dynamic in Static: Hybrid Visual Correspondence for Self-Supervised Video Object Segmentation
par: Pei, Gensheng, et autres
Publié: (2024)
par: Pei, Gensheng, et autres
Publié: (2024)
Documents similaires
-
Conquering the Retina: Bringing Visual in-Context Learning to OCT
par: Negrini, Alessio, et autres
Publié: (2025) -
Is Visual in-Context Learning for Compositional Medical Tasks within Reach?
par: Reiß, Simon, et autres
Publié: (2025) -
Probing Intrinsic Medical Task Relationships: A Contrastive Learning Perspective
par: Muth, Jonas, et autres
Publié: (2026) -
GazeGen: Gaze-Driven User Interaction for Visual Content Generation
par: Hsieh, He-Yen, et autres
Publié: (2024) -
From Generalist to Specialist: Adapting Vision Language Models via Task-Specific Visual Instruction Tuning
par: Bai, Yang, et autres
Publié: (2024)