GMC: A General Framework of Multi-stage Context Learning and Utilization for Visual Detection Tasks
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Xuan, Tang, Hao, Zhu, Zhigang |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Enhancing Visual Forced Alignment with Local Context-Aware Feature Extraction and Multi-Task Learning
by: He, Yi, et al.
Published: (2025)
by: He, Yi, et al.
Published: (2025)
VisualCloze: A Universal Image Generation Framework via Visual In-Context Learning
by: Li, Zhong-Yu, et al.
Published: (2025)
by: Li, Zhong-Yu, et al.
Published: (2025)
TerraGen: A Unified Multi-Task Layout Generation Framework for Remote Sensing Data Augmentation
by: Tang, Datao, et al.
Published: (2025)
by: Tang, Datao, et al.
Published: (2025)
GMC-IQA: Exploiting Global-correlation and Mean-opinion Consistency for No-reference Image Quality Assessment
by: Chen, Zewen, et al.
Published: (2024)
by: Chen, Zewen, et al.
Published: (2024)
Exploring Task-Level Optimal Prompts for Visual In-Context Learning
by: Zhu, Yan, et al.
Published: (2025)
by: Zhu, Yan, et al.
Published: (2025)
Is Visual in-Context Learning for Compositional Medical Tasks within Reach?
by: Reiß, Simon, et al.
Published: (2025)
by: Reiß, Simon, et al.
Published: (2025)
Enhancing Visual In-Context Learning by Multi-Faceted Fusion
by: Liao, Wenwen, et al.
Published: (2026)
by: Liao, Wenwen, et al.
Published: (2026)
Mamba Learns in Context: Structure-Aware Domain Generalization for Multi-Task Point Cloud Understanding
by: Jiang, Jincen, et al.
Published: (2026)
by: Jiang, Jincen, et al.
Published: (2026)
GrabDAE: An Innovative Framework for Unsupervised Domain Adaptation Utilizing Grab-Mask and Denoise Auto-Encoder
by: Chen, Junzhou, et al.
Published: (2024)
by: Chen, Junzhou, et al.
Published: (2024)
Multi-stage feature decorrelation constraints for improving CNN classification performance
by: Zhu, Qiuyu, et al.
Published: (2023)
by: Zhu, Qiuyu, et al.
Published: (2023)
Revisiting Multi-Task Visual Representation Learning
by: Di, Shangzhe, et al.
Published: (2026)
by: Di, Shangzhe, et al.
Published: (2026)
A Vanilla Multi-Task Framework for Dense Visual Prediction Solution to 1st VCL Challenge -- Multi-Task Robustness Track
by: Chen, Zehui, et al.
Published: (2024)
by: Chen, Zehui, et al.
Published: (2024)
Enhancing Visual Grounding and Generalization: A Multi-Task Cycle Training Approach for Vision-Language Models
by: Yang, Xiaoyu, et al.
Published: (2023)
by: Yang, Xiaoyu, et al.
Published: (2023)
Beyond Semantics: Rediscovering Spatial Awareness in Vision-Language Models
by: Qi, Jianing, et al.
Published: (2025)
by: Qi, Jianing, et al.
Published: (2025)
mmCooper: A Multi-agent Multi-stage Communication-efficient and Collaboration-robust Cooperative Perception Framework
by: Liu, Bingyi, et al.
Published: (2025)
by: Liu, Bingyi, et al.
Published: (2025)
Leveraging Visual Tokens for Extended Text Contexts in Multi-Modal Learning
by: Wang, Alex Jinpeng, et al.
Published: (2024)
by: Wang, Alex Jinpeng, et al.
Published: (2024)
ICM-Fusion: In-Context Meta-Optimized LoRA Fusion for Multi-Task Adaptation
by: Shao, Yihua, et al.
Published: (2025)
by: Shao, Yihua, et al.
Published: (2025)
X-Transfer: A Transfer Learning-Based Framework for GAN-Generated Fake Image Detection
by: Zhang, Lei, et al.
Published: (2023)
by: Zhang, Lei, et al.
Published: (2023)
LiSD: An Efficient Multi-Task Learning Framework for LiDAR Segmentation and Detection
by: Xu, Jiahua, et al.
Published: (2024)
by: Xu, Jiahua, et al.
Published: (2024)
Align the GAP: Prior-based Unified Multi-Task Remote Physiological Measurement Framework For Domain Generalization and Personalization
by: Wang, Jiyao, et al.
Published: (2025)
by: Wang, Jiyao, et al.
Published: (2025)
MC-Bench: A Benchmark for Multi-Context Visual Grounding in the Era of MLLMs
by: Xu, Yunqiu, et al.
Published: (2024)
by: Xu, Yunqiu, et al.
Published: (2024)
VFXMaster: Unlocking Dynamic Visual Effect Generation via In-Context Learning
by: Li, Baolu, et al.
Published: (2025)
by: Li, Baolu, et al.
Published: (2025)
Structured Context Learning for Generic Event Boundary Detection
by: Gu, Xin, et al.
Published: (2025)
by: Gu, Xin, et al.
Published: (2025)
MMTL-UniAD: A Unified Framework for Multimodal and Multi-Task Learning in Assistive Driving Perception
by: Liu, Wenzhuo, et al.
Published: (2025)
by: Liu, Wenzhuo, et al.
Published: (2025)
Phrase Grounding-based Style Transfer for Single-Domain Generalized Object Detection
by: Li, Hao, et al.
Published: (2024)
by: Li, Hao, et al.
Published: (2024)
An Efficient and Effective Transformer Decoder-Based Framework for Multi-Task Visual Grounding
by: Chen, Wei, et al.
Published: (2024)
by: Chen, Wei, et al.
Published: (2024)
Progressive Language-guided Visual Learning for Multi-Task Visual Grounding
by: Wang, Jingchao, et al.
Published: (2025)
by: Wang, Jingchao, et al.
Published: (2025)
A Simple Image Segmentation Framework via In-Context Examples
by: Liu, Yang, et al.
Published: (2024)
by: Liu, Yang, et al.
Published: (2024)
Amped: Adaptive Multi-stage Non-edge Pruning for Edge Detection
by: Gao, Yuhan, et al.
Published: (2026)
by: Gao, Yuhan, et al.
Published: (2026)
VrdONE: One-stage Video Visual Relation Detection
by: Jiang, Xinjie, et al.
Published: (2024)
by: Jiang, Xinjie, et al.
Published: (2024)
FullDiT: Multi-Task Video Generative Foundation Model with Full Attention
by: Ju, Xuan, et al.
Published: (2025)
by: Ju, Xuan, et al.
Published: (2025)
StoryImager: A Unified and Efficient Framework for Coherent Story Visualization and Completion
by: Tao, Ming, et al.
Published: (2024)
by: Tao, Ming, et al.
Published: (2024)
VISTA: A Visual Analytics Framework to Enhance Foundation Model-Generated Data Labels
by: Xuan, Xiwei, et al.
Published: (2025)
by: Xuan, Xiwei, et al.
Published: (2025)
Hallucinate, Ground, Repeat: A Framework for Generalized Visual Relationship Detection
by: Vellamcheti, Shanmukha, et al.
Published: (2025)
by: Vellamcheti, Shanmukha, et al.
Published: (2025)
UniVAD: A Training-free Unified Model for Few-shot Visual Anomaly Detection
by: Gu, Zhaopeng, et al.
Published: (2024)
by: Gu, Zhaopeng, et al.
Published: (2024)
VinDr-CXR-VQA: A Visual Question Answering Dataset for Explainable Chest X-Ray Analysis with Multi-Task Learning
by: Nguyen, Dang H., et al.
Published: (2025)
by: Nguyen, Dang H., et al.
Published: (2025)
Visual Context-Aware Person Fall Detection
by: Nagaj, Aleksander, et al.
Published: (2024)
by: Nagaj, Aleksander, et al.
Published: (2024)
A Stepwise Distillation Learning Strategy for Non-differentiable Visual Programming Frameworks on Visual Reasoning Tasks
by: Wan, Wentao, et al.
Published: (2023)
by: Wan, Wentao, et al.
Published: (2023)
CAD 100K: A Comprehensive Multi-Task Dataset for Car Related Visual Anomaly Detection
by: Pang, Jiahua, et al.
Published: (2026)
by: Pang, Jiahua, et al.
Published: (2026)
Resolving Task Objective Conflicts in Unified Model via Task-Aware Mixture-of-Experts
by: Zhang, Jiaxing, et al.
Published: (2025)
by: Zhang, Jiaxing, et al.
Published: (2025)
Similar Items
-
Enhancing Visual Forced Alignment with Local Context-Aware Feature Extraction and Multi-Task Learning
by: He, Yi, et al.
Published: (2025) -
VisualCloze: A Universal Image Generation Framework via Visual In-Context Learning
by: Li, Zhong-Yu, et al.
Published: (2025) -
TerraGen: A Unified Multi-Task Layout Generation Framework for Remote Sensing Data Augmentation
by: Tang, Datao, et al.
Published: (2025) -
GMC-IQA: Exploiting Global-correlation and Mean-opinion Consistency for No-reference Image Quality Assessment
by: Chen, Zewen, et al.
Published: (2024) -
Exploring Task-Level Optimal Prompts for Visual In-Context Learning
by: Zhu, Yan, et al.
Published: (2025)