GMC: A General Framework of Multi-stage Context Learning and Utilization for Visual Detection Tasks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Xuan, Tang, Hao, Zhu, Zhigang |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Enhancing Visual Forced Alignment with Local Context-Aware Feature Extraction and Multi-Task Learning
par: He, Yi, et autres
Publié: (2025)
par: He, Yi, et autres
Publié: (2025)
VisualCloze: A Universal Image Generation Framework via Visual In-Context Learning
par: Li, Zhong-Yu, et autres
Publié: (2025)
par: Li, Zhong-Yu, et autres
Publié: (2025)
TerraGen: A Unified Multi-Task Layout Generation Framework for Remote Sensing Data Augmentation
par: Tang, Datao, et autres
Publié: (2025)
par: Tang, Datao, et autres
Publié: (2025)
GMC-IQA: Exploiting Global-correlation and Mean-opinion Consistency for No-reference Image Quality Assessment
par: Chen, Zewen, et autres
Publié: (2024)
par: Chen, Zewen, et autres
Publié: (2024)
Exploring Task-Level Optimal Prompts for Visual In-Context Learning
par: Zhu, Yan, et autres
Publié: (2025)
par: Zhu, Yan, et autres
Publié: (2025)
Is Visual in-Context Learning for Compositional Medical Tasks within Reach?
par: Reiß, Simon, et autres
Publié: (2025)
par: Reiß, Simon, et autres
Publié: (2025)
Enhancing Visual In-Context Learning by Multi-Faceted Fusion
par: Liao, Wenwen, et autres
Publié: (2026)
par: Liao, Wenwen, et autres
Publié: (2026)
Mamba Learns in Context: Structure-Aware Domain Generalization for Multi-Task Point Cloud Understanding
par: Jiang, Jincen, et autres
Publié: (2026)
par: Jiang, Jincen, et autres
Publié: (2026)
GrabDAE: An Innovative Framework for Unsupervised Domain Adaptation Utilizing Grab-Mask and Denoise Auto-Encoder
par: Chen, Junzhou, et autres
Publié: (2024)
par: Chen, Junzhou, et autres
Publié: (2024)
Multi-stage feature decorrelation constraints for improving CNN classification performance
par: Zhu, Qiuyu, et autres
Publié: (2023)
par: Zhu, Qiuyu, et autres
Publié: (2023)
Revisiting Multi-Task Visual Representation Learning
par: Di, Shangzhe, et autres
Publié: (2026)
par: Di, Shangzhe, et autres
Publié: (2026)
A Vanilla Multi-Task Framework for Dense Visual Prediction Solution to 1st VCL Challenge -- Multi-Task Robustness Track
par: Chen, Zehui, et autres
Publié: (2024)
par: Chen, Zehui, et autres
Publié: (2024)
Enhancing Visual Grounding and Generalization: A Multi-Task Cycle Training Approach for Vision-Language Models
par: Yang, Xiaoyu, et autres
Publié: (2023)
par: Yang, Xiaoyu, et autres
Publié: (2023)
Beyond Semantics: Rediscovering Spatial Awareness in Vision-Language Models
par: Qi, Jianing, et autres
Publié: (2025)
par: Qi, Jianing, et autres
Publié: (2025)
mmCooper: A Multi-agent Multi-stage Communication-efficient and Collaboration-robust Cooperative Perception Framework
par: Liu, Bingyi, et autres
Publié: (2025)
par: Liu, Bingyi, et autres
Publié: (2025)
Leveraging Visual Tokens for Extended Text Contexts in Multi-Modal Learning
par: Wang, Alex Jinpeng, et autres
Publié: (2024)
par: Wang, Alex Jinpeng, et autres
Publié: (2024)
ICM-Fusion: In-Context Meta-Optimized LoRA Fusion for Multi-Task Adaptation
par: Shao, Yihua, et autres
Publié: (2025)
par: Shao, Yihua, et autres
Publié: (2025)
X-Transfer: A Transfer Learning-Based Framework for GAN-Generated Fake Image Detection
par: Zhang, Lei, et autres
Publié: (2023)
par: Zhang, Lei, et autres
Publié: (2023)
LiSD: An Efficient Multi-Task Learning Framework for LiDAR Segmentation and Detection
par: Xu, Jiahua, et autres
Publié: (2024)
par: Xu, Jiahua, et autres
Publié: (2024)
Align the GAP: Prior-based Unified Multi-Task Remote Physiological Measurement Framework For Domain Generalization and Personalization
par: Wang, Jiyao, et autres
Publié: (2025)
par: Wang, Jiyao, et autres
Publié: (2025)
MC-Bench: A Benchmark for Multi-Context Visual Grounding in the Era of MLLMs
par: Xu, Yunqiu, et autres
Publié: (2024)
par: Xu, Yunqiu, et autres
Publié: (2024)
VFXMaster: Unlocking Dynamic Visual Effect Generation via In-Context Learning
par: Li, Baolu, et autres
Publié: (2025)
par: Li, Baolu, et autres
Publié: (2025)
Structured Context Learning for Generic Event Boundary Detection
par: Gu, Xin, et autres
Publié: (2025)
par: Gu, Xin, et autres
Publié: (2025)
MMTL-UniAD: A Unified Framework for Multimodal and Multi-Task Learning in Assistive Driving Perception
par: Liu, Wenzhuo, et autres
Publié: (2025)
par: Liu, Wenzhuo, et autres
Publié: (2025)
Phrase Grounding-based Style Transfer for Single-Domain Generalized Object Detection
par: Li, Hao, et autres
Publié: (2024)
par: Li, Hao, et autres
Publié: (2024)
An Efficient and Effective Transformer Decoder-Based Framework for Multi-Task Visual Grounding
par: Chen, Wei, et autres
Publié: (2024)
par: Chen, Wei, et autres
Publié: (2024)
Progressive Language-guided Visual Learning for Multi-Task Visual Grounding
par: Wang, Jingchao, et autres
Publié: (2025)
par: Wang, Jingchao, et autres
Publié: (2025)
A Simple Image Segmentation Framework via In-Context Examples
par: Liu, Yang, et autres
Publié: (2024)
par: Liu, Yang, et autres
Publié: (2024)
Amped: Adaptive Multi-stage Non-edge Pruning for Edge Detection
par: Gao, Yuhan, et autres
Publié: (2026)
par: Gao, Yuhan, et autres
Publié: (2026)
VrdONE: One-stage Video Visual Relation Detection
par: Jiang, Xinjie, et autres
Publié: (2024)
par: Jiang, Xinjie, et autres
Publié: (2024)
FullDiT: Multi-Task Video Generative Foundation Model with Full Attention
par: Ju, Xuan, et autres
Publié: (2025)
par: Ju, Xuan, et autres
Publié: (2025)
StoryImager: A Unified and Efficient Framework for Coherent Story Visualization and Completion
par: Tao, Ming, et autres
Publié: (2024)
par: Tao, Ming, et autres
Publié: (2024)
VISTA: A Visual Analytics Framework to Enhance Foundation Model-Generated Data Labels
par: Xuan, Xiwei, et autres
Publié: (2025)
par: Xuan, Xiwei, et autres
Publié: (2025)
Hallucinate, Ground, Repeat: A Framework for Generalized Visual Relationship Detection
par: Vellamcheti, Shanmukha, et autres
Publié: (2025)
par: Vellamcheti, Shanmukha, et autres
Publié: (2025)
UniVAD: A Training-free Unified Model for Few-shot Visual Anomaly Detection
par: Gu, Zhaopeng, et autres
Publié: (2024)
par: Gu, Zhaopeng, et autres
Publié: (2024)
VinDr-CXR-VQA: A Visual Question Answering Dataset for Explainable Chest X-Ray Analysis with Multi-Task Learning
par: Nguyen, Dang H., et autres
Publié: (2025)
par: Nguyen, Dang H., et autres
Publié: (2025)
Visual Context-Aware Person Fall Detection
par: Nagaj, Aleksander, et autres
Publié: (2024)
par: Nagaj, Aleksander, et autres
Publié: (2024)
A Stepwise Distillation Learning Strategy for Non-differentiable Visual Programming Frameworks on Visual Reasoning Tasks
par: Wan, Wentao, et autres
Publié: (2023)
par: Wan, Wentao, et autres
Publié: (2023)
CAD 100K: A Comprehensive Multi-Task Dataset for Car Related Visual Anomaly Detection
par: Pang, Jiahua, et autres
Publié: (2026)
par: Pang, Jiahua, et autres
Publié: (2026)
Resolving Task Objective Conflicts in Unified Model via Task-Aware Mixture-of-Experts
par: Zhang, Jiaxing, et autres
Publié: (2025)
par: Zhang, Jiaxing, et autres
Publié: (2025)
Documents similaires
-
Enhancing Visual Forced Alignment with Local Context-Aware Feature Extraction and Multi-Task Learning
par: He, Yi, et autres
Publié: (2025) -
VisualCloze: A Universal Image Generation Framework via Visual In-Context Learning
par: Li, Zhong-Yu, et autres
Publié: (2025) -
TerraGen: A Unified Multi-Task Layout Generation Framework for Remote Sensing Data Augmentation
par: Tang, Datao, et autres
Publié: (2025) -
GMC-IQA: Exploiting Global-correlation and Mean-opinion Consistency for No-reference Image Quality Assessment
par: Chen, Zewen, et autres
Publié: (2024) -
Exploring Task-Level Optimal Prompts for Visual In-Context Learning
par: Zhu, Yan, et autres
Publié: (2025)