Underlying Semantic Diffusion for Effective and Efficient In-Context Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ji, Zhong, Cao, Weilong, Zhang, Yan, Pang, Yanwei, Han, Jungong, Li, Xuelong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
iEBAKER: Improved Remote Sensing Image-Text Retrieval Framework via Eliminate Before Align and Keyword Explicit Reasoning
par: Zhang, Yan, et autres
Publié: (2025)
par: Zhang, Yan, et autres
Publié: (2025)
Multi-Stage Knowledge Integration of Vision-Language Models for Continual Learning
par: Zhang, Hongsheng, et autres
Publié: (2024)
par: Zhang, Hongsheng, et autres
Publié: (2024)
Interpretable Few-Shot Image Classification via Prototypical Concept-Guided Mixture of LoRA Experts
par: Ji, Zhong, et autres
Publié: (2025)
par: Ji, Zhong, et autres
Publié: (2025)
Raformer: Redundancy-Aware Transformer for Video Wire Inpainting
par: Ji, Zhong, et autres
Publié: (2024)
par: Ji, Zhong, et autres
Publié: (2024)
A Fresh Look at Generalized Category Discovery through Non-negative Matrix Factorization
par: Ji, Zhong, et autres
Publié: (2024)
par: Ji, Zhong, et autres
Publié: (2024)
Hierarchical Matching and Reasoning for Multi-Query Image Retrieval
par: Ji, Zhong, et autres
Publié: (2023)
par: Ji, Zhong, et autres
Publié: (2023)
Optimal Transport Adapter Tuning for Bridging Modality Gaps in Few-Shot Remote Sensing Scene Classification
par: Ji, Zhong, et autres
Publié: (2025)
par: Ji, Zhong, et autres
Publié: (2025)
Transformer-based stereo-aware 3D object detection from binocular images
par: Sun, Hanqing, et autres
Publié: (2023)
par: Sun, Hanqing, et autres
Publié: (2023)
Deep Intra-Image Contrastive Learning for Weakly Supervised One-Step Person Search
par: Wang, Jiabei, et autres
Publié: (2023)
par: Wang, Jiabei, et autres
Publié: (2023)
VFMM3D: Releasing the Potential of Image by Vision Foundation Model for Monocular 3D Object Detection
par: Ding, Bonan, et autres
Publié: (2024)
par: Ding, Bonan, et autres
Publié: (2024)
Efficient Learned Image Compression without Entropy Coding
par: Cao, Hao, et autres
Publié: (2026)
par: Cao, Hao, et autres
Publié: (2026)
SimMLM: A Simple Framework for Multi-modal Learning with Missing Modality
par: Li, Sijie, et autres
Publié: (2025)
par: Li, Sijie, et autres
Publié: (2025)
WaveFace: Authentic Face Restoration with Efficient Frequency Recovery
par: Miao, Yunqi, et autres
Publié: (2024)
par: Miao, Yunqi, et autres
Publié: (2024)
CLIPer: Hierarchically Improving Spatial Representation of CLIP for Open-Vocabulary Semantic Segmentation
par: Sun, Lin, et autres
Publié: (2024)
par: Sun, Lin, et autres
Publié: (2024)
Implicit and Explicit Language Guidance for Diffusion-based Visual Perception
par: Wang, Hefeng, et autres
Publié: (2024)
par: Wang, Hefeng, et autres
Publié: (2024)
SED: A Simple Encoder-Decoder for Open-Vocabulary Semantic Segmentation
par: Xie, Bin, et autres
Publié: (2023)
par: Xie, Bin, et autres
Publié: (2023)
ER-LoRA: Effective-Rank Guided Adaptation for Weather-Generalized Depth Estimation
par: Yan, Weilong, et autres
Publié: (2025)
par: Yan, Weilong, et autres
Publié: (2025)
Virtual Category Learning: A Semi-Supervised Learning Method for Dense Prediction with Extremely Limited Labels
par: Chen, Changrui, et autres
Publié: (2023)
par: Chen, Changrui, et autres
Publié: (2023)
Dual Contrastive Network for Few-Shot Remote Sensing Image Scene Classification
par: Ji, Zhong, et autres
Publié: (2026)
par: Ji, Zhong, et autres
Publié: (2026)
HarmoniDiff-RS: Training-Free Diffusion Harmonization for Satellite Image Composition
par: Zhuang, Xiaoqi, et autres
Publié: (2026)
par: Zhuang, Xiaoqi, et autres
Publié: (2026)
Re-Prompting SAM 3 via Object Retrieval: 3rd of the 5th PVUW MOSE Track
par: Gao, Mingqi, et autres
Publié: (2026)
par: Gao, Mingqi, et autres
Publié: (2026)
From Missing Pieces to Masterpieces: Image Completion with Context-Adaptive Diffusion
par: Shamsolmoali, Pourya, et autres
Publié: (2025)
par: Shamsolmoali, Pourya, et autres
Publié: (2025)
On Exploring PDE Modeling for Point Cloud Video Representation Learning
par: Huang, Zhuoxu, et autres
Publié: (2024)
par: Huang, Zhuoxu, et autres
Publié: (2024)
Paving the Way for Point Cloud Video Representation Learning Using A PDE Model
par: Huang, Zhuoxu, et autres
Publié: (2026)
par: Huang, Zhuoxu, et autres
Publié: (2026)
Extremely Simple Out-of-distribution Detection for Audio-visual Generalized Zero-shot Learning
par: Liu, Yang, et autres
Publié: (2025)
par: Liu, Yang, et autres
Publié: (2025)
SAM-Body4D: Training-Free 4D Human Body Mesh Recovery from Videos
par: Gao, Mingqi, et autres
Publié: (2025)
par: Gao, Mingqi, et autres
Publié: (2025)
Point Linguist Model: Segment Any Object via Bridged Large 3D-Language Model
par: Huang, Zhuoxu, et autres
Publié: (2025)
par: Huang, Zhuoxu, et autres
Publié: (2025)
ProGIC: Progressive and Lightweight Generative Image Compression with Residual Vector Quantization
par: Cao, Hao, et autres
Publié: (2026)
par: Cao, Hao, et autres
Publié: (2026)
THU-Warwick Submission for EPIC-KITCHEN Challenge 2025: Semi-Supervised Video Object Segmentation
par: Gao, Mingqi, et autres
Publié: (2025)
par: Gao, Mingqi, et autres
Publié: (2025)
Part-Whole Relational Fusion Towards Multi-Modal Scene Understanding
par: Liu, Yi, et autres
Publié: (2024)
par: Liu, Yi, et autres
Publié: (2024)
FGAseg: Fine-Grained Pixel-Text Alignment for Open-Vocabulary Semantic Segmentation
par: Li, Bingyu, et autres
Publié: (2025)
par: Li, Bingyu, et autres
Publié: (2025)
Context Matters: Learning Global Semantics via Object-Centric Representation
par: Zhong, Jike, et autres
Publié: (2025)
par: Zhong, Jike, et autres
Publié: (2025)
U3M: Unbiased Multiscale Modal Fusion Model for Multimodal Semantic Segmentation
par: Li, Bingyu, et autres
Publié: (2024)
par: Li, Bingyu, et autres
Publié: (2024)
Transferable 3D Adversarial Shape Completion using Diffusion Models
par: Dai, Xuelong, et autres
Publié: (2024)
par: Dai, Xuelong, et autres
Publié: (2024)
[CLS] Token Tells Everything Needed for Training-free Efficient MLLMs
par: Wang, Ao, et autres
Publié: (2024)
par: Wang, Ao, et autres
Publié: (2024)
Unlocking the Potential of Diffusion Priors in Blind Face Restoration
par: Miao, Yunqi, et autres
Publié: (2025)
par: Miao, Yunqi, et autres
Publié: (2025)
EgoLCD: Egocentric Video Generation with Long Context Diffusion
par: Zhang, Liuzhou, et autres
Publié: (2025)
par: Zhang, Liuzhou, et autres
Publié: (2025)
SNNSIR: A Simple Spiking Neural Network for Stereo Image Restoration
par: Xu, Ronghua, et autres
Publié: (2025)
par: Xu, Ronghua, et autres
Publié: (2025)
CLIP-VIS: Adapting CLIP for Open-Vocabulary Video Instance Segmentation
par: Zhu, Wenqi, et autres
Publié: (2024)
par: Zhu, Wenqi, et autres
Publié: (2024)
Unbiased Max-Min Embedding Classification for Transductive Few-Shot Learning: Clustering and Classification Are All You Need
par: Liu, Yang, et autres
Publié: (2025)
par: Liu, Yang, et autres
Publié: (2025)
Documents similaires
-
iEBAKER: Improved Remote Sensing Image-Text Retrieval Framework via Eliminate Before Align and Keyword Explicit Reasoning
par: Zhang, Yan, et autres
Publié: (2025) -
Multi-Stage Knowledge Integration of Vision-Language Models for Continual Learning
par: Zhang, Hongsheng, et autres
Publié: (2024) -
Interpretable Few-Shot Image Classification via Prototypical Concept-Guided Mixture of LoRA Experts
par: Ji, Zhong, et autres
Publié: (2025) -
Raformer: Redundancy-Aware Transformer for Video Wire Inpainting
par: Ji, Zhong, et autres
Publié: (2024) -
A Fresh Look at Generalized Category Discovery through Non-negative Matrix Factorization
par: Ji, Zhong, et autres
Publié: (2024)