Multi-Modal Proxy Learning Towards Personalized Visual Multiple Clustering
Fuente:
arXiv
Saved in:
| Main Authors: | Yao, Jiawei, Qian, Qi, Hu, Juhua |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Dual-disentangled Deep Multiple Clustering
by: Yao, Jiawei, et al.
Published: (2024)
by: Yao, Jiawei, et al.
Published: (2024)
Text-Guided Mixup Towards Long-Tailed Image Categorization
by: Franklin, Richard, et al.
Published: (2024)
by: Franklin, Richard, et al.
Published: (2024)
Customized Multiple Clustering via Multi-Modal Subspace Proxy Learning
by: Yao, Jiawei, et al.
Published: (2024)
by: Yao, Jiawei, et al.
Published: (2024)
Online Zero-Shot Classification with CLIP
by: Qian, Qi, et al.
Published: (2024)
by: Qian, Qi, et al.
Published: (2024)
SeA: Semantic Adversarial Augmentation for Last Layer Features from Unsupervised Representation Learning
by: Qian, Qi, et al.
Published: (2024)
by: Qian, Qi, et al.
Published: (2024)
Rethinking Model Efficiency: Multi-Agent Inference with Large Models
by: Dong, Sixun, et al.
Published: (2026)
by: Dong, Sixun, et al.
Published: (2026)
SimInversion: A Simple Framework for Inversion-Based Text-to-Image Editing
by: Qian, Qi, et al.
Published: (2024)
by: Qian, Qi, et al.
Published: (2024)
Learning Visual Proxy for Compositional Zero-Shot Learning
by: Zhang, Shiyu, et al.
Published: (2025)
by: Zhang, Shiyu, et al.
Published: (2025)
MMTok: Multimodal Coverage Maximization for Efficient Inference of VLMs
by: Dong, Sixun, et al.
Published: (2025)
by: Dong, Sixun, et al.
Published: (2025)
Towards Personalized Multi-Modal MRI Synthesis across Heterogeneous Datasets
by: Zhang, Yue, et al.
Published: (2026)
by: Zhang, Yue, et al.
Published: (2026)
M4: Multi-Proxy Multi-Gate Mixture of Experts Network for Multiple Instance Learning in Histopathology Image Analysis
by: Li, Junyu, et al.
Published: (2024)
by: Li, Junyu, et al.
Published: (2024)
RFL-CDNet: Towards Accurate Change Detection via Richer Feature Learning
by: Gan, Yuhang, et al.
Published: (2024)
by: Gan, Yuhang, et al.
Published: (2024)
Dynamic Modality-Camera Invariant Clustering for Unsupervised Visible-Infrared Person Re-identification
by: Yang, Yiming, et al.
Published: (2024)
by: Yang, Yiming, et al.
Published: (2024)
Advancing Fine-Grained Visual Understanding with Multi-Scale Alignment in Multi-Modal Models
by: Wang, Wei, et al.
Published: (2024)
by: Wang, Wei, et al.
Published: (2024)
Towards Open Domain Text-Driven Synthesis of Multi-Person Motions
by: Shan, Mengyi, et al.
Published: (2024)
by: Shan, Mengyi, et al.
Published: (2024)
MUVR: A Multi-Modal Untrimmed Video Retrieval Benchmark with Multi-Level Visual Correspondence
by: Feng, Yue, et al.
Published: (2025)
by: Feng, Yue, et al.
Published: (2025)
Visible-Infrared Person Re-Identification via Patch-Mixed Cross-Modality Learning
by: Qian, Zhihao, et al.
Published: (2023)
by: Qian, Zhihao, et al.
Published: (2023)
Memory Proxy Maps for Visual Navigation
by: Johnson, Faith, et al.
Published: (2024)
by: Johnson, Faith, et al.
Published: (2024)
SDSTrack: Self-Distillation Symmetric Adapter Learning for Multi-Modal Visual Object Tracking
by: Hou, Xiaojun, et al.
Published: (2024)
by: Hou, Xiaojun, et al.
Published: (2024)
Segment Anything with Multiple Modalities
by: Xiao, Aoran, et al.
Published: (2024)
by: Xiao, Aoran, et al.
Published: (2024)
Referring Video Object Segmentation with Cross-Modality Proxy Queries
by: Sun, Baoli, et al.
Published: (2025)
by: Sun, Baoli, et al.
Published: (2025)
PGformer: Proxy-Bridged Game Transformer for Multi-Person Highly Interactive Extreme Motion Prediction
by: Fang, Yanwen, et al.
Published: (2023)
by: Fang, Yanwen, et al.
Published: (2023)
FusionSAM: Visual Multi-Modal Learning with Segment Anything
by: Li, Daixun, et al.
Published: (2024)
by: Li, Daixun, et al.
Published: (2024)
Multi-label Cluster Discrimination for Visual Representation Learning
by: An, Xiang, et al.
Published: (2024)
by: An, Xiang, et al.
Published: (2024)
Narrative Weaver: Towards Controllable Long-Range Visual Consistency with Multi-Modal Conditioning
by: Yao, Zhengjian, et al.
Published: (2026)
by: Yao, Zhengjian, et al.
Published: (2026)
ProxyTransformation: Preshaping Point Cloud Manifold With Proxy Attention For 3D Visual Grounding
by: Peng, Qihang, et al.
Published: (2025)
by: Peng, Qihang, et al.
Published: (2025)
Visual Question Answering on Multiple Remote Sensing Image Modalities
by: Boussaid, Hichem, et al.
Published: (2025)
by: Boussaid, Hichem, et al.
Published: (2025)
MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing
by: Zheng, Junjie, et al.
Published: (2025)
by: Zheng, Junjie, et al.
Published: (2025)
ProxyImg: Towards Highly-Controllable Image Representation via Hierarchical Disentangled Proxy Embedding
by: Chen, Ye, et al.
Published: (2026)
by: Chen, Ye, et al.
Published: (2026)
Leveraging Visual Tokens for Extended Text Contexts in Multi-Modal Learning
by: Wang, Alex Jinpeng, et al.
Published: (2024)
by: Wang, Alex Jinpeng, et al.
Published: (2024)
EvoCut: Multi-Layer Evolution-Aware Visual Token Compression for Efficient Large Vision-Language Models
by: Lu, Hongyu, et al.
Published: (2026)
by: Lu, Hongyu, et al.
Published: (2026)
Towards Balanced Multi-Modal Learning in 3D Human Pose Estimation
by: Qi, Mengshi, et al.
Published: (2025)
by: Qi, Mengshi, et al.
Published: (2025)
MultiRef: Controllable Image Generation with Multiple Visual References
by: Chen, Ruoxi, et al.
Published: (2025)
by: Chen, Ruoxi, et al.
Published: (2025)
COMMA: Co-Articulated Multi-Modal Learning
by: Hu, Lianyu, et al.
Published: (2023)
by: Hu, Lianyu, et al.
Published: (2023)
DiffProxy: Multi-View Human Mesh Recovery via Diffusion-Generated Dense Proxies
by: Wang, Renke, et al.
Published: (2026)
by: Wang, Renke, et al.
Published: (2026)
Unified Sequence-to-Sequence Learning for Single- and Multi-Modal Visual Object Tracking
by: Chen, Xin, et al.
Published: (2023)
by: Chen, Xin, et al.
Published: (2023)
Can Text-to-image Model Assist Multi-modal Learning for Visual Recognition with Visual Modality Missing?
by: Feng, Tiantian, et al.
Published: (2024)
by: Feng, Tiantian, et al.
Published: (2024)
VDLF-Net: Variational Feature Fusion for Adaptive and Few-Shot Visual Learning
by: Yan, Jiawei
Published: (2026)
by: Yan, Jiawei
Published: (2026)
MMP: Towards Robust Multi-Modal Learning with Masked Modality Projection
by: Nezakati, Niki, et al.
Published: (2024)
by: Nezakati, Niki, et al.
Published: (2024)
Domain Camera Adaptation and Collaborative Multiple Feature Clustering for Unsupervised Person Re-ID
by: Tu, Yuanpeng
Published: (2022)
by: Tu, Yuanpeng
Published: (2022)
Similar Items
-
Dual-disentangled Deep Multiple Clustering
by: Yao, Jiawei, et al.
Published: (2024) -
Text-Guided Mixup Towards Long-Tailed Image Categorization
by: Franklin, Richard, et al.
Published: (2024) -
Customized Multiple Clustering via Multi-Modal Subspace Proxy Learning
by: Yao, Jiawei, et al.
Published: (2024) -
Online Zero-Shot Classification with CLIP
by: Qian, Qi, et al.
Published: (2024) -
SeA: Semantic Adversarial Augmentation for Last Layer Features from Unsupervised Representation Learning
by: Qian, Qi, et al.
Published: (2024)