Neural Clustering based Visual Representation Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Guikun, Li, Xia, Yang, Yi, Wang, Wenguan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SinkTrack: Attention Sink based Context Anchoring for Large Language Models
di: Liu, Xu, et al.
Pubblicazione: (2026)
di: Liu, Xu, et al.
Pubblicazione: (2026)
Hydra-SGG: Hybrid Relation Assignment for One-stage Scene Graph Generation
di: Chen, Minghan, et al.
Pubblicazione: (2024)
di: Chen, Minghan, et al.
Pubblicazione: (2024)
A Survey on 3D Gaussian Splatting
di: Chen, Guikun, et al.
Pubblicazione: (2024)
di: Chen, Guikun, et al.
Pubblicazione: (2024)
Scene Graph Generation with Role-Playing Large Language Models
di: Chen, Guikun, et al.
Pubblicazione: (2024)
di: Chen, Guikun, et al.
Pubblicazione: (2024)
DoraemonGPT: Toward Understanding Dynamic Scenes with Large Language Models (Exemplified as A Video Agent)
di: Yang, Zongxin, et al.
Pubblicazione: (2024)
di: Yang, Zongxin, et al.
Pubblicazione: (2024)
Volumetric Environment Representation for Vision-Language Navigation
di: Liu, Rui, et al.
Pubblicazione: (2024)
di: Liu, Rui, et al.
Pubblicazione: (2024)
Clustering Propagation for Universal Medical Image Segmentation
di: Ding, Yuhang, et al.
Pubblicazione: (2024)
di: Ding, Yuhang, et al.
Pubblicazione: (2024)
Learning Clustering-based Prototypes for Compositional Zero-shot Learning
di: Qu, Hongyu, et al.
Pubblicazione: (2025)
di: Qu, Hongyu, et al.
Pubblicazione: (2025)
Compositional Zero-shot Learning via Progressive Language-based Observations
di: Li, Lin, et al.
Pubblicazione: (2023)
di: Li, Lin, et al.
Pubblicazione: (2023)
Human-Object Interaction Detection Collaborated with Large Relation-driven Diffusion Models
di: Li, Liulei, et al.
Pubblicazione: (2024)
di: Li, Liulei, et al.
Pubblicazione: (2024)
Shape2Scene: 3D Scene Representation Learning Through Pre-training on Shape Data
di: Feng, Tuo, et al.
Pubblicazione: (2024)
di: Feng, Tuo, et al.
Pubblicazione: (2024)
Region-based Cluster Discrimination for Visual Representation Learning
di: Xie, Yin, et al.
Pubblicazione: (2025)
di: Xie, Yin, et al.
Pubblicazione: (2025)
DIFFVSGG: Diffusion-Driven Online Video Scene Graph Generation
di: Chen, Mu, et al.
Pubblicazione: (2025)
di: Chen, Mu, et al.
Pubblicazione: (2025)
Decomposed Prototype Learning for Few-Shot Scene Graph Generation
di: Li, Xingchen, et al.
Pubblicazione: (2023)
di: Li, Xingchen, et al.
Pubblicazione: (2023)
Vision-Language Navigation with Energy-Based Policy
di: Liu, Rui, et al.
Pubblicazione: (2024)
di: Liu, Rui, et al.
Pubblicazione: (2024)
Visual Knowledge in the Big Model Era: Retrospect and Prospect
di: Wang, Wenguan, et al.
Pubblicazione: (2024)
di: Wang, Wenguan, et al.
Pubblicazione: (2024)
Compositional Feature Augmentation for Unbiased Scene Graph Generation
di: Li, Lin, et al.
Pubblicazione: (2023)
di: Li, Lin, et al.
Pubblicazione: (2023)
A Survey of World Models for Autonomous Driving
di: Feng, Tuo, et al.
Pubblicazione: (2025)
di: Feng, Tuo, et al.
Pubblicazione: (2025)
Multi-label Cluster Discrimination for Visual Representation Learning
di: An, Xiang, et al.
Pubblicazione: (2024)
di: An, Xiang, et al.
Pubblicazione: (2024)
Neural-MCRL: Neural Multimodal Contrastive Representation Learning for EEG-based Visual Decoding
di: Li, Yueyang, et al.
Pubblicazione: (2024)
di: Li, Yueyang, et al.
Pubblicazione: (2024)
LSK3DNet: Towards Effective and Efficient 3D Perception with Large Sparse Kernels
di: Feng, Tuo, et al.
Pubblicazione: (2024)
di: Feng, Tuo, et al.
Pubblicazione: (2024)
Navigation Instruction Generation with BEV Perception and Large Language Models
di: Fan, Sheng, et al.
Pubblicazione: (2024)
di: Fan, Sheng, et al.
Pubblicazione: (2024)
Learning Human-Object Interaction as Groups
di: Hong, Jiajun, et al.
Pubblicazione: (2025)
di: Hong, Jiajun, et al.
Pubblicazione: (2025)
Mutual Learning for Acoustic Matching and Dereverberation via Visual Scene-driven Diffusion
di: Ma, Jian, et al.
Pubblicazione: (2024)
di: Ma, Jian, et al.
Pubblicazione: (2024)
Learning 3D Representations for Spatial Intelligence from Unposed Multi-View Images
di: Zhou, Bo, et al.
Pubblicazione: (2026)
di: Zhou, Bo, et al.
Pubblicazione: (2026)
General and Task-Oriented Video Segmentation
di: Chen, Mu, et al.
Pubblicazione: (2024)
di: Chen, Mu, et al.
Pubblicazione: (2024)
Unbiased Object Detection Beyond Frequency with Visually Prompted Image Synthesis
di: Cai, Xinhao, et al.
Pubblicazione: (2025)
di: Cai, Xinhao, et al.
Pubblicazione: (2025)
Psychometry: An Omnifit Model for Image Reconstruction from Human Brain Activity
di: Quan, Ruijie, et al.
Pubblicazione: (2024)
di: Quan, Ruijie, et al.
Pubblicazione: (2024)
Local-Global Context Aware Transformer for Language-Guided Video Segmentation
di: Liang, Chen, et al.
Pubblicazione: (2022)
di: Liang, Chen, et al.
Pubblicazione: (2022)
Efficient Unsupervised Visual Representation Learning with Explicit Cluster Balancing
di: Metaxas, Ioannis Maniadis, et al.
Pubblicazione: (2024)
di: Metaxas, Ioannis Maniadis, et al.
Pubblicazione: (2024)
Franca: Nested Matryoshka Clustering for Scalable Visual Representation Learning
di: Venkataramanan, Shashanka, et al.
Pubblicazione: (2025)
di: Venkataramanan, Shashanka, et al.
Pubblicazione: (2025)
Scalable Video Object Segmentation with Identification Mechanism
di: Yang, Zongxin, et al.
Pubblicazione: (2022)
di: Yang, Zongxin, et al.
Pubblicazione: (2022)
Towards Data-and Knowledge-Driven Artificial Intelligence: A Survey on Neuro-Symbolic Computing
di: Wang, Wenguan, et al.
Pubblicazione: (2022)
di: Wang, Wenguan, et al.
Pubblicazione: (2022)
Nonverbal Interaction Detection
di: Wei, Jianan, et al.
Pubblicazione: (2024)
di: Wei, Jianan, et al.
Pubblicazione: (2024)
Moving Beyond Diffusion: Hierarchy-to-Hierarchy Autoregression for fMRI-to-Image Reconstruction
di: Zhang, Xu, et al.
Pubblicazione: (2025)
di: Zhang, Xu, et al.
Pubblicazione: (2025)
Rethinking Cross-modal Interaction from a Top-down Perspective for Referring Video Object Segmentation
di: Liang, Chen, et al.
Pubblicazione: (2021)
di: Liang, Chen, et al.
Pubblicazione: (2021)
3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation
di: Gao, Jianzhe, et al.
Pubblicazione: (2026)
di: Gao, Jianzhe, et al.
Pubblicazione: (2026)
Cluster Contrast for Unsupervised Visual Representation Learning
di: Giakoumoglou, Nikolaos, et al.
Pubblicazione: (2025)
di: Giakoumoglou, Nikolaos, et al.
Pubblicazione: (2025)
Dynamic in Static: Hybrid Visual Correspondence for Self-Supervised Video Object Segmentation
di: Pei, Gensheng, et al.
Pubblicazione: (2024)
di: Pei, Gensheng, et al.
Pubblicazione: (2024)
Deciphering 'What' and 'Where' Visual Pathways from Spectral Clustering of Layer-Distributed Neural Representations
di: Zhang, Xiao, et al.
Pubblicazione: (2023)
di: Zhang, Xiao, et al.
Pubblicazione: (2023)
Documenti analoghi
-
SinkTrack: Attention Sink based Context Anchoring for Large Language Models
di: Liu, Xu, et al.
Pubblicazione: (2026) -
Hydra-SGG: Hybrid Relation Assignment for One-stage Scene Graph Generation
di: Chen, Minghan, et al.
Pubblicazione: (2024) -
A Survey on 3D Gaussian Splatting
di: Chen, Guikun, et al.
Pubblicazione: (2024) -
Scene Graph Generation with Role-Playing Large Language Models
di: Chen, Guikun, et al.
Pubblicazione: (2024) -
DoraemonGPT: Toward Understanding Dynamic Scenes with Large Language Models (Exemplified as A Video Agent)
di: Yang, Zongxin, et al.
Pubblicazione: (2024)