AlignCAT: Visual-Linguistic Alignment of Category and Attribute for Weakly Supervised Visual Grounding
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Yidan, Zhuang, Chenyi, Liu, Wutao, Gao, Pan, Sebe, Nicu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Uni4D: A Unified Self-Supervised Learning Framework for Point Cloud Videos
por: Zuo, Zhi, et al.
Publicado: (2025)
por: Zuo, Zhi, et al.
Publicado: (2025)
3DWG: 3D Weakly Supervised Visual Grounding via Category and Instance-Level Alignment
por: Li, Xiaoqi, et al.
Publicado: (2025)
por: Li, Xiaoqi, et al.
Publicado: (2025)
Weakly-Supervised 3D Visual Grounding based on Visual Language Alignment
por: Xu, Xiaoxu, et al.
Publicado: (2023)
por: Xu, Xiaoxu, et al.
Publicado: (2023)
Loomis Painter: Reconstructing the Painting Process
por: Pobitzer, Markus, et al.
Publicado: (2025)
por: Pobitzer, Markus, et al.
Publicado: (2025)
TerraScope: Pixel-Grounded Visual Reasoning for Earth Observation
por: Shu, Yan, et al.
Publicado: (2026)
por: Shu, Yan, et al.
Publicado: (2026)
PiCo: Enhancing Text-Image Alignment with Improved Noise Selection and Precise Mask Control in Diffusion Models
por: Xie, Chang, et al.
Publicado: (2025)
por: Xie, Chang, et al.
Publicado: (2025)
Prototypical Hash Encoding for On-the-Fly Fine-Grained Category Discovery
por: Zheng, Haiyang, et al.
Publicado: (2024)
por: Zheng, Haiyang, et al.
Publicado: (2024)
Generalized Fine-Grained Category Discovery with Multi-Granularity Conceptual Experts
por: Zheng, Haiyang, et al.
Publicado: (2025)
por: Zheng, Haiyang, et al.
Publicado: (2025)
Democratizing Fine-grained Visual Recognition with Large Language Models
por: Liu, Mingxuan, et al.
Publicado: (2024)
por: Liu, Mingxuan, et al.
Publicado: (2024)
Beyond Object Categories: Multi-Attribute Reference Understanding for Visual Grounding
por: Guo, Hao, et al.
Publicado: (2025)
por: Guo, Hao, et al.
Publicado: (2025)
Textual Knowledge Matters: Cross-Modality Co-Teaching for Generalized Visual Class Discovery
por: Zheng, Haiyang, et al.
Publicado: (2024)
por: Zheng, Haiyang, et al.
Publicado: (2024)
Generate, Refine, and Encode: Leveraging Synthesized Novel Samples for On-the-Fly Fine-Grained Category Discovery
por: Liu, Xiao, et al.
Publicado: (2025)
por: Liu, Xiao, et al.
Publicado: (2025)
3D Weakly Supervised Semantic Segmentation with 2D Vision-Language Guidance
por: Xu, Xiaoxu, et al.
Publicado: (2024)
por: Xu, Xiaoxu, et al.
Publicado: (2024)
Wasserstein-Aligned Hyperbolic Multi-View Clustering
por: Wang, Rui, et al.
Publicado: (2025)
por: Wang, Rui, et al.
Publicado: (2025)
Weakly-Supervised 3D Scene Graph Generation via Visual-Linguistic Assisted Pseudo-labeling
por: Wang, Xu, et al.
Publicado: (2024)
por: Wang, Xu, et al.
Publicado: (2024)
3D Part Segmentation via Geometric Aggregation of 2D Visual Features
por: Garosi, Marco, et al.
Publicado: (2024)
por: Garosi, Marco, et al.
Publicado: (2024)
Dual Attribute-Spatial Relation Alignment for 3D Visual Grounding
por: Xu, Yue, et al.
Publicado: (2024)
por: Xu, Yue, et al.
Publicado: (2024)
Inverse Virtual Try-On: Generating Multi-Category Product-Style Images from Clothed Individuals
por: Lobba, Davide, et al.
Publicado: (2025)
por: Lobba, Davide, et al.
Publicado: (2025)
First RAG, Second SEG: A Training-Free Paradigm for Camouflaged Object Detection
por: Liu, Wutao, et al.
Publicado: (2025)
por: Liu, Wutao, et al.
Publicado: (2025)
Training and Tuning Generative Neural Radiance Fields for Attribute-Conditional 3D-Aware Face Generation
por: Zhang, Jichao, et al.
Publicado: (2022)
por: Zhang, Jichao, et al.
Publicado: (2022)
Consistent Supervised-Unsupervised Alignment for Generalized Category Discovery
por: Han, Jizhou, et al.
Publicado: (2025)
por: Han, Jizhou, et al.
Publicado: (2025)
Open-World Deepfake Attribution via Confidence-Aware Asymmetric Learning
por: Zheng, Haiyang, et al.
Publicado: (2025)
por: Zheng, Haiyang, et al.
Publicado: (2025)
3D Weakly Supervised Semantic Segmentation via Class-Aware and Geometry-Guided Pseudo-Label Refinement
por: Xu, Xiaoxu, et al.
Publicado: (2025)
por: Xu, Xiaoxu, et al.
Publicado: (2025)
Magnet: We Never Know How Text-to-Image Diffusion Models Work, Until We Learn How Vision-Language Models Function
por: Zhuang, Chenyi, et al.
Publicado: (2024)
por: Zhuang, Chenyi, et al.
Publicado: (2024)
GeoViS: Geospatially Rewarded Visual Search for Remote Sensing Visual Grounding
por: Zhang, Peirong, et al.
Publicado: (2025)
por: Zhang, Peirong, et al.
Publicado: (2025)
CLIP is Strong Enough to Fight Back: Test-time Counterattacks towards Zero-shot Adversarial Robustness of CLIP
por: Xing, Songlong, et al.
Publicado: (2025)
por: Xing, Songlong, et al.
Publicado: (2025)
Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding
por: Huy, Ta Duc, et al.
Publicado: (2025)
por: Huy, Ta Duc, et al.
Publicado: (2025)
Hierarchical Visual Prompt Learning for Continual Video Instance Segmentation
por: Dong, Jiahua, et al.
Publicado: (2025)
por: Dong, Jiahua, et al.
Publicado: (2025)
Reinforced Label Denoising for Weakly-Supervised Audio-Visual Video Parsing
por: Gao, Yongbiao, et al.
Publicado: (2024)
por: Gao, Yongbiao, et al.
Publicado: (2024)
Attribute Distribution Modeling and Semantic-Visual Alignment for Generative Zero-shot Learning
por: Pu, Haojie, et al.
Publicado: (2026)
por: Pu, Haojie, et al.
Publicado: (2026)
Multi-focal Conditioned Latent Diffusion for Person Image Synthesis
por: Liu, Jiaqi, et al.
Publicado: (2025)
por: Liu, Jiaqi, et al.
Publicado: (2025)
RankFeat&RankWeight: Rank-1 Feature/Weight Removal for Out-of-distribution Detection
por: Song, Yue, et al.
Publicado: (2023)
por: Song, Yue, et al.
Publicado: (2023)
DiffuseST: Unleashing the Capability of the Diffusion Model for Style Transfer
por: Hu, Ying, et al.
Publicado: (2024)
por: Hu, Ying, et al.
Publicado: (2024)
Rethinking the Learning Paradigm for Facial Expression Recognition
por: Wang, Weijie, et al.
Publicado: (2022)
por: Wang, Weijie, et al.
Publicado: (2022)
Reverse Personalization
por: Kung, Han-Wei, et al.
Publicado: (2025)
por: Kung, Han-Wei, et al.
Publicado: (2025)
Siamese Learning with Joint Alignment and Regression for Weakly-Supervised Video Paragraph Grounding
por: Tan, Chaolei, et al.
Publicado: (2024)
por: Tan, Chaolei, et al.
Publicado: (2024)
Recursive Visual Imagination and Adaptive Linguistic Grounding for Vision Language Navigation
por: Chen, Bolei, et al.
Publicado: (2025)
por: Chen, Bolei, et al.
Publicado: (2025)
Prompt Categories Cluster for Weakly Supervised Semantic Segmentation
por: Wu, Wangyu, et al.
Publicado: (2024)
por: Wu, Wangyu, et al.
Publicado: (2024)
Diff9D: Diffusion-Based Domain-Generalized Category-Level 9-DoF Object Pose Estimation
por: Liu, Jian, et al.
Publicado: (2025)
por: Liu, Jian, et al.
Publicado: (2025)
Unified Unsupervised Salient Object Detection via Knowledge Transfer
por: Yuan, Yao, et al.
Publicado: (2024)
por: Yuan, Yao, et al.
Publicado: (2024)
Ejemplares similares
-
Uni4D: A Unified Self-Supervised Learning Framework for Point Cloud Videos
por: Zuo, Zhi, et al.
Publicado: (2025) -
3DWG: 3D Weakly Supervised Visual Grounding via Category and Instance-Level Alignment
por: Li, Xiaoqi, et al.
Publicado: (2025) -
Weakly-Supervised 3D Visual Grounding based on Visual Language Alignment
por: Xu, Xiaoxu, et al.
Publicado: (2023) -
Loomis Painter: Reconstructing the Painting Process
por: Pobitzer, Markus, et al.
Publicado: (2025) -
TerraScope: Pixel-Grounded Visual Reasoning for Earth Observation
por: Shu, Yan, et al.
Publicado: (2026)