DiffCLIP: Leveraging Stable Diffusion for Language Grounded 3D Classification
Fuente:
arXiv
Saved in:
| Main Authors: | Shen, Sitian, Zhu, Zilin, Fan, Linqian, Zhang, Harry, Wu, Xinxiao |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
DiffCLIP: Few-shot Language-driven Multimodal Classifier
by: Zhang, Jiaqing, et al.
Published: (2024)
by: Zhang, Jiaqing, et al.
Published: (2024)
DiffCLIP: Differential Attention Meets CLIP
by: Hammoud, Hasan Abed Al Kader, et al.
Published: (2025)
by: Hammoud, Hasan Abed Al Kader, et al.
Published: (2025)
Video Summarization using Denoising Diffusion Probabilistic Model
by: Shang, Zirui, et al.
Published: (2024)
by: Shang, Zirui, et al.
Published: (2024)
H2OFlow: Grounding Human-Object Affordances with 3D Generative Models and Dense Diffused Flows
by: Zhang, Harry, et al.
Published: (2025)
by: Zhang, Harry, et al.
Published: (2025)
LLM-powered Query Expansion for Enhancing Boundary Prediction in Language-driven Action Localization
by: Shang, Zirui, et al.
Published: (2025)
by: Shang, Zirui, et al.
Published: (2025)
TriCLIP-3D: A Unified Parameter-Efficient Framework for Tri-Modal 3D Visual Grounding based on CLIP
by: Li, Fan, et al.
Published: (2025)
by: Li, Fan, et al.
Published: (2025)
Diff3Dformer: Leveraging Slice Sequence Diffusion for Enhanced 3D CT Classification with Transformer Networks
by: Jin, Zihao, et al.
Published: (2024)
by: Jin, Zihao, et al.
Published: (2024)
DiffGS: Functional Gaussian Splatting Diffusion
by: Zhou, Junsheng, et al.
Published: (2024)
by: Zhou, Junsheng, et al.
Published: (2024)
DiffTF++: 3D-aware Diffusion Transformer for Large-Vocabulary 3D Generation
by: Cao, Ziang, et al.
Published: (2024)
by: Cao, Ziang, et al.
Published: (2024)
BokehDiff: Neural Lens Blur with One-Step Diffusion
by: Zhu, Chengxuan, et al.
Published: (2025)
by: Zhu, Chengxuan, et al.
Published: (2025)
METOR: A Unified Framework for Mutual Enhancement of Objects and Relationships in Open-vocabulary Video Visual Relationship Detection
by: Wang, Yongqi, et al.
Published: (2025)
by: Wang, Yongqi, et al.
Published: (2025)
LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching
by: Tian, Mengxiao, et al.
Published: (2025)
by: Tian, Mengxiao, et al.
Published: (2025)
GeoDiff3D: Self-Supervised 3D Scene Generation with Geometry-Constrained 2D Diffusion Guidance
by: Zhu, Haozhi, et al.
Published: (2026)
by: Zhu, Haozhi, et al.
Published: (2026)
EC-Diff: Fast and High-Quality Edge-Cloud Collaborative Inference for Diffusion Models
by: Xie, Jiajian, et al.
Published: (2025)
by: Xie, Jiajian, et al.
Published: (2025)
$R_\text{dm}$: Re-conceptualizing Distribution Matching as a Reward for Diffusion Distillation
by: Fan, Linqian, et al.
Published: (2026)
by: Fan, Linqian, et al.
Published: (2026)
DragGaussian: Enabling Drag-style Manipulation on 3D Gaussian Representation
by: Shen, Sitian, et al.
Published: (2024)
by: Shen, Sitian, et al.
Published: (2024)
CLIP-FSAC++: Few-Shot Anomaly Classification with Anomaly Descriptor Based on CLIP
by: Zuo, Zuo, et al.
Published: (2024)
by: Zuo, Zuo, et al.
Published: (2024)
Jano: Adaptive Diffusion Generation with Early-stage Convergence Awareness
by: Chen, Yuyang, et al.
Published: (2026)
by: Chen, Yuyang, et al.
Published: (2026)
Diffusion Feedback Helps CLIP See Better
by: Wang, Wenxuan, et al.
Published: (2024)
by: Wang, Wenxuan, et al.
Published: (2024)
From 3D Pose to Prose: Biomechanics-Grounded Vision--Language Coaching
by: Ji, Yuyang, et al.
Published: (2026)
by: Ji, Yuyang, et al.
Published: (2026)
DiffSpeaker: Speech-Driven 3D Facial Animation with Diffusion Transformer
by: Ma, Zhiyuan, et al.
Published: (2024)
by: Ma, Zhiyuan, et al.
Published: (2024)
Leveraging Cross-Modal Neighbor Representation for Improved CLIP Classification
by: Yi, Chao, et al.
Published: (2024)
by: Yi, Chao, et al.
Published: (2024)
Grounding Language Models for Visual Entity Recognition
by: Xiao, Zilin, et al.
Published: (2024)
by: Xiao, Zilin, et al.
Published: (2024)
DiffAge3D: Diffusion-based 3D-aware Face Aging
by: Wahid, Junaid, et al.
Published: (2024)
by: Wahid, Junaid, et al.
Published: (2024)
CLIP3D-AD: Extending CLIP for 3D Few-Shot Anomaly Detection with Multi-View Images Generation
by: Zuo, Zuo, et al.
Published: (2024)
by: Zuo, Zuo, et al.
Published: (2024)
SuperCLIP: CLIP with Simple Classification Supervision
by: Zhao, Weiheng, et al.
Published: (2025)
by: Zhao, Weiheng, et al.
Published: (2025)
KineDiff3D: Kinematic-Aware Diffusion for Category-Level Articulated Object Shape Reconstruction and Generation
by: Xu, WenBo, et al.
Published: (2025)
by: Xu, WenBo, et al.
Published: (2025)
SC-Diff: 3D Shape Completion with Latent Diffusion Models
by: Schaefer, Simon, et al.
Published: (2024)
by: Schaefer, Simon, et al.
Published: (2024)
WP-CLIP: Leveraging CLIP to Predict Wölfflin's Principles in Visual Art
by: Ghildyal, Abhijay, et al.
Published: (2025)
by: Ghildyal, Abhijay, et al.
Published: (2025)
Diff3DETR:Agent-based Diffusion Model for Semi-supervised 3D Object Detection
by: Deng, Jiacheng, et al.
Published: (2024)
by: Deng, Jiacheng, et al.
Published: (2024)
SignDiff: Diffusion Model for American Sign Language Production
by: Fang, Sen, et al.
Published: (2023)
by: Fang, Sen, et al.
Published: (2023)
CLIP-VG: Self-paced Curriculum Adapting of CLIP for Visual Grounding
by: Xiao, Linhui, et al.
Published: (2023)
by: Xiao, Linhui, et al.
Published: (2023)
Diff-ES: Stage-wise Structural Diffusion Pruning via Evolutionary Search
by: Liu, Zongfang, et al.
Published: (2026)
by: Liu, Zongfang, et al.
Published: (2026)
CLIP-IT: CLIP-based Pairing for Histology Images Classification
by: Karimian, Banafsheh, et al.
Published: (2025)
by: Karimian, Banafsheh, et al.
Published: (2025)
GrounDiff: Diffusion-Based Ground Surface Generation from Digital Surface Models
by: Dhaouadi, Oussema, et al.
Published: (2025)
by: Dhaouadi, Oussema, et al.
Published: (2025)
HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models
by: Wei, Zhixiang, et al.
Published: (2025)
by: Wei, Zhixiang, et al.
Published: (2025)
FreeDiff: Progressive Frequency Truncation for Image Editing with Diffusion Models
by: Wu, Wei, et al.
Published: (2024)
by: Wu, Wei, et al.
Published: (2024)
Diff-Reg v2: Diffusion-Based Matching Matrix Estimation for Image Matching and 3D Registration
by: Wu, Qianliang, et al.
Published: (2025)
by: Wu, Qianliang, et al.
Published: (2025)
DeltaDiff: Reality-Driven Diffusion with AnchorResiduals for Faithful SR
by: Yang, Chao, et al.
Published: (2025)
by: Yang, Chao, et al.
Published: (2025)
HOI-Diff: Text-Driven Synthesis of 3D Human-Object Interactions using Diffusion Models
by: Peng, Xiaogang, et al.
Published: (2023)
by: Peng, Xiaogang, et al.
Published: (2023)
Similar Items
-
DiffCLIP: Few-shot Language-driven Multimodal Classifier
by: Zhang, Jiaqing, et al.
Published: (2024) -
DiffCLIP: Differential Attention Meets CLIP
by: Hammoud, Hasan Abed Al Kader, et al.
Published: (2025) -
Video Summarization using Denoising Diffusion Probabilistic Model
by: Shang, Zirui, et al.
Published: (2024) -
H2OFlow: Grounding Human-Object Affordances with 3D Generative Models and Dense Diffused Flows
by: Zhang, Harry, et al.
Published: (2025) -
LLM-powered Query Expansion for Enhancing Boundary Prediction in Language-driven Action Localization
by: Shang, Zirui, et al.
Published: (2025)