Semantic-Space-Intervened Diffusive Alignment for Visual Classification
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Zixuan, Meng, Lei, Chao, Guoqing, Wu, Wei, Yan, Xiaoshuo, Yang, Yimeng, Qi, Zhuang, Meng, Xiangxu |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification
by: Yan, Xiaoshuo, et al.
Published: (2025)
by: Yan, Xiaoshuo, et al.
Published: (2025)
Unifying Visual and Semantic Feature Spaces with Diffusion Models for Enhanced Cross-Modal Alignment
by: Zheng, Yuze, et al.
Published: (2024)
by: Zheng, Yuze, et al.
Published: (2024)
ProtoConNet: Prototypical Augmentation and Alignment for Open-Set Few-Shot Image Classification
by: Shi, Kexuan, et al.
Published: (2025)
by: Shi, Kexuan, et al.
Published: (2025)
From Selection to Scheduling: Federated Geometry-Aware Correction Makes Exemplar Replay Work Better under Continual Dynamic Heterogeneity
by: Qi, Zhuang, et al.
Published: (2026)
by: Qi, Zhuang, et al.
Published: (2026)
Global Intervention and Distillation for Federated Out-of-Distribution Generalization
by: Qi, Zhuang, et al.
Published: (2025)
by: Qi, Zhuang, et al.
Published: (2025)
Federated Deconfounding and Debiasing Learning for Out-of-Distribution Generalization
by: Qi, Zhuang, et al.
Published: (2025)
by: Qi, Zhuang, et al.
Published: (2025)
Global Prompt Refinement with Non-Interfering Attention Masking for One-Shot Federated Learning
by: Qi, Zhuang, et al.
Published: (2025)
by: Qi, Zhuang, et al.
Published: (2025)
Class-wise Balancing Data Replay for Federated Class-Incremental Learning
by: Qi, Zhuang, et al.
Published: (2025)
by: Qi, Zhuang, et al.
Published: (2025)
LLM-Enabled Style and Content Regularization for Personalized Text-to-Image Generation
by: Yu, Anran, et al.
Published: (2025)
by: Yu, Anran, et al.
Published: (2025)
Hierarchically-Structured Open-Vocabulary Indoor Scene Synthesis with Pre-trained Large Language Model
by: Sun, Weilin, et al.
Published: (2025)
by: Sun, Weilin, et al.
Published: (2025)
MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces
by: E, Shaojun, et al.
Published: (2025)
by: E, Shaojun, et al.
Published: (2025)
Visual-Semantic Decomposition and Partial Alignment for Document-based Zero-Shot Learning
by: Qu, Xiangyan, et al.
Published: (2024)
by: Qu, Xiangyan, et al.
Published: (2024)
HF-VTON: High-Fidelity Virtual Try-On via Consistent Geometric and Semantic Alignment
by: Meng, Ming, et al.
Published: (2025)
by: Meng, Ming, et al.
Published: (2025)
OpenVidVRD: Open-Vocabulary Video Visual Relation Detection via Prompt-Driven Semantic Space Alignment
by: Liu, Qi, et al.
Published: (2025)
by: Liu, Qi, et al.
Published: (2025)
Cascade-Free Mandarin Visual Speech Recognition via Semantic-Guided Cross-Representation Alignment
by: Yang, Lei, et al.
Published: (2026)
by: Yang, Lei, et al.
Published: (2026)
Deep Semantic-Visual Alignment for Zero-Shot Remote Sensing Image Scene Classification
by: Xu, Wenjia, et al.
Published: (2024)
by: Xu, Wenjia, et al.
Published: (2024)
MindTuner: Cross-Subject Visual Decoding with Visual Fingerprint and Semantic Correction
by: Gong, Zixuan, et al.
Published: (2024)
by: Gong, Zixuan, et al.
Published: (2024)
Intervene-All-Paths: Unified Mitigation of LVLM Hallucinations across Alignment Formats
by: Qian, Jiaye, et al.
Published: (2025)
by: Qian, Jiaye, et al.
Published: (2025)
Semantic Lens: Instance-Centric Semantic Alignment for Video Super-Resolution
by: Tang, Qi, et al.
Published: (2023)
by: Tang, Qi, et al.
Published: (2023)
Spatial-Mamba: Effective Visual State Space Models via Structure-aware State Fusion
by: Xiao, Chaodong, et al.
Published: (2024)
by: Xiao, Chaodong, et al.
Published: (2024)
Pix2Key: Controllable Open-Vocabulary Retrieval with Semantic Decomposition and Self-Supervised Visual Dictionary Learning
by: Wei, Guoyizhe, et al.
Published: (2026)
by: Wei, Guoyizhe, et al.
Published: (2026)
Streaming Video Diffusion: Online Video Editing with Diffusion Models
by: Chen, Feng, et al.
Published: (2024)
by: Chen, Feng, et al.
Published: (2024)
RoadMamba: A Dual Branch Visual State Space Model for Road Surface Classification
by: Wang, Tianze, et al.
Published: (2025)
by: Wang, Tianze, et al.
Published: (2025)
JoReS-Diff: Joint Retinex and Semantic Priors in Diffusion Model for Low-light Image Enhancement
by: Wu, Yuhui, et al.
Published: (2023)
by: Wu, Yuhui, et al.
Published: (2023)
Diffusion Models Need Visual Priors for Image Generation
by: Yue, Xiaoyu, et al.
Published: (2024)
by: Yue, Xiaoyu, et al.
Published: (2024)
Coarse-to-Fine Hierarchical Alignment for UAV-based Human Detection using Diffusion Models
by: Li, Wenda, et al.
Published: (2025)
by: Li, Wenda, et al.
Published: (2025)
Hierarchical Feature Learning for Medical Point Clouds via State Space Model
by: Zhang, Guoqing, et al.
Published: (2025)
by: Zhang, Guoqing, et al.
Published: (2025)
$Z^2$-Sampling: Zero-Cost Zigzag Trajectories for Semantic Alignment in Diffusion Models
by: Li, Haosen, et al.
Published: (2026)
by: Li, Haosen, et al.
Published: (2026)
StableDub: Taming Diffusion Prior for Generalized and Efficient Visual Dubbing
by: Chen, Liyang, et al.
Published: (2025)
by: Chen, Liyang, et al.
Published: (2025)
Semantic Alignment in Hyperbolic Space for Open-Vocabulary Semantic Segmentation
by: Truong, Hoang M., et al.
Published: (2026)
by: Truong, Hoang M., et al.
Published: (2026)
DiffAttn: Diffusion-Based Drivers' Visual Attention Prediction with LLM-Enhanced Semantic Reasoning
by: Liu, Weimin, et al.
Published: (2026)
by: Liu, Weimin, et al.
Published: (2026)
Structure Matters: Tackling the Semantic Discrepancy in Diffusion Models for Image Inpainting
by: Liu, Haipeng, et al.
Published: (2024)
by: Liu, Haipeng, et al.
Published: (2024)
Efficient Multi-Slide Visual-Language Feature Fusion for Placental Disease Classification
by: Guo, Hang, et al.
Published: (2025)
by: Guo, Hang, et al.
Published: (2025)
Few-Shot Image Classification and Segmentation as Visual Question Answering Using Vision-Language Models
by: Meng, Tian, et al.
Published: (2024)
by: Meng, Tian, et al.
Published: (2024)
Latent Watermark: Inject and Detect Watermarks in Latent Diffusion Space
by: Meng, Zheling, et al.
Published: (2024)
by: Meng, Zheling, et al.
Published: (2024)
StarVid: Enhancing Semantic Alignment in Video Diffusion Models via Spatial and SynTactic Guided Attention Refocusing
by: Li, Yuanhang, et al.
Published: (2024)
by: Li, Yuanhang, et al.
Published: (2024)
Data Generation Scheme for Thermal Modality with Edge-Guided Adversarial Conditional Diffusion Model
by: Zhu, Guoqing, et al.
Published: (2024)
by: Zhu, Guoqing, et al.
Published: (2024)
Training Class-Imbalanced Diffusion Model Via Overlap Optimization
by: Yan, Divin, et al.
Published: (2024)
by: Yan, Divin, et al.
Published: (2024)
Asymmetric Visual Semantic Embedding Framework for Efficient Vision-Language Alignment
by: Liu, Yang, et al.
Published: (2025)
by: Liu, Yang, et al.
Published: (2025)
FER-YOLO-Mamba: Facial Expression Detection and Classification Based on Selective State Space
by: Ma, Hui, et al.
Published: (2024)
by: Ma, Hui, et al.
Published: (2024)
Similar Items
-
Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification
by: Yan, Xiaoshuo, et al.
Published: (2025) -
Unifying Visual and Semantic Feature Spaces with Diffusion Models for Enhanced Cross-Modal Alignment
by: Zheng, Yuze, et al.
Published: (2024) -
ProtoConNet: Prototypical Augmentation and Alignment for Open-Set Few-Shot Image Classification
by: Shi, Kexuan, et al.
Published: (2025) -
From Selection to Scheduling: Federated Geometry-Aware Correction Makes Exemplar Replay Work Better under Continual Dynamic Heterogeneity
by: Qi, Zhuang, et al.
Published: (2026) -
Global Intervention and Distillation for Federated Out-of-Distribution Generalization
by: Qi, Zhuang, et al.
Published: (2025)