Unifying Visual and Semantic Feature Spaces with Diffusion Models for Enhanced Cross-Modal Alignment
Fuente:
arXiv
Saved in:
| Main Authors: | Zheng, Yuze, Li, Zixuan, Li, Xiangxian, Liu, Jinxing, Wang, Yuqing, Meng, Xiangxu, Meng, Lei |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Semantic-Space-Intervened Diffusive Alignment for Visual Classification
by: Li, Zixuan, et al.
Published: (2025)
by: Li, Zixuan, et al.
Published: (2025)
Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification
by: Yan, Xiaoshuo, et al.
Published: (2025)
by: Yan, Xiaoshuo, et al.
Published: (2025)
Cross-Modal Scene Semantic Alignment for Image Complexity Assessment
by: Luo, Yuqing, et al.
Published: (2025)
by: Luo, Yuqing, et al.
Published: (2025)
Hierarchically-Structured Open-Vocabulary Indoor Scene Synthesis with Pre-trained Large Language Model
by: Sun, Weilin, et al.
Published: (2025)
by: Sun, Weilin, et al.
Published: (2025)
TUNI: Real-time RGB-T Semantic Segmentation with Unified Multi-Modal Feature Extraction and Cross-Modal Feature Fusion
by: Guo, Xiaodong, et al.
Published: (2025)
by: Guo, Xiaodong, et al.
Published: (2025)
ProtoConNet: Prototypical Augmentation and Alignment for Open-Set Few-Shot Image Classification
by: Shi, Kexuan, et al.
Published: (2025)
by: Shi, Kexuan, et al.
Published: (2025)
LLM-Enabled Style and Content Regularization for Personalized Text-to-Image Generation
by: Yu, Anran, et al.
Published: (2025)
by: Yu, Anran, et al.
Published: (2025)
Enhancing Audio-Visual Spiking Neural Networks through Semantic-Alignment and Cross-Modal Residual Learning
by: He, Xiang, et al.
Published: (2025)
by: He, Xiang, et al.
Published: (2025)
UniFuse: A Unified All-in-One Framework for Multi-Modal Medical Image Fusion Under Diverse Degradations and Misalignments
by: Su, Dayong, et al.
Published: (2025)
by: Su, Dayong, et al.
Published: (2025)
Dynamic Cross-Modal Alignment for Robust Semantic Location Prediction
by: Jing, Liu, et al.
Published: (2024)
by: Jing, Liu, et al.
Published: (2024)
Combating Visual Neglect and Semantic Drift in Large Multimodal Models for Enhanced Cross-Modal Retrieval
by: Zhang, Guosheng, et al.
Published: (2026)
by: Zhang, Guosheng, et al.
Published: (2026)
Global Prompt Refinement with Non-Interfering Attention Masking for One-Shot Federated Learning
by: Qi, Zhuang, et al.
Published: (2025)
by: Qi, Zhuang, et al.
Published: (2025)
Federated Deconfounding and Debiasing Learning for Out-of-Distribution Generalization
by: Qi, Zhuang, et al.
Published: (2025)
by: Qi, Zhuang, et al.
Published: (2025)
DiffAttn: Diffusion-Based Drivers' Visual Attention Prediction with LLM-Enhanced Semantic Reasoning
by: Liu, Weimin, et al.
Published: (2026)
by: Liu, Weimin, et al.
Published: (2026)
CRFT: Consistent-Recurrent Feature Flow Transformer for Cross-Modal Image Registration
by: Liu, Xuecong, et al.
Published: (2026)
by: Liu, Xuecong, et al.
Published: (2026)
MindTuner: Cross-Subject Visual Decoding with Visual Fingerprint and Semantic Correction
by: Gong, Zixuan, et al.
Published: (2024)
by: Gong, Zixuan, et al.
Published: (2024)
Class-wise Balancing Data Replay for Federated Class-Incremental Learning
by: Qi, Zhuang, et al.
Published: (2025)
by: Qi, Zhuang, et al.
Published: (2025)
UniAlignment: Semantic Alignment for Unified Image Generation, Understanding, Manipulation and Perception
by: Song, Xinyang, et al.
Published: (2025)
by: Song, Xinyang, et al.
Published: (2025)
Learning Modality Knowledge Alignment for Cross-Modality Transfer
by: Ma, Wenxuan, et al.
Published: (2024)
by: Ma, Wenxuan, et al.
Published: (2024)
Ultrasound Report Generation with Cross-Modality Feature Alignment via Unsupervised Guidance
by: Li, Jun, et al.
Published: (2024)
by: Li, Jun, et al.
Published: (2024)
Dense Audio-Visual Event Localization under Cross-Modal Consistency and Multi-Temporal Granularity Collaboration
by: Zhou, Ziheng, et al.
Published: (2024)
by: Zhou, Ziheng, et al.
Published: (2024)
Self-Enhanced Image Clustering with Cross-Modal Semantic Consistency
by: Li, Zihan, et al.
Published: (2025)
by: Li, Zihan, et al.
Published: (2025)
Spatial-Mamba: Effective Visual State Space Models via Structure-aware State Fusion
by: Xiao, Chaodong, et al.
Published: (2024)
by: Xiao, Chaodong, et al.
Published: (2024)
PyramidMamba: Rethinking Pyramid Feature Fusion with Selective Space State Model for Semantic Segmentation of Remote Sensing Imagery
by: Wang, Libo, et al.
Published: (2024)
by: Wang, Libo, et al.
Published: (2024)
AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition
by: Liu, Zehua, et al.
Published: (2024)
by: Liu, Zehua, et al.
Published: (2024)
Advancing Weakly-Supervised Audio-Visual Video Parsing via Segment-wise Pseudo Labeling
by: Zhou, Jinxing, et al.
Published: (2024)
by: Zhou, Jinxing, et al.
Published: (2024)
Missing No More: Dictionary-Guided Cross-Modal Image Fusion under Missing Infrared
by: Zhang, Yafei, et al.
Published: (2026)
by: Zhang, Yafei, et al.
Published: (2026)
CM-Bench: A Comprehensive Cross-Modal Feature Matching Benchmark Bridging Visible and Infrared Images
by: Sun, Liangzheng, et al.
Published: (2026)
by: Sun, Liangzheng, et al.
Published: (2026)
Global Intervention and Distillation for Federated Out-of-Distribution Generalization
by: Qi, Zhuang, et al.
Published: (2025)
by: Qi, Zhuang, et al.
Published: (2025)
Explicit Temporal-Semantic Modeling for Dense Video Captioning via Context-Aware Cross-Modal Interaction
by: Jia, Mingda, et al.
Published: (2025)
by: Jia, Mingda, et al.
Published: (2025)
Selective Transfer Learning of Cross-Modality Distillation for Monocular 3D Object Detection
by: Ding, Rui, et al.
Published: (2026)
by: Ding, Rui, et al.
Published: (2026)
ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling
by: Yang, Jianxuan, et al.
Published: (2026)
by: Yang, Jianxuan, et al.
Published: (2026)
ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment
by: Hu, Xiwei, et al.
Published: (2024)
by: Hu, Xiwei, et al.
Published: (2024)
VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization
by: Li, Mingxiao, et al.
Published: (2025)
by: Li, Mingxiao, et al.
Published: (2025)
Causal Disentanglement and Cross-Modal Alignment for Enhanced Few-Shot Learning
by: Jiang, Tianjiao, et al.
Published: (2025)
by: Jiang, Tianjiao, et al.
Published: (2025)
Unified Medical Image Pre-training in Language-Guided Common Semantic Space
by: He, Xiaoxuan, et al.
Published: (2023)
by: He, Xiaoxuan, et al.
Published: (2023)
Bridge Feature Matching and Cross-Modal Alignment with Mutual-filtering for Zero-shot Anomaly Detection
by: Bai, Yuhu, et al.
Published: (2025)
by: Bai, Yuhu, et al.
Published: (2025)
Cascade-Free Mandarin Visual Speech Recognition via Semantic-Guided Cross-Representation Alignment
by: Yang, Lei, et al.
Published: (2026)
by: Yang, Lei, et al.
Published: (2026)
$Z^2$-Sampling: Zero-Cost Zigzag Trajectories for Semantic Alignment in Diffusion Models
by: Li, Haosen, et al.
Published: (2026)
by: Li, Haosen, et al.
Published: (2026)
Beyond Weight Adaptation: Feature-Space Domain Injection for Cross-Modal Ship Re-Identification
by: Xian, Tingfeng, et al.
Published: (2025)
by: Xian, Tingfeng, et al.
Published: (2025)
Similar Items
-
Semantic-Space-Intervened Diffusive Alignment for Visual Classification
by: Li, Zixuan, et al.
Published: (2025) -
Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification
by: Yan, Xiaoshuo, et al.
Published: (2025) -
Cross-Modal Scene Semantic Alignment for Image Complexity Assessment
by: Luo, Yuqing, et al.
Published: (2025) -
Hierarchically-Structured Open-Vocabulary Indoor Scene Synthesis with Pre-trained Large Language Model
by: Sun, Weilin, et al.
Published: (2025) -
TUNI: Real-time RGB-T Semantic Segmentation with Unified Multi-Modal Feature Extraction and Cross-Modal Feature Fusion
by: Guo, Xiaodong, et al.
Published: (2025)