Saved in:
| Main Authors: | Zhang, Shiyi, Liang, Dong, Zheng, Hairong, Zhou, Yihang |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2510.03122 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
HAVIR: HierArchical Vision to Image Reconstruction using CLIP-Guided Versatile Diffusion
by: Zhang, Shiyi, et al.
Published: (2025)
by: Zhang, Shiyi, et al.
Published: (2025)
HAMMR: HierArchical MultiModal React agents for generic VQA
by: Castrejon, Lluis, et al.
Published: (2024)
by: Castrejon, Lluis, et al.
Published: (2024)
Joint PET-MRI Reconstruction with Diffusion Stochastic Differential Model
by: Xie, Taofeng, et al.
Published: (2024)
by: Xie, Taofeng, et al.
Published: (2024)
FACMIC: Federated Adaptative CLIP Model for Medical Image Classification
by: Wu, Yihang, et al.
Published: (2024)
by: Wu, Yihang, et al.
Published: (2024)
Diffusion Curriculum: Synthetic-to-Real Data Curriculum via Image-Guided Diffusion
by: Liang, Yijun, et al.
Published: (2024)
by: Liang, Yijun, et al.
Published: (2024)
NeuroSwift: A Lightweight Cross-Subject Framework for fMRI Visual Reconstruction of Complex Scenes
by: Zhang, Shiyi, et al.
Published: (2025)
by: Zhang, Shiyi, et al.
Published: (2025)
Image Synthesis with Class-Aware Semantic Diffusion Models for Surgical Scene Segmentation
by: Zhou, Yihang, et al.
Published: (2024)
by: Zhou, Yihang, et al.
Published: (2024)
Versatile Framework with Semantic and Structural guidance for Image Reconstruction from Brain Activity
by: Lu, Yizhuo, et al.
Published: (2026)
by: Lu, Yizhuo, et al.
Published: (2026)
PriorCLIP: Visual Prior Guided Vision-Language Model for Remote Sensing Image-Text Retrieval
by: Pan, Jiancheng, et al.
Published: (2024)
by: Pan, Jiancheng, et al.
Published: (2024)
CLIP-MUSED: CLIP-Guided Multi-Subject Visual Neural Information Semantic Decoding
by: Zhou, Qiongyi, et al.
Published: (2024)
by: Zhou, Qiongyi, et al.
Published: (2024)
HierLoc: Hyperbolic Entity Embeddings for Hierarchical Visual Geolocation
by: Gadi, Hari Krishna, et al.
Published: (2026)
by: Gadi, Hari Krishna, et al.
Published: (2026)
SpikeVAEDiff: Neural Spike-based Natural Visual Scene Reconstruction via VD-VAE and Versatile Diffusion
by: Li, Jialu, et al.
Published: (2026)
by: Li, Jialu, et al.
Published: (2026)
Paired Image Generation with Diffusion-Guided Diffusion Models
by: Zhang, Haoxuan, et al.
Published: (2025)
by: Zhang, Haoxuan, et al.
Published: (2025)
XAI-CLIP: ROI-Guided Perturbation Framework for Explainable Medical Image Segmentation in Multimodal Vision-Language Models
by: Alzubaidi, Thuraya, et al.
Published: (2026)
by: Alzubaidi, Thuraya, et al.
Published: (2026)
Position-aware Guided Point Cloud Completion with CLIP Model
by: Zhou, Feng, et al.
Published: (2024)
by: Zhou, Feng, et al.
Published: (2024)
Enabling Versatile Controls for Video Diffusion Models
by: Zhang, Xu, et al.
Published: (2025)
by: Zhang, Xu, et al.
Published: (2025)
SmartCLIP: Modular Vision-language Alignment with Identification Guarantees
by: Xie, Shaoan, et al.
Published: (2025)
by: Xie, Shaoan, et al.
Published: (2025)
FoCLIP: A Feature-Space Misalignment Framework for CLIP-Based Image Manipulation and Detection
by: Chen, Yulin, et al.
Published: (2025)
by: Chen, Yulin, et al.
Published: (2025)
Exploration of Reproducible Generated Image Detection
by: Duan, Yihang
Published: (2025)
by: Duan, Yihang
Published: (2025)
On the Utility of Foundation Models for Fast MRI: Vision-Language-Guided Image Reconstruction
by: Feng, Ruimin, et al.
Published: (2025)
by: Feng, Ruimin, et al.
Published: (2025)
CLIP-Guided Unsupervised Semantic-Aware Exposure Correction
by: Wu, Puzhen, et al.
Published: (2026)
by: Wu, Puzhen, et al.
Published: (2026)
RAVE: Residual Vector Embedding for CLIP-Guided Backlit Image Enhancement
by: Gaintseva, Tatiana, et al.
Published: (2024)
by: Gaintseva, Tatiana, et al.
Published: (2024)
Gradient-Guided Conditional Diffusion Models for Private Image Reconstruction: Analyzing Adversarial Impacts of Differential Privacy and Denoising
by: Huang, Tao, et al.
Published: (2024)
by: Huang, Tao, et al.
Published: (2024)
VisionCLIP: An Med-AIGC based Ethical Language-Image Foundation Model for Generalizable Retina Image Analysis
by: Wei, Hao, et al.
Published: (2024)
by: Wei, Hao, et al.
Published: (2024)
TernaryCLIP: Efficiently Compressing Vision-Language Models with Ternary Weights and Distilled Knowledge
by: Zhang, Shu-Hao, et al.
Published: (2025)
by: Zhang, Shu-Hao, et al.
Published: (2025)
DiffCAP: Diffusion-based Cumulative Adversarial Purification for Vision Language Models
by: Fu, Jia, et al.
Published: (2025)
by: Fu, Jia, et al.
Published: (2025)
Vista: A Generalizable Driving World Model with High Fidelity and Versatile Controllability
by: Gao, Shenyuan, et al.
Published: (2024)
by: Gao, Shenyuan, et al.
Published: (2024)
CLIP-DQA: Blindly Evaluating Dehazed Images from Global and Local Perspectives Using CLIP
by: Zeng, Yirui, et al.
Published: (2025)
by: Zeng, Yirui, et al.
Published: (2025)
Investigating and Mitigating Object Hallucinations in Pretrained Vision-Language (CLIP) Models
by: Liu, Yufang, et al.
Published: (2024)
by: Liu, Yufang, et al.
Published: (2024)
SVGDreamer: Text Guided SVG Generation with Diffusion Model
by: Xing, Ximing, et al.
Published: (2023)
by: Xing, Ximing, et al.
Published: (2023)
Lagrange Duality and Compound Multi-Attention Transformer for Semi-Supervised Medical Image Segmentation
by: Zheng, Fuchen, et al.
Published: (2024)
by: Zheng, Fuchen, et al.
Published: (2024)
MedProbCLIP: Probabilistic Adaptation of Vision-Language Foundation Model for Reliable Radiograph-Report Retrieval
by: Elallaf, Ahmad, et al.
Published: (2026)
by: Elallaf, Ahmad, et al.
Published: (2026)
Contrastive Learning Guided Latent Diffusion Model for Image-to-Image Translation
by: Si, Qi, et al.
Published: (2025)
by: Si, Qi, et al.
Published: (2025)
AdaptCLIP: Adapting CLIP for Universal Visual Anomaly Detection
by: Gao, Bin-Bin, et al.
Published: (2025)
by: Gao, Bin-Bin, et al.
Published: (2025)
Feature-Optimized Vision for Adaptive 3D Scene Reconstruction
by: Liang, Eric
Published: (2026)
by: Liang, Eric
Published: (2026)
Pixel3DMM: Versatile Screen-Space Priors for Single-Image 3D Face Reconstruction
by: Giebenhain, Simon, et al.
Published: (2025)
by: Giebenhain, Simon, et al.
Published: (2025)
DIST-CLIP: Arbitrary Metadata and Image Guided MRI Harmonization via Disentangled Anatomy-Contrast Representations
by: Avci, Mehmet Yigit, et al.
Published: (2025)
by: Avci, Mehmet Yigit, et al.
Published: (2025)
DiffVLA: Vision-Language Guided Diffusion Planning for Autonomous Driving
by: Jiang, Anqing, et al.
Published: (2025)
by: Jiang, Anqing, et al.
Published: (2025)
DP-MDM: Detail-Preserving MR Reconstruction via Multiple Diffusion Models
by: Geng, Mengxiao, et al.
Published: (2024)
by: Geng, Mengxiao, et al.
Published: (2024)
Versatile Multimodal Controls for Expressive Talking Human Animation
by: Qin, Zheng, et al.
Published: (2025)
by: Qin, Zheng, et al.
Published: (2025)
Similar Items
-
HAVIR: HierArchical Vision to Image Reconstruction using CLIP-Guided Versatile Diffusion
by: Zhang, Shiyi, et al.
Published: (2025) -
HAMMR: HierArchical MultiModal React agents for generic VQA
by: Castrejon, Lluis, et al.
Published: (2024) -
Joint PET-MRI Reconstruction with Diffusion Stochastic Differential Model
by: Xie, Taofeng, et al.
Published: (2024) -
FACMIC: Federated Adaptative CLIP Model for Medical Image Classification
by: Wu, Yihang, et al.
Published: (2024) -
Diffusion Curriculum: Synthetic-to-Real Data Curriculum via Image-Guided Diffusion
by: Liang, Yijun, et al.
Published: (2024)