HAVIR: HierArchical Vision to Image Reconstruction using CLIP-Guided Versatile Diffusion
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Shiyi, Liang, Dong, Zheng, Hairong, Zhou, Yihang |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
HAVIR: HierArchical Vision to Image Reconstruction using CLIP-Guided Versatile Diffusion
by: Zhang, Shiyi, et al.
Published: (2025)
by: Zhang, Shiyi, et al.
Published: (2025)
HAMMR: HierArchical MultiModal React agents for generic VQA
by: Castrejon, Lluis, et al.
Published: (2024)
by: Castrejon, Lluis, et al.
Published: (2024)
DEXTER: Diffusion-Guided EXplanations with TExtual Reasoning for Vision Models
by: Carnemolla, Simone, et al.
Published: (2025)
by: Carnemolla, Simone, et al.
Published: (2025)
Lightweight Prompt-Guided CLIP Adaptation for Monocular Depth Estimation
by: Manghotay, Reyhaneh Ahani, et al.
Published: (2026)
by: Manghotay, Reyhaneh Ahani, et al.
Published: (2026)
CLIP Embeddings for AI-Generated Image Detection: A Few-Shot Study with Lightweight Classifier
by: Ou, Ziyang
Published: (2025)
by: Ou, Ziyang
Published: (2025)
Context-Aware Full Body Anonymization using Text-to-Image Diffusion Models
by: Zwick, Pascal, et al.
Published: (2024)
by: Zwick, Pascal, et al.
Published: (2024)
FrescoDiffusion: 4K Image-to-Video with Prior-Regularized Tiled Diffusion
by: Caselles-Dupré, Hugo, et al.
Published: (2026)
by: Caselles-Dupré, Hugo, et al.
Published: (2026)
CoMViT: An Efficient Vision Backbone for Supervised Classification in Medical Imaging
by: Safdar, Aon, et al.
Published: (2025)
by: Safdar, Aon, et al.
Published: (2025)
Disrupting Diffusion: Token-Level Attention Erasure Attack against Diffusion-based Customization
by: Liu, Yisu, et al.
Published: (2024)
by: Liu, Yisu, et al.
Published: (2024)
Diffusion Curriculum: Synthetic-to-Real Data Curriculum via Image-Guided Diffusion
by: Liang, Yijun, et al.
Published: (2024)
by: Liang, Yijun, et al.
Published: (2024)
LATTE: Latent Trajectory Embedding for Diffusion-Generated Image Detection
by: Vasilcoiu, Ana, et al.
Published: (2025)
by: Vasilcoiu, Ana, et al.
Published: (2025)
Skeleton-based sign language recognition using a dual-stream spatio-temporal dynamic graph convolutional network
by: Liu, Liangjin, et al.
Published: (2025)
by: Liu, Liangjin, et al.
Published: (2025)
Scaling Large Vision-Language Models for Enhanced Multimodal Comprehension In Biomedical Image Analysis
by: Umeike, Robinson, et al.
Published: (2025)
by: Umeike, Robinson, et al.
Published: (2025)
Joint PET-MRI Reconstruction with Diffusion Stochastic Differential Model
by: Xie, Taofeng, et al.
Published: (2024)
by: Xie, Taofeng, et al.
Published: (2024)
NeeCo: Image Synthesis of Novel Instrument States Based on Dynamic and Deformable 3D Gaussian Reconstruction
by: Zeng, Tianle, et al.
Published: (2025)
by: Zeng, Tianle, et al.
Published: (2025)
Diffusion-Based Synthetic Brightfield Microscopy Images for Enhanced Single Cell Detection
by: da Graca, Mario de Jesus, et al.
Published: (2025)
by: da Graca, Mario de Jesus, et al.
Published: (2025)
DPER: Diffusion Prior Driven Neural Representation for Limited Angle and Sparse View CT Reconstruction
by: Du, Chenhe, et al.
Published: (2024)
by: Du, Chenhe, et al.
Published: (2024)
VQ4DiT: Efficient Post-Training Vector Quantization for Diffusion Transformers
by: Deng, Juncan, et al.
Published: (2024)
by: Deng, Juncan, et al.
Published: (2024)
Intrinsic Image Fusion for Multi-View 3D Material Reconstruction
by: Kocsis, Peter, et al.
Published: (2025)
by: Kocsis, Peter, et al.
Published: (2025)
Versatile Framework with Semantic and Structural guidance for Image Reconstruction from Brain Activity
by: Lu, Yizhuo, et al.
Published: (2026)
by: Lu, Yizhuo, et al.
Published: (2026)
Scalable Face Security Vision Foundation Model for Deepfake, Diffusion, and Spoofing Detection
by: Wang, Gaojian, et al.
Published: (2025)
by: Wang, Gaojian, et al.
Published: (2025)
PriorCLIP: Visual Prior Guided Vision-Language Model for Remote Sensing Image-Text Retrieval
by: Pan, Jiancheng, et al.
Published: (2024)
by: Pan, Jiancheng, et al.
Published: (2024)
PBSBench: A Multi-Level Vision-Language Framework and Benchmark for Hematopathology Whole Slide Image Interpretation
by: Wang, Yuanlong, et al.
Published: (2026)
by: Wang, Yuanlong, et al.
Published: (2026)
Dynamic Residual Encoding with Slide-Level Contrastive Learning for End-to-End Whole Slide Image Representation
by: Jin, Jing, et al.
Published: (2025)
by: Jin, Jing, et al.
Published: (2025)
SnapPix: Efficient-Coding--Inspired In-Sensor Compression for Edge Vision
by: Lin, Weikai, et al.
Published: (2025)
by: Lin, Weikai, et al.
Published: (2025)
Image Synthesis with Class-Aware Semantic Diffusion Models for Surgical Scene Segmentation
by: Zhou, Yihang, et al.
Published: (2024)
by: Zhou, Yihang, et al.
Published: (2024)
Intrinsic Image Diffusion for Indoor Single-view Material Estimation
by: Kocsis, Peter, et al.
Published: (2023)
by: Kocsis, Peter, et al.
Published: (2023)
FACMIC: Federated Adaptative CLIP Model for Medical Image Classification
by: Wu, Yihang, et al.
Published: (2024)
by: Wu, Yihang, et al.
Published: (2024)
From Dead Pixels to Editable Slides: Infographic Reconstruction into Native Google Slides via Vision-Language Region Understanding
by: Gonzalez, Leonardo
Published: (2026)
by: Gonzalez, Leonardo
Published: (2026)
SpikeVAEDiff: Neural Spike-based Natural Visual Scene Reconstruction via VD-VAE and Versatile Diffusion
by: Li, Jialu, et al.
Published: (2026)
by: Li, Jialu, et al.
Published: (2026)
CLIP-MUSED: CLIP-Guided Multi-Subject Visual Neural Information Semantic Decoding
by: Zhou, Qiongyi, et al.
Published: (2024)
by: Zhou, Qiongyi, et al.
Published: (2024)
Long Tail Image Generation Through Feature Space Augmentation and Iterated Learning
by: Elberg, Rafael, et al.
Published: (2024)
by: Elberg, Rafael, et al.
Published: (2024)
XAI-CLIP: ROI-Guided Perturbation Framework for Explainable Medical Image Segmentation in Multimodal Vision-Language Models
by: Alzubaidi, Thuraya, et al.
Published: (2026)
by: Alzubaidi, Thuraya, et al.
Published: (2026)
FusionSense: Bridging Common Sense, Vision, and Touch for Robust Sparse-View Reconstruction
by: Fang, Irving, et al.
Published: (2024)
by: Fang, Irving, et al.
Published: (2024)
Safeguarding Vision-Language Models Against Patched Visual Prompt Injectors
by: Sun, Jiachen, et al.
Published: (2024)
by: Sun, Jiachen, et al.
Published: (2024)
On the Limitations of Vision-Language Models in Understanding Image Transforms
by: Anis, Ahmad Mustafa, et al.
Published: (2025)
by: Anis, Ahmad Mustafa, et al.
Published: (2025)
Faster Vision Mamba is Rebuilt in Minutes via Merged Token Re-training
by: Shi, Mingjia, et al.
Published: (2024)
by: Shi, Mingjia, et al.
Published: (2024)
CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation
by: Chong, Zheng, et al.
Published: (2025)
by: Chong, Zheng, et al.
Published: (2025)
T-HITL Effectively Addresses Problematic Associations in Image Generation and Maintains Overall Visual Quality
by: Epstein, Susan, et al.
Published: (2024)
by: Epstein, Susan, et al.
Published: (2024)
On the Utility of Foundation Models for Fast MRI: Vision-Language-Guided Image Reconstruction
by: Feng, Ruimin, et al.
Published: (2025)
by: Feng, Ruimin, et al.
Published: (2025)
Similar Items
-
HAVIR: HierArchical Vision to Image Reconstruction using CLIP-Guided Versatile Diffusion
by: Zhang, Shiyi, et al.
Published: (2025) -
HAMMR: HierArchical MultiModal React agents for generic VQA
by: Castrejon, Lluis, et al.
Published: (2024) -
DEXTER: Diffusion-Guided EXplanations with TExtual Reasoning for Vision Models
by: Carnemolla, Simone, et al.
Published: (2025) -
Lightweight Prompt-Guided CLIP Adaptation for Monocular Depth Estimation
by: Manghotay, Reyhaneh Ahani, et al.
Published: (2026) -
CLIP Embeddings for AI-Generated Image Detection: A Few-Shot Study with Lightweight Classifier
by: Ou, Ziyang
Published: (2025)