HAVIR: HierArchical Vision to Image Reconstruction using CLIP-Guided Versatile Diffusion
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Shiyi, Liang, Dong, Zheng, Hairong, Zhou, Yihang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
HAVIR: HierArchical Vision to Image Reconstruction using CLIP-Guided Versatile Diffusion
di: Zhang, Shiyi, et al.
Pubblicazione: (2025)
di: Zhang, Shiyi, et al.
Pubblicazione: (2025)
HAMMR: HierArchical MultiModal React agents for generic VQA
di: Castrejon, Lluis, et al.
Pubblicazione: (2024)
di: Castrejon, Lluis, et al.
Pubblicazione: (2024)
DEXTER: Diffusion-Guided EXplanations with TExtual Reasoning for Vision Models
di: Carnemolla, Simone, et al.
Pubblicazione: (2025)
di: Carnemolla, Simone, et al.
Pubblicazione: (2025)
Lightweight Prompt-Guided CLIP Adaptation for Monocular Depth Estimation
di: Manghotay, Reyhaneh Ahani, et al.
Pubblicazione: (2026)
di: Manghotay, Reyhaneh Ahani, et al.
Pubblicazione: (2026)
CLIP Embeddings for AI-Generated Image Detection: A Few-Shot Study with Lightweight Classifier
di: Ou, Ziyang
Pubblicazione: (2025)
di: Ou, Ziyang
Pubblicazione: (2025)
Context-Aware Full Body Anonymization using Text-to-Image Diffusion Models
di: Zwick, Pascal, et al.
Pubblicazione: (2024)
di: Zwick, Pascal, et al.
Pubblicazione: (2024)
FrescoDiffusion: 4K Image-to-Video with Prior-Regularized Tiled Diffusion
di: Caselles-Dupré, Hugo, et al.
Pubblicazione: (2026)
di: Caselles-Dupré, Hugo, et al.
Pubblicazione: (2026)
CoMViT: An Efficient Vision Backbone for Supervised Classification in Medical Imaging
di: Safdar, Aon, et al.
Pubblicazione: (2025)
di: Safdar, Aon, et al.
Pubblicazione: (2025)
Disrupting Diffusion: Token-Level Attention Erasure Attack against Diffusion-based Customization
di: Liu, Yisu, et al.
Pubblicazione: (2024)
di: Liu, Yisu, et al.
Pubblicazione: (2024)
Diffusion Curriculum: Synthetic-to-Real Data Curriculum via Image-Guided Diffusion
di: Liang, Yijun, et al.
Pubblicazione: (2024)
di: Liang, Yijun, et al.
Pubblicazione: (2024)
LATTE: Latent Trajectory Embedding for Diffusion-Generated Image Detection
di: Vasilcoiu, Ana, et al.
Pubblicazione: (2025)
di: Vasilcoiu, Ana, et al.
Pubblicazione: (2025)
Skeleton-based sign language recognition using a dual-stream spatio-temporal dynamic graph convolutional network
di: Liu, Liangjin, et al.
Pubblicazione: (2025)
di: Liu, Liangjin, et al.
Pubblicazione: (2025)
Scaling Large Vision-Language Models for Enhanced Multimodal Comprehension In Biomedical Image Analysis
di: Umeike, Robinson, et al.
Pubblicazione: (2025)
di: Umeike, Robinson, et al.
Pubblicazione: (2025)
Joint PET-MRI Reconstruction with Diffusion Stochastic Differential Model
di: Xie, Taofeng, et al.
Pubblicazione: (2024)
di: Xie, Taofeng, et al.
Pubblicazione: (2024)
NeeCo: Image Synthesis of Novel Instrument States Based on Dynamic and Deformable 3D Gaussian Reconstruction
di: Zeng, Tianle, et al.
Pubblicazione: (2025)
di: Zeng, Tianle, et al.
Pubblicazione: (2025)
Diffusion-Based Synthetic Brightfield Microscopy Images for Enhanced Single Cell Detection
di: da Graca, Mario de Jesus, et al.
Pubblicazione: (2025)
di: da Graca, Mario de Jesus, et al.
Pubblicazione: (2025)
DPER: Diffusion Prior Driven Neural Representation for Limited Angle and Sparse View CT Reconstruction
di: Du, Chenhe, et al.
Pubblicazione: (2024)
di: Du, Chenhe, et al.
Pubblicazione: (2024)
VQ4DiT: Efficient Post-Training Vector Quantization for Diffusion Transformers
di: Deng, Juncan, et al.
Pubblicazione: (2024)
di: Deng, Juncan, et al.
Pubblicazione: (2024)
Intrinsic Image Fusion for Multi-View 3D Material Reconstruction
di: Kocsis, Peter, et al.
Pubblicazione: (2025)
di: Kocsis, Peter, et al.
Pubblicazione: (2025)
Versatile Framework with Semantic and Structural guidance for Image Reconstruction from Brain Activity
di: Lu, Yizhuo, et al.
Pubblicazione: (2026)
di: Lu, Yizhuo, et al.
Pubblicazione: (2026)
Scalable Face Security Vision Foundation Model for Deepfake, Diffusion, and Spoofing Detection
di: Wang, Gaojian, et al.
Pubblicazione: (2025)
di: Wang, Gaojian, et al.
Pubblicazione: (2025)
PriorCLIP: Visual Prior Guided Vision-Language Model for Remote Sensing Image-Text Retrieval
di: Pan, Jiancheng, et al.
Pubblicazione: (2024)
di: Pan, Jiancheng, et al.
Pubblicazione: (2024)
PBSBench: A Multi-Level Vision-Language Framework and Benchmark for Hematopathology Whole Slide Image Interpretation
di: Wang, Yuanlong, et al.
Pubblicazione: (2026)
di: Wang, Yuanlong, et al.
Pubblicazione: (2026)
Dynamic Residual Encoding with Slide-Level Contrastive Learning for End-to-End Whole Slide Image Representation
di: Jin, Jing, et al.
Pubblicazione: (2025)
di: Jin, Jing, et al.
Pubblicazione: (2025)
SnapPix: Efficient-Coding--Inspired In-Sensor Compression for Edge Vision
di: Lin, Weikai, et al.
Pubblicazione: (2025)
di: Lin, Weikai, et al.
Pubblicazione: (2025)
Image Synthesis with Class-Aware Semantic Diffusion Models for Surgical Scene Segmentation
di: Zhou, Yihang, et al.
Pubblicazione: (2024)
di: Zhou, Yihang, et al.
Pubblicazione: (2024)
Intrinsic Image Diffusion for Indoor Single-view Material Estimation
di: Kocsis, Peter, et al.
Pubblicazione: (2023)
di: Kocsis, Peter, et al.
Pubblicazione: (2023)
FACMIC: Federated Adaptative CLIP Model for Medical Image Classification
di: Wu, Yihang, et al.
Pubblicazione: (2024)
di: Wu, Yihang, et al.
Pubblicazione: (2024)
From Dead Pixels to Editable Slides: Infographic Reconstruction into Native Google Slides via Vision-Language Region Understanding
di: Gonzalez, Leonardo
Pubblicazione: (2026)
di: Gonzalez, Leonardo
Pubblicazione: (2026)
SpikeVAEDiff: Neural Spike-based Natural Visual Scene Reconstruction via VD-VAE and Versatile Diffusion
di: Li, Jialu, et al.
Pubblicazione: (2026)
di: Li, Jialu, et al.
Pubblicazione: (2026)
CLIP-MUSED: CLIP-Guided Multi-Subject Visual Neural Information Semantic Decoding
di: Zhou, Qiongyi, et al.
Pubblicazione: (2024)
di: Zhou, Qiongyi, et al.
Pubblicazione: (2024)
Long Tail Image Generation Through Feature Space Augmentation and Iterated Learning
di: Elberg, Rafael, et al.
Pubblicazione: (2024)
di: Elberg, Rafael, et al.
Pubblicazione: (2024)
XAI-CLIP: ROI-Guided Perturbation Framework for Explainable Medical Image Segmentation in Multimodal Vision-Language Models
di: Alzubaidi, Thuraya, et al.
Pubblicazione: (2026)
di: Alzubaidi, Thuraya, et al.
Pubblicazione: (2026)
FusionSense: Bridging Common Sense, Vision, and Touch for Robust Sparse-View Reconstruction
di: Fang, Irving, et al.
Pubblicazione: (2024)
di: Fang, Irving, et al.
Pubblicazione: (2024)
Safeguarding Vision-Language Models Against Patched Visual Prompt Injectors
di: Sun, Jiachen, et al.
Pubblicazione: (2024)
di: Sun, Jiachen, et al.
Pubblicazione: (2024)
On the Limitations of Vision-Language Models in Understanding Image Transforms
di: Anis, Ahmad Mustafa, et al.
Pubblicazione: (2025)
di: Anis, Ahmad Mustafa, et al.
Pubblicazione: (2025)
Faster Vision Mamba is Rebuilt in Minutes via Merged Token Re-training
di: Shi, Mingjia, et al.
Pubblicazione: (2024)
di: Shi, Mingjia, et al.
Pubblicazione: (2024)
CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation
di: Chong, Zheng, et al.
Pubblicazione: (2025)
di: Chong, Zheng, et al.
Pubblicazione: (2025)
T-HITL Effectively Addresses Problematic Associations in Image Generation and Maintains Overall Visual Quality
di: Epstein, Susan, et al.
Pubblicazione: (2024)
di: Epstein, Susan, et al.
Pubblicazione: (2024)
On the Utility of Foundation Models for Fast MRI: Vision-Language-Guided Image Reconstruction
di: Feng, Ruimin, et al.
Pubblicazione: (2025)
di: Feng, Ruimin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
HAVIR: HierArchical Vision to Image Reconstruction using CLIP-Guided Versatile Diffusion
di: Zhang, Shiyi, et al.
Pubblicazione: (2025) -
HAMMR: HierArchical MultiModal React agents for generic VQA
di: Castrejon, Lluis, et al.
Pubblicazione: (2024) -
DEXTER: Diffusion-Guided EXplanations with TExtual Reasoning for Vision Models
di: Carnemolla, Simone, et al.
Pubblicazione: (2025) -
Lightweight Prompt-Guided CLIP Adaptation for Monocular Depth Estimation
di: Manghotay, Reyhaneh Ahani, et al.
Pubblicazione: (2026) -
CLIP Embeddings for AI-Generated Image Detection: A Few-Shot Study with Lightweight Classifier
di: Ou, Ziyang
Pubblicazione: (2025)