VGDiffZero: Text-to-image Diffusion Models Can Be Zero-shot Visual Grounders
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Xuyang, Huang, Siteng, Kang, Yachen, Chen, Honggang, Wang, Donglin |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DARA: Domain- and Relation-aware Adapters Make Parameter-efficient Tuning for Visual Grounding
par: Liu, Ting, et autres
Publié: (2024)
par: Liu, Ting, et autres
Publié: (2024)
VLM-Grounder: A VLM Agent for Zero-Shot 3D Visual Grounding
par: Xu, Runsen, et autres
Publié: (2024)
par: Xu, Runsen, et autres
Publié: (2024)
Focus-Consistent Multi-Level Aggregation for Compositional Zero-Shot Learning
par: Dai, Fengyuan, et autres
Publié: (2024)
par: Dai, Fengyuan, et autres
Publié: (2024)
Variation-aware Vision Token Dropping for Faster Large Vision-Language Models
par: Chen, Junjie, et autres
Publié: (2025)
par: Chen, Junjie, et autres
Publié: (2025)
Filter, Correlate, Compress: Training-Free Token Reduction for MLLM Acceleration
par: Han, Yuhang, et autres
Publié: (2024)
par: Han, Yuhang, et autres
Publié: (2024)
M2IST: Multi-Modal Interactive Side-Tuning for Efficient Referring Expression Comprehension
par: Liu, Xuyang, et autres
Publié: (2024)
par: Liu, Xuyang, et autres
Publié: (2024)
AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models
par: Huynh, Cuong, et autres
Publié: (2026)
par: Huynh, Cuong, et autres
Publié: (2026)
Zero-shot Composed Text-Image Retrieval
par: Liu, Yikun, et autres
Publié: (2023)
par: Liu, Yikun, et autres
Publié: (2023)
Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models
par: Akdemir, Kiymet, et autres
Publié: (2025)
par: Akdemir, Kiymet, et autres
Publié: (2025)
DreamDrone: Text-to-Image Diffusion Models are Zero-shot Perpetual View Generators
par: Kong, Hanyang, et autres
Publié: (2023)
par: Kong, Hanyang, et autres
Publié: (2023)
Troika: Multi-Path Cross-Modal Traction for Compositional Zero-Shot Learning
par: Huang, Siteng, et autres
Publié: (2023)
par: Huang, Siteng, et autres
Publié: (2023)
Global Compression Commander: Plug-and-Play Inference Acceleration for High-Resolution Large Vision-Language Models
par: Liu, Xuyang, et autres
Publié: (2025)
par: Liu, Xuyang, et autres
Publié: (2025)
SceneGraphGrounder: Zero-Shot 3D Visual Grounding via Structured Scene Graph Matching
par: Sun, Xuefei, et autres
Publié: (2026)
par: Sun, Xuefei, et autres
Publié: (2026)
Zero-shot Hierarchical Plant Segmentation via Foundation Segmentation Models and Text-to-image Attention
par: Xing, Junhao, et autres
Publié: (2025)
par: Xing, Junhao, et autres
Publié: (2025)
Learning Disentangled Identifiers for Action-Customized Text-to-Image Generation
par: Huang, Siteng, et autres
Publié: (2023)
par: Huang, Siteng, et autres
Publié: (2023)
GPT4Vis: What Can GPT-4 Do for Zero-shot Visual Recognition?
par: Wu, Wenhao, et autres
Publié: (2023)
par: Wu, Wenhao, et autres
Publié: (2023)
VisTa: Visual-contextual and Text-augmented Zero-shot Object-level OOD Detection
par: Zhang, Bin, et autres
Publié: (2025)
par: Zhang, Bin, et autres
Publié: (2025)
ZeroDiff++: Substantial Unseen Visual-semantic Correlation in Zero-shot Learning
par: Ye, Zihan, et autres
Publié: (2026)
par: Ye, Zihan, et autres
Publié: (2026)
TI2V-Zero: Zero-Shot Image Conditioning for Text-to-Video Diffusion Models
par: Ni, Haomiao, et autres
Publié: (2024)
par: Ni, Haomiao, et autres
Publié: (2024)
Zero-shot Compound Expression Recognition with Visual Language Model at the 6th ABAW Challenge
par: Wang, Jiahe, et autres
Publié: (2024)
par: Wang, Jiahe, et autres
Publié: (2024)
Task-Specific Zero-shot Quantization-Aware Training for Object Detection
par: Li, Changhao, et autres
Publié: (2025)
par: Li, Changhao, et autres
Publié: (2025)
Ground-A-Video: Zero-shot Grounded Video Editing using Text-to-image Diffusion Models
par: Jeong, Hyeonho, et autres
Publié: (2023)
par: Jeong, Hyeonho, et autres
Publié: (2023)
FAGStyle: Feature Augmentation on Geodesic Surface for Zero-shot Text-guided Diffusion Image Style Transfer
par: Han, Yuexing, et autres
Publié: (2024)
par: Han, Yuexing, et autres
Publié: (2024)
MS-Diffusion: Multi-subject Zero-shot Image Personalization with Layout Guidance
par: Wang, Xierui, et autres
Publié: (2024)
par: Wang, Xierui, et autres
Publié: (2024)
ZeroShape: Regression-based Zero-shot Shape Reconstruction
par: Huang, Zixuan, et autres
Publié: (2023)
par: Huang, Zixuan, et autres
Publié: (2023)
Visual Space Optimization for Zero-shot Learning
par: Wang, Xinsheng, et autres
Publié: (2019)
par: Wang, Xinsheng, et autres
Publié: (2019)
ZeroComp: Zero-shot Object Compositing from Image Intrinsics via Diffusion
par: Zhang, Zitian, et autres
Publié: (2024)
par: Zhang, Zitian, et autres
Publié: (2024)
Zero-shot Image Editing with Reference Imitation
par: Chen, Xi, et autres
Publié: (2024)
par: Chen, Xi, et autres
Publié: (2024)
PiTe: Pixel-Temporal Alignment for Large Video-Language Model
par: Liu, Yang, et autres
Publié: (2024)
par: Liu, Yang, et autres
Publié: (2024)
Dynamic Visual-semantic Alignment for Zero-shot Learning with Ambiguous Labels
par: Li, Jiangnan, et autres
Publié: (2026)
par: Li, Jiangnan, et autres
Publié: (2026)
Accelerating Diffusion Transformers with Token-wise Feature Caching
par: Zou, Chang, et autres
Publié: (2024)
par: Zou, Chang, et autres
Publié: (2024)
Free-Editor: Zero-shot Text-driven 3D Scene Editing
par: Karim, Nazmul, et autres
Publié: (2023)
par: Karim, Nazmul, et autres
Publié: (2023)
Zero-shot Quantization: A Comprehensive Survey
par: Kim, Minjun, et autres
Publié: (2025)
par: Kim, Minjun, et autres
Publié: (2025)
Sparse-Tuning: Adapting Vision Transformers with Efficient Fine-tuning and Inference
par: Liu, Ting, et autres
Publié: (2024)
par: Liu, Ting, et autres
Publié: (2024)
VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL
par: Dai, Fengyuan, et autres
Publié: (2025)
par: Dai, Fengyuan, et autres
Publié: (2025)
ZeroStereo: Zero-shot Stereo Matching from Single Images
par: Wang, Xianqi, et autres
Publié: (2025)
par: Wang, Xianqi, et autres
Publié: (2025)
Simultaneous Image-to-Zero and Zero-to-Noise: Diffusion Models with Analytical Image Attenuation
par: Huang, Yuhang, et autres
Publié: (2023)
par: Huang, Yuhang, et autres
Publié: (2023)
Zero-shot Dynamic MRI Reconstruction with Global-to-local Diffusion Model
par: Guan, Yu, et autres
Publié: (2024)
par: Guan, Yu, et autres
Publié: (2024)
DynaIP: Dynamic Image Prompt Adapter for Scalable Zero-shot Personalized Text-to-Image Generation
par: Wang, Zhizhong, et autres
Publié: (2025)
par: Wang, Zhizhong, et autres
Publié: (2025)
Boosting Audio-visual Zero-shot Learning with Large Language Models
par: Chen, Haoxing, et autres
Publié: (2023)
par: Chen, Haoxing, et autres
Publié: (2023)
Documents similaires
-
DARA: Domain- and Relation-aware Adapters Make Parameter-efficient Tuning for Visual Grounding
par: Liu, Ting, et autres
Publié: (2024) -
VLM-Grounder: A VLM Agent for Zero-Shot 3D Visual Grounding
par: Xu, Runsen, et autres
Publié: (2024) -
Focus-Consistent Multi-Level Aggregation for Compositional Zero-Shot Learning
par: Dai, Fengyuan, et autres
Publié: (2024) -
Variation-aware Vision Token Dropping for Faster Large Vision-Language Models
par: Chen, Junjie, et autres
Publié: (2025) -
Filter, Correlate, Compress: Training-Free Token Reduction for MLLM Acceleration
par: Han, Yuhang, et autres
Publié: (2024)