Implicit and Explicit Language Guidance for Diffusion-based Visual Perception
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Hefeng, Cao, Jiale, Xie, Jin, Yang, Aiping, Pang, Yanwei |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Transformer-based stereo-aware 3D object detection from binocular images
by: Sun, Hanqing, et al.
Published: (2023)
by: Sun, Hanqing, et al.
Published: (2023)
CLIP-VIS: Adapting CLIP for Open-Vocabulary Video Instance Segmentation
by: Zhu, Wenqi, et al.
Published: (2024)
by: Zhu, Wenqi, et al.
Published: (2024)
iSeg: An Iterative Refinement-based Framework for Training-free Segmentation
by: Sun, Lin, et al.
Published: (2024)
by: Sun, Lin, et al.
Published: (2024)
CLIPer: Hierarchically Improving Spatial Representation of CLIP for Open-Vocabulary Semantic Segmentation
by: Sun, Lin, et al.
Published: (2024)
by: Sun, Lin, et al.
Published: (2024)
SNNSIR: A Simple Spiking Neural Network for Stereo Image Restoration
by: Xu, Ronghua, et al.
Published: (2025)
by: Xu, Ronghua, et al.
Published: (2025)
SED: A Simple Encoder-Decoder for Open-Vocabulary Semantic Segmentation
by: Xie, Bin, et al.
Published: (2023)
by: Xie, Bin, et al.
Published: (2023)
VFMM3D: Releasing the Potential of Image by Vision Foundation Model for Monocular 3D Object Detection
by: Ding, Bonan, et al.
Published: (2024)
by: Ding, Bonan, et al.
Published: (2024)
Deep Intra-Image Contrastive Learning for Weakly Supervised One-Step Person Search
by: Wang, Jiabei, et al.
Published: (2023)
by: Wang, Jiabei, et al.
Published: (2023)
Implicit Guidance and Explicit Representation of Semantic Information in Points Cloud: A Survey
by: Tang, Jingyuan, et al.
Published: (2025)
by: Tang, Jingyuan, et al.
Published: (2025)
Explicit Critic Guidance for Aligning Diffusion Models
by: Liang, Zhengyang, et al.
Published: (2026)
by: Liang, Zhengyang, et al.
Published: (2026)
Aligning Generative Denoising with Discriminative Objectives Unleashes Diffusion for Visual Perception
by: Pang, Ziqi, et al.
Published: (2025)
by: Pang, Ziqi, et al.
Published: (2025)
IMG: Calibrating Diffusion Models via Implicit Multimodal Guidance
by: Guo, Jiayi, et al.
Published: (2025)
by: Guo, Jiayi, et al.
Published: (2025)
Implicit Neural Surface Deformation with Explicit Velocity Fields
by: Sang, Lu, et al.
Published: (2025)
by: Sang, Lu, et al.
Published: (2025)
Routing Matters in MoE: Scaling Diffusion Transformers with Explicit Routing Guidance
by: Wei, Yujie, et al.
Published: (2025)
by: Wei, Yujie, et al.
Published: (2025)
ClassDiffusion: More Aligned Personalization Tuning with Explicit Class Guidance
by: Huang, Jiannan, et al.
Published: (2024)
by: Huang, Jiannan, et al.
Published: (2024)
iEBAKER: Improved Remote Sensing Image-Text Retrieval Framework via Eliminate Before Align and Keyword Explicit Reasoning
by: Zhang, Yan, et al.
Published: (2025)
by: Zhang, Yan, et al.
Published: (2025)
Visual-Geometric Collaborative Guidance for Affordance Learning
by: Luo, Hongchen, et al.
Published: (2024)
by: Luo, Hongchen, et al.
Published: (2024)
Underlying Semantic Diffusion for Effective and Efficient In-Context Learning
by: Ji, Zhong, et al.
Published: (2025)
by: Ji, Zhong, et al.
Published: (2025)
Enhancing Video Inpainting with Aligned Frame Interval Guidance
by: Xie, Ming, et al.
Published: (2025)
by: Xie, Ming, et al.
Published: (2025)
EPIPTrack: Rethinking Prompt Modeling with Explicit and Implicit Prompts for Multi-Object Tracking
by: Zhang, Yukuan, et al.
Published: (2025)
by: Zhang, Yukuan, et al.
Published: (2025)
StructInbet: Integrating Explicit Structural Guidance into Inbetween Frame Generation
by: Pan, Zhenglin, et al.
Published: (2025)
by: Pan, Zhenglin, et al.
Published: (2025)
Dual-View Data Hallucination with Semantic Relation Guidance for Few-Shot Image Recognition
by: Wu, Hefeng, et al.
Published: (2024)
by: Wu, Hefeng, et al.
Published: (2024)
Personal Visual Memory from Explicit and Implicit Evidence
by: Nguyen, Viet, et al.
Published: (2026)
by: Nguyen, Viet, et al.
Published: (2026)
DVGBench: Implicit-to-Explicit Visual Grounding Benchmark in UAV Imagery with Large Vision-Language Models
by: Zhou, Yue, et al.
Published: (2026)
by: Zhou, Yue, et al.
Published: (2026)
LeftRefill: Filling Right Canvas based on Left Reference through Generalized Text-to-Image Diffusion Model
by: Cao, Chenjie, et al.
Published: (2023)
by: Cao, Chenjie, et al.
Published: (2023)
VisBias: Measuring Explicit and Implicit Social Biases in Vision Language Models
by: Huang, Jen-tse, et al.
Published: (2025)
by: Huang, Jen-tse, et al.
Published: (2025)
DepthSync: Diffusion Guidance-Based Depth Synchronization for Scale- and Geometry-Consistent Video Depth Estimation
by: Dong, Yue-Jiang, et al.
Published: (2025)
by: Dong, Yue-Jiang, et al.
Published: (2025)
POPL-KF: A Pose-Only Geometric Representation-Based Kalman Filter for Point-Line-Based Visual-Inertial Odometry
by: Wang, Aiping, et al.
Published: (2026)
by: Wang, Aiping, et al.
Published: (2026)
Zero-shot Compound Expression Recognition with Visual Language Model at the 6th ABAW Challenge
by: Wang, Jiahe, et al.
Published: (2024)
by: Wang, Jiahe, et al.
Published: (2024)
VALLR-Pin: Uncertainty-Factorized Visual Speech Recognition for Mandarin with Pinyin Guidance
by: Sun, Chang, et al.
Published: (2025)
by: Sun, Chang, et al.
Published: (2025)
Degradation-Guided One-Step Image Super-Resolution with Diffusion Priors
by: Zhang, Aiping, et al.
Published: (2024)
by: Zhang, Aiping, et al.
Published: (2024)
Guidance Free Image Editing via Explicit Conditioning
by: Noroozi, Mehdi, et al.
Published: (2025)
by: Noroozi, Mehdi, et al.
Published: (2025)
EMIE-MAP: Large-Scale Road Surface Reconstruction Based on Explicit Mesh and Implicit Encoding
by: Wu, Wenhua, et al.
Published: (2024)
by: Wu, Wenhua, et al.
Published: (2024)
Implicit and Explicit Commonsense for Multi-sentence Video Captioning
by: Chou, Shih-Han, et al.
Published: (2023)
by: Chou, Shih-Han, et al.
Published: (2023)
Implicit Counterfactual Learning for Audio-Visual Segmentation
by: Zha, Mingfeng, et al.
Published: (2025)
by: Zha, Mingfeng, et al.
Published: (2025)
CIEC: Coupling Implicit and Explicit Cues for Multimodal Weakly Supervised Manipulation Localization
by: Yu, Xinquan, et al.
Published: (2026)
by: Yu, Xinquan, et al.
Published: (2026)
KG-ViP: Bridging Knowledge Grounding and Visual Perception in Multi-modal LLMs for Visual Question Answering
by: Li, Zhiyang, et al.
Published: (2026)
by: Li, Zhiyang, et al.
Published: (2026)
Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis
by: Wang, Pengfei, et al.
Published: (2025)
by: Wang, Pengfei, et al.
Published: (2025)
DRM: Diffusion-based Reward Model With Step-wise Guidance
by: Zhang, Jaxon, et al.
Published: (2026)
by: Zhang, Jaxon, et al.
Published: (2026)
StrandDesigner: Towards Practical Strand Generation with Sketch Guidance
by: Zhang, Na, et al.
Published: (2025)
by: Zhang, Na, et al.
Published: (2025)
Similar Items
-
Transformer-based stereo-aware 3D object detection from binocular images
by: Sun, Hanqing, et al.
Published: (2023) -
CLIP-VIS: Adapting CLIP for Open-Vocabulary Video Instance Segmentation
by: Zhu, Wenqi, et al.
Published: (2024) -
iSeg: An Iterative Refinement-based Framework for Training-free Segmentation
by: Sun, Lin, et al.
Published: (2024) -
CLIPer: Hierarchically Improving Spatial Representation of CLIP for Open-Vocabulary Semantic Segmentation
by: Sun, Lin, et al.
Published: (2024) -
SNNSIR: A Simple Spiking Neural Network for Stereo Image Restoration
by: Xu, Ronghua, et al.
Published: (2025)