Affordance-Aware Object Insertion via Mask-Aware Dual Diffusion
Fuente:
arXiv
Saved in:
| Main Authors: | He, Jixuan, Li, Wanhua, Liu, Ye, Kim, Junsik, Wei, Donglai, Pfister, Hanspeter |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
$R^2$-Tuning: Efficient Image-to-Video Transfer Learning for Video Temporal Grounding
by: Liu, Ye, et al.
Published: (2024)
by: Liu, Ye, et al.
Published: (2024)
Joint-Task Regularization for Partially Labeled Multi-Task Learning
by: Nishi, Kento, et al.
Published: (2024)
by: Nishi, Kento, et al.
Published: (2024)
MoRA: LoRA Guided Multi-Modal Disease Diagnosis with Missing Modality
by: Shi, Zhiyi, et al.
Published: (2024)
by: Shi, Zhiyi, et al.
Published: (2024)
SocialGPT: Prompting LLMs for Social Relation Reasoning via Greedy Segment Optimization
by: Li, Wanhua, et al.
Published: (2024)
by: Li, Wanhua, et al.
Published: (2024)
CTRL-GS: Cascaded Temporal Residue Learning for 4D Gaussian Splatting
by: Hou, Karly, et al.
Published: (2025)
by: Hou, Karly, et al.
Published: (2025)
LangFlash: Feed-forward 3D Language Gaussian Splatting from Sparse Unposed Images
by: Liu, Yilong, et al.
Published: (2026)
by: Liu, Yilong, et al.
Published: (2026)
DualEdit: Dual Editing for Knowledge Updating in Vision-Language Models
by: Shi, Zhiyi, et al.
Published: (2025)
by: Shi, Zhiyi, et al.
Published: (2025)
RiGS: Rigid-aware 4D Gaussian Splatting from a Single Monocular Video
by: Wu, Chenyu, et al.
Published: (2026)
by: Wu, Chenyu, et al.
Published: (2026)
LangSplat: 3D Language Gaussian Splatting
by: Qin, Minghan, et al.
Published: (2023)
by: Qin, Minghan, et al.
Published: (2023)
RoboTAG: End-to-end Robot Configuration Estimation via Topological Alignment Graph
by: Liu, Yifan, et al.
Published: (2025)
by: Liu, Yifan, et al.
Published: (2025)
TriSAM: Tri-Plane SAM for zero-shot cortical blood vessel segmentation in VEM images
by: Wan, Jia, et al.
Published: (2024)
by: Wan, Jia, et al.
Published: (2024)
Tree of Attributes Prompt Learning for Vision-Language Models
by: Ding, Tong, et al.
Published: (2024)
by: Ding, Tong, et al.
Published: (2024)
S$^3$-TTA: Scale-Style Selection for Test-Time Augmentation in Biomedical Image Segmentation
by: Xie, Kangxian, et al.
Published: (2023)
by: Xie, Kangxian, et al.
Published: (2023)
Is What You Ask For What You Get? Investigating Concept Associations in Text-to-Image Models
by: Magid, Salma Abdel, et al.
Published: (2024)
by: Magid, Salma Abdel, et al.
Published: (2024)
4D LangSplat: 4D Language Gaussian Splatting via Multimodal Large Language Models
by: Li, Wanhua, et al.
Published: (2025)
by: Li, Wanhua, et al.
Published: (2025)
LangSplatV2: High-dimensional 3D Language Gaussian Splatting with 450+ FPS
by: Li, Wanhua, et al.
Published: (2025)
by: Li, Wanhua, et al.
Published: (2025)
Towards Affordance-Aware Articulation Synthesis for Rigged Objects
by: Yu, Yu-Chu, et al.
Published: (2025)
by: Yu, Yu-Chu, et al.
Published: (2025)
Multimodal Learning for Embryo Viability Prediction in Clinical IVF
by: Kim, Junsik, et al.
Published: (2024)
by: Kim, Junsik, et al.
Published: (2024)
AffordGrasp: Cross-Modal Diffusion for Affordance-Aware Grasp Synthesis
by: Wu, Xiaofei, et al.
Published: (2026)
by: Wu, Xiaofei, et al.
Published: (2026)
OmniInsert: Mask-Free Video Insertion of Any Reference via Diffusion Transformer Models
by: Chen, Jinshu, et al.
Published: (2025)
by: Chen, Jinshu, et al.
Published: (2025)
Momentum-GS: Momentum Gaussian Self-Distillation for High-Quality Large Scene Reconstruction
by: Fan, Jixuan, et al.
Published: (2024)
by: Fan, Jixuan, et al.
Published: (2024)
Virtual Multiplex Staining for Histological Images using a Marker-wise Conditioned Diffusion Model
by: Oh, Hyun-Jic, et al.
Published: (2025)
by: Oh, Hyun-Jic, et al.
Published: (2025)
Spatial-Temporal Pre-Training for Embryo Viability Prediction Using Time-Lapse Videos
by: Shi, Zhiyi, et al.
Published: (2025)
by: Shi, Zhiyi, et al.
Published: (2025)
Timestep-Aware Block Masking for Efficient Diffusion Model Inference
by: He, Haodong, et al.
Published: (2026)
by: He, Haodong, et al.
Published: (2026)
Learning Gaze-aware Compositional GAN
by: Aranjuelo, Nerea, et al.
Published: (2024)
by: Aranjuelo, Nerea, et al.
Published: (2024)
Aligning Sight and Sound: Advanced Sound Source Localization Through Audio-Visual Alignment
by: Senocak, Arda, et al.
Published: (2024)
by: Senocak, Arda, et al.
Published: (2024)
Part-Aware Open-Vocabulary 3D Affordance Grounding via Prototypical Semantic and Geometric Alignment
by: Gou, Dongqiang, et al.
Published: (2026)
by: Gou, Dongqiang, et al.
Published: (2026)
MDE-Edit: Masked Dual-Editing for Multi-Object Image Editing via Diffusion Models
by: Zhu, Hongyang, et al.
Published: (2025)
by: Zhu, Hongyang, et al.
Published: (2025)
Occlusion-Aware 3D Hand-Object Pose Estimation with Masked AutoEncoders
by: Yang, Hui, et al.
Published: (2025)
by: Yang, Hui, et al.
Published: (2025)
Populate-A-Scene: Affordance-Aware Human Video Generation
by: Shan, Mengyi, et al.
Published: (2025)
by: Shan, Mengyi, et al.
Published: (2025)
Towards 1000-fold Electron Microscopy Image Compression for Connectomics via VQ-VAE with Transformer Prior
by: Yang, Fuming, et al.
Published: (2025)
by: Yang, Fuming, et al.
Published: (2025)
Object Affordance Recognition and Grounding via Multi-scale Cross-modal Representation Learning
by: Wan, Xinhang, et al.
Published: (2025)
by: Wan, Xinhang, et al.
Published: (2025)
Uncertainty-Aware Pedestrian Trajectory Prediction via Distributional Diffusion
by: Liu, Yao, et al.
Published: (2023)
by: Liu, Yao, et al.
Published: (2023)
Task-Aware 3D Affordance Segmentation via 2D Guidance and Geometric Refinement
by: He, Lian, et al.
Published: (2025)
by: He, Lian, et al.
Published: (2025)
CatalogStitch: Dimension-Aware and Occlusion-Preserving Object Compositing for Catalog Image Generation
by: Jain, Sanyam, et al.
Published: (2026)
by: Jain, Sanyam, et al.
Published: (2026)
HAODiff: Human-Aware One-Step Diffusion via Dual-Prompt Guidance
by: Gong, Jue, et al.
Published: (2025)
by: Gong, Jue, et al.
Published: (2025)
Leverage Task Context for Object Affordance Ranking
by: Huang, Haojie, et al.
Published: (2024)
by: Huang, Haojie, et al.
Published: (2024)
DAViD: Modeling Dynamic Affordance of 3D Objects Using Pre-trained Video Diffusion Models
by: Kim, Hyeonwoo, et al.
Published: (2025)
by: Kim, Hyeonwoo, et al.
Published: (2025)
SARD: Segmentation-Aware Anomaly Synthesis via Region-Constrained Diffusion with Discriminative Mask Guidance
by: Wang, Yanshu, et al.
Published: (2025)
by: Wang, Yanshu, et al.
Published: (2025)
Unsupervised Structural Scene Decomposition via Foreground-Aware Slot Attention with Pseudo-Mask Guidance
by: Sheng, Huankun, et al.
Published: (2025)
by: Sheng, Huankun, et al.
Published: (2025)
Similar Items
-
$R^2$-Tuning: Efficient Image-to-Video Transfer Learning for Video Temporal Grounding
by: Liu, Ye, et al.
Published: (2024) -
Joint-Task Regularization for Partially Labeled Multi-Task Learning
by: Nishi, Kento, et al.
Published: (2024) -
MoRA: LoRA Guided Multi-Modal Disease Diagnosis with Missing Modality
by: Shi, Zhiyi, et al.
Published: (2024) -
SocialGPT: Prompting LLMs for Social Relation Reasoning via Greedy Segment Optimization
by: Li, Wanhua, et al.
Published: (2024) -
CTRL-GS: Cascaded Temporal Residue Learning for 4D Gaussian Splatting
by: Hou, Karly, et al.
Published: (2025)