Graph Transformer GANs with Graph Masked Modeling for Architectural Layout Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Tang, Hao, Shao, Ling, Sebe, Nicu, Van Gool, Luc |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Spatial-Temporal Graph Mamba for Music-Guided Dance Video Synthesis
por: Tang, Hao, et al.
Publicado: (2025)
por: Tang, Hao, et al.
Publicado: (2025)
Enhanced Multi-Scale Cross-Attention for Person Image Generation
por: Tang, Hao, et al.
Publicado: (2025)
por: Tang, Hao, et al.
Publicado: (2025)
Asymmetric GANs for Image-to-Image Translation
por: Tang, Hao, et al.
Publicado: (2019)
por: Tang, Hao, et al.
Publicado: (2019)
Key-Graph Transformer for Image Restoration
por: Ren, Bin, et al.
Publicado: (2024)
por: Ren, Bin, et al.
Publicado: (2024)
Bringing Masked Autoencoders Explicit Contrastive Properties for Point Cloud Self-Supervised Learning
por: Ren, Bin, et al.
Publicado: (2024)
por: Ren, Bin, et al.
Publicado: (2024)
GraphMLP: A Graph MLP-Like Architecture for 3D Human Pose Estimation
por: Li, Wenhao, et al.
Publicado: (2022)
por: Li, Wenhao, et al.
Publicado: (2022)
Sharing Key Semantics in Transformer Makes Efficient Image Restoration
por: Ren, Bin, et al.
Publicado: (2024)
por: Ren, Bin, et al.
Publicado: (2024)
Towards Online Real-Time Memory-based Video Inpainting Transformers
por: Thiry, Guillaume, et al.
Publicado: (2024)
por: Thiry, Guillaume, et al.
Publicado: (2024)
CityLoc: 6DoF Pose Distributional Localization for Text Descriptions in Large-Scale Scenes with Gaussian Representation
por: Ma, Qi, et al.
Publicado: (2025)
por: Ma, Qi, et al.
Publicado: (2025)
Hierarchical Cross-Attention Network for Virtual Try-On
por: Tang, Hao, et al.
Publicado: (2024)
por: Tang, Hao, et al.
Publicado: (2024)
Retrieval Augmented Generation and Understanding in Vision: A Survey and New Outlook
por: Zheng, Xu, et al.
Publicado: (2025)
por: Zheng, Xu, et al.
Publicado: (2025)
ShapeSplat: A Large-scale Dataset of Gaussian Splats and Their Self-Supervised Pretraining
por: Ma, Qi, et al.
Publicado: (2024)
por: Ma, Qi, et al.
Publicado: (2024)
EarthMind: Leveraging Cross-Sensor Data for Advanced Earth Observation Interpretation with a Unified Multimodal LLM
por: Shu, Yan, et al.
Publicado: (2025)
por: Shu, Yan, et al.
Publicado: (2025)
MatIR: A Hybrid Mamba-Transformer Image Restoration Model
por: Wen, Juan, et al.
Publicado: (2025)
por: Wen, Juan, et al.
Publicado: (2025)
Efficient Degradation-agnostic Image Restoration via Channel-Wise Functional Decomposition and Manifold Regularization
por: Ren, Bin, et al.
Publicado: (2025)
por: Ren, Bin, et al.
Publicado: (2025)
Training and Tuning Generative Neural Radiance Fields for Attribute-Conditional 3D-Aware Face Generation
por: Zhang, Jichao, et al.
Publicado: (2022)
por: Zhang, Jichao, et al.
Publicado: (2022)
HandDiff: 3D Hand Pose Estimation with Diffusion on Image-Point Cloud
por: Cheng, Wencan, et al.
Publicado: (2024)
por: Cheng, Wencan, et al.
Publicado: (2024)
CLIP is Strong Enough to Fight Back: Test-time Counterattacks towards Zero-shot Adversarial Robustness of CLIP
por: Xing, Songlong, et al.
Publicado: (2025)
por: Xing, Songlong, et al.
Publicado: (2025)
POCI-Diff: Position Objects Consistently and Interactively with 3D-Layout Guided Diffusion
por: Rigo, Andrea, et al.
Publicado: (2026)
por: Rigo, Andrea, et al.
Publicado: (2026)
TrafficBots V1.5: Traffic Simulation via Conditional VAEs and Transformers with Relative Pose Encoding
por: Zhang, Zhejun, et al.
Publicado: (2024)
por: Zhang, Zhejun, et al.
Publicado: (2024)
A Unified Masked Jigsaw Puzzle Framework for Vision and Language Models
por: Ye, Weixin, et al.
Publicado: (2026)
por: Ye, Weixin, et al.
Publicado: (2026)
Walker: Self-supervised Multiple Object Tracking by Walking on Temporal Appearance Graphs
por: Segu, Mattia, et al.
Publicado: (2024)
por: Segu, Mattia, et al.
Publicado: (2024)
Masked Image Modeling: A Survey
por: Hondru, Vlad, et al.
Publicado: (2024)
por: Hondru, Vlad, et al.
Publicado: (2024)
Masked Clustering Prediction for Unsupervised Point Cloud Pre-training
por: Ren, Bin, et al.
Publicado: (2025)
por: Ren, Bin, et al.
Publicado: (2025)
Any Image Restoration via Efficient Spatial-Frequency Degradation Adaptation
por: Ren, Bin, et al.
Publicado: (2025)
por: Ren, Bin, et al.
Publicado: (2025)
Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models
por: Li, Jinlong, et al.
Publicado: (2026)
por: Li, Jinlong, et al.
Publicado: (2026)
DSGC-Net: A Dual-Stream Graph Convolutional Network for Crowd Counting via Feature Correlation Mining
por: Wu, Yihong, et al.
Publicado: (2025)
por: Wu, Yihong, et al.
Publicado: (2025)
Reverse Personalization
por: Kung, Han-Wei, et al.
Publicado: (2025)
por: Kung, Han-Wei, et al.
Publicado: (2025)
RAGME: Retrieval Augmented Video Generation for Enhanced Motion Realism
por: Peruzzo, Elia, et al.
Publicado: (2025)
por: Peruzzo, Elia, et al.
Publicado: (2025)
Chorus: Multi-Teacher Pretraining for Holistic 3D Gaussian Scene Encoding
por: Li, Yue, et al.
Publicado: (2025)
por: Li, Yue, et al.
Publicado: (2025)
CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation
por: Zhang, Hui, et al.
Publicado: (2024)
por: Zhang, Hui, et al.
Publicado: (2024)
Generalized Fine-Grained Category Discovery with Multi-Granularity Conceptual Experts
por: Zheng, Haiyang, et al.
Publicado: (2025)
por: Zheng, Haiyang, et al.
Publicado: (2025)
Anti-Forgetting Adaptation for Unsupervised Person Re-identification
por: Chen, Hao, et al.
Publicado: (2024)
por: Chen, Hao, et al.
Publicado: (2024)
Test-time Training for Hyperspectral Image Super-resolution
por: Li, Ke, et al.
Publicado: (2024)
por: Li, Ke, et al.
Publicado: (2024)
Optimizing against Infeasible Inclusions from Data for Semantic Segmentation through Morphology
por: Basu, Shamik, et al.
Publicado: (2024)
por: Basu, Shamik, et al.
Publicado: (2024)
Bayesian Self-Training for Semi-Supervised 3D Segmentation
por: Unal, Ozan, et al.
Publicado: (2024)
por: Unal, Ozan, et al.
Publicado: (2024)
Textual Knowledge Matters: Cross-Modality Co-Teaching for Generalized Visual Class Discovery
por: Zheng, Haiyang, et al.
Publicado: (2024)
por: Zheng, Haiyang, et al.
Publicado: (2024)
Hallucination Early Detection in Diffusion Models
por: Betti, Federico, et al.
Publicado: (2026)
por: Betti, Federico, et al.
Publicado: (2026)
RankFeat&RankWeight: Rank-1 Feature/Weight Removal for Out-of-distribution Detection
por: Song, Yue, et al.
Publicado: (2023)
por: Song, Yue, et al.
Publicado: (2023)
Investigating the Effectiveness of Cross-Attention to Unlock Zero-Shot Editing of Text-to-Video Diffusion Models
por: Motamed, Saman, et al.
Publicado: (2024)
por: Motamed, Saman, et al.
Publicado: (2024)
Ejemplares similares
-
Spatial-Temporal Graph Mamba for Music-Guided Dance Video Synthesis
por: Tang, Hao, et al.
Publicado: (2025) -
Enhanced Multi-Scale Cross-Attention for Person Image Generation
por: Tang, Hao, et al.
Publicado: (2025) -
Asymmetric GANs for Image-to-Image Translation
por: Tang, Hao, et al.
Publicado: (2019) -
Key-Graph Transformer for Image Restoration
por: Ren, Bin, et al.
Publicado: (2024) -
Bringing Masked Autoencoders Explicit Contrastive Properties for Point Cloud Self-Supervised Learning
por: Ren, Bin, et al.
Publicado: (2024)