LTOS: Layout-controllable Text-Object Synthesis via Adaptive Cross-attention Fusions
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhao, Xiaoran, Wu, Tianhao, Lai, Yu, Tian, Zhiliang, Huang, Zhen, Liu, Yahui, He, Zejiang, Li, Dongsheng |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Not Just What's There: Enabling CLIP to Comprehend Negated Visual Descriptions Without Fine-tuning
par: Xiao, Junhao, et autres
Publié: (2026)
par: Xiao, Junhao, et autres
Publié: (2026)
CTTA-T: Continual Test-Time Adaptation for Text Understanding via Teacher-Student with a Domain-aware and Generalized Teacher
par: Liu, Tianlun, et autres
Publié: (2025)
par: Liu, Tianlun, et autres
Publié: (2025)
Learn to Disguise: Avoid Refusal Responses in LLM's Defense via a Multi-agent Attacker-Disguiser Game
par: Xu, Qianqiao, et autres
Publié: (2024)
par: Xu, Qianqiao, et autres
Publié: (2024)
PLACE: Adaptive Layout-Semantic Fusion for Semantic Image Synthesis
par: Lv, Zhengyao, et autres
Publié: (2024)
par: Lv, Zhengyao, et autres
Publié: (2024)
Zero-resource Hallucination Detection for Text Generation via Graph-based Contextual Knowledge Triples Modeling
par: Fang, Xinyue, et autres
Publié: (2024)
par: Fang, Xinyue, et autres
Publié: (2024)
CraftSVG: Multi-Object Text-to-SVG Synthesis via Layout Guided Diffusion
par: Banerjee, Ayan, et autres
Publié: (2024)
par: Banerjee, Ayan, et autres
Publié: (2024)
LLM-based Privacy Data Augmentation Guided by Knowledge Distillation with a Distribution Tutor for Medical Text Classification
par: Song, Yiping, et autres
Publié: (2024)
par: Song, Yiping, et autres
Publié: (2024)
POMP: Probability-driven Meta-graph Prompter for LLMs in Low-resource Unsupervised Neural Machine Translation
par: Pan, Shilong, et autres
Publié: (2024)
par: Pan, Shilong, et autres
Publié: (2024)
Multitwine: Multi-Object Compositing with Text and Layout Control
par: Tarrés, Gemma Canet, et autres
Publié: (2025)
par: Tarrés, Gemma Canet, et autres
Publié: (2025)
Novel Object Synthesis via Adaptive Text-Image Harmony
par: Xiong, Zeren, et autres
Publié: (2024)
par: Xiong, Zeren, et autres
Publié: (2024)
Enhancing Object Coherence in Layout-to-Image Synthesis
par: Wang, Yibin, et autres
Publié: (2023)
par: Wang, Yibin, et autres
Publié: (2023)
TORCH: Characterizing Invalid Route Filtering via Tunnelled Observation
par: Tian, Renrui, et autres
Publié: (2026)
par: Tian, Renrui, et autres
Publié: (2026)
DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation
par: He, Weijie, et autres
Publié: (2025)
par: He, Weijie, et autres
Publié: (2025)
Multi-modal and Multi-view Fundus Image Fusion for Retinopathy Diagnosis via Multi-scale Cross-attention and Shifted Window Self-attention
par: Huang, Yonghao, et autres
Publié: (2025)
par: Huang, Yonghao, et autres
Publié: (2025)
Animating the Past: Reconstruct Trilobite via Video Generation
par: Wu, Xiaoran, et autres
Publié: (2024)
par: Wu, Xiaoran, et autres
Publié: (2024)
Perception of Knowledge Boundary for Large Language Models through Semi-open-ended Question Answering
par: Wen, Zhihua, et autres
Publié: (2024)
par: Wen, Zhihua, et autres
Publié: (2024)
Layout Agnostic Scene Text Image Synthesis with Diffusion Models
par: Zhangli, Qilong, et autres
Publié: (2024)
par: Zhangli, Qilong, et autres
Publié: (2024)
Small Object Detection by DETR via Information Augmentation and Adaptive Feature Fusion
par: Huang, Ji, et autres
Publié: (2024)
par: Huang, Ji, et autres
Publié: (2024)
DocLayout-YOLO: Enhancing Document Layout Analysis through Diverse Synthetic Data and Global-to-Local Adaptive Perception
par: Zhao, Zhiyuan, et autres
Publié: (2024)
par: Zhao, Zhiyuan, et autres
Publié: (2024)
Manga Generation via Layout-controllable Diffusion
par: Chen, Siyu, et autres
Publié: (2024)
par: Chen, Siyu, et autres
Publié: (2024)
TTMBA: Towards Text To Multiple Sources Binaural Audio Generation
par: He, Yuxuan, et autres
Publié: (2025)
par: He, Yuxuan, et autres
Publié: (2025)
Adaptive prescribed‐time control for nonlinear systems with uncertain time‐varying parameters and control gains
par: Yulong Ji, et autres
Publié: (2024)
par: Yulong Ji, et autres
Publié: (2024)
Tailoring Advanced CdS Anisotropy‐Driven Charge Spatial Vectorial Separation and Migration via In Situ Dual Co‐Catalyst Synergistic Layout
par: Teng Li, et autres
Publié: (2024)
par: Teng Li, et autres
Publié: (2024)
Wind Farm Layout Optimization Based on Dynamic Opposite Learning‐Enhanced Sparrow Search Algorithm
par: Yun Zhu, et autres
Publié: (2024)
par: Yun Zhu, et autres
Publié: (2024)
FusionCell: Cross-Attentive Fusion of Layout Geometry and Netlist Topology for Standard-Cell Performance Prediction
par: Zhang, Haoyi, et autres
Publié: (2026)
par: Zhang, Haoyi, et autres
Publié: (2026)
CMFN: Cross-Modal Fusion Network for Irregular Scene Text Recognition
par: Zheng, Jinzhi, et autres
Publié: (2024)
par: Zheng, Jinzhi, et autres
Publié: (2024)
Text, Layout, and Medium
Publié: (2025)
Publié: (2025)
GP2F: Cross-Domain Graph Prompting with Adaptive Fusion of Pre-trained Graph Neural Networks
par: He, Dongxiao, et autres
Publié: (2026)
par: He, Dongxiao, et autres
Publié: (2026)
CasLayout: Cascaded 3D Layout Diffusion for Indoor Scene Synthesis with Implicit Relation Modeling
par: Wu, Yingrui, et autres
Publié: (2026)
par: Wu, Yingrui, et autres
Publié: (2026)
MV-SAM3D: Adaptive Multi-View Fusion for Layout-Aware 3D Generation
par: Li, Baicheng, et autres
Publié: (2026)
par: Li, Baicheng, et autres
Publié: (2026)
Advancements in Natural Language Processing: Exploring Transformer-Based Architectures for Text Understanding
par: Wu, Tianhao, et autres
Publié: (2025)
par: Wu, Tianhao, et autres
Publié: (2025)
TextDiffuser-RL: Efficient and Robust Text Layout Optimization for High-Fidelity Text-to-Image Synthesis
par: Rahman, Kazi Mahathir, et autres
Publié: (2025)
par: Rahman, Kazi Mahathir, et autres
Publié: (2025)
Zero-Painter: Training-Free Layout Control for Text-to-Image Synthesis
par: Ohanyan, Marianna, et autres
Publié: (2024)
par: Ohanyan, Marianna, et autres
Publié: (2024)
Multi-Modal Brain Tumor Segmentation via 3D Multi-Scale Self-attention and Cross-attention
par: Huang, Yonghao, et autres
Publié: (2025)
par: Huang, Yonghao, et autres
Publié: (2025)
Modality-Decoupled RGB-Thermal Object Detector via Query Fusion
par: Tian, Chao, et autres
Publié: (2026)
par: Tian, Chao, et autres
Publié: (2026)
Universal Domain Adaptive Object Detection via Dual Probabilistic Alignment
par: Zheng, Yuanfan, et autres
Publié: (2024)
par: Zheng, Yuanfan, et autres
Publié: (2024)
AutoLayout: Closed-Loop Layout Synthesis via Slow-Fast Collaborative Reasoning
par: Chen, Weixing, et autres
Publié: (2025)
par: Chen, Weixing, et autres
Publié: (2025)
Reusing Fusion-Time Spectral Reliability for Adaptive Fusion and Expert Routing in RGB-Infrared Object Detection
par: Wu, Yefeng
Publié: (2026)
par: Wu, Yefeng
Publié: (2026)
DOPE: Dual Object Perception-Enhancement Network for Vision-and-Language Navigation
par: Yu, Yinfeng, et autres
Publié: (2025)
par: Yu, Yinfeng, et autres
Publié: (2025)
DiffX: Guide Your Layout to Cross-Modal Generative Modeling
par: Wang, Zeyu, et autres
Publié: (2024)
par: Wang, Zeyu, et autres
Publié: (2024)
Documents similaires
-
Not Just What's There: Enabling CLIP to Comprehend Negated Visual Descriptions Without Fine-tuning
par: Xiao, Junhao, et autres
Publié: (2026) -
CTTA-T: Continual Test-Time Adaptation for Text Understanding via Teacher-Student with a Domain-aware and Generalized Teacher
par: Liu, Tianlun, et autres
Publié: (2025) -
Learn to Disguise: Avoid Refusal Responses in LLM's Defense via a Multi-agent Attacker-Disguiser Game
par: Xu, Qianqiao, et autres
Publié: (2024) -
PLACE: Adaptive Layout-Semantic Fusion for Semantic Image Synthesis
par: Lv, Zhengyao, et autres
Publié: (2024) -
Zero-resource Hallucination Detection for Text Generation via Graph-based Contextual Knowledge Triples Modeling
par: Fang, Xinyue, et autres
Publié: (2024)