MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Mingcheng, Hou, Xiaolu, Liu, Ziyang, Yang, Dingkang, Qian, Ziyun, Chen, Jiawei, Wei, Jinjie, Jiang, Yue, Xu, Qingyao, Zhang, Lihua |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
BloomScene: Lightweight Structured 3D Gaussian Splatting for Crossmodal Scene Generation
by: Hou, Xiaolu, et al.
Published: (2025)
by: Hou, Xiaolu, et al.
Published: (2025)
Efficiency in Focus: LayerNorm as a Catalyst for Fine-tuning Medical Visual Language Pre-trained Models
by: Chen, Jiawei, et al.
Published: (2024)
by: Chen, Jiawei, et al.
Published: (2024)
Can LLMs' Tuning Methods Work in Medical Multimodal Domain?
by: Chen, Jiawei, et al.
Published: (2024)
by: Chen, Jiawei, et al.
Published: (2024)
Toward Robust Incomplete Multimodal Sentiment Analysis via Hierarchical Representation Learning
by: Li, Mingcheng, et al.
Published: (2024)
by: Li, Mingcheng, et al.
Published: (2024)
SatireDecoder: Visual Cascaded Decoupling for Enhancing Satirical Image Comprehension
by: Jiang, Yue, et al.
Published: (2025)
by: Jiang, Yue, et al.
Published: (2025)
Faster Diffusion Action Segmentation
by: Wang, Shuaibing, et al.
Published: (2024)
by: Wang, Shuaibing, et al.
Published: (2024)
HandGCAT: Occlusion-Robust 3D Hand Mesh Reconstruction from Monocular Images
by: Wang, Shuaibing, et al.
Published: (2024)
by: Wang, Shuaibing, et al.
Published: (2024)
MedAide: Information Fusion and Anatomy of Medical Intents via LLM-based Agent Collaboration
by: Yang, Dingkang, et al.
Published: (2024)
by: Yang, Dingkang, et al.
Published: (2024)
SMCD: High Realism Motion Style Transfer via Mamba-based Diffusion
by: Qian, Ziyun, et al.
Published: (2024)
by: Qian, Ziyun, et al.
Published: (2024)
Detecting and Evaluating Medical Hallucinations in Large Vision Language Models
by: Chen, Jiawei, et al.
Published: (2024)
by: Chen, Jiawei, et al.
Published: (2024)
Debiased Multimodal Understanding for Human Language Sequences
by: Xu, Zhi, et al.
Published: (2024)
by: Xu, Zhi, et al.
Published: (2024)
Improving Factuality in Large Language Models via Decoding-Time Hallucinatory and Truthful Comparators
by: Yang, Dingkang, et al.
Published: (2024)
by: Yang, Dingkang, et al.
Published: (2024)
CoMT: Chain-of-Medical-Thought Reduces Hallucination in Medical Report Generation
by: Jiang, Yue, et al.
Published: (2024)
by: Jiang, Yue, et al.
Published: (2024)
PediatricsGPT: Large Language Models as Chinese Medical Assistants for Pediatric Applications
by: Yang, Dingkang, et al.
Published: (2024)
by: Yang, Dingkang, et al.
Published: (2024)
MISS: A Generative Pretraining and Finetuning Approach for Med-VQA
by: Chen, Jiawei, et al.
Published: (2024)
by: Chen, Jiawei, et al.
Published: (2024)
PersonaAnimator: Personalized Motion Transfer from Unconstrained Videos
by: Qian, Ziyun, et al.
Published: (2025)
by: Qian, Ziyun, et al.
Published: (2025)
Skip and Skip: Segmenting Medical Images with Prompts
by: Chen, Jiawei, et al.
Published: (2024)
by: Chen, Jiawei, et al.
Published: (2024)
ProFocus: Proactive Perception and Focused Reasoning in Vision-and-Language Navigation
by: Xue, Wei, et al.
Published: (2026)
by: Xue, Wei, et al.
Published: (2026)
Correlation-Decoupled Knowledge Distillation for Multimodal Sentiment Analysis with Incomplete Modalities
by: Li, Mingcheng, et al.
Published: (2024)
by: Li, Mingcheng, et al.
Published: (2024)
FysicsWorld: A Unified Full-Modality Benchmark for Any-to-Any Understanding, Generation, and Reasoning
by: Jiang, Yue, et al.
Published: (2025)
by: Jiang, Yue, et al.
Published: (2025)
Robust Emotion Recognition in Context Debiasing
by: Yang, Dingkang, et al.
Published: (2024)
by: Yang, Dingkang, et al.
Published: (2024)
Resolving Evidence Sparsity: Agentic Context Engineering for Long-Document Understanding
by: Liu, Keliang, et al.
Published: (2025)
by: Liu, Keliang, et al.
Published: (2025)
HybridOcc: NeRF Enhanced Transformer-based Multi-Camera 3D Occupancy Prediction
by: Zhao, Xiao, et al.
Published: (2024)
by: Zhao, Xiao, et al.
Published: (2024)
GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration
by: Huang, Kaiyi, et al.
Published: (2024)
by: Huang, Kaiyi, et al.
Published: (2024)
More Than Generation: Unifying Generation and Depth Estimation via Text-to-Image Diffusion Models
by: Lin, Hongkai, et al.
Published: (2025)
by: Lin, Hongkai, et al.
Published: (2025)
Learning, Reasoning, Refinement: A Framework for Kahneman's Dual-System Intelligence in GUI Agents
by: Wei, Jinjie, et al.
Published: (2025)
by: Wei, Jinjie, et al.
Published: (2025)
Diffusion-based Blind Text Image Super-Resolution
by: Zhang, Yuzhe, et al.
Published: (2023)
by: Zhang, Yuzhe, et al.
Published: (2023)
Improving Multimodal Sentiment Analysis via Modality Optimization and Dynamic Primary Modality Selection
by: Yang, Dingkang, et al.
Published: (2025)
by: Yang, Dingkang, et al.
Published: (2025)
Bayesian WeakS-to-Strong from Text Classification to Generation
by: Cui, Ziyun, et al.
Published: (2024)
by: Cui, Ziyun, et al.
Published: (2024)
MCCD: A Multi-Attribute Chinese Calligraphy Character Dataset Annotated with Script Styles, Dynasties, and Calligraphers
by: Zhao, Yixin, et al.
Published: (2025)
by: Zhao, Yixin, et al.
Published: (2025)
PersonaVlog: Personalized Multimodal Vlog Generation with Multi-Agent Collaboration and Iterative Self-Correction
by: Hou, Xiaolu, et al.
Published: (2025)
by: Hou, Xiaolu, et al.
Published: (2025)
Asynchronous Multimodal Video Sequence Fusion via Learning Modality-Exclusive and -Agnostic Representations
by: Yang, Dingkang, et al.
Published: (2024)
by: Yang, Dingkang, et al.
Published: (2024)
MaskBEV: Towards A Unified Framework for BEV Detection and Map Segmentation
by: Zhao, Xiao, et al.
Published: (2024)
by: Zhao, Xiao, et al.
Published: (2024)
OmniFysics: Towards Physical Intelligence Evolution via Omni-Modal Signal Processing and Network Optimization
by: Han, Minghao, et al.
Published: (2026)
by: Han, Minghao, et al.
Published: (2026)
On-Orbit Space AI: Federated, Multi-Agent, and Collaborative Algorithms for Satellite Constellations
by: Wang, Ziyang
Published: (2026)
by: Wang, Ziyang
Published: (2026)
AgentCTG: Harnessing Multi-Agent Collaboration for Fine-Grained Precise Control in Text Generation
by: Zhou, Xinxu, et al.
Published: (2025)
by: Zhou, Xinxu, et al.
Published: (2025)
CAMF: Collaborative Adversarial Multi-agent Framework for Machine Generated Text Detection
by: Wang, Yue, et al.
Published: (2025)
by: Wang, Yue, et al.
Published: (2025)
EmoGen: Emotional Image Content Generation with Text-to-Image Diffusion Models
by: Yang, Jingyuan, et al.
Published: (2024)
by: Yang, Jingyuan, et al.
Published: (2024)
Collaborative Text-to-Image Generation via Multi-Agent Reinforcement Learning and Semantic Fusion
by: Shi, Jiabao, et al.
Published: (2025)
by: Shi, Jiabao, et al.
Published: (2025)
High-Dimensional Multi-Study Robust Factor Model for Analyzing RNA Sequencing Data from Heterogeneous Sources
by: Jiang, Xiaolu, et al.
Published: (2025)
by: Jiang, Xiaolu, et al.
Published: (2025)
Similar Items
-
BloomScene: Lightweight Structured 3D Gaussian Splatting for Crossmodal Scene Generation
by: Hou, Xiaolu, et al.
Published: (2025) -
Efficiency in Focus: LayerNorm as a Catalyst for Fine-tuning Medical Visual Language Pre-trained Models
by: Chen, Jiawei, et al.
Published: (2024) -
Can LLMs' Tuning Methods Work in Medical Multimodal Domain?
by: Chen, Jiawei, et al.
Published: (2024) -
Toward Robust Incomplete Multimodal Sentiment Analysis via Hierarchical Representation Learning
by: Li, Mingcheng, et al.
Published: (2024) -
SatireDecoder: Visual Cascaded Decoupling for Enhancing Satirical Image Comprehension
by: Jiang, Yue, et al.
Published: (2025)