CogView3: Finer and Faster Text-to-Image Generation via Relay Diffusion
Fuente:
arXiv
Salvato in:
| Autori principali: | Zheng, Wendi, Teng, Jiayan, Yang, Zhuoyi, Wang, Weihan, Chen, Jidong, Gu, Xiaotao, Dong, Yuxiao, Ding, Ming, Tang, Jie |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer
di: Yang, Zhuoyi, et al.
Pubblicazione: (2024)
di: Yang, Zhuoyi, et al.
Pubblicazione: (2024)
Inf-DiT: Upsampling Any-Resolution Image with Memory-Efficient Diffusion Transformer
di: Yang, Zhuoyi, et al.
Pubblicazione: (2024)
di: Yang, Zhuoyi, et al.
Pubblicazione: (2024)
Delving into Latent Spectral Biasing of Video VAEs for Superior Diffusability
di: Liu, Shizhan, et al.
Pubblicazione: (2025)
di: Liu, Shizhan, et al.
Pubblicazione: (2025)
VPO: Aligning Text-to-Video Generation Models with Prompt Optimization
di: Cheng, Jiale, et al.
Pubblicazione: (2025)
di: Cheng, Jiale, et al.
Pubblicazione: (2025)
Concat-ID: Towards Universal Identity-Preserving Video Synthesis
di: Zhong, Yong, et al.
Pubblicazione: (2025)
di: Zhong, Yong, et al.
Pubblicazione: (2025)
MotionBench: Benchmarking and Improving Fine-grained Video Motion Understanding for Vision Language Models
di: Hong, Wenyi, et al.
Pubblicazione: (2025)
di: Hong, Wenyi, et al.
Pubblicazione: (2025)
CogVLM2: Visual Language Models for Image and Video Understanding
di: Hong, Wenyi, et al.
Pubblicazione: (2024)
di: Hong, Wenyi, et al.
Pubblicazione: (2024)
CogVLM: Visual Expert for Pretrained Language Models
di: Wang, Weihan, et al.
Pubblicazione: (2023)
di: Wang, Weihan, et al.
Pubblicazione: (2023)
Kaleido: Open-Sourced Multi-Subject Reference Video Generation Model
di: Zhang, Zhenxing, et al.
Pubblicazione: (2025)
di: Zhang, Zhenxing, et al.
Pubblicazione: (2025)
CogCoM: A Visual Language Model with Chain-of-Manipulations Reasoning
di: Qi, Ji, et al.
Pubblicazione: (2024)
di: Qi, Ji, et al.
Pubblicazione: (2024)
VisionReward: Fine-Grained Multi-Dimensional Human Preference Learning for Image and Video Generation
di: Xu, Jiazheng, et al.
Pubblicazione: (2024)
di: Xu, Jiazheng, et al.
Pubblicazione: (2024)
CogAgent: A Visual Language Model for GUI Agents
di: Hong, Wenyi, et al.
Pubblicazione: (2023)
di: Hong, Wenyi, et al.
Pubblicazione: (2023)
SCAIL: Towards Studio-Grade Character Animation via In-Context Learning of 3D-Consistent Pose Representations
di: Yan, Wenhao, et al.
Pubblicazione: (2025)
di: Yan, Wenhao, et al.
Pubblicazione: (2025)
DreamPolish: Domain Score Distillation With Progressive Geometry Generation
di: Cheng, Yean, et al.
Pubblicazione: (2024)
di: Cheng, Yean, et al.
Pubblicazione: (2024)
LVBench: An Extreme Long Video Understanding Benchmark
di: Wang, Weihan, et al.
Pubblicazione: (2024)
di: Wang, Weihan, et al.
Pubblicazione: (2024)
MP-PolarMask: A Faster and Finer Instance Segmentation for Concave Images
di: Wang, Ke-Lei, et al.
Pubblicazione: (2024)
di: Wang, Ke-Lei, et al.
Pubblicazione: (2024)
F3-Pruning: A Training-Free and Generalized Pruning Strategy towards Faster and Finer Text-to-Video Synthesis
di: Su, Sitong, et al.
Pubblicazione: (2023)
di: Su, Sitong, et al.
Pubblicazione: (2023)
UI2Code^N: UI-to-Code Generation as Interactive Visual Optimization
di: Yang, Zhen, et al.
Pubblicazione: (2025)
di: Yang, Zhen, et al.
Pubblicazione: (2025)
CogBlender: Towards Continuous Cognitive Intervention in Text-to-Image Generation
di: Dang, Shengqi, et al.
Pubblicazione: (2026)
di: Dang, Shengqi, et al.
Pubblicazione: (2026)
Marrying Text-to-Motion Generation with Skeleton-Based Action Recognition
di: Kuang, Jidong, et al.
Pubblicazione: (2026)
di: Kuang, Jidong, et al.
Pubblicazione: (2026)
Finer-CAM: Spotting the Difference Reveals Finer Details for Visual Explanation
di: Zhang, Ziheng, et al.
Pubblicazione: (2025)
di: Zhang, Ziheng, et al.
Pubblicazione: (2025)
NaturalCodeBench: Examining Coding Performance Mismatch on HumanEval and Natural User Prompts
di: Zhang, Shudan, et al.
Pubblicazione: (2024)
di: Zhang, Shudan, et al.
Pubblicazione: (2024)
Presynthesis: Towards Scaling Up Program Synthesis with Finer-Grained Abstract Semantics
di: Dong, Rui, et al.
Pubblicazione: (2026)
di: Dong, Rui, et al.
Pubblicazione: (2026)
TwinDiffusion: Enhancing Coherence and Efficiency in Panoramic Image Generation with Diffusion Models
di: Zhou, Teng, et al.
Pubblicazione: (2024)
di: Zhou, Teng, et al.
Pubblicazione: (2024)
CogMorph: Cognitive Morphing Attacks for Text-to-Image Models
di: Jing, Zonglei, et al.
Pubblicazione: (2025)
di: Jing, Zonglei, et al.
Pubblicazione: (2025)
A Finer View of the Parameterized Landscape of Labeled Graph Contractions
di: Mathur, Yashaswini, et al.
Pubblicazione: (2025)
di: Mathur, Yashaswini, et al.
Pubblicazione: (2025)
DesignDiffusion: High-Quality Text-to-Design Image Generation with Diffusion Models
di: Wang, Zhendong, et al.
Pubblicazione: (2025)
di: Wang, Zhendong, et al.
Pubblicazione: (2025)
AutoDetect: Towards a Unified Framework for Automated Weakness Detection in Large Language Models
di: Cheng, Jiale, et al.
Pubblicazione: (2024)
di: Cheng, Jiale, et al.
Pubblicazione: (2024)
LogicGame: Benchmarking Rule-Based Reasoning Abilities of Large Language Models
di: Gui, Jiayi, et al.
Pubblicazione: (2024)
di: Gui, Jiayi, et al.
Pubblicazione: (2024)
Glyph: Scaling Context Windows via Visual-Text Compression
di: Cheng, Jiale, et al.
Pubblicazione: (2025)
di: Cheng, Jiale, et al.
Pubblicazione: (2025)
The Finer the Better: Towards Granular-aware Open-set Domain Generalization
di: Wang, Yunyun, et al.
Pubblicazione: (2025)
di: Wang, Yunyun, et al.
Pubblicazione: (2025)
CogGen: Cognitive-Load-Informed Fully Unsupervised Deep Generative Modeling for Compressively Sampled MRI Reconstruction
di: Zhu, Qingyong, et al.
Pubblicazione: (2026)
di: Zhu, Qingyong, et al.
Pubblicazione: (2026)
FinerCut: Finer-grained Interpretable Layer Pruning for Large Language Models
di: Zhang, Yang, et al.
Pubblicazione: (2024)
di: Zhang, Yang, et al.
Pubblicazione: (2024)
LongSafety: Evaluating Long-Context Safety of Large Language Models
di: Lu, Yida, et al.
Pubblicazione: (2025)
di: Lu, Yida, et al.
Pubblicazione: (2025)
SPaR: Self-Play with Tree-Search Refinement to Improve Instruction-Following in Large Language Models
di: Cheng, Jiale, et al.
Pubblicazione: (2024)
di: Cheng, Jiale, et al.
Pubblicazione: (2024)
Finer-Personalization Rank: Fine-Grained Retrieval Examines Identity Preservation for Personalized Generation
di: Kilrain, Connor, et al.
Pubblicazione: (2025)
di: Kilrain, Connor, et al.
Pubblicazione: (2025)
Quantum symmetric pairs via Hall algebras
di: Lu, Ming, et al.
Pubblicazione: (2025)
di: Lu, Ming, et al.
Pubblicazione: (2025)
Auto-Regressively Generating Multi-View Consistent Images
di: Hu, JiaKui, et al.
Pubblicazione: (2025)
di: Hu, JiaKui, et al.
Pubblicazione: (2025)
Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models
di: Cheng, Hao, et al.
Pubblicazione: (2024)
di: Cheng, Hao, et al.
Pubblicazione: (2024)
Hawk: Leveraging Spatial Context for Faster Autoregressive Text-to-Image Generation
di: Chen, Zhi-Kai, et al.
Pubblicazione: (2025)
di: Chen, Zhi-Kai, et al.
Pubblicazione: (2025)
Documenti analoghi
-
CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer
di: Yang, Zhuoyi, et al.
Pubblicazione: (2024) -
Inf-DiT: Upsampling Any-Resolution Image with Memory-Efficient Diffusion Transformer
di: Yang, Zhuoyi, et al.
Pubblicazione: (2024) -
Delving into Latent Spectral Biasing of Video VAEs for Superior Diffusability
di: Liu, Shizhan, et al.
Pubblicazione: (2025) -
VPO: Aligning Text-to-Video Generation Models with Prompt Optimization
di: Cheng, Jiale, et al.
Pubblicazione: (2025) -
Concat-ID: Towards Universal Identity-Preserving Video Synthesis
di: Zhong, Yong, et al.
Pubblicazione: (2025)