STARFlow2: Bridging Language Models and Normalizing Flows for Unified Multimodal Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Shen, Ying, Chen, Tianrong, Gao, Yuan, Zhang, Yizhe, Wang, Yuyang, Bautista, Miguel Ángel, Zhai, Shuangfei, Susskind, Joshua M., Gu, Jiatao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
STARFlow-V: End-to-End Video Generative Modeling with Normalizing Flows
di: Gu, Jiatao, et al.
Pubblicazione: (2025)
di: Gu, Jiatao, et al.
Pubblicazione: (2025)
STARFlow: Scaling Latent Normalizing Flows for High-resolution Image Synthesis
di: Gu, Jiatao, et al.
Pubblicazione: (2025)
di: Gu, Jiatao, et al.
Pubblicazione: (2025)
Normalizing Flows with Iterative Denoising
di: Chen, Tianrong, et al.
Pubblicazione: (2026)
di: Chen, Tianrong, et al.
Pubblicazione: (2026)
Normalizing Trajectory Models
di: Gu, Jiatao, et al.
Pubblicazione: (2026)
di: Gu, Jiatao, et al.
Pubblicazione: (2026)
Normalizing Flows are Capable Generative Models
di: Zhai, Shuangfei, et al.
Pubblicazione: (2024)
di: Zhai, Shuangfei, et al.
Pubblicazione: (2024)
Many-to-many Image Generation with Auto-regressive Diffusion Models
di: Shen, Ying, et al.
Pubblicazione: (2024)
di: Shen, Ying, et al.
Pubblicazione: (2024)
Kaleido Diffusion: Improving Conditional Diffusion Models with Autoregressive Latent Modeling
di: Gu, Jiatao, et al.
Pubblicazione: (2024)
di: Gu, Jiatao, et al.
Pubblicazione: (2024)
The Coupling Within: Flow Matching via Distilled Normalizing Flows
di: Berthelot, David, et al.
Pubblicazione: (2026)
di: Berthelot, David, et al.
Pubblicazione: (2026)
Generative Modeling with Phase Stochastic Bridges
di: Chen, Tianrong, et al.
Pubblicazione: (2023)
di: Chen, Tianrong, et al.
Pubblicazione: (2023)
Matryoshka Diffusion Models
di: Gu, Jiatao, et al.
Pubblicazione: (2023)
di: Gu, Jiatao, et al.
Pubblicazione: (2023)
Flexible Language Modeling in Continuous Space with Transformer-based Autoregressive Flows
di: Zhang, Ruixiang, et al.
Pubblicazione: (2025)
di: Zhang, Ruixiang, et al.
Pubblicazione: (2025)
World-consistent Video Diffusion with Explicit 3D Modeling
di: Zhang, Qihang, et al.
Pubblicazione: (2024)
di: Zhang, Qihang, et al.
Pubblicazione: (2024)
DART: Denoising Autoregressive Transformer for Scalable Text-to-Image Generation
di: Gu, Jiatao, et al.
Pubblicazione: (2024)
di: Gu, Jiatao, et al.
Pubblicazione: (2024)
TypeScore: A Text Fidelity Metric for Text-to-Image Generative Models
di: Sampaio, Georgia Gabriela, et al.
Pubblicazione: (2024)
di: Sampaio, Georgia Gabriela, et al.
Pubblicazione: (2024)
PLANNER: Generating Diversified Paragraph via Latent Language Diffusion Model
di: Zhang, Yizhe, et al.
Pubblicazione: (2023)
di: Zhang, Yizhe, et al.
Pubblicazione: (2023)
How Far Are We from Intelligent Visual Deductive Reasoning?
di: Zhang, Yizhe, et al.
Pubblicazione: (2024)
di: Zhang, Yizhe, et al.
Pubblicazione: (2024)
Improving GFlowNets for Text-to-Image Diffusion Alignment
di: Zhang, Dinghuai, et al.
Pubblicazione: (2024)
di: Zhang, Dinghuai, et al.
Pubblicazione: (2024)
TADA: Improved Diffusion Sampling with Training-free Augmented Dynamics
di: Chen, Tianrong, et al.
Pubblicazione: (2025)
di: Chen, Tianrong, et al.
Pubblicazione: (2025)
One Layer Is Enough: Adapting Pretrained Visual Encoders for Image Generation
di: Gao, Yuan, et al.
Pubblicazione: (2025)
di: Gao, Yuan, et al.
Pubblicazione: (2025)
3D Shape Tokenization via Latent Flow Matching
di: Chang, Jen-Hao Rick, et al.
Pubblicazione: (2024)
di: Chang, Jen-Hao Rick, et al.
Pubblicazione: (2024)
Scalable Pre-training of Large Autoregressive Image Models
di: El-Nouby, Alaaeldin, et al.
Pubblicazione: (2024)
di: El-Nouby, Alaaeldin, et al.
Pubblicazione: (2024)
INRFlow: Flow Matching for INRs in Ambient Space
di: Wang, Yuyang, et al.
Pubblicazione: (2024)
di: Wang, Yuyang, et al.
Pubblicazione: (2024)
Pseudo-Generalized Dynamic View Synthesis from a Video
di: Zhao, Xiaoming, et al.
Pubblicazione: (2023)
di: Zhao, Xiaoming, et al.
Pubblicazione: (2023)
CTRLorALTer: Conditional LoRAdapter for Efficient 0-Shot Control & Altering of T2I Models
di: Stracke, Nick, et al.
Pubblicazione: (2024)
di: Stracke, Nick, et al.
Pubblicazione: (2024)
Target Concrete Score Matching: A Holistic Framework for Discrete Diffusion
di: Zhang, Ruixiang, et al.
Pubblicazione: (2025)
di: Zhang, Ruixiang, et al.
Pubblicazione: (2025)
STARFlow: Spatial Temporal Feature Re-embedding with Attentive Learning for Real-world Scene Flow
di: Lu, Zhiyang, et al.
Pubblicazione: (2024)
di: Lu, Zhiyang, et al.
Pubblicazione: (2024)
Swallowing the Bitter Pill: Simplified Scalable Conformer Generation
di: Wang, Yuyang, et al.
Pubblicazione: (2023)
di: Wang, Yuyang, et al.
Pubblicazione: (2023)
Manifold Diffusion Fields
di: Elhag, Ahmed A., et al.
Pubblicazione: (2023)
di: Elhag, Ahmed A., et al.
Pubblicazione: (2023)
Learning Long-term Motion Embeddings for Efficient Kinematics Generation
di: Stracke, Nick, et al.
Pubblicazione: (2026)
di: Stracke, Nick, et al.
Pubblicazione: (2026)
Adapting Self-Supervised Representations as a Latent Space for Efficient Generation
di: Gui, Ming, et al.
Pubblicazione: (2025)
di: Gui, Ming, et al.
Pubblicazione: (2025)
UniBlendNet: Unified Global, Multi-Scale, and Region-Adaptive Modeling for Ambient Lighting Normalization
di: Dai, Jiatao, et al.
Pubblicazione: (2026)
di: Dai, Jiatao, et al.
Pubblicazione: (2026)
TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation
di: Qu, Liao, et al.
Pubblicazione: (2024)
di: Qu, Liao, et al.
Pubblicazione: (2024)
GECO: Generative Image-to-3D within a SECOnd
di: Wang, Chen, et al.
Pubblicazione: (2024)
di: Wang, Chen, et al.
Pubblicazione: (2024)
Continuously Augmented Discrete Diffusion model for Categorical Generative Modeling
di: Zheng, Huangjie, et al.
Pubblicazione: (2025)
di: Zheng, Huangjie, et al.
Pubblicazione: (2025)
MEDBind: Unifying Language and Multimodal Medical Data Embeddings
di: Gao, Yuan, et al.
Pubblicazione: (2024)
di: Gao, Yuan, et al.
Pubblicazione: (2024)
Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations
di: Huang, Hai, et al.
Pubblicazione: (2025)
di: Huang, Hai, et al.
Pubblicazione: (2025)
HBridge: H-Shape Bridging of Heterogeneous Experts for Unified Multimodal Understanding and Generation
di: Wang, Xiang, et al.
Pubblicazione: (2025)
di: Wang, Xiang, et al.
Pubblicazione: (2025)
SimpleFold: Folding Proteins is Simpler than You Think
di: Wang, Yuyang, et al.
Pubblicazione: (2025)
di: Wang, Yuyang, et al.
Pubblicazione: (2025)
FlowInOne:Unifying Multimodal Generation as Image-in, Image-out Flow Matching
di: Yi, Junchao, et al.
Pubblicazione: (2026)
di: Yi, Junchao, et al.
Pubblicazione: (2026)
NextFlow: Unified Sequential Modeling Activates Multimodal Understanding and Generation
di: Zhang, Huichao, et al.
Pubblicazione: (2026)
di: Zhang, Huichao, et al.
Pubblicazione: (2026)
Documenti analoghi
-
STARFlow-V: End-to-End Video Generative Modeling with Normalizing Flows
di: Gu, Jiatao, et al.
Pubblicazione: (2025) -
STARFlow: Scaling Latent Normalizing Flows for High-resolution Image Synthesis
di: Gu, Jiatao, et al.
Pubblicazione: (2025) -
Normalizing Flows with Iterative Denoising
di: Chen, Tianrong, et al.
Pubblicazione: (2026) -
Normalizing Trajectory Models
di: Gu, Jiatao, et al.
Pubblicazione: (2026) -
Normalizing Flows are Capable Generative Models
di: Zhai, Shuangfei, et al.
Pubblicazione: (2024)