FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Jin, Lai, Yao, Li, Aoxue, Zhang, Shifeng, Sun, Jiacheng, Kang, Ning, Wu, Chengyue, Li, Zhenguo, Luo, Ping |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GenArtist: Multimodal LLM as an Agent for Unified Image Generation and Editing
par: Wang, Zhenyu, et autres
Publié: (2024)
par: Wang, Zhenyu, et autres
Publié: (2024)
Enhancing Text-to-Image Editing via Hybrid Mask-Informed Fusion
par: Li, Aoxue, et autres
Publié: (2024)
par: Li, Aoxue, et autres
Publié: (2024)
Towards Understanding the Working Mechanism of Text-to-Image Diffusion Model
par: Yi, Mingyang, et autres
Publié: (2024)
par: Yi, Mingyang, et autres
Publié: (2024)
Diff-Instruct: A Universal Approach for Transferring Knowledge From Pre-trained Diffusion Models
par: Luo, Weijian, et autres
Publié: (2023)
par: Luo, Weijian, et autres
Publié: (2023)
Efficient Transferability Assessment for Selection of Pre-trained Detectors
par: Wang, Zhao, et autres
Publié: (2024)
par: Wang, Zhao, et autres
Publié: (2024)
LiT: Delving into a Simple Linear Diffusion Transformer for Image Generation
par: Wang, Jiahao, et autres
Publié: (2025)
par: Wang, Jiahao, et autres
Publié: (2025)
ProofAug: Efficient Neural Theorem Proving via Fine-grained Proof Structure Analysis
par: Liu, Haoxiong, et autres
Publié: (2025)
par: Liu, Haoxiong, et autres
Publié: (2025)
CustomVideo: Customizing Text-to-Video Generation with Multiple Subjects
par: Wang, Zhao, et autres
Publié: (2024)
par: Wang, Zhao, et autres
Publié: (2024)
SA-Solver: Stochastic Adams Solver for Fast Sampling of Diffusion Models
par: Xue, Shuchen, et autres
Publié: (2023)
par: Xue, Shuchen, et autres
Publié: (2023)
Divide and Conquer: Language Models can Plan and Self-Correct for Compositional Text-to-Image Generation
par: Wang, Zhenyu, et autres
Publié: (2024)
par: Wang, Zhenyu, et autres
Publié: (2024)
Open-Vocabulary Object Detection with Meta Prompt Representation and Instance Contrastive Optimization
par: Wang, Zhao, et autres
Publié: (2024)
par: Wang, Zhao, et autres
Publié: (2024)
Flow Matching with General Discrete Paths: A Kinetic-Optimal Perspective
par: Shaul, Neta, et autres
Publié: (2024)
par: Shaul, Neta, et autres
Publié: (2024)
Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation
par: Wu, Chengyue, et autres
Publié: (2024)
par: Wu, Chengyue, et autres
Publié: (2024)
A Hybrid Gas-Kinetic Scheme and Discrete Velocity Method for Continuum and Rarefied Flows
par: Wu, Hangkong, et autres
Publié: (2026)
par: Wu, Hangkong, et autres
Publié: (2026)
Implicit Search via Discrete Diffusion: A Study on Chess
par: Ye, Jiacheng, et autres
Publié: (2025)
par: Ye, Jiacheng, et autres
Publié: (2025)
JanusFlow: Harmonizing Autoregression and Rectified Flow for Unified Multimodal Understanding and Generation
par: Ma, Yiyang, et autres
Publié: (2024)
par: Ma, Yiyang, et autres
Publié: (2024)
Your Absorbing Discrete Diffusion Secretly Models the Conditional Distributions of Clean Data
par: Ou, Jingyang, et autres
Publié: (2024)
par: Ou, Jingyang, et autres
Publié: (2024)
Variational Autoencoding Discrete Diffusion with Enhanced Dimensional Correlations Modeling
par: Xie, Tianyu, et autres
Publié: (2025)
par: Xie, Tianyu, et autres
Publié: (2025)
Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion
par: Li, Lijiang, et autres
Publié: (2026)
par: Li, Lijiang, et autres
Publié: (2026)
DMFlow: Disordered Materials Generation by Flow Matching
par: Wu, Liming, et autres
Publié: (2026)
par: Wu, Liming, et autres
Publié: (2026)
Discretization approximation: An alternative to Monte Carlo in Bayesian computation
par: Xiong, Shifeng
Publié: (2025)
par: Xiong, Shifeng
Publié: (2025)
Beyond Autoregression: Discrete Diffusion for Complex Reasoning and Planning
par: Ye, Jiacheng, et autres
Publié: (2024)
par: Ye, Jiacheng, et autres
Publié: (2024)
Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
par: Liang, Zhixuan, et autres
Publié: (2025)
par: Liang, Zhixuan, et autres
Publié: (2025)
Analysis of the characteristics of reflectance confocal microscopy images of xanthogranuloma and xanthoma
par: Hongyong Sun, et autres
Publié: (2024)
par: Hongyong Sun, et autres
Publié: (2024)
AlignFlow: Improving Flow-based Generative Models with Semi-Discrete Optimal Transport
par: Kong, Lingkai, et autres
Publié: (2025)
par: Kong, Lingkai, et autres
Publié: (2025)
ChainStream: An LLM-based Framework for Unified Synthetic Sensing
par: Liu, Jiacheng, et autres
Publié: (2024)
par: Liu, Jiacheng, et autres
Publié: (2024)
ViewMask-1-to-3: Multi-View Consistent Image Generation via Multimodal Diffusion Models
par: Zhu, Ruishu, et autres
Publié: (2025)
par: Zhu, Ruishu, et autres
Publié: (2025)
SJD++: Improved Speculative Jacobi Decoding for Training-free Acceleration of Discrete Auto-regressive Text-to-Image Generation
par: Teng, Yao, et autres
Publié: (2025)
par: Teng, Yao, et autres
Publié: (2025)
SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models
par: Jin, Weiyang, et autres
Publié: (2025)
par: Jin, Weiyang, et autres
Publié: (2025)
Adding Additional Control to One-Step Diffusion with Joint Distribution Matching
par: Luo, Yihong, et autres
Publié: (2025)
par: Luo, Yihong, et autres
Publié: (2025)
Highly Accelerated Aortic 4D Flow MRI : Implications for Pulse Wave Velocity Measurements
par: Bingyi Wang, et autres
Publié: (2025)
par: Bingyi Wang, et autres
Publié: (2025)
UniFlow: Unifying Speech Front-End Tasks via Continuous Generative Modeling
par: Wang, Ziqian, et autres
Publié: (2025)
par: Wang, Ziqian, et autres
Publié: (2025)
Language Rectified Flow: Advancing Diffusion Language Generation with Probabilistic Flows
par: Zhang, Shujian, et autres
Publié: (2024)
par: Zhang, Shujian, et autres
Publié: (2024)
AnalogCoder-Pro: Unifying Analog Circuit Generation and Optimization via Multi-modal LLMs
par: Lai, Yao, et autres
Publié: (2025)
par: Lai, Yao, et autres
Publié: (2025)
How Do LLMs Acquire New Knowledge? A Knowledge Circuits Perspective on Continual Pre-Training
par: Ou, Yixin, et autres
Publié: (2025)
par: Ou, Yixin, et autres
Publié: (2025)
Best of Both Worlds: Multimodal Reasoning and Generation via Unified Discrete Flow Matching
par: Susladkar, Onkar, et autres
Publié: (2026)
par: Susladkar, Onkar, et autres
Publié: (2026)
Unified Reward Model for Multimodal Understanding and Generation
par: Wang, Yibin, et autres
Publié: (2025)
par: Wang, Yibin, et autres
Publié: (2025)
A Unified Multi-Agent Framework for Universal Multimodal Understanding and Generation
par: Li, Jiulin, et autres
Publié: (2025)
par: Li, Jiulin, et autres
Publié: (2025)
The Velocity Deficit: Initial Energy Injection for Flow Matching
par: Li, Linze, et autres
Publié: (2026)
par: Li, Linze, et autres
Publié: (2026)
$α$-Flow: A Unified Framework for Continuous-State Discrete Flow Matching Models
par: Cheng, Chaoran, et autres
Publié: (2025)
par: Cheng, Chaoran, et autres
Publié: (2025)
Documents similaires
-
GenArtist: Multimodal LLM as an Agent for Unified Image Generation and Editing
par: Wang, Zhenyu, et autres
Publié: (2024) -
Enhancing Text-to-Image Editing via Hybrid Mask-Informed Fusion
par: Li, Aoxue, et autres
Publié: (2024) -
Towards Understanding the Working Mechanism of Text-to-Image Diffusion Model
par: Yi, Mingyang, et autres
Publié: (2024) -
Diff-Instruct: A Universal Approach for Transferring Knowledge From Pre-trained Diffusion Models
par: Luo, Weijian, et autres
Publié: (2023) -
Efficient Transferability Assessment for Selection of Pre-trained Detectors
par: Wang, Zhao, et autres
Publié: (2024)