FlowInOne:Unifying Multimodal Generation as Image-in, Image-out Flow Matching
Fuente:
arXiv
Salvato in:
| Autori principali: | Yi, Junchao, Zhao, Rui, Tang, Jiahao, Lei, Weixian, Li, Linjie, Su, Qisheng, Yang, Zhengyuan, Wang, Lijuan, Zhu, Xiaofeng, Wang, Alex Jinpeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Beyond Words: Advancing Long-Text Image Generation via Multimodal Autoregressive Models
di: Wang, Alex Jinpeng, et al.
Pubblicazione: (2025)
di: Wang, Alex Jinpeng, et al.
Pubblicazione: (2025)
Glance: Accelerating Diffusion Models with 1 Sample
di: Dong, Zhuobai, et al.
Pubblicazione: (2025)
di: Dong, Zhuobai, et al.
Pubblicazione: (2025)
V-MAGE: A Game Evaluation Framework for Assessing Vision-Centric Capabilities in Multimodal Large Language Models
di: Zheng, Xiangxi, et al.
Pubblicazione: (2025)
di: Zheng, Xiangxi, et al.
Pubblicazione: (2025)
MusFlow: Multimodal Music Generation via Conditional Flow Matching
di: Song, Jiahao, et al.
Pubblicazione: (2025)
di: Song, Jiahao, et al.
Pubblicazione: (2025)
Exploring a Unified Vision-Centric Contrastive Alternatives on Multi-Modal Web Documents
di: Lin, Yiqi, et al.
Pubblicazione: (2025)
di: Lin, Yiqi, et al.
Pubblicazione: (2025)
ShowUI: One Vision-Language-Action Model for GUI Visual Agent
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2024)
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2024)
Diagnostic Benchmark and Iterative Inpainting for Layout-Guided Image Generation
di: Cho, Jaemin, et al.
Pubblicazione: (2023)
di: Cho, Jaemin, et al.
Pubblicazione: (2023)
TextGround4M: A Prompt-Aligned Dataset for Layout-Aware Text Rendering
di: Mao, Dongxing, et al.
Pubblicazione: (2026)
di: Mao, Dongxing, et al.
Pubblicazione: (2026)
ImageGen-CoT: Enhancing Text-to-Image In-context Learning with Chain-of-Thought Reasoning
di: Liao, Jiaqi, et al.
Pubblicazione: (2025)
di: Liao, Jiaqi, et al.
Pubblicazione: (2025)
CurveFlow: Curvature-Guided Flow Matching for Image Generation
di: Luo, Yan, et al.
Pubblicazione: (2025)
di: Luo, Yan, et al.
Pubblicazione: (2025)
FusionFM: All-in-One Multi-Modal Image Fusion with Flow Matching
di: Zhu, Huayi, et al.
Pubblicazione: (2025)
di: Zhu, Huayi, et al.
Pubblicazione: (2025)
List Items One by One: A New Data Source and Learning Paradigm for Multimodal LLMs
di: Yan, An, et al.
Pubblicazione: (2024)
di: Yan, An, et al.
Pubblicazione: (2024)
TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation
di: Qu, Liao, et al.
Pubblicazione: (2024)
di: Qu, Liao, et al.
Pubblicazione: (2024)
LiVOS: Light Video Object Segmentation with Gated Linear Matching
di: Liu, Qin, et al.
Pubblicazione: (2024)
di: Liu, Qin, et al.
Pubblicazione: (2024)
TextAtlas5M: A Large-scale Dataset for Dense Text Image Generation
di: Wang, Alex Jinpeng, et al.
Pubblicazione: (2025)
di: Wang, Alex Jinpeng, et al.
Pubblicazione: (2025)
COSMO: COntrastive Streamlined MultimOdal Model with Interleaved Pre-Training
di: Wang, Alex Jinpeng, et al.
Pubblicazione: (2024)
di: Wang, Alex Jinpeng, et al.
Pubblicazione: (2024)
Idea2Img: Iterative Self-Refinement with GPT-4V(ision) for Automatic Image Design and Generation
di: Yang, Zhengyuan, et al.
Pubblicazione: (2023)
di: Yang, Zhengyuan, et al.
Pubblicazione: (2023)
RAW-Flow: Advancing RGB-to-RAW Image Reconstruction with Deterministic Latent Flow Matching
di: Liu, Zhen, et al.
Pubblicazione: (2026)
di: Liu, Zhen, et al.
Pubblicazione: (2026)
SenseFlow: Scaling Distribution Matching for Flow-based Text-to-Image Distillation
di: Ge, Xingtong, et al.
Pubblicazione: (2025)
di: Ge, Xingtong, et al.
Pubblicazione: (2025)
Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark
di: Hao, Yunzhuo, et al.
Pubblicazione: (2025)
di: Hao, Yunzhuo, et al.
Pubblicazione: (2025)
TechImage-Bench: Rubric-Based Evaluation for Technical Image Generation
di: Ni, Minheng, et al.
Pubblicazione: (2025)
di: Ni, Minheng, et al.
Pubblicazione: (2025)
MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities
di: Yu, Weihao, et al.
Pubblicazione: (2023)
di: Yu, Weihao, et al.
Pubblicazione: (2023)
Domain Adaptive Diabetic Retinopathy Grading with Model Absence and Flowing Data
di: Su, Wenxin, et al.
Pubblicazione: (2024)
di: Su, Wenxin, et al.
Pubblicazione: (2024)
Ambiguity-aware Truncated Flow Matching for Ambiguous Medical Image Segmentation
di: Li, Fanding, et al.
Pubblicazione: (2025)
di: Li, Fanding, et al.
Pubblicazione: (2025)
Distilled Decoding 1: One-step Sampling of Image Auto-regressive Models with Flow Matching
di: Liu, Enshu, et al.
Pubblicazione: (2024)
di: Liu, Enshu, et al.
Pubblicazione: (2024)
Leveraging Visual Tokens for Extended Text Contexts in Multi-Modal Learning
di: Wang, Alex Jinpeng, et al.
Pubblicazione: (2024)
di: Wang, Alex Jinpeng, et al.
Pubblicazione: (2024)
Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning
di: Ni, Minheng, et al.
Pubblicazione: (2025)
di: Ni, Minheng, et al.
Pubblicazione: (2025)
Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT
di: Dong, Zhuobai, et al.
Pubblicazione: (2025)
di: Dong, Zhuobai, et al.
Pubblicazione: (2025)
MT-EditFlow: Reinforcement Learning for Multi-Turn Image Editing with Flow Matching
di: Huang, Jiahui, et al.
Pubblicazione: (2026)
di: Huang, Jiahui, et al.
Pubblicazione: (2026)
A Unified Framework for Diffusion Bridge Problems: Flow Matching and Schrödinger Matching into One
di: Kim, Minyoung
Pubblicazione: (2025)
di: Kim, Minyoung
Pubblicazione: (2025)
Geometry-Aware Image Flow Matching
di: Lee, Junho, et al.
Pubblicazione: (2026)
di: Lee, Junho, et al.
Pubblicazione: (2026)
CBCT-Based Synthetic CT Generation Using Conditional Flow Matching Model
di: Peng, Junbo, et al.
Pubblicazione: (2026)
di: Peng, Junbo, et al.
Pubblicazione: (2026)
Restora-Flow: Mask-Guided Image Restoration with Flow Matching
di: Hadzic, Arnela, et al.
Pubblicazione: (2025)
di: Hadzic, Arnela, et al.
Pubblicazione: (2025)
Flow-Matching Guided Deep Unfolding for Hyperspectral Image Reconstruction
di: Ai, Yi, et al.
Pubblicazione: (2025)
di: Ai, Yi, et al.
Pubblicazione: (2025)
UniFlow-Audio: Unified Flow Matching for Audio Generation from Omni-Modalities
di: Xu, Xuenan, et al.
Pubblicazione: (2025)
di: Xu, Xuenan, et al.
Pubblicazione: (2025)
FlowLUT: Efficient Image Enhancement via Differentiable LUTs and Iterative Flow Matching
di: Hu, Liubing, et al.
Pubblicazione: (2025)
di: Hu, Liubing, et al.
Pubblicazione: (2025)
Reverse Flow Matching: A Unified Framework for Online Reinforcement Learning with Diffusion and Flow Policies
di: Li, Zeyang, et al.
Pubblicazione: (2026)
di: Li, Zeyang, et al.
Pubblicazione: (2026)
EMatch: A Unified Framework for Event-based Optical Flow and Stereo Matching
di: Zhang, Pengjie, et al.
Pubblicazione: (2024)
di: Zhang, Pengjie, et al.
Pubblicazione: (2024)
4KDehazeFlow: Ultra-High-Definition Image Dehazing via Flow Matching
di: Chen, Xingchi, et al.
Pubblicazione: (2025)
di: Chen, Xingchi, et al.
Pubblicazione: (2025)
TReFT: Taming Rectified Flow Models For One-Step Image Translation
di: Li, Shengqian, et al.
Pubblicazione: (2025)
di: Li, Shengqian, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Beyond Words: Advancing Long-Text Image Generation via Multimodal Autoregressive Models
di: Wang, Alex Jinpeng, et al.
Pubblicazione: (2025) -
Glance: Accelerating Diffusion Models with 1 Sample
di: Dong, Zhuobai, et al.
Pubblicazione: (2025) -
V-MAGE: A Game Evaluation Framework for Assessing Vision-Centric Capabilities in Multimodal Large Language Models
di: Zheng, Xiangxi, et al.
Pubblicazione: (2025) -
MusFlow: Multimodal Music Generation via Conditional Flow Matching
di: Song, Jiahao, et al.
Pubblicazione: (2025) -
Exploring a Unified Vision-Centric Contrastive Alternatives on Multi-Modal Web Documents
di: Lin, Yiqi, et al.
Pubblicazione: (2025)