Latent Action Control for Reasoning-Guided Unified Image Generation
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhai, Fuxiang, Chen, Sixiang, Li, Yingjin, Li, Shuaibo, Lai, Jianyu, Huang, Tengjun, Zhu, Lei |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
GenEvolve: Self-Evolving Image Generation Agents via Tool-Orchestrated Visual Experience Distillation
von: Chen, Sixiang, et al.
Veröffentlicht: (2026)
von: Chen, Sixiang, et al.
Veröffentlicht: (2026)
PosterOmni: Generalized Artistic Poster Creation via Task Distillation and Unified Reward Feedback
von: Chen, Sixiang, et al.
Veröffentlicht: (2026)
von: Chen, Sixiang, et al.
Veröffentlicht: (2026)
Learning Additively Compositional Latent Actions for Embodied AI
von: Wei, Hangxing, et al.
Veröffentlicht: (2026)
von: Wei, Hangxing, et al.
Veröffentlicht: (2026)
LucidNFT: LR-Anchored Multi-Reward Preference Optimization for Flow-Based Real-World Super-Resolution
von: Fei, Song, et al.
Veröffentlicht: (2026)
von: Fei, Song, et al.
Veröffentlicht: (2026)
Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning
von: Hao, Pengfei, et al.
Veröffentlicht: (2025)
von: Hao, Pengfei, et al.
Veröffentlicht: (2025)
MILR: Improving Multimodal Image Generation via Test-Time Latent Reasoning
von: Mi, Yapeng, et al.
Veröffentlicht: (2025)
von: Mi, Yapeng, et al.
Veröffentlicht: (2025)
Stabilize the Latent Space for Image Autoregressive Modeling: A Unified Perspective
von: Zhu, Yongxin, et al.
Veröffentlicht: (2024)
von: Zhu, Yongxin, et al.
Veröffentlicht: (2024)
Spatial-Aware Latent Initialization for Controllable Image Generation
von: Sun, Wenqiang, et al.
Veröffentlicht: (2024)
von: Sun, Wenqiang, et al.
Veröffentlicht: (2024)
Efficient Remote Sensing with Harmonized Transfer Learning and Modality Alignment
von: Huang, Tengjun
Veröffentlicht: (2024)
von: Huang, Tengjun
Veröffentlicht: (2024)
A Survey of Multimodal Composite Editing and Retrieval
von: Li, Suyan, et al.
Veröffentlicht: (2024)
von: Li, Suyan, et al.
Veröffentlicht: (2024)
ATA: Bridging Implicit Reasoning with Attention-Guided and Action-Guided Inference for Vision-Language Action Models
von: Yang, Cheng, et al.
Veröffentlicht: (2026)
von: Yang, Cheng, et al.
Veröffentlicht: (2026)
TransLight: Image-Guided Customized Lighting Control with Generative Decoupling
von: Li, Zongming, et al.
Veröffentlicht: (2025)
von: Li, Zongming, et al.
Veröffentlicht: (2025)
iWorld-Bench: A Benchmark for Interactive World Models with a Unified Action Generation Framework
von: Fang, Jianjie, et al.
Veröffentlicht: (2026)
von: Fang, Jianjie, et al.
Veröffentlicht: (2026)
LD-RPS: Zero-Shot Unified Image Restoration via Latent Diffusion Recurrent Posterior Sampling
von: Li, Huaqiu, et al.
Veröffentlicht: (2025)
von: Li, Huaqiu, et al.
Veröffentlicht: (2025)
Chain of World: World Model Thinking in Latent Motion
von: Yang, Fuxiang, et al.
Veröffentlicht: (2026)
von: Yang, Fuxiang, et al.
Veröffentlicht: (2026)
AeroLite: Tag-Guided Lightweight Generation of Aerial Image Captions
von: Zi, Xing, et al.
Veröffentlicht: (2025)
von: Zi, Xing, et al.
Veröffentlicht: (2025)
Surgical-MambaLLM: Mamba2-enhanced Multimodal Large Language Model for VQLA in Robotic Surgery
von: Hao, Pengfei, et al.
Veröffentlicht: (2025)
von: Hao, Pengfei, et al.
Veröffentlicht: (2025)
LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning
von: Hao, Haihong, et al.
Veröffentlicht: (2026)
von: Hao, Haihong, et al.
Veröffentlicht: (2026)
Latent Harmony: Synergistic Unified UHD Image Restoration via Latent Space Regularization and Controllable Refinement
von: Liu, Yidi, et al.
Veröffentlicht: (2025)
von: Liu, Yidi, et al.
Veröffentlicht: (2025)
Reward Guided Latent Consistency Distillation
von: Li, Jiachen, et al.
Veröffentlicht: (2024)
von: Li, Jiachen, et al.
Veröffentlicht: (2024)
What-Meets-Where: Unified Learning of Action and Contact Localization in Images
von: Wang, Yuxiao, et al.
Veröffentlicht: (2025)
von: Wang, Yuxiao, et al.
Veröffentlicht: (2025)
Gradient Harmonization in Unsupervised Domain Adaptation
von: Huang, Fuxiang, et al.
Veröffentlicht: (2024)
von: Huang, Fuxiang, et al.
Veröffentlicht: (2024)
Unified Thinker: A General Reasoning Modular Core for Image Generation
von: Zhou, Sashuai, et al.
Veröffentlicht: (2026)
von: Zhou, Sashuai, et al.
Veröffentlicht: (2026)
WholeBodyVLA: Towards Unified Latent VLA for Whole-Body Loco-Manipulation Control
von: Jiang, Haoran, et al.
Veröffentlicht: (2025)
von: Jiang, Haoran, et al.
Veröffentlicht: (2025)
OmniGen: Unified Image Generation
von: Xiao, Shitao, et al.
Veröffentlicht: (2024)
von: Xiao, Shitao, et al.
Veröffentlicht: (2024)
The Thinking Pixel: Recursive Sparse Reasoning in Multimodal Diffusion Latents
von: Sun, Yuwei, et al.
Veröffentlicht: (2026)
von: Sun, Yuwei, et al.
Veröffentlicht: (2026)
Learning Patient-Specific Disease Dynamics with Latent Flow Matching for Longitudinal Imaging Generation
von: Chen, Hao, et al.
Veröffentlicht: (2025)
von: Chen, Hao, et al.
Veröffentlicht: (2025)
SemHiTok: A Unified Image Tokenizer via Semantic-Guided Hierarchical Codebook for Multimodal Understanding and Generation
von: Chen, Zisheng, et al.
Veröffentlicht: (2025)
von: Chen, Zisheng, et al.
Veröffentlicht: (2025)
UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent
von: Zhang, Jianke, et al.
Veröffentlicht: (2025)
von: Zhang, Jianke, et al.
Veröffentlicht: (2025)
Revisiting Visual Understanding in Multimodal Reasoning through a Lens of Image Perturbation
von: Li, Yuting, et al.
Veröffentlicht: (2025)
von: Li, Yuting, et al.
Veröffentlicht: (2025)
RestoreAgent: Autonomous Image Restoration Agent via Multimodal Large Language Models
von: Chen, Haoyu, et al.
Veröffentlicht: (2024)
von: Chen, Haoyu, et al.
Veröffentlicht: (2024)
Beyond Task-Specific Reasoning: A Unified Conditional Generative Framework for Abstract Visual Reasoning
von: Shi, Fan, et al.
Veröffentlicht: (2025)
von: Shi, Fan, et al.
Veröffentlicht: (2025)
SegDINO: An Efficient Design for Medical and Natural Image Segmentation with DINO-V3
von: Yang, Sicheng, et al.
Veröffentlicht: (2025)
von: Yang, Sicheng, et al.
Veröffentlicht: (2025)
SSR3D-LLM: Structured Spatial Reasoning via Latent Steps for Fine-Grained Grounding in Unified 3D-LLMs
von: Li, Jiawei, et al.
Veröffentlicht: (2026)
von: Li, Jiawei, et al.
Veröffentlicht: (2026)
Video-As-Prompt: Unified Semantic Control for Video Generation
von: Bian, Yuxuan, et al.
Veröffentlicht: (2025)
von: Bian, Yuxuan, et al.
Veröffentlicht: (2025)
Compress3D: a Compressed Latent Space for 3D Generation from a Single Image
von: Zhang, Bowen, et al.
Veröffentlicht: (2024)
von: Zhang, Bowen, et al.
Veröffentlicht: (2024)
LDEdit: Towards Generalized Text Guided Image Manipulation via Latent Diffusion Models
von: Chandramouli, Paramanand, et al.
Veröffentlicht: (2022)
von: Chandramouli, Paramanand, et al.
Veröffentlicht: (2022)
GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking
von: Zhan, Yufei, et al.
Veröffentlicht: (2025)
von: Zhan, Yufei, et al.
Veröffentlicht: (2025)
Generative Medical Image Anonymization Based on Latent Code Projection and Optimization
von: Li, Huiyu, et al.
Veröffentlicht: (2025)
von: Li, Huiyu, et al.
Veröffentlicht: (2025)
X-UniMotion: Animating Human Images with Expressive, Unified and Identity-Agnostic Motion Latents
von: Song, Guoxian, et al.
Veröffentlicht: (2025)
von: Song, Guoxian, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
GenEvolve: Self-Evolving Image Generation Agents via Tool-Orchestrated Visual Experience Distillation
von: Chen, Sixiang, et al.
Veröffentlicht: (2026) -
PosterOmni: Generalized Artistic Poster Creation via Task Distillation and Unified Reward Feedback
von: Chen, Sixiang, et al.
Veröffentlicht: (2026) -
Learning Additively Compositional Latent Actions for Embodied AI
von: Wei, Hangxing, et al.
Veröffentlicht: (2026) -
LucidNFT: LR-Anchored Multi-Reward Preference Optimization for Flow-Based Real-World Super-Resolution
von: Fei, Song, et al.
Veröffentlicht: (2026) -
Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning
von: Hao, Pengfei, et al.
Veröffentlicht: (2025)