MILR: Improving Multimodal Image Generation via Test-Time Latent Reasoning
Fuente:
arXiv
Saved in:
| Main Authors: | Mi, Yapeng, Zhao, Yanpeng, Li, Hengli, Li, Chenxi, Wu, Huimin, Ma, Xiaojian, Zhu, Song-Chun, Wu, Ying Nian, Li, Qing |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Seek in the Dark: Reasoning via Test-Time Instance-Level Policy Gradient in Latent Space
by: Li, Hengli, et al.
Published: (2025)
by: Li, Hengli, et al.
Published: (2025)
NEP: Autoregressive Image Editing via Next Editing Token Prediction
by: Wu, Huimin, et al.
Published: (2025)
by: Wu, Huimin, et al.
Published: (2025)
Building LLM Agents by Incorporating Insights from Computer Systems
by: Mi, Yapeng, et al.
Published: (2025)
by: Mi, Yapeng, et al.
Published: (2025)
Discrete Markov Bridge
by: Li, Hengli, et al.
Published: (2025)
by: Li, Hengli, et al.
Published: (2025)
Iterative Tool Usage Exploration for Multimodal Agents via Step-wise Preference Tuning
by: Li, Pengxiang, et al.
Published: (2025)
by: Li, Pengxiang, et al.
Published: (2025)
Neural-Symbolic Recursive Machine for Systematic Generalization
by: Li, Qing, et al.
Published: (2022)
by: Li, Qing, et al.
Published: (2022)
Bongard-OpenWorld: Few-Shot Reasoning for Free-form Visual Concepts in the Real World
by: Wu, Rujie, et al.
Published: (2023)
by: Wu, Rujie, et al.
Published: (2023)
TongUI: Internet-Scale Trajectories from Multimodal Web Tutorials for Generalized GUI Agents
by: Zhang, Bofei, et al.
Published: (2025)
by: Zhang, Bofei, et al.
Published: (2025)
MindDial: Belief Dynamics Tracking with Theory-of-Mind Modeling for Situated Neural Dialogue Generation
by: Qiu, Shuwen, et al.
Published: (2023)
by: Qiu, Shuwen, et al.
Published: (2023)
VideoAgent: A Memory-augmented Multimodal Agent for Video Understanding
by: Fan, Yue, et al.
Published: (2024)
by: Fan, Yue, et al.
Published: (2024)
Parallel Test-Time Scaling for Latent Reasoning Models
by: You, Runyang, et al.
Published: (2025)
by: You, Runyang, et al.
Published: (2025)
Inference-Time Rethinking with Latent Thought Vectors for Math Reasoning
by: Kong, Deqian, et al.
Published: (2026)
by: Kong, Deqian, et al.
Published: (2026)
BEDA: Belief Estimation as Probabilistic Constraints for Performing Strategic Dialogue Acts
by: Li, Hengli, et al.
Published: (2025)
by: Li, Hengli, et al.
Published: (2025)
Probing Visual Planning in Image Editing Models
by: Zhou, Zhimu, et al.
Published: (2026)
by: Zhou, Zhimu, et al.
Published: (2026)
Latent Action Control for Reasoning-Guided Unified Image Generation
by: Zhai, Fuxiang, et al.
Published: (2026)
by: Zhai, Fuxiang, et al.
Published: (2026)
ManCAR: Manifold-Constrained Latent Reasoning with Adaptive Test-Time Computation for Sequential Recommendation
by: Yang, Kun, et al.
Published: (2026)
by: Yang, Kun, et al.
Published: (2026)
Generative Actor Critic
by: Qin, Aoyang, et al.
Published: (2025)
by: Qin, Aoyang, et al.
Published: (2025)
Training LLMs for Divide-and-Conquer Reasoning Elevates Test-Time Scalability
by: Liang, Xiao, et al.
Published: (2026)
by: Liang, Xiao, et al.
Published: (2026)
TLRN: Temporal Latent Residual Networks For Large Deformation Image Registration
by: Wu, Nian, et al.
Published: (2024)
by: Wu, Nian, et al.
Published: (2024)
From Noise to Latent: Generating Gaussian Latents for INR-Based Image Compression
by: Lin, Chaoyi, et al.
Published: (2025)
by: Lin, Chaoyi, et al.
Published: (2025)
InterPreT: Interactive Predicate Learning from Language Feedback for Generalizable Task Planning
by: Han, Muzhi, et al.
Published: (2024)
by: Han, Muzhi, et al.
Published: (2024)
Kernel-based multi-marker tests of association based on the accelerated failure time model
by: Li, Chenxi, et al.
Published: (2024)
by: Li, Chenxi, et al.
Published: (2024)
CLOVA: A Closed-Loop Visual Assistant with Tool Usage and Update
by: Gao, Zhi, et al.
Published: (2023)
by: Gao, Zhi, et al.
Published: (2023)
Multivariate Long-term Time Series Forecasting with Fourier Neural Filter
by: Xu, Chenheng, et al.
Published: (2025)
by: Xu, Chenheng, et al.
Published: (2025)
Test Species Discrimination in Codonopsis (Campanulaceae) Using Genome Skimming Data
by: Chun‐Jiao Li, et al.
Published: (2025)
by: Chun‐Jiao Li, et al.
Published: (2025)
The Thinking Pixel: Recursive Sparse Reasoning in Multimodal Diffusion Latents
by: Sun, Yuwei, et al.
Published: (2026)
by: Sun, Yuwei, et al.
Published: (2026)
Thoughts-as-Planning: Latent World Models for Chain-of-Thoughts Optimization via Reinforcement Planning
by: Liu, Dong, et al.
Published: (2026)
by: Liu, Dong, et al.
Published: (2026)
LaRe: Latent Refocusing for Multimodal Reasoning
by: Ma, Jizheng, et al.
Published: (2025)
by: Ma, Jizheng, et al.
Published: (2025)
Multi-modal Agent Tuning: Building a VLM-Driven Agent for Efficient Tool Usage
by: Gao, Zhi, et al.
Published: (2024)
by: Gao, Zhi, et al.
Published: (2024)
Molecule Design by Latent Prompt Transformer
by: Kong, Deqian, et al.
Published: (2023)
by: Kong, Deqian, et al.
Published: (2023)
AquaMILR+: Design of an untethered limbless robot for complex aquatic terrain navigation
by: Fernandez, Matthew, et al.
Published: (2024)
by: Fernandez, Matthew, et al.
Published: (2024)
LLM3:Large Language Model-based Task and Motion Planning with Motion Failure Reasoning
by: Wang, Shu, et al.
Published: (2024)
by: Wang, Shu, et al.
Published: (2024)
Mitigating Strategy-Selection Bias in Reasoning for More Effective Test-Time Scaling
by: Wu, Zongqian, et al.
Published: (2025)
by: Wu, Zongqian, et al.
Published: (2025)
Multimodal Learning To Improve Cardiac Late Mechanical Activation Detection From Cine MR Images
by: Xing, Jiarui, et al.
Published: (2024)
by: Xing, Jiarui, et al.
Published: (2024)
$\nabla$-Reasoner: LLM Reasoning via Test-Time Gradient Descent in Latent Space
by: Wang, Peihao, et al.
Published: (2026)
by: Wang, Peihao, et al.
Published: (2026)
Mediation Analysis of Failure Time Data Under Interval Censoring
by: Yanpeng Shi, et al.
Published: (2026)
by: Yanpeng Shi, et al.
Published: (2026)
AquaMILR: Mechanical intelligence simplifies control of undulatory robots in cluttered fluid environments
by: Wang, Tianyu, et al.
Published: (2024)
by: Wang, Tianyu, et al.
Published: (2024)
A Study on the Ancient theater of official house in The Taihang mountain area of North Henan Province in China
by: Hengli Peng
Published: (2023)
by: Hengli Peng
Published: (2023)
Latent Reward Steering: An Adaptive Inference-Time Framework that Implicitly Promotes Cognitive Behaviors in Reasoning LLMs
by: Li, Jiakang, et al.
Published: (2026)
by: Li, Jiakang, et al.
Published: (2026)
LaTER: Efficient Test-Time Reasoning via Latent Exploration and Explicit Verification
by: Li, Xuan, et al.
Published: (2026)
by: Li, Xuan, et al.
Published: (2026)
Similar Items
-
Seek in the Dark: Reasoning via Test-Time Instance-Level Policy Gradient in Latent Space
by: Li, Hengli, et al.
Published: (2025) -
NEP: Autoregressive Image Editing via Next Editing Token Prediction
by: Wu, Huimin, et al.
Published: (2025) -
Building LLM Agents by Incorporating Insights from Computer Systems
by: Mi, Yapeng, et al.
Published: (2025) -
Discrete Markov Bridge
by: Li, Hengli, et al.
Published: (2025) -
Iterative Tool Usage Exploration for Multimodal Agents via Step-wise Preference Tuning
by: Li, Pengxiang, et al.
Published: (2025)