LatentUM: Unleashing the Potential of Interleaved Cross-Modal Reasoning via a Latent-Space Unified Model
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jin, Jiachun, Zhou, Zetong, Yang, Xiao, Zhang, Hao, Liu, Pengfei, Zhu, Jun, Deng, Zhijie |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Think-Then-Generate: Reasoning-Aware Text-to-Image Diffusion with LLM Encoders
par: Kou, Siqi, et autres
Publié: (2026)
par: Kou, Siqi, et autres
Publié: (2026)
LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning
par: Dai, Yifan, et autres
Publié: (2026)
par: Dai, Yifan, et autres
Publié: (2026)
Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space
par: Liu, Chengzhi, et autres
Publié: (2025)
par: Liu, Chengzhi, et autres
Publié: (2025)
Reasoning in the Dark: Interleaved Vision-Text Reasoning in Latent Space
par: Chen, Chao, et autres
Publié: (2025)
par: Chen, Chao, et autres
Publié: (2025)
Orthus: Autoregressive Interleaved Image-Text Generation with Modality-Specific Heads
par: Kou, Siqi, et autres
Publié: (2024)
par: Kou, Siqi, et autres
Publié: (2024)
Unleashing the Potential of the Semantic Latent Space in Diffusion Models for Image Dehazing
par: Yang, Zizheng, et autres
Publié: (2025)
par: Yang, Zizheng, et autres
Publié: (2025)
WEAVE: Unleashing and Benchmarking the In-context Interleaved Comprehension and Generation
par: Chow, Wei, et autres
Publié: (2025)
par: Chow, Wei, et autres
Publié: (2025)
Latent Harmony: Synergistic Unified UHD Image Restoration via Latent Space Regularization and Controllable Refinement
par: Liu, Yidi, et autres
Publié: (2025)
par: Liu, Yidi, et autres
Publié: (2025)
Interleaved Latent Visual Reasoning with Selective Perceptual Modeling
par: Dong, Shuai, et autres
Publié: (2025)
par: Dong, Shuai, et autres
Publié: (2025)
Self-Consistent Latent Reasoning: Long Latent Sequence Reasoning for Vision-Language Model
par: Wang, Chenfeng, et autres
Publié: (2026)
par: Wang, Chenfeng, et autres
Publié: (2026)
Vision Model Pre-training on Interleaved Image-Text Data via Latent Compression Learning
par: Yang, Chenyu, et autres
Publié: (2024)
par: Yang, Chenyu, et autres
Publié: (2024)
VINO: A Unified Visual Generator with Interleaved OmniModal Context
par: Chen, Junyi, et autres
Publié: (2026)
par: Chen, Junyi, et autres
Publié: (2026)
Monet: Reasoning in Latent Visual Space Beyond Images and Language
par: Wang, Qixun, et autres
Publié: (2025)
par: Wang, Qixun, et autres
Publié: (2025)
Alias-Free Latent Diffusion Models: Improving Fractional Shift Equivariance of Diffusion Latent Space
par: Zhou, Yifan, et autres
Publié: (2025)
par: Zhou, Yifan, et autres
Publié: (2025)
Source-Free Cross-Modal Knowledge Transfer by Unleashing the Potential of Task-Irrelevant Data
par: Zhu, Jinjing, et autres
Publié: (2024)
par: Zhu, Jinjing, et autres
Publié: (2024)
Heterogeneous-Modal Unsupervised Domain Adaptation via Latent Space Bridging
par: Yang, Jiawen, et autres
Publié: (2025)
par: Yang, Jiawen, et autres
Publié: (2025)
StrokeFusion: Vector Sketch Generation via Joint Stroke-UDF Encoding and Latent Sequence Diffusion
par: Zhou, Jin, et autres
Publié: (2025)
par: Zhou, Jin, et autres
Publié: (2025)
Sketch-in-Latents: Eliciting Unified Reasoning in MLLMs
par: Tong, Jintao, et autres
Publié: (2025)
par: Tong, Jintao, et autres
Publié: (2025)
One Latent Space to Rule All Degradations: Unifying Restoration Knowledge for Image Fusion
par: Ma, Haolong, et autres
Publié: (2025)
par: Ma, Haolong, et autres
Publié: (2025)
LatentGeo: Learnable Auxiliary Constructions in Latent Space for Multimodal Geometric Reasoning
par: Xu, Haiying, et autres
Publié: (2026)
par: Xu, Haiying, et autres
Publié: (2026)
MorphAny3D: Unleashing the Power of Structured Latent in 3D Morphing
par: Sun, Xiaokun, et autres
Publié: (2026)
par: Sun, Xiaokun, et autres
Publié: (2026)
Latent Action Control for Reasoning-Guided Unified Image Generation
par: Zhai, Fuxiang, et autres
Publié: (2026)
par: Zhai, Fuxiang, et autres
Publié: (2026)
Unleashing the Potential of Consistency Learning for Detecting and Grounding Multi-Modal Media Manipulation
par: Li, Yiheng, et autres
Publié: (2025)
par: Li, Yiheng, et autres
Publié: (2025)
Stabilize the Latent Space for Image Autoregressive Modeling: A Unified Perspective
par: Zhu, Yongxin, et autres
Publié: (2024)
par: Zhu, Yongxin, et autres
Publié: (2024)
Unleashing MLLMs on the Edge: A Unified Framework for Cross-Modal ReID via Adaptive SVD Distillation
par: Jiang, Hongbo, et autres
Publié: (2026)
par: Jiang, Hongbo, et autres
Publié: (2026)
Latent Transfer Attack: Adversarial Examples via Generative Latent Spaces
par: Shaar, Eitan, et autres
Publié: (2026)
par: Shaar, Eitan, et autres
Publié: (2026)
Omni-Reward: Towards Generalist Omni-Modal Reward Modeling with Free-Form Preferences
par: Jin, Zhuoran, et autres
Publié: (2025)
par: Jin, Zhuoran, et autres
Publié: (2025)
PERL: Parameter Efficient Reasoning in CLIP Latent Space
par: Carnemolla, Simone, et autres
Publié: (2026)
par: Carnemolla, Simone, et autres
Publié: (2026)
Leveraging Latent Visual Reasoning in Silence
par: Zhu, Dongyao, et autres
Publié: (2026)
par: Zhu, Dongyao, et autres
Publié: (2026)
Latent Visual Reasoning
par: Li, Bangzheng, et autres
Publié: (2025)
par: Li, Bangzheng, et autres
Publié: (2025)
Interleaved-Modal Chain-of-Thought
par: Gao, Jun, et autres
Publié: (2024)
par: Gao, Jun, et autres
Publié: (2024)
Structured 3D Latents Are Surprisingly Powerful: Unleashing Generalizable Style with 2D Diffusion
par: Qiao, Yiran, et autres
Publié: (2026)
par: Qiao, Yiran, et autres
Publié: (2026)
DeepLatent: Think with Images via Parallel Latent Visual Reasoning
par: Lu, Dongchen, et autres
Publié: (2026)
par: Lu, Dongchen, et autres
Publié: (2026)
Open-set Cross Modal Generalization via Multimodal Unified Representation
par: Huang, Hai, et autres
Publié: (2025)
par: Huang, Hai, et autres
Publié: (2025)
Youtu-VL: Unleashing Visual Potential via Unified Vision-Language Supervision
par: Wei, Zhixiang, et autres
Publié: (2026)
par: Wei, Zhixiang, et autres
Publié: (2026)
LatentUMM: Dual Latent Alignment for Unified Multimodal Models
par: Luo, Yinyi, et autres
Publié: (2026)
par: Luo, Yinyi, et autres
Publié: (2026)
GMapLatent: Geometric Mapping in Latent Space
par: Zeng, Wei, et autres
Publié: (2025)
par: Zeng, Wei, et autres
Publié: (2025)
IDOL: Unified Dual-Modal Latent Diffusion for Human-Centric Joint Video-Depth Generation
par: Zhai, Yuanhao, et autres
Publié: (2024)
par: Zhai, Yuanhao, et autres
Publié: (2024)
DiffHarmony: Latent Diffusion Model Meets Image Harmonization
par: Zhou, Pengfei, et autres
Publié: (2024)
par: Zhou, Pengfei, et autres
Publié: (2024)
Joint Geometry-Appearance Human Reconstruction in a Unified Latent Space via Bridge Diffusion
par: Tang, Yingzhi, et autres
Publié: (2026)
par: Tang, Yingzhi, et autres
Publié: (2026)
Documents similaires
-
Think-Then-Generate: Reasoning-Aware Text-to-Image Diffusion with LLM Encoders
par: Kou, Siqi, et autres
Publié: (2026) -
LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning
par: Dai, Yifan, et autres
Publié: (2026) -
Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space
par: Liu, Chengzhi, et autres
Publié: (2025) -
Reasoning in the Dark: Interleaved Vision-Text Reasoning in Latent Space
par: Chen, Chao, et autres
Publié: (2025) -
Orthus: Autoregressive Interleaved Image-Text Generation with Modality-Specific Heads
par: Kou, Siqi, et autres
Publié: (2024)