ChatUMM: Robust Context Tracking for Conversational Interleaved Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Dai, Wenxun, Zhao, Zhiyuan, Zhong, Yule, Cheng, Yiji, Zhang, Jianwei, Wang, Linqing, Zhang, Shiyi, Lin, Yunlong, He, Runze, Song, Fellix, Zhuang, Wayne, Liu, Yong, Zhang, Haoji, Tang, Yansong, Wang, Chunyu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Meta-CoT: Enhancing Granularity and Generalization in Image Editing
por: Zhang, Shiyi, et al.
Publicado: (2026)
por: Zhang, Shiyi, et al.
Publicado: (2026)
Re-Align: Structured Reasoning-guided Alignment for In-Context Image Generation and Editing
por: He, Runze, et al.
Publicado: (2026)
por: He, Runze, et al.
Publicado: (2026)
LOGO: A Long-Form Video Dataset for Group Action Quality Assessment
por: Zhang, Shiyi, et al.
Publicado: (2024)
por: Zhang, Shiyi, et al.
Publicado: (2024)
JarvisEvo: Towards a Self-Evolving Photo Editing Agent with Synergistic Editor-Evaluator Optimization
por: Lin, Yunlong, et al.
Publicado: (2025)
por: Lin, Yunlong, et al.
Publicado: (2025)
Ponder & Press: Advancing Visual GUI Agent towards General Computer Control
por: Wang, Yiqin, et al.
Publicado: (2024)
por: Wang, Yiqin, et al.
Publicado: (2024)
GaussianCube: A Structured and Explicit Radiance Representation for 3D Generative Modeling
por: Zhang, Bowen, et al.
Publicado: (2024)
por: Zhang, Bowen, et al.
Publicado: (2024)
A High‐Gain Interleaved Soft‐Switching Bidirectional Flyback Converter
por: Junlei Liu, et al.
Publicado: (2025)
por: Junlei Liu, et al.
Publicado: (2025)
FlexiAct: Towards Flexible Action Control in Heterogeneous Scenarios
por: Zhang, Shiyi, et al.
Publicado: (2025)
por: Zhang, Shiyi, et al.
Publicado: (2025)
RodinHD: High-Fidelity 3D Avatar Generation with Diffusion Models
por: Zhang, Bowen, et al.
Publicado: (2024)
por: Zhang, Bowen, et al.
Publicado: (2024)
VG-Refiner: Towards Tool-Refined Referring Grounded Reasoning via Agentic Reinforcement Learning
por: Wang, Yuji, et al.
Publicado: (2025)
por: Wang, Yuji, et al.
Publicado: (2025)
Stable gradient-adjusted root mean square propagation on least squares problem
por: Li, Runze, et al.
Publicado: (2024)
por: Li, Runze, et al.
Publicado: (2024)
Stochastic versus Deterministic in Stochastic Gradient Descent
por: Li, Runze, et al.
Publicado: (2025)
por: Li, Runze, et al.
Publicado: (2025)
Generative Visual Chain-of-Thought for Image Editing
por: Yin, Zijin, et al.
Publicado: (2026)
por: Yin, Zijin, et al.
Publicado: (2026)
MotionLCM: Real-time Controllable Motion Generation via Latent Consistency Model
por: Dai, Wenxun, et al.
Publicado: (2024)
por: Dai, Wenxun, et al.
Publicado: (2024)
Research on Photovoltaic Grid‐Connected Inverter Based on Interleaved Parallel Decoupling
por: Yu Wang, et al.
Publicado: (2025)
por: Yu Wang, et al.
Publicado: (2025)
Hierarchical Memory for Long Video QA
por: Wang, Yiqin, et al.
Publicado: (2024)
por: Wang, Yiqin, et al.
Publicado: (2024)
Flash-VStream: Memory-Based Real-Time Understanding for Long Video Streams
por: Zhang, Haoji, et al.
Publicado: (2024)
por: Zhang, Haoji, et al.
Publicado: (2024)
LatentUMM: Dual Latent Alignment for Unified Multimodal Models
por: Luo, Yinyi, et al.
Publicado: (2026)
por: Luo, Yinyi, et al.
Publicado: (2026)
InstantCharacter: Personalize Any Characters with a Scalable Diffusion Transformer Framework
por: Tao, Jiale, et al.
Publicado: (2025)
por: Tao, Jiale, et al.
Publicado: (2025)
Flash-VStream: Efficient Real-Time Understanding for Long Video Streams
por: Zhang, Haoji, et al.
Publicado: (2025)
por: Zhang, Haoji, et al.
Publicado: (2025)
TAG-MoE: Task-Aware Gating for Unified Generative Mixture-of-Experts
por: Xu, Yu, et al.
Publicado: (2026)
por: Xu, Yu, et al.
Publicado: (2026)
Depth-first directional search for nonconvex optimization
por: Zhang, Yuxuan, et al.
Publicado: (2024)
por: Zhang, Yuxuan, et al.
Publicado: (2024)
Directly Aligning the Full Diffusion Trajectory with Fine-Grained Human Preference
por: Shen, Xiangwei, et al.
Publicado: (2025)
por: Shen, Xiangwei, et al.
Publicado: (2025)
ManiCM: Real-time 3D Diffusion Policy via Consistency Model for Robotic Manipulation
por: Lu, Guanxing, et al.
Publicado: (2024)
por: Lu, Guanxing, et al.
Publicado: (2024)
KV-Edit: Training-Free Image Editing for Precise Background Preservation
por: Zhu, Tianrui, et al.
Publicado: (2025)
por: Zhu, Tianrui, et al.
Publicado: (2025)
FedUMM: A General Framework for Federated Learning with Unified Multimodal Models
por: Su, Zhaolong, et al.
Publicado: (2026)
por: Su, Zhaolong, et al.
Publicado: (2026)
M$^{2}$Chat: Empowering VLM for Multimodal LLM Interleaved Text-Image Generation
por: Chi, Xiaowei, et al.
Publicado: (2023)
por: Chi, Xiaowei, et al.
Publicado: (2023)
How Preschoolers Defend: Early Preschoolers Act More, Intend Less, and Strategically Defend Friends
por: Xiaoqian Wu, et al.
Publicado: (2026)
por: Xiaoqian Wu, et al.
Publicado: (2026)
Childhood trauma and adolescent loneliness: Contributions of emotion dysregulation and parasympathetic functioning
por: Huayu Ji, et al.
Publicado: (2026)
por: Huayu Ji, et al.
Publicado: (2026)
Emotional reactivity mediates and moderates the longitudinal associations between mothers' depressive symptoms and behavioral problems in youth
por: Huayu Ji, et al.
Publicado: (2024)
por: Huayu Ji, et al.
Publicado: (2024)
TorchUMM: A Unified Multimodal Model Codebase for Evaluation, Analysis, and Post-training
por: Luo, Yinyi, et al.
Publicado: (2026)
por: Luo, Yinyi, et al.
Publicado: (2026)
Cross-Lingual Transfer of Cultural Knowledge: An Asymmetric Phenomenon
por: Zhang, Chen, et al.
Publicado: (2025)
por: Zhang, Chen, et al.
Publicado: (2025)
Stiffness Evaluation of Multigirder Bridges Using Vision‐Based Displacement Measurement and an Iterative Algorithm
por: Yuyao Cheng, et al.
Publicado: (2026)
por: Yuyao Cheng, et al.
Publicado: (2026)
Towards Text-Image Interleaved Retrieval
por: Zhang, Xin, et al.
Publicado: (2025)
por: Zhang, Xin, et al.
Publicado: (2025)
A CLIP-based Uncertainty Modal Modeling (UMM) Framework for Pedestrian Re-Identification in Autonomous Driving
por: Li, Jialin, et al.
Publicado: (2025)
por: Li, Jialin, et al.
Publicado: (2025)
ManiGaussian: Dynamic Gaussian Splatting for Multi-task Robotic Manipulation
por: Lu, Guanxing, et al.
Publicado: (2024)
por: Lu, Guanxing, et al.
Publicado: (2024)
Global Context Compression with Interleaved Vision-Text Transformation
por: Jiao, Dian, et al.
Publicado: (2026)
por: Jiao, Dian, et al.
Publicado: (2026)
Refinement via Regeneration: Enlarging Modification Space Boosts Image Refinement in Unified Multimodal Models
por: Guo, Jiayi, et al.
Publicado: (2026)
por: Guo, Jiayi, et al.
Publicado: (2026)
Learning Video Context as Interleaved Multimodal Sequences
por: Lin, Kevin Qinghong, et al.
Publicado: (2024)
por: Lin, Kevin Qinghong, et al.
Publicado: (2024)
PromptEnhancer: A Simple Approach to Enhance Text-to-Image Models via Chain-of-Thought Prompt Rewriting
por: Wang, Linqing, et al.
Publicado: (2025)
por: Wang, Linqing, et al.
Publicado: (2025)
Ejemplares similares
-
Meta-CoT: Enhancing Granularity and Generalization in Image Editing
por: Zhang, Shiyi, et al.
Publicado: (2026) -
Re-Align: Structured Reasoning-guided Alignment for In-Context Image Generation and Editing
por: He, Runze, et al.
Publicado: (2026) -
LOGO: A Long-Form Video Dataset for Group Action Quality Assessment
por: Zhang, Shiyi, et al.
Publicado: (2024) -
JarvisEvo: Towards a Self-Evolving Photo Editing Agent with Synergistic Editor-Evaluator Optimization
por: Lin, Yunlong, et al.
Publicado: (2025) -
Ponder & Press: Advancing Visual GUI Agent towards General Computer Control
por: Wang, Yiqin, et al.
Publicado: (2024)