DreamLLM: Synergistic Multimodal Comprehension and Creation
Fuente:
arXiv
Saved in:
| Main Authors: | Dong, Runpei, Han, Chunrui, Peng, Yuang, Qi, Zekun, Ge, Zheng, Yang, Jinrong, Zhao, Liang, Sun, Jianjian, Zhou, Hongyu, Wei, Haoran, Kong, Xiangwen, Zhang, Xiangyu, Ma, Kaisheng, Yi, Li |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Exploring Recurrent Long-term Temporal Fusion for Multi-view 3D Perception
by: Han, Chunrui, et al.
Published: (2023)
by: Han, Chunrui, et al.
Published: (2023)
ShapeLLM: Universal 3D Object Understanding for Embodied Interaction
by: Qi, Zekun, et al.
Published: (2024)
by: Qi, Zekun, et al.
Published: (2024)
DreamBench++: A Human-Aligned Benchmark for Personalized Image Generation
by: Peng, Yuang, et al.
Published: (2024)
by: Peng, Yuang, et al.
Published: (2024)
Perception in Reflection
by: Wei, Yana, et al.
Published: (2025)
by: Wei, Yana, et al.
Published: (2025)
General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model
by: Wei, Haoran, et al.
Published: (2024)
by: Wei, Haoran, et al.
Published: (2024)
DreamLLM-3D: Affective Dream Reliving using Large Language Model and 3D Generative AI
by: Liu, Pinyao, et al.
Published: (2025)
by: Liu, Pinyao, et al.
Published: (2025)
Small Language Model Meets with Reinforced Vision Vocabulary
by: Wei, Haoran, et al.
Published: (2024)
by: Wei, Haoran, et al.
Published: (2024)
OneChart: Purify the Chart Structural Extraction via One Auxiliary Token
by: Chen, Jinyue, et al.
Published: (2024)
by: Chen, Jinyue, et al.
Published: (2024)
DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge
by: Zhang, Wenyao, et al.
Published: (2025)
by: Zhang, Wenyao, et al.
Published: (2025)
Focus Anywhere for Fine-grained Multi-page Document Understanding
by: Liu, Chenglong, et al.
Published: (2024)
by: Liu, Chenglong, et al.
Published: (2024)
Perception-R1: Pioneering Perception Policy with Reinforcement Learning
by: Yu, En, et al.
Published: (2025)
by: Yu, En, et al.
Published: (2025)
Positional Prompt Tuning for Efficient 3D Representation Learning
by: Zhang, Shaochen, et al.
Published: (2024)
by: Zhang, Shaochen, et al.
Published: (2024)
Open Vision Reasoner: Transferring Linguistic Cognitive Behavior for Visual Reasoning
by: Wei, Yana, et al.
Published: (2025)
by: Wei, Yana, et al.
Published: (2025)
Merlin:Empowering Multimodal LLMs with Foresight Minds
by: Yu, En, et al.
Published: (2023)
by: Yu, En, et al.
Published: (2023)
Taming Teacher Forcing for Masked Autoregressive Video Generation
by: Zhou, Deyu, et al.
Published: (2025)
by: Zhou, Deyu, et al.
Published: (2025)
DreamScape: 3D Scene Creation via Gaussian Splatting joint Correlation Modeling
by: Zhao, Yueming, et al.
Published: (2024)
by: Zhao, Yueming, et al.
Published: (2024)
Preference-Aware Memory Update for Long-Term LLM Agents
by: Sun, Haoran, et al.
Published: (2025)
by: Sun, Haoran, et al.
Published: (2025)
Slow Perception: Let's Perceive Geometric Figures Step-by-step
by: Wei, Haoran, et al.
Published: (2024)
by: Wei, Haoran, et al.
Published: (2024)
Unhackable Temporal Rewarding for Scalable Video MLLMs
by: Yu, En, et al.
Published: (2025)
by: Yu, En, et al.
Published: (2025)
ULTRA: Unified Multimodal Control for Autonomous Humanoid Whole-Body Loco-Manipulation
by: He, Xialin, et al.
Published: (2026)
by: He, Xialin, et al.
Published: (2026)
SketchPlay: Intuitive Creation of Physically Realistic VR Content with Gesture-Driven Sketching
by: Zhang, Xiangwen, et al.
Published: (2025)
by: Zhang, Xiangwen, et al.
Published: (2025)
DGAE: Diffusion-Guided Autoencoder for Efficient Latent Representation Learning
by: Liu, Dongxu, et al.
Published: (2025)
by: Liu, Dongxu, et al.
Published: (2025)
Learning Humanoid End-Effector Control for Open-Vocabulary Visual Loco-Manipulation
by: Dong, Runpei, et al.
Published: (2026)
by: Dong, Runpei, et al.
Published: (2026)
LLM-REVal: Can We Trust LLM Reviewers Yet?
by: Li, Rui, et al.
Published: (2025)
by: Li, Rui, et al.
Published: (2025)
PerPO: Perceptual Preference Optimization via Discriminative Rewarding
by: Zhu, Zining, et al.
Published: (2025)
by: Zhu, Zining, et al.
Published: (2025)
Thinking by Doing: Building Efficient World Model Reasoning in LLMs via Multi-turn Interaction
by: Shu, Bao, et al.
Published: (2025)
by: Shu, Bao, et al.
Published: (2025)
Multimodal Long Video Modeling Based on Temporal Dynamic Context
by: Hao, Haoran, et al.
Published: (2025)
by: Hao, Haoran, et al.
Published: (2025)
DreamGaussian: Generative Gaussian Splatting for Efficient 3D Content Creation
by: Tang, Jiaxiang, et al.
Published: (2023)
by: Tang, Jiaxiang, et al.
Published: (2023)
Cross-Cultural Communication in the Digital Age: An Analysis of Cultural Representation and Inclusivity in Emojis
by: Li, Lingfeng, et al.
Published: (2024)
by: Li, Lingfeng, et al.
Published: (2024)
DreamArtist++: Controllable One-Shot Text-to-Image Generation via Positive-Negative Adapter
by: Dong, Ziyi, et al.
Published: (2022)
by: Dong, Ziyi, et al.
Published: (2022)
Multimodal ArXiv: A Dataset for Improving Scientific Comprehension of Large Vision-Language Models
by: Li, Lei, et al.
Published: (2024)
by: Li, Lei, et al.
Published: (2024)
Multimodal Representation Learning Techniques for Comprehensive Facial State Analysis
by: Zheng, Kaiwen, et al.
Published: (2025)
by: Zheng, Kaiwen, et al.
Published: (2025)
Improving Transferable Targeted Attacks with Feature Tuning Mixup
by: Liang, Kaisheng, et al.
Published: (2024)
by: Liang, Kaisheng, et al.
Published: (2024)
Dream360: Diverse and Immersive Outdoor Virtual Scene Creation via Transformer-Based 360 Image Outpainting
by: Ai, Hao, et al.
Published: (2024)
by: Ai, Hao, et al.
Published: (2024)
AdvDiff: Generating Unrestricted Adversarial Examples using Diffusion Models
by: Dai, Xuelong, et al.
Published: (2023)
by: Dai, Xuelong, et al.
Published: (2023)
UV-Attack: Physical-World Adversarial Attacks for Person Detection via Dynamic-NeRF-based UV Mapping
by: Li, Yanjie, et al.
Published: (2025)
by: Li, Yanjie, et al.
Published: (2025)
MemBench: Towards More Comprehensive Evaluation on the Memory of LLM-based Agents
by: Tan, Haoran, et al.
Published: (2025)
by: Tan, Haoran, et al.
Published: (2025)
SoFar: Language-Grounded Orientation Bridges Spatial Reasoning and Object Manipulation
by: Qi, Zekun, et al.
Published: (2025)
by: Qi, Zekun, et al.
Published: (2025)
A Novel Self-Evolution Framework for Large Language Models
by: Sun, Haoran, et al.
Published: (2025)
by: Sun, Haoran, et al.
Published: (2025)
DreamOmni2: Multimodal Instruction-based Editing and Generation
by: Xia, Bin, et al.
Published: (2025)
by: Xia, Bin, et al.
Published: (2025)
Similar Items
-
Exploring Recurrent Long-term Temporal Fusion for Multi-view 3D Perception
by: Han, Chunrui, et al.
Published: (2023) -
ShapeLLM: Universal 3D Object Understanding for Embodied Interaction
by: Qi, Zekun, et al.
Published: (2024) -
DreamBench++: A Human-Aligned Benchmark for Personalized Image Generation
by: Peng, Yuang, et al.
Published: (2024) -
Perception in Reflection
by: Wei, Yana, et al.
Published: (2025) -
General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model
by: Wei, Haoran, et al.
Published: (2024)