EMMA: Efficient Multimodal Understanding, Generation, and Editing with a Unified Architecture
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | He, Xin, Wei, Longhui, Ouyang, Jianbo, Liao, Minghui, Xie, Lingxi, Tian, Qi |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Incorporating Visual Experts to Resolve the Information Loss in Multimodal Large Language Models
par: He, Xin, et autres
Publié: (2024)
par: He, Xin, et autres
Publié: (2024)
Mixpert: Mitigating Multimodal Learning Conflicts with Efficient Mixture-of-Vision-Experts
par: He, Xin, et autres
Publié: (2025)
par: He, Xin, et autres
Publié: (2025)
PSR: Scaling Multi-Subject Personalized Image Generation with Pairwise Subject-Consistency Rewards
par: Wang, Shulei, et autres
Publié: (2025)
par: Wang, Shulei, et autres
Publié: (2025)
InternVL-U: Democratizing Unified Multimodal Models for Understanding, Reasoning, Generation and Editing
par: Tian, Changyao, et autres
Publié: (2026)
par: Tian, Changyao, et autres
Publié: (2026)
UniLiP: Adapting CLIP for Unified Multimodal Understanding, Generation and Editing
par: Tang, Hao, et autres
Publié: (2025)
par: Tang, Hao, et autres
Publié: (2025)
GaussianEditor: Editing 3D Gaussians Delicately with Text Instructions
par: Wang, Junjie, et autres
Publié: (2023)
par: Wang, Junjie, et autres
Publié: (2023)
Unified Personalized Understanding, Generating and Editing
par: Zhong, Yu, et autres
Publié: (2026)
par: Zhong, Yu, et autres
Publié: (2026)
LongVideo-R1: Smart Navigation for Low-cost Long Video Understanding
par: Qiu, Jihao, et autres
Publié: (2026)
par: Qiu, Jihao, et autres
Publié: (2026)
Efficient Multi-modal Long Context Learning for Training-free Adaptation
par: Ma, Zehong, et autres
Publié: (2025)
par: Ma, Zehong, et autres
Publié: (2025)
OmniMamba: Efficient and Unified Multimodal Understanding and Generation via State Space Models
par: Zou, Jialv, et autres
Publié: (2025)
par: Zou, Jialv, et autres
Publié: (2025)
Vidi: Large Multimodal Models for Video Understanding and Editing
par: Vidi Team, et autres
Publié: (2025)
par: Vidi Team, et autres
Publié: (2025)
Parameter Efficient Fine-tuning via Cross Block Orchestration for Segment Anything Model
par: Peng, Zelin, et autres
Publié: (2023)
par: Peng, Zelin, et autres
Publié: (2023)
UniVideo: Unified Understanding, Generation, and Editing for Videos
par: Wei, Cong, et autres
Publié: (2025)
par: Wei, Cong, et autres
Publié: (2025)
EMMA: Extracting Multiple physical parameters from Multimodal Data
par: Shaikh, Farhat, et autres
Publié: (2026)
par: Shaikh, Farhat, et autres
Publié: (2026)
Query-Kontext: An Unified Multimodal Model for Image Generation and Editing
par: Song, Yuxin, et autres
Publié: (2025)
par: Song, Yuxin, et autres
Publié: (2025)
Towards Generalized Multi-Image Editing for Unified Multimodal Models
par: Xu, Pengcheng, et autres
Publié: (2026)
par: Xu, Pengcheng, et autres
Publié: (2026)
SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture
par: Diao, Haiwen, et autres
Publié: (2026)
par: Diao, Haiwen, et autres
Publié: (2026)
Tele-Omni: a Unified Multimodal Framework for Video Generation and Editing
par: Liu, Jialun, et autres
Publié: (2026)
par: Liu, Jialun, et autres
Publié: (2026)
MagCache: Fast Video Generation with Magnitude-Aware Cache
par: Ma, Zehong, et autres
Publié: (2025)
par: Ma, Zehong, et autres
Publié: (2025)
UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding
par: Xu, Chenkai, et autres
Publié: (2025)
par: Xu, Chenkai, et autres
Publié: (2025)
Thinking with Camera: A Unified Multimodal Model for Camera-Centric Understanding and Generation
par: Liao, Kang, et autres
Publié: (2025)
par: Liao, Kang, et autres
Publié: (2025)
OVMR: Open-Vocabulary Recognition with Multi-Modal References
par: Ma, Zehong, et autres
Publié: (2024)
par: Ma, Zehong, et autres
Publié: (2024)
ChatterBox: Multi-round Multimodal Referring and Grounding
par: Tian, Yunjie, et autres
Publié: (2024)
par: Tian, Yunjie, et autres
Publié: (2024)
TextHawk: Exploring Efficient Fine-Grained Perception of Multimodal Large Language Models
par: Yu, Ya-Qi, et autres
Publié: (2024)
par: Yu, Ya-Qi, et autres
Publié: (2024)
MME-Unify: A Comprehensive Benchmark for Unified Multimodal Understanding and Generation Models
par: Xie, Wulin, et autres
Publié: (2025)
par: Xie, Wulin, et autres
Publié: (2025)
Harmonizing Visual Representations for Unified Multimodal Understanding and Generation
par: Wu, Size, et autres
Publié: (2025)
par: Wu, Size, et autres
Publié: (2025)
Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark
par: Hao, Yunzhuo, et autres
Publié: (2025)
par: Hao, Yunzhuo, et autres
Publié: (2025)
UM-Text: A Unified Multimodal Model for Image Understanding and Visual Text Editing
par: Ma, Lichen, et autres
Publié: (2026)
par: Ma, Lichen, et autres
Publié: (2026)
OpenEMMA: Open-Source Multimodal Model for End-to-End Autonomous Driving
par: Xing, Shuo, et autres
Publié: (2024)
par: Xing, Shuo, et autres
Publié: (2024)
EMMA: End-to-End Multimodal Model for Autonomous Driving
par: Hwang, Jyh-Jing, et autres
Publié: (2024)
par: Hwang, Jyh-Jing, et autres
Publié: (2024)
DriveSplat: Unified Neural Gaussian Reconstruction for Dynamic Driving Scenes
par: Wang, Cong, et autres
Publié: (2025)
par: Wang, Cong, et autres
Publié: (2025)
Hyper-Bagel: A Unified Acceleration Framework for Multimodal Understanding and Generation
par: Lu, Yanzuo, et autres
Publié: (2025)
par: Lu, Yanzuo, et autres
Publié: (2025)
Unified Reward Model for Multimodal Understanding and Generation
par: Wang, Yibin, et autres
Publié: (2025)
par: Wang, Yibin, et autres
Publié: (2025)
EMMA: Concept Erasure Benchmark with Comprehensive Semantic Metrics and Diverse Categories
par: Wei, Lu, et autres
Publié: (2025)
par: Wei, Lu, et autres
Publié: (2025)
GenArtist: Multimodal LLM as an Agent for Unified Image Generation and Editing
par: Wang, Zhenyu, et autres
Publié: (2024)
par: Wang, Zhenyu, et autres
Publié: (2024)
VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model
par: Zhuang, Xianwei, et autres
Publié: (2025)
par: Zhuang, Xianwei, et autres
Publié: (2025)
Few-step Flow for 3D Generation via Marginal-Data Transport Distillation
par: Zhou, Zanwei, et autres
Publié: (2025)
par: Zhou, Zanwei, et autres
Publié: (2025)
MammothModa2: A Unified AR-Diffusion Framework for Multimodal Understanding and Generation
par: Shen, Tao, et autres
Publié: (2025)
par: Shen, Tao, et autres
Publié: (2025)
Show-o: One Single Transformer to Unify Multimodal Understanding and Generation
par: Xie, Jinheng, et autres
Publié: (2024)
par: Xie, Jinheng, et autres
Publié: (2024)
AnyPhoto: Multi-Person Identity Preserving Image Generation with ID Adaptive Modulation on Location Canvas
par: Yuan, Longhui
Publié: (2026)
par: Yuan, Longhui
Publié: (2026)
Documents similaires
-
Incorporating Visual Experts to Resolve the Information Loss in Multimodal Large Language Models
par: He, Xin, et autres
Publié: (2024) -
Mixpert: Mitigating Multimodal Learning Conflicts with Efficient Mixture-of-Vision-Experts
par: He, Xin, et autres
Publié: (2025) -
PSR: Scaling Multi-Subject Personalized Image Generation with Pairwise Subject-Consistency Rewards
par: Wang, Shulei, et autres
Publié: (2025) -
InternVL-U: Democratizing Unified Multimodal Models for Understanding, Reasoning, Generation and Editing
par: Tian, Changyao, et autres
Publié: (2026) -
UniLiP: Adapting CLIP for Unified Multimodal Understanding, Generation and Editing
par: Tang, Hao, et autres
Publié: (2025)