AEGIS: Exploring the Limit of World Knowledge Capabilities for Unified Mulitmodal Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lin, Jintao, Dong, Bowen, Shi, Weikang, Lei, Chenyang, Zhang, Suiyun, Liu, Rui, Liu, Xihui |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
V2PE: Improving Multimodal Long-Context Capability of Vision-Language Models with Variable Visual Position Encoding
par: Ge, Junqi, et autres
Publié: (2024)
par: Ge, Junqi, et autres
Publié: (2024)
Disentangling Instruction Influence in Diffusion Transformers for Parallel Multi-Instruction-Guided Image Editing
par: Liu, Hui, et autres
Publié: (2025)
par: Liu, Hui, et autres
Publié: (2025)
MultiWorld: Scalable Multi-Agent Multi-View Video World Models
par: Wu, Haoyu, et autres
Publié: (2026)
par: Wu, Haoyu, et autres
Publié: (2026)
WorldArena: A Unified Benchmark for Evaluating Perception and Functional Utility of Embodied World Models
par: Shang, Yu, et autres
Publié: (2026)
par: Shang, Yu, et autres
Publié: (2026)
World Guidance: World Modeling in Condition Space for Action Generation
par: Su, Yue, et autres
Publié: (2026)
par: Su, Yue, et autres
Publié: (2026)
GenArtist: Multimodal LLM as an Agent for Unified Image Generation and Editing
par: Wang, Zhenyu, et autres
Publié: (2024)
par: Wang, Zhenyu, et autres
Publié: (2024)
WorldSimBench: Towards Video Generation Models as World Simulators
par: Qin, Yiran, et autres
Publié: (2024)
par: Qin, Yiran, et autres
Publié: (2024)
OST-Bench: Evaluating the Capabilities of MLLMs in Online Spatio-temporal Scene Understanding
par: Lin, Jingli, et autres
Publié: (2025)
par: Lin, Jingli, et autres
Publié: (2025)
RSCaMa: Remote Sensing Image Change Captioning with State Space Model
par: Liu, Chenyang, et autres
Publié: (2024)
par: Liu, Chenyang, et autres
Publié: (2024)
RSRefSeg 2: Decoupling Referring Remote Sensing Image Segmentation with Foundation Models
par: Chen, Keyan, et autres
Publié: (2025)
par: Chen, Keyan, et autres
Publié: (2025)
MMMamba: A Versatile Cross-Modal In Context Fusion Framework for Pan-Sharpening and Zero-Shot Image Enhancement
par: Wang, Yingying, et autres
Publié: (2025)
par: Wang, Yingying, et autres
Publié: (2025)
RSMamba: Remote Sensing Image Classification with State Space Model
par: Chen, Keyan, et autres
Publié: (2024)
par: Chen, Keyan, et autres
Publié: (2024)
GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing
par: Fang, Rongyao, et autres
Publié: (2025)
par: Fang, Rongyao, et autres
Publié: (2025)
AEGIS: Anchor-Enforced Gradient Isolation for Knowledge-Preserving Vision-Language-Action Fine-Tuning
par: Singh, Guransh
Publié: (2026)
par: Singh, Guransh
Publié: (2026)
AEGIS: Authenticity Evaluation Benchmark for AI-Generated Video Sequences
par: Li, Jieyu, et autres
Publié: (2025)
par: Li, Jieyu, et autres
Publié: (2025)
Personalized Text-to-Image Generation with Auto-Regressive Models
par: Sun, Kaiyue, et autres
Publié: (2025)
par: Sun, Kaiyue, et autres
Publié: (2025)
MR-GDINO: Efficient Open-World Continual Object Detection
par: Dong, Bowen, et autres
Publié: (2024)
par: Dong, Bowen, et autres
Publié: (2024)
StoryWeaver: A Unified World Model for Knowledge-Enhanced Story Character Customization
par: Zhang, Jinlu, et autres
Publié: (2024)
par: Zhang, Jinlu, et autres
Publié: (2024)
TaCo: Capturing Spatio-Temporal Semantic Consistency in Remote Sensing Change Detection
par: Guo, Han, et autres
Publié: (2025)
par: Guo, Han, et autres
Publié: (2025)
SimMAT: Exploring Transferability from Vision Foundation Models to Any Image Modality
par: Lei, Chenyang, et autres
Publié: (2024)
par: Lei, Chenyang, et autres
Publié: (2024)
Representation Forcing for Bottleneck-Free Unified Multimodal Models
par: Wang, Yuqing, et autres
Publié: (2026)
par: Wang, Yuqing, et autres
Publié: (2026)
AEGIS: A Holistic Benchmark for Evaluating Forensic Analysis of AI-Generated Academic Images
par: Zhang, Bo, et autres
Publié: (2026)
par: Zhang, Bo, et autres
Publié: (2026)
Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model
par: Liu, Chenyang, et autres
Publié: (2025)
par: Liu, Chenyang, et autres
Publié: (2025)
Exploring Scalable Unified Modeling for General Low-Level Vision
par: Chen, Xiangyu, et autres
Publié: (2025)
par: Chen, Xiangyu, et autres
Publié: (2025)
ScanReason: Empowering 3D Visual Grounding with Reasoning Capabilities
par: Zhu, Chenming, et autres
Publié: (2024)
par: Zhu, Chenming, et autres
Publié: (2024)
Large Motion Model for Unified Multi-Modal Motion Generation
par: Zhang, Mingyuan, et autres
Publié: (2024)
par: Zhang, Mingyuan, et autres
Publié: (2024)
MetaEarth3D: Unlocking World-scale 3D Generation with Spatially Scalable Generative Modeling
par: Cao, Jinqi, et autres
Publié: (2026)
par: Cao, Jinqi, et autres
Publié: (2026)
MBench: A Comprehensive Benchmark on Memory Capability for Video World Models
par: Zhang, Shengjun, et autres
Publié: (2026)
par: Zhang, Shengjun, et autres
Publié: (2026)
DynamicVis: Dynamic Visual Perception for Efficient Remote Sensing Foundation Models
par: Chen, Keyan, et autres
Publié: (2025)
par: Chen, Keyan, et autres
Publié: (2025)
DreamWorld: Unified World Modeling in Video Generation
par: Tan, Boming, et autres
Publié: (2026)
par: Tan, Boming, et autres
Publié: (2026)
START: A Generalized State Space Model with Saliency-Driven Token-Aware Transformation
par: Guo, Jintao, et autres
Publié: (2024)
par: Guo, Jintao, et autres
Publié: (2024)
PUMA: Empowering Unified MLLM with Multi-granular Visual Generation
par: Fang, Rongyao, et autres
Publié: (2024)
par: Fang, Rongyao, et autres
Publié: (2024)
Research on World Models Is Not Merely Injecting World Knowledge into Specific Tasks
par: Zeng, Bohan, et autres
Publié: (2026)
par: Zeng, Bohan, et autres
Publié: (2026)
WorldMark: A Unified Benchmark Suite for Interactive Video World Models
par: Xu, Xiaojie, et autres
Publié: (2026)
par: Xu, Xiaojie, et autres
Publié: (2026)
Distilling Temporal Knowledge with Masked Feature Reconstruction for 3D Object Detection
par: Zheng, Haowen, et autres
Publié: (2024)
par: Zheng, Haowen, et autres
Publié: (2024)
Pusa V1.0: Unlocking Temporal Control in Pretrained Video Diffusion Models via Vectorized Timestep Adaptation
par: Liu, Yaofang, et autres
Publié: (2025)
par: Liu, Yaofang, et autres
Publié: (2025)
UMG-CLIP: A Unified Multi-Granularity Vision Generalist for Open-World Understanding
par: Shi, Bowen, et autres
Publié: (2024)
par: Shi, Bowen, et autres
Publié: (2024)
DriveX: Omni Scene Modeling for Learning Generalizable World Knowledge in Autonomous Driving
par: Shi, Chen, et autres
Publié: (2025)
par: Shi, Chen, et autres
Publié: (2025)
Can Vision-Language Models Think from the Sky? Unifying UAV Reasoning and Generation
par: Sun, Jintao, et autres
Publié: (2026)
par: Sun, Jintao, et autres
Publié: (2026)
World-Shaper: A Unified Framework for 360° Panoramic Editing
par: Liang, Dong, et autres
Publié: (2026)
par: Liang, Dong, et autres
Publié: (2026)
Documents similaires
-
V2PE: Improving Multimodal Long-Context Capability of Vision-Language Models with Variable Visual Position Encoding
par: Ge, Junqi, et autres
Publié: (2024) -
Disentangling Instruction Influence in Diffusion Transformers for Parallel Multi-Instruction-Guided Image Editing
par: Liu, Hui, et autres
Publié: (2025) -
MultiWorld: Scalable Multi-Agent Multi-View Video World Models
par: Wu, Haoyu, et autres
Publié: (2026) -
WorldArena: A Unified Benchmark for Evaluating Perception and Functional Utility of Embodied World Models
par: Shang, Yu, et autres
Publié: (2026) -
World Guidance: World Modeling in Condition Space for Action Generation
par: Su, Yue, et autres
Publié: (2026)