GEMS: Agent-Native Multimodal Generation with Memory and Skills
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | He, Zefeng, Huang, Siyuan, Qu, Xiaoye, Li, Yafu, Zhu, Tong, Cheng, Yu, Yang, Yang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
DiffThinker: Towards Generative Multimodal Reasoning with Diffusion Models
von: He, Zefeng, et al.
Veröffentlicht: (2025)
von: He, Zefeng, et al.
Veröffentlicht: (2025)
Spotlight on Token Perception for Multimodal Reinforcement Learning
von: Huang, Siyuan, et al.
Veröffentlicht: (2025)
von: Huang, Siyuan, et al.
Veröffentlicht: (2025)
VideoSSR: Video Self-Supervised Reinforcement Learning
von: He, Zefeng, et al.
Veröffentlicht: (2025)
von: He, Zefeng, et al.
Veröffentlicht: (2025)
FrameThinker: Learning to Think with Long Videos via Multi-Turn Frame Spotlighting
von: He, Zefeng, et al.
Veröffentlicht: (2025)
von: He, Zefeng, et al.
Veröffentlicht: (2025)
Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs
von: Huang, Siyuan, et al.
Veröffentlicht: (2026)
von: Huang, Siyuan, et al.
Veröffentlicht: (2026)
CLIP-MoE: Towards Building Mixture of Experts for CLIP with Diversified Multiplet Upcycling
von: Zhang, Jihai, et al.
Veröffentlicht: (2024)
von: Zhang, Jihai, et al.
Veröffentlicht: (2024)
AnySkill: Learning Open-Vocabulary Physical Skill for Interactive Agents
von: Cui, Jieming, et al.
Veröffentlicht: (2024)
von: Cui, Jieming, et al.
Veröffentlicht: (2024)
LatentMem: Customizing Latent Memory for Multi-Agent Systems
von: Fu, Muxin, et al.
Veröffentlicht: (2026)
von: Fu, Muxin, et al.
Veröffentlicht: (2026)
SATORI-R1: Incentivizing Multimodal Reasoning through Explicit Visual Anchoring
von: Shen, Chuming, et al.
Veröffentlicht: (2025)
von: Shen, Chuming, et al.
Veröffentlicht: (2025)
Advancing Multimodal Reasoning: From Optimized Cold Start to Staged Reinforcement Learning
von: Chen, Shuang, et al.
Veröffentlicht: (2025)
von: Chen, Shuang, et al.
Veröffentlicht: (2025)
Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning
von: Liao, Xinyao, et al.
Veröffentlicht: (2025)
von: Liao, Xinyao, et al.
Veröffentlicht: (2025)
MMA: Multimodal Memory Agent
von: Lu, Yihao, et al.
Veröffentlicht: (2026)
von: Lu, Yihao, et al.
Veröffentlicht: (2026)
A Survey of Attacks on Large Vision-Language Models: Resources, Advances, and Future Trends
von: Liu, Daizong, et al.
Veröffentlicht: (2024)
von: Liu, Daizong, et al.
Veröffentlicht: (2024)
VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation
von: Liao, Xinyao, et al.
Veröffentlicht: (2026)
von: Liao, Xinyao, et al.
Veröffentlicht: (2026)
GLM-5V-Turbo: Toward a Native Foundation Model for Multimodal Agents
von: V Team, et al.
Veröffentlicht: (2026)
von: V Team, et al.
Veröffentlicht: (2026)
ExFusion: Efficient Transformer Training via Multi-Experts Fusion
von: Ruan, Jiacheng, et al.
Veröffentlicht: (2026)
von: Ruan, Jiacheng, et al.
Veröffentlicht: (2026)
SkyNative: A Native Multimodal Framework for Remote Sensing Visual Evidence Reasoning
von: Yang, Xiao, et al.
Veröffentlicht: (2026)
von: Yang, Xiao, et al.
Veröffentlicht: (2026)
VisionGPT: Vision-Language Understanding Agent Using Generalized Multimodal Framework
von: Kelly, Chris, et al.
Veröffentlicht: (2024)
von: Kelly, Chris, et al.
Veröffentlicht: (2024)
Aria: An Open Multimodal Native Mixture-of-Experts Model
von: Li, Dongxu, et al.
Veröffentlicht: (2024)
von: Li, Dongxu, et al.
Veröffentlicht: (2024)
Native Audio-Visual Alignment for Generation
von: Ji, Longbin, et al.
Veröffentlicht: (2026)
von: Ji, Longbin, et al.
Veröffentlicht: (2026)
Thinking with Images for Multimodal Reasoning: Foundations, Methods, and Future Frontiers
von: Su, Zhaochen, et al.
Veröffentlicht: (2025)
von: Su, Zhaochen, et al.
Veröffentlicht: (2025)
From Head to Tail: Towards Balanced Representation in Large Vision-Language Models through Adaptive Data Calibration
von: Song, Mingyang, et al.
Veröffentlicht: (2025)
von: Song, Mingyang, et al.
Veröffentlicht: (2025)
Look, Compare, Decide: Alleviating Hallucination in Large Vision-Language Models via Multi-View Multi-Path Reasoning
von: Qu, Xiaoye, et al.
Veröffentlicht: (2024)
von: Qu, Xiaoye, et al.
Veröffentlicht: (2024)
Toward Native Multimodal Modeling: A Roadmap
von: An, Siyu, et al.
Veröffentlicht: (2026)
von: An, Siyu, et al.
Veröffentlicht: (2026)
AtlasVA: Self-Evolving Visual Skill Memory for Teacher-Free VLM Agents
von: Wang, Pan, et al.
Veröffentlicht: (2026)
von: Wang, Pan, et al.
Veröffentlicht: (2026)
Ag2Manip: Learning Novel Manipulation Skills with Agent-Agnostic Visual and Action Representations
von: Li, Puhao, et al.
Veröffentlicht: (2024)
von: Li, Puhao, et al.
Veröffentlicht: (2024)
Flash-DMD: Towards High-Fidelity Few-Step Image Generation with Efficient Distillation and Joint Reinforcement Learning
von: Chen, Guanjie, et al.
Veröffentlicht: (2025)
von: Chen, Guanjie, et al.
Veröffentlicht: (2025)
GROVE: A Generalized Reward for Learning Open-Vocabulary Physical Skill
von: Cui, Jieming, et al.
Veröffentlicht: (2025)
von: Cui, Jieming, et al.
Veröffentlicht: (2025)
Show-o2: Improved Native Unified Multimodal Models
von: Xie, Jinheng, et al.
Veröffentlicht: (2025)
von: Xie, Jinheng, et al.
Veröffentlicht: (2025)
VideoAgent: A Memory-augmented Multimodal Agent for Video Understanding
von: Fan, Yue, et al.
Veröffentlicht: (2024)
von: Fan, Yue, et al.
Veröffentlicht: (2024)
Seeing, Listening, Remembering, and Reasoning: A Multimodal Agent with Long-Term Memory
von: Long, Lin, et al.
Veröffentlicht: (2025)
von: Long, Lin, et al.
Veröffentlicht: (2025)
SURf: Teaching Large Vision-Language Models to Selectively Utilize Retrieved Information
von: Sun, Jiashuo, et al.
Veröffentlicht: (2024)
von: Sun, Jiashuo, et al.
Veröffentlicht: (2024)
Towards Stabilized and Efficient Diffusion Transformers through Long-Skip-Connections with Spectral Constraints
von: Chen, Guanjie, et al.
Veröffentlicht: (2024)
von: Chen, Guanjie, et al.
Veröffentlicht: (2024)
ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding
von: Ye, Junliang, et al.
Veröffentlicht: (2025)
von: Ye, Junliang, et al.
Veröffentlicht: (2025)
EMemBench: Interactive Benchmarking of Episodic Memory for VLM Agents
von: Li, Xinze, et al.
Veröffentlicht: (2026)
von: Li, Xinze, et al.
Veröffentlicht: (2026)
Emu3.5: Native Multimodal Models are World Learners
von: Cui, Yufeng, et al.
Veröffentlicht: (2025)
von: Cui, Yufeng, et al.
Veröffentlicht: (2025)
Memory-Augmented Incomplete Multimodal Survival Prediction via Cross-Slide and Gene-Attentive Hypergraph Learning
von: Qu, Mingcheng, et al.
Veröffentlicht: (2025)
von: Qu, Mingcheng, et al.
Veröffentlicht: (2025)
PresentAgent: Multimodal Agent for Presentation Video Generation
von: Shi, Jingwei, et al.
Veröffentlicht: (2025)
von: Shi, Jingwei, et al.
Veröffentlicht: (2025)
CLEAR: Unlocking Generative Potential for Degraded Image Understanding in Unified Multimodal Models
von: Hao, Xiangzhao, et al.
Veröffentlicht: (2026)
von: Hao, Xiangzhao, et al.
Veröffentlicht: (2026)
LoRASculpt: Sculpting LoRA for Harmonizing General and Specialized Knowledge in Multimodal Large Language Models
von: Liang, Jian, et al.
Veröffentlicht: (2025)
von: Liang, Jian, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
DiffThinker: Towards Generative Multimodal Reasoning with Diffusion Models
von: He, Zefeng, et al.
Veröffentlicht: (2025) -
Spotlight on Token Perception for Multimodal Reinforcement Learning
von: Huang, Siyuan, et al.
Veröffentlicht: (2025) -
VideoSSR: Video Self-Supervised Reinforcement Learning
von: He, Zefeng, et al.
Veröffentlicht: (2025) -
FrameThinker: Learning to Think with Long Videos via Multi-Turn Frame Spotlighting
von: He, Zefeng, et al.
Veröffentlicht: (2025) -
Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs
von: Huang, Siyuan, et al.
Veröffentlicht: (2026)