OmniNova:A General Multimodal Agent Framework
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Du, Pengfei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Memory for Autonomous LLM Agents:Mechanisms, Evaluation, and Emerging Frontiers
par: Du, Pengfei
Publié: (2026)
par: Du, Pengfei
Publié: (2026)
Omni-SimpleMem: Autoresearch-Guided Discovery of Lifelong Multimodal Agent Memory
par: Liu, Jiaqi, et autres
Publié: (2026)
par: Liu, Jiaqi, et autres
Publié: (2026)
Lumina-OmniLV: A Unified Multimodal Framework for General Low-Level Vision
par: Pu, Yuandong, et autres
Publié: (2025)
par: Pu, Yuandong, et autres
Publié: (2025)
Omni-R1: Towards the Unified Generative Paradigm for Multimodal Reasoning
par: Cheng, Dongjie, et autres
Publié: (2026)
par: Cheng, Dongjie, et autres
Publié: (2026)
OmniTrace: A Unified Framework for Generation-Time Attribution in Omni-Modal LLMs
par: Yan, Qianqi, et autres
Publié: (2026)
par: Yan, Qianqi, et autres
Publié: (2026)
A Multimodal Multi-Agent Framework for Radiology Report Generation
par: Yi, Ziruo, et autres
Publié: (2025)
par: Yi, Ziruo, et autres
Publié: (2025)
OmniDPO: A Preference Optimization Framework to Address Omni-Modal Hallucination
par: Chen, Junzhe, et autres
Publié: (2025)
par: Chen, Junzhe, et autres
Publié: (2025)
OmniGen2: Towards Instruction-Aligned Multimodal Generation
par: Wu, Chenyuan, et autres
Publié: (2025)
par: Wu, Chenyuan, et autres
Publié: (2025)
Ming-Flash-Omni: A Sparse, Unified Architecture for Multimodal Perception and Generation
par: AI, Inclusion, et autres
Publié: (2025)
par: AI, Inclusion, et autres
Publié: (2025)
OmniGUI: Benchmarking GUI Agents in Omni-Modal Smartphone Environments
par: Henry, Felix, et autres
Publié: (2026)
par: Henry, Felix, et autres
Publié: (2026)
Mind-Omni: A Unified Multi-Task Framework for Brain-Vision-Language Modeling via Discrete Diffusion
par: Lu, Yizhuo, et autres
Publié: (2026)
par: Lu, Yizhuo, et autres
Publié: (2026)
Agent-Omni: Test-Time Multimodal Reasoning via Model Coordination for Understanding Anything
par: Lin, Huawei, et autres
Publié: (2025)
par: Lin, Huawei, et autres
Publié: (2025)
OmniFuser: Adaptive Multimodal Fusion for Service-Oriented Predictive Maintenance
par: Wang, Ziqi, et autres
Publié: (2025)
par: Wang, Ziqi, et autres
Publié: (2025)
OmniCam: Unified Multimodal Video Generation via Camera Control
par: Yang, Xiaoda, et autres
Publié: (2025)
par: Yang, Xiaoda, et autres
Publié: (2025)
HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation
par: Xiao, Yicheng, et autres
Publié: (2025)
par: Xiao, Yicheng, et autres
Publié: (2025)
OmniPlay: Benchmarking Omni-Modal Models on Omni-Modal Game Playing
par: Bie, Fuqing, et autres
Publié: (2025)
par: Bie, Fuqing, et autres
Publié: (2025)
OmniDiT: Extending Diffusion Transformer to Omni-VTON Framework
par: Zeng, Weixuan, et autres
Publié: (2026)
par: Zeng, Weixuan, et autres
Publié: (2026)
OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks
par: Wang, Jiayu, et autres
Publié: (2025)
par: Wang, Jiayu, et autres
Publié: (2025)
DEMENTIA-PLAN: An Agent-Based Framework for Multi-Knowledge Graph Retrieval-Augmented Generation in Dementia Care
par: Song, Yutong, et autres
Publié: (2025)
par: Song, Yutong, et autres
Publié: (2025)
Omni-AutoThink: Adaptive Multimodal Reasoning via Reinforcement Learning
par: Yang, Dongchao, et autres
Publié: (2025)
par: Yang, Dongchao, et autres
Publié: (2025)
Terra Nova: A Comprehensive Challenge Environment for Intelligent Agents
par: McInroe, Trevor
Publié: (2025)
par: McInroe, Trevor
Publié: (2025)
OpenOmni: A Collaborative Open Source Tool for Building Future-Ready Multimodal Conversational Agents
par: Sun, Qiang, et autres
Publié: (2024)
par: Sun, Qiang, et autres
Publié: (2024)
AutoAgents: A Framework for Automatic Agent Generation
par: Chen, Guangyao, et autres
Publié: (2023)
par: Chen, Guangyao, et autres
Publié: (2023)
OmniGeo: Towards a Multimodal Large Language Models for Geospatial Artificial Intelligence
par: Yuan, Long, et autres
Publié: (2025)
par: Yuan, Long, et autres
Publié: (2025)
Beyond Description: A Multimodal Agent Framework for Insightful Chart Summarization
par: Bai, Yuhang, et autres
Publié: (2026)
par: Bai, Yuhang, et autres
Publié: (2026)
A Unified Multi-Agent Framework for Universal Multimodal Understanding and Generation
par: Li, Jiulin, et autres
Publié: (2025)
par: Li, Jiulin, et autres
Publié: (2025)
TOBench: A Task-Oriented Omni-Modal Benchmark for Real-World Tool-Using Agents
par: Liu, Zhiqiang, et autres
Publié: (2026)
par: Liu, Zhiqiang, et autres
Publié: (2026)
PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training
par: Du, Pengfei
Publié: (2025)
par: Du, Pengfei
Publié: (2025)
AEGIS: An Agent-based Framework for General Bug Reproduction from Issue Descriptions
par: Wang, Xinchen, et autres
Publié: (2024)
par: Wang, Xinchen, et autres
Publié: (2024)
OmniFusion: Simultaneous Multilingual Multimodal Translations via Modular Fusion
par: Koneru, Sai, et autres
Publié: (2025)
par: Koneru, Sai, et autres
Publié: (2025)
SocialOmni: Benchmarking Audio-Visual Social Interactivity in Omni Models
par: Xie, Tianyu, et autres
Publié: (2026)
par: Xie, Tianyu, et autres
Publié: (2026)
ImAgent: A Unified Multimodal Agent Framework for Test-Time Scalable Image Generation
par: Wang, Kaishen, et autres
Publié: (2025)
par: Wang, Kaishen, et autres
Publié: (2025)
MAGMA-Edu: Multi-Agent Generative Multimodal Framework for Text-Diagram Educational Question Generation
par: Wu, Zhenyu, et autres
Publié: (2025)
par: Wu, Zhenyu, et autres
Publié: (2025)
OmniMatBench: A Human-Calibrated Multimodal Reasoning Benchmark Across 19 Materials Science Subfields
par: Liu, Wanhao, et autres
Publié: (2026)
par: Liu, Wanhao, et autres
Publié: (2026)
OmniResponse: Online Multimodal Conversational Response Generation in Dyadic Interactions
par: Luo, Cheng, et autres
Publié: (2025)
par: Luo, Cheng, et autres
Publié: (2025)
Owl-1: Omni World Model for Consistent Long Video Generation
par: Huang, Yuanhui, et autres
Publié: (2024)
par: Huang, Yuanhui, et autres
Publié: (2024)
MMRole: A Comprehensive Framework for Developing and Evaluating Multimodal Role-Playing Agents
par: Dai, Yanqi, et autres
Publié: (2024)
par: Dai, Yanqi, et autres
Publié: (2024)
STaR-Attack: A Spatio-Temporal and Narrative Reasoning Attack Framework for Unified Multimodal Understanding and Generation Models
par: Guo, Shaoxiong, et autres
Publié: (2025)
par: Guo, Shaoxiong, et autres
Publié: (2025)
Omni-Reward: Towards Generalist Omni-Modal Reward Modeling with Free-Form Preferences
par: Jin, Zhuoran, et autres
Publié: (2025)
par: Jin, Zhuoran, et autres
Publié: (2025)
OmniVideoBench: Towards Audio-Visual Understanding Evaluation for Omni MLLMs
par: Li, Caorui, et autres
Publié: (2025)
par: Li, Caorui, et autres
Publié: (2025)
Documents similaires
-
Memory for Autonomous LLM Agents:Mechanisms, Evaluation, and Emerging Frontiers
par: Du, Pengfei
Publié: (2026) -
Omni-SimpleMem: Autoresearch-Guided Discovery of Lifelong Multimodal Agent Memory
par: Liu, Jiaqi, et autres
Publié: (2026) -
Lumina-OmniLV: A Unified Multimodal Framework for General Low-Level Vision
par: Pu, Yuandong, et autres
Publié: (2025) -
Omni-R1: Towards the Unified Generative Paradigm for Multimodal Reasoning
par: Cheng, Dongjie, et autres
Publié: (2026) -
OmniTrace: A Unified Framework for Generation-Time Attribution in Omni-Modal LLMs
par: Yan, Qianqi, et autres
Publié: (2026)