Octopus v3: Technical Report for On-device Sub-billion Multimodal AI Agent
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Wei, Li, Zhiyuan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Pegasus-v1 Technical Report
par: Jung, Raehyuk, et autres
Publié: (2024)
par: Jung, Raehyuk, et autres
Publié: (2024)
Skywork-R1V3 Technical Report
par: Shen, Wei, et autres
Publié: (2025)
par: Shen, Wei, et autres
Publié: (2025)
Multimodal Structured Generation: CVPR's 2nd MMFM Challenge Technical Report
par: Cesista, Franz Louis
Publié: (2024)
par: Cesista, Franz Louis
Publié: (2024)
Mano Technical Report
par: Fu, Tianyu, et autres
Publié: (2025)
par: Fu, Tianyu, et autres
Publié: (2025)
Qwen2.5-VL Technical Report
par: Bai, Shuai, et autres
Publié: (2025)
par: Bai, Shuai, et autres
Publié: (2025)
Arctic-Extract Technical Report
par: Chiliński, Mateusz, et autres
Publié: (2025)
par: Chiliński, Mateusz, et autres
Publié: (2025)
Octopus v2: On-device language model for super agent
par: Chen, Wei, et autres
Publié: (2024)
par: Chen, Wei, et autres
Publié: (2024)
Multimodal Reasoning for Science: Technical Report and 1st Place Solution to the ICML 2025 SeePhys Challenge
par: Liang, Hao, et autres
Publié: (2025)
par: Liang, Hao, et autres
Publié: (2025)
Baichuan-Omni Technical Report
par: Li, Yadong, et autres
Publié: (2024)
par: Li, Yadong, et autres
Publié: (2024)
Privacy-Aware Camera 2.0 Technical Report
par: Song, Huan, et autres
Publié: (2026)
par: Song, Huan, et autres
Publié: (2026)
PresentAgent-2: Towards Generalist Multimodal Presentation Agents
par: Wu, Wei, et autres
Publié: (2026)
par: Wu, Wei, et autres
Publié: (2026)
Falcon2-11B Technical Report
par: Malartic, Quentin, et autres
Publié: (2024)
par: Malartic, Quentin, et autres
Publié: (2024)
VARCO-VISION-2.0 Technical Report
par: Cha, Young-rok, et autres
Publié: (2025)
par: Cha, Young-rok, et autres
Publié: (2025)
On the Risk of Misleading Reports: Diagnosing Textual Biases in Multimodal Clinical AI
par: Restrepo, David, et autres
Publié: (2025)
par: Restrepo, David, et autres
Publié: (2025)
Frontier AI Risk Management Framework in Practice: A Risk Analysis Technical Report v1.5
par: Liu, Dongrui, et autres
Publié: (2026)
par: Liu, Dongrui, et autres
Publié: (2026)
Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model
par: Ma, Guoqing, et autres
Publié: (2025)
par: Ma, Guoqing, et autres
Publié: (2025)
EmbodiedEval: Evaluate Multimodal LLMs as Embodied Agents
par: Cheng, Zhili, et autres
Publié: (2025)
par: Cheng, Zhili, et autres
Publié: (2025)
Docling Technical Report
par: Auer, Christoph, et autres
Publié: (2024)
par: Auer, Christoph, et autres
Publié: (2024)
v1: Learning to Point Visual Tokens for Multimodal Grounded Reasoning
par: Chung, Jiwan, et autres
Publié: (2025)
par: Chung, Jiwan, et autres
Publié: (2025)
MedGemma Technical Report
par: Sellergren, Andrew, et autres
Publié: (2025)
par: Sellergren, Andrew, et autres
Publié: (2025)
Step-Video-TI2V Technical Report: A State-of-the-Art Text-Driven Image-to-Video Generation Model
par: Huang, Haoyang, et autres
Publié: (2025)
par: Huang, Haoyang, et autres
Publié: (2025)
Integrating Chain-of-Thought for Multimodal Alignment: A Study on 3D Vision-Language Learning
par: Chen, Yanjun, et autres
Publié: (2025)
par: Chen, Yanjun, et autres
Publié: (2025)
MiMo-Embodied: X-Embodied Foundation Model Technical Report
par: Hao, Xiaoshuai, et autres
Publié: (2025)
par: Hao, Xiaoshuai, et autres
Publié: (2025)
UI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn Reinforcement Learning
par: Wang, Haoming, et autres
Publié: (2025)
par: Wang, Haoming, et autres
Publié: (2025)
Mobile-Agent-v2: Mobile Device Operation Assistant with Effective Navigation via Multi-Agent Collaboration
par: Wang, Junyang, et autres
Publié: (2024)
par: Wang, Junyang, et autres
Publié: (2024)
VaseVQA: Multimodal Agent and Benchmark for Ancient Greek Pottery
par: Ge, Jinchao, et autres
Publié: (2025)
par: Ge, Jinchao, et autres
Publié: (2025)
Large Multimodal Agents: A Survey
par: Xie, Junlin, et autres
Publié: (2024)
par: Xie, Junlin, et autres
Publié: (2024)
Cooperative Sentiment Agents for Multimodal Sentiment Analysis
par: Wang, Shanmin, et autres
Publié: (2024)
par: Wang, Shanmin, et autres
Publié: (2024)
Through the Lens of Character: Resolving Modality-Role Interference in Multimodal Role-Playing Agent
par: Tang, Yihong, et autres
Publié: (2026)
par: Tang, Yihong, et autres
Publié: (2026)
SurvAgent: Hierarchical CoT-Enhanced Case Banking and Dichotomy-Based Multi-Agent System for Multimodal Survival Prediction
par: Huang, Guolin, et autres
Publié: (2025)
par: Huang, Guolin, et autres
Publié: (2025)
Ovis2.5 Technical Report
par: Lu, Shiyin, et autres
Publié: (2025)
par: Lu, Shiyin, et autres
Publié: (2025)
Octopus: Agentic Multimodal Reasoning with Six-Capability Orchestration
par: Guo, Yifu, et autres
Publié: (2025)
par: Guo, Yifu, et autres
Publié: (2025)
Frontier AI Risk Management Framework in Practice: A Risk Analysis Technical Report
par: Lab, Shanghai AI, et autres
Publié: (2025)
par: Lab, Shanghai AI, et autres
Publié: (2025)
Qwen3-Omni Technical Report
par: Xu, Jin, et autres
Publié: (2025)
par: Xu, Jin, et autres
Publié: (2025)
Kosmos-G: Generating Images in Context with Multimodal Large Language Models
par: Pan, Xichen, et autres
Publié: (2023)
par: Pan, Xichen, et autres
Publié: (2023)
Agent-X: Evaluating Deep Multimodal Reasoning in Vision-Centric Agentic Tasks
par: Ashraf, Tajamul, et autres
Publié: (2025)
par: Ashraf, Tajamul, et autres
Publié: (2025)
RestoreAgent: Autonomous Image Restoration Agent via Multimodal Large Language Models
par: Chen, Haoyu, et autres
Publié: (2024)
par: Chen, Haoyu, et autres
Publié: (2024)
Multimodal LLM With Hierarchical Mixture-of-Experts for VQA on 3D Brain MRI
par: Vepa, Arvind Murari, et autres
Publié: (2025)
par: Vepa, Arvind Murari, et autres
Publié: (2025)
WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction
par: Liu, Chengzhi, et autres
Publié: (2026)
par: Liu, Chengzhi, et autres
Publié: (2026)
Toward Multimodal Conversational AI for Age-Related Macular Degeneration
par: Gu, Ran, et autres
Publié: (2026)
par: Gu, Ran, et autres
Publié: (2026)
Documents similaires
-
Pegasus-v1 Technical Report
par: Jung, Raehyuk, et autres
Publié: (2024) -
Skywork-R1V3 Technical Report
par: Shen, Wei, et autres
Publié: (2025) -
Multimodal Structured Generation: CVPR's 2nd MMFM Challenge Technical Report
par: Cesista, Franz Louis
Publié: (2024) -
Mano Technical Report
par: Fu, Tianyu, et autres
Publié: (2025) -
Qwen2.5-VL Technical Report
par: Bai, Shuai, et autres
Publié: (2025)