Octopus: Agentic Multimodal Reasoning with Six-Capability Orchestration
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Guo, Yifu, Xu, Zishan, Yao, Zhiyuan, Lu, Yuquan, Lin, Jiaye, Hu, Sen, Tang, Zhenheng, Wang, Huacan, Chen, Ronghao |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VideoSeg-R1:Reasoning Video Object Segmentation via Reinforcement Learning
par: Xu, Zishan, et autres
Publié: (2025)
par: Xu, Zishan, et autres
Publié: (2025)
Decoupling Continual Semantic Segmentation
par: Guo, Yifu, et autres
Publié: (2025)
par: Guo, Yifu, et autres
Publié: (2025)
Zero-Forgetting CISS via Dual-Phase Cognitive Cascades
par: Lu, Yuquan, et autres
Publié: (2026)
par: Lu, Yuquan, et autres
Publié: (2026)
Watching, Reasoning, and Searching: A Video Deep Research Benchmark on Open Web for Agentic Video Reasoning
par: Liu, Chengwen, et autres
Publié: (2026)
par: Liu, Chengwen, et autres
Publié: (2026)
AgentComp: From Agentic Reasoning to Compositional Mastery in Text-to-Image Models
par: Zarei, Arman, et autres
Publié: (2025)
par: Zarei, Arman, et autres
Publié: (2025)
ARMOR: Agentic Reasoning for Methods Orchestration and Reparameterization for Robust Adversarial Attacks
par: Rong, Gabriel Lee Jun, et autres
Publié: (2026)
par: Rong, Gabriel Lee Jun, et autres
Publié: (2026)
Octopus v3: Technical Report for On-device Sub-billion Multimodal AI Agent
par: Chen, Wei, et autres
Publié: (2024)
par: Chen, Wei, et autres
Publié: (2024)
RealMem: Benchmarking LLMs in Real-World Memory-Driven Interaction
par: Bian, Haonan, et autres
Publié: (2026)
par: Bian, Haonan, et autres
Publié: (2026)
Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models
par: Huang, Wenxuan, et autres
Publié: (2025)
par: Huang, Wenxuan, et autres
Publié: (2025)
SenseNova-MARS: Empowering Multimodal Agentic Reasoning and Search via Reinforcement Learning
par: Chng, Yong Xien, et autres
Publié: (2025)
par: Chng, Yong Xien, et autres
Publié: (2025)
Tracing and Mitigating Hallucinations in Multimodal LLMs via Dynamic Attention Localization
par: Yang, Tiancheng, et autres
Publié: (2025)
par: Yang, Tiancheng, et autres
Publié: (2025)
InterLV-Search: Benchmarking Interleaved Multimodal Agentic Search
par: Hou, Bohan, et autres
Publié: (2026)
par: Hou, Bohan, et autres
Publié: (2026)
VaaWIT: Visual-Aware Adaptation of Large Language Models for Multilingual Web Image Translation
par: Li, Bo, et autres
Publié: (2026)
par: Li, Bo, et autres
Publié: (2026)
ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document Reconstruction
par: Guo, Zichun, et autres
Publié: (2026)
par: Guo, Zichun, et autres
Publié: (2026)
Rethinking Token Pruning for Historical Screenshots in GUI Visual Agents: Semantic, Spatial, and Temporal Perspectives
par: Li, Daiqiang, et autres
Publié: (2026)
par: Li, Daiqiang, et autres
Publié: (2026)
Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models
par: Sun, Haoyuan, et autres
Publié: (2025)
par: Sun, Haoyuan, et autres
Publié: (2025)
RadFabric: Agentic AI System with Reasoning Capability for Radiology
par: Chen, Wenting, et autres
Publié: (2025)
par: Chen, Wenting, et autres
Publié: (2025)
End-to-end Semantic-centric Video-based Multimodal Affective Computing
par: Lin, Ronghao, et autres
Publié: (2024)
par: Lin, Ronghao, et autres
Publié: (2024)
SkyNative: A Native Multimodal Framework for Remote Sensing Visual Evidence Reasoning
par: Yang, Xiao, et autres
Publié: (2026)
par: Yang, Xiao, et autres
Publié: (2026)
Show-o2: Improved Native Unified Multimodal Models
par: Xie, Jinheng, et autres
Publié: (2025)
par: Xie, Jinheng, et autres
Publié: (2025)
Shape of Thought: Progressive Object Assembly via Visual Chain-of-Thought
par: Huo, Yu, et autres
Publié: (2026)
par: Huo, Yu, et autres
Publié: (2026)
UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths
par: Mao, Weijia, et autres
Publié: (2025)
par: Mao, Weijia, et autres
Publié: (2025)
Multi-source Multimodal Progressive Domain Adaption for Audio-Visual Deception Detection
par: Lin, Ronghao, et autres
Publié: (2025)
par: Lin, Ronghao, et autres
Publié: (2025)
Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization
par: Yang, Wenhao, et autres
Publié: (2026)
par: Yang, Wenhao, et autres
Publié: (2026)
UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning
par: Mao, Weijia, et autres
Publié: (2025)
par: Mao, Weijia, et autres
Publié: (2025)
An Empirical Analysis on Spatial Reasoning Capabilities of Large Multimodal Models
par: Shiri, Fatemeh, et autres
Publié: (2024)
par: Shiri, Fatemeh, et autres
Publié: (2024)
Inquire, Interact, and Integrate: A Proactive Agent Collaborative Framework for Zero-Shot Multimodal Medical Reasoning
par: Gu, Zishan, et autres
Publié: (2024)
par: Gu, Zishan, et autres
Publié: (2024)
CoReS: Orchestrating the Dance of Reasoning and Segmentation
par: Bao, Xiaoyi, et autres
Publié: (2024)
par: Bao, Xiaoyi, et autres
Publié: (2024)
OmniAD: Detect and Understand Industrial Anomaly via Multimodal Reasoning
par: Zhao, Shifang, et autres
Publié: (2025)
par: Zhao, Shifang, et autres
Publié: (2025)
LAD-Reasoner: Tiny Multimodal Models are Good Reasoners for Logical Anomaly Detection
par: Li, Weijia, et autres
Publié: (2025)
par: Li, Weijia, et autres
Publié: (2025)
MuDD: A Multimodal Deception Detection Dataset and GSR-Guided Progressive Distillation for Non-Contact Deception Detection
par: Jiang, Peiyuan, et autres
Publié: (2026)
par: Jiang, Peiyuan, et autres
Publié: (2026)
SPR-128K: A New Benchmark for Spatial Plausibility Reasoning with Multimodal Large Language Models
par: Hu, Zhiyuan, et autres
Publié: (2025)
par: Hu, Zhiyuan, et autres
Publié: (2025)
DeepEyesV2: Toward Agentic Multimodal Model
par: Hong, Jack, et autres
Publié: (2025)
par: Hong, Jack, et autres
Publié: (2025)
CloneMem: Benchmarking Long-Term Memory for AI Clones
par: Hu, Sen, et autres
Publié: (2026)
par: Hu, Sen, et autres
Publié: (2026)
FlashSign: Pose-Free Guidance for Efficient Sign Language Video Generation
par: Zhang, Liuzhou, et autres
Publié: (2026)
par: Zhang, Liuzhou, et autres
Publié: (2026)
UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation
par: Chen, Yanzhe, et autres
Publié: (2025)
par: Chen, Yanzhe, et autres
Publié: (2025)
DUALVISION: RGB-Infrared Multimodal Large Language Models for Robust Visual Reasoning
par: Majeedi, Abrar, et autres
Publié: (2026)
par: Majeedi, Abrar, et autres
Publié: (2026)
Vision-DeepResearch: Incentivizing DeepResearch Capability in Multimodal Large Language Models
par: Huang, Wenxuan, et autres
Publié: (2026)
par: Huang, Wenxuan, et autres
Publié: (2026)
Echo-α: Large Agentic Multimodal Reasoning Model for Ultrasound Interpretation
par: Zhang, Jing, et autres
Publié: (2026)
par: Zhang, Jing, et autres
Publié: (2026)
V-Retrver: Evidence-Driven Agentic Reasoning for Universal Multimodal Retrieval
par: Chen, Dongyang, et autres
Publié: (2026)
par: Chen, Dongyang, et autres
Publié: (2026)
Documents similaires
-
VideoSeg-R1:Reasoning Video Object Segmentation via Reinforcement Learning
par: Xu, Zishan, et autres
Publié: (2025) -
Decoupling Continual Semantic Segmentation
par: Guo, Yifu, et autres
Publié: (2025) -
Zero-Forgetting CISS via Dual-Phase Cognitive Cascades
par: Lu, Yuquan, et autres
Publié: (2026) -
Watching, Reasoning, and Searching: A Video Deep Research Benchmark on Open Web for Agentic Video Reasoning
par: Liu, Chengwen, et autres
Publié: (2026) -
AgentComp: From Agentic Reasoning to Compositional Mastery in Text-to-Image Models
par: Zarei, Arman, et autres
Publié: (2025)