SenseNova-MARS: Empowering Multimodal Agentic Reasoning and Search via Reinforcement Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Chng, Yong Xien, Hu, Tao, Tong, Wenwen, Li, Xueheng, Chen, Jiandong, Yu, Haojia, Lu, Jiefan, Guo, Hewei, Deng, Hanming, Xie, Chengjun, Huang, Gao, Lin, Dahua, Lu, Lewei |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture
by: Diao, Haiwen, et al.
Published: (2026)
by: Diao, Haiwen, et al.
Published: (2026)
EgoPro-Bench: Benchmarking Personalized Proactive Interaction in Egocentric Video Streams
by: Ran, Dongchuan, et al.
Published: (2026)
by: Ran, Dongchuan, et al.
Published: (2026)
InterSketch: An Interleaved Reasoning Model with Self-correcting Visual Sketch and Stepwise Reward
by: Ning, Zhiwei, et al.
Published: (2026)
by: Ning, Zhiwei, et al.
Published: (2026)
InteractiveOmni: A Unified Omni-modal Model for Audio-Visual Multi-turn Dialogue
by: Tong, Wenwen, et al.
Published: (2025)
by: Tong, Wenwen, et al.
Published: (2025)
Multimodal 3D Reasoning Segmentation with Complex Scenes
by: Jiang, Xueying, et al.
Published: (2024)
by: Jiang, Xueying, et al.
Published: (2024)
L-MARS: Legal Multi-Agent Workflow with Orchestrated Reasoning and Agentic Search
by: Wang, Ziqi, et al.
Published: (2025)
by: Wang, Ziqi, et al.
Published: (2025)
EVA: Efficient Reinforcement Learning for End-to-End Video Agent
by: Zhang, Yaolun, et al.
Published: (2026)
by: Zhang, Yaolun, et al.
Published: (2026)
From Pixels to Words -- Towards Native Vision-Language Primitives at Scale
by: Diao, Haiwen, et al.
Published: (2025)
by: Diao, Haiwen, et al.
Published: (2025)
V-ABS: Action-Observer Driven Beam Search for Dynamic Visual Reasoning
by: Ning, Zhiwei, et al.
Published: (2026)
by: Ning, Zhiwei, et al.
Published: (2026)
GUI-Reflection: Empowering Multimodal GUI Models with Self-Reflection Behavior
by: Wu, Penghao, et al.
Published: (2025)
by: Wu, Penghao, et al.
Published: (2025)
InSight-o3: Empowering Multimodal Foundation Models with Generalized Visual Search
by: Li, Kaican, et al.
Published: (2025)
by: Li, Kaican, et al.
Published: (2025)
MARS: Multimodal Active Robotic Sensing for Articulated Characterization
by: Zeng, Hongliang, et al.
Published: (2024)
by: Zeng, Hongliang, et al.
Published: (2024)
ACPO: Counteracting Likelihood Displacement in Vision-Language Alignment with Asymmetric Constraints
by: Huang, Kaili, et al.
Published: (2026)
by: Huang, Kaili, et al.
Published: (2026)
MARS-Sep: Multimodal-Aligned Reinforced Sound Separation
by: Zhang, Zihan, et al.
Published: (2025)
by: Zhang, Zihan, et al.
Published: (2025)
Pest-Thinker: Learning to Think and Reason like Entomologists via Reinforcement Learning
by: Li, Xueheng, et al.
Published: (2026)
by: Li, Xueheng, et al.
Published: (2026)
Q-Probe: Scaling Image Quality Assessment to High Resolution via Context-Aware Agentic Probing
by: Li, Xiang, et al.
Published: (2026)
by: Li, Xiang, et al.
Published: (2026)
MARS: Harmonizing Multimodal Convergence via Adaptive Rank Search
by: Cho, Minkyoung, et al.
Published: (2026)
by: Cho, Minkyoung, et al.
Published: (2026)
MC-Search: Evaluating and Enhancing Multimodal Agentic Search with Structured Long Reasoning Chains
by: Ning, Xuying, et al.
Published: (2026)
by: Ning, Xuying, et al.
Published: (2026)
LookWise: Knowing When and Where to Look for Fine-Grained Visual Reasoning in Multimodal Large Language Models
by: Shen, Yuxiang, et al.
Published: (2026)
by: Shen, Yuxiang, et al.
Published: (2026)
VLA-Reasoner: Empowering Vision-Language-Action Models with Reasoning via Online Monte Carlo Tree Search
by: Guo, Wenkai, et al.
Published: (2025)
by: Guo, Wenkai, et al.
Published: (2025)
ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning
by: Ding, Shengyuan, et al.
Published: (2025)
by: Ding, Shengyuan, et al.
Published: (2025)
VisuoThink: Empowering LVLM Reasoning with Multimodal Tree Search
by: Wang, Yikun, et al.
Published: (2025)
by: Wang, Yikun, et al.
Published: (2025)
MARS2 2025 Challenge on Multimodal Reasoning: Datasets, Methods, Results, Discussion, and Outlook
by: Xu, Peng, et al.
Published: (2025)
by: Xu, Peng, et al.
Published: (2025)
Agentic Conversational Search with Contextualized Reasoning via Reinforcement Learning
by: Mo, Fengran, et al.
Published: (2026)
by: Mo, Fengran, et al.
Published: (2026)
Visual Adversarial Attacks and Defenses in the Physical World: A Survey
by: Wei, Xingxing, et al.
Published: (2022)
by: Wei, Xingxing, et al.
Published: (2022)
R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning
by: Zhao, Qingfei, et al.
Published: (2025)
by: Zhao, Qingfei, et al.
Published: (2025)
MemSearch-o1: Empowering Large Language Models with Reasoning-Aligned Memory Growth in Agentic Search
by: Zhang, Sheng, et al.
Published: (2026)
by: Zhang, Sheng, et al.
Published: (2026)
Mask Grounding for Referring Image Segmentation
by: Chng, Yong Xien, et al.
Published: (2023)
by: Chng, Yong Xien, et al.
Published: (2023)
MARS: Efficient, Adaptive Co-Scheduling for Heterogeneous Agentic Systems
by: Wang, Yifei, et al.
Published: (2026)
by: Wang, Yifei, et al.
Published: (2026)
PestVL-Net: Enabling Multimodal Pest Learning via Fine-grained Vision-Language Interaction
by: Li, Xueheng, et al.
Published: (2026)
by: Li, Xueheng, et al.
Published: (2026)
Agentic Transformers Provably Learn to Search via Reinforcement Learning
by: Yang, Tong, et al.
Published: (2026)
by: Yang, Tong, et al.
Published: (2026)
ELV-Halluc: Benchmarking Semantic Aggregation Hallucinations in Long Video Understanding
by: Lu, Hao, et al.
Published: (2025)
by: Lu, Hao, et al.
Published: (2025)
MARS Policy: Multimodality Only When It Matters
by: Jia, Jindou, et al.
Published: (2026)
by: Jia, Jindou, et al.
Published: (2026)
MARS$^2$: Scaling Multi-Agent Tree Search via Reinforcement Learning for Code Generation
by: Li, Pengfei, et al.
Published: (2026)
by: Li, Pengfei, et al.
Published: (2026)
Octopus: Agentic Multimodal Reasoning with Six-Capability Orchestration
by: Guo, Yifu, et al.
Published: (2025)
by: Guo, Yifu, et al.
Published: (2025)
Empowering VLMs for Few-Shot Multimodal Time Series Classification via Tailored Agentic Reasoning
by: Li, Lin, et al.
Published: (2026)
by: Li, Lin, et al.
Published: (2026)
DriveMLM: Aligning Multi-Modal Large Language Models with Behavioral Planning States for Autonomous Driving
by: Cui, Erfei, et al.
Published: (2023)
by: Cui, Erfei, et al.
Published: (2023)
MathSmith: Towards Extremely Hard Mathematical Reasoning by Forging Synthetic Problems with a Reinforced Policy
by: Zhan, Shaoxiong, et al.
Published: (2025)
by: Zhan, Shaoxiong, et al.
Published: (2025)
CoSearch: Joint Training of Reasoning and Document Ranking via Reinforcement Learning for Agentic Search
by: Zeng, Hansi, et al.
Published: (2026)
by: Zeng, Hansi, et al.
Published: (2026)
Practical Quantum CIM Empowerment via All-Domestic-Core Agentic Large Model
by: Rui, Wang, et al.
Published: (2026)
by: Rui, Wang, et al.
Published: (2026)
Similar Items
-
SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture
by: Diao, Haiwen, et al.
Published: (2026) -
EgoPro-Bench: Benchmarking Personalized Proactive Interaction in Egocentric Video Streams
by: Ran, Dongchuan, et al.
Published: (2026) -
InterSketch: An Interleaved Reasoning Model with Self-correcting Visual Sketch and Stepwise Reward
by: Ning, Zhiwei, et al.
Published: (2026) -
InteractiveOmni: A Unified Omni-modal Model for Audio-Visual Multi-turn Dialogue
by: Tong, Wenwen, et al.
Published: (2025) -
Multimodal 3D Reasoning Segmentation with Complex Scenes
by: Jiang, Xueying, et al.
Published: (2024)