Gespeichert in:
| Hauptverfasser: | Guo, Yifu, Xu, Zishan, Yao, Zhiyuan, Lu, Yuquan, Lin, Jiaye, Hu, Sen, Tang, Zhenheng, Wang, Huacan, Chen, Ronghao |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | https://arxiv.org/abs/2511.15351 |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
VideoSeg-R1:Reasoning Video Object Segmentation via Reinforcement Learning
von: Xu, Zishan, et al.
Veröffentlicht: (2025)
von: Xu, Zishan, et al.
Veröffentlicht: (2025)
Decoupling Continual Semantic Segmentation
von: Guo, Yifu, et al.
Veröffentlicht: (2025)
von: Guo, Yifu, et al.
Veröffentlicht: (2025)
Zero-Forgetting CISS via Dual-Phase Cognitive Cascades
von: Lu, Yuquan, et al.
Veröffentlicht: (2026)
von: Lu, Yuquan, et al.
Veröffentlicht: (2026)
Watching, Reasoning, and Searching: A Video Deep Research Benchmark on Open Web for Agentic Video Reasoning
von: Liu, Chengwen, et al.
Veröffentlicht: (2026)
von: Liu, Chengwen, et al.
Veröffentlicht: (2026)
RealMem: Benchmarking LLMs in Real-World Memory-Driven Interaction
von: Bian, Haonan, et al.
Veröffentlicht: (2026)
von: Bian, Haonan, et al.
Veröffentlicht: (2026)
AgentComp: From Agentic Reasoning to Compositional Mastery in Text-to-Image Models
von: Zarei, Arman, et al.
Veröffentlicht: (2025)
von: Zarei, Arman, et al.
Veröffentlicht: (2025)
Octopus v3: Technical Report for On-device Sub-billion Multimodal AI Agent
von: Chen, Wei, et al.
Veröffentlicht: (2024)
von: Chen, Wei, et al.
Veröffentlicht: (2024)
Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models
von: Huang, Wenxuan, et al.
Veröffentlicht: (2025)
von: Huang, Wenxuan, et al.
Veröffentlicht: (2025)
ARMOR: Agentic Reasoning for Methods Orchestration and Reparameterization for Robust Adversarial Attacks
von: Rong, Gabriel Lee Jun, et al.
Veröffentlicht: (2026)
von: Rong, Gabriel Lee Jun, et al.
Veröffentlicht: (2026)
VaaWIT: Visual-Aware Adaptation of Large Language Models for Multilingual Web Image Translation
von: Li, Bo, et al.
Veröffentlicht: (2026)
von: Li, Bo, et al.
Veröffentlicht: (2026)
Tracing and Mitigating Hallucinations in Multimodal LLMs via Dynamic Attention Localization
von: Yang, Tiancheng, et al.
Veröffentlicht: (2025)
von: Yang, Tiancheng, et al.
Veröffentlicht: (2025)
SenseNova-MARS: Empowering Multimodal Agentic Reasoning and Search via Reinforcement Learning
von: Chng, Yong Xien, et al.
Veröffentlicht: (2025)
von: Chng, Yong Xien, et al.
Veröffentlicht: (2025)
Rethinking Token Pruning for Historical Screenshots in GUI Visual Agents: Semantic, Spatial, and Temporal Perspectives
von: Li, Daiqiang, et al.
Veröffentlicht: (2026)
von: Li, Daiqiang, et al.
Veröffentlicht: (2026)
InterLV-Search: Benchmarking Interleaved Multimodal Agentic Search
von: Hou, Bohan, et al.
Veröffentlicht: (2026)
von: Hou, Bohan, et al.
Veröffentlicht: (2026)
CloneMem: Benchmarking Long-Term Memory for AI Clones
von: Hu, Sen, et al.
Veröffentlicht: (2026)
von: Hu, Sen, et al.
Veröffentlicht: (2026)
End-to-end Semantic-centric Video-based Multimodal Affective Computing
von: Lin, Ronghao, et al.
Veröffentlicht: (2024)
von: Lin, Ronghao, et al.
Veröffentlicht: (2024)
Shape of Thought: Progressive Object Assembly via Visual Chain-of-Thought
von: Huo, Yu, et al.
Veröffentlicht: (2026)
von: Huo, Yu, et al.
Veröffentlicht: (2026)
ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document Reconstruction
von: Guo, Zichun, et al.
Veröffentlicht: (2026)
von: Guo, Zichun, et al.
Veröffentlicht: (2026)
Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models
von: Sun, Haoyuan, et al.
Veröffentlicht: (2025)
von: Sun, Haoyuan, et al.
Veröffentlicht: (2025)
Show-o2: Improved Native Unified Multimodal Models
von: Xie, Jinheng, et al.
Veröffentlicht: (2025)
von: Xie, Jinheng, et al.
Veröffentlicht: (2025)
SkyNative: A Native Multimodal Framework for Remote Sensing Visual Evidence Reasoning
von: Yang, Xiao, et al.
Veröffentlicht: (2026)
von: Yang, Xiao, et al.
Veröffentlicht: (2026)
RadFabric: Agentic AI System with Reasoning Capability for Radiology
von: Chen, Wenting, et al.
Veröffentlicht: (2025)
von: Chen, Wenting, et al.
Veröffentlicht: (2025)
UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths
von: Mao, Weijia, et al.
Veröffentlicht: (2025)
von: Mao, Weijia, et al.
Veröffentlicht: (2025)
Multi-source Multimodal Progressive Domain Adaption for Audio-Visual Deception Detection
von: Lin, Ronghao, et al.
Veröffentlicht: (2025)
von: Lin, Ronghao, et al.
Veröffentlicht: (2025)
Inquire, Interact, and Integrate: A Proactive Agent Collaborative Framework for Zero-Shot Multimodal Medical Reasoning
von: Gu, Zishan, et al.
Veröffentlicht: (2024)
von: Gu, Zishan, et al.
Veröffentlicht: (2024)
UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning
von: Mao, Weijia, et al.
Veröffentlicht: (2025)
von: Mao, Weijia, et al.
Veröffentlicht: (2025)
MuDD: A Multimodal Deception Detection Dataset and GSR-Guided Progressive Distillation for Non-Contact Deception Detection
von: Jiang, Peiyuan, et al.
Veröffentlicht: (2026)
von: Jiang, Peiyuan, et al.
Veröffentlicht: (2026)
FlashSign: Pose-Free Guidance for Efficient Sign Language Video Generation
von: Zhang, Liuzhou, et al.
Veröffentlicht: (2026)
von: Zhang, Liuzhou, et al.
Veröffentlicht: (2026)
An Empirical Analysis on Spatial Reasoning Capabilities of Large Multimodal Models
von: Shiri, Fatemeh, et al.
Veröffentlicht: (2024)
von: Shiri, Fatemeh, et al.
Veröffentlicht: (2024)
Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization
von: Yang, Wenhao, et al.
Veröffentlicht: (2026)
von: Yang, Wenhao, et al.
Veröffentlicht: (2026)
CoReS: Orchestrating the Dance of Reasoning and Segmentation
von: Bao, Xiaoyi, et al.
Veröffentlicht: (2024)
von: Bao, Xiaoyi, et al.
Veröffentlicht: (2024)
Enlighten-Your-Voice: When Multimodal Meets Zero-shot Low-light Image Enhancement
von: Zhang, Xiaofeng, et al.
Veröffentlicht: (2023)
von: Zhang, Xiaofeng, et al.
Veröffentlicht: (2023)
OmniAD: Detect and Understand Industrial Anomaly via Multimodal Reasoning
von: Zhao, Shifang, et al.
Veröffentlicht: (2025)
von: Zhao, Shifang, et al.
Veröffentlicht: (2025)
COEF-VQ: Cost-Efficient Video Quality Understanding through a Cascaded Multimodal LLM Framework
von: Dong, Xin, et al.
Veröffentlicht: (2024)
von: Dong, Xin, et al.
Veröffentlicht: (2024)
LAD-Reasoner: Tiny Multimodal Models are Good Reasoners for Logical Anomaly Detection
von: Li, Weijia, et al.
Veröffentlicht: (2025)
von: Li, Weijia, et al.
Veröffentlicht: (2025)
UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation
von: Chen, Yanzhe, et al.
Veröffentlicht: (2025)
von: Chen, Yanzhe, et al.
Veröffentlicht: (2025)
SPR-128K: A New Benchmark for Spatial Plausibility Reasoning with Multimodal Large Language Models
von: Hu, Zhiyuan, et al.
Veröffentlicht: (2025)
von: Hu, Zhiyuan, et al.
Veröffentlicht: (2025)
DRKF: Decoupled Representations with Knowledge Fusion for Multimodal Emotion Recognition
von: Jiang, Peiyuan, et al.
Veröffentlicht: (2025)
von: Jiang, Peiyuan, et al.
Veröffentlicht: (2025)
DeepEyesV2: Toward Agentic Multimodal Model
von: Hong, Jack, et al.
Veröffentlicht: (2025)
von: Hong, Jack, et al.
Veröffentlicht: (2025)
InfiMM-WebMath-40B: Advancing Multimodal Pre-Training for Enhanced Mathematical Reasoning
von: Han, Xiaotian, et al.
Veröffentlicht: (2024)
von: Han, Xiaotian, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
VideoSeg-R1:Reasoning Video Object Segmentation via Reinforcement Learning
von: Xu, Zishan, et al.
Veröffentlicht: (2025) -
Decoupling Continual Semantic Segmentation
von: Guo, Yifu, et al.
Veröffentlicht: (2025) -
Zero-Forgetting CISS via Dual-Phase Cognitive Cascades
von: Lu, Yuquan, et al.
Veröffentlicht: (2026) -
Watching, Reasoning, and Searching: A Video Deep Research Benchmark on Open Web for Agentic Video Reasoning
von: Liu, Chengwen, et al.
Veröffentlicht: (2026) -
RealMem: Benchmarking LLMs in Real-World Memory-Driven Interaction
von: Bian, Haonan, et al.
Veröffentlicht: (2026)