IBISAgent: Reinforcing Pixel-Level Visual Reasoning in MLLMs for Universal Biomedical Object Referring and Segmentation
Fuente:
arXiv
Salvato in:
| Autori principali: | Jiang, Yankai, Li, Qiaoru, Xu, Binlu, Sun, Haoran, Ding, Chao, Dong, Junting, Cai, Yuxiang, Zhang, Xuhong, Yin, Jianwei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VITAL: Visual-Semantic Dual Supervision for Enhanced and Interpretable Latent Reasoning in Medical MLLMs
di: Li, Qiaoru, et al.
Pubblicazione: (2026)
di: Li, Qiaoru, et al.
Pubblicazione: (2026)
UniPixel: Unified Object Referring and Segmentation for Pixel-Level Visual Reasoning
di: Liu, Ye, et al.
Pubblicazione: (2025)
di: Liu, Ye, et al.
Pubblicazione: (2025)
Pixel-Level Reasoning Segmentation via Multi-turn Conversations
di: Cai, Dexian, et al.
Pubblicazione: (2025)
di: Cai, Dexian, et al.
Pubblicazione: (2025)
Improving the Reasoning of Multi-Image Grounding in MLLMs via Reinforcement Learning
di: Zhang, Bob, et al.
Pubblicazione: (2025)
di: Zhang, Bob, et al.
Pubblicazione: (2025)
Semi-Mamba-UNet: Pixel-Level Contrastive and Pixel-Level Cross-Supervised Visual Mamba-based UNet for Semi-Supervised Medical Image Segmentation
di: Ma, Chao, et al.
Pubblicazione: (2024)
di: Ma, Chao, et al.
Pubblicazione: (2024)
Ground What You See: Hallucination-Resistant MLLMs via Caption Feedback, Diversity-Aware Sampling, and Conflict Regularization
di: Pan, Miao, et al.
Pubblicazione: (2026)
di: Pan, Miao, et al.
Pubblicazione: (2026)
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation
di: Ying, Kaining, et al.
Pubblicazione: (2025)
di: Ying, Kaining, et al.
Pubblicazione: (2025)
Think Before You Segment: An Object-aware Reasoning Agent for Referring Audio-Visual Segmentation
di: Zhou, Jinxing, et al.
Pubblicazione: (2025)
di: Zhou, Jinxing, et al.
Pubblicazione: (2025)
Visual Reasoning Tracer: Object-Level Grounded Reasoning Benchmark
di: Yuan, Haobo, et al.
Pubblicazione: (2025)
di: Yuan, Haobo, et al.
Pubblicazione: (2025)
TK-Mamba: Marrying KAN With Mamba for Text-Driven 3D Medical Image Segmentation
di: Yang, Haoyu, et al.
Pubblicazione: (2025)
di: Yang, Haoyu, et al.
Pubblicazione: (2025)
ReferDINO: Referring Video Object Segmentation with Visual Grounding Foundations
di: Liang, Tianming, et al.
Pubblicazione: (2025)
di: Liang, Tianming, et al.
Pubblicazione: (2025)
Geo-R1: Improving Few-Shot Geospatial Referring Expression Understanding with Reinforcement Fine-Tuning
di: Zhang, Zilun, et al.
Pubblicazione: (2025)
di: Zhang, Zilun, et al.
Pubblicazione: (2025)
Struct2D: A Perception-Guided Framework for Spatial Reasoning in MLLMs
di: Zhu, Fangrui, et al.
Pubblicazione: (2025)
di: Zhu, Fangrui, et al.
Pubblicazione: (2025)
Distill Visual Chart Reasoning Ability from LLMs to MLLMs
di: He, Wei, et al.
Pubblicazione: (2024)
di: He, Wei, et al.
Pubblicazione: (2024)
AURORA:Augmented Understanding via Structured Reasoning and Reinforcement Learning for Reference Audio-Visual Segmentation
di: Luo, Ziyang, et al.
Pubblicazione: (2025)
di: Luo, Ziyang, et al.
Pubblicazione: (2025)
Asymptotic behavior for a new higher-order nonlinear Schrödinger equation
di: Zhang, Hongyi, et al.
Pubblicazione: (2024)
di: Zhang, Hongyi, et al.
Pubblicazione: (2024)
Long-time asymptotics for a complex cubic Camassa-Holm equation
di: Zhang, Hongyi, et al.
Pubblicazione: (2022)
di: Zhang, Hongyi, et al.
Pubblicazione: (2022)
A class of extended high-dimensional nonisospectral KdV hierarchies and symmetry
di: Wang, Haifeng, et al.
Pubblicazione: (2022)
di: Wang, Haifeng, et al.
Pubblicazione: (2022)
R1-Track: Direct Application of MLLMs to Visual Object Tracking via Reinforcement Learning
di: Wang, Biao, et al.
Pubblicazione: (2025)
di: Wang, Biao, et al.
Pubblicazione: (2025)
Ref-AVS: Refer and Segment Objects in Audio-Visual Scenes
di: Wang, Yaoting, et al.
Pubblicazione: (2024)
di: Wang, Yaoting, et al.
Pubblicazione: (2024)
Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning
di: Wang, Haozhe, et al.
Pubblicazione: (2025)
di: Wang, Haozhe, et al.
Pubblicazione: (2025)
FairReason: Balancing Reasoning and Social Bias in MLLMs
di: Pan, Zhenyu, et al.
Pubblicazione: (2025)
di: Pan, Zhenyu, et al.
Pubblicazione: (2025)
VisualQuest: A Benchmark for Abstract Visual Reasoning in MLLMs
di: Xiao, Kelaiti, et al.
Pubblicazione: (2025)
di: Xiao, Kelaiti, et al.
Pubblicazione: (2025)
MedReasoner: Reinforcement Learning Drives Reasoning Grounding from Clinical Thought to Pixel-Level Precision
di: Yan, Zhonghao, et al.
Pubblicazione: (2025)
di: Yan, Zhonghao, et al.
Pubblicazione: (2025)
SEA: Supervised Embedding Alignment for Token-Level Visual-Textual Integration in MLLMs
di: Yin, Yuanyang, et al.
Pubblicazione: (2024)
di: Yin, Yuanyang, et al.
Pubblicazione: (2024)
SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement
di: Yin, Weijie, et al.
Pubblicazione: (2025)
di: Yin, Weijie, et al.
Pubblicazione: (2025)
LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs
di: Lou, Haoran, et al.
Pubblicazione: (2025)
di: Lou, Haoran, et al.
Pubblicazione: (2025)
Touch-R1: Reinforcing Touch Reasoning in MLLMs
di: Lai, Yingxin, et al.
Pubblicazione: (2026)
di: Lai, Yingxin, et al.
Pubblicazione: (2026)
Video-R1: Reinforcing Video Reasoning in MLLMs
di: Feng, Kaituo, et al.
Pubblicazione: (2025)
di: Feng, Kaituo, et al.
Pubblicazione: (2025)
SpaceR: Reinforcing MLLMs in Video Spatial Reasoning
di: Ouyang, Kun, et al.
Pubblicazione: (2025)
di: Ouyang, Kun, et al.
Pubblicazione: (2025)
Scaling Spatial Reasoning in MLLMs through Programmatic Data Synthesis
di: Helu, Zhi, et al.
Pubblicazione: (2025)
di: Helu, Zhi, et al.
Pubblicazione: (2025)
EventRR: Event Referential Reasoning for Referring Video Object Segmentation
di: Xu, Huihui, et al.
Pubblicazione: (2025)
di: Xu, Huihui, et al.
Pubblicazione: (2025)
Latent Sketchpad: Sketching Visual Thoughts to Elicit Multimodal Reasoning in MLLMs
di: Zhang, Huanyu, et al.
Pubblicazione: (2025)
di: Zhang, Huanyu, et al.
Pubblicazione: (2025)
Visual Grounding for Object-Level Generalization in Reinforcement Learning
di: Jiang, Haobin, et al.
Pubblicazione: (2024)
di: Jiang, Haobin, et al.
Pubblicazione: (2024)
PixelRefer: A Unified Framework for Spatio-Temporal Object Referring with Arbitrary Granularity
di: Yuan, Yuqian, et al.
Pubblicazione: (2025)
di: Yuan, Yuqian, et al.
Pubblicazione: (2025)
Mitigating Query Selection Bias in Referring Video Object Segmentation
di: Zhang, Dingwei, et al.
Pubblicazione: (2025)
di: Zhang, Dingwei, et al.
Pubblicazione: (2025)
AgentRVOS: Reasoning over Object Tracks for Zero-Shot Referring Video Object Segmentation
di: Jin, Woojeong, et al.
Pubblicazione: (2026)
di: Jin, Woojeong, et al.
Pubblicazione: (2026)
Expression Prompt Collaboration Transformer for Universal Referring Video Object Segmentation
di: Chen, Jiajun, et al.
Pubblicazione: (2023)
di: Chen, Jiajun, et al.
Pubblicazione: (2023)
Towards Faithful Reasoning in Comics for Small MLLMs
di: Feng, Chengcheng, et al.
Pubblicazione: (2026)
di: Feng, Chengcheng, et al.
Pubblicazione: (2026)
Reverse Region-to-Entity Annotation for Pixel-Level Visual Entity Linking
di: Xu, Zhengfei, et al.
Pubblicazione: (2024)
di: Xu, Zhengfei, et al.
Pubblicazione: (2024)
Documenti analoghi
-
VITAL: Visual-Semantic Dual Supervision for Enhanced and Interpretable Latent Reasoning in Medical MLLMs
di: Li, Qiaoru, et al.
Pubblicazione: (2026) -
UniPixel: Unified Object Referring and Segmentation for Pixel-Level Visual Reasoning
di: Liu, Ye, et al.
Pubblicazione: (2025) -
Pixel-Level Reasoning Segmentation via Multi-turn Conversations
di: Cai, Dexian, et al.
Pubblicazione: (2025) -
Improving the Reasoning of Multi-Image Grounding in MLLMs via Reinforcement Learning
di: Zhang, Bob, et al.
Pubblicazione: (2025) -
Semi-Mamba-UNet: Pixel-Level Contrastive and Pixel-Level Cross-Supervised Visual Mamba-based UNet for Semi-Supervised Medical Image Segmentation
di: Ma, Chao, et al.
Pubblicazione: (2024)