MiCo: Multi-image Contrast for Reinforcement Visual Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Xi, Zhu, Mingkang, Liu, Shaoteng, Wu, Xiaoyang, Xu, Xiaogang, Liu, Yu, Bai, Xiang, Zhao, Hengshuang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MiCo: Multiple Instance Learning with Context-Aware Clustering for Whole Slide Image Analysis
por: Li, Junjian, et al.
Publicado: (2025)
por: Li, Junjian, et al.
Publicado: (2025)
DiffCamera: Arbitrary Refocusing on Images
por: Wang, Yiyang, et al.
Publicado: (2025)
por: Wang, Yiyang, et al.
Publicado: (2025)
LogoSticker: Inserting Logos into Diffusion Models for Customized Generation
por: Zhu, Mingkang, et al.
Publicado: (2024)
por: Zhu, Mingkang, et al.
Publicado: (2024)
GDRO: Group-level Reward Post-training Suitable for Diffusion Models
por: Wang, Yiyang, et al.
Publicado: (2026)
por: Wang, Yiyang, et al.
Publicado: (2026)
Modular Customization of Diffusion Models via Blockwise-Parameterized Low-Rank Adaptation
por: Zhu, Mingkang, et al.
Publicado: (2025)
por: Zhu, Mingkang, et al.
Publicado: (2025)
DiffDoctor: Diagnosing Image Diffusion Models Before Treating
por: Wang, Yiyang, et al.
Publicado: (2025)
por: Wang, Yiyang, et al.
Publicado: (2025)
OpenIns3D: Snap and Lookup for 3D Open-vocabulary Instance Segmentation
por: Huang, Zhening, et al.
Publicado: (2023)
por: Huang, Zhening, et al.
Publicado: (2023)
ViSurf: Visual Supervised-and-Reinforcement Fine-Tuning for Large Vision-and-Language Models
por: Liu, Yuqi, et al.
Publicado: (2025)
por: Liu, Yuqi, et al.
Publicado: (2025)
Towards Large-scale 3D Representation Learning with Multi-dataset Point Prompt Training
por: Wu, Xiaoyang, et al.
Publicado: (2023)
por: Wu, Xiaoyang, et al.
Publicado: (2023)
CoLVR: Enhancing Exploratory Latent Visual Reasoning via Contrastive Optimization
por: Ding, Ziyang, et al.
Publicado: (2026)
por: Ding, Ziyang, et al.
Publicado: (2026)
FashionComposer: Compositional Fashion Image Generation
por: Ji, Sihui, et al.
Publicado: (2024)
por: Ji, Sihui, et al.
Publicado: (2024)
Liquid: Language Models are Scalable and Unified Multi-modal Generators
por: Wu, Junfeng, et al.
Publicado: (2024)
por: Wu, Junfeng, et al.
Publicado: (2024)
FocalClick-XL: Towards Unified and High-quality Interactive Segmentation
por: Chen, Xi, et al.
Publicado: (2025)
por: Chen, Xi, et al.
Publicado: (2025)
Towards Unified 3D Object Detection via Algorithm and Data Unification
por: Li, Zhuoling, et al.
Publicado: (2024)
por: Li, Zhuoling, et al.
Publicado: (2024)
GroupContrast: Semantic-aware Self-supervised Representation Learning for 3D Understanding
por: Wang, Chengyao, et al.
Publicado: (2024)
por: Wang, Chengyao, et al.
Publicado: (2024)
Point Transformer V3 Extreme: 1st Place Solution for 2024 Waymo Open Dataset Challenge in Semantic Segmentation
por: Wu, Xiaoyang, et al.
Publicado: (2024)
por: Wu, Xiaoyang, et al.
Publicado: (2024)
DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs
por: Zhao, Jiahe, et al.
Publicado: (2025)
por: Zhao, Jiahe, et al.
Publicado: (2025)
LARM: Large Auto-Regressive Model for Long-Horizon Embodied Intelligence
por: Li, Zhuoling, et al.
Publicado: (2024)
por: Li, Zhuoling, et al.
Publicado: (2024)
PlayerOne: Egocentric World Simulator
por: Tu, Yuanpeng, et al.
Publicado: (2025)
por: Tu, Yuanpeng, et al.
Publicado: (2025)
VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control
por: Tu, Yuanpeng, et al.
Publicado: (2025)
por: Tu, Yuanpeng, et al.
Publicado: (2025)
PhysMaster: Mastering Physical Representation for Video Generation via Reinforcement Learning
por: Ji, Sihui, et al.
Publicado: (2025)
por: Ji, Sihui, et al.
Publicado: (2025)
UniLION: Towards Unified Autonomous Driving Model with Linear Group RNNs
por: Liu, Zhe, et al.
Publicado: (2025)
por: Liu, Zhe, et al.
Publicado: (2025)
Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data
por: Yang, Lihe, et al.
Publicado: (2024)
por: Yang, Lihe, et al.
Publicado: (2024)
AnyDoor: Zero-shot Object-level Image Customization
por: Chen, Xi, et al.
Publicado: (2023)
por: Chen, Xi, et al.
Publicado: (2023)
ViLLa: Video Reasoning Segmentation with Large Language Model
por: Zheng, Rongkun, et al.
Publicado: (2024)
por: Zheng, Rongkun, et al.
Publicado: (2024)
MiLDEdit: Reasoning-Based Multi-Layer Design Document Editing
por: Lin, Zihao, et al.
Publicado: (2026)
por: Lin, Zihao, et al.
Publicado: (2026)
Seg-VAR: Image Segmentation with Visual Autoregressive Modeling
por: Zheng, Rongkun, et al.
Publicado: (2025)
por: Zheng, Rongkun, et al.
Publicado: (2025)
Depth Anything V2
por: Yang, Lihe, et al.
Publicado: (2024)
por: Yang, Lihe, et al.
Publicado: (2024)
Predictive Reasoning with Augmented Anomaly Contrastive Learning for Compositional Visual Relations
por: Li, Chengtai, et al.
Publicado: (2026)
por: Li, Chengtai, et al.
Publicado: (2026)
Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search
por: Lai, Xin, et al.
Publicado: (2025)
por: Lai, Xin, et al.
Publicado: (2025)
CACE-Net: Co-guidance Attention and Contrastive Enhancement for Effective Audio-Visual Event Localization
por: He, Xiang, et al.
Publicado: (2024)
por: He, Xiang, et al.
Publicado: (2024)
Point Transformer V3: Simpler, Faster, Stronger
por: Wu, Xiaoyang, et al.
Publicado: (2023)
por: Wu, Xiaoyang, et al.
Publicado: (2023)
DreamComposer++: Empowering Diffusion Models with Multi-View Conditions for 3D Content Generation
por: Yang, Yunhan, et al.
Publicado: (2025)
por: Yang, Yunhan, et al.
Publicado: (2025)
VisionReasoner: Unified Reasoning-Integrated Visual Perception via Reinforcement Learning
por: Liu, Yuqi, et al.
Publicado: (2025)
por: Liu, Yuqi, et al.
Publicado: (2025)
LION: Linear Group RNN for 3D Object Detection in Point Clouds
por: Liu, Zhe, et al.
Publicado: (2024)
por: Liu, Zhe, et al.
Publicado: (2024)
CoCoNet: Coupled Contrastive Learning Network with Multi-level Feature Ensemble for Multi-modality Image Fusion
por: Liu, Jinyuan, et al.
Publicado: (2022)
por: Liu, Jinyuan, et al.
Publicado: (2022)
VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning
por: Qi, Zhangyang, et al.
Publicado: (2025)
por: Qi, Zhangyang, et al.
Publicado: (2025)
TMT-VIS: Taxonomy-aware Multi-dataset Joint Training for Video Instance Segmentation
por: Zheng, Rongkun, et al.
Publicado: (2023)
por: Zheng, Rongkun, et al.
Publicado: (2023)
Rolling Sink: Bridging Limited-Horizon Training and Open-Ended Testing in Autoregressive Video Diffusion
por: Li, Haodong, et al.
Publicado: (2026)
por: Li, Haodong, et al.
Publicado: (2026)
OA-CNNs: Omni-Adaptive Sparse CNNs for 3D Semantic Segmentation
por: Peng, Bohao, et al.
Publicado: (2024)
por: Peng, Bohao, et al.
Publicado: (2024)
Ejemplares similares
-
MiCo: Multiple Instance Learning with Context-Aware Clustering for Whole Slide Image Analysis
por: Li, Junjian, et al.
Publicado: (2025) -
DiffCamera: Arbitrary Refocusing on Images
por: Wang, Yiyang, et al.
Publicado: (2025) -
LogoSticker: Inserting Logos into Diffusion Models for Customized Generation
por: Zhu, Mingkang, et al.
Publicado: (2024) -
GDRO: Group-level Reward Post-training Suitable for Diffusion Models
por: Wang, Yiyang, et al.
Publicado: (2026) -
Modular Customization of Diffusion Models via Blockwise-Parameterized Low-Rank Adaptation
por: Zhu, Mingkang, et al.
Publicado: (2025)