OneRef: Unified One-tower Expression Grounding and Segmentation with Mask Referring Modeling
Fuente:
arXiv
Guardado en:
| Autores principales: | Xiao, Linhui, Yang, Xiaoshan, Peng, Fang, Wang, Yaowei, Xu, Changsheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
HiVG: Hierarchical Multimodal Fine-grained Modulation for Visual Grounding
por: Xiao, Linhui, et al.
Publicado: (2024)
por: Xiao, Linhui, et al.
Publicado: (2024)
CLIP-VG: Self-paced Curriculum Adapting of CLIP for Visual Grounding
por: Xiao, Linhui, et al.
Publicado: (2023)
por: Xiao, Linhui, et al.
Publicado: (2023)
Towards Visual Grounding: A Survey
por: Xiao, Linhui, et al.
Publicado: (2024)
por: Xiao, Linhui, et al.
Publicado: (2024)
RefMask3D: Language-Guided Transformer for 3D Referring Segmentation
por: He, Shuting, et al.
Publicado: (2024)
por: He, Shuting, et al.
Publicado: (2024)
Mask Grounding for Referring Image Segmentation
por: Chng, Yong Xien, et al.
Publicado: (2023)
por: Chng, Yong Xien, et al.
Publicado: (2023)
BARE: Towards Bias-Aware and Reasoning-Enhanced One-Tower Visual Grounding
por: Li, Hongbing, et al.
Publicado: (2026)
por: Li, Hongbing, et al.
Publicado: (2026)
RefCut: Interactive Segmentation with Reference Guidance
por: Lin, Zheng, et al.
Publicado: (2025)
por: Lin, Zheng, et al.
Publicado: (2025)
FineCops-Ref: A new Dataset and Task for Fine-Grained Compositional Referring Expression Comprehension
por: Liu, Junzhuo, et al.
Publicado: (2024)
por: Liu, Junzhuo, et al.
Publicado: (2024)
ViRefSAM: Visual Reference-Guided Segment Anything Model for Remote Sensing Segmentation
por: Bi, Hanbo, et al.
Publicado: (2025)
por: Bi, Hanbo, et al.
Publicado: (2025)
Pilot: Building the Federated Multimodal Instruction Tuning Framework
por: Xiong, Baochen, et al.
Publicado: (2025)
por: Xiong, Baochen, et al.
Publicado: (2025)
Libra: Building Decoupled Vision System on Large Language Models
por: Xu, Yifan, et al.
Publicado: (2024)
por: Xu, Yifan, et al.
Publicado: (2024)
RefDrone: A Challenging Benchmark for Referring Expression Comprehension in Drone Scenes
por: Sun, Zhichao, et al.
Publicado: (2025)
por: Sun, Zhichao, et al.
Publicado: (2025)
RefSAM: Efficiently Adapting Segmenting Anything Model for Referring Video Object Segmentation
por: Li, Yonglin, et al.
Publicado: (2023)
por: Li, Yonglin, et al.
Publicado: (2023)
RefEdit: A Benchmark and Method for Improving Instruction-based Image Editing Model on Referring Expressions
por: Pathiraja, Bimsara, et al.
Publicado: (2025)
por: Pathiraja, Bimsara, et al.
Publicado: (2025)
RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension
por: Gao, Tianyi, et al.
Publicado: (2025)
por: Gao, Tianyi, et al.
Publicado: (2025)
RefHCM: A Unified Model for Referring Perceptions in Human-Centric Scenarios
por: Huang, Jie, et al.
Publicado: (2024)
por: Huang, Jie, et al.
Publicado: (2024)
RefComp: A Reference-guided Unified Framework for Unpaired Point Cloud Completion
por: Yang, Yixuan, et al.
Publicado: (2025)
por: Yang, Yixuan, et al.
Publicado: (2025)
Ref-Adv: Exploring MLLM Visual Reasoning in Referring Expression Tasks
por: Dong, Qihua, et al.
Publicado: (2026)
por: Dong, Qihua, et al.
Publicado: (2026)
StoryImager: A Unified and Efficient Framework for Coherent Story Visualization and Completion
por: Tao, Ming, et al.
Publicado: (2024)
por: Tao, Ming, et al.
Publicado: (2024)
RefAlign: Representation Alignment for Reference-to-Video Generation
por: Wang, Lei, et al.
Publicado: (2026)
por: Wang, Lei, et al.
Publicado: (2026)
Ref-AVS: Refer and Segment Objects in Audio-Visual Scenes
por: Wang, Yaoting, et al.
Publicado: (2024)
por: Wang, Yaoting, et al.
Publicado: (2024)
A Comprehensive Review of Few-shot Action Recognition
por: Wanyan, Yuyang, et al.
Publicado: (2024)
por: Wanyan, Yuyang, et al.
Publicado: (2024)
OneVOS: Unifying Video Object Segmentation with All-in-One Transformer Framework
por: Li, Wanyun, et al.
Publicado: (2024)
por: Li, Wanyun, et al.
Publicado: (2024)
Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC
por: Tao, Ming, et al.
Publicado: (2024)
por: Tao, Ming, et al.
Publicado: (2024)
TransRef: Multi-Scale Reference Embedding Transformer for Reference-Guided Image Inpainting
por: Liu, Taorong, et al.
Publicado: (2023)
por: Liu, Taorong, et al.
Publicado: (2023)
Latent Expression Generation for Referring Image Segmentation and Grounding
por: Yu, Seonghoon, et al.
Publicado: (2025)
por: Yu, Seonghoon, et al.
Publicado: (2025)
Towards Unified Referring Expression Segmentation Across Omni-Level Visual Target Granularities
por: Liu, Jing, et al.
Publicado: (2025)
por: Liu, Jing, et al.
Publicado: (2025)
One for All: Toward Unified Foundation Models for Earth Vision
por: Xiong, Zhitong, et al.
Publicado: (2024)
por: Xiong, Zhitong, et al.
Publicado: (2024)
Beyond Referring Expressions: Scenario Comprehension Visual Grounding
por: He, Ruozhen, et al.
Publicado: (2026)
por: He, Ruozhen, et al.
Publicado: (2026)
MVGGT: Multimodal Visual Geometry Grounded Transformer for Multiview 3D Referring Expression Segmentation
por: Wu, Changli, et al.
Publicado: (2026)
por: Wu, Changli, et al.
Publicado: (2026)
OneReward: Unified Mask-Guided Image Generation via Multi-Task Human Preference Learning
por: Gong, Yuan, et al.
Publicado: (2025)
por: Gong, Yuan, et al.
Publicado: (2025)
Deforming Videos to Masks: Flow Matching for Referring Video Segmentation
por: Wang, Zanyi, et al.
Publicado: (2025)
por: Wang, Zanyi, et al.
Publicado: (2025)
ReferDINO: Referring Video Object Segmentation with Visual Grounding Foundations
por: Liang, Tianming, et al.
Publicado: (2025)
por: Liang, Tianming, et al.
Publicado: (2025)
MotionCrafter: One-Shot Motion Customization of Diffusion Models
por: Zhang, Yuxin, et al.
Publicado: (2023)
por: Zhang, Yuxin, et al.
Publicado: (2023)
Towards Domain-Generalized Open-Vocabulary Object Detection: A Progressive Domain-invariant Cross-modal Alignment Method
por: Xu, Xiaoran, et al.
Publicado: (2026)
por: Xu, Xiaoran, et al.
Publicado: (2026)
OneCAT: Decoder-Only Auto-Regressive Model for Unified Understanding and Generation
por: Li, Han, et al.
Publicado: (2025)
por: Li, Han, et al.
Publicado: (2025)
MaskBEV: Towards A Unified Framework for BEV Detection and Map Segmentation
por: Zhao, Xiao, et al.
Publicado: (2024)
por: Zhao, Xiao, et al.
Publicado: (2024)
RefOnce: Distilling References into a Prototype Memory for Referring Camouflaged Object Detection
por: Wu, Yu-Huan, et al.
Publicado: (2025)
por: Wu, Yu-Huan, et al.
Publicado: (2025)
RefTok: Reference-Based Tokenization for Video Generation
por: Fan, Xiang, et al.
Publicado: (2025)
por: Fan, Xiang, et al.
Publicado: (2025)
MultiRef: Controllable Image Generation with Multiple Visual References
por: Chen, Ruoxi, et al.
Publicado: (2025)
por: Chen, Ruoxi, et al.
Publicado: (2025)
Ejemplares similares
-
HiVG: Hierarchical Multimodal Fine-grained Modulation for Visual Grounding
por: Xiao, Linhui, et al.
Publicado: (2024) -
CLIP-VG: Self-paced Curriculum Adapting of CLIP for Visual Grounding
por: Xiao, Linhui, et al.
Publicado: (2023) -
Towards Visual Grounding: A Survey
por: Xiao, Linhui, et al.
Publicado: (2024) -
RefMask3D: Language-Guided Transformer for 3D Referring Segmentation
por: He, Shuting, et al.
Publicado: (2024) -
Mask Grounding for Referring Image Segmentation
por: Chng, Yong Xien, et al.
Publicado: (2023)