SAMTok: Representing Any Mask with Two Words
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhou, Yikang, Zhang, Tao, Gong, Dengxian, Wu, Yuanzheng, Tian, Ye, Wang, Haochen, Yuan, Haobo, Wang, Jiacong, Qi, Lu, Fei, Hao, Wang, Anran, Wang, Zhuochen, Wang, Yujing, Chen, Cheng, Ji, Shunping, Li, Xiangtai |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SaSaSaSa2VA: 2nd Place of the 5th PVUW MeViS-Text Track
por: Gong, Dengxian, et al.
Publicado: (2026)
por: Gong, Dengxian, et al.
Publicado: (2026)
Grasp Any Region: Towards Precise, Contextual Pixel Understanding for Multimodal LLMs
por: Wang, Haochen, et al.
Publicado: (2025)
por: Wang, Haochen, et al.
Publicado: (2025)
DeH4R: A Decoupled and Hybrid Method for Road Network Graph Extraction
por: Gong, Dengxian, et al.
Publicado: (2025)
por: Gong, Dengxian, et al.
Publicado: (2025)
The 1st Solution for 7th LSVOS RVOS Track: SaSaSa2VA
por: Niu, Quanzhu, et al.
Publicado: (2025)
por: Niu, Quanzhu, et al.
Publicado: (2025)
PairUni: Pairwise Training for Unified Multimodal Language Models
por: Zheng, Jiani, et al.
Publicado: (2025)
por: Zheng, Jiani, et al.
Publicado: (2025)
Open-o3-Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence
por: Meng, Jiahao, et al.
Publicado: (2025)
por: Meng, Jiahao, et al.
Publicado: (2025)
Traceable Evidence Enhanced Visual Grounded Reasoning: Evaluation and Methodology
por: Wang, Haochen, et al.
Publicado: (2025)
por: Wang, Haochen, et al.
Publicado: (2025)
DVIS-DAQ: Improving Video Segmentation via Dynamic Anchor Queries
por: Zhou, Yikang, et al.
Publicado: (2024)
por: Zhou, Yikang, et al.
Publicado: (2024)
Dense360: Dense Understanding from Omnidirectional Panoramas
por: Zhou, Yikang, et al.
Publicado: (2025)
por: Zhou, Yikang, et al.
Publicado: (2025)
MMaDA-Parallel: Multimodal Large Diffusion Language Models for Thinking-Aware Editing and Generation
por: Tian, Ye, et al.
Publicado: (2025)
por: Tian, Ye, et al.
Publicado: (2025)
Point Cloud Mamba: Point Cloud Learning via State Space Model
por: Zhang, Tao, et al.
Publicado: (2024)
por: Zhang, Tao, et al.
Publicado: (2024)
OMG-LLaVA: Bridging Image-level, Object-level, Pixel-level Reasoning and Understanding
por: Zhang, Tao, et al.
Publicado: (2024)
por: Zhang, Tao, et al.
Publicado: (2024)
The Scalability of Simplicity: Empirical Analysis of Vision-Language Learning with a Single Transformer
por: Lei, Weixian, et al.
Publicado: (2025)
por: Lei, Weixian, et al.
Publicado: (2025)
Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation
por: Niu, Quanzhu, et al.
Publicado: (2025)
por: Niu, Quanzhu, et al.
Publicado: (2025)
Are They the Same? Exploring Visual Correspondence Shortcomings of Multimodal LLMs
por: Zhou, Yikang, et al.
Publicado: (2025)
por: Zhou, Yikang, et al.
Publicado: (2025)
Innovative methods of using information technology in teaching stringed instruments in college
por: Wang, Yuanzheng
Publicado: (2025)
por: Wang, Yuanzheng
Publicado: (2025)
Visual Reasoning Tracer: Object-Level Grounded Reasoning Benchmark
por: Yuan, Haobo, et al.
Publicado: (2025)
por: Yuan, Haobo, et al.
Publicado: (2025)
P2PFormer: A Primitive-to-polygon Method for Regular Building Contour Extraction from Remote Sensing Images
por: Zhang, Tao, et al.
Publicado: (2024)
por: Zhang, Tao, et al.
Publicado: (2024)
Efficiently matching random inhomogeneous graphs via degree profiles
por: Ding, Jian, et al.
Publicado: (2023)
por: Ding, Jian, et al.
Publicado: (2023)
Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos
por: Yuan, Haobo, et al.
Publicado: (2025)
por: Yuan, Haobo, et al.
Publicado: (2025)
AMCEN: An Attention Masking-based Contrastive Event Network for Two-stage Temporal Knowledge Graph Reasoning
por: Yang, Jing, et al.
Publicado: (2024)
por: Yang, Jing, et al.
Publicado: (2024)
Conditional Panoramic Image Generation via Masked Autoregressive Modeling
por: Wang, Chaoyang, et al.
Publicado: (2025)
por: Wang, Chaoyang, et al.
Publicado: (2025)
Chinese ModernBERT with Whole-Word Masking
por: Zhao, Zeyu, et al.
Publicado: (2025)
por: Zhao, Zeyu, et al.
Publicado: (2025)
DreamSwapV: Mask-guided Subject Swapping for Any Customized Video Editing
por: Wang, Weitao, et al.
Publicado: (2025)
por: Wang, Weitao, et al.
Publicado: (2025)
Segment Any 4D Gaussians
por: Ji, Shengxiang, et al.
Publicado: (2024)
por: Ji, Shengxiang, et al.
Publicado: (2024)
DriveFine: Refining-Augmented Masked Diffusion VLA for Precise and Robust Driving
por: Dang, Chenxu, et al.
Publicado: (2026)
por: Dang, Chenxu, et al.
Publicado: (2026)
Lysine Acetyltransferase 6 in Health and Disease
por: Yujing Tan, et al.
Publicado: (2025)
por: Yujing Tan, et al.
Publicado: (2025)
A Novel Shape Guided Transformer Network for Instance Segmentation in Remote Sensing Images
por: Yu, Dawen, et al.
Publicado: (2024)
por: Yu, Dawen, et al.
Publicado: (2024)
Towards Cross-Table Masked Pretraining for Web Data Mining
por: Ye, Chao, et al.
Publicado: (2023)
por: Ye, Chao, et al.
Publicado: (2023)
Any Labor Union Can Represent Any Unit
Publicado: (2024)
Publicado: (2024)
MAGREF: Masked Guidance for Any-Reference Video Generation with Subject Disentanglement
por: Deng, Yufan, et al.
Publicado: (2025)
por: Deng, Yufan, et al.
Publicado: (2025)
Any2Caption:Interpreting Any Condition to Caption for Controllable Video Generation
por: Wu, Shengqiong, et al.
Publicado: (2025)
por: Wu, Shengqiong, et al.
Publicado: (2025)
Forgetting Any Data at Any Time: A Theoretically Certified Unlearning Framework for Vertical Federated Learning
por: Wang, Linian, et al.
Publicado: (2025)
por: Wang, Linian, et al.
Publicado: (2025)
Any Model, Any Place, Any Time: Get Remote Sensing Foundation Model Embeddings On Demand
por: Ye, Dingqi, et al.
Publicado: (2026)
por: Ye, Dingqi, et al.
Publicado: (2026)
A note about why deep learning is deep: A discontinuous approximation perspective
por: Yongxin Li, et al.
Publicado: (2024)
por: Yongxin Li, et al.
Publicado: (2024)
SPICE : Leveraging Soft Probabilistic Causal Intervention for Breast Ultrasound Tumor Segmentation
por: Haobo Chen, et al.
Publicado: (2026)
por: Haobo Chen, et al.
Publicado: (2026)
Emergent Kagome lattice and non-Abelian lattice gauge field of biexcitons in t-MoTe$_2$
por: Wang, Haochen, et al.
Publicado: (2025)
por: Wang, Haochen, et al.
Publicado: (2025)
Representing Noisy Image Without Denoising
por: Qi, Shuren, et al.
Publicado: (2023)
por: Qi, Shuren, et al.
Publicado: (2023)
Preparation, Characterization and Antioxidant Effects on Processed Sausages of Ultrafine Green Tea Powder Emulsions
por: Xin Tao, et al.
Publicado: (2026)
por: Xin Tao, et al.
Publicado: (2026)
K-frames: Scene-Driven Any-k Keyframe Selection for long video understanding
por: Yao, Yifeng, et al.
Publicado: (2025)
por: Yao, Yifeng, et al.
Publicado: (2025)
Ejemplares similares
-
SaSaSaSa2VA: 2nd Place of the 5th PVUW MeViS-Text Track
por: Gong, Dengxian, et al.
Publicado: (2026) -
Grasp Any Region: Towards Precise, Contextual Pixel Understanding for Multimodal LLMs
por: Wang, Haochen, et al.
Publicado: (2025) -
DeH4R: A Decoupled and Hybrid Method for Road Network Graph Extraction
por: Gong, Dengxian, et al.
Publicado: (2025) -
The 1st Solution for 7th LSVOS RVOS Track: SaSaSa2VA
por: Niu, Quanzhu, et al.
Publicado: (2025) -
PairUni: Pairwise Training for Unified Multimodal Language Models
por: Zheng, Jiani, et al.
Publicado: (2025)