SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Zhixiong, Li, Yizhuo, Ding, Shuangrui, Zang, Yuhang, Ding, Shengyuan, Xing, Long, Wang, Yibin, Zhang, Qiaosheng, Wang, Jiaqi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
2nd Place Report of MOSEv2 Challenge 2025: Concept Guided Video Object Segmentation via SeC
par: Zhang, Zhixiong, et autres
Publié: (2025)
par: Zhang, Zhixiong, et autres
Publié: (2025)
Advancing Complex Video Object Segmentation via Progressive Concept Construction
par: Zhang, Zhixiong, et autres
Publié: (2025)
par: Zhang, Zhixiong, et autres
Publié: (2025)
SongGen: A Single Stage Auto-regressive Transformer for Text-to-Song Generation
par: Liu, Zihan, et autres
Publié: (2025)
par: Liu, Zihan, et autres
Publié: (2025)
SAM2Long: Enhancing SAM 2 for Long Video Segmentation with a Training-Free Memory Tree
par: Ding, Shuangrui, et autres
Publié: (2024)
par: Ding, Shuangrui, et autres
Publié: (2024)
Streaming Long Video Understanding with Large Language Models
par: Qian, Rui, et autres
Publié: (2024)
par: Qian, Rui, et autres
Publié: (2024)
Dispider: Enabling Video LLMs with Active Real-Time Interaction via Disentangled Perception, Decision, and Reaction
par: Qian, Rui, et autres
Publié: (2025)
par: Qian, Rui, et autres
Publié: (2025)
WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation
par: Ding, Shuangrui, et autres
Publié: (2026)
par: Ding, Shuangrui, et autres
Publié: (2026)
MM-IFEngine: Towards Multimodal Instruction Following
par: Ding, Shengyuan, et autres
Publié: (2025)
par: Ding, Shengyuan, et autres
Publié: (2025)
Demo-ICL: In-Context Learning for Procedural Video Knowledge Acquisition
par: Dong, Yuhao, et autres
Publié: (2026)
par: Dong, Yuhao, et autres
Publié: (2026)
ScaleCap: Inference-Time Scalable Image Captioning via Dual-Modality Debiasing
par: Xing, Long, et autres
Publié: (2025)
par: Xing, Long, et autres
Publié: (2025)
Reifenberg Theorem for Locally Finitely Almost Splitting Sets
par: Zang, Jiaqi
Publié: (2025)
par: Zang, Jiaqi
Publié: (2025)
SPARK: Synergistic Policy And Reward Co-Evolving Framework
par: Liu, Ziyu, et autres
Publié: (2025)
par: Liu, Ziyu, et autres
Publié: (2025)
Unified Reward Model for Multimodal Understanding and Generation
par: Wang, Yibin, et autres
Publié: (2025)
par: Wang, Yibin, et autres
Publié: (2025)
LoMo: Local Modality Substitution for Deeper Vision-Language Fusion
par: Han, Feng, et autres
Publié: (2026)
par: Han, Feng, et autres
Publié: (2026)
Open-Set Facial Expression Recognition
par: Zhang, Yuhang, et autres
Publié: (2024)
par: Zhang, Yuhang, et autres
Publié: (2024)
MiRD: Reliable Set-Valued Prediction for Open-Ended Question Answering via Miscoverage Risk Decomposition
par: Hu, Anqi, et autres
Publié: (2026)
par: Hu, Anqi, et autres
Publié: (2026)
Quality Diversity through Human Feedback: Towards Open-Ended Diversity-Driven Optimization
par: Ding, Li, et autres
Publié: (2023)
par: Ding, Li, et autres
Publié: (2023)
LOC: A General Language-Guided Framework for Open-Set 3D Occupancy Prediction
par: Gao, Yuhang, et autres
Publié: (2025)
par: Gao, Yuhang, et autres
Publié: (2025)
Set Prediction Guided by Semantic Concepts for Diverse Video Captioning
par: Lu, Yifan, et autres
Publié: (2023)
par: Lu, Yifan, et autres
Publié: (2023)
Conformal Prediction Sets for Instance Segmentation
par: Lu, Kerri, et autres
Publié: (2026)
par: Lu, Kerri, et autres
Publié: (2026)
Unified Multimodal Chain-of-Thought Reward Model through Reinforcement Fine-Tuning
par: Wang, Yibin, et autres
Publié: (2025)
par: Wang, Yibin, et autres
Publié: (2025)
Rethinking Image-to-Video Adaptation: An Object-centric Perspective
par: Qian, Rui, et autres
Publié: (2024)
par: Qian, Rui, et autres
Publié: (2024)
Marco-o1: Towards Open Reasoning Models for Open-Ended Solutions
par: Zhao, Yu, et autres
Publié: (2024)
par: Zhao, Yu, et autres
Publié: (2024)
OpenEP: Open-Ended Future Event Prediction
par: Guan, Yong, et autres
Publié: (2024)
par: Guan, Yong, et autres
Publié: (2024)
Neural Codec Source Tracing: Toward Comprehensive Attribution in Open-Set Condition
par: Xie, Yuankun, et autres
Publié: (2025)
par: Xie, Yuankun, et autres
Publié: (2025)
More Pictures Say More: Visual Intersection Network for Open Set Object Detection
par: Dong, Bingcheng, et autres
Publié: (2024)
par: Dong, Bingcheng, et autres
Publié: (2024)
EtCon: Edit-then-Consolidate for Reliable Knowledge Editing
par: Li, Ruilin, et autres
Publié: (2025)
par: Li, Ruilin, et autres
Publié: (2025)
DiCache: Let Diffusion Model Determine Its Own Cache
par: Bu, Jiazi, et autres
Publié: (2025)
par: Bu, Jiazi, et autres
Publié: (2025)
Unified Personalized Reward Model for Vision Generation
par: Wang, Yibin, et autres
Publié: (2026)
par: Wang, Yibin, et autres
Publié: (2026)
OSSAR: Towards Open-Set Surgical Activity Recognition in Robot-assisted Surgery
par: Bai, Long, et autres
Publié: (2024)
par: Bai, Long, et autres
Publié: (2024)
Betrayed by Attention: A Simple yet Effective Approach for Self-supervised Video Object Segmentation
par: Ding, Shuangrui, et autres
Publié: (2023)
par: Ding, Shuangrui, et autres
Publié: (2023)
InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model
par: Zang, Yuhang, et autres
Publié: (2025)
par: Zang, Yuhang, et autres
Publié: (2025)
Extending RLVR to Open-Ended Tasks via Verifiable Multiple-Choice Reformulation
par: Zhang, Mengyu, et autres
Publié: (2025)
par: Zhang, Mengyu, et autres
Publié: (2025)
Towards Adaptive Open-Set Object Detection via Category-Level Collaboration Knowledge Mining
par: Ji, Yuqi, et autres
Publié: (2026)
par: Ji, Yuqi, et autres
Publié: (2026)
Towards Storage-Efficient Visual Document Retrieval: An Empirical Study on Reducing Patch-Level Embeddings
par: Ma, Yubo, et autres
Publié: (2025)
par: Ma, Yubo, et autres
Publié: (2025)
ProtoConNet: Prototypical Augmentation and Alignment for Open-Set Few-Shot Image Classification
par: Shi, Kexuan, et autres
Publié: (2025)
par: Shi, Kexuan, et autres
Publié: (2025)
MSF: Efficient Diffusion Model Via Multi-Scale Latent Factorize
par: Xu, Haohang, et autres
Publié: (2025)
par: Xu, Haohang, et autres
Publié: (2025)
Visual-ERM: Reward Modeling for Visual Equivalence
par: Liu, Ziyu, et autres
Publié: (2026)
par: Liu, Ziyu, et autres
Publié: (2026)
OVO-Bench: How Far is Your Video-LLMs from Real-World Online Video Understanding?
par: Li, Yifei, et autres
Publié: (2025)
par: Li, Yifei, et autres
Publié: (2025)
Audit After Segmentation: Reference-Free Mask Quality Assessment for Language-Referred Audio-Visual Segmentation
par: Zhou, Jinxing, et autres
Publié: (2026)
par: Zhou, Jinxing, et autres
Publié: (2026)
Documents similaires
-
2nd Place Report of MOSEv2 Challenge 2025: Concept Guided Video Object Segmentation via SeC
par: Zhang, Zhixiong, et autres
Publié: (2025) -
Advancing Complex Video Object Segmentation via Progressive Concept Construction
par: Zhang, Zhixiong, et autres
Publié: (2025) -
SongGen: A Single Stage Auto-regressive Transformer for Text-to-Song Generation
par: Liu, Zihan, et autres
Publié: (2025) -
SAM2Long: Enhancing SAM 2 for Long Video Segmentation with a Training-Free Memory Tree
par: Ding, Shuangrui, et autres
Publié: (2024) -
Streaming Long Video Understanding with Large Language Models
par: Qian, Rui, et autres
Publié: (2024)