Decoupled Seg Tokens Make Stronger Reasoning Video Segmenter and Grounder
Fuente:
arXiv
Saved in:
| Main Authors: | Jisheng, Dang, Xudong, Wu, Bimei, Wang, Ning, Lv, Jiayu, Chen, Zhao, Jingwen, liu, Yichu, Liu, Jizhao, Li, Juncheng, Wang, Teng |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
FastGRPO: Accelerating Policy Optimization via Concurrency-aware Speculative Decoding and Online Draft Learning
by: Zhang, Yizhou, et al.
Published: (2025)
by: Zhang, Yizhou, et al.
Published: (2025)
MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering
by: Dang, Jisheng, et al.
Published: (2025)
by: Dang, Jisheng, et al.
Published: (2025)
One Token to Seg Them All: Language Instructed Reasoning Segmentation in Videos
by: Bai, Zechen, et al.
Published: (2024)
by: Bai, Zechen, et al.
Published: (2024)
On the Implicit Reward Overfitting and the Low-rank Dynamics in RLVR
by: Ye, Hao, et al.
Published: (2026)
by: Ye, Hao, et al.
Published: (2026)
A Chaotic Dynamics Framework Inspired by Dorsal Stream for Event Signal Processing
by: Chen, Yu, et al.
Published: (2025)
by: Chen, Yu, et al.
Published: (2025)
Reinforcing Video Reasoning with Focused Thinking
by: Dang, Jisheng, et al.
Published: (2025)
by: Dang, Jisheng, et al.
Published: (2025)
Reverse Thinking Makes LLMs Stronger Reasoners
by: Chen, Justin Chih-Yao, et al.
Published: (2024)
by: Chen, Justin Chih-Yao, et al.
Published: (2024)
SegMoTE: Token-Level Mixture of Experts for Medical Image Segmentation
by: Lu, Yujie, et al.
Published: (2026)
by: Lu, Yujie, et al.
Published: (2026)
SteerSeg: Attention Steering for Reasoning Video Segmentation
by: Cheraghian, Ali, et al.
Published: (2026)
by: Cheraghian, Ali, et al.
Published: (2026)
Temporal Regularization Makes Your Video Generator Stronger
by: Chen, Harold Haodong, et al.
Published: (2025)
by: Chen, Harold Haodong, et al.
Published: (2025)
RCoT-Seg: Reinforced Chain-of-Thought for Video Reasoning and Segmentation
by: Wen, Junwei, et al.
Published: (2026)
by: Wen, Junwei, et al.
Published: (2026)
Video-KTR: Reinforcing Video Reasoning via Key Token Attribution
by: Wang, Ziyue, et al.
Published: (2026)
by: Wang, Ziyue, et al.
Published: (2026)
The Impact of Green Finance Policies on the Enterprise Export Resilience—Empirical Evidence From China's Manufacturing Industry
by: Bimei Feng, et al.
Published: (2025)
by: Bimei Feng, et al.
Published: (2025)
SAPO: Self-Adaptive Process Optimization Makes Small Reasoners Stronger
by: Chen, Kaiyuan, et al.
Published: (2026)
by: Chen, Kaiyuan, et al.
Published: (2026)
SegLLM: Multi-round Reasoning Segmentation
by: Wang, XuDong, et al.
Published: (2024)
by: Wang, XuDong, et al.
Published: (2024)
CLNet: Cross-View Correspondence Makes a Stronger Geo-Localizationer
by: Cao, Xianwei, et al.
Published: (2025)
by: Cao, Xianwei, et al.
Published: (2025)
VideoSeg-R1:Reasoning Video Object Segmentation via Reinforcement Learning
by: Xu, Zishan, et al.
Published: (2025)
by: Xu, Zishan, et al.
Published: (2025)
ReasonGrounder: LVLM-Guided Hierarchical Feature Splatting for Open-Vocabulary 3D Visual Grounding and Reasoning
by: Liu, Zhenyang, et al.
Published: (2025)
by: Liu, Zhenyang, et al.
Published: (2025)
DeRA: Decoupled Representation Alignment for Video Tokenization
by: Guo, Pengbo, et al.
Published: (2025)
by: Guo, Pengbo, et al.
Published: (2025)
LLM-Seg: Bridging Image Segmentation and Large Language Model Reasoning
by: Wang, Junchi, et al.
Published: (2024)
by: Wang, Junchi, et al.
Published: (2024)
GeoSeg: Training-Free Reasoning-Driven Segmentation in Remote Sensing Imagery
by: Jiang, Lifan, et al.
Published: (2026)
by: Jiang, Lifan, et al.
Published: (2026)
Mutual Reasoning Makes Smaller LLMs Stronger Problem-Solvers
by: Qi, Zhenting, et al.
Published: (2024)
by: Qi, Zhenting, et al.
Published: (2024)
Decoupling Motion and Geometry in 4D Gaussian Splatting
by: Zhang, Yi, et al.
Published: (2026)
by: Zhang, Yi, et al.
Published: (2026)
SegMo: Segment-aligned Text to 3D Human Motion Generation
by: Dang, Bowen, et al.
Published: (2025)
by: Dang, Bowen, et al.
Published: (2025)
Make Continual Learning Stronger via C-Flat
by: Bian, Ang, et al.
Published: (2024)
by: Bian, Ang, et al.
Published: (2024)
SegCompass: Exploring Interpretable Alignment with Sparse Autoencoders for Enhanced Reasoning Segmentation
by: Lu, Zhenyu, et al.
Published: (2026)
by: Lu, Zhenyu, et al.
Published: (2026)
SegPoint: Segment Any Point Cloud via Large Language Model
by: He, Shuting, et al.
Published: (2024)
by: He, Shuting, et al.
Published: (2024)
LoGoSeg: Integrating Local and Global Features for Open-Vocabulary Semantic Segmentation
by: Chen, Junyang, et al.
Published: (2026)
by: Chen, Junyang, et al.
Published: (2026)
Seg-VAR: Image Segmentation with Visual Autoregressive Modeling
by: Zheng, Rongkun, et al.
Published: (2025)
by: Zheng, Rongkun, et al.
Published: (2025)
Consistency-aware Fake Videos Detection on Short Video Platforms
by: Wang, Junxi, et al.
Published: (2025)
by: Wang, Junxi, et al.
Published: (2025)
Securing Satellite Communications: Real-Time Video Encryption Scheme on Satellite Payloads
by: Qiu, Hanshuo, et al.
Published: (2025)
by: Qiu, Hanshuo, et al.
Published: (2025)
SynPO: Synergizing Descriptiveness and Preference Optimization for Video Detailed Captioning
by: Dang, Jisheng, et al.
Published: (2025)
by: Dang, Jisheng, et al.
Published: (2025)
VTok: A Unified Video Tokenizer with Decoupled Spatial-Temporal Latents
by: Wang, Feng, et al.
Published: (2026)
by: Wang, Feng, et al.
Published: (2026)
Online Reasoning Video Object Segmentation
by: Liu, Jinyuan, et al.
Published: (2026)
by: Liu, Jinyuan, et al.
Published: (2026)
GLoRE: Evaluating Logical Reasoning of Large Language Models
by: liu, Hanmeng, et al.
Published: (2023)
by: liu, Hanmeng, et al.
Published: (2023)
MatchSeg: Towards Better Segmentation via Reference Image Matching
by: Huo, Jiayu, et al.
Published: (2024)
by: Huo, Jiayu, et al.
Published: (2024)
RSRefSeg 2: Decoupling Referring Remote Sensing Image Segmentation with Foundation Models
by: Chen, Keyan, et al.
Published: (2025)
by: Chen, Keyan, et al.
Published: (2025)
LLMBoost: Make Large Language Models Stronger with Boosting
by: Chen, Zehao, et al.
Published: (2025)
by: Chen, Zehao, et al.
Published: (2025)
TokenSeg: Efficient 3D Medical Image Segmentation via Hierarchical Visual Token Compression
by: Zeng, Sen, et al.
Published: (2026)
by: Zeng, Sen, et al.
Published: (2026)
The Devil is in Temporal Token: High Quality Video Reasoning Segmentation
by: Gong, Sitong, et al.
Published: (2025)
by: Gong, Sitong, et al.
Published: (2025)
Similar Items
-
FastGRPO: Accelerating Policy Optimization via Concurrency-aware Speculative Decoding and Online Draft Learning
by: Zhang, Yizhou, et al.
Published: (2025) -
MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering
by: Dang, Jisheng, et al.
Published: (2025) -
One Token to Seg Them All: Language Instructed Reasoning Segmentation in Videos
by: Bai, Zechen, et al.
Published: (2024) -
On the Implicit Reward Overfitting and the Low-rank Dynamics in RLVR
by: Ye, Hao, et al.
Published: (2026) -
A Chaotic Dynamics Framework Inspired by Dorsal Stream for Event Signal Processing
by: Chen, Yu, et al.
Published: (2025)