One Token to Seg Them All: Language Instructed Reasoning Segmentation in Videos
Fuente:
arXiv
Salvato in:
| Autori principali: | Bai, Zechen, He, Tong, Mei, Haiyang, Wang, Pichao, Gao, Ziteng, Chen, Joya, Liu, Lei, Zhang, Zheng, Shou, Mike Zheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Factorized Visual Tokenization and Generation
di: Bai, Zechen, et al.
Pubblicazione: (2024)
di: Bai, Zechen, et al.
Pubblicazione: (2024)
RobotSeg: A Model and Dataset for Segmenting Robots in Image and Video
di: Mei, Haiyang, et al.
Pubblicazione: (2025)
di: Mei, Haiyang, et al.
Pubblicazione: (2025)
Hallucination of Multimodal Large Language Models: A Survey
di: Bai, Zechen, et al.
Pubblicazione: (2024)
di: Bai, Zechen, et al.
Pubblicazione: (2024)
Bridging Information Asymmetry in Text-video Retrieval: A Data-centric Approach
di: Bai, Zechen, et al.
Pubblicazione: (2024)
di: Bai, Zechen, et al.
Pubblicazione: (2024)
Impossible Videos
di: Bai, Zechen, et al.
Pubblicazione: (2025)
di: Bai, Zechen, et al.
Pubblicazione: (2025)
EVOLVE-VLA: Test-Time Training from Environment Feedback for Vision-Language-Action Models
di: Bai, Zechen, et al.
Pubblicazione: (2025)
di: Bai, Zechen, et al.
Pubblicazione: (2025)
SAM-I2V: Upgrading SAM to Support Promptable Video Segmentation with Less than 0.2% Training Cost
di: Mei, Haiyang, et al.
Pubblicazione: (2025)
di: Mei, Haiyang, et al.
Pubblicazione: (2025)
Bootstrapping SparseFormers from Vision Foundation Models
di: Gao, Ziteng, et al.
Pubblicazione: (2023)
di: Gao, Ziteng, et al.
Pubblicazione: (2023)
D-AR: Diffusion via Autoregressive Models
di: Gao, Ziteng, et al.
Pubblicazione: (2025)
di: Gao, Ziteng, et al.
Pubblicazione: (2025)
Skip \n: A Simple Method to Reduce Hallucination in Large Vision-Language Models
di: Han, Zongbo, et al.
Pubblicazione: (2024)
di: Han, Zongbo, et al.
Pubblicazione: (2024)
InstructSeg: Unifying Instructed Visual Segmentation with Multi-modal Large Language Models
di: Wei, Cong, et al.
Pubblicazione: (2024)
di: Wei, Cong, et al.
Pubblicazione: (2024)
VideoLLM-online: Online Video Large Language Model for Streaming Video
di: Chen, Joya, et al.
Pubblicazione: (2024)
di: Chen, Joya, et al.
Pubblicazione: (2024)
Learning Video Context as Interleaved Multimodal Sequences
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2024)
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2024)
Kiwi-Edit: Versatile Video Editing via Instruction and Reference Guidance
di: Lin, Yiqi, et al.
Pubblicazione: (2026)
di: Lin, Yiqi, et al.
Pubblicazione: (2026)
ShowUI: One Vision-Language-Action Model for GUI Visual Agent
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2024)
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2024)
LOVA3: Learning to Visual Question Answering, Asking and Assessment
di: Zhao, Henry Hengyuan, et al.
Pubblicazione: (2024)
di: Zhao, Henry Hengyuan, et al.
Pubblicazione: (2024)
VideoLLM-MoD: Efficient Video-Language Streaming with Mixture-of-Depths Vision Computation
di: Wu, Shiwei, et al.
Pubblicazione: (2024)
di: Wu, Shiwei, et al.
Pubblicazione: (2024)
Decoupled Seg Tokens Make Stronger Reasoning Video Segmenter and Grounder
di: Jisheng, Dang, et al.
Pubblicazione: (2025)
di: Jisheng, Dang, et al.
Pubblicazione: (2025)
VLog: Video-Language Models by Generative Retrieval of Narration Vocabulary
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2025)
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2025)
LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale
di: Chen, Joya, et al.
Pubblicazione: (2025)
di: Chen, Joya, et al.
Pubblicazione: (2025)
TPDiff: Temporal Pyramid Video Diffusion Model
di: Ran, Lingmin, et al.
Pubblicazione: (2025)
di: Ran, Lingmin, et al.
Pubblicazione: (2025)
PANDA: Towards Generalist Video Anomaly Detection via Agentic AI Engineer
di: Yang, Zhiwei, et al.
Pubblicazione: (2025)
di: Yang, Zhiwei, et al.
Pubblicazione: (2025)
OMG-Seg: Is One Model Good Enough For All Segmentation?
di: Li, Xiangtai, et al.
Pubblicazione: (2024)
di: Li, Xiangtai, et al.
Pubblicazione: (2024)
OneVOS: Unifying Video Object Segmentation with All-in-One Transformer Framework
di: Li, Wanyun, et al.
Pubblicazione: (2024)
di: Li, Wanyun, et al.
Pubblicazione: (2024)
Factorized Learning for Temporally Grounded Video-Language Models
di: Zeng, Wenzheng, et al.
Pubblicazione: (2025)
di: Zeng, Wenzheng, et al.
Pubblicazione: (2025)
TokenSeg: Efficient 3D Medical Image Segmentation via Hierarchical Visual Token Compression
di: Zeng, Sen, et al.
Pubblicazione: (2026)
di: Zeng, Sen, et al.
Pubblicazione: (2026)
LLM-Seg: Bridging Image Segmentation and Large Language Model Reasoning
di: Wang, Junchi, et al.
Pubblicazione: (2024)
di: Wang, Junchi, et al.
Pubblicazione: (2024)
SteerSeg: Attention Steering for Reasoning Video Segmentation
di: Cheraghian, Ali, et al.
Pubblicazione: (2026)
di: Cheraghian, Ali, et al.
Pubblicazione: (2026)
SCT: A Simple Baseline for Parameter-Efficient Fine-Tuning via Salient Channels
di: Zhao, Henry Hengyuan, et al.
Pubblicazione: (2023)
di: Zhao, Henry Hengyuan, et al.
Pubblicazione: (2023)
OmniCaptioner: One Captioner to Rule Them All
di: Lu, Yiting, et al.
Pubblicazione: (2025)
di: Lu, Yiting, et al.
Pubblicazione: (2025)
DiffSeg30k: A Multi-Turn Diffusion Editing Benchmark for Localized AIGC Detection
di: Ci, Hai, et al.
Pubblicazione: (2025)
di: Ci, Hai, et al.
Pubblicazione: (2025)
VideoMind: A Chain-of-LoRA Agent for Temporal-Grounded Video Reasoning
di: Liu, Ye, et al.
Pubblicazione: (2025)
di: Liu, Ye, et al.
Pubblicazione: (2025)
VIRST: Video-Instructed Reasoning Assistant for SpatioTemporal Segmentation
di: Hong, Jihwan, et al.
Pubblicazione: (2026)
di: Hong, Jihwan, et al.
Pubblicazione: (2026)
Unsupervised Open-Vocabulary Object Localization in Videos
di: Fan, Ke, et al.
Pubblicazione: (2023)
di: Fan, Ke, et al.
Pubblicazione: (2023)
Long-Context Autoregressive Video Modeling with Next-Frame Prediction
di: Gu, Yuchao, et al.
Pubblicazione: (2025)
di: Gu, Yuchao, et al.
Pubblicazione: (2025)
RCoT-Seg: Reinforced Chain-of-Thought for Video Reasoning and Segmentation
di: Wen, Junwei, et al.
Pubblicazione: (2026)
di: Wen, Junwei, et al.
Pubblicazione: (2026)
Visual-Instructed Degradation Diffusion for All-in-One Image Restoration
di: Luo, Wenyang, et al.
Pubblicazione: (2025)
di: Luo, Wenyang, et al.
Pubblicazione: (2025)
Show-o: One Single Transformer to Unify Multimodal Understanding and Generation
di: Xie, Jinheng, et al.
Pubblicazione: (2024)
di: Xie, Jinheng, et al.
Pubblicazione: (2024)
Seg-ReSearch: Segmentation with Interleaved Reasoning and External Search
di: Liang, Tianming, et al.
Pubblicazione: (2026)
di: Liang, Tianming, et al.
Pubblicazione: (2026)
Bring Your Own Character: A Holistic Solution for Automatic Facial Animation Generation of Customized Characters
di: Bai, Zechen, et al.
Pubblicazione: (2024)
di: Bai, Zechen, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Factorized Visual Tokenization and Generation
di: Bai, Zechen, et al.
Pubblicazione: (2024) -
RobotSeg: A Model and Dataset for Segmenting Robots in Image and Video
di: Mei, Haiyang, et al.
Pubblicazione: (2025) -
Hallucination of Multimodal Large Language Models: A Survey
di: Bai, Zechen, et al.
Pubblicazione: (2024) -
Bridging Information Asymmetry in Text-video Retrieval: A Data-centric Approach
di: Bai, Zechen, et al.
Pubblicazione: (2024) -
Impossible Videos
di: Bai, Zechen, et al.
Pubblicazione: (2025)