VISA: Reasoning Video Object Segmentation via Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Yan, Cilin, Wang, Haochen, Yan, Shilin, Jiang, Xiaolong, Hu, Yao, Kang, Guoliang, Xie, Weidi, Gavves, Efstratios |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Mining Open Semantics from CLIP: A Relation Transition Perspective for Few-Shot Learning
di: Yan, Cilin, et al.
Pubblicazione: (2024)
di: Yan, Cilin, et al.
Pubblicazione: (2024)
Object-centric Video Question Answering with Visual Grounding and Referring
di: Wang, Haochen, et al.
Pubblicazione: (2025)
di: Wang, Haochen, et al.
Pubblicazione: (2025)
PiClick: Picking the desired mask from multiple candidates in click-based interactive segmentation
di: Yan, Cilin, et al.
Pubblicazione: (2023)
di: Yan, Cilin, et al.
Pubblicazione: (2023)
LTCA: Long-range Temporal Context Attention for Referring Video Object Segmentation
di: Yan, Cilin, et al.
Pubblicazione: (2025)
di: Yan, Cilin, et al.
Pubblicazione: (2025)
CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models
di: Li, Jingyao, et al.
Pubblicazione: (2025)
di: Li, Jingyao, et al.
Pubblicazione: (2025)
AgentCVR: Active Multi-Agent Cross-Video Reasoning via Script-Simulated Reinforcement Learning
di: Qiu, Yilun, et al.
Pubblicazione: (2026)
di: Qiu, Yilun, et al.
Pubblicazione: (2026)
WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs
di: Hong, Jack, et al.
Pubblicazione: (2025)
di: Hong, Jack, et al.
Pubblicazione: (2025)
A Sanity Check for AI-generated Image Detection
di: Yan, Shilin, et al.
Pubblicazione: (2024)
di: Yan, Shilin, et al.
Pubblicazione: (2024)
Dynamic Prototype Adaptation with Distillation for Few-shot Point Cloud Segmentation
di: Liu, Jie, et al.
Pubblicazione: (2024)
di: Liu, Jie, et al.
Pubblicazione: (2024)
EchoSight: Advancing Visual-Language Models with Wiki Knowledge
di: Yan, Yibin, et al.
Pubblicazione: (2024)
di: Yan, Yibin, et al.
Pubblicazione: (2024)
Probabilistic Prototype Calibration of Vision-Language Models for Generalized Few-shot Semantic Segmentation
di: Liu, Jie, et al.
Pubblicazione: (2025)
di: Liu, Jie, et al.
Pubblicazione: (2025)
Weaver: End-to-End Agentic System Training for Video Interleaved Reasoning
di: Shi, Yudi, et al.
Pubblicazione: (2026)
di: Shi, Yudi, et al.
Pubblicazione: (2026)
Progressive Scaling Visual Object Tracking
di: Hong, Jack, et al.
Pubblicazione: (2025)
di: Hong, Jack, et al.
Pubblicazione: (2025)
Appearance-Based Refinement for Object-Centric Motion Segmentation
di: Xie, Junyu, et al.
Pubblicazione: (2023)
di: Xie, Junyu, et al.
Pubblicazione: (2023)
LamRA: Large Multimodal Model as Your Advanced Retrieval Assistant
di: Liu, Yikun, et al.
Pubblicazione: (2024)
di: Liu, Yikun, et al.
Pubblicazione: (2024)
Enhancing Video-LLM Reasoning via Agent-of-Thoughts Distillation
di: Shi, Yudi, et al.
Pubblicazione: (2024)
di: Shi, Yudi, et al.
Pubblicazione: (2024)
Moving Object Segmentation: All You Need Is SAM (and Flow)
di: Xie, Junyu, et al.
Pubblicazione: (2024)
di: Xie, Junyu, et al.
Pubblicazione: (2024)
Redefining Normal: A Novel Object-Level Approach for Multi-Object Novelty Detection
di: Salehi, Mohammadreza, et al.
Pubblicazione: (2024)
di: Salehi, Mohammadreza, et al.
Pubblicazione: (2024)
CTRL-O: Language-Controllable Object-Centric Visual Representation Learning
di: Didolkar, Aniket, et al.
Pubblicazione: (2025)
di: Didolkar, Aniket, et al.
Pubblicazione: (2025)
GMOS: Grounding Moving Object Segmentation in 3D Space and Time
di: Xie, Junyu, et al.
Pubblicazione: (2026)
di: Xie, Junyu, et al.
Pubblicazione: (2026)
RSBuilding: Towards General Remote Sensing Image Building Extraction and Change Detection with Foundation Model
di: Wang, Mingze, et al.
Pubblicazione: (2024)
di: Wang, Mingze, et al.
Pubblicazione: (2024)
SIGMA: Sinkhorn-Guided Masked Video Modeling
di: Salehi, Mohammadreza, et al.
Pubblicazione: (2024)
di: Salehi, Mohammadreza, et al.
Pubblicazione: (2024)
Morpheus: Benchmarking Physical Reasoning of Video Generative Models with Real Physical Experiments
di: Zhang, Chenyu, et al.
Pubblicazione: (2025)
di: Zhang, Chenyu, et al.
Pubblicazione: (2025)
LoTUS: Large-Scale Machine Unlearning with a Taste of Uncertainty
di: Spartalis, Christoforos N., et al.
Pubblicazione: (2025)
di: Spartalis, Christoforos N., et al.
Pubblicazione: (2025)
Universal Video Temporal Grounding with Generative Multi-modal Large Language Models
di: Li, Zeqian, et al.
Pubblicazione: (2025)
di: Li, Zeqian, et al.
Pubblicazione: (2025)
Reason3D: Searching and Reasoning 3D Segmentation via Large Language Model
di: Huang, Kuan-Chih, et al.
Pubblicazione: (2024)
di: Huang, Kuan-Chih, et al.
Pubblicazione: (2024)
Grounded Question-Answering in Long Egocentric Videos
di: Di, Shangzhe, et al.
Pubblicazione: (2023)
di: Di, Shangzhe, et al.
Pubblicazione: (2023)
Probabilistic Interactive 3D Segmentation with Hierarchical Neural Processes
di: Liu, Jie, et al.
Pubblicazione: (2025)
di: Liu, Jie, et al.
Pubblicazione: (2025)
Rethinking the Global Knowledge of CLIP in Training-Free Open-Vocabulary Semantic Segmentation
di: Wang, Jingyun, et al.
Pubblicazione: (2025)
di: Wang, Jingyun, et al.
Pubblicazione: (2025)
ViLLa: Video Reasoning Segmentation with Large Language Model
di: Zheng, Rongkun, et al.
Pubblicazione: (2024)
di: Zheng, Rongkun, et al.
Pubblicazione: (2024)
Dual Guidance Semi-Supervised Action Detection
di: Singh, Ankit, et al.
Pubblicazione: (2025)
di: Singh, Ankit, et al.
Pubblicazione: (2025)
Improving the Reasoning of Multi-Image Grounding in MLLMs via Reinforcement Learning
di: Zhang, Bob, et al.
Pubblicazione: (2025)
di: Zhang, Bob, et al.
Pubblicazione: (2025)
Online Reasoning Video Object Segmentation
di: Liu, Jinyuan, et al.
Pubblicazione: (2026)
di: Liu, Jinyuan, et al.
Pubblicazione: (2026)
Grounded Multi-Hop VideoQA in Long-Form Egocentric Videos
di: Chen, Qirui, et al.
Pubblicazione: (2024)
di: Chen, Qirui, et al.
Pubblicazione: (2024)
Any-Resolution AI-Generated Image Detection by Spectral Learning
di: Karageorgiou, Dimitrios, et al.
Pubblicazione: (2024)
di: Karageorgiou, Dimitrios, et al.
Pubblicazione: (2024)
Aerial Monocular 3D Object Detection
di: Hu, Yue, et al.
Pubblicazione: (2022)
di: Hu, Yue, et al.
Pubblicazione: (2022)
Dream to Manipulate: Compositional World Models Empowering Robot Imitation Learning with Imagination
di: Barcellona, Leonardo, et al.
Pubblicazione: (2024)
di: Barcellona, Leonardo, et al.
Pubblicazione: (2024)
VISA: Group-wise Visual Token Selection and Aggregation via Graph Summarization for Efficient MLLMs Inference
di: Jiang, Pengfei, et al.
Pubblicazione: (2025)
di: Jiang, Pengfei, et al.
Pubblicazione: (2025)
LISA: Reasoning Segmentation via Large Language Model
di: Lai, Xin, et al.
Pubblicazione: (2023)
di: Lai, Xin, et al.
Pubblicazione: (2023)
SegVG: Transferring Object Bounding Box to Segmentation for Visual Grounding
di: Kang, Weitai, et al.
Pubblicazione: (2024)
di: Kang, Weitai, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Mining Open Semantics from CLIP: A Relation Transition Perspective for Few-Shot Learning
di: Yan, Cilin, et al.
Pubblicazione: (2024) -
Object-centric Video Question Answering with Visual Grounding and Referring
di: Wang, Haochen, et al.
Pubblicazione: (2025) -
PiClick: Picking the desired mask from multiple candidates in click-based interactive segmentation
di: Yan, Cilin, et al.
Pubblicazione: (2023) -
LTCA: Long-range Temporal Context Attention for Referring Video Object Segmentation
di: Yan, Cilin, et al.
Pubblicazione: (2025) -
CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models
di: Li, Jingyao, et al.
Pubblicazione: (2025)