Exploring Vision-Language Models for Open-Vocabulary Zero-Shot Action Segmentation
Fuente:
arXiv
Guardado en:
| Autores principales: | Unmesh, Asim, Ramesh, Kaki, Patel, Mayank, Jain, Rahul, Ramani, Karthik |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MechVerse: Evaluating Physical Motion Consistency in Video Generation Models
por: Jain, Rahul, et al.
Publicado: (2026)
por: Jain, Rahul, et al.
Publicado: (2026)
DYNAMO: Dependency-Aware Deep Learning Framework for Articulated Assembly Motion Prediction
por: Patel, Mayank, et al.
Publicado: (2025)
por: Patel, Mayank, et al.
Publicado: (2025)
Synthetic Captions for Open-Vocabulary Zero-Shot Segmentation
por: Lebailly, Tim, et al.
Publicado: (2025)
por: Lebailly, Tim, et al.
Publicado: (2025)
A Simple Framework for Open-Vocabulary Zero-Shot Segmentation
por: Stegmüller, Thomas, et al.
Publicado: (2024)
por: Stegmüller, Thomas, et al.
Publicado: (2024)
Interactive authoring of outcome-oriented lesson plans for immersive Virtual Reality training
por: Ipsita, Ananya, et al.
Publicado: (2025)
por: Ipsita, Ananya, et al.
Publicado: (2025)
Open-Vocabulary Camouflaged Object Segmentation with Cascaded Vision Language Models
por: Zhao, Kai, et al.
Publicado: (2025)
por: Zhao, Kai, et al.
Publicado: (2025)
Beyond-Labels: Advancing Open-Vocabulary Segmentation With Vision-Language Models
por: Rahman, Muhammad Atta ur, et al.
Publicado: (2025)
por: Rahman, Muhammad Atta ur, et al.
Publicado: (2025)
RADSeg: Unleashing Parameter and Compute Efficient Zero-Shot Open-Vocabulary Segmentation Using Agglomerative Models
por: Alama, Omar, et al.
Publicado: (2025)
por: Alama, Omar, et al.
Publicado: (2025)
Zero-Shot Open-Vocabulary Tracking with Large Pre-Trained Models
por: Chu, Wen-Hsuan, et al.
Publicado: (2023)
por: Chu, Wen-Hsuan, et al.
Publicado: (2023)
Zero-Shot Dual-Path Integration Framework for Open-Vocabulary 3D Instance Segmentation
por: Ton, Tri, et al.
Publicado: (2024)
por: Ton, Tri, et al.
Publicado: (2024)
Test-Time Adaptation of Vision-Language Models for Open-Vocabulary Semantic Segmentation
por: Noori, Mehrdad, et al.
Publicado: (2025)
por: Noori, Mehrdad, et al.
Publicado: (2025)
Adapting Vision-Language Model with Fine-grained Semantics for Open-Vocabulary Segmentation
por: Chng, Yong Xien, et al.
Publicado: (2024)
por: Chng, Yong Xien, et al.
Publicado: (2024)
Leveraging Vision-Language Models for Open-Vocabulary Instance Segmentation and Tracking
por: Pätzold, Bastian, et al.
Publicado: (2025)
por: Pätzold, Bastian, et al.
Publicado: (2025)
Training-Free Zero-Shot Temporal Action Detection with Vision-Language Models
por: Han, Chaolei, et al.
Publicado: (2025)
por: Han, Chaolei, et al.
Publicado: (2025)
RAZER: Robust Accelerated Zero-Shot 3D Open-Vocabulary Panoptic Reconstruction with Spatio-Temporal Aggregation
por: Patel, Naman, et al.
Publicado: (2025)
por: Patel, Naman, et al.
Publicado: (2025)
ZS-VCOS: Zero-Shot Video Camouflaged Object Segmentation By Optical Flow and Open Vocabulary Object Detection
por: Guo, Wenqi, et al.
Publicado: (2025)
por: Guo, Wenqi, et al.
Publicado: (2025)
Open-Nav: Exploring Zero-Shot Vision-and-Language Navigation in Continuous Environment with Open-Source LLMs
por: Qiao, Yanyuan, et al.
Publicado: (2024)
por: Qiao, Yanyuan, et al.
Publicado: (2024)
Test-Time Low Rank Adaptation via Confidence Maximization for Zero-Shot Generalization of Vision-Language Models
por: Imam, Raza, et al.
Publicado: (2024)
por: Imam, Raza, et al.
Publicado: (2024)
Exploring the Zero-Shot Capabilities of Vision-Language Models for Improving Gaze Following
por: Gupta, Anshul, et al.
Publicado: (2024)
por: Gupta, Anshul, et al.
Publicado: (2024)
OV-MAP : Open-Vocabulary Zero-Shot 3D Instance Segmentation Map for Robots
por: Kim, Juno, et al.
Publicado: (2025)
por: Kim, Juno, et al.
Publicado: (2025)
Zero-Shot Open-Vocabulary Human Motion Grounding with Test-Time Training
por: Zhou, Yunjiao, et al.
Publicado: (2025)
por: Zhou, Yunjiao, et al.
Publicado: (2025)
Diffusion Models for Open-Vocabulary Segmentation
por: Karazija, Laurynas, et al.
Publicado: (2023)
por: Karazija, Laurynas, et al.
Publicado: (2023)
Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection
por: Bao, Wentao, et al.
Publicado: (2024)
por: Bao, Wentao, et al.
Publicado: (2024)
Collaborative Vision-Text Representation Optimizing for Open-Vocabulary Segmentation
por: Jiao, Siyu, et al.
Publicado: (2024)
por: Jiao, Siyu, et al.
Publicado: (2024)
Exploring Simple Open-Vocabulary Semantic Segmentation
por: Lai, Zihang
Publicado: (2024)
por: Lai, Zihang
Publicado: (2024)
Decomposed Vision-Language Alignment for Fine-Grained Open-Vocabulary Segmentation
por: Wang, Chenhao, et al.
Publicado: (2026)
por: Wang, Chenhao, et al.
Publicado: (2026)
Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models
por: Ranasinghe, Yasiru, et al.
Publicado: (2025)
por: Ranasinghe, Yasiru, et al.
Publicado: (2025)
Emergent Open-Vocabulary Semantic Segmentation from Off-the-shelf Vision-Language Models
por: Luo, Jiayun, et al.
Publicado: (2023)
por: Luo, Jiayun, et al.
Publicado: (2023)
MROVSeg: Breaking the Resolution Curse of Vision-Language Models in Open-Vocabulary Image Segmentation
por: Zhu, Yuanbing, et al.
Publicado: (2024)
por: Zhu, Yuanbing, et al.
Publicado: (2024)
fine-CLIP: Enhancing Zero-Shot Fine-Grained Surgical Action Recognition with Vision-Language Models
por: Sharma, Saurav, et al.
Publicado: (2025)
por: Sharma, Saurav, et al.
Publicado: (2025)
Exploring Vision-Language Models for Online Signature Verification: A Zero-Shot Capability Study
por: Robledo-Moreno, Marta, et al.
Publicado: (2026)
por: Robledo-Moreno, Marta, et al.
Publicado: (2026)
Harnessing Vision Foundation Models for High-Performance, Training-Free Open Vocabulary Segmentation
por: Shi, Yuheng, et al.
Publicado: (2024)
por: Shi, Yuheng, et al.
Publicado: (2024)
Explore the Potential of CLIP for Training-Free Open Vocabulary Semantic Segmentation
por: Shao, Tong, et al.
Publicado: (2024)
por: Shao, Tong, et al.
Publicado: (2024)
From Open-Vocabulary to Vocabulary-Free Semantic Segmentation
por: Reichard, Klara, et al.
Publicado: (2025)
por: Reichard, Klara, et al.
Publicado: (2025)
Scaling Open-Vocabulary Action Detection
por: Sia, Zhen Hao, et al.
Publicado: (2025)
por: Sia, Zhen Hao, et al.
Publicado: (2025)
Exploring Efficient Open-Vocabulary Segmentation in the Remote Sensing
por: Li, Bingyu, et al.
Publicado: (2025)
por: Li, Bingyu, et al.
Publicado: (2025)
Cascade-CLIP: Cascaded Vision-Language Embeddings Alignment for Zero-Shot Semantic Segmentation
por: Li, Yunheng, et al.
Publicado: (2024)
por: Li, Yunheng, et al.
Publicado: (2024)
3D Open-Vocabulary Panoptic Segmentation with 2D-3D Vision-Language Distillation
por: Xiao, Zihao, et al.
Publicado: (2024)
por: Xiao, Zihao, et al.
Publicado: (2024)
Reasoning3D -- Grounding and Reasoning in 3D: Fine-Grained Zero-Shot Open-Vocabulary 3D Reasoning Part Segmentation via Large Vision-Language Models
por: Chen, Tianrun, et al.
Publicado: (2024)
por: Chen, Tianrun, et al.
Publicado: (2024)
DOZE: A Dataset for Open-Vocabulary Zero-Shot Object Navigation in Dynamic Environments
por: Ma, Ji, et al.
Publicado: (2024)
por: Ma, Ji, et al.
Publicado: (2024)
Ejemplares similares
-
MechVerse: Evaluating Physical Motion Consistency in Video Generation Models
por: Jain, Rahul, et al.
Publicado: (2026) -
DYNAMO: Dependency-Aware Deep Learning Framework for Articulated Assembly Motion Prediction
por: Patel, Mayank, et al.
Publicado: (2025) -
Synthetic Captions for Open-Vocabulary Zero-Shot Segmentation
por: Lebailly, Tim, et al.
Publicado: (2025) -
A Simple Framework for Open-Vocabulary Zero-Shot Segmentation
por: Stegmüller, Thomas, et al.
Publicado: (2024) -
Interactive authoring of outcome-oriented lesson plans for immersive Virtual Reality training
por: Ipsita, Ananya, et al.
Publicado: (2025)