From Semantics, Scene to Instance-awareness: Distilling Foundation Model for Grounded Open-vocabulary Situation Recognition
Fuente:
arXiv
Saved in:
| Main Authors: | Cai, Chen, Liu, Tianyi, Gao, Jianjun, Liu, Wenyang, Wu, Kejun, Wang, Ruoyu, Wang, Yi, Liew, Soo Chin |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Relation-aware Hierarchical Prompt for Open-vocabulary Scene Graph Generation
by: Liu, Tao, et al.
Published: (2024)
by: Liu, Tao, et al.
Published: (2024)
CM2-Net: Continual Cross-Modal Mapping Network for Driver Action Recognition
by: Wang, Ruoyu, et al.
Published: (2024)
by: Wang, Ruoyu, et al.
Published: (2024)
CL-HOI: Cross-Level Human-Object Interaction Distillation from Vision Large Language Models
by: Gao, Jianjun, et al.
Published: (2024)
by: Gao, Jianjun, et al.
Published: (2024)
OpenInsGaussian: Open-vocabulary Instance Gaussian Segmentation with Context-aware Cross-view Fusion
by: Huang, Tianyu, et al.
Published: (2025)
by: Huang, Tianyu, et al.
Published: (2025)
OpenVIS: Open-vocabulary Video Instance Segmentation
by: Guo, Pinxue, et al.
Published: (2023)
by: Guo, Pinxue, et al.
Published: (2023)
PromptSR: Cascade Prompting for Lightweight Image Super-Resolution
by: Liu, Wenyang, et al.
Published: (2025)
by: Liu, Wenyang, et al.
Published: (2025)
Instance Brownian Bridge as Texts for Open-vocabulary Video Instance Segmentation
by: Cheng, Zesen, et al.
Published: (2024)
by: Cheng, Zesen, et al.
Published: (2024)
ByteNet: Rethinking Multimedia File Fragment Classification through Visual Perspectives
by: Liu, Wenyang, et al.
Published: (2024)
by: Liu, Wenyang, et al.
Published: (2024)
FM-Fusion: Instance-aware Semantic Mapping Boosted by Vision-Language Foundation Models
by: Liu, Chuhao, et al.
Published: (2024)
by: Liu, Chuhao, et al.
Published: (2024)
OpenVox: Real-time Instance-level Open-vocabulary Probabilistic Voxel Representation
by: Deng, Yinan, et al.
Published: (2025)
by: Deng, Yinan, et al.
Published: (2025)
PanopticRecon: Leverage Open-vocabulary Instance Segmentation for Zero-shot Panoptic Reconstruction
by: Yu, Xuan, et al.
Published: (2024)
by: Yu, Xuan, et al.
Published: (2024)
Towards Blind Bitstream-corrupted Video Recovery via a Visual Foundation Model-driven Framework
by: Liu, Tianyi, et al.
Published: (2025)
by: Liu, Tianyi, et al.
Published: (2025)
From Data to Modeling: Fully Open-vocabulary Scene Graph Generation
by: Chen, Zuyao, et al.
Published: (2025)
by: Chen, Zuyao, et al.
Published: (2025)
L2COcc: Lightweight Camera-Centric Semantic Scene Completion via Distillation of LiDAR Model
by: Wang, Ruoyu, et al.
Published: (2025)
by: Wang, Ruoyu, et al.
Published: (2025)
Details Matter for Indoor Open-vocabulary 3D Instance Segmentation
by: Jung, Sanghun, et al.
Published: (2025)
by: Jung, Sanghun, et al.
Published: (2025)
SSH-Net: A Self-Supervised and Hybrid Network for Noisy Image Watermark Removal
by: Liu, Wenyang, et al.
Published: (2025)
by: Liu, Wenyang, et al.
Published: (2025)
Improving Generalized Visual Grounding with Instance-aware Joint Learning
by: Dai, Ming, et al.
Published: (2025)
by: Dai, Ming, et al.
Published: (2025)
Director: Instance-aware Gaussian Splatting for Dynamic Scene Modeling and Understanding
by: Jiang, Yuheng, et al.
Published: (2026)
by: Jiang, Yuheng, et al.
Published: (2026)
OpenFusion++: An Open-vocabulary Real-time Scene Understanding System
by: Jin, Xiaofeng, et al.
Published: (2025)
by: Jin, Xiaofeng, et al.
Published: (2025)
Open-RGBT: Open-vocabulary RGB-T Zero-shot Semantic Segmentation in Open-world Environments
by: Yu, Meng, et al.
Published: (2024)
by: Yu, Meng, et al.
Published: (2024)
SHiNe: Semantic Hierarchy Nexus for Open-vocabulary Object Detection
by: Liu, Mingxuan, et al.
Published: (2024)
by: Liu, Mingxuan, et al.
Published: (2024)
Kramers-Kronig Relations and Causality in Non-Markovian Open Quantum Dynamics: Kernel, State, and Effective Kernel
by: Liu, Kejun
Published: (2026)
by: Liu, Kejun
Published: (2026)
Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion
by: Liu, Enyu, et al.
Published: (2025)
by: Liu, Enyu, et al.
Published: (2025)
OV-NeRF: Open-vocabulary Neural Radiance Fields with Vision and Language Foundation Models for 3D Semantic Understanding
by: Liao, Guibiao, et al.
Published: (2024)
by: Liao, Guibiao, et al.
Published: (2024)
OpenIns3D: Snap and Lookup for 3D Open-vocabulary Instance Segmentation
by: Huang, Zhening, et al.
Published: (2023)
by: Huang, Zhening, et al.
Published: (2023)
OpenTie: Open-vocabulary Sequential Rebar Tying System
by: Liu, Mingze, et al.
Published: (2025)
by: Liu, Mingze, et al.
Published: (2025)
Semantic-CD: Remote Sensing Image Semantic Change Detection towards Open-vocabulary Setting
by: Zhu, Yongshuo, et al.
Published: (2025)
by: Zhu, Yongshuo, et al.
Published: (2025)
Semantic Consistent Language Gaussian Splatting for Point-Level Open-vocabulary Querying
by: Yin, Hairong, et al.
Published: (2025)
by: Yin, Hairong, et al.
Published: (2025)
Video sentence grounding with temporally global textual knowledge
by: Chen, Cai, et al.
Published: (2024)
by: Chen, Cai, et al.
Published: (2024)
FLOSS: Free Lunch in Open-vocabulary Semantic Segmentation
by: Benigmim, Yasser, et al.
Published: (2025)
by: Benigmim, Yasser, et al.
Published: (2025)
VEOcc: Voxel-Centric Online Semantic Occupancy Prediction For Embodied Scene Understanding
by: Wang, Ruoyu, et al.
Published: (2026)
by: Wang, Ruoyu, et al.
Published: (2026)
Parameter-efficient Fine-tuning in Hyperspherical Space for Open-vocabulary Semantic Segmentation
by: Peng, Zelin, et al.
Published: (2024)
by: Peng, Zelin, et al.
Published: (2024)
Multi-Grained Cross-modal Alignment for Learning Open-vocabulary Semantic Segmentation from Text Supervision
by: Liu, Yajie, et al.
Published: (2024)
by: Liu, Yajie, et al.
Published: (2024)
MultiFuser: Multimodal Fusion Transformer for Enhanced Driver Action Recognition
by: Wang, Ruoyu, et al.
Published: (2024)
by: Wang, Ruoyu, et al.
Published: (2024)
ARM: A Learnable, Plug-and-Play Module for CLIP-based Open-vocabulary Semantic Segmentation
by: Liu, Ziquan, et al.
Published: (2025)
by: Liu, Ziquan, et al.
Published: (2025)
MR-COGraphs: Communication-efficient Multi-Robot Open-vocabulary Mapping System via 3D Scene Graphs
by: Gu, Qiuyi, et al.
Published: (2024)
by: Gu, Qiuyi, et al.
Published: (2024)
Confidence-aware Self-Semantic Distillation on Knowledge Graph Embedding
by: Liu, Yichen, et al.
Published: (2022)
by: Liu, Yichen, et al.
Published: (2022)
IGLOSS: Image Generation for Lidar Open-vocabulary Semantic Segmentation
by: Samet, Nermin, et al.
Published: (2026)
by: Samet, Nermin, et al.
Published: (2026)
Empowering Large Language Model for Continual Video Question Answering with Collaborative Prompting
by: Cai, Chen, et al.
Published: (2024)
by: Cai, Chen, et al.
Published: (2024)
Not All Voxels Are Equal: Hardness-Aware Semantic Scene Completion with Self-Distillation
by: Wang, Song, et al.
Published: (2024)
by: Wang, Song, et al.
Published: (2024)
Similar Items
-
Relation-aware Hierarchical Prompt for Open-vocabulary Scene Graph Generation
by: Liu, Tao, et al.
Published: (2024) -
CM2-Net: Continual Cross-Modal Mapping Network for Driver Action Recognition
by: Wang, Ruoyu, et al.
Published: (2024) -
CL-HOI: Cross-Level Human-Object Interaction Distillation from Vision Large Language Models
by: Gao, Jianjun, et al.
Published: (2024) -
OpenInsGaussian: Open-vocabulary Instance Gaussian Segmentation with Context-aware Cross-view Fusion
by: Huang, Tianyu, et al.
Published: (2025) -
OpenVIS: Open-vocabulary Video Instance Segmentation
by: Guo, Pinxue, et al.
Published: (2023)