Local-Global Context Aware Transformer for Language-Guided Video Segmentation
Fuente:
arXiv
Guardado en:
| Autores principales: | Liang, Chen, Wang, Wenguan, Zhou, Tianfei, Miao, Jiaxu, Luo, Yawei, Yang, Yi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2022
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Scalable Video Object Segmentation with Identification Mechanism
por: Yang, Zongxin, et al.
Publicado: (2022)
por: Yang, Zongxin, et al.
Publicado: (2022)
Rethinking Cross-modal Interaction from a Top-down Perspective for Referring Video Object Segmentation
por: Liang, Chen, et al.
Publicado: (2021)
por: Liang, Chen, et al.
Publicado: (2021)
Nonverbal Interaction Detection
por: Wei, Jianan, et al.
Publicado: (2024)
por: Wei, Jianan, et al.
Publicado: (2024)
ClawCraneNet: Leveraging Object-level Relation for Text-based Video Segmentation
por: Liang, Chen, et al.
Publicado: (2021)
por: Liang, Chen, et al.
Publicado: (2021)
Image Segmentation in Foundation Model Era: A Survey
por: Zhou, Tianfei, et al.
Publicado: (2024)
por: Zhou, Tianfei, et al.
Publicado: (2024)
General and Task-Oriented Video Segmentation
por: Chen, Mu, et al.
Publicado: (2024)
por: Chen, Mu, et al.
Publicado: (2024)
Efficiency Follows Global-Local Decoupling
por: Yang, Zhenyu, et al.
Publicado: (2026)
por: Yang, Zhenyu, et al.
Publicado: (2026)
SinkTrack: Attention Sink based Context Anchoring for Large Language Models
por: Liu, Xu, et al.
Publicado: (2026)
por: Liu, Xu, et al.
Publicado: (2026)
DIFFVSGG: Diffusion-Driven Online Video Scene Graph Generation
por: Chen, Mu, et al.
Publicado: (2025)
por: Chen, Mu, et al.
Publicado: (2025)
DICS: Find Domain-Invariant and Class-Specific Features for Out-of-Distribution Generalization
por: Miao, Qiaowei, et al.
Publicado: (2024)
por: Miao, Qiaowei, et al.
Publicado: (2024)
Volumetric Environment Representation for Vision-Language Navigation
por: Liu, Rui, et al.
Publicado: (2024)
por: Liu, Rui, et al.
Publicado: (2024)
Vision-Language Navigation with Energy-Based Policy
por: Liu, Rui, et al.
Publicado: (2024)
por: Liu, Rui, et al.
Publicado: (2024)
Clustering Propagation for Universal Medical Image Segmentation
por: Ding, Yuhang, et al.
Publicado: (2024)
por: Ding, Yuhang, et al.
Publicado: (2024)
DoraemonGPT: Toward Understanding Dynamic Scenes with Large Language Models (Exemplified as A Video Agent)
por: Yang, Zongxin, et al.
Publicado: (2024)
por: Yang, Zongxin, et al.
Publicado: (2024)
Navigation Instruction Generation with BEV Perception and Large Language Models
por: Fan, Sheng, et al.
Publicado: (2024)
por: Fan, Sheng, et al.
Publicado: (2024)
VideoRFT: Incentivizing Video Reasoning Capability in MLLMs via Reinforced Fine-Tuning
por: Wang, Qi, et al.
Publicado: (2025)
por: Wang, Qi, et al.
Publicado: (2025)
Learning Local and Global Temporal Contexts for Video Semantic Segmentation
por: Sun, Guolei, et al.
Publicado: (2022)
por: Sun, Guolei, et al.
Publicado: (2022)
Human-Object Interaction Detection Collaborated with Large Relation-driven Diffusion Models
por: Li, Liulei, et al.
Publicado: (2024)
por: Li, Liulei, et al.
Publicado: (2024)
Local2Global query Alignment for Video Instance Segmentation
por: Koner, Rajat, et al.
Publicado: (2025)
por: Koner, Rajat, et al.
Publicado: (2025)
Hydra-SGG: Hybrid Relation Assignment for One-stage Scene Graph Generation
por: Chen, Minghan, et al.
Publicado: (2024)
por: Chen, Minghan, et al.
Publicado: (2024)
CAVIS: Context-Aware Video Instance Segmentation
por: Lee, Seunghun, et al.
Publicado: (2024)
por: Lee, Seunghun, et al.
Publicado: (2024)
Hybrid Local-Global Context Learning for Neural Video Compression
por: Zhai, Yongqi, et al.
Publicado: (2024)
por: Zhai, Yongqi, et al.
Publicado: (2024)
Neural Clustering based Visual Representation Learning
por: Chen, Guikun, et al.
Publicado: (2024)
por: Chen, Guikun, et al.
Publicado: (2024)
Dynamic in Static: Hybrid Visual Correspondence for Self-Supervised Video Object Segmentation
por: Pei, Gensheng, et al.
Publicado: (2024)
por: Pei, Gensheng, et al.
Publicado: (2024)
TEFormer: Texture-Aware and Edge-Guided Transformer for Semantic Segmentation of Urban Remote Sensing Images
por: Zhou, Guoyu, et al.
Publicado: (2025)
por: Zhou, Guoyu, et al.
Publicado: (2025)
A Survey of World Models for Autonomous Driving
por: Feng, Tuo, et al.
Publicado: (2025)
por: Feng, Tuo, et al.
Publicado: (2025)
Uncertainty-Aware Gaussian Map for Vision-Language Navigation
por: Gao, Jianzhe, et al.
Publicado: (2026)
por: Gao, Jianzhe, et al.
Publicado: (2026)
Knowledge-guided Causal Intervention for Weakly-supervised Object Localization
por: Shao, Feifei, et al.
Publicado: (2023)
por: Shao, Feifei, et al.
Publicado: (2023)
LAVA: Language Driven Scalable and Versatile Traffic Video Analytics
por: Yu, Yanrui, et al.
Publicado: (2025)
por: Yu, Yanrui, et al.
Publicado: (2025)
Product-Level Try-on: Characteristics-preserving Try-on with Realistic Clothes Shading and Wrinkles
por: Zang, Yanlong, et al.
Publicado: (2024)
por: Zang, Yanlong, et al.
Publicado: (2024)
Scene Graph Generation with Role-Playing Large Language Models
por: Chen, Guikun, et al.
Publicado: (2024)
por: Chen, Guikun, et al.
Publicado: (2024)
GLUS: Global-Local Reasoning Unified into A Single Large Language Model for Video Segmentation
por: Lin, Lang, et al.
Publicado: (2025)
por: Lin, Lang, et al.
Publicado: (2025)
DGL: Dynamic Global-Local Prompt Tuning for Text-Video Retrieval
por: Yang, Xiangpeng, et al.
Publicado: (2024)
por: Yang, Xiangpeng, et al.
Publicado: (2024)
Video2Roleplay: A Multimodal Dataset and Framework for Video-Guided Role-playing Agents
por: Zhang, Xueqiao, et al.
Publicado: (2025)
por: Zhang, Xueqiao, et al.
Publicado: (2025)
LSK3DNet: Towards Effective and Efficient 3D Perception with Large Sparse Kernels
por: Feng, Tuo, et al.
Publicado: (2024)
por: Feng, Tuo, et al.
Publicado: (2024)
Counterfactual Co-occurring Learning for Bias Mitigation in Weakly-supervised Object Localization
por: Shao, Feifei, et al.
Publicado: (2023)
por: Shao, Feifei, et al.
Publicado: (2023)
History-Enhanced Two-Stage Transformer for Aerial Vision-and-Language Navigation
por: Ding, Xichen, et al.
Publicado: (2025)
por: Ding, Xichen, et al.
Publicado: (2025)
3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation
por: Gao, Jianzhe, et al.
Publicado: (2026)
por: Gao, Jianzhe, et al.
Publicado: (2026)
Enhancing Visual Forced Alignment with Local Context-Aware Feature Extraction and Multi-Task Learning
por: He, Yi, et al.
Publicado: (2025)
por: He, Yi, et al.
Publicado: (2025)
Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models
por: Li, Jinlong, et al.
Publicado: (2026)
por: Li, Jinlong, et al.
Publicado: (2026)
Ejemplares similares
-
Scalable Video Object Segmentation with Identification Mechanism
por: Yang, Zongxin, et al.
Publicado: (2022) -
Rethinking Cross-modal Interaction from a Top-down Perspective for Referring Video Object Segmentation
por: Liang, Chen, et al.
Publicado: (2021) -
Nonverbal Interaction Detection
por: Wei, Jianan, et al.
Publicado: (2024) -
ClawCraneNet: Leveraging Object-level Relation for Text-based Video Segmentation
por: Liang, Chen, et al.
Publicado: (2021) -
Image Segmentation in Foundation Model Era: A Survey
por: Zhou, Tianfei, et al.
Publicado: (2024)