Enriching Phrases with Coupled Pixel and Object Contexts for Panoptic Narrative Grounding
Fuente:
arXiv
Saved in:
| Main Authors: | Hui, Tianrui, Ding, Zihan, Huang, Junshi, Wei, Xiaoming, Wei, Xiaolin, Dai, Jiao, Han, Jizhong, Liu, Si |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Dynamic Prompting of Frozen Text-to-Image Diffusion Models for Panoptic Narrative Grounding
by: Li, Hongyu, et al.
Published: (2024)
by: Li, Hongyu, et al.
Published: (2024)
Unleashing the Temporal-Spatial Reasoning Capacity of GPT for Training-Free Audio and Language Referenced Video Object Segmentation
by: Huang, Shaofei, et al.
Published: (2024)
by: Huang, Shaofei, et al.
Published: (2024)
FreeEdit: Mask-free Reference-based Image Editing with Multi-modal Instruction
by: He, Runze, et al.
Published: (2024)
by: He, Runze, et al.
Published: (2024)
Phrase Grounding-based Style Transfer for Single-Domain Generalized Object Detection
by: Li, Hao, et al.
Published: (2024)
by: Li, Hao, et al.
Published: (2024)
LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding
by: Li, Hongyu, et al.
Published: (2025)
by: Li, Hongyu, et al.
Published: (2025)
PEAR: Phrase-Based Hand-Object Interaction Anticipation
by: Zhang, Zichen, et al.
Published: (2024)
by: Zhang, Zichen, et al.
Published: (2024)
Multi-label Classification with Panoptic Context Aggregation Networks
by: Jiu, Mingyuan, et al.
Published: (2025)
by: Jiu, Mingyuan, et al.
Published: (2025)
Generalised Medical Phrase Grounding
by: Zhang, Wenjun, et al.
Published: (2025)
by: Zhang, Wenjun, et al.
Published: (2025)
Enhancing Self-Supervised Fine-Grained Video Object Tracking with Dynamic Memory Prediction
by: Zhou, Zihan, et al.
Published: (2025)
by: Zhou, Zihan, et al.
Published: (2025)
Panoptic-FlashOcc: An Efficient Baseline to Marry Semantic Occupancy with Panoptic via Instance Center
by: Yu, Zichen, et al.
Published: (2024)
by: Yu, Zichen, et al.
Published: (2024)
Generalizable Object Re-Identification via Visual In-Context Prompting
by: Huang, Zhizhong, et al.
Published: (2025)
by: Huang, Zhizhong, et al.
Published: (2025)
Uncertainty-aware Medical Diagnostic Phrase Identification and Grounding
by: Zou, Ke, et al.
Published: (2024)
by: Zou, Ke, et al.
Published: (2024)
Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation
by: Zhang, Wenchao, et al.
Published: (2025)
by: Zhang, Wenchao, et al.
Published: (2025)
Model Will Tell: Training Membership Inference for Diffusion Models
by: Fu, Xiaomeng, et al.
Published: (2024)
by: Fu, Xiaomeng, et al.
Published: (2024)
Pixel-SAIL: Single Transformer For Pixel-Grounded Understanding
by: Zhang, Tao, et al.
Published: (2025)
by: Zhang, Tao, et al.
Published: (2025)
FrequencyBooster: Full-Frequency Modeling for High-Fidelity Pixel Diffusion
by: Ma, Lichen, et al.
Published: (2026)
by: Ma, Lichen, et al.
Published: (2026)
HyperDiT: Hyper-Connected Transformers for High-Fidelity Pixel-Space Diffusion
by: He, Yu, et al.
Published: (2026)
by: He, Yu, et al.
Published: (2026)
Exploring Phrase-Level Grounding with Text-to-Image Diffusion Model
by: Yang, Danni, et al.
Published: (2024)
by: Yang, Danni, et al.
Published: (2024)
Panoptic Scene Graph Generation with Semantics-Prototype Learning
by: Li, Li, et al.
Published: (2023)
by: Li, Li, et al.
Published: (2023)
Generate to Ground: Multimodal Text Conditioning Boosts Phrase Grounding in Medical Vision-Language Models
by: Nützel, Felix, et al.
Published: (2025)
by: Nützel, Felix, et al.
Published: (2025)
Empower Words: DualGround for Structured Phrase and Sentence-Level Temporal Grounding
by: Kang, Minseok, et al.
Published: (2025)
by: Kang, Minseok, et al.
Published: (2025)
Unveiling Structural Memorization: Structural Membership Inference Attack for Text-to-Image Diffusion Models
by: Li, Qiao, et al.
Published: (2024)
by: Li, Qiao, et al.
Published: (2024)
Learning to Discover Forgery Cues for Face Forgery Detection
by: Tian, Jiahe, et al.
Published: (2024)
by: Tian, Jiahe, et al.
Published: (2024)
PanSR: An Object-Centric Mask Transformer for Panoptic Segmentation
by: Žust, Lojze, et al.
Published: (2024)
by: Žust, Lojze, et al.
Published: (2024)
Anchor3DLane++: 3D Lane Detection via Sample-Adaptive Sparse 3D Anchor Regression
by: Huang, Shaofei, et al.
Published: (2024)
by: Huang, Shaofei, et al.
Published: (2024)
Enriching Information and Preserving Semantic Consistency in Expanding Curvilinear Object Segmentation Datasets
by: Lei, Qin, et al.
Published: (2024)
by: Lei, Qin, et al.
Published: (2024)
Re-Align: Structured Reasoning-guided Alignment for In-Context Image Generation and Editing
by: He, Runze, et al.
Published: (2026)
by: He, Runze, et al.
Published: (2026)
Leveraging Motion Information for Better Self-Supervised Video Correspondence Learning
by: Zhou, Zihan, et al.
Published: (2025)
by: Zhou, Zihan, et al.
Published: (2025)
COCO-OLAC: A Benchmark for Occluded Panoptic Segmentation and Image Understanding
by: Wei, Wenbo, et al.
Published: (2024)
by: Wei, Wenbo, et al.
Published: (2024)
PLGS: Robust Panoptic Lifting with 3D Gaussian Splatting
by: Wang, Yu, et al.
Published: (2024)
by: Wang, Yu, et al.
Published: (2024)
Pixel-level Quality Assessment for Oriented Object Detection
by: Zhu, Yunhui, et al.
Published: (2025)
by: Zhu, Yunhui, et al.
Published: (2025)
Phrase Decoupling Cross-Modal Hierarchical Matching and Progressive Position Correction for Visual Grounding
by: Xie, Minghong, et al.
Published: (2024)
by: Xie, Minghong, et al.
Published: (2024)
Zero-Shot Medical Phrase Grounding with Off-the-shelf Diffusion Models
by: Vilouras, Konstantinos, et al.
Published: (2024)
by: Vilouras, Konstantinos, et al.
Published: (2024)
Mitigating Object Hallucination in MLLMs via Data-augmented Phrase-level Alignment
by: Sarkar, Pritam, et al.
Published: (2024)
by: Sarkar, Pritam, et al.
Published: (2024)
Leverage Task Context for Object Affordance Ranking
by: Huang, Haojie, et al.
Published: (2024)
by: Huang, Haojie, et al.
Published: (2024)
A Comparison of Object Detection and Phrase Grounding Models in Chest X-ray Abnormality Localization using Eye-tracking Data
by: Ghelichkhan, Elham, et al.
Published: (2025)
by: Ghelichkhan, Elham, et al.
Published: (2025)
PixelMan: Consistent Object Editing with Diffusion Models via Pixel Manipulation and Generation
by: Jiang, Liyao, et al.
Published: (2024)
by: Jiang, Liyao, et al.
Published: (2024)
PanopticRecon: Leverage Open-vocabulary Instance Segmentation for Zero-shot Panoptic Reconstruction
by: Yu, Xuan, et al.
Published: (2024)
by: Yu, Xuan, et al.
Published: (2024)
PixelLM: Pixel Reasoning with Large Multimodal Model
by: Ren, Zhongwei, et al.
Published: (2023)
by: Ren, Zhongwei, et al.
Published: (2023)
GeoPixel: Pixel Grounding Large Multimodal Model in Remote Sensing
by: Shabbir, Akashah, et al.
Published: (2025)
by: Shabbir, Akashah, et al.
Published: (2025)
Similar Items
-
Dynamic Prompting of Frozen Text-to-Image Diffusion Models for Panoptic Narrative Grounding
by: Li, Hongyu, et al.
Published: (2024) -
Unleashing the Temporal-Spatial Reasoning Capacity of GPT for Training-Free Audio and Language Referenced Video Object Segmentation
by: Huang, Shaofei, et al.
Published: (2024) -
FreeEdit: Mask-free Reference-based Image Editing with Multi-modal Instruction
by: He, Runze, et al.
Published: (2024) -
Phrase Grounding-based Style Transfer for Single-Domain Generalized Object Detection
by: Li, Hao, et al.
Published: (2024) -
LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding
by: Li, Hongyu, et al.
Published: (2025)