GraCo: Granularity-Controllable Interactive Segmentation
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhao, Yian, Li, Kehan, Cheng, Zesen, Qiao, Pengchong, Zheng, Xiawu, Ji, Rongrong, Liu, Chang, Yuan, Li, Chen, Jie |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Instance Brownian Bridge as Texts for Open-vocabulary Video Instance Segmentation
von: Cheng, Zesen, et al.
Veröffentlicht: (2024)
von: Cheng, Zesen, et al.
Veröffentlicht: (2024)
iSegMan: Interactive Segment-and-Manipulate 3D Gaussians
von: Zhao, Yian, et al.
Veröffentlicht: (2025)
von: Zhao, Yian, et al.
Veröffentlicht: (2025)
Tune-Your-Style: Intensity-tunable 3D Style Transfer with Gaussian Splatting
von: Zhao, Yian, et al.
Veröffentlicht: (2026)
von: Zhao, Yian, et al.
Veröffentlicht: (2026)
Depth-Guided Semi-Supervised Instance Segmentation
von: Chen, Xin, et al.
Veröffentlicht: (2024)
von: Chen, Xin, et al.
Veröffentlicht: (2024)
Local Action-Guided Motion Diffusion Model for Text-to-Motion Generation
von: Jin, Peng, et al.
Veröffentlicht: (2024)
von: Jin, Peng, et al.
Veröffentlicht: (2024)
FaceChain-SuDe: Building Derived Class to Inherit Category Attributes for One-shot Subject-Driven Generation
von: Qiao, Pengchong, et al.
Veröffentlicht: (2024)
von: Qiao, Pengchong, et al.
Veröffentlicht: (2024)
GraSP-VL: Length as a Semantic Granularity Interface for Vision-Language Representations
von: Li, Zesheng, et al.
Veröffentlicht: (2026)
von: Li, Zesheng, et al.
Veröffentlicht: (2026)
Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models
von: Luo, Gen, et al.
Veröffentlicht: (2024)
von: Luo, Gen, et al.
Veröffentlicht: (2024)
Multi-branch Collaborative Learning Network for 3D Visual Grounding
von: Qian, Zhipeng, et al.
Veröffentlicht: (2024)
von: Qian, Zhipeng, et al.
Veröffentlicht: (2024)
Few-Shot Image Quality Assessment via Adaptation of Vision-Language Models
von: Li, Xudong, et al.
Veröffentlicht: (2024)
von: Li, Xudong, et al.
Veröffentlicht: (2024)
An Information Theory-inspired Strategy for Automatic Network Pruning
von: Zheng, Xiawu, et al.
Veröffentlicht: (2021)
von: Zheng, Xiawu, et al.
Veröffentlicht: (2021)
HASTE: Training-Free Video Diffusion Acceleration via Head-Wise Adaptive Sparse Attention
von: Zheng, Xuzhe, et al.
Veröffentlicht: (2026)
von: Zheng, Xuzhe, et al.
Veröffentlicht: (2026)
Breaking the Memory Barrier: Near Infinite Batch Size Scaling for Contrastive Loss
von: Cheng, Zesen, et al.
Veröffentlicht: (2024)
von: Cheng, Zesen, et al.
Veröffentlicht: (2024)
QuoTA: Query-oriented Token Assignment via CoT Query Decouple for Long Video Comprehension
von: Luo, Yongdong, et al.
Veröffentlicht: (2025)
von: Luo, Yongdong, et al.
Veröffentlicht: (2025)
Q-DeepSight: Incentivizing Thinking with Images for Image Quality Assessment and Refinement
von: Li, Xudong, et al.
Veröffentlicht: (2026)
von: Li, Xudong, et al.
Veröffentlicht: (2026)
SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning
von: Huang, Haoyu, et al.
Veröffentlicht: (2026)
von: Huang, Haoyu, et al.
Veröffentlicht: (2026)
PixelRefer: A Unified Framework for Spatio-Temporal Object Referring with Arbitrary Granularity
von: Yuan, Yuqian, et al.
Veröffentlicht: (2025)
von: Yuan, Yuqian, et al.
Veröffentlicht: (2025)
SGAD-SLAM: Splatting Gaussians at Adjusted Depth for Better Radiance Fields in RGBD SLAM
von: Hu, Pengchong, et al.
Veröffentlicht: (2026)
von: Hu, Pengchong, et al.
Veröffentlicht: (2026)
Learning Neural Implicit through Volume Rendering with Attentive Depth Fusion Priors
von: Hu, Pengchong, et al.
Veröffentlicht: (2023)
von: Hu, Pengchong, et al.
Veröffentlicht: (2023)
VTGaussian-SLAM: RGBD SLAM for Large Scale Scenes with Splatting View-Tied 3D Gaussians
von: Hu, Pengchong, et al.
Veröffentlicht: (2025)
von: Hu, Pengchong, et al.
Veröffentlicht: (2025)
Event-Anchored Frame Selection for Effective Long-Video Understanding
von: Chen, Wang, et al.
Veröffentlicht: (2026)
von: Chen, Wang, et al.
Veröffentlicht: (2026)
Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs
von: Li, Xudong, et al.
Veröffentlicht: (2025)
von: Li, Xudong, et al.
Veröffentlicht: (2025)
Rotated Multi-Scale Interaction Network for Referring Remote Sensing Image Segmentation
von: Liu, Sihan, et al.
Veröffentlicht: (2023)
von: Liu, Sihan, et al.
Veröffentlicht: (2023)
HRSAM: Efficient Interactive Segmentation in High-Resolution Images
von: Huang, You, et al.
Veröffentlicht: (2024)
von: Huang, You, et al.
Veröffentlicht: (2024)
Feature Denoising Diffusion Model for Blind Image Quality Assessment
von: Li, Xudong, et al.
Veröffentlicht: (2024)
von: Li, Xudong, et al.
Veröffentlicht: (2024)
Instruction-guided Multi-Granularity Segmentation and Captioning with Large Multimodal Model
von: Zhou, Li, et al.
Veröffentlicht: (2024)
von: Zhou, Li, et al.
Veröffentlicht: (2024)
Uncovering the Over-smoothing Challenge in Image Super-Resolution: Entropy-based Quantification and Contrastive Optimization
von: Xu, Tianshuo, et al.
Veröffentlicht: (2022)
von: Xu, Tianshuo, et al.
Veröffentlicht: (2022)
Rethinking 3D Dense Caption and Visual Grounding in A Unified Framework through Prompt-based Localization
von: Luo, Yongdong, et al.
Veröffentlicht: (2024)
von: Luo, Yongdong, et al.
Veröffentlicht: (2024)
Adaptive Feature Selection for No-Reference Image Quality Assessment by Mitigating Semantic Noise Sensitivity
von: Li, Xudong, et al.
Veröffentlicht: (2023)
von: Li, Xudong, et al.
Veröffentlicht: (2023)
From Objects to Events: Unlocking Complex Visual Understanding in Object Detectors via LLM-guided Symbolic Reasoning
von: Zeng, Yuhui, et al.
Veröffentlicht: (2025)
von: Zeng, Yuhui, et al.
Veröffentlicht: (2025)
Distill, Diffuse, and Semanticize (DDS): Annotation-Free 3D Scene Understanding Based on Multi-Granularity Distillation and Graph-Diffusion-Based Segmentation
von: Wang, Yijing, et al.
Veröffentlicht: (2026)
von: Wang, Yijing, et al.
Veröffentlicht: (2026)
DeNAS-ViT: Data Efficient NAS-Optimized Vision Transformer for Ultrasound Image Segmentation
von: Chen, Renqi, et al.
Veröffentlicht: (2024)
von: Chen, Renqi, et al.
Veröffentlicht: (2024)
Video Generation with Predictive Latents
von: Zhao, Yian, et al.
Veröffentlicht: (2026)
von: Zhao, Yian, et al.
Veröffentlicht: (2026)
MSP-MVS: Multi-Granularity Segmentation Prior Guided Multi-View Stereo
von: Yuan, Zhenlong, et al.
Veröffentlicht: (2024)
von: Yuan, Zhenlong, et al.
Veröffentlicht: (2024)
PixDLM: A Dual-Path Multimodal Language Model for UAV Reasoning Segmentation
von: Ke, Shuyan, et al.
Veröffentlicht: (2026)
von: Ke, Shuyan, et al.
Veröffentlicht: (2026)
Multi-Granularity and Multi-modal Feature Interaction Approach for Text Video Retrieval
von: Li, Wenjun, et al.
Veröffentlicht: (2024)
von: Li, Wenjun, et al.
Veröffentlicht: (2024)
Multi-Granularity Feature Calibration via VFM for Domain Generalized Semantic Segmentation
von: Li, Xinhui, et al.
Veröffentlicht: (2025)
von: Li, Xinhui, et al.
Veröffentlicht: (2025)
Video-RAG: Visually-aligned Retrieval-Augmented Long Video Comprehension
von: Luo, Yongdong, et al.
Veröffentlicht: (2024)
von: Luo, Yongdong, et al.
Veröffentlicht: (2024)
ShapeGraFormer: GraFormer-Based Network for Hand-Object Reconstruction from a Single Depth Map
von: Aboukhadra, Ahmed Tawfik, et al.
Veröffentlicht: (2023)
von: Aboukhadra, Ahmed Tawfik, et al.
Veröffentlicht: (2023)
Omni-Referring Image Segmentation
von: Zheng, Qiancheng, et al.
Veröffentlicht: (2025)
von: Zheng, Qiancheng, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Instance Brownian Bridge as Texts for Open-vocabulary Video Instance Segmentation
von: Cheng, Zesen, et al.
Veröffentlicht: (2024) -
iSegMan: Interactive Segment-and-Manipulate 3D Gaussians
von: Zhao, Yian, et al.
Veröffentlicht: (2025) -
Tune-Your-Style: Intensity-tunable 3D Style Transfer with Gaussian Splatting
von: Zhao, Yian, et al.
Veröffentlicht: (2026) -
Depth-Guided Semi-Supervised Instance Segmentation
von: Chen, Xin, et al.
Veröffentlicht: (2024) -
Local Action-Guided Motion Diffusion Model for Text-to-Motion Generation
von: Jin, Peng, et al.
Veröffentlicht: (2024)