Completing Visual Objects via Bridging Generation and Segmentation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Xiang, Chen, Yinpeng, Lin, Chung-Ching, Chen, Hao, Hu, Kai, Singh, Rita, Raj, Bhiksha, Wang, Lijuan, Liu, Zicheng |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ControlVAR: Exploring Controllable Visual Autoregressive Modeling
par: Li, Xiang, et autres
Publié: (2024)
par: Li, Xiang, et autres
Publié: (2024)
ImageFolder: Autoregressive Image Generation with Folded Tokens
par: Li, Xiang, et autres
Publié: (2024)
par: Li, Xiang, et autres
Publié: (2024)
QDFormer: Towards Robust Audiovisual Segmentation in Complex Environments with Quantization-based Semantic Decomposition
par: Li, Xiang, et autres
Publié: (2023)
par: Li, Xiang, et autres
Publié: (2023)
$\text{R}^2$-Bench: Benchmarking the Robustness of Referring Perception Models under Perturbations
par: Li, Xiang, et autres
Publié: (2024)
par: Li, Xiang, et autres
Publié: (2024)
XQ-GAN: An Open-source Image Tokenization Framework for Autoregressive Generation
par: Li, Xiang, et autres
Publié: (2024)
par: Li, Xiang, et autres
Publié: (2024)
Idea2Img: Iterative Self-Refinement with GPT-4V(ision) for Automatic Image Design and Generation
par: Yang, Zhengyuan, et autres
Publié: (2023)
par: Yang, Zhengyuan, et autres
Publié: (2023)
Robust Latent Matters: Boosting Image Generation with Sampling Error Synthesis
par: Qiu, Kai, et autres
Publié: (2025)
par: Qiu, Kai, et autres
Publié: (2025)
Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning
par: Ni, Minheng, et autres
Publié: (2025)
par: Ni, Minheng, et autres
Publié: (2025)
IDOL: Unified Dual-Modal Latent Diffusion for Human-Centric Joint Video-Depth Generation
par: Zhai, Yuanhao, et autres
Publié: (2024)
par: Zhai, Yuanhao, et autres
Publié: (2024)
Image Tokenizer Needs Post-Training
par: Qiu, Kai, et autres
Publié: (2025)
par: Qiu, Kai, et autres
Publié: (2025)
DisCo: Disentangled Control for Realistic Human Dance Generation
par: Wang, Tan, et autres
Publié: (2023)
par: Wang, Tan, et autres
Publié: (2023)
Segment and Caption Anything
par: Huang, Xiaoke, et autres
Publié: (2023)
par: Huang, Xiaoke, et autres
Publié: (2023)
Interaction-Consistent Object Removal via MLLM-Based Reasoning
par: Huang, Ching-Kai, et autres
Publié: (2026)
par: Huang, Ching-Kai, et autres
Publié: (2026)
Masked Autoencoders Are Effective Tokenizers for Diffusion Models
par: Chen, Hao, et autres
Publié: (2025)
par: Chen, Hao, et autres
Publié: (2025)
SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer
par: Chen, Hao, et autres
Publié: (2024)
par: Chen, Hao, et autres
Publié: (2024)
RTGen: Generating Region-Text Pairs for Open-Vocabulary Object Detection
par: Chen, Fangyi, et autres
Publié: (2024)
par: Chen, Fangyi, et autres
Publié: (2024)
Slight Corruption in Pre-training Data Makes Better Diffusion Models
par: Chen, Hao, et autres
Publié: (2024)
par: Chen, Hao, et autres
Publié: (2024)
One-Shot Medical Video Object Segmentation via Temporal Contrastive Memory Networks
par: Chen, Yaxiong, et autres
Publié: (2025)
par: Chen, Yaxiong, et autres
Publié: (2025)
SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement
par: Wang, Xiyao, et autres
Publié: (2025)
par: Wang, Xiyao, et autres
Publié: (2025)
ED-SAM: An Efficient Diffusion Sampling Approach to Domain Generalization in Vision-Language Foundation Models
par: Truong, Thanh-Dat, et autres
Publié: (2024)
par: Truong, Thanh-Dat, et autres
Publié: (2024)
GS: Generative Segmentation via Label Diffusion
par: Chen, Yuhao, et autres
Publié: (2025)
par: Chen, Yuhao, et autres
Publié: (2025)
FALCON: Fairness Learning via Contrastive Attention Approach to Continual Semantic Scene Understanding
par: Truong, Thanh-Dat, et autres
Publié: (2023)
par: Truong, Thanh-Dat, et autres
Publié: (2023)
Imprecise Label Learning: A Unified Framework for Learning with Various Imprecise Label Configurations
par: Chen, Hao, et autres
Publié: (2023)
par: Chen, Hao, et autres
Publié: (2023)
LiVOS: Light Video Object Segmentation with Gated Linear Matching
par: Liu, Qin, et autres
Publié: (2024)
par: Liu, Qin, et autres
Publié: (2024)
VerLM: Explaining Face Verification Using Natural Language
par: Hannan, Syed Abdul, et autres
Publié: (2026)
par: Hannan, Syed Abdul, et autres
Publié: (2026)
ReferDINO: Referring Video Object Segmentation with Visual Grounding Foundations
par: Liang, Tianming, et autres
Publié: (2025)
par: Liang, Tianming, et autres
Publié: (2025)
X-Prompt: Multi-modal Visual Prompt for Video Object Segmentation
par: Guo, Pinxue, et autres
Publié: (2024)
par: Guo, Pinxue, et autres
Publié: (2024)
360VOTS: Visual Object Tracking and Segmentation in Omnidirectional Videos
par: Xu, Yinzhe, et autres
Publié: (2024)
par: Xu, Yinzhe, et autres
Publié: (2024)
Boosting Visual Knowledge-Intensive Training for LVLMs Through Causality-Driven Visual Object Completion
par: Hu, Qingguo, et autres
Publié: (2025)
par: Hu, Qingguo, et autres
Publié: (2025)
Online Unsupervised Video Object Segmentation via Contrastive Motion Clustering
par: Xi, Lin, et autres
Publié: (2023)
par: Xi, Lin, et autres
Publié: (2023)
Exploring Invariance in Images through One-way Wave Equations
par: Chen, Yinpeng, et autres
Publié: (2023)
par: Chen, Yinpeng, et autres
Publié: (2023)
Toward Fairness via Maximum Mean Discrepancy Regularization on Logits Space
par: Chung, Hao-Wei, et autres
Publié: (2024)
par: Chung, Hao-Wei, et autres
Publié: (2024)
An Analysis of Kalman Filter based Object Tracking Methods for Fast-Moving Tiny Objects
par: Singh, Prithvi Raj, et autres
Publié: (2025)
par: Singh, Prithvi Raj, et autres
Publié: (2025)
BridgeShape: Latent Diffusion Schrödinger Bridge for 3D Shape Completion
par: Kong, Dequan, et autres
Publié: (2025)
par: Kong, Dequan, et autres
Publié: (2025)
Confronting Ambiguity in 6D Object Pose Estimation via Score-Based Diffusion on SE(3)
par: Hsiao, Tsu-Ching, et autres
Publié: (2023)
par: Hsiao, Tsu-Ching, et autres
Publié: (2023)
VL-SAM-v3: Memory-Guided Visual Priors for Open-World Object Detection
par: Liu, Chih-Chung, et autres
Publié: (2026)
par: Liu, Chih-Chung, et autres
Publié: (2026)
Glass Segmentation with Fusion of Learned and General Visual Features
par: Ojala, Risto, et autres
Publié: (2026)
par: Ojala, Risto, et autres
Publié: (2026)
Language-Driven Visual Consensus for Zero-Shot Semantic Segmentation
par: Zhang, Zicheng, et autres
Publié: (2024)
par: Zhang, Zicheng, et autres
Publié: (2024)
Resolving Endpoint Underfitting in Diffusion Bridges via Noise Alignment
par: Gao, Yurong, et autres
Publié: (2026)
par: Gao, Yurong, et autres
Publié: (2026)
Bridge the Gap Between Visual and Linguistic Comprehension for Generalized Zero-shot Semantic Segmentation
par: Guo, Xiaoqing, et autres
Publié: (2025)
par: Guo, Xiaoqing, et autres
Publié: (2025)
Documents similaires
-
ControlVAR: Exploring Controllable Visual Autoregressive Modeling
par: Li, Xiang, et autres
Publié: (2024) -
ImageFolder: Autoregressive Image Generation with Folded Tokens
par: Li, Xiang, et autres
Publié: (2024) -
QDFormer: Towards Robust Audiovisual Segmentation in Complex Environments with Quantization-based Semantic Decomposition
par: Li, Xiang, et autres
Publié: (2023) -
$\text{R}^2$-Bench: Benchmarking the Robustness of Referring Perception Models under Perturbations
par: Li, Xiang, et autres
Publié: (2024) -
XQ-GAN: An Open-source Image Tokenization Framework for Autoregressive Generation
par: Li, Xiang, et autres
Publié: (2024)