Completing Visual Objects via Bridging Generation and Segmentation
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Xiang, Chen, Yinpeng, Lin, Chung-Ching, Chen, Hao, Hu, Kai, Singh, Rita, Raj, Bhiksha, Wang, Lijuan, Liu, Zicheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ControlVAR: Exploring Controllable Visual Autoregressive Modeling
di: Li, Xiang, et al.
Pubblicazione: (2024)
di: Li, Xiang, et al.
Pubblicazione: (2024)
ImageFolder: Autoregressive Image Generation with Folded Tokens
di: Li, Xiang, et al.
Pubblicazione: (2024)
di: Li, Xiang, et al.
Pubblicazione: (2024)
QDFormer: Towards Robust Audiovisual Segmentation in Complex Environments with Quantization-based Semantic Decomposition
di: Li, Xiang, et al.
Pubblicazione: (2023)
di: Li, Xiang, et al.
Pubblicazione: (2023)
$\text{R}^2$-Bench: Benchmarking the Robustness of Referring Perception Models under Perturbations
di: Li, Xiang, et al.
Pubblicazione: (2024)
di: Li, Xiang, et al.
Pubblicazione: (2024)
XQ-GAN: An Open-source Image Tokenization Framework for Autoregressive Generation
di: Li, Xiang, et al.
Pubblicazione: (2024)
di: Li, Xiang, et al.
Pubblicazione: (2024)
Idea2Img: Iterative Self-Refinement with GPT-4V(ision) for Automatic Image Design and Generation
di: Yang, Zhengyuan, et al.
Pubblicazione: (2023)
di: Yang, Zhengyuan, et al.
Pubblicazione: (2023)
Robust Latent Matters: Boosting Image Generation with Sampling Error Synthesis
di: Qiu, Kai, et al.
Pubblicazione: (2025)
di: Qiu, Kai, et al.
Pubblicazione: (2025)
Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning
di: Ni, Minheng, et al.
Pubblicazione: (2025)
di: Ni, Minheng, et al.
Pubblicazione: (2025)
IDOL: Unified Dual-Modal Latent Diffusion for Human-Centric Joint Video-Depth Generation
di: Zhai, Yuanhao, et al.
Pubblicazione: (2024)
di: Zhai, Yuanhao, et al.
Pubblicazione: (2024)
Image Tokenizer Needs Post-Training
di: Qiu, Kai, et al.
Pubblicazione: (2025)
di: Qiu, Kai, et al.
Pubblicazione: (2025)
DisCo: Disentangled Control for Realistic Human Dance Generation
di: Wang, Tan, et al.
Pubblicazione: (2023)
di: Wang, Tan, et al.
Pubblicazione: (2023)
Segment and Caption Anything
di: Huang, Xiaoke, et al.
Pubblicazione: (2023)
di: Huang, Xiaoke, et al.
Pubblicazione: (2023)
Interaction-Consistent Object Removal via MLLM-Based Reasoning
di: Huang, Ching-Kai, et al.
Pubblicazione: (2026)
di: Huang, Ching-Kai, et al.
Pubblicazione: (2026)
Masked Autoencoders Are Effective Tokenizers for Diffusion Models
di: Chen, Hao, et al.
Pubblicazione: (2025)
di: Chen, Hao, et al.
Pubblicazione: (2025)
SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer
di: Chen, Hao, et al.
Pubblicazione: (2024)
di: Chen, Hao, et al.
Pubblicazione: (2024)
RTGen: Generating Region-Text Pairs for Open-Vocabulary Object Detection
di: Chen, Fangyi, et al.
Pubblicazione: (2024)
di: Chen, Fangyi, et al.
Pubblicazione: (2024)
Slight Corruption in Pre-training Data Makes Better Diffusion Models
di: Chen, Hao, et al.
Pubblicazione: (2024)
di: Chen, Hao, et al.
Pubblicazione: (2024)
One-Shot Medical Video Object Segmentation via Temporal Contrastive Memory Networks
di: Chen, Yaxiong, et al.
Pubblicazione: (2025)
di: Chen, Yaxiong, et al.
Pubblicazione: (2025)
SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement
di: Wang, Xiyao, et al.
Pubblicazione: (2025)
di: Wang, Xiyao, et al.
Pubblicazione: (2025)
ED-SAM: An Efficient Diffusion Sampling Approach to Domain Generalization in Vision-Language Foundation Models
di: Truong, Thanh-Dat, et al.
Pubblicazione: (2024)
di: Truong, Thanh-Dat, et al.
Pubblicazione: (2024)
GS: Generative Segmentation via Label Diffusion
di: Chen, Yuhao, et al.
Pubblicazione: (2025)
di: Chen, Yuhao, et al.
Pubblicazione: (2025)
FALCON: Fairness Learning via Contrastive Attention Approach to Continual Semantic Scene Understanding
di: Truong, Thanh-Dat, et al.
Pubblicazione: (2023)
di: Truong, Thanh-Dat, et al.
Pubblicazione: (2023)
Imprecise Label Learning: A Unified Framework for Learning with Various Imprecise Label Configurations
di: Chen, Hao, et al.
Pubblicazione: (2023)
di: Chen, Hao, et al.
Pubblicazione: (2023)
LiVOS: Light Video Object Segmentation with Gated Linear Matching
di: Liu, Qin, et al.
Pubblicazione: (2024)
di: Liu, Qin, et al.
Pubblicazione: (2024)
VerLM: Explaining Face Verification Using Natural Language
di: Hannan, Syed Abdul, et al.
Pubblicazione: (2026)
di: Hannan, Syed Abdul, et al.
Pubblicazione: (2026)
ReferDINO: Referring Video Object Segmentation with Visual Grounding Foundations
di: Liang, Tianming, et al.
Pubblicazione: (2025)
di: Liang, Tianming, et al.
Pubblicazione: (2025)
X-Prompt: Multi-modal Visual Prompt for Video Object Segmentation
di: Guo, Pinxue, et al.
Pubblicazione: (2024)
di: Guo, Pinxue, et al.
Pubblicazione: (2024)
360VOTS: Visual Object Tracking and Segmentation in Omnidirectional Videos
di: Xu, Yinzhe, et al.
Pubblicazione: (2024)
di: Xu, Yinzhe, et al.
Pubblicazione: (2024)
Boosting Visual Knowledge-Intensive Training for LVLMs Through Causality-Driven Visual Object Completion
di: Hu, Qingguo, et al.
Pubblicazione: (2025)
di: Hu, Qingguo, et al.
Pubblicazione: (2025)
Online Unsupervised Video Object Segmentation via Contrastive Motion Clustering
di: Xi, Lin, et al.
Pubblicazione: (2023)
di: Xi, Lin, et al.
Pubblicazione: (2023)
Exploring Invariance in Images through One-way Wave Equations
di: Chen, Yinpeng, et al.
Pubblicazione: (2023)
di: Chen, Yinpeng, et al.
Pubblicazione: (2023)
Toward Fairness via Maximum Mean Discrepancy Regularization on Logits Space
di: Chung, Hao-Wei, et al.
Pubblicazione: (2024)
di: Chung, Hao-Wei, et al.
Pubblicazione: (2024)
An Analysis of Kalman Filter based Object Tracking Methods for Fast-Moving Tiny Objects
di: Singh, Prithvi Raj, et al.
Pubblicazione: (2025)
di: Singh, Prithvi Raj, et al.
Pubblicazione: (2025)
BridgeShape: Latent Diffusion Schrödinger Bridge for 3D Shape Completion
di: Kong, Dequan, et al.
Pubblicazione: (2025)
di: Kong, Dequan, et al.
Pubblicazione: (2025)
Confronting Ambiguity in 6D Object Pose Estimation via Score-Based Diffusion on SE(3)
di: Hsiao, Tsu-Ching, et al.
Pubblicazione: (2023)
di: Hsiao, Tsu-Ching, et al.
Pubblicazione: (2023)
VL-SAM-v3: Memory-Guided Visual Priors for Open-World Object Detection
di: Liu, Chih-Chung, et al.
Pubblicazione: (2026)
di: Liu, Chih-Chung, et al.
Pubblicazione: (2026)
Glass Segmentation with Fusion of Learned and General Visual Features
di: Ojala, Risto, et al.
Pubblicazione: (2026)
di: Ojala, Risto, et al.
Pubblicazione: (2026)
Language-Driven Visual Consensus for Zero-Shot Semantic Segmentation
di: Zhang, Zicheng, et al.
Pubblicazione: (2024)
di: Zhang, Zicheng, et al.
Pubblicazione: (2024)
Resolving Endpoint Underfitting in Diffusion Bridges via Noise Alignment
di: Gao, Yurong, et al.
Pubblicazione: (2026)
di: Gao, Yurong, et al.
Pubblicazione: (2026)
Bridge the Gap Between Visual and Linguistic Comprehension for Generalized Zero-shot Semantic Segmentation
di: Guo, Xiaoqing, et al.
Pubblicazione: (2025)
di: Guo, Xiaoqing, et al.
Pubblicazione: (2025)
Documenti analoghi
-
ControlVAR: Exploring Controllable Visual Autoregressive Modeling
di: Li, Xiang, et al.
Pubblicazione: (2024) -
ImageFolder: Autoregressive Image Generation with Folded Tokens
di: Li, Xiang, et al.
Pubblicazione: (2024) -
QDFormer: Towards Robust Audiovisual Segmentation in Complex Environments with Quantization-based Semantic Decomposition
di: Li, Xiang, et al.
Pubblicazione: (2023) -
$\text{R}^2$-Bench: Benchmarking the Robustness of Referring Perception Models under Perturbations
di: Li, Xiang, et al.
Pubblicazione: (2024) -
XQ-GAN: An Open-source Image Tokenization Framework for Autoregressive Generation
di: Li, Xiang, et al.
Pubblicazione: (2024)