Memory Efficient Matting with Adaptive Token Routing
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lin, Yiheng, Hu, Yihan, Zhang, Chenyi, Liu, Ting, Qu, Xiaochao, Liu, Luoqi, Zhao, Yao, Wei, Yunchao |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DCEdit: Dual-Level Controlled Image Editing via Precisely Localized Semantics
par: Hu, Yihan, et autres
Publié: (2025)
par: Hu, Yihan, et autres
Publié: (2025)
AlignGen: Boosting Personalized Image Generation with Cross-Modality Prior Alignment
par: Lin, Yiheng, et autres
Publié: (2025)
par: Lin, Yiheng, et autres
Publié: (2025)
Diffusion for Natural Image Matting
par: Hu, Yihan, et autres
Publié: (2023)
par: Hu, Yihan, et autres
Publié: (2023)
Learning Trimaps via Clicks for Image Matting
par: Zhang, Chenyi, et autres
Publié: (2024)
par: Zhang, Chenyi, et autres
Publié: (2024)
On Exact Editing of Flow-Based Diffusion Models
par: Li, Zixiang, et autres
Publié: (2025)
par: Li, Zixiang, et autres
Publié: (2025)
Rethinking Video Segmentation with Masked Video Consistency: Did the Model Learn as Intended?
par: Liang, Chen, et autres
Publié: (2024)
par: Liang, Chen, et autres
Publié: (2024)
MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting
par: Huang, Jun, et autres
Publié: (2025)
par: Huang, Jun, et autres
Publié: (2025)
GlyphMastero: A Glyph Encoder for High-Fidelity Scene Text Editing
par: Wang, Tong, et autres
Publié: (2025)
par: Wang, Tong, et autres
Publié: (2025)
MiVE: Multiscale Vision-language features for reference-guided video Editing
par: Wang, Tong, et autres
Publié: (2026)
par: Wang, Tong, et autres
Publié: (2026)
SAM-REF: Introducing Image-Prompt Synergy during Interaction for Detail Enhancement in the Segment Anything Model
par: Yu, Chongkai, et autres
Publié: (2024)
par: Yu, Chongkai, et autres
Publié: (2024)
Draw Like an Artist: Complex Scene Generation with Diffusion Model via Composition, Painting, and Retouching
par: Liu, Minghao, et autres
Publié: (2024)
par: Liu, Minghao, et autres
Publié: (2024)
FlowSeg: Dynamic Semantic Guidance for LLM-Conditioned Segmentation
par: Zhang, Zekang, et autres
Publié: (2026)
par: Zhang, Zekang, et autres
Publié: (2026)
Self-Prompting Diffusion Transformer for Open-Vocabulary Scene Text Editing via In-Context Learning
par: Li, Hongxi, et autres
Publié: (2026)
par: Li, Hongxi, et autres
Publié: (2026)
PortraitCraft: A Benchmark for Portrait Composition Understanding and Generation
par: Sha, Yuyang, et autres
Publié: (2026)
par: Sha, Yuyang, et autres
Publié: (2026)
OmniAD: Detect and Understand Industrial Anomaly via Multimodal Reasoning
par: Zhao, Shifang, et autres
Publié: (2025)
par: Zhao, Shifang, et autres
Publié: (2025)
Learning Stochastic Bridges for Video Object Removal via Video-to-Video Translation
par: Lou, Zijie, et autres
Publié: (2026)
par: Lou, Zijie, et autres
Publié: (2026)
TextMastero: Mastering High-Quality Scene Text Editing in Diverse Languages and Styles
par: Wang, Tong, et autres
Publié: (2024)
par: Wang, Tong, et autres
Publié: (2024)
2nd Place Solution for MOSE Track in CVPR 2024 PVUW workshop: Complex Video Object Segmentation
par: Xu, Zhensong, et autres
Publié: (2024)
par: Xu, Zhensong, et autres
Publié: (2024)
CutClaw: Agentic Hours-Long Video Editing via Music Synchronization
par: Zhao, Shifang, et autres
Publié: (2026)
par: Zhao, Shifang, et autres
Publié: (2026)
MatAnyone: Stable Video Matting with Consistent Memory Propagation
par: Yang, Peiqing, et autres
Publié: (2025)
par: Yang, Peiqing, et autres
Publié: (2025)
Path-Adaptive Matting for Efficient Inference Under Various Computational Cost Constraints
par: Liu, Qinglin, et autres
Publié: (2025)
par: Liu, Qinglin, et autres
Publié: (2025)
FreeFuse: Multi-Subject LoRA Fusion via Adaptive Token-Level Routing at Test Time
par: Liu, Yaoli, et autres
Publié: (2025)
par: Liu, Yaoli, et autres
Publié: (2025)
AvatarMakeup: Realistic Makeup Transfer for 3D Animatable Head Avatars
par: Zhong, Yiming, et autres
Publié: (2025)
par: Zhong, Yiming, et autres
Publié: (2025)
Efficient Autoregressive Shape Generation via Octree-Based Adaptive Tokenization
par: Deng, Kangle, et autres
Publié: (2025)
par: Deng, Kangle, et autres
Publié: (2025)
Context Tokens are Anchors: Understanding the Repetition Curse in dMLLMs from an Information Flow Perspective
par: Zhao, Qiyan, et autres
Publié: (2026)
par: Zhao, Qiyan, et autres
Publié: (2026)
Region-Adaptive Transform with Segmentation Prior for Image Compression
par: Liu, Yuxi, et autres
Publié: (2024)
par: Liu, Yuxi, et autres
Publié: (2024)
Rethinking MLLM Itself as a Segmenter with a Single Segmentation Token
par: Zhang, Anqi, et autres
Publié: (2026)
par: Zhang, Anqi, et autres
Publié: (2026)
DreamLCM: Towards High-Quality Text-to-3D Generation via Latent Consistency Model
par: Zhong, Yiming, et autres
Publié: (2024)
par: Zhong, Yiming, et autres
Publié: (2024)
3rd Place Solution for PVUW Challenge 2024: Video Panoptic Segmentation
par: Wu, Ruipu, et autres
Publié: (2024)
par: Wu, Ruipu, et autres
Publié: (2024)
Semantic Segmentation on VSPW Dataset through Masked Video Consistency
par: Liang, Chen, et autres
Publié: (2024)
par: Liang, Chen, et autres
Publié: (2024)
3DResT: A Strong Baseline for Semi-Supervised 3D Referring Expression Segmentation
par: Chen, Wenxin, et autres
Publié: (2025)
par: Chen, Wenxin, et autres
Publié: (2025)
ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model
par: Han, Kunyang, et autres
Publié: (2024)
par: Han, Kunyang, et autres
Publié: (2024)
Frequency-Aware Deepfake Detection: Improving Generalizability through Frequency Space Learning
par: Tan, Chuangchuang, et autres
Publié: (2024)
par: Tan, Chuangchuang, et autres
Publié: (2024)
Dual-Context Aggregation for Universal Image Matting
par: Liu, Qinglin, et autres
Publié: (2024)
par: Liu, Qinglin, et autres
Publié: (2024)
EVATok: Adaptive Length Video Tokenization for Efficient Visual Autoregressive Generation
par: Xiong, Tianwei, et autres
Publié: (2026)
par: Xiong, Tianwei, et autres
Publié: (2026)
Guiding the Experts: Semantic Priors for Efficient and Focused MoE Routing
par: Min, Chengxi, et autres
Publié: (2025)
par: Min, Chengxi, et autres
Publié: (2025)
TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation
par: Qu, Liao, et autres
Publié: (2024)
par: Qu, Liao, et autres
Publié: (2024)
Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model
par: Liu, Ting, et autres
Publié: (2024)
par: Liu, Ting, et autres
Publié: (2024)
IPSeg: Image Posterior Mitigates Semantic Drift in Class-Incremental Segmentation
par: Yu, Xiao, et autres
Publié: (2025)
par: Yu, Xiao, et autres
Publié: (2025)
Collaborative Feature-Logits Contrastive Learning for Open-Set Semi-Supervised Object Detection
par: Zhong, Xinhao, et autres
Publié: (2024)
par: Zhong, Xinhao, et autres
Publié: (2024)
Documents similaires
-
DCEdit: Dual-Level Controlled Image Editing via Precisely Localized Semantics
par: Hu, Yihan, et autres
Publié: (2025) -
AlignGen: Boosting Personalized Image Generation with Cross-Modality Prior Alignment
par: Lin, Yiheng, et autres
Publié: (2025) -
Diffusion for Natural Image Matting
par: Hu, Yihan, et autres
Publié: (2023) -
Learning Trimaps via Clicks for Image Matting
par: Zhang, Chenyi, et autres
Publié: (2024) -
On Exact Editing of Flow-Based Diffusion Models
par: Li, Zixiang, et autres
Publié: (2025)