Referring Layer Decomposition
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Fangyi, Shen, Yaojie, Xu, Lu, Yuan, Ye, Zhang, Shu, Niu, Yulei, Wen, Longyin |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
EchoFoley: Event-Centric Hierarchical Control for Video Grounded Creative Sound Generation
par: Li, Bingxuan, et autres
Publié: (2025)
par: Li, Bingxuan, et autres
Publié: (2025)
Accurate and Fast Compressed Video Captioning
par: Shen, Yaojie, et autres
Publié: (2023)
par: Shen, Yaojie, et autres
Publié: (2023)
Where do Large Vision-Language Models Look at when Answering Questions?
par: Xing, Xiaoying, et autres
Publié: (2025)
par: Xing, Xiaoying, et autres
Publié: (2025)
D-Attn: Decomposed Attention for Large Vision-and-Language Models
par: Kuo, Chia-Wen, et autres
Publié: (2025)
par: Kuo, Chia-Wen, et autres
Publié: (2025)
Beyond Raw Videos: Understanding Edited Videos with Large Multimodal Model
par: Xu, Lu, et autres
Publié: (2024)
par: Xu, Lu, et autres
Publié: (2024)
From Inpainting to Layer Decomposition: Repurposing Generative Inpainting Models for Image Layer Decomposition
par: Chen, Jingxi, et autres
Publié: (2025)
par: Chen, Jingxi, et autres
Publié: (2025)
Thinking With Bounding Boxes: Enhancing Spatio-Temporal Video Grounding via Reinforcement Fine-Tuning
par: Gu, Xin, et autres
Publié: (2025)
par: Gu, Xin, et autres
Publié: (2025)
ShortV: Efficient Multimodal Large Language Models by Freezing Visual Tokens in Ineffective Layers
par: Yuan, Qianhao, et autres
Publié: (2025)
par: Yuan, Qianhao, et autres
Publié: (2025)
CuMo: Scaling Multimodal LLM with Co-Upcycled Mixture-of-Experts
par: Li, Jiachen, et autres
Publié: (2024)
par: Li, Jiachen, et autres
Publié: (2024)
Qwen-Image-Layered: Towards Inherent Editability via Layer Decomposition
par: Yin, Shengming, et autres
Publié: (2025)
par: Yin, Shengming, et autres
Publié: (2025)
Generative Image Layer Decomposition with Visual Effects
par: Yang, Jinrui, et autres
Publié: (2024)
par: Yang, Jinrui, et autres
Publié: (2024)
Multi-Reward as Condition for Instruction-based Image Editing
par: Gu, Xin, et autres
Publié: (2024)
par: Gu, Xin, et autres
Publié: (2024)
Edit3K: Universal Representation Learning for Video Editing Components
par: Gu, Xin, et autres
Publié: (2024)
par: Gu, Xin, et autres
Publié: (2024)
Does Synthetic Layered Design Data Benefit Layered Design Decomposition?
par: Wu, Kam Man, et autres
Publié: (2026)
par: Wu, Kam Man, et autres
Publié: (2026)
Two Causal Principles for Improving Visual Dialog
par: Qi, Jiaxin, et autres
Publié: (2019)
par: Qi, Jiaxin, et autres
Publié: (2019)
CyberV: Cybernetics for Test-time Scaling in Video Understanding
par: Meng, Jiahao, et autres
Publié: (2025)
par: Meng, Jiahao, et autres
Publié: (2025)
Cycle-Consistent Tuning for Layered Image Decomposition
par: Gu, Zheng, et autres
Publié: (2026)
par: Gu, Zheng, et autres
Publié: (2026)
A Reference-Based 3D Semantic-Aware Framework for Accurate Local Facial Attribute Editing
par: Huang, Yu-Kai, et autres
Publié: (2024)
par: Huang, Yu-Kai, et autres
Publié: (2024)
Prompt-aligned Gradient for Prompt Tuning
par: Zhu, Beier, et autres
Publié: (2022)
par: Zhu, Beier, et autres
Publié: (2022)
Debiased Fine-Tuning for Vision-language Models by Prompt Regularization
par: Zhu, Beier, et autres
Publié: (2023)
par: Zhu, Beier, et autres
Publié: (2023)
VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing
par: Deng, Andong, et autres
Publié: (2026)
par: Deng, Andong, et autres
Publié: (2026)
MetaLogic: Robustness Evaluation of Text-to-Image Models via Logically Equivalent Prompts
par: Shen, Yifan, et autres
Publié: (2025)
par: Shen, Yifan, et autres
Publié: (2025)
DesignEdit: Multi-Layered Latent Decomposition and Fusion for Unified & Accurate Image Editing
par: Jia, Yueru, et autres
Publié: (2024)
par: Jia, Yueru, et autres
Publié: (2024)
Structured Context Learning for Generic Event Boundary Detection
par: Gu, Xin, et autres
Publié: (2025)
par: Gu, Xin, et autres
Publié: (2025)
CareCom: Generative Image Composition with Calibrated Reference Features
par: Chen, Jiaxuan, et autres
Publié: (2025)
par: Chen, Jiaxuan, et autres
Publié: (2025)
Illustrator's Depth: Monocular Layer Index Prediction for Image Decomposition
par: Maruani, Nissim, et autres
Publié: (2025)
par: Maruani, Nissim, et autres
Publié: (2025)
Vidi: Large Multimodal Models for Video Understanding and Editing
par: Vidi Team, et autres
Publié: (2025)
par: Vidi Team, et autres
Publié: (2025)
Workflow-Aware Structured Layer Decomposition for Illustration Production
par: Zhang, Tianyu, et autres
Publié: (2026)
par: Zhang, Tianyu, et autres
Publié: (2026)
GS-Matching: Reconsidering Feature Matching task in Point Cloud Registration
par: Zhang, Yaojie, et autres
Publié: (2024)
par: Zhang, Yaojie, et autres
Publié: (2024)
Decision PCR: Decision version of the Point Cloud Registration task
par: Zhang, Yaojie, et autres
Publié: (2025)
par: Zhang, Yaojie, et autres
Publié: (2025)
RevealLayer: Disentangling Hidden and Visible Layers via Occlusion-Aware Image Decomposition
par: Wang, Binhao, et autres
Publié: (2026)
par: Wang, Binhao, et autres
Publié: (2026)
Unbiased Scene Graph Generation from Biased Training
par: Tang, Kaihua, et autres
Publié: (2020)
par: Tang, Kaihua, et autres
Publié: (2020)
EviRCOD: Evidence-Guided Probabilistic Decoding for Referring Camouflaged Object Detection
par: Wang, Ye, et autres
Publié: (2026)
par: Wang, Ye, et autres
Publié: (2026)
Multi-modal Knowledge Decomposition based Online Distillation for Biomarker Prediction in Breast Cancer Histopathology
par: Zhang, Qibin, et autres
Publié: (2025)
par: Zhang, Qibin, et autres
Publié: (2025)
RTGen: Generating Region-Text Pairs for Open-Vocabulary Object Detection
par: Chen, Fangyi, et autres
Publié: (2024)
par: Chen, Fangyi, et autres
Publié: (2024)
Joint RGB-Spectral Decomposition Model Guided Image Enhancement in Mobile Photography
par: Zhou, Kailai, et autres
Publié: (2024)
par: Zhou, Kailai, et autres
Publié: (2024)
EasyOmnimatte: Taming Pretrained Inpainting Diffusion Models for End-to-End Video Layered Decomposition
par: Hu, Yihan, et autres
Publié: (2025)
par: Hu, Yihan, et autres
Publié: (2025)
Layer-Wise Modality Decomposition for Interpretable Multimodal Sensor Fusion
par: Park, Jaehyun, et autres
Publié: (2025)
par: Park, Jaehyun, et autres
Publié: (2025)
Orthogonal Subspace Decomposition for Generalizable AI-Generated Image Detection
par: Yan, Zhiyuan, et autres
Publié: (2024)
par: Yan, Zhiyuan, et autres
Publié: (2024)
Vidi2.5: Large Multimodal Models for Video Understanding and Creation
par: Vidi Team, et autres
Publié: (2025)
par: Vidi Team, et autres
Publié: (2025)
Documents similaires
-
EchoFoley: Event-Centric Hierarchical Control for Video Grounded Creative Sound Generation
par: Li, Bingxuan, et autres
Publié: (2025) -
Accurate and Fast Compressed Video Captioning
par: Shen, Yaojie, et autres
Publié: (2023) -
Where do Large Vision-Language Models Look at when Answering Questions?
par: Xing, Xiaoying, et autres
Publié: (2025) -
D-Attn: Decomposed Attention for Large Vision-and-Language Models
par: Kuo, Chia-Wen, et autres
Publié: (2025) -
Beyond Raw Videos: Understanding Edited Videos with Large Multimodal Model
par: Xu, Lu, et autres
Publié: (2024)