AnyRefill: A Unified, Data-Efficient Framework for Left-Prompt-Guided Vision Tasks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xie, Ming, Cao, Chenjie, Cai, Yunuo, Xue, Xiangyang, Jiang, Yu-Gang, Fu, Yanwei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LeftRefill: Filling Right Canvas based on Left Reference through Generalized Text-to-Image Diffusion Model
par: Cao, Chenjie, et autres
Publié: (2023)
par: Cao, Chenjie, et autres
Publié: (2023)
MVGenMaster: Scaling Multi-View Generation from Any Image via 3D Priors Enhanced Diffusion Model
par: Cao, Chenjie, et autres
Publié: (2024)
par: Cao, Chenjie, et autres
Publié: (2024)
Improving Neural Surface Reconstruction with Feature Priors from Multi-View Image
par: Ren, Xinlin, et autres
Publié: (2024)
par: Ren, Xinlin, et autres
Publié: (2024)
Aligned Stable Inpainting: Mitigating Unwanted Object Insertion and Preserving Color Consistency
par: Wang, Yikai, et autres
Publié: (2026)
par: Wang, Yikai, et autres
Publié: (2026)
MVInpainter: Learning Multi-View Consistent Inpainting to Bridge 2D and 3D Editing
par: Cao, Chenjie, et autres
Publié: (2024)
par: Cao, Chenjie, et autres
Publié: (2024)
TriVLA: A Triple-System-Based Unified Vision-Language-Action Model with Episodic World Modeling for General Robot Control
par: Liu, Zhenyang, et autres
Publié: (2025)
par: Liu, Zhenyang, et autres
Publié: (2025)
Towards Enhanced Image Inpainting: Mitigating Unwanted Object Insertion and Preserving Color Consistency
par: Wang, Yikai, et autres
Publié: (2023)
par: Wang, Yikai, et autres
Publié: (2023)
Uni3C: Unifying Precisely 3D-Enhanced Camera and Human Motion Controls for Video Generation
par: Cao, Chenjie, et autres
Publié: (2025)
par: Cao, Chenjie, et autres
Publié: (2025)
TP-MDDN: Task-Preferenced Multi-Demand-Driven Navigation with Autonomous Decision-Making
par: Li, Shanshan, et autres
Publié: (2025)
par: Li, Shanshan, et autres
Publié: (2025)
You Only Estimate Once: Unified, One-stage, Real-Time Category-level Articulated Object 6D Pose Estimation for Robotic Grasping
par: Huang, Jingshun, et autres
Publié: (2025)
par: Huang, Jingshun, et autres
Publié: (2025)
Enhancing Video Inpainting with Aligned Frame Interval Guidance
par: Xie, Ming, et autres
Publié: (2025)
par: Xie, Ming, et autres
Publié: (2025)
MVSFormer++: Revealing the Devil in Transformer's Details for Multi-View Stereo
par: Cao, Chenjie, et autres
Publié: (2024)
par: Cao, Chenjie, et autres
Publié: (2024)
Repositioning the Subject within Image
par: Wang, Yikai, et autres
Publié: (2024)
par: Wang, Yikai, et autres
Publié: (2024)
NSFW-Classifier Guided Prompt Sanitization for Safe Text-to-Image Generation
par: Xie, Yu, et autres
Publié: (2025)
par: Xie, Yu, et autres
Publié: (2025)
Refiling by the Second
par: Poucher, Licy A., et autres
Publié: (1970)
par: Poucher, Licy A., et autres
Publié: (1970)
RAG-6DPose: Retrieval-Augmented 6D Pose Estimation via Leveraging CAD as Knowledge Base
par: Wang, Kuanning, et autres
Publié: (2025)
par: Wang, Kuanning, et autres
Publié: (2025)
Beyond Task-Specific Reasoning: A Unified Conditional Generative Framework for Abstract Visual Reasoning
par: Shi, Fan, et autres
Publié: (2025)
par: Shi, Fan, et autres
Publié: (2025)
Say, Dream, and Act: Learning Video World Models for Instruction-Driven Robot Manipulation
par: Gu, Songen, et autres
Publié: (2026)
par: Gu, Songen, et autres
Publié: (2026)
ActiveVLA: Injecting Active Perception into Vision-Language-Action Models for Precise 3D Robotic Manipulation
par: Liu, Zhenyang, et autres
Publié: (2026)
par: Liu, Zhenyang, et autres
Publié: (2026)
PECTP: Parameter-Efficient Cross-Task Prompts for Incremental Vision Transformer
par: Feng, Qian, et autres
Publié: (2024)
par: Feng, Qian, et autres
Publié: (2024)
Efficient Algorithms for Empirical Group Distributionally Robust Optimization and Beyond
par: Yu, Dingzhi, et autres
Publié: (2024)
par: Yu, Dingzhi, et autres
Publié: (2024)
VADF: Vision-Adaptive Diffusion Policy Framework for Efficient Robotic Manipulation
par: Yu, Xinglei, et autres
Publié: (2026)
par: Yu, Xinglei, et autres
Publié: (2026)
Animate3D: Animating Any 3D Model with Multi-view Video Diffusion
par: Jiang, Yanqin, et autres
Publié: (2024)
par: Jiang, Yanqin, et autres
Publié: (2024)
CAP-Net: A Unified Network for 6D Pose and Size Estimation of Categorical Articulated Parts from a Single RGB-D Image
par: Huang, Jingshun, et autres
Publié: (2025)
par: Huang, Jingshun, et autres
Publié: (2025)
LLF : A Lightweight Learning Framework for Resource‐Efficient Sports Pattern Recognition in Mobile Edge IoT
par: Xiangyang Cai
Publié: (2026)
par: Xiangyang Cai
Publié: (2026)
Boosting Long-Context Management via Query-Guided Activation Refilling
par: Qian, Hongjin, et autres
Publié: (2024)
par: Qian, Hongjin, et autres
Publié: (2024)
Universal Pose Pretraining for Generalizable Vision-Language-Action Policies
par: Lin, Haitao, et autres
Publié: (2026)
par: Lin, Haitao, et autres
Publié: (2026)
Refer to Any Segmentation Mask Group With Vision-Language Prompts
par: Cao, Shengcao, et autres
Publié: (2025)
par: Cao, Shengcao, et autres
Publié: (2025)
OCRA: Object-Centric Learning with 3D and Tactile Priors for Human-to-Robot Action Transfer
par: Wang, Kuanning, et autres
Publié: (2026)
par: Wang, Kuanning, et autres
Publié: (2026)
ReasonGrounder: LVLM-Guided Hierarchical Feature Splatting for Open-Vocabulary 3D Visual Grounding and Reasoning
par: Liu, Zhenyang, et autres
Publié: (2025)
par: Liu, Zhenyang, et autres
Publié: (2025)
Steerable Pyramid Transform Enables Robust Left Ventricle Quantification
par: Zhu, Xiangyang, et autres
Publié: (2022)
par: Zhu, Xiangyang, et autres
Publié: (2022)
Afford-VLA: Action-Aligned Visual Planning via Internalized Affordance
par: Wang, Runze, et autres
Publié: (2026)
par: Wang, Runze, et autres
Publié: (2026)
Image-Text-Image Knowledge Transfer for Lifelong Person Re-Identification with Hybrid Clothing States
par: Wang, Qizao, et autres
Publié: (2024)
par: Wang, Qizao, et autres
Publié: (2024)
Beyond 'Templates': Category-Agnostic Object Pose, Size, and Shape Estimation from a Single View
par: Zhang, Jinyu, et autres
Publié: (2025)
par: Zhang, Jinyu, et autres
Publié: (2025)
Exploring Fine-Grained Representation and Recomposition for Cloth-Changing Person Re-Identification
par: Wang, Qizao, et autres
Publié: (2023)
par: Wang, Qizao, et autres
Publié: (2023)
A Neural Representation Framework with LLM-Driven Spatial Reasoning for Open-Vocabulary 3D Visual Grounding
par: Liu, Zhenyang, et autres
Publié: (2025)
par: Liu, Zhenyang, et autres
Publié: (2025)
LUMIR: an LLM-Driven Unified Agent Framework for Multi-task Infrared Spectroscopy Reasoning
par: Xie, Zujie, et autres
Publié: (2025)
par: Xie, Zujie, et autres
Publié: (2025)
Task-Guided Prompting for Unified Remote Sensing Image Restoration
par: Huang, Wenli, et autres
Publié: (2026)
par: Huang, Wenli, et autres
Publié: (2026)
LiON-LoRA: Rethinking LoRA Fusion to Unify Controllable Spatial and Temporal Generation for Video Diffusion
par: Zhang, Yisu, et autres
Publié: (2025)
par: Zhang, Yisu, et autres
Publié: (2025)
Any House Any Task: Scalable Long-Horizon Planning for Abstract Human Tasks
par: Liu, Zhihong, et autres
Publié: (2026)
par: Liu, Zhihong, et autres
Publié: (2026)
Documents similaires
-
LeftRefill: Filling Right Canvas based on Left Reference through Generalized Text-to-Image Diffusion Model
par: Cao, Chenjie, et autres
Publié: (2023) -
MVGenMaster: Scaling Multi-View Generation from Any Image via 3D Priors Enhanced Diffusion Model
par: Cao, Chenjie, et autres
Publié: (2024) -
Improving Neural Surface Reconstruction with Feature Priors from Multi-View Image
par: Ren, Xinlin, et autres
Publié: (2024) -
Aligned Stable Inpainting: Mitigating Unwanted Object Insertion and Preserving Color Consistency
par: Wang, Yikai, et autres
Publié: (2026) -
MVInpainter: Learning Multi-View Consistent Inpainting to Bridge 2D and 3D Editing
par: Cao, Chenjie, et autres
Publié: (2024)