Ctrl&Shift: High-Quality Geometry-Aware Object Manipulation in Visual Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ruan, Penghui, Zi, Bojia, Qi, Xianbiao, Huang, Youze, Xiao, Rong, Wang, Pichao, Cao, Jiannong, Shi, Yuhui |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Refaçade: Editing Object with Given Reference Texture
par: Huang, Youze, et autres
Publié: (2025)
par: Huang, Youze, et autres
Publié: (2025)
Enhancing Motion in Text-to-Video Generation with Decomposed Encoding and Conditioning
par: Ruan, Penghui, et autres
Publié: (2024)
par: Ruan, Penghui, et autres
Publié: (2024)
Señorita-2M: A High-Quality Instruction-based Dataset for General Video Editing by Video Specialists
par: Zi, Bojia, et autres
Publié: (2025)
par: Zi, Bojia, et autres
Publié: (2025)
MiniMax-Remover: Taming Bad Noise Helps Video Object Removal
par: Zi, Bojia, et autres
Publié: (2025)
par: Zi, Bojia, et autres
Publié: (2025)
BiGR: Harnessing Binary Latent Codes for Image Generation and Improved Visual Representation Capabilities
par: Hao, Shaozhe, et autres
Publié: (2024)
par: Hao, Shaozhe, et autres
Publié: (2024)
GPrune-LLM: Generalization-Aware Structured Pruning for Large Language Models
par: Liu, Xiaoyun, et autres
Publié: (2026)
par: Liu, Xiaoyun, et autres
Publié: (2026)
Geometry-Consistent 4D Gaussian Splatting for Sparse-Input Dynamic View Synthesis
par: Li, Yiwei, et autres
Publié: (2025)
par: Li, Yiwei, et autres
Publié: (2025)
Taming Transformer Without Using Learning Rate Warmup
par: Qi, Xianbiao, et autres
Publié: (2025)
par: Qi, Xianbiao, et autres
Publié: (2025)
BrokenVideos: A Benchmark Dataset for Fine-Grained Artifact Localization in AI-Generated Videos
par: Lin, Jiahao, et autres
Publié: (2025)
par: Lin, Jiahao, et autres
Publié: (2025)
MGAS: Multi-Granularity Architecture Search for Trade-Off Between Model Effectiveness and Efficiency
par: Liu, Xiaoyun, et autres
Publié: (2023)
par: Liu, Xiaoyun, et autres
Publié: (2023)
Inductive Spatial Temporal Prediction Under Data Drift with Informative Graph Neural Network
par: Zheng, Jialun, et autres
Publié: (2024)
par: Zheng, Jialun, et autres
Publié: (2024)
Ctrl-World: A Controllable Generative World Model for Robot Manipulation
par: Guo, Yanjiang, et autres
Publié: (2025)
par: Guo, Yanjiang, et autres
Publié: (2025)
CoCoCo: Improving Text-Guided Video Inpainting for Better Consistency, Controllability and Compatibility
par: Zi, Bojia, et autres
Publié: (2024)
par: Zi, Bojia, et autres
Publié: (2024)
NASPrecision: Neural Architecture Search-Driven Multi-Stage Learning for Surface Roughness Prediction in Ultra-Precision Machining
par: Ruan, Penghui, et autres
Publié: (2024)
par: Ruan, Penghui, et autres
Publié: (2024)
DualCamCtrl: Dual-Branch Diffusion Model for Geometry-Aware Camera-Controlled Video Generation
par: Zhang, Hongfei, et autres
Publié: (2025)
par: Zhang, Hongfei, et autres
Publié: (2025)
Multi-Modal Representation Learning via Semi-Supervised Rate Reduction for Generalized Category Discovery
par: He, Wei, et autres
Publié: (2026)
par: He, Wei, et autres
Publié: (2026)
AdaCtrl: Towards Adaptive and Controllable Reasoning via Difficulty-Aware Budgeting
par: Huang, Shijue, et autres
Publié: (2025)
par: Huang, Shijue, et autres
Publié: (2025)
Proxy Model-Guided Reinforcement Learning for Client Selection in Federated Recommendation
par: Qu, Liang, et autres
Publié: (2025)
par: Qu, Liang, et autres
Publié: (2025)
SimpleGPT: Improving GPT via A Simple Normalization Strategy
par: Chen, Marco, et autres
Publié: (2026)
par: Chen, Marco, et autres
Publié: (2026)
HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs
par: Yang, Dongquan, et autres
Publié: (2025)
par: Yang, Dongquan, et autres
Publié: (2025)
Delving into Muon and Beyond: Deep Analysis and Extensions
par: Qi, Xianbiao, et autres
Publié: (2026)
par: Qi, Xianbiao, et autres
Publié: (2026)
Ultra-low Power AMOLED Displays for Smart Wearable Applications: Theory and Practice
par: Lyu, Bojia
Publié: (2025)
par: Lyu, Bojia
Publié: (2025)
EmoCtrl: Controllable Emotional Image Content Generation
par: Yang, Jingyuan, et autres
Publié: (2025)
par: Yang, Jingyuan, et autres
Publié: (2025)
Exploring a Principled Framework for Deep Subspace Clustering
par: Meng, Xianghan, et autres
Publié: (2025)
par: Meng, Xianghan, et autres
Publié: (2025)
Ormer: A Manipulation-resistant and Gas-efficient Blockchain Pricing Oracle for DeFi
par: Bai, Dongbin, et autres
Publié: (2024)
par: Bai, Dongbin, et autres
Publié: (2024)
DreamTime: An Improved Optimization Strategy for Diffusion-Guided 3D Generation
par: Huang, Yukun, et autres
Publié: (2023)
par: Huang, Yukun, et autres
Publié: (2023)
Ctrl-V: Higher Fidelity Video Generation with Bounding-Box Controlled Object Motion
par: Luo, Ge Ya, et autres
Publié: (2024)
par: Luo, Ge Ya, et autres
Publié: (2024)
Bridging Different Language Models and Generative Vision Models for Text-to-Image Generation
par: Zhao, Shihao, et autres
Publié: (2024)
par: Zhao, Shihao, et autres
Publié: (2024)
Iterative Adversarial Attack on Image-guided Story Ending Generation
par: Wang, Youze, et autres
Publié: (2023)
par: Wang, Youze, et autres
Publié: (2023)
CtrlFuse: Mask-Prompt Guided Controllable Infrared and Visible Image Fusion
par: Sun, Yiming, et autres
Publié: (2026)
par: Sun, Yiming, et autres
Publié: (2026)
CtrlNeRF: The Generative Neural Radiation Fields for the Controllable Synthesis of High-fidelity 3D-Aware Images
par: Liu, Jian, et autres
Publié: (2024)
par: Liu, Jian, et autres
Publié: (2024)
PhysCtrl: Generative Physics for Controllable and Physics-Grounded Video Generation
par: Wang, Chen, et autres
Publié: (2025)
par: Wang, Chen, et autres
Publié: (2025)
Open-Text Aerial Detection: A Unified Framework For Aerial Visual Grounding And Detection
par: Wei, Guoting, et autres
Publié: (2026)
par: Wei, Guoting, et autres
Publié: (2026)
A General Blue-Shift Phenomenon
par: Ruan, Yangyang
Publié: (2023)
par: Ruan, Yangyang
Publié: (2023)
Factorized Visual Tokenization and Generation
par: Bai, Zechen, et autres
Publié: (2024)
par: Bai, Zechen, et autres
Publié: (2024)
Point2Insert: Video Object Insertion via Sparse Point Guidance
par: Zhou, Yu, et autres
Publié: (2026)
par: Zhou, Yu, et autres
Publié: (2026)
Neural Normalized Cut: A Differential and Generalizable Approach for Spectral Clustering
par: He, Wei, et autres
Publié: (2025)
par: He, Wei, et autres
Publié: (2025)
Geometry-Aware 3D Salient Object Detection Network
par: Wang, Chen, et autres
Publié: (2025)
par: Wang, Chen, et autres
Publié: (2025)
Ctrl-GenAug: Controllable Generative Augmentation for Medical Sequence Classification
par: Zhou, Xinrui, et autres
Publié: (2024)
par: Zhou, Xinrui, et autres
Publié: (2024)
TeleStyle: Content-Preserving Style Transfer in Images and Videos
par: Zhang, Shiwen, et autres
Publié: (2026)
par: Zhang, Shiwen, et autres
Publié: (2026)
Documents similaires
-
Refaçade: Editing Object with Given Reference Texture
par: Huang, Youze, et autres
Publié: (2025) -
Enhancing Motion in Text-to-Video Generation with Decomposed Encoding and Conditioning
par: Ruan, Penghui, et autres
Publié: (2024) -
Señorita-2M: A High-Quality Instruction-based Dataset for General Video Editing by Video Specialists
par: Zi, Bojia, et autres
Publié: (2025) -
MiniMax-Remover: Taming Bad Noise Helps Video Object Removal
par: Zi, Bojia, et autres
Publié: (2025) -
BiGR: Harnessing Binary Latent Codes for Image Generation and Improved Visual Representation Capabilities
par: Hao, Shaozhe, et autres
Publié: (2024)