DECap: Towards Generalized Explicit Caption Editing via Diffusion Mechanism
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Zhen, Jiang, Xinyun, Xiao, Jun, Chen, Tao, Chen, Long |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ReasonEdit: Towards Interpretable Image Editing Evaluation via Reinforcement Learning
di: Chen, Honghua, et al.
Pubblicazione: (2026)
di: Chen, Honghua, et al.
Pubblicazione: (2026)
FlowDC: Flow-Based Decoupling-Decay for Complex Image Editing
di: Jiang, Yilei, et al.
Pubblicazione: (2025)
di: Jiang, Yilei, et al.
Pubblicazione: (2025)
Target-aware Image Editing via Cycle-consistent Constraints
di: Wang, Yanghao, et al.
Pubblicazione: (2025)
di: Wang, Yanghao, et al.
Pubblicazione: (2025)
Event-Customized Image Generation
di: Wang, Zhen, et al.
Pubblicazione: (2024)
di: Wang, Zhen, et al.
Pubblicazione: (2024)
CLIPDrag: Combining Text-based and Drag-based Instructions for Image Editing
di: Jiang, Ziqi, et al.
Pubblicazione: (2024)
di: Jiang, Ziqi, et al.
Pubblicazione: (2024)
FreeTuner: Any Subject in Any Style with Training-free Diffusion
di: Xu, Youcan, et al.
Pubblicazione: (2024)
di: Xu, Youcan, et al.
Pubblicazione: (2024)
Compositional Zero-shot Learning via Progressive Language-based Observations
di: Li, Lin, et al.
Pubblicazione: (2023)
di: Li, Lin, et al.
Pubblicazione: (2023)
SpatialReward: Bridging the Perception Gap in Online RL for Image Editing via Explicit Spatial Reasoning
di: Long, Yancheng, et al.
Pubblicazione: (2026)
di: Long, Yancheng, et al.
Pubblicazione: (2026)
Streaming Video Diffusion: Online Video Editing with Diffusion Models
di: Chen, Feng, et al.
Pubblicazione: (2024)
di: Chen, Feng, et al.
Pubblicazione: (2024)
DisControlFace: Adding Disentangled Control to Diffusion Autoencoder for One-shot Explicit Facial Image Editing
di: Jia, Haozhe, et al.
Pubblicazione: (2023)
di: Jia, Haozhe, et al.
Pubblicazione: (2023)
ReMix: Towards a Unified View of Consistent Character Generation and Editing
di: Zhou, Benjia, et al.
Pubblicazione: (2025)
di: Zhou, Benjia, et al.
Pubblicazione: (2025)
Towards Photorealistic and Efficient Bokeh Rendering via Diffusion Framework
di: Shi, Linxiao, et al.
Pubblicazione: (2026)
di: Shi, Linxiao, et al.
Pubblicazione: (2026)
SteerFlow: Steering Rectified Flows for Faithful Inversion-Based Image Editing
di: Dao, Thinh, et al.
Pubblicazione: (2026)
di: Dao, Thinh, et al.
Pubblicazione: (2026)
World to Code: Multi-modal Data Generation via Self-Instructed Compositional Captioning and Filtering
di: Wang, Jiacong, et al.
Pubblicazione: (2024)
di: Wang, Jiacong, et al.
Pubblicazione: (2024)
LazyDrag: Enabling Stable Drag-Based Editing on Multi-Modal Diffusion Transformers via Explicit Correspondence
di: Yin, Zixin, et al.
Pubblicazione: (2025)
di: Yin, Zixin, et al.
Pubblicazione: (2025)
Guidance Free Image Editing via Explicit Conditioning
di: Noroozi, Mehdi, et al.
Pubblicazione: (2025)
di: Noroozi, Mehdi, et al.
Pubblicazione: (2025)
MetaCaptioner: Towards Generalist Visual Captioning with Open-source Suites
di: Lei, Zhenxin, et al.
Pubblicazione: (2025)
di: Lei, Zhenxin, et al.
Pubblicazione: (2025)
FlowMotion: Training-Free Flow Guidance for Video Motion Transfer
di: Wang, Zhen, et al.
Pubblicazione: (2026)
di: Wang, Zhen, et al.
Pubblicazione: (2026)
Implicit and Explicit Commonsense for Multi-sentence Video Captioning
di: Chou, Shih-Han, et al.
Pubblicazione: (2023)
di: Chou, Shih-Han, et al.
Pubblicazione: (2023)
Coarse-Guided Visual Generation via Weighted h-Transform Sampling
di: Wang, Yanghao, et al.
Pubblicazione: (2026)
di: Wang, Yanghao, et al.
Pubblicazione: (2026)
SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning
di: Zhang, Lin, et al.
Pubblicazione: (2025)
di: Zhang, Lin, et al.
Pubblicazione: (2025)
LongCaptioning: Unlocking the Power of Long Video Caption Generation in Large Multimodal Models
di: Wei, Hongchen, et al.
Pubblicazione: (2025)
di: Wei, Hongchen, et al.
Pubblicazione: (2025)
EffiVED:Efficient Video Editing via Text-instruction Diffusion Models
di: Zhang, Zhenghao, et al.
Pubblicazione: (2024)
di: Zhang, Zhenghao, et al.
Pubblicazione: (2024)
Ca2-VDM: Efficient Autoregressive Video Diffusion Model with Causal Generation and Cache Sharing
di: Gao, Kaifeng, et al.
Pubblicazione: (2024)
di: Gao, Kaifeng, et al.
Pubblicazione: (2024)
Explicitly Guided Information Interaction Network for Cross-modal Point Cloud Completion
di: Xu, Hang, et al.
Pubblicazione: (2024)
di: Xu, Hang, et al.
Pubblicazione: (2024)
FashionEngine: Interactive 3D Human Generation and Editing via Multimodal Controls
di: Hu, Tao, et al.
Pubblicazione: (2024)
di: Hu, Tao, et al.
Pubblicazione: (2024)
Towards Understanding Cross and Self-Attention in Stable Diffusion for Text-Guided Image Editing
di: Liu, Bingyan, et al.
Pubblicazione: (2024)
di: Liu, Bingyan, et al.
Pubblicazione: (2024)
HiDiGen: Hierarchical Diffusion for B-Rep Generation with Explicit Topological Constraints
di: Liu, Shurui, et al.
Pubblicazione: (2026)
di: Liu, Shurui, et al.
Pubblicazione: (2026)
High-Fidelity Diffusion-based Image Editing
di: Hou, Chen, et al.
Pubblicazione: (2023)
di: Hou, Chen, et al.
Pubblicazione: (2023)
CCEdit: Creative and Controllable Video Editing via Diffusion Models
di: Feng, Ruoyu, et al.
Pubblicazione: (2023)
di: Feng, Ruoyu, et al.
Pubblicazione: (2023)
Towards Real-World Blind Face Restoration with Generative Diffusion Prior
di: Chen, Xiaoxu, et al.
Pubblicazione: (2023)
di: Chen, Xiaoxu, et al.
Pubblicazione: (2023)
Evaluating Image Caption via Cycle-consistent Text-to-Image Generation
di: Cui, Tianyu, et al.
Pubblicazione: (2025)
di: Cui, Tianyu, et al.
Pubblicazione: (2025)
SeedVR: Seeding Infinity in Diffusion Transformer Towards Generic Video Restoration
di: Wang, Jianyi, et al.
Pubblicazione: (2025)
di: Wang, Jianyi, et al.
Pubblicazione: (2025)
DiT4Edit: Diffusion Transformer for Image Editing
di: Feng, Kunyu, et al.
Pubblicazione: (2024)
di: Feng, Kunyu, et al.
Pubblicazione: (2024)
Explicit Temporal-Semantic Modeling for Dense Video Captioning via Context-Aware Cross-Modal Interaction
di: Jia, Mingda, et al.
Pubblicazione: (2025)
di: Jia, Mingda, et al.
Pubblicazione: (2025)
Edit As You Wish: Video Caption Editing with Multi-grained User Control
di: Yao, Linli, et al.
Pubblicazione: (2023)
di: Yao, Linli, et al.
Pubblicazione: (2023)
HTDC: Hesitation-Triggered Differential Calibration for Mitigating Hallucination in Large Vision-Language Models
di: Liu, Xinyun
Pubblicazione: (2026)
di: Liu, Xinyun
Pubblicazione: (2026)
UniVG: A Generalist Diffusion Model for Unified Image Generation and Editing
di: Fu, Tsu-Jui, et al.
Pubblicazione: (2025)
di: Fu, Tsu-Jui, et al.
Pubblicazione: (2025)
EditInfinity: Image Editing with Binary-Quantized Generative Models
di: Wang, Jiahuan, et al.
Pubblicazione: (2025)
di: Wang, Jiahuan, et al.
Pubblicazione: (2025)
VITRIX-CLIPIN: Enhancing Fine-Grained Visual Understanding in CLIP via Instruction Editing Data and Long Captions
di: Wang, Ziteng, et al.
Pubblicazione: (2025)
di: Wang, Ziteng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
ReasonEdit: Towards Interpretable Image Editing Evaluation via Reinforcement Learning
di: Chen, Honghua, et al.
Pubblicazione: (2026) -
FlowDC: Flow-Based Decoupling-Decay for Complex Image Editing
di: Jiang, Yilei, et al.
Pubblicazione: (2025) -
Target-aware Image Editing via Cycle-consistent Constraints
di: Wang, Yanghao, et al.
Pubblicazione: (2025) -
Event-Customized Image Generation
di: Wang, Zhen, et al.
Pubblicazione: (2024) -
CLIPDrag: Combining Text-based and Drag-based Instructions for Image Editing
di: Jiang, Ziqi, et al.
Pubblicazione: (2024)