Empowering Visual Creativity: A Vision-Language Assistant to Image Editing Recommendations
Fuente:
arXiv
Guardado en:
| Autores principales: | Shen, Tiancheng, Liew, Jun Hao, Mai, Long, Qi, Lu, Feng, Jiashi, Jia, Jiaya |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
GigaTok: Scaling Visual Tokenizers to 3 Billion Parameters for Autoregressive Image Generation
por: Xiong, Tianwei, et al.
Publicado: (2025)
por: Xiong, Tianwei, et al.
Publicado: (2025)
LightningDrag: Lightning Fast and Accurate Drag-based Image Editing Emerging from Videos
por: Shi, Yujun, et al.
Publicado: (2024)
por: Shi, Yujun, et al.
Publicado: (2024)
The Scalability of Simplicity: Empirical Analysis of Vision-Language Learning with a Single Transformer
por: Lei, Weixian, et al.
Publicado: (2025)
por: Lei, Weixian, et al.
Publicado: (2025)
EVATok: Adaptive Length Video Tokenization for Efficient Visual Autoregressive Generation
por: Xiong, Tianwei, et al.
Publicado: (2026)
por: Xiong, Tianwei, et al.
Publicado: (2026)
LLMGA: Multimodal Large Language Model based Generation Assistant
por: Xia, Bin, et al.
Publicado: (2023)
por: Xia, Bin, et al.
Publicado: (2023)
High Quality Segmentation for Ultra High-resolution Images
por: Shen, Tiancheng, et al.
Publicado: (2021)
por: Shen, Tiancheng, et al.
Publicado: (2021)
ViSurf: Visual Supervised-and-Reinforcement Fine-Tuning for Large Vision-and-Language Models
por: Liu, Yuqi, et al.
Publicado: (2025)
por: Liu, Yuqi, et al.
Publicado: (2025)
DreamOmni: Unified Image Generation and Editing
por: Xia, Bin, et al.
Publicado: (2024)
por: Xia, Bin, et al.
Publicado: (2024)
InstructRL4Pix: Training Diffusion for Image Editing by Reinforcement Learning
por: Li, Tiancheng, et al.
Publicado: (2024)
por: Li, Tiancheng, et al.
Publicado: (2024)
VLPose: Bridging the Domain Gap in Pose Estimation with Language-Vision Tuning
por: Li, Jingyao, et al.
Publicado: (2024)
por: Li, Jingyao, et al.
Publicado: (2024)
FFAA: Multimodal Large Language Model based Explainable Open-World Face Forgery Analysis Assistant
por: Huang, Zhengchao, et al.
Publicado: (2024)
por: Huang, Zhengchao, et al.
Publicado: (2024)
Classification Done Right for Vision-Language Pre-Training
por: Huang, Zilong, et al.
Publicado: (2024)
por: Huang, Zilong, et al.
Publicado: (2024)
DreamVE: Unified Instruction-based Image and Video Editing
por: Xia, Bin, et al.
Publicado: (2025)
por: Xia, Bin, et al.
Publicado: (2025)
VisionDirector: Vision-Language Guided Closed-Loop Refinement for Generative Image Synthesis
por: Chu, Meng, et al.
Publicado: (2025)
por: Chu, Meng, et al.
Publicado: (2025)
VisionReasoner: Unified Reasoning-Integrated Visual Perception via Reinforcement Learning
por: Liu, Yuqi, et al.
Publicado: (2025)
por: Liu, Yuqi, et al.
Publicado: (2025)
Depth Anything 3: Recovering the Visual Space from Any Views
por: Lin, Haotong, et al.
Publicado: (2025)
por: Lin, Haotong, et al.
Publicado: (2025)
Does Your Vision-Language Model Get Lost in the Long Video Sampling Dilemma?
por: Qu, Tianyuan, et al.
Publicado: (2025)
por: Qu, Tianyuan, et al.
Publicado: (2025)
AdjointDPM: Adjoint Sensitivity Method for Gradient Backpropagation of Diffusion Probabilistic Models
por: Pan, Jiachun, et al.
Publicado: (2023)
por: Pan, Jiachun, et al.
Publicado: (2023)
TraveLLaMA: A Multimodal Travel Assistant with Large-Scale Dataset and Structured Reasoning
por: Chu, Meng, et al.
Publicado: (2025)
por: Chu, Meng, et al.
Publicado: (2025)
RePlan: Reasoning-guided Region Planning for Complex Instruction-based Image Editing
por: Qu, Tianyuan, et al.
Publicado: (2025)
por: Qu, Tianyuan, et al.
Publicado: (2025)
DiG: Scalable and Efficient Diffusion Models with Gated Linear Attention
por: Zhu, Lianghui, et al.
Publicado: (2024)
por: Zhu, Lianghui, et al.
Publicado: (2024)
TRACE: Object Motion Editing in Videos with First-Frame Trajectory Guidance
por: Phung, Quynh, et al.
Publicado: (2026)
por: Phung, Quynh, et al.
Publicado: (2026)
Unified Language-driven Zero-shot Domain Adaptation
por: Yang, Senqiao, et al.
Publicado: (2024)
por: Yang, Senqiao, et al.
Publicado: (2024)
PixWizard: Versatile Image-to-Image Visual Assistant with Open-Language Instructions
por: Lin, Weifeng, et al.
Publicado: (2024)
por: Lin, Weifeng, et al.
Publicado: (2024)
High Quality Human Image Animation using Regional Supervision and Motion Blur Condition
por: Xu, Zhongcong, et al.
Publicado: (2024)
por: Xu, Zhongcong, et al.
Publicado: (2024)
Contrastive Masked Autoencoders are Stronger Vision Learners
por: Huang, Zhicheng, et al.
Publicado: (2022)
por: Huang, Zhicheng, et al.
Publicado: (2022)
Which Pretraining Paradigm Better Serves Spatial Intelligence? An Empirical Comparison of Vision-Language and Video Generation Models
por: Shen, Haozhan, et al.
Publicado: (2026)
por: Shen, Haozhan, et al.
Publicado: (2026)
AD-Copilot: A Vision-Language Assistant for Industrial Anomaly Detection via Visual In-context Comparison
por: Jiang, Xi, et al.
Publicado: (2026)
por: Jiang, Xi, et al.
Publicado: (2026)
WiseEdit: Benchmarking Cognition- and Creativity-Informed Image Editing
por: Pan, Kaihang, et al.
Publicado: (2025)
por: Pan, Kaihang, et al.
Publicado: (2025)
Vision Search Assistant: Empower Vision-Language Models as Multimodal Search Engines
por: Zhang, Zhixin, et al.
Publicado: (2024)
por: Zhang, Zhixin, et al.
Publicado: (2024)
FireEdit: Fine-grained Instruction-based Image Editing via Region-aware Vision Language Model
por: Zhou, Jun, et al.
Publicado: (2025)
por: Zhou, Jun, et al.
Publicado: (2025)
Vista-LLaMA: Reducing Hallucination in Video Language Models via Equal Distance to Visual Tokens
por: Ma, Fan, et al.
Publicado: (2023)
por: Ma, Fan, et al.
Publicado: (2023)
MOODv2: Masked Image Modeling for Out-of-Distribution Detection
por: Li, Jingyao, et al.
Publicado: (2024)
por: Li, Jingyao, et al.
Publicado: (2024)
Visual Autoregressive Modeling for Instruction-Guided Image Editing
por: Mao, Qingyang, et al.
Publicado: (2025)
por: Mao, Qingyang, et al.
Publicado: (2025)
Responsible Visual Editing
por: Ni, Minheng, et al.
Publicado: (2024)
por: Ni, Minheng, et al.
Publicado: (2024)
Mind the Interference: Retaining Pre-trained Knowledge in Parameter Efficient Continual Learning of Vision-Language Models
por: Tang, Longxiang, et al.
Publicado: (2024)
por: Tang, Longxiang, et al.
Publicado: (2024)
Generative Visual Chain-of-Thought for Image Editing
por: Yin, Zijin, et al.
Publicado: (2026)
por: Yin, Zijin, et al.
Publicado: (2026)
Edit Transfer: Learning Image Editing via Vision In-Context Relations
por: Chen, Lan, et al.
Publicado: (2025)
por: Chen, Lan, et al.
Publicado: (2025)
Learning Feature-Preserving Portrait Editing from Generated Pairs
por: Chen, Bowei, et al.
Publicado: (2024)
por: Chen, Bowei, et al.
Publicado: (2024)
LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval
por: Lu, Weiheng, et al.
Publicado: (2024)
por: Lu, Weiheng, et al.
Publicado: (2024)
Ejemplares similares
-
GigaTok: Scaling Visual Tokenizers to 3 Billion Parameters for Autoregressive Image Generation
por: Xiong, Tianwei, et al.
Publicado: (2025) -
LightningDrag: Lightning Fast and Accurate Drag-based Image Editing Emerging from Videos
por: Shi, Yujun, et al.
Publicado: (2024) -
The Scalability of Simplicity: Empirical Analysis of Vision-Language Learning with a Single Transformer
por: Lei, Weixian, et al.
Publicado: (2025) -
EVATok: Adaptive Length Video Tokenization for Efficient Visual Autoregressive Generation
por: Xiong, Tianwei, et al.
Publicado: (2026) -
LLMGA: Multimodal Large Language Model based Generation Assistant
por: Xia, Bin, et al.
Publicado: (2023)