Pico-Banana-400K: A Large-Scale Dataset for Text-Guided Image Editing
Fuente:
arXiv
Guardado en:
| Autores principales: | Qian, Yusu, Bocek-Rivele, Eli, Song, Liangchen, Tong, Jialing, Yang, Yinfei, Lu, Jiasen, Hu, Wenze, Gan, Zhe |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
GIE-Bench: Towards Grounded Evaluation for Text-Guided Image Editing
por: Qian, Yusu, et al.
Publicado: (2025)
por: Qian, Yusu, et al.
Publicado: (2025)
UniVG: A Generalist Diffusion Model for Unified Image Generation and Editing
por: Fu, Tsu-Jui, et al.
Publicado: (2025)
por: Fu, Tsu-Jui, et al.
Publicado: (2025)
How Easy is It to Fool Your Multimodal LLMs? An Empirical Analysis on Deceptive Prompts
por: Qian, Yusu, et al.
Publicado: (2024)
por: Qian, Yusu, et al.
Publicado: (2024)
Guiding Instruction-based Image Editing via Multimodal Large Language Models
por: Fu, Tsu-Jui, et al.
Publicado: (2023)
por: Fu, Tsu-Jui, et al.
Publicado: (2023)
MIA-Bench: Towards Better Instruction Following Evaluation of Multimodal LLMs
por: Qian, Yusu, et al.
Publicado: (2024)
por: Qian, Yusu, et al.
Publicado: (2024)
PRISM-Bench: A Benchmark of Puzzle-Based Visual Tasks with CoT Error Detection
por: Qian, Yusu, et al.
Publicado: (2025)
por: Qian, Yusu, et al.
Publicado: (2025)
UniGen-1.5: Enhancing Image Generation and Editing through Reward Unification in Reinforcement Learning
por: Tian, Rui, et al.
Publicado: (2025)
por: Tian, Rui, et al.
Publicado: (2025)
Med-Banana-50K: A Cross-modality Large-Scale Dataset for Text-guided Medical Image Editing
por: Chen, Zhihui, et al.
Publicado: (2025)
por: Chen, Zhihui, et al.
Publicado: (2025)
DiT-Air: Revisiting the Efficiency of Diffusion Model Architecture Design in Text to Image Generation
por: Chen, Chen, et al.
Publicado: (2025)
por: Chen, Chen, et al.
Publicado: (2025)
STIV: Scalable Text and Image Conditioned Video Generation
por: Lin, Zongyu, et al.
Publicado: (2024)
por: Lin, Zongyu, et al.
Publicado: (2024)
Autoregressive Video Generation beyond Next Frames Prediction
por: Ren, Sucheng, et al.
Publicado: (2025)
por: Ren, Sucheng, et al.
Publicado: (2025)
AToken: A Unified Tokenizer for Vision
por: Lu, Jiasen, et al.
Publicado: (2025)
por: Lu, Jiasen, et al.
Publicado: (2025)
Score Distillation of Flow Matching Models
por: Zhou, Mingyuan, et al.
Publicado: (2025)
por: Zhou, Mingyuan, et al.
Publicado: (2025)
CAR-Flow: Condition-Aware Reparameterization Aligns Source and Target for Better Flow Matching
por: Chen, Chen, et al.
Publicado: (2025)
por: Chen, Chen, et al.
Publicado: (2025)
Understanding Alignment in Multimodal LLMs: A Comprehensive Study
por: Amirloo, Elmira, et al.
Publicado: (2024)
por: Amirloo, Elmira, et al.
Publicado: (2024)
Revisit Large-Scale Image-Caption Data in Pre-training Multimodal Foundation Models
por: Lai, Zhengfeng, et al.
Publicado: (2024)
por: Lai, Zhengfeng, et al.
Publicado: (2024)
Agent Banana: High-Fidelity Image Editing with Agentic Thinking and Tooling
por: Ye, Ruijie, et al.
Publicado: (2026)
por: Ye, Ruijie, et al.
Publicado: (2026)
ANIM-400K: A Large-Scale Dataset for Automated End-To-End Dubbing of Video
por: Cai, Kevin, et al.
Publicado: (2024)
por: Cai, Kevin, et al.
Publicado: (2024)
FDS: Frequency-Aware Denoising Score for Text-Guided Latent Diffusion Image Editing
por: Ren, Yufan, et al.
Publicado: (2025)
por: Ren, Yufan, et al.
Publicado: (2025)
WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing
por: Zhang, Hui, et al.
Publicado: (2026)
por: Zhang, Hui, et al.
Publicado: (2026)
SlowFast-LLaVA-1.5: A Family of Token-Efficient Video Large Language Models for Long-Form Video Understanding
por: Xu, Mingze, et al.
Publicado: (2025)
por: Xu, Mingze, et al.
Publicado: (2025)
VINS-120K: Ultra High-Resolution Image Editing with A Large-Scale Dataset
por: Chen, Zhizhou, et al.
Publicado: (2026)
por: Chen, Zhizhou, et al.
Publicado: (2026)
RSEdit: Text-Guided Image Editing for Remote Sensing
por: Zhenyuan, Chen, et al.
Publicado: (2026)
por: Zhenyuan, Chen, et al.
Publicado: (2026)
Exploring Text-Guided Single Image Editing for Remote Sensing Images
por: Han, Fangzhou, et al.
Publicado: (2024)
por: Han, Fangzhou, et al.
Publicado: (2024)
Forgedit: Text Guided Image Editing via Learning and Forgetting
por: Zhang, Shiwen, et al.
Publicado: (2023)
por: Zhang, Shiwen, et al.
Publicado: (2023)
MagicBrush: A Manually Annotated Dataset for Instruction-Guided Image Editing
por: Zhang, Kai, et al.
Publicado: (2023)
por: Zhang, Kai, et al.
Publicado: (2023)
ParallelEdits: Efficient Multi-object Image Editing
por: Huang, Mingzhen, et al.
Publicado: (2024)
por: Huang, Mingzhen, et al.
Publicado: (2024)
A Survey of Multimodal-Guided Image Editing with Text-to-Image Diffusion Models
por: Shuai, Xincheng, et al.
Publicado: (2024)
por: Shuai, Xincheng, et al.
Publicado: (2024)
MultiBanana: A Challenging Benchmark for Multi-Reference Text-to-Image Generation
por: Oshima, Yuta, et al.
Publicado: (2025)
por: Oshima, Yuta, et al.
Publicado: (2025)
Wavelet-Guided Acceleration of Text Inversion in Diffusion-Based Image Editing
por: Koo, Gwanhyeong, et al.
Publicado: (2024)
por: Koo, Gwanhyeong, et al.
Publicado: (2024)
LocInv: Localization-aware Inversion for Text-Guided Image Editing
por: Tang, Chuanming, et al.
Publicado: (2024)
por: Tang, Chuanming, et al.
Publicado: (2024)
Text Guided Image Editing with Automatic Concept Locating and Forgetting
por: Li, Jia, et al.
Publicado: (2024)
por: Li, Jia, et al.
Publicado: (2024)
Compressing LLMs: The Truth is Rarely Pure and Never Simple
por: Jaiswal, Ajay, et al.
Publicado: (2023)
por: Jaiswal, Ajay, et al.
Publicado: (2023)
MOFI: Learning Image Representations from Noisy Entity Annotated Images
por: Wu, Wentao, et al.
Publicado: (2023)
por: Wu, Wentao, et al.
Publicado: (2023)
Are Watermarked Images Editable? SafeMark for Watermark-Preserving Text-Guided Image Editing
por: Wu, Xiaodong, et al.
Publicado: (2026)
por: Wu, Xiaodong, et al.
Publicado: (2026)
Energy-Guided Optimization for Personalized Image Editing with Pretrained Text-to-Image Diffusion Models
por: Jiang, Rui, et al.
Publicado: (2025)
por: Jiang, Rui, et al.
Publicado: (2025)
ArchCAD-400K: A Large-Scale CAD drawings Dataset and New Baseline for Panoptic Symbol Spotting
por: Luo, Ruifeng, et al.
Publicado: (2025)
por: Luo, Ruifeng, et al.
Publicado: (2025)
Ferret-UI: Grounded Mobile UI Understanding with Multimodal LLMs
por: You, Keen, et al.
Publicado: (2024)
por: You, Keen, et al.
Publicado: (2024)
Large Language Models are Universal Reasoners for Visual Generation
por: Ren, Sucheng, et al.
Publicado: (2026)
por: Ren, Sucheng, et al.
Publicado: (2026)
ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation
por: Chen, Sherry X., et al.
Publicado: (2025)
por: Chen, Sherry X., et al.
Publicado: (2025)
Ejemplares similares
-
GIE-Bench: Towards Grounded Evaluation for Text-Guided Image Editing
por: Qian, Yusu, et al.
Publicado: (2025) -
UniVG: A Generalist Diffusion Model for Unified Image Generation and Editing
por: Fu, Tsu-Jui, et al.
Publicado: (2025) -
How Easy is It to Fool Your Multimodal LLMs? An Empirical Analysis on Deceptive Prompts
por: Qian, Yusu, et al.
Publicado: (2024) -
Guiding Instruction-based Image Editing via Multimodal Large Language Models
por: Fu, Tsu-Jui, et al.
Publicado: (2023) -
MIA-Bench: Towards Better Instruction Following Evaluation of Multimodal LLMs
por: Qian, Yusu, et al.
Publicado: (2024)