SEED-Data-Edit Technical Report: A Hybrid Dataset for Instructional Image Editing
Fuente:
arXiv
Salvato in:
| Autori principali: | Ge, Yuying, Zhao, Sijie, Li, Chen, Ge, Yixiao, Shan, Ying |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation
di: Ge, Yuying, et al.
Pubblicazione: (2024)
di: Ge, Yuying, et al.
Pubblicazione: (2024)
SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension
di: Li, Bohao, et al.
Pubblicazione: (2024)
di: Li, Bohao, et al.
Pubblicazione: (2024)
SEED-Story: Multimodal Long Story Generation with Large Language Model
di: Yang, Shuai, et al.
Pubblicazione: (2024)
di: Yang, Shuai, et al.
Pubblicazione: (2024)
Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation
di: Ge, Yuying, et al.
Pubblicazione: (2024)
di: Ge, Yuying, et al.
Pubblicazione: (2024)
AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation
di: Qiu, Lu, et al.
Pubblicazione: (2025)
di: Qiu, Lu, et al.
Pubblicazione: (2025)
Exploring the Effect of Reinforcement Learning on Video Understanding: Insights from SEED-Bench-R1
di: Chen, Yi, et al.
Pubblicazione: (2025)
di: Chen, Yi, et al.
Pubblicazione: (2025)
DiCoDe: Diffusion-Compressed Deep Tokens for Autoregressive Video Generation with Language Models
di: Li, Yizhuo, et al.
Pubblicazione: (2024)
di: Li, Yizhuo, et al.
Pubblicazione: (2024)
AnimeGamer: Infinite Anime Life Simulation with Next Game State Prediction
di: Cheng, Junhao, et al.
Pubblicazione: (2025)
di: Cheng, Junhao, et al.
Pubblicazione: (2025)
ARC-Chapter: Structuring Hour-Long Videos into Navigable Chapters and Hierarchical Summaries
di: Pu, Junfu, et al.
Pubblicazione: (2025)
di: Pu, Junfu, et al.
Pubblicazione: (2025)
Aligning Latent Spaces with Flow Priors
di: Li, Yizhuo, et al.
Pubblicazione: (2025)
di: Li, Yizhuo, et al.
Pubblicazione: (2025)
BT-Adapter: Video Conversation is Feasible Without Video Instruction Tuning
di: Liu, Ruyang, et al.
Pubblicazione: (2023)
di: Liu, Ruyang, et al.
Pubblicazione: (2023)
Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?
di: Cheng, Junhao, et al.
Pubblicazione: (2025)
di: Cheng, Junhao, et al.
Pubblicazione: (2025)
GenHancer: Imperfect Generative Models are Secretly Strong Vision-Centric Enhancers
di: Ma, Shijie, et al.
Pubblicazione: (2025)
di: Ma, Shijie, et al.
Pubblicazione: (2025)
EgoPlan-Bench2: A Benchmark for Multimodal Large Language Model Planning in Real-World Scenarios
di: Qiu, Lu, et al.
Pubblicazione: (2024)
di: Qiu, Lu, et al.
Pubblicazione: (2024)
SuperEdit: Rectifying and Facilitating Supervision for Instruction-Based Image Editing
di: Li, Ming, et al.
Pubblicazione: (2025)
di: Li, Ming, et al.
Pubblicazione: (2025)
Supervised Fine-tuning in turn Improves Visual Foundation Models
di: Jiang, Xiaohu, et al.
Pubblicazione: (2024)
di: Jiang, Xiaohu, et al.
Pubblicazione: (2024)
HQ-Edit: A High-Quality Dataset for Instruction-based Image Editing
di: Hui, Mude, et al.
Pubblicazione: (2024)
di: Hui, Mude, et al.
Pubblicazione: (2024)
UltraEdit: Instruction-based Fine-Grained Image Editing at Scale
di: Zhao, Haozhe, et al.
Pubblicazione: (2024)
di: Zhao, Haozhe, et al.
Pubblicazione: (2024)
ST-LLM: Large Language Models Are Effective Temporal Learners
di: Liu, Ruyang, et al.
Pubblicazione: (2024)
di: Liu, Ruyang, et al.
Pubblicazione: (2024)
TBStar-Edit: From Image Editing Pattern Shifting to Consistency Enhancement
di: Fang, Hao, et al.
Pubblicazione: (2025)
di: Fang, Hao, et al.
Pubblicazione: (2025)
HumanEdit: A High-Quality Human-Rewarded Dataset for Instruction-based Image Editing
di: Bai, Jinbin, et al.
Pubblicazione: (2024)
di: Bai, Jinbin, et al.
Pubblicazione: (2024)
MultiEdit: Advancing Instruction-based Image Editing on Diverse and Challenging Tasks
di: Li, Mingsong, et al.
Pubblicazione: (2025)
di: Li, Mingsong, et al.
Pubblicazione: (2025)
ImgEdit: A Unified Image Editing Dataset and Benchmark
di: Ye, Yang, et al.
Pubblicazione: (2025)
di: Ye, Yang, et al.
Pubblicazione: (2025)
AudioStory: Generating Long-Form Narrative Audio with Large Language Models
di: Guo, Yuxin, et al.
Pubblicazione: (2025)
di: Guo, Yuxin, et al.
Pubblicazione: (2025)
Edit-GRPO: A Locality-Preserving Policy Optimization Framework for Image Editing
di: Xu, Shaodong, et al.
Pubblicazione: (2026)
di: Xu, Shaodong, et al.
Pubblicazione: (2026)
Reasoning to Edit: Hypothetical Instruction-Based Image Editing with Visual Reasoning
di: He, Qingdong, et al.
Pubblicazione: (2025)
di: He, Qingdong, et al.
Pubblicazione: (2025)
Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing
di: Yeh, Chun-Hsiao, et al.
Pubblicazione: (2025)
di: Yeh, Chun-Hsiao, et al.
Pubblicazione: (2025)
UniRepLKNet: A Universal Perception Large-Kernel ConvNet for Audio, Video, Point Cloud, Time-Series and Image Recognition
di: Ding, Xiaohan, et al.
Pubblicazione: (2023)
di: Ding, Xiaohan, et al.
Pubblicazione: (2023)
TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs
di: Zhang, Jun, et al.
Pubblicazione: (2025)
di: Zhang, Jun, et al.
Pubblicazione: (2025)
InsightEdit: Towards Better Instruction Following for Image Editing
di: Xu, Yingjing, et al.
Pubblicazione: (2024)
di: Xu, Yingjing, et al.
Pubblicazione: (2024)
Multi-Reward as Condition for Instruction-based Image Editing
di: Gu, Xin, et al.
Pubblicazione: (2024)
di: Gu, Xin, et al.
Pubblicazione: (2024)
GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning
di: Chen, Yi, et al.
Pubblicazione: (2025)
di: Chen, Yi, et al.
Pubblicazione: (2025)
Group Editing: Edit Multiple Images in One Go
di: Ma, Yue, et al.
Pubblicazione: (2026)
di: Ma, Yue, et al.
Pubblicazione: (2026)
EgoPlan-Bench: Benchmarking Multimodal Large Language Models for Human-Level Planning
di: Chen, Yi, et al.
Pubblicazione: (2023)
di: Chen, Yi, et al.
Pubblicazione: (2023)
PostEdit: Posterior Sampling for Efficient Zero-Shot Image Editing
di: Tian, Feng, et al.
Pubblicazione: (2024)
di: Tian, Feng, et al.
Pubblicazione: (2024)
BrushEdit: All-In-One Image Inpainting and Editing
di: Li, Yaowei, et al.
Pubblicazione: (2024)
di: Li, Yaowei, et al.
Pubblicazione: (2024)
SliderEdit: Continuous Image Editing with Fine-Grained Instruction Control
di: Zarei, Arman, et al.
Pubblicazione: (2025)
di: Zarei, Arman, et al.
Pubblicazione: (2025)
ParallelEdits: Efficient Multi-object Image Editing
di: Huang, Mingzhen, et al.
Pubblicazione: (2024)
di: Huang, Mingzhen, et al.
Pubblicazione: (2024)
OmniEdit: Building Image Editing Generalist Models Through Specialist Supervision
di: Wei, Cong, et al.
Pubblicazione: (2024)
di: Wei, Cong, et al.
Pubblicazione: (2024)
LocateEdit-Bench: A Benchmark for Instruction-Based Editing Localization
di: Wu, Shiyu, et al.
Pubblicazione: (2026)
di: Wu, Shiyu, et al.
Pubblicazione: (2026)
Documenti analoghi
-
SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation
di: Ge, Yuying, et al.
Pubblicazione: (2024) -
SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension
di: Li, Bohao, et al.
Pubblicazione: (2024) -
SEED-Story: Multimodal Long Story Generation with Large Language Model
di: Yang, Shuai, et al.
Pubblicazione: (2024) -
Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation
di: Ge, Yuying, et al.
Pubblicazione: (2024) -
AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation
di: Qiu, Lu, et al.
Pubblicazione: (2025)