Salvato in:
| Autori principali: | Liu, Shiyu, Han, Yucheng, Xing, Peng, Yin, Fukun, Wang, Rui, Cheng, Wei, Liao, Jiaqi, Wang, Yingming, Fu, Honghao, Han, Chunrui, Li, Guopeng, Peng, Yuang, Sun, Quan, Wu, Jingwei, Cai, Yan, Ge, Zheng, Ming, Ranchen, Xia, Lei, Zeng, Xianfang, Zhu, Yibo, Jiao, Binxing, Zhang, Xiangyu, Yu, Gang, Jiang, Daxin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2504.17761 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ReasonEdit: Towards Reasoning-Enhanced Image Editing Models
di: Yin, Fukun, et al.
Pubblicazione: (2025)
di: Yin, Fukun, et al.
Pubblicazione: (2025)
NextStep-1: Toward Autoregressive Image Generation with Continuous Tokens at Scale
di: NextStep Team, et al.
Pubblicazione: (2025)
di: NextStep Team, et al.
Pubblicazione: (2025)
Step-Audio-EditX Technical Report
di: Yan, Chao, et al.
Pubblicazione: (2025)
di: Yan, Chao, et al.
Pubblicazione: (2025)
RealRestorer: Towards Generalizable Real-World Image Restoration with Large-Scale Image Editing Models
di: Yang, Yufeng, et al.
Pubblicazione: (2026)
di: Yang, Yufeng, et al.
Pubblicazione: (2026)
DGAE: Diffusion-Guided Autoencoder for Efficient Latent Representation Learning
di: Liu, Dongxu, et al.
Pubblicazione: (2025)
di: Liu, Dongxu, et al.
Pubblicazione: (2025)
Thinking by Doing: Building Efficient World Model Reasoning in LLMs via Multi-turn Interaction
di: Shu, Bao, et al.
Pubblicazione: (2025)
di: Shu, Bao, et al.
Pubblicazione: (2025)
Perception-R1: Pioneering Perception Policy with Reinforcement Learning
di: Yu, En, et al.
Pubblicazione: (2025)
di: Yu, En, et al.
Pubblicazione: (2025)
Exploring Recurrent Long-term Temporal Fusion for Multi-view 3D Perception
di: Han, Chunrui, et al.
Pubblicazione: (2023)
di: Han, Chunrui, et al.
Pubblicazione: (2023)
SE-Agent: Self-Evolution Trajectory Optimization in Multi-Step Reasoning with LLM-Based Agents
di: Lin, Jiaye, et al.
Pubblicazione: (2025)
di: Lin, Jiaye, et al.
Pubblicazione: (2025)
Edit Where You Mean: Region-Aware Adapter Injection for Mask-Free Local Image Editing
di: Cai, Honghao, et al.
Pubblicazione: (2026)
di: Cai, Honghao, et al.
Pubblicazione: (2026)
DeepEdit: Knowledge Editing as Decoding with Constraints
di: Wang, Yiwei, et al.
Pubblicazione: (2024)
di: Wang, Yiwei, et al.
Pubblicazione: (2024)
DreamBench++: A Human-Aligned Benchmark for Personalized Image Generation
di: Peng, Yuang, et al.
Pubblicazione: (2024)
di: Peng, Yuang, et al.
Pubblicazione: (2024)
CARE-Edit: Condition-Aware Routing of Experts for Contextual Image Editing
di: Wang, Yucheng, et al.
Pubblicazione: (2026)
di: Wang, Yucheng, et al.
Pubblicazione: (2026)
SeedEdit: Align Image Re-Generation to Image Editing
di: Shi, Yichun, et al.
Pubblicazione: (2024)
di: Shi, Yichun, et al.
Pubblicazione: (2024)
FlexEdit: Marrying Free-Shape Masks to VLLM for Flexible Image Editing
di: Yuan, Tianshuo, et al.
Pubblicazione: (2024)
di: Yuan, Tianshuo, et al.
Pubblicazione: (2024)
General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model
di: Wei, Haoran, et al.
Pubblicazione: (2024)
di: Wei, Haoran, et al.
Pubblicazione: (2024)
Text Embeddings by Weakly-Supervised Contrastive Pre-training
di: Wang, Liang, et al.
Pubblicazione: (2022)
di: Wang, Liang, et al.
Pubblicazione: (2022)
Random Policy Valuation is Enough for LLM Reasoning with Verifiable Rewards
di: He, Haoran, et al.
Pubblicazione: (2025)
di: He, Haoran, et al.
Pubblicazione: (2025)
Adam: Dense Retrieval Distillation with Adaptive Dark Examples
di: Tao, Chongyang, et al.
Pubblicazione: (2022)
di: Tao, Chongyang, et al.
Pubblicazione: (2022)
Open Vision Reasoner: Transferring Linguistic Cognitive Behavior for Visual Reasoning
di: Wei, Yana, et al.
Pubblicazione: (2025)
di: Wei, Yana, et al.
Pubblicazione: (2025)
LocateEdit-Bench: A Benchmark for Instruction-Based Editing Localization
di: Wu, Shiyu, et al.
Pubblicazione: (2026)
di: Wu, Shiyu, et al.
Pubblicazione: (2026)
ComplexBench-Edit: Benchmarking Complex Instruction-Driven Image Editing via Compositional Dependencies
di: Wang, Chenglin, et al.
Pubblicazione: (2025)
di: Wang, Chenglin, et al.
Pubblicazione: (2025)
Learning to Compress: Unlocking the Potential of Large Language Models for Text Representation
di: Zhang, Yeqin, et al.
Pubblicazione: (2025)
di: Zhang, Yeqin, et al.
Pubblicazione: (2025)
WithAnyone: Towards Controllable and ID Consistent Image Generation
di: Xu, Hengyuan, et al.
Pubblicazione: (2025)
di: Xu, Hengyuan, et al.
Pubblicazione: (2025)
ChordEdit: One-Step Low-Energy Transport for Image Editing
di: Lu, Liangsi, et al.
Pubblicazione: (2026)
di: Lu, Liangsi, et al.
Pubblicazione: (2026)
EtCon: Edit-then-Consolidate for Reliable Knowledge Editing
di: Li, Ruilin, et al.
Pubblicazione: (2025)
di: Li, Ruilin, et al.
Pubblicazione: (2025)
SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing
di: Zhang, Hanlin, et al.
Pubblicazione: (2026)
di: Zhang, Hanlin, et al.
Pubblicazione: (2026)
OmniSVG: A Unified Scalable Vector Graphics Generation Model
di: Yang, Yiying, et al.
Pubblicazione: (2025)
di: Yang, Yiying, et al.
Pubblicazione: (2025)
RegionE: Adaptive Region-Aware Generation for Efficient Image Editing
di: Chen, Pengtao, et al.
Pubblicazione: (2025)
di: Chen, Pengtao, et al.
Pubblicazione: (2025)
GEBench: Benchmarking Image Generation Models as GUI Environments
di: Li, Haodong, et al.
Pubblicazione: (2026)
di: Li, Haodong, et al.
Pubblicazione: (2026)
Rethinking Where to Edit: Task-Aware Localization for Instruction-Based Image Editing
di: He, Jingxuan, et al.
Pubblicazione: (2026)
di: He, Jingxuan, et al.
Pubblicazione: (2026)
UniEdit-Flow: Unleashing Inversion and Editing in the Era of Flow Models
di: Jiao, Guanlong, et al.
Pubblicazione: (2025)
di: Jiao, Guanlong, et al.
Pubblicazione: (2025)
ResetEdit: Precise Text-guided Editing of Generated Image via Resettable Starting Latent
di: Wang, Hanyi, et al.
Pubblicazione: (2026)
di: Wang, Hanyi, et al.
Pubblicazione: (2026)
In-Context Learning with Unpaired Clips for Instruction-based Video Editing
di: Liao, Xinyao, et al.
Pubblicazione: (2025)
di: Liao, Xinyao, et al.
Pubblicazione: (2025)
HQ-Edit: A High-Quality Dataset for Instruction-based Image Editing
di: Hui, Mude, et al.
Pubblicazione: (2024)
di: Hui, Mude, et al.
Pubblicazione: (2024)
FreeEdit: Mask-free Reference-based Image Editing with Multi-modal Instruction
di: He, Runze, et al.
Pubblicazione: (2024)
di: He, Runze, et al.
Pubblicazione: (2024)
AutoEdit: Automatic Hyperparameter Tuning for Image Editing
di: Pham, Chau, et al.
Pubblicazione: (2025)
di: Pham, Chau, et al.
Pubblicazione: (2025)
Step-Video-TI2V Technical Report: A State-of-the-Art Text-Driven Image-to-Video Generation Model
di: Huang, Haoyang, et al.
Pubblicazione: (2025)
di: Huang, Haoyang, et al.
Pubblicazione: (2025)
DreamLLM: Synergistic Multimodal Comprehension and Creation
di: Dong, Runpei, et al.
Pubblicazione: (2023)
di: Dong, Runpei, et al.
Pubblicazione: (2023)
InteractEdit: Zero-Shot Editing of Human-Object Interactions in Images
di: Hoe, Jiun Tian, et al.
Pubblicazione: (2025)
di: Hoe, Jiun Tian, et al.
Pubblicazione: (2025)
Documenti analoghi
-
ReasonEdit: Towards Reasoning-Enhanced Image Editing Models
di: Yin, Fukun, et al.
Pubblicazione: (2025) -
NextStep-1: Toward Autoregressive Image Generation with Continuous Tokens at Scale
di: NextStep Team, et al.
Pubblicazione: (2025) -
Step-Audio-EditX Technical Report
di: Yan, Chao, et al.
Pubblicazione: (2025) -
RealRestorer: Towards Generalizable Real-World Image Restoration with Large-Scale Image Editing Models
di: Yang, Yufeng, et al.
Pubblicazione: (2026) -
DGAE: Diffusion-Guided Autoencoder for Efficient Latent Representation Learning
di: Liu, Dongxu, et al.
Pubblicazione: (2025)