ChronoEdit: Towards Temporal Reasoning for Image Editing and World Simulation
Fuente:
arXiv
Guardado en:
| Autores principales: | Wu, Jay Zhangjie, Ren, Xuanchi, Shen, Tianchang, Cao, Tianshi, He, Kai, Lu, Yifan, Gao, Ruiyuan, Xie, Enze, Lan, Shiyi, Alvarez, Jose M., Gao, Jun, Fidler, Sanja, Wang, Zian, Ling, Huan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
APE: Agentic Prompt Enhancer for Image Generation and Editing
por: Huang, Zijian, et al.
Publicado: (2026)
por: Huang, Zijian, et al.
Publicado: (2026)
PiD: Fast and High-Resolution Latent Decoding with Pixel Diffusion
por: Lu, Yifan, et al.
Publicado: (2026)
por: Lu, Yifan, et al.
Publicado: (2026)
Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players
por: Liu, Fangfu, et al.
Publicado: (2026)
por: Liu, Fangfu, et al.
Publicado: (2026)
Cosmos-Drive-Dreams: Scalable Synthetic Driving Data Generation with World Foundation Models
por: Ren, Xuanchi, et al.
Publicado: (2025)
por: Ren, Xuanchi, et al.
Publicado: (2025)
MoRight: Motion Control Done Right
por: Liu, Shaowei, et al.
Publicado: (2026)
por: Liu, Shaowei, et al.
Publicado: (2026)
InfiniCube: Unbounded and Controllable Dynamic 3D Driving Scene Generation with World-Guided Video Models
por: Lu, Yifan, et al.
Publicado: (2024)
por: Lu, Yifan, et al.
Publicado: (2024)
GEN3C: 3D-Informed World-Consistent Video Generation with Precise Camera Control
por: Ren, Xuanchi, et al.
Publicado: (2025)
por: Ren, Xuanchi, et al.
Publicado: (2025)
Lyra 2.0: Explorable Generative 3D Worlds
por: Shen, Tianchang, et al.
Publicado: (2026)
por: Shen, Tianchang, et al.
Publicado: (2026)
Difix3D+: Improving 3D Reconstructions with Single-Step Diffusion Models
por: Wu, Jay Zhangjie, et al.
Publicado: (2025)
por: Wu, Jay Zhangjie, et al.
Publicado: (2025)
SCube: Instant Large-Scale Scene Reconstruction using VoxSplats
por: Ren, Xuanchi, et al.
Publicado: (2024)
por: Ren, Xuanchi, et al.
Publicado: (2024)
Lyra: Generative 3D Scene Reconstruction via Video Diffusion Model Self-Distillation
por: Bahmani, Sherwin, et al.
Publicado: (2025)
por: Bahmani, Sherwin, et al.
Publicado: (2025)
XCube: Large-Scale 3D Generative Modeling using Sparse Voxel Hierarchies
por: Ren, Xuanchi, et al.
Publicado: (2023)
por: Ren, Xuanchi, et al.
Publicado: (2023)
Augmented Reality based Simulated Data (ARSim) with multi-view consistency for AV perception networks
por: Anwar, Aqeel, et al.
Publicado: (2024)
por: Anwar, Aqeel, et al.
Publicado: (2024)
ViPE: Video Pose Engine for 3D Geometric Perception
por: Huang, Jiahui, et al.
Publicado: (2025)
por: Huang, Jiahui, et al.
Publicado: (2025)
EditWorld: Simulating World Dynamics for Instruction-Following Image Editing
por: Yang, Ling, et al.
Publicado: (2024)
por: Yang, Ling, et al.
Publicado: (2024)
SpaceMesh: A Continuous Representation for Learning Manifold Surface Meshes
por: Shen, Tianchang, et al.
Publicado: (2024)
por: Shen, Tianchang, et al.
Publicado: (2024)
ViR: Towards Efficient Vision Retention Backbones
por: Hatamizadeh, Ali, et al.
Publicado: (2023)
por: Hatamizadeh, Ali, et al.
Publicado: (2023)
ArtiFixer: Enhancing and Extending 3D Reconstruction with Auto-Regressive Diffusion Models
por: de Lutio, Riccardo, et al.
Publicado: (2026)
por: de Lutio, Riccardo, et al.
Publicado: (2026)
Align Your Gaussians: Text-to-4D with Dynamic 3D Gaussians and Composed Diffusion Models
por: Ling, Huan, et al.
Publicado: (2023)
por: Ling, Huan, et al.
Publicado: (2023)
LATTE3D: Large-scale Amortized Text-To-Enhanced3D Synthesis
por: Xie, Kevin, et al.
Publicado: (2024)
por: Xie, Kevin, et al.
Publicado: (2024)
DiffusionRenderer: Neural Inverse and Forward Rendering with Video Diffusion Models
por: Liang, Ruofan, et al.
Publicado: (2025)
por: Liang, Ruofan, et al.
Publicado: (2025)
Reasoning Paths with Reference Objects Elicit Quantitative Spatial Reasoning in Large Vision-Language Models
por: Liao, Yuan-Hong, et al.
Publicado: (2024)
por: Liao, Yuan-Hong, et al.
Publicado: (2024)
KV-Edit: Training-Free Image Editing for Precise Background Preservation
por: Zhu, Tianrui, et al.
Publicado: (2025)
por: Zhu, Tianrui, et al.
Publicado: (2025)
Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control
por: NVIDIA, et al.
Publicado: (2025)
por: NVIDIA, et al.
Publicado: (2025)
LuxDiT: Lighting Estimation with Video Diffusion Transformer
por: Liang, Ruofan, et al.
Publicado: (2025)
por: Liang, Ruofan, et al.
Publicado: (2025)
Align Your Flow: Scaling Continuous-Time Flow Map Distillation
por: Sabour, Amirmojtaba, et al.
Publicado: (2025)
por: Sabour, Amirmojtaba, et al.
Publicado: (2025)
Align Your Steps: Optimizing Sampling Schedules in Diffusion Models
por: Sabour, Amirmojtaba, et al.
Publicado: (2024)
por: Sabour, Amirmojtaba, et al.
Publicado: (2024)
Controllable Weather Synthesis and Removal with Video Diffusion Models
por: Lin, Chih-Hao, et al.
Publicado: (2025)
por: Lin, Chih-Hao, et al.
Publicado: (2025)
Photorealistic Object Insertion with Diffusion-Guided Inverse Rendering
por: Liang, Ruofan, et al.
Publicado: (2024)
por: Liang, Ruofan, et al.
Publicado: (2024)
DiffusionHarmonizer: Bridging Neural Reconstruction and Photorealistic Simulation with Online Diffusion Enhancer
por: Zhang, Yuxuan, et al.
Publicado: (2026)
por: Zhang, Yuxuan, et al.
Publicado: (2026)
Chronos: Learning Temporal Dynamics of Reasoning Chains for Test-Time Scaling
por: Zhang, Kai, et al.
Publicado: (2026)
por: Zhang, Kai, et al.
Publicado: (2026)
WorldEdit: Towards Open-World Image Editing with a Knowledge-Informed Benchmark
por: Lin, Wang, et al.
Publicado: (2026)
por: Lin, Wang, et al.
Publicado: (2026)
ReasonEdit: Towards Reasoning-Enhanced Image Editing Models
por: Yin, Fukun, et al.
Publicado: (2025)
por: Yin, Fukun, et al.
Publicado: (2025)
ChronosObserver: Taming 4D World with Hyperspace Diffusion Sampling
por: Wang, Qisen, et al.
Publicado: (2025)
por: Wang, Qisen, et al.
Publicado: (2025)
Trajeglish: Traffic Modeling as Next-Token Prediction
por: Philion, Jonah, et al.
Publicado: (2023)
por: Philion, Jonah, et al.
Publicado: (2023)
VideoMat: Extracting PBR Materials from Video Diffusion Models
por: Munkberg, Jacob, et al.
Publicado: (2025)
por: Munkberg, Jacob, et al.
Publicado: (2025)
PhysEdit: Physically-Consistent Region-Aware Image Editing via Adaptive Spatio-Temporal Reasoning
por: Li, Guandong, et al.
Publicado: (2026)
por: Li, Guandong, et al.
Publicado: (2026)
ReasonEdit: Editing Vision-Language Models using Human Reasoning
por: Qiu, Jiaxing, et al.
Publicado: (2026)
por: Qiu, Jiaxing, et al.
Publicado: (2026)
Reasoning to Edit: Hypothetical Instruction-Based Image Editing with Visual Reasoning
por: He, Qingdong, et al.
Publicado: (2025)
por: He, Qingdong, et al.
Publicado: (2025)
ChronoDreamer: Action-Conditioned World Model as an Online Simulator for Robotic Planning
por: Zhou, Zhenhao, et al.
Publicado: (2025)
por: Zhou, Zhenhao, et al.
Publicado: (2025)
Ejemplares similares
-
APE: Agentic Prompt Enhancer for Image Generation and Editing
por: Huang, Zijian, et al.
Publicado: (2026) -
PiD: Fast and High-Resolution Latent Decoding with Pixel Diffusion
por: Lu, Yifan, et al.
Publicado: (2026) -
Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players
por: Liu, Fangfu, et al.
Publicado: (2026) -
Cosmos-Drive-Dreams: Scalable Synthetic Driving Data Generation with World Foundation Models
por: Ren, Xuanchi, et al.
Publicado: (2025) -
MoRight: Motion Control Done Right
por: Liu, Shaowei, et al.
Publicado: (2026)