Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Peng, Ren, Xiaoming, Liu, Fengkai, Xie, Qingsong, Zheng, Quanlong, Zhang, Yanhao, Lu, Haonan, Yang, Yujiu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
H2VU-Benchmark: A Comprehensive Benchmark for Hierarchical Holistic Video Understanding
par: Wu, Qi, et autres
Publié: (2025)
par: Wu, Qi, et autres
Publié: (2025)
Layton: Latent Consistency Tokenizer for 1024-pixel Image Reconstruction and Generation by 256 Tokens
par: Xie, Qingsong, et autres
Publié: (2025)
par: Xie, Qingsong, et autres
Publié: (2025)
X-OmniClaw Technical Report: A Unified Mobile Agent for Multimodal Understanding and Interaction
par: Ren, Xiaoming, et autres
Publié: (2026)
par: Ren, Xiaoming, et autres
Publié: (2026)
Free-MoRef: Instantly Multiplexing Context Perception Capabilities of Video-MLLMs within Single Inference
par: Wang, Kuo, et autres
Publié: (2025)
par: Wang, Kuo, et autres
Publié: (2025)
Improved Visual-Spatial Reasoning via R1-Zero-Like Training
par: Liao, Zhenyi, et autres
Publié: (2025)
par: Liao, Zhenyi, et autres
Publié: (2025)
Thinking in Streaming Video
par: Liu, Zikang, et autres
Publié: (2026)
par: Liu, Zikang, et autres
Publié: (2026)
PEA-Diffusion: Parameter-Efficient Adapter with Knowledge Distillation in non-English Text-to-Image Generation
par: Ma, Jian, et autres
Publié: (2023)
par: Ma, Jian, et autres
Publié: (2023)
Advancing Text-to-3D Generation with Linearized Lookahead Variational Score Distillation
par: Lei, Yu, et autres
Publié: (2025)
par: Lei, Yu, et autres
Publié: (2025)
TLCM: Training-efficient Latent Consistency Model for Image Generation with 2-8 Steps
par: Xie, Qingsong, et autres
Publié: (2024)
par: Xie, Qingsong, et autres
Publié: (2024)
DMTrack: Spatio-Temporal Multimodal Tracking via Dual-Adapter
par: Li, Weihong, et autres
Publié: (2025)
par: Li, Weihong, et autres
Publié: (2025)
Consolidating Diffusion-Generated Video Detection with Unified Multimodal Forgery Learning
par: Liu, Xiaohong, et autres
Publié: (2025)
par: Liu, Xiaohong, et autres
Publié: (2025)
SwiftI2V: Efficient High-Resolution Image-to-Video Generation via Conditional Segment-wise Generation
par: Liu, YaoYang, et autres
Publié: (2026)
par: Liu, YaoYang, et autres
Publié: (2026)
PainterNet: Adaptive Image Inpainting with Actual-Token Attention and Diverse Mask Control
par: Wang, Ruichen, et autres
Publié: (2024)
par: Wang, Ruichen, et autres
Publié: (2024)
MergeTok: Unified Continuous and Discrete Visual Tokenization via Token Merging
par: Zhang, Luyuan, et autres
Publié: (2026)
par: Zhang, Luyuan, et autres
Publié: (2026)
X2I: Seamless Integration of Multimodal Understanding into Diffusion Transformer via Attention Distillation
par: Ma, Jian, et autres
Publié: (2025)
par: Ma, Jian, et autres
Publié: (2025)
ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation
par: Ren, Weiming, et autres
Publié: (2024)
par: Ren, Weiming, et autres
Publié: (2024)
OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning
par: Liang, Zhijia, et autres
Publié: (2026)
par: Liang, Zhijia, et autres
Publié: (2026)
Training-free Boost for Open-Vocabulary Object Detection with Confidence Aggregation
par: Zheng, Yanhao, et autres
Publié: (2024)
par: Zheng, Yanhao, et autres
Publié: (2024)
AnyCharV: Bootstrap Controllable Character Video Generation with Fine-to-Coarse Guidance
par: Wang, Zhao, et autres
Publié: (2025)
par: Wang, Zhao, et autres
Publié: (2025)
DaMo: Data Mixing Optimizer in Fine-tuning Multimodal LLMs for Mobile Phone Agents
par: Shi, Kai, et autres
Publié: (2025)
par: Shi, Kai, et autres
Publié: (2025)
FerretNet: Efficient Synthetic Image Detection via Local Pixel Dependencies
par: Liang, Shuqiao, et autres
Publié: (2025)
par: Liang, Shuqiao, et autres
Publié: (2025)
OwlCap: Harmonizing Motion-Detail for Video Captioning via HMD-270K and Caption Set Equivalence Reward
par: Zhong, Chunlin, et autres
Publié: (2025)
par: Zhong, Chunlin, et autres
Publié: (2025)
I2V-Adapter: A General Image-to-Video Adapter for Diffusion Models
par: Guo, Xun, et autres
Publié: (2023)
par: Guo, Xun, et autres
Publié: (2023)
LAPTOP-Diff: Layer Pruning and Normalized Distillation for Compressing Diffusion Models
par: Zhang, Dingkun, et autres
Publié: (2024)
par: Zhang, Dingkun, et autres
Publié: (2024)
A Comprehensive Study of Multimodal Large Language Models for Image Quality Assessment
par: Wu, Tianhe, et autres
Publié: (2024)
par: Wu, Tianhe, et autres
Publié: (2024)
CamI2V: Camera-Controlled Image-to-Video Diffusion Model
par: Zheng, Guangcong, et autres
Publié: (2024)
par: Zheng, Guangcong, et autres
Publié: (2024)
LLMI3D: MLLM-based 3D Perception from a Single 2D Image
par: Yang, Fan, et autres
Publié: (2024)
par: Yang, Fan, et autres
Publié: (2024)
EvAnimate: Event-conditioned Image-to-Video Generation for Human Animation
par: Qu, Qiang, et autres
Publié: (2025)
par: Qu, Qiang, et autres
Publié: (2025)
Click-to-Ask: An AI Live Streaming Assistant with Offline Copywriting and Online Interactive QA
par: Yu, Ruizhi, et autres
Publié: (2026)
par: Yu, Ruizhi, et autres
Publié: (2026)
MoMA: Multimodal LLM Adapter for Fast Personalized Image Generation
par: Song, Kunpeng, et autres
Publié: (2024)
par: Song, Kunpeng, et autres
Publié: (2024)
Video-Zero: Self-Evolution Video Understanding
par: Zhang, Ruixu, et autres
Publié: (2026)
par: Zhang, Ruixu, et autres
Publié: (2026)
GenAgent: Scaling Text-to-Image Generation via Agentic Multimodal Reasoning
par: Jiang, Kaixun, et autres
Publié: (2026)
par: Jiang, Kaixun, et autres
Publié: (2026)
Wan-Move: Motion-controllable Video Generation via Latent Trajectory Guidance
par: Chu, Ruihang, et autres
Publié: (2025)
par: Chu, Ruihang, et autres
Publié: (2025)
From Static to Dynamic: Exploring Self-supervised Image-to-Video Representation Transfer Learning
par: Liu, Yang, et autres
Publié: (2026)
par: Liu, Yang, et autres
Publié: (2026)
HEIE: MLLM-Based Hierarchical Explainable AIGC Image Implausibility Evaluator
par: Yang, Fan, et autres
Publié: (2024)
par: Yang, Fan, et autres
Publié: (2024)
MaskCD: Mitigating LVLM Hallucinations by Image Head Masked Contrastive Decoding
par: Deng, Jingyuan, et autres
Publié: (2025)
par: Deng, Jingyuan, et autres
Publié: (2025)
Mitigating the Reasoning Tax in Vision-Language Fine-Tuning with Input-Adaptive Depth Aggregation
par: Ren, Yiming, et autres
Publié: (2026)
par: Ren, Yiming, et autres
Publié: (2026)
Identity-Preserving Text-to-Video Generation via Training-Free Prompt, Image, and Guidance Enhancement
par: Gao, Jiayi, et autres
Publié: (2025)
par: Gao, Jiayi, et autres
Publié: (2025)
RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control
par: Li, Teng, et autres
Publié: (2025)
par: Li, Teng, et autres
Publié: (2025)
GenEraser: Generalizable Video Object Removal via Balanced Text-Mask Guidance and Decoupled Locator-Preserver
par: Chen, Yuqing, et autres
Publié: (2026)
par: Chen, Yuqing, et autres
Publié: (2026)
Documents similaires
-
H2VU-Benchmark: A Comprehensive Benchmark for Hierarchical Holistic Video Understanding
par: Wu, Qi, et autres
Publié: (2025) -
Layton: Latent Consistency Tokenizer for 1024-pixel Image Reconstruction and Generation by 256 Tokens
par: Xie, Qingsong, et autres
Publié: (2025) -
X-OmniClaw Technical Report: A Unified Mobile Agent for Multimodal Understanding and Interaction
par: Ren, Xiaoming, et autres
Publié: (2026) -
Free-MoRef: Instantly Multiplexing Context Perception Capabilities of Video-MLLMs within Single Inference
par: Wang, Kuo, et autres
Publié: (2025) -
Improved Visual-Spatial Reasoning via R1-Zero-Like Training
par: Liao, Zhenyi, et autres
Publié: (2025)