Mind-of-Director: Multi-modal Agent-Driven Film Previsualization via Collaborative Decision-Making
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Nan, Shufeng, Li, Mengtian, Zheng, Sixiao, Lu, Yuwei, Zhang, Han, Fu, Yanwei |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Intelligent Director: An Automatic Framework for Dynamic Visual Composition using ChatGPT
par: Zheng, Sixiao, et autres
Publié: (2024)
par: Zheng, Sixiao, et autres
Publié: (2024)
ContextualStory: Consistent Visual Storytelling with Spatially-Enhanced and Storyline Context
par: Zheng, Sixiao, et autres
Publié: (2024)
par: Zheng, Sixiao, et autres
Publié: (2024)
A Neural Representation Framework with LLM-Driven Spatial Reasoning for Open-Vocabulary 3D Visual Grounding
par: Liu, Zhenyang, et autres
Publié: (2025)
par: Liu, Zhenyang, et autres
Publié: (2025)
VerseCrafter: Dynamic Realistic Video World Model with 4D Geometric Control
par: Zheng, Sixiao, et autres
Publié: (2026)
par: Zheng, Sixiao, et autres
Publié: (2026)
TP-MDDN: Task-Preferenced Multi-Demand-Driven Navigation with Autonomous Decision-Making
par: Li, Shanshan, et autres
Publié: (2025)
par: Li, Shanshan, et autres
Publié: (2025)
ReasonGrounder: LVLM-Guided Hierarchical Feature Splatting for Open-Vocabulary 3D Visual Grounding and Reasoning
par: Liu, Zhenyang, et autres
Publié: (2025)
par: Liu, Zhenyang, et autres
Publié: (2025)
CinePreGen: Camera Controllable Video Previsualization via Engine-powered Diffusion
par: Chen, Yiran, et autres
Publié: (2024)
par: Chen, Yiran, et autres
Publié: (2024)
Vision Transformers: From Semantic Segmentation to Dense Prediction
par: Zhang, Li, et autres
Publié: (2022)
par: Zhang, Li, et autres
Publié: (2022)
Multi-modal Agent Tuning: Building a VLM-Driven Agent for Efficient Tool Usage
par: Gao, Zhi, et autres
Publié: (2024)
par: Gao, Zhi, et autres
Publié: (2024)
AutoDirector: Online Auto-scheduling Agents for Multi-sensory Composition
par: Ni, Minheng, et autres
Publié: (2024)
par: Ni, Minheng, et autres
Publié: (2024)
FilmComposer: LLM-Driven Music Production for Silent Film Clips
par: Xie, Zhifeng, et autres
Publié: (2025)
par: Xie, Zhifeng, et autres
Publié: (2025)
AgentsCoMerge: Large Language Model Empowered Collaborative Decision Making for Ramp Merging
par: Hu, Senkang, et autres
Publié: (2024)
par: Hu, Senkang, et autres
Publié: (2024)
Multi-modal Generative AI: Multi-modal LLMs, Diffusions, and the Unification
par: Wang, Xin, et autres
Publié: (2024)
par: Wang, Xin, et autres
Publié: (2024)
VidCRAFT3: Camera, Object, and Lighting Control for Image-to-Video Generation
par: Zheng, Sixiao, et autres
Publié: (2025)
par: Zheng, Sixiao, et autres
Publié: (2025)
Personalizing Causal Audio-Driven Facial Motion via Dynamic Multi-modal Retrieval
par: Chu, Xuangeng, et autres
Publié: (2026)
par: Chu, Xuangeng, et autres
Publié: (2026)
Scaling Video Understanding via Compact Latent Multi-Agent Collaboration
par: Chen, Kerui, et autres
Publié: (2026)
par: Chen, Kerui, et autres
Publié: (2026)
Reasoning-Driven Amodal Completion: Collaborative Agents and Perceptual Evaluation
par: Fan, Hongxing, et autres
Publié: (2025)
par: Fan, Hongxing, et autres
Publié: (2025)
FilmSceneDesigner: Chaining Set Design for Procedural Film Scene Generation
par: Xie, Zhifeng, et autres
Publié: (2025)
par: Xie, Zhifeng, et autres
Publié: (2025)
VERTIGO: Visual Preference Optimization for Cinematic Camera Trajectory Generation
par: Li, Mengtian, et autres
Publié: (2026)
par: Li, Mengtian, et autres
Publié: (2026)
MVSFormer++: Revealing the Devil in Transformer's Details for Multi-View Stereo
par: Cao, Chenjie, et autres
Publié: (2024)
par: Cao, Chenjie, et autres
Publié: (2024)
Making Your Dreams A Reality: Decoding the Dreams into a Coherent Video Story from fMRI Signals
par: Fu, Yanwei, et autres
Publié: (2025)
par: Fu, Yanwei, et autres
Publié: (2025)
Multi-modal Collaborative Optimization and Expansion Network for Event-assisted Single-eye Expression Recognition
par: Han, Runduo, et autres
Publié: (2025)
par: Han, Runduo, et autres
Publié: (2025)
TEOcc: Radar-camera Multi-modal Occupancy Prediction via Temporal Enhancement
par: Lin, Zhiwei, et autres
Publié: (2024)
par: Lin, Zhiwei, et autres
Publié: (2024)
Soap2Soap: Long Cinematic Video Remaking via Multi-Agent Collaboration
par: Song, Yiren, et autres
Publié: (2026)
par: Song, Yiren, et autres
Publié: (2026)
EIMC: Efficient Instance-aware Multi-modal Collaborative Perception
par: Yang, Kang, et autres
Publié: (2026)
par: Yang, Kang, et autres
Publié: (2026)
MuMA-ToM: Multi-modal Multi-Agent Theory of Mind
par: Shi, Haojun, et autres
Publié: (2024)
par: Shi, Haojun, et autres
Publié: (2024)
AnomalyXFusion: Multi-modal Anomaly Synthesis with Diffusion
par: Hu, Jie, et autres
Publié: (2024)
par: Hu, Jie, et autres
Publié: (2024)
Mind the Time: Temporally-Controlled Multi-Event Video Generation
par: Wu, Ziyi, et autres
Publié: (2024)
par: Wu, Ziyi, et autres
Publié: (2024)
VideoFusion: A Spatio-Temporal Collaborative Network for Multi-modal Video Fusion
par: Tang, Linfeng, et autres
Publié: (2025)
par: Tang, Linfeng, et autres
Publié: (2025)
Mind-to-Face: Neural-Driven Photorealistic Avatar Synthesis via EEG Decoding
par: Xiong, Haolin, et autres
Publié: (2025)
par: Xiong, Haolin, et autres
Publié: (2025)
GardenDesigner: Encoding Aesthetic Principles into Jiangnan Garden Construction via a Chain of Agents
par: Li, Mengtian, et autres
Publié: (2026)
par: Li, Mengtian, et autres
Publié: (2026)
Human-AI Collaborative Multi-modal Multi-rater Learning for Endometriosis Diagnosis
par: Wang, Hu, et autres
Publié: (2024)
par: Wang, Hu, et autres
Publié: (2024)
Efficient Multi-modal Large Language Models via Visual Token Grouping
par: Huang, Minbin, et autres
Publié: (2024)
par: Huang, Minbin, et autres
Publié: (2024)
QTrack: Query-Driven Reasoning for Multi-modal MOT
par: Ashraf, Tajamul, et autres
Publié: (2026)
par: Ashraf, Tajamul, et autres
Publié: (2026)
AutoIAD: Manager-Driven Multi-Agent Collaboration for Automated Industrial Anomaly Detection
par: Ji, Dongwei, et autres
Publié: (2025)
par: Ji, Dongwei, et autres
Publié: (2025)
Sub-Image Recapture for Multi-View 3D Reconstruction
par: Wang, Yanwei
Publié: (2025)
par: Wang, Yanwei
Publié: (2025)
NADER: Neural Architecture Design via Multi-Agent Collaboration
par: Yang, Zekang, et autres
Publié: (2024)
par: Yang, Zekang, et autres
Publié: (2024)
Large Multi-modality Model Assisted AI-Generated Image Quality Assessment
par: Wang, Puyi, et autres
Publié: (2024)
par: Wang, Puyi, et autres
Publié: (2024)
CustAny: Customizing Anything from A Single Example
par: Kong, Lingjie, et autres
Publié: (2024)
par: Kong, Lingjie, et autres
Publié: (2024)
CrossTracker: Robust Multi-modal 3D Multi-Object Tracking via Cross Correction
par: Gu, Lipeng, et autres
Publié: (2024)
par: Gu, Lipeng, et autres
Publié: (2024)
Documents similaires
-
Intelligent Director: An Automatic Framework for Dynamic Visual Composition using ChatGPT
par: Zheng, Sixiao, et autres
Publié: (2024) -
ContextualStory: Consistent Visual Storytelling with Spatially-Enhanced and Storyline Context
par: Zheng, Sixiao, et autres
Publié: (2024) -
A Neural Representation Framework with LLM-Driven Spatial Reasoning for Open-Vocabulary 3D Visual Grounding
par: Liu, Zhenyang, et autres
Publié: (2025) -
VerseCrafter: Dynamic Realistic Video World Model with 4D Geometric Control
par: Zheng, Sixiao, et autres
Publié: (2026) -
TP-MDDN: Task-Preferenced Multi-Demand-Driven Navigation with Autonomous Decision-Making
par: Li, Shanshan, et autres
Publié: (2025)