NEWTON: Agentic Planning for Physically Grounded Video Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Feng, Yuxiang, Wang, Juncheng, Xu, Chao, Qian, Yijie, Wang, Huihan, Hou, Wenlong, Liu, Yang, Sun, Baigui, Liu, Yong, Wang, Shujun |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Think Before You Move: Latent Motion Reasoning for Text-to-Motion Generation
par: Qian, Yijie, et autres
Publié: (2025)
par: Qian, Yijie, et autres
Publié: (2025)
Guided by the Plan: Enhancing Faithful Autoregressive Text-to-Audio Generation with Guided Decoding
par: Wang, Juncheng, et autres
Publié: (2026)
par: Wang, Juncheng, et autres
Publié: (2026)
TryOn-Adapter: Efficient Fine-Grained Clothing Identity Adaptation for High-Fidelity Virtual Try-On
par: Xing, Jiazheng, et autres
Publié: (2024)
par: Xing, Jiazheng, et autres
Publié: (2024)
Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents
par: Liu, Dayong, et autres
Publié: (2025)
par: Liu, Dayong, et autres
Publié: (2025)
Synchronized Video-to-Audio Generation via Mel Quantization-Continuum Decomposition
par: Wang, Juncheng, et autres
Publié: (2025)
par: Wang, Juncheng, et autres
Publié: (2025)
PRA-PoE: Robust Multimodal Alzheimer's Diagnosis with Arbitrary Missing Modalities
par: Yang, Guangqian, et autres
Publié: (2026)
par: Yang, Guangqian, et autres
Publié: (2026)
FEAT: Full-Dimensional Efficient Attention Transformer for Medical Video Generation
par: Wang, Huihan, et autres
Publié: (2025)
par: Wang, Huihan, et autres
Publié: (2025)
Beyond Talking -- Generating Holistic 3D Human Dyadic Motion for Communication
par: Sun, Mingze, et autres
Publié: (2024)
par: Sun, Mingze, et autres
Publié: (2024)
MA-FSAR: Multimodal Adaptation of CLIP for Few-Shot Action Recognition
par: Xing, Jiazheng, et autres
Publié: (2023)
par: Xing, Jiazheng, et autres
Publié: (2023)
Driving in the Occupancy World: Vision-Centric 4D Occupancy Forecasting and Planning via World Models for Autonomous Driving
par: Yang, Yu, et autres
Publié: (2024)
par: Yang, Yu, et autres
Publié: (2024)
VG-Refiner: Towards Tool-Refined Referring Grounded Reasoning via Agentic Reinforcement Learning
par: Wang, Yuji, et autres
Publié: (2025)
par: Wang, Yuji, et autres
Publié: (2025)
PhysCtrl: Generative Physics for Controllable and Physics-Grounded Video Generation
par: Wang, Chen, et autres
Publié: (2025)
par: Wang, Chen, et autres
Publié: (2025)
BrainAnytime: Anatomy-Aware Cross-Modal Pretraining for Brain Image Analysis with Arbitrary Modality Availability
par: Yang, Guangqian, et autres
Publié: (2026)
par: Yang, Guangqian, et autres
Publié: (2026)
Exploring Scale Shift in Crowd Localization under the Context of Domain Generalization
par: Wang, Juncheng, et autres
Publié: (2025)
par: Wang, Juncheng, et autres
Publié: (2025)
Combo: Co-speech holistic 3D human motion generation and efficient customizable adaptation in harmony
par: Xu, Chao, et autres
Publié: (2024)
par: Xu, Chao, et autres
Publié: (2024)
RRNet: Configurable Real-Time Video Enhancement with Arbitrary Local Lighting Variations
par: Yang, Wenlong, et autres
Publié: (2026)
par: Yang, Wenlong, et autres
Publié: (2026)
TempCompass: Do Video LLMs Really Understand Videos?
par: Liu, Yuanxin, et autres
Publié: (2024)
par: Liu, Yuanxin, et autres
Publié: (2024)
VideoTemp-o3: Harmonizing Temporal Grounding and Video Understanding in Agentic Thinking-with-Videos
par: Liu, Wenqi, et autres
Publié: (2026)
par: Liu, Wenqi, et autres
Publié: (2026)
PhysGen: Rigid-Body Physics-Grounded Image-to-Video Generation
par: Liu, Shaowei, et autres
Publié: (2024)
par: Liu, Shaowei, et autres
Publié: (2024)
Multi-sentence Video Grounding for Long Video Generation
par: Feng, Wei, et autres
Publié: (2024)
par: Feng, Wei, et autres
Publié: (2024)
Preacher: Paper-to-Video Agentic System
par: Liu, Jingwei, et autres
Publié: (2025)
par: Liu, Jingwei, et autres
Publié: (2025)
BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations
par: Feng, Weixi, et autres
Publié: (2025)
par: Feng, Weixi, et autres
Publié: (2025)
GenieDrive: Towards Physics-Aware Driving World Model with 4D Occupancy Guided Video Generation
par: Yang, Zhenya, et autres
Publié: (2025)
par: Yang, Zhenya, et autres
Publié: (2025)
MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering
par: Dang, Jisheng, et autres
Publié: (2025)
par: Dang, Jisheng, et autres
Publié: (2025)
ADAgent: LLM Agent for Alzheimer's Disease Analysis with Collaborative Coordinator
par: Hou, Wenlong, et autres
Publié: (2025)
par: Hou, Wenlong, et autres
Publié: (2025)
VideoMiner: Iteratively Grounding Key Frames of Hour-Long Videos via Tree-based Group Relative Policy Optimization
par: Cao, Xinye, et autres
Publié: (2025)
par: Cao, Xinye, et autres
Publié: (2025)
ImageDoctor: Diagnosing Text-to-Image Generation via Grounded Image Reasoning
par: Guo, Yuxiang, et autres
Publié: (2025)
par: Guo, Yuxiang, et autres
Publié: (2025)
DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation
par: He, Weijie, et autres
Publié: (2025)
par: He, Weijie, et autres
Publié: (2025)
Moment Quantization for Video Temporal Grounding
par: Sun, Xiaolong, et autres
Publié: (2025)
par: Sun, Xiaolong, et autres
Publié: (2025)
RobustMVS: Single Domain Generalized Deep Multi-view Stereo
par: Xu, Hongbin, et autres
Publié: (2024)
par: Xu, Hongbin, et autres
Publié: (2024)
StyleDyRF: Zero-shot 4D Style Transfer for Dynamic Neural Radiance Fields
par: Xu, Hongbin, et autres
Publié: (2024)
par: Xu, Hongbin, et autres
Publié: (2024)
Revisiting Cross-Attention Mechanisms: Leveraging Beneficial Noise for Domain-Adaptive Learning
par: Zang, Zelin, et autres
Publié: (2026)
par: Zang, Zelin, et autres
Publié: (2026)
TransFace++: Rethinking the Face Recognition Paradigm with a Focus on Accuracy, Efficiency, and Security
par: Dan, Jun, et autres
Publié: (2023)
par: Dan, Jun, et autres
Publié: (2023)
Generation Navigator: A State-Aware Agentic Framework for Image Generation
par: Liu, Jinming, et autres
Publié: (2026)
par: Liu, Jinming, et autres
Publié: (2026)
Bootstrapping Physics-Grounded Video Generation through VLM-Guided Iterative Self-Refinement
par: Liu, Yang, et autres
Publié: (2025)
par: Liu, Yang, et autres
Publié: (2025)
PRCL: Probabilistic Representation Contrastive Learning for Semi-Supervised Semantic Segmentation
par: Xie, Haoyu, et autres
Publié: (2024)
par: Xie, Haoyu, et autres
Publié: (2024)
Chain of Event-Centric Causal Thought for Physically Plausible Video Generation
par: Wang, Zixuan, et autres
Publié: (2026)
par: Wang, Zixuan, et autres
Publié: (2026)
TelePhysics: Physics-Grounded Multi-Object Scene Generation from a Single Image with Real-Time Interaction
par: Zhang, Xin, et autres
Publié: (2026)
par: Zhang, Xin, et autres
Publié: (2026)
This&That: Language-Gesture Controlled Video Generation for Robot Planning
par: Wang, Boyang, et autres
Publié: (2024)
par: Wang, Boyang, et autres
Publié: (2024)
FaceChain-SuDe: Building Derived Class to Inherit Category Attributes for One-shot Subject-Driven Generation
par: Qiao, Pengchong, et autres
Publié: (2024)
par: Qiao, Pengchong, et autres
Publié: (2024)
Documents similaires
-
Think Before You Move: Latent Motion Reasoning for Text-to-Motion Generation
par: Qian, Yijie, et autres
Publié: (2025) -
Guided by the Plan: Enhancing Faithful Autoregressive Text-to-Audio Generation with Guided Decoding
par: Wang, Juncheng, et autres
Publié: (2026) -
TryOn-Adapter: Efficient Fine-Grained Clothing Identity Adaptation for High-Fidelity Virtual Try-On
par: Xing, Jiazheng, et autres
Publié: (2024) -
Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents
par: Liu, Dayong, et autres
Publié: (2025) -
Synchronized Video-to-Audio Generation via Mel Quantization-Continuum Decomposition
par: Wang, Juncheng, et autres
Publié: (2025)