Exploring the Evolution of Physics Cognition in Video Generation: A Survey
Fuente:
arXiv
Salvato in:
| Autori principali: | Lin, Minghui, Wang, Xiang, Wang, Yishan, Wang, Shu, Dai, Fengqi, Ding, Pengxiang, Wang, Cunxiang, Zuo, Zhengrong, Sang, Nong, Huang, Siteng, Wang, Donglin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DMPT: Decoupled Modality-aware Prompt Tuning for Multi-modal Object Re-identification
di: Lin, Minghui, et al.
Pubblicazione: (2025)
di: Lin, Minghui, et al.
Pubblicazione: (2025)
PiTe: Pixel-Temporal Alignment for Large Video-Language Model
di: Liu, Yang, et al.
Pubblicazione: (2024)
di: Liu, Yang, et al.
Pubblicazione: (2024)
HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models
di: Lin, Minghui, et al.
Pubblicazione: (2025)
di: Lin, Minghui, et al.
Pubblicazione: (2025)
Cobra: Extending Mamba to Multi-Modal Large Language Model for Efficient Inference
di: Zhao, Han, et al.
Pubblicazione: (2024)
di: Zhao, Han, et al.
Pubblicazione: (2024)
ProFD: Prompt-Guided Feature Disentangling for Occluded Person Re-Identification
di: Cui, Can, et al.
Pubblicazione: (2024)
di: Cui, Can, et al.
Pubblicazione: (2024)
GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation
di: Zhang, Hongyin, et al.
Pubblicazione: (2025)
di: Zhang, Hongyin, et al.
Pubblicazione: (2025)
MMaDA-VLA: Large Diffusion Vision-Language-Action Model with Unified Multi-Modal Instruction and Generation
di: Liu, Yang, et al.
Pubblicazione: (2026)
di: Liu, Yang, et al.
Pubblicazione: (2026)
Focus-Consistent Multi-Level Aggregation for Compositional Zero-Shot Learning
di: Dai, Fengyuan, et al.
Pubblicazione: (2024)
di: Dai, Fengyuan, et al.
Pubblicazione: (2024)
Rethinking Target Label Conditioning in Adversarial Attacks: A 2D Tensor-Guided Generative Approach
di: Liu, Hangyu, et al.
Pubblicazione: (2025)
di: Liu, Hangyu, et al.
Pubblicazione: (2025)
QUAR-VLA: Vision-Language-Action Model for Quadruped Robots
di: Ding, Pengxiang, et al.
Pubblicazione: (2023)
di: Ding, Pengxiang, et al.
Pubblicazione: (2023)
Score and Distribution Matching Policy: Advanced Accelerated Visuomotor Policies via Matched Distillation
di: Jia, Bofang, et al.
Pubblicazione: (2024)
di: Jia, Bofang, et al.
Pubblicazione: (2024)
SSR: Enhancing Depth Perception in Vision-Language Models via Rationale-Guided Spatial Reasoning
di: Liu, Yang, et al.
Pubblicazione: (2025)
di: Liu, Yang, et al.
Pubblicazione: (2025)
CARP: Visuomotor Policy Learning via Coarse-to-Fine Autoregressive Prediction
di: Gong, Zhefei, et al.
Pubblicazione: (2024)
di: Gong, Zhefei, et al.
Pubblicazione: (2024)
Long-VLA: Unleashing Long-Horizon Capability of Vision Language Action Model for Robot Manipulation
di: Fan, Yiguo, et al.
Pubblicazione: (2025)
di: Fan, Yiguo, et al.
Pubblicazione: (2025)
Score-Based Diffusion Policy Compatible with Reinforcement Learning via Optimal Transport
di: Sun, Mingyang, et al.
Pubblicazione: (2025)
di: Sun, Mingyang, et al.
Pubblicazione: (2025)
Iterative Refinement of Flow Policies in Probability Space for Online Reinforcement Learning
di: Sun, Mingyang, et al.
Pubblicazione: (2025)
di: Sun, Mingyang, et al.
Pubblicazione: (2025)
Nash CoT: Multi-Path Inference with Preference Equilibrium
di: Zhang, Ziqi, et al.
Pubblicazione: (2024)
di: Zhang, Ziqi, et al.
Pubblicazione: (2024)
Filter, Correlate, Compress: Training-Free Token Reduction for MLLM Acceleration
di: Han, Yuhang, et al.
Pubblicazione: (2024)
di: Han, Yuhang, et al.
Pubblicazione: (2024)
CUBic: Coordinated Unified Bimanual Perception and Control Framework
di: Wang, Xingyu, et al.
Pubblicazione: (2026)
di: Wang, Xingyu, et al.
Pubblicazione: (2026)
GlanceVAD: Exploring Glance Supervision for Label-efficient Video Anomaly Detection
di: Zhang, Huaxin, et al.
Pubblicazione: (2024)
di: Zhang, Huaxin, et al.
Pubblicazione: (2024)
VGDiffZero: Text-to-image Diffusion Models Can Be Zero-shot Visual Grounders
di: Liu, Xuyang, et al.
Pubblicazione: (2023)
di: Liu, Xuyang, et al.
Pubblicazione: (2023)
Holmes-VAD: Towards Unbiased and Explainable Video Anomaly Detection via Multi-modal LLM
di: Zhang, Huaxin, et al.
Pubblicazione: (2024)
di: Zhang, Huaxin, et al.
Pubblicazione: (2024)
VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL
di: Dai, Fengyuan, et al.
Pubblicazione: (2025)
di: Dai, Fengyuan, et al.
Pubblicazione: (2025)
High-Fidelity Full-Sky Video Prediction for Photovoltaic Ramp Event Forecasting
di: Wang, Siyuan, et al.
Pubblicazione: (2026)
di: Wang, Siyuan, et al.
Pubblicazione: (2026)
Expressive Forecasting of 3D Whole-body Human Motions
di: Ding, Pengxiang, et al.
Pubblicazione: (2023)
di: Ding, Pengxiang, et al.
Pubblicazione: (2023)
VLA^2: Empowering Vision-Language-Action Models with an Agentic Framework for Unseen Concept Manipulation
di: Zhao, Han, et al.
Pubblicazione: (2025)
di: Zhao, Han, et al.
Pubblicazione: (2025)
Enhancing Adversarial Transferability via Component-Wise Transformation
di: Liu, Hangyu, et al.
Pubblicazione: (2025)
di: Liu, Hangyu, et al.
Pubblicazione: (2025)
Robust Online Residual Refinement via Koopman-Guided Dynamics Modeling
di: Gong, Zhefei, et al.
Pubblicazione: (2025)
di: Gong, Zhefei, et al.
Pubblicazione: (2025)
OpenHelix: A Short Survey, Empirical Analysis, and Open-Source Dual-System VLA Model for Robotic Manipulation
di: Cui, Can, et al.
Pubblicazione: (2025)
di: Cui, Can, et al.
Pubblicazione: (2025)
Learning Disentangled Identifiers for Action-Customized Text-to-Image Generation
di: Huang, Siteng, et al.
Pubblicazione: (2023)
di: Huang, Siteng, et al.
Pubblicazione: (2023)
Holmes-VAU: Towards Long-term Video Anomaly Understanding at Any Granularity
di: Zhang, Huaxin, et al.
Pubblicazione: (2024)
di: Zhang, Huaxin, et al.
Pubblicazione: (2024)
UniAnimate-DiT: Human Image Animation with Large-Scale Video Diffusion Transformer
di: Wang, Xiang, et al.
Pubblicazione: (2025)
di: Wang, Xiang, et al.
Pubblicazione: (2025)
Troika: Multi-Path Cross-Modal Traction for Compositional Zero-Shot Learning
di: Huang, Siteng, et al.
Pubblicazione: (2023)
di: Huang, Siteng, et al.
Pubblicazione: (2023)
VideoChat-A1: Thinking with Long Videos by Chain-of-Shot Reasoning
di: Wang, Zikang, et al.
Pubblicazione: (2025)
di: Wang, Zikang, et al.
Pubblicazione: (2025)
Geometric Phase-Driven Scattering Evolutions
di: Wang, Pengxiang, et al.
Pubblicazione: (2024)
di: Wang, Pengxiang, et al.
Pubblicazione: (2024)
UniAnimate: Taming Unified Video Diffusion Models for Consistent Human Image Animation
di: Wang, Xiang, et al.
Pubblicazione: (2024)
di: Wang, Xiang, et al.
Pubblicazione: (2024)
ReinboT: Amplifying Robot Visual-Language Manipulation with Reinforcement Learning
di: Zhang, Hongyin, et al.
Pubblicazione: (2025)
di: Zhang, Hongyin, et al.
Pubblicazione: (2025)
Rethinking Latent Redundancy in Behavior Cloning: An Information Bottleneck Approach for Robot Manipulation
di: Bai, Shuanghao, et al.
Pubblicazione: (2025)
di: Bai, Shuanghao, et al.
Pubblicazione: (2025)
Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions
di: Zhao, Wei, et al.
Pubblicazione: (2025)
di: Zhao, Wei, et al.
Pubblicazione: (2025)
V-Stylist: Video Stylization via Collaboration and Reflection of MLLM Agents
di: Yue, Zhengrong, et al.
Pubblicazione: (2025)
di: Yue, Zhengrong, et al.
Pubblicazione: (2025)
Documenti analoghi
-
DMPT: Decoupled Modality-aware Prompt Tuning for Multi-modal Object Re-identification
di: Lin, Minghui, et al.
Pubblicazione: (2025) -
PiTe: Pixel-Temporal Alignment for Large Video-Language Model
di: Liu, Yang, et al.
Pubblicazione: (2024) -
HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models
di: Lin, Minghui, et al.
Pubblicazione: (2025) -
Cobra: Extending Mamba to Multi-Modal Large Language Model for Efficient Inference
di: Zhao, Han, et al.
Pubblicazione: (2024) -
ProFD: Prompt-Guided Feature Disentangling for Occluded Person Re-Identification
di: Cui, Can, et al.
Pubblicazione: (2024)