Exploring the Evolution of Physics Cognition in Video Generation: A Survey
Fuente:
arXiv
Guardado en:
| Autores principales: | Lin, Minghui, Wang, Xiang, Wang, Yishan, Wang, Shu, Dai, Fengqi, Ding, Pengxiang, Wang, Cunxiang, Zuo, Zhengrong, Sang, Nong, Huang, Siteng, Wang, Donglin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DMPT: Decoupled Modality-aware Prompt Tuning for Multi-modal Object Re-identification
por: Lin, Minghui, et al.
Publicado: (2025)
por: Lin, Minghui, et al.
Publicado: (2025)
PiTe: Pixel-Temporal Alignment for Large Video-Language Model
por: Liu, Yang, et al.
Publicado: (2024)
por: Liu, Yang, et al.
Publicado: (2024)
HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models
por: Lin, Minghui, et al.
Publicado: (2025)
por: Lin, Minghui, et al.
Publicado: (2025)
Cobra: Extending Mamba to Multi-Modal Large Language Model for Efficient Inference
por: Zhao, Han, et al.
Publicado: (2024)
por: Zhao, Han, et al.
Publicado: (2024)
ProFD: Prompt-Guided Feature Disentangling for Occluded Person Re-Identification
por: Cui, Can, et al.
Publicado: (2024)
por: Cui, Can, et al.
Publicado: (2024)
GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation
por: Zhang, Hongyin, et al.
Publicado: (2025)
por: Zhang, Hongyin, et al.
Publicado: (2025)
MMaDA-VLA: Large Diffusion Vision-Language-Action Model with Unified Multi-Modal Instruction and Generation
por: Liu, Yang, et al.
Publicado: (2026)
por: Liu, Yang, et al.
Publicado: (2026)
Focus-Consistent Multi-Level Aggregation for Compositional Zero-Shot Learning
por: Dai, Fengyuan, et al.
Publicado: (2024)
por: Dai, Fengyuan, et al.
Publicado: (2024)
QUAR-VLA: Vision-Language-Action Model for Quadruped Robots
por: Ding, Pengxiang, et al.
Publicado: (2023)
por: Ding, Pengxiang, et al.
Publicado: (2023)
Score and Distribution Matching Policy: Advanced Accelerated Visuomotor Policies via Matched Distillation
por: Jia, Bofang, et al.
Publicado: (2024)
por: Jia, Bofang, et al.
Publicado: (2024)
SSR: Enhancing Depth Perception in Vision-Language Models via Rationale-Guided Spatial Reasoning
por: Liu, Yang, et al.
Publicado: (2025)
por: Liu, Yang, et al.
Publicado: (2025)
CARP: Visuomotor Policy Learning via Coarse-to-Fine Autoregressive Prediction
por: Gong, Zhefei, et al.
Publicado: (2024)
por: Gong, Zhefei, et al.
Publicado: (2024)
Long-VLA: Unleashing Long-Horizon Capability of Vision Language Action Model for Robot Manipulation
por: Fan, Yiguo, et al.
Publicado: (2025)
por: Fan, Yiguo, et al.
Publicado: (2025)
Rethinking Target Label Conditioning in Adversarial Attacks: A 2D Tensor-Guided Generative Approach
por: Liu, Hangyu, et al.
Publicado: (2025)
por: Liu, Hangyu, et al.
Publicado: (2025)
Filter, Correlate, Compress: Training-Free Token Reduction for MLLM Acceleration
por: Han, Yuhang, et al.
Publicado: (2024)
por: Han, Yuhang, et al.
Publicado: (2024)
Nash CoT: Multi-Path Inference with Preference Equilibrium
por: Zhang, Ziqi, et al.
Publicado: (2024)
por: Zhang, Ziqi, et al.
Publicado: (2024)
Score-Based Diffusion Policy Compatible with Reinforcement Learning via Optimal Transport
por: Sun, Mingyang, et al.
Publicado: (2025)
por: Sun, Mingyang, et al.
Publicado: (2025)
Iterative Refinement of Flow Policies in Probability Space for Online Reinforcement Learning
por: Sun, Mingyang, et al.
Publicado: (2025)
por: Sun, Mingyang, et al.
Publicado: (2025)
CUBic: Coordinated Unified Bimanual Perception and Control Framework
por: Wang, Xingyu, et al.
Publicado: (2026)
por: Wang, Xingyu, et al.
Publicado: (2026)
VGDiffZero: Text-to-image Diffusion Models Can Be Zero-shot Visual Grounders
por: Liu, Xuyang, et al.
Publicado: (2023)
por: Liu, Xuyang, et al.
Publicado: (2023)
GlanceVAD: Exploring Glance Supervision for Label-efficient Video Anomaly Detection
por: Zhang, Huaxin, et al.
Publicado: (2024)
por: Zhang, Huaxin, et al.
Publicado: (2024)
VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL
por: Dai, Fengyuan, et al.
Publicado: (2025)
por: Dai, Fengyuan, et al.
Publicado: (2025)
Holmes-VAD: Towards Unbiased and Explainable Video Anomaly Detection via Multi-modal LLM
por: Zhang, Huaxin, et al.
Publicado: (2024)
por: Zhang, Huaxin, et al.
Publicado: (2024)
OpenHelix: A Short Survey, Empirical Analysis, and Open-Source Dual-System VLA Model for Robotic Manipulation
por: Cui, Can, et al.
Publicado: (2025)
por: Cui, Can, et al.
Publicado: (2025)
Expressive Forecasting of 3D Whole-body Human Motions
por: Ding, Pengxiang, et al.
Publicado: (2023)
por: Ding, Pengxiang, et al.
Publicado: (2023)
VLA^2: Empowering Vision-Language-Action Models with an Agentic Framework for Unseen Concept Manipulation
por: Zhao, Han, et al.
Publicado: (2025)
por: Zhao, Han, et al.
Publicado: (2025)
Enhancing Adversarial Transferability via Component-Wise Transformation
por: Liu, Hangyu, et al.
Publicado: (2025)
por: Liu, Hangyu, et al.
Publicado: (2025)
Robust Online Residual Refinement via Koopman-Guided Dynamics Modeling
por: Gong, Zhefei, et al.
Publicado: (2025)
por: Gong, Zhefei, et al.
Publicado: (2025)
Learning Disentangled Identifiers for Action-Customized Text-to-Image Generation
por: Huang, Siteng, et al.
Publicado: (2023)
por: Huang, Siteng, et al.
Publicado: (2023)
Troika: Multi-Path Cross-Modal Traction for Compositional Zero-Shot Learning
por: Huang, Siteng, et al.
Publicado: (2023)
por: Huang, Siteng, et al.
Publicado: (2023)
High-Fidelity Full-Sky Video Prediction for Photovoltaic Ramp Event Forecasting
por: Wang, Siyuan, et al.
Publicado: (2026)
por: Wang, Siyuan, et al.
Publicado: (2026)
Holmes-VAU: Towards Long-term Video Anomaly Understanding at Any Granularity
por: Zhang, Huaxin, et al.
Publicado: (2024)
por: Zhang, Huaxin, et al.
Publicado: (2024)
UniAnimate-DiT: Human Image Animation with Large-Scale Video Diffusion Transformer
por: Wang, Xiang, et al.
Publicado: (2025)
por: Wang, Xiang, et al.
Publicado: (2025)
QUART-Online: Latency-Free Large Multimodal Language Model for Quadruped Robot Learning
por: Tong, Xinyang, et al.
Publicado: (2024)
por: Tong, Xinyang, et al.
Publicado: (2024)
ReinboT: Amplifying Robot Visual-Language Manipulation with Reinforcement Learning
por: Zhang, Hongyin, et al.
Publicado: (2025)
por: Zhang, Hongyin, et al.
Publicado: (2025)
Rethinking Latent Redundancy in Behavior Cloning: An Information Bottleneck Approach for Robot Manipulation
por: Bai, Shuanghao, et al.
Publicado: (2025)
por: Bai, Shuanghao, et al.
Publicado: (2025)
Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions
por: Zhao, Wei, et al.
Publicado: (2025)
por: Zhao, Wei, et al.
Publicado: (2025)
CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding
por: Song, Wenxuan, et al.
Publicado: (2025)
por: Song, Wenxuan, et al.
Publicado: (2025)
Prompt-based Distribution Alignment for Unsupervised Domain Adaptation
por: Bai, Shuanghao, et al.
Publicado: (2023)
por: Bai, Shuanghao, et al.
Publicado: (2023)
UniAnimate: Taming Unified Video Diffusion Models for Consistent Human Image Animation
por: Wang, Xiang, et al.
Publicado: (2024)
por: Wang, Xiang, et al.
Publicado: (2024)
Ejemplares similares
-
DMPT: Decoupled Modality-aware Prompt Tuning for Multi-modal Object Re-identification
por: Lin, Minghui, et al.
Publicado: (2025) -
PiTe: Pixel-Temporal Alignment for Large Video-Language Model
por: Liu, Yang, et al.
Publicado: (2024) -
HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models
por: Lin, Minghui, et al.
Publicado: (2025) -
Cobra: Extending Mamba to Multi-Modal Large Language Model for Efficient Inference
por: Zhao, Han, et al.
Publicado: (2024) -
ProFD: Prompt-Guided Feature Disentangling for Occluded Person Re-Identification
por: Cui, Can, et al.
Publicado: (2024)