An Anatomy of Vision-Language-Action Models: From Modules to Milestones and Challenges
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xu, Chao, Zhang, Suyu, Liu, Yang, Sun, Baigui, Chen, Weihong, Xu, Bo, Liu, Qi, Wang, Juncheng, Wang, Shujun, Luo, Shan, Peters, Jan, Vasilakos, Athanasios V., Zafeiriou, Stefanos, Deng, Jiankang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents
par: Liu, Dayong, et autres
Publié: (2025)
par: Liu, Dayong, et autres
Publié: (2025)
ImHead: A Large-scale Implicit Morphable Model for Localized Head Modeling
par: Potamias, Rolandos Alexandros, et autres
Publié: (2025)
par: Potamias, Rolandos Alexandros, et autres
Publié: (2025)
ID-to-3D: Expressive ID-guided 3D Heads via Score Distillation Sampling
par: Babiloni, Francesca, et autres
Publié: (2024)
par: Babiloni, Francesca, et autres
Publié: (2024)
Improving face generation quality and prompt following with synthetic captions
par: Tarasiou, Michail, et autres
Publié: (2024)
par: Tarasiou, Michail, et autres
Publié: (2024)
Deep Face Restoration: A Survey
par: Wang, Tao, et autres
Publié: (2022)
par: Wang, Tao, et autres
Publié: (2022)
WiLoR: End-to-end 3D Hand Localization and Reconstruction in-the-wild
par: Potamias, Rolandos Alexandros, et autres
Publié: (2024)
par: Potamias, Rolandos Alexandros, et autres
Publié: (2024)
Guided by the Plan: Enhancing Faithful Autoregressive Text-to-Audio Generation with Guided Decoding
par: Wang, Juncheng, et autres
Publié: (2026)
par: Wang, Juncheng, et autres
Publié: (2026)
TransFace++: Rethinking the Face Recognition Paradigm with a Focus on Accuracy, Efficiency, and Security
par: Dan, Jun, et autres
Publié: (2023)
par: Dan, Jun, et autres
Publié: (2023)
Spatio-temporal Prompting Network for Robust Video Feature Extraction
par: Sun, Guanxiong, et autres
Publié: (2024)
par: Sun, Guanxiong, et autres
Publié: (2024)
SAGS: Structure-Aware 3D Gaussian Splatting
par: Ververas, Evangelos, et autres
Publié: (2024)
par: Ververas, Evangelos, et autres
Publié: (2024)
Signs as Tokens: A Retrieval-Enhanced Multilingual Sign Language Generator
par: Zuo, Ronglai, et autres
Publié: (2024)
par: Zuo, Ronglai, et autres
Publié: (2024)
MaDiS: Taming Masked Diffusion Language Models for Sign Language Generation
par: Zuo, Ronglai, et autres
Publié: (2026)
par: Zuo, Ronglai, et autres
Publié: (2026)
NEWTON: Agentic Planning for Physically Grounded Video Generation
par: Feng, Yuxiang, et autres
Publié: (2026)
par: Feng, Yuxiang, et autres
Publié: (2026)
Think Before You Move: Latent Motion Reasoning for Text-to-Motion Generation
par: Qian, Yijie, et autres
Publié: (2025)
par: Qian, Yijie, et autres
Publié: (2025)
Dex2HOI: Dexterous Bimanual Two-Object Interaction Generation
par: Pratikaki, Chrysa, et autres
Publié: (2026)
par: Pratikaki, Chrysa, et autres
Publié: (2026)
HO-Flow: Generalizable Hand-Object Interaction Generation with Latent Flow Matching
par: Chen, Zerui, et autres
Publié: (2026)
par: Chen, Zerui, et autres
Publié: (2026)
Neural Sign Actors: A diffusion model for 3D sign language production from text
par: Baltatzis, Vasileios, et autres
Publié: (2023)
par: Baltatzis, Vasileios, et autres
Publié: (2023)
Do You See What I Am Pointing At? Gesture-Based Egocentric Video Question Answering
par: Choi, Yura, et autres
Publié: (2026)
par: Choi, Yura, et autres
Publié: (2026)
Arc2Face: A Foundation Model for ID-Consistent Human Faces
par: Papantoniou, Foivos Paraperas, et autres
Publié: (2024)
par: Papantoniou, Foivos Paraperas, et autres
Publié: (2024)
Geo-ID: Test-Time Geometric Consensus for Cross-View Consistent Intrinsics
par: Dirik, Alara, et autres
Publié: (2026)
par: Dirik, Alara, et autres
Publié: (2026)
360SFUDA++: Towards Source-free UDA for Panoramic Segmentation by Learning Reliable Category Prototypes
par: Zheng, Xu, et autres
Publié: (2024)
par: Zheng, Xu, et autres
Publié: (2024)
Semantics, Distortion, and Style Matter: Towards Source-free UDA for Panoramic Segmentation
par: Zheng, Xu, et autres
Publié: (2024)
par: Zheng, Xu, et autres
Publié: (2024)
TopoFR: A Closer Look at Topology Alignment on Face Recognition
par: Dan, Jun, et autres
Publié: (2024)
par: Dan, Jun, et autres
Publié: (2024)
Unsupervised Visible-Infrared ReID via Pseudo-label Correction and Modality-level Alignment
par: Liu, Yexin, et autres
Publié: (2024)
par: Liu, Yexin, et autres
Publié: (2024)
ID-Consistent, Precise Expression Generation with Blendshape-Guided Diffusion
par: Papantoniou, Foivos Paraperas, et autres
Publié: (2025)
par: Papantoniou, Foivos Paraperas, et autres
Publié: (2025)
MA-FSAR: Multimodal Adaptation of CLIP for Few-Shot Action Recognition
par: Xing, Jiazheng, et autres
Publié: (2023)
par: Xing, Jiazheng, et autres
Publié: (2023)
Synchronized Video-to-Audio Generation via Mel Quantization-Continuum Decomposition
par: Wang, Juncheng, et autres
Publié: (2025)
par: Wang, Juncheng, et autres
Publié: (2025)
Dyn-HaMR: Recovering 4D Interacting Hand Motion from a Dynamic Camera
par: Yu, Zhengdi, et autres
Publié: (2024)
par: Yu, Zhengdi, et autres
Publié: (2024)
DermaFlux: Synthetic Skin Lesion Generation with Rectified Flows for Enhanced Image Classification
par: Galanakis, Stathis, et autres
Publié: (2026)
par: Galanakis, Stathis, et autres
Publié: (2026)
UV-free Texture Generation with Denoising and Geodesic Heat Diffusions
par: Foti, Simone, et autres
Publié: (2024)
par: Foti, Simone, et autres
Publié: (2024)
Distribution Matching for Multi-Task Learning of Classification Tasks: a Large-Scale Study on Faces & Beyond
par: Kollias, Dimitrios, et autres
Publié: (2024)
par: Kollias, Dimitrios, et autres
Publié: (2024)
On Committor Functions in Milestoning
par: Ji, Xiaojun, et autres
Publié: (2023)
par: Ji, Xiaojun, et autres
Publié: (2023)
360$^\circ$ High-Resolution Depth Estimation via Uncertainty-aware Structural Knowledge Transfer
par: Cao, Zidong, et autres
Publié: (2023)
par: Cao, Zidong, et autres
Publié: (2023)
Design2Cloth: 3D Cloth Generation from 2D Masks
par: Zheng, Jiali, et autres
Publié: (2024)
par: Zheng, Jiali, et autres
Publié: (2024)
Context-self contrastive pretraining for crop type semantic segmentation
par: Tarasiou, Michail, et autres
Publié: (2021)
par: Tarasiou, Michail, et autres
Publié: (2021)
Vision-Language-Action Safety: Threats, Challenges, Evaluations, and Mechanisms
par: Li, Qi, et autres
Publié: (2026)
par: Li, Qi, et autres
Publié: (2026)
PRISM: A Unified Framework for Photorealistic Reconstruction and Intrinsic Scene Modeling
par: Dirik, Alara, et autres
Publié: (2025)
par: Dirik, Alara, et autres
Publié: (2025)
ReasonX: MLLM-Guided Intrinsic Image Decomposition
par: Dirik, Alara, et autres
Publié: (2025)
par: Dirik, Alara, et autres
Publié: (2025)
MagicSkin: Balancing Marker and Markerless Modes in Vision-Based Tactile Sensors with a Translucent Skin
par: Tijani, Oluwatimilehin, et autres
Publié: (2025)
par: Tijani, Oluwatimilehin, et autres
Publié: (2025)
Dual Information Speech Language Models for Emotional Conversations
par: Wang, Chun, et autres
Publié: (2025)
par: Wang, Chun, et autres
Publié: (2025)
Documents similaires
-
Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents
par: Liu, Dayong, et autres
Publié: (2025) -
ImHead: A Large-scale Implicit Morphable Model for Localized Head Modeling
par: Potamias, Rolandos Alexandros, et autres
Publié: (2025) -
ID-to-3D: Expressive ID-guided 3D Heads via Score Distillation Sampling
par: Babiloni, Francesca, et autres
Publié: (2024) -
Improving face generation quality and prompt following with synthetic captions
par: Tarasiou, Michail, et autres
Publié: (2024) -
Deep Face Restoration: A Survey
par: Wang, Tao, et autres
Publié: (2022)