ForgeVLA: Federated Vision-Language-Action Learning without Language Annotations
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhou, Yuhao, Zhu, Yunpeng, Zhou, Yang, Lyu, Jindi, Lan, Jian, Wang, Zhangyuan, Si, Dan, Seidl, Thomas, Ye, Qing, Lyu, Jiancheng |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Deploying Models to Non-participating Clients in Federated Learning without Fine-tuning: A Hypernetwork-based Approach
par: Zhou, Yuhao, et autres
Publié: (2025)
par: Zhou, Yuhao, et autres
Publié: (2025)
UnderwaterVLA: Dual-brain Vision-Language-Action architecture for Autonomous Underwater Navigation
par: Wang, Zhangyuan, et autres
Publié: (2025)
par: Wang, Zhangyuan, et autres
Publié: (2025)
GPS: Distilling Compact Memories via Grid-based Patch Sampling for Efficient Online Class-Incremental Learning
par: Ma, Mingchuan, et autres
Publié: (2025)
par: Ma, Mingchuan, et autres
Publié: (2025)
RotVLA: Rotational Latent Action for Vision-Language-Action Model
par: Li, Qiwei, et autres
Publié: (2026)
par: Li, Qiwei, et autres
Publié: (2026)
HyperNAS: Enhancing Architecture Representation for NAS Predictor via Hypernetwork
par: Lv, Jindi, et autres
Publié: (2025)
par: Lv, Jindi, et autres
Publié: (2025)
Stable Language Guidance for Vision-Language-Action Models
par: Zhan, Zhihao, et autres
Publié: (2026)
par: Zhan, Zhihao, et autres
Publié: (2026)
ReconVLA: An Uncertainty-Guided and Failure-Aware Vision-Language-Action Framework for Robotic Control
par: Chen, Lingling, et autres
Publié: (2026)
par: Chen, Lingling, et autres
Publié: (2026)
DyGRO-VLA: Cross-Task Scaling of Vision-Language-Action Models via Dynamic Grouped Residual Optimization
par: Lin, Sixu, et autres
Publié: (2026)
par: Lin, Sixu, et autres
Publié: (2026)
Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models
par: Bai, Shuanghao, et autres
Publié: (2026)
par: Bai, Shuanghao, et autres
Publié: (2026)
StableVLA: Towards Robust Vision-Language-Action Models without Extra Data
par: Fu, Yiyang, et autres
Publié: (2026)
par: Fu, Yiyang, et autres
Publié: (2026)
ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models
par: Zhong, Linqing, et autres
Publié: (2026)
par: Zhong, Linqing, et autres
Publié: (2026)
UrbanVLA: A Vision-Language-Action Model for Urban Micromobility
par: Li, Anqi, et autres
Publié: (2025)
par: Li, Anqi, et autres
Publié: (2025)
MAIN-VLA: Modeling Abstraction of Intention and eNvironment for Vision-Language-Action Models
par: Zhou, Zheyuan, et autres
Publié: (2026)
par: Zhou, Zheyuan, et autres
Publié: (2026)
VLA-Pro: Cross-Task Procedural Memory Transfer for Vision-Language-Action Models
par: Si, Shengyu, et autres
Publié: (2026)
par: Si, Shengyu, et autres
Publié: (2026)
RedVLA: Physical Red Teaming for Vision-Language-Action Models
par: Zhang, Yuhao, et autres
Publié: (2026)
par: Zhang, Yuhao, et autres
Publié: (2026)
Pure Vision Language Action (VLA) Models: A Comprehensive Survey
par: Zhang, Dapeng, et autres
Publié: (2025)
par: Zhang, Dapeng, et autres
Publié: (2025)
VLA-R1: Enhancing Reasoning in Vision-Language-Action Models
par: Ye, Angen, et autres
Publié: (2025)
par: Ye, Angen, et autres
Publié: (2025)
Multi-Path Collaborative Reasoning via Reinforcement Learning
par: Lv, Jindi, et autres
Publié: (2025)
par: Lv, Jindi, et autres
Publié: (2025)
Sparse Visual Thought Circuits in Vision-Language Models
par: Zhou, Yunpeng
Publié: (2026)
par: Zhou, Yunpeng
Publié: (2026)
TacVLA: Contact-Aware Tactile Fusion for Robust Vision-Language-Action Manipulation
par: Zhang, Kaidi, et autres
Publié: (2026)
par: Zhang, Kaidi, et autres
Publié: (2026)
Ferret: An Efficient Online Continual Learning Framework under Varying Memory Constraints
par: Zhou, Yuhao, et autres
Publié: (2025)
par: Zhou, Yuhao, et autres
Publié: (2025)
EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models
par: Yang, Yantai, et autres
Publié: (2025)
par: Yang, Yantai, et autres
Publié: (2025)
NICE FACT: Diagnosing and Calibrating VLMs in Quantitative Reasoning for Kinematic Physics
par: Lan, Jian, et autres
Publié: (2026)
par: Lan, Jian, et autres
Publié: (2026)
VLA-Arena: An Open-Source Framework for Benchmarking Vision-Language-Action Models
par: Zhang, Borong, et autres
Publié: (2025)
par: Zhang, Borong, et autres
Publié: (2025)
ChatVLA: Unified Multimodal Understanding and Robot Control with Vision-Language-Action Model
par: Zhou, Zhongyi, et autres
Publié: (2025)
par: Zhou, Zhongyi, et autres
Publié: (2025)
HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models
par: Lin, Minghui, et autres
Publié: (2025)
par: Lin, Minghui, et autres
Publié: (2025)
VLA-AN: An Efficient and Onboard Vision-Language-Action Framework for Aerial Navigation in Complex Environments
par: Wu, Yuze, et autres
Publié: (2025)
par: Wu, Yuze, et autres
Publié: (2025)
Towards Unified Facial Action Unit Recognition Framework by Large Language Models
par: Hu, Guohong, et autres
Publié: (2024)
par: Hu, Guohong, et autres
Publié: (2024)
Counterfactual VLA: Self-Reflective Vision-Language-Action Model with Adaptive Reasoning
par: Peng, Zhenghao "Mark", et autres
Publié: (2025)
par: Peng, Zhenghao "Mark", et autres
Publié: (2025)
ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge
par: Zhou, Zhongyi, et autres
Publié: (2025)
par: Zhou, Zhongyi, et autres
Publié: (2025)
ST4VLA: Spatially Guided Training for Vision-Language-Action Models
par: Ye, Jinhui, et autres
Publié: (2026)
par: Ye, Jinhui, et autres
Publié: (2026)
VP-VLA: Visual Prompting as an Interface for Vision-Language-Action Models
par: Wang, Zixuan, et autres
Publié: (2026)
par: Wang, Zixuan, et autres
Publié: (2026)
BadVLA: Towards Backdoor Attacks on Vision-Language-Action Models via Objective-Decoupled Optimization
par: Zhou, Xueyang, et autres
Publié: (2025)
par: Zhou, Xueyang, et autres
Publié: (2025)
EdgeVLA: Efficient Vision-Language-Action Models
par: Budzianowski, Paweł, et autres
Publié: (2025)
par: Budzianowski, Paweł, et autres
Publié: (2025)
CRL-VLA: Continual Vision-Language-Action Learning
par: Zeng, Qixin, et autres
Publié: (2026)
par: Zeng, Qixin, et autres
Publié: (2026)
StarVLA-$α$: Reducing Complexity in Vision-Language-Action Systems
par: Ye, Jinhui, et autres
Publié: (2026)
par: Ye, Jinhui, et autres
Publié: (2026)
FutureVLA: Joint Visuomotor Prediction for Vision-Language-Action Model
par: Xu, Xiaoxu, et autres
Publié: (2026)
par: Xu, Xiaoxu, et autres
Publié: (2026)
Dream-VL & Dream-VLA: Open Vision-Language and Vision-Language-Action Models with Diffusion Language Model Backbone
par: Ye, Jiacheng, et autres
Publié: (2025)
par: Ye, Jiacheng, et autres
Publié: (2025)
SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning
par: Zhang, Borong, et autres
Publié: (2025)
par: Zhang, Borong, et autres
Publié: (2025)
QDepth-VLA: Quantized Depth Prediction as Auxiliary Supervision for Vision-Language-Action Models
par: Li, Yixuan, et autres
Publié: (2025)
par: Li, Yixuan, et autres
Publié: (2025)
Documents similaires
-
Deploying Models to Non-participating Clients in Federated Learning without Fine-tuning: A Hypernetwork-based Approach
par: Zhou, Yuhao, et autres
Publié: (2025) -
UnderwaterVLA: Dual-brain Vision-Language-Action architecture for Autonomous Underwater Navigation
par: Wang, Zhangyuan, et autres
Publié: (2025) -
GPS: Distilling Compact Memories via Grid-based Patch Sampling for Efficient Online Class-Incremental Learning
par: Ma, Mingchuan, et autres
Publié: (2025) -
RotVLA: Rotational Latent Action for Vision-Language-Action Model
par: Li, Qiwei, et autres
Publié: (2026) -
HyperNAS: Enhancing Architecture Representation for NAS Predictor via Hypernetwork
par: Lv, Jindi, et autres
Publié: (2025)