ForgeVLA: Federated Vision-Language-Action Learning without Language Annotations
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhou, Yuhao, Zhu, Yunpeng, Zhou, Yang, Lyu, Jindi, Lan, Jian, Wang, Zhangyuan, Si, Dan, Seidl, Thomas, Ye, Qing, Lyu, Jiancheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Deploying Models to Non-participating Clients in Federated Learning without Fine-tuning: A Hypernetwork-based Approach
por: Zhou, Yuhao, et al.
Publicado: (2025)
por: Zhou, Yuhao, et al.
Publicado: (2025)
UnderwaterVLA: Dual-brain Vision-Language-Action architecture for Autonomous Underwater Navigation
por: Wang, Zhangyuan, et al.
Publicado: (2025)
por: Wang, Zhangyuan, et al.
Publicado: (2025)
GPS: Distilling Compact Memories via Grid-based Patch Sampling for Efficient Online Class-Incremental Learning
por: Ma, Mingchuan, et al.
Publicado: (2025)
por: Ma, Mingchuan, et al.
Publicado: (2025)
RotVLA: Rotational Latent Action for Vision-Language-Action Model
por: Li, Qiwei, et al.
Publicado: (2026)
por: Li, Qiwei, et al.
Publicado: (2026)
HyperNAS: Enhancing Architecture Representation for NAS Predictor via Hypernetwork
por: Lv, Jindi, et al.
Publicado: (2025)
por: Lv, Jindi, et al.
Publicado: (2025)
Stable Language Guidance for Vision-Language-Action Models
por: Zhan, Zhihao, et al.
Publicado: (2026)
por: Zhan, Zhihao, et al.
Publicado: (2026)
ReconVLA: An Uncertainty-Guided and Failure-Aware Vision-Language-Action Framework for Robotic Control
por: Chen, Lingling, et al.
Publicado: (2026)
por: Chen, Lingling, et al.
Publicado: (2026)
DyGRO-VLA: Cross-Task Scaling of Vision-Language-Action Models via Dynamic Grouped Residual Optimization
por: Lin, Sixu, et al.
Publicado: (2026)
por: Lin, Sixu, et al.
Publicado: (2026)
Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models
por: Bai, Shuanghao, et al.
Publicado: (2026)
por: Bai, Shuanghao, et al.
Publicado: (2026)
StableVLA: Towards Robust Vision-Language-Action Models without Extra Data
por: Fu, Yiyang, et al.
Publicado: (2026)
por: Fu, Yiyang, et al.
Publicado: (2026)
ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models
por: Zhong, Linqing, et al.
Publicado: (2026)
por: Zhong, Linqing, et al.
Publicado: (2026)
UrbanVLA: A Vision-Language-Action Model for Urban Micromobility
por: Li, Anqi, et al.
Publicado: (2025)
por: Li, Anqi, et al.
Publicado: (2025)
MAIN-VLA: Modeling Abstraction of Intention and eNvironment for Vision-Language-Action Models
por: Zhou, Zheyuan, et al.
Publicado: (2026)
por: Zhou, Zheyuan, et al.
Publicado: (2026)
VLA-Pro: Cross-Task Procedural Memory Transfer for Vision-Language-Action Models
por: Si, Shengyu, et al.
Publicado: (2026)
por: Si, Shengyu, et al.
Publicado: (2026)
RedVLA: Physical Red Teaming for Vision-Language-Action Models
por: Zhang, Yuhao, et al.
Publicado: (2026)
por: Zhang, Yuhao, et al.
Publicado: (2026)
Pure Vision Language Action (VLA) Models: A Comprehensive Survey
por: Zhang, Dapeng, et al.
Publicado: (2025)
por: Zhang, Dapeng, et al.
Publicado: (2025)
VLA-R1: Enhancing Reasoning in Vision-Language-Action Models
por: Ye, Angen, et al.
Publicado: (2025)
por: Ye, Angen, et al.
Publicado: (2025)
Multi-Path Collaborative Reasoning via Reinforcement Learning
por: Lv, Jindi, et al.
Publicado: (2025)
por: Lv, Jindi, et al.
Publicado: (2025)
TacVLA: Contact-Aware Tactile Fusion for Robust Vision-Language-Action Manipulation
por: Zhang, Kaidi, et al.
Publicado: (2026)
por: Zhang, Kaidi, et al.
Publicado: (2026)
Sparse Visual Thought Circuits in Vision-Language Models
por: Zhou, Yunpeng
Publicado: (2026)
por: Zhou, Yunpeng
Publicado: (2026)
Ferret: An Efficient Online Continual Learning Framework under Varying Memory Constraints
por: Zhou, Yuhao, et al.
Publicado: (2025)
por: Zhou, Yuhao, et al.
Publicado: (2025)
EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models
por: Yang, Yantai, et al.
Publicado: (2025)
por: Yang, Yantai, et al.
Publicado: (2025)
NICE FACT: Diagnosing and Calibrating VLMs in Quantitative Reasoning for Kinematic Physics
por: Lan, Jian, et al.
Publicado: (2026)
por: Lan, Jian, et al.
Publicado: (2026)
VLA-Arena: An Open-Source Framework for Benchmarking Vision-Language-Action Models
por: Zhang, Borong, et al.
Publicado: (2025)
por: Zhang, Borong, et al.
Publicado: (2025)
ChatVLA: Unified Multimodal Understanding and Robot Control with Vision-Language-Action Model
por: Zhou, Zhongyi, et al.
Publicado: (2025)
por: Zhou, Zhongyi, et al.
Publicado: (2025)
HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models
por: Lin, Minghui, et al.
Publicado: (2025)
por: Lin, Minghui, et al.
Publicado: (2025)
VLA-AN: An Efficient and Onboard Vision-Language-Action Framework for Aerial Navigation in Complex Environments
por: Wu, Yuze, et al.
Publicado: (2025)
por: Wu, Yuze, et al.
Publicado: (2025)
Towards Unified Facial Action Unit Recognition Framework by Large Language Models
por: Hu, Guohong, et al.
Publicado: (2024)
por: Hu, Guohong, et al.
Publicado: (2024)
Counterfactual VLA: Self-Reflective Vision-Language-Action Model with Adaptive Reasoning
por: Peng, Zhenghao "Mark", et al.
Publicado: (2025)
por: Peng, Zhenghao "Mark", et al.
Publicado: (2025)
ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge
por: Zhou, Zhongyi, et al.
Publicado: (2025)
por: Zhou, Zhongyi, et al.
Publicado: (2025)
ST4VLA: Spatially Guided Training for Vision-Language-Action Models
por: Ye, Jinhui, et al.
Publicado: (2026)
por: Ye, Jinhui, et al.
Publicado: (2026)
VP-VLA: Visual Prompting as an Interface for Vision-Language-Action Models
por: Wang, Zixuan, et al.
Publicado: (2026)
por: Wang, Zixuan, et al.
Publicado: (2026)
BadVLA: Towards Backdoor Attacks on Vision-Language-Action Models via Objective-Decoupled Optimization
por: Zhou, Xueyang, et al.
Publicado: (2025)
por: Zhou, Xueyang, et al.
Publicado: (2025)
EdgeVLA: Efficient Vision-Language-Action Models
por: Budzianowski, Paweł, et al.
Publicado: (2025)
por: Budzianowski, Paweł, et al.
Publicado: (2025)
CRL-VLA: Continual Vision-Language-Action Learning
por: Zeng, Qixin, et al.
Publicado: (2026)
por: Zeng, Qixin, et al.
Publicado: (2026)
StarVLA-$α$: Reducing Complexity in Vision-Language-Action Systems
por: Ye, Jinhui, et al.
Publicado: (2026)
por: Ye, Jinhui, et al.
Publicado: (2026)
FutureVLA: Joint Visuomotor Prediction for Vision-Language-Action Model
por: Xu, Xiaoxu, et al.
Publicado: (2026)
por: Xu, Xiaoxu, et al.
Publicado: (2026)
Dream-VL & Dream-VLA: Open Vision-Language and Vision-Language-Action Models with Diffusion Language Model Backbone
por: Ye, Jiacheng, et al.
Publicado: (2025)
por: Ye, Jiacheng, et al.
Publicado: (2025)
SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning
por: Zhang, Borong, et al.
Publicado: (2025)
por: Zhang, Borong, et al.
Publicado: (2025)
QDepth-VLA: Quantized Depth Prediction as Auxiliary Supervision for Vision-Language-Action Models
por: Li, Yixuan, et al.
Publicado: (2025)
por: Li, Yixuan, et al.
Publicado: (2025)
Ejemplares similares
-
Deploying Models to Non-participating Clients in Federated Learning without Fine-tuning: A Hypernetwork-based Approach
por: Zhou, Yuhao, et al.
Publicado: (2025) -
UnderwaterVLA: Dual-brain Vision-Language-Action architecture for Autonomous Underwater Navigation
por: Wang, Zhangyuan, et al.
Publicado: (2025) -
GPS: Distilling Compact Memories via Grid-based Patch Sampling for Efficient Online Class-Incremental Learning
por: Ma, Mingchuan, et al.
Publicado: (2025) -
RotVLA: Rotational Latent Action for Vision-Language-Action Model
por: Li, Qiwei, et al.
Publicado: (2026) -
HyperNAS: Enhancing Architecture Representation for NAS Predictor via Hypernetwork
por: Lv, Jindi, et al.
Publicado: (2025)