ROCKET: Residual-Oriented Multi-Layer Alignment for Spatially-Aware Vision-Language-Action Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sun, Guoheng, Du, Tingting, Feng, Kaixi, Luo, Chenxiang, Ding, Xingguo, Shen, Zheyu, Wang, Ziyao, He, Yexiao, Li, Ang |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Vision-Language-Action in Robotics: A Survey of Datasets, Benchmarks, and Data Engines
par: Wang, Ziyao, et autres
Publié: (2026)
par: Wang, Ziyao, et autres
Publié: (2026)
Predictive Auditing of Hidden Tokens in LLM APIs via Reasoning Length Estimation
par: Wang, Ziyao, et autres
Publié: (2025)
par: Wang, Ziyao, et autres
Publié: (2025)
EdgeLoRA: An Efficient Multi-Tenant LLM Serving System on Edge Devices
par: Shen, Zheyu, et autres
Publié: (2025)
par: Shen, Zheyu, et autres
Publié: (2025)
FedMOA: Federated GRPO for Personalized Reasoning LLMs under Heterogeneous Rewards
par: Wang, Ziyao, et autres
Publié: (2026)
par: Wang, Ziyao, et autres
Publié: (2026)
Prada: Black-Box LLM Adaptation with Private Data on Resource-Constrained Devices
par: Wang, Ziyao, et autres
Publié: (2025)
par: Wang, Ziyao, et autres
Publié: (2025)
FLoRA: Federated Fine-Tuning Large Language Models with Heterogeneous Low-Rank Adaptations
par: Wang, Ziyao, et autres
Publié: (2024)
par: Wang, Ziyao, et autres
Publié: (2024)
Invisible Tokens, Visible Bills: The Urgent Need to Audit Hidden Operations in Opaque LLM Services
par: Sun, Guoheng, et autres
Publié: (2025)
par: Sun, Guoheng, et autres
Publié: (2025)
SHED: Shapley-Based Automated Dataset Refinement for Instruction Fine-Tuning
par: He, Yexiao, et autres
Publié: (2024)
par: He, Yexiao, et autres
Publié: (2024)
Revisiting Federated Fine-Tuning: A Single Communication Round is Enough for Foundation Models
par: Wang, Ziyao, et autres
Publié: (2024)
par: Wang, Ziyao, et autres
Publié: (2024)
CoIn: Counting the Invisible Reasoning Tokens in Commercial Opaque LLM APIs
par: Sun, Guoheng, et autres
Publié: (2025)
par: Sun, Guoheng, et autres
Publié: (2025)
What Matters in Transformers? Not All Attention is Needed
par: He, Shwai, et autres
Publié: (2024)
par: He, Shwai, et autres
Publié: (2024)
Fair Diagnosis: Leveraging Causal Modeling to Mitigate Medical Bias
par: Tian, Bowei, et autres
Publié: (2024)
par: Tian, Bowei, et autres
Publié: (2024)
NeuroSymAD: A Neuro-Symbolic Framework for Interpretable Alzheimer's Disease Diagnosis
par: He, Yexiao, et autres
Publié: (2025)
par: He, Yexiao, et autres
Publié: (2025)
SymRTLO: Enhancing RTL Code Optimization with LLMs and Neuron-Inspired Symbolic Reasoning
par: Wang, Yiting, et autres
Publié: (2025)
par: Wang, Yiting, et autres
Publié: (2025)
MindCraft: How Concept Trees Take Shape In Deep Models
par: Tian, Bowei, et autres
Publié: (2025)
par: Tian, Bowei, et autres
Publié: (2025)
HIT-ROCKET: Hadamard-vector Inner-product Transformer for ROCKET
par: Hao, Wang, et autres
Publié: (2025)
par: Hao, Wang, et autres
Publié: (2025)
CogniPair: From LLM Chatbots to Conscious AI Agents -- GNWT-Based Multi-Agent Digital Twins for Social Pairing -- Dating & Hiring Applications
par: Ye, Wanghao, et autres
Publié: (2025)
par: Ye, Wanghao, et autres
Publié: (2025)
Towards Building Non-Fine-Tunable Foundation Models
par: Wang, Ziyao, et autres
Publié: (2026)
par: Wang, Ziyao, et autres
Publié: (2026)
VEGA: Visual Encoder Grounding Alignment for Spatially-Aware Vision-Language-Action Models
par: Wang, Hao, et autres
Publié: (2026)
par: Wang, Hao, et autres
Publié: (2026)
EvoVerilog: Large Langugage Model Assisted Evolution of Verilog Code
par: Guo, Ping, et autres
Publié: (2025)
par: Guo, Ping, et autres
Publié: (2025)
MCP4EDA: LLM-Powered Model Context Protocol RTL-to-GDSII Automation with Backend Aware Synthesis Optimization
par: Wang, Yiting, et autres
Publié: (2025)
par: Wang, Yiting, et autres
Publié: (2025)
MedOrch: Medical Diagnosis with Tool-Augmented Reasoning Agents for Flexible Extensibility
par: He, Yexiao, et autres
Publié: (2025)
par: He, Yexiao, et autres
Publié: (2025)
ROCKET-2: Steering Visuomotor Policy via Cross-View Goal Alignment
par: Cai, Shaofei, et autres
Publié: (2025)
par: Cai, Shaofei, et autres
Publié: (2025)
CUROCKET: Optimizing ROCKET for GPU
par: Stüven, Ole, et autres
Publié: (2026)
par: Stüven, Ole, et autres
Publié: (2026)
Data-Efficient Spectral Classification of Hyperspectral Data Using MiniROCKET and HDC-MiniROCKET
par: Theisen, Nick, et autres
Publié: (2025)
par: Theisen, Nick, et autres
Publié: (2025)
Towards counterfactual fairness through auxiliary variables
par: Tian, Bowei, et autres
Publié: (2024)
par: Tian, Bowei, et autres
Publié: (2024)
Residual Supply and the Price of Risk Absorption
par: Wang, Ziyao
Publié: (2026)
par: Wang, Ziyao
Publié: (2026)
Arctic-Text2SQL-R1: Simple Rewards, Strong Reasoning in Text-to-SQL
par: Yao, Zhewei, et autres
Publié: (2025)
par: Yao, Zhewei, et autres
Publié: (2025)
Cognibit: From Digital Exhaustion to Real-World Connection Through Gamified Territory Control and LLM-Powered Twin Networking
par: Ye, Wanghao, et autres
Publié: (2026)
par: Ye, Wanghao, et autres
Publié: (2026)
Decentralized Time Series Classification with ROCKET Features
par: Casella, Bruno, et autres
Publié: (2025)
par: Casella, Bruno, et autres
Publié: (2025)
Global-local Spatial-temporal Aware Graph Attention Network for Network Traffic Forecasting
par: Xing, Jinming, et autres
Publié: (2025)
par: Xing, Jinming, et autres
Publié: (2025)
Demystifying When Pruning Works via Representation Hierarchies
par: He, Shwai, et autres
Publié: (2026)
par: He, Shwai, et autres
Publié: (2026)
Group Deliberation Oriented Multi-Agent Conversational Model for Complex Reasoning
par: Shi, Zheyu, et autres
Publié: (2025)
par: Shi, Zheyu, et autres
Publié: (2025)
Spatial Memory for Out-of-Vision Manipulation in Vision-Language-Action
par: Li, Pengteng, et autres
Publié: (2026)
par: Li, Pengteng, et autres
Publié: (2026)
Autoregressive Video Autoencoder with Decoupled Temporal and Spatial Context
par: Shen, Cuifeng, et autres
Publié: (2025)
par: Shen, Cuifeng, et autres
Publié: (2025)
ML-CLIPSim: Multi-Layer CLIP Similarity for Machine-Oriented Image Quality
par: Ding, Feng, et autres
Publié: (2026)
par: Ding, Feng, et autres
Publié: (2026)
InSpire: Vision-Language-Action Models with Intrinsic Spatial Reasoning
par: Zhang, Ji, et autres
Publié: (2025)
par: Zhang, Ji, et autres
Publié: (2025)
Self-Improving Vision-Language-Action Models with Data Generation via Residual RL
par: Xiao, Wenli, et autres
Publié: (2025)
par: Xiao, Wenli, et autres
Publié: (2025)
SPROCKET: Extending ROCKET to Distance-Based Time-Series Transformations With Prototypes
par: Harner, Nicholas
Publié: (2025)
par: Harner, Nicholas
Publié: (2025)
Spatial Forcing: Implicit Spatial Representation Alignment for Vision-language-action Model
par: Li, Fuhao, et autres
Publié: (2025)
par: Li, Fuhao, et autres
Publié: (2025)
Documents similaires
-
Vision-Language-Action in Robotics: A Survey of Datasets, Benchmarks, and Data Engines
par: Wang, Ziyao, et autres
Publié: (2026) -
Predictive Auditing of Hidden Tokens in LLM APIs via Reasoning Length Estimation
par: Wang, Ziyao, et autres
Publié: (2025) -
EdgeLoRA: An Efficient Multi-Tenant LLM Serving System on Edge Devices
par: Shen, Zheyu, et autres
Publié: (2025) -
FedMOA: Federated GRPO for Personalized Reasoning LLMs under Heterogeneous Rewards
par: Wang, Ziyao, et autres
Publié: (2026) -
Prada: Black-Box LLM Adaptation with Private Data on Resource-Constrained Devices
par: Wang, Ziyao, et autres
Publié: (2025)