Salvato in:
| Autori principali: | Luo, Yulin, Fan, Chun-Kai, Dong, Menghang, Shi, Jiayu, Zhao, Mengdi, Zhang, Bo-Wen, Chi, Cheng, Liu, Jiaming, Dai, Gaole, Zhang, Rongyu, An, Ruichuan, Wu, Kun, Che, Zhengping, Xie, Shaoxuan, Yao, Guocai, Zhao, Zhongxia, Wang, Pengwei, Liu, Guang, Wang, Zhongyuan, Huang, Tiejun, Zhang, Shanghang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2510.17801 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SpikeGen: Decoupled "Rods and Cones" Visual Representation Processing with Latent Generative Framework
di: Dai, Gaole, et al.
Pubblicazione: (2025)
di: Dai, Gaole, et al.
Pubblicazione: (2025)
Robo-Dopamine: General Process Reward Modeling for High-Precision Robotic Manipulation
di: Tan, Huajie, et al.
Pubblicazione: (2025)
di: Tan, Huajie, et al.
Pubblicazione: (2025)
METIS: Multi-Source Egocentric Training for Integrated Dexterous Vision-Language-Action Model
di: Fu, Yankai, et al.
Pubblicazione: (2025)
di: Fu, Yankai, et al.
Pubblicazione: (2025)
LLM as Dataset Analyst: Subpopulation Structure Discovery with Large Language Model
di: Luo, Yulin, et al.
Pubblicazione: (2024)
di: Luo, Yulin, et al.
Pubblicazione: (2024)
MoLe-VLA: Dynamic Layer-skipping Vision Language Action Model via Mixture-of-Layers for Efficient Robot Manipulation
di: Zhang, Rongyu, et al.
Pubblicazione: (2025)
di: Zhang, Rongyu, et al.
Pubblicazione: (2025)
RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete
di: Ji, Yuheng, et al.
Pubblicazione: (2025)
di: Ji, Yuheng, et al.
Pubblicazione: (2025)
Multimodal Large Language Models for Bioimage Analysis
di: Zhang, Shanghang, et al.
Pubblicazione: (2024)
di: Zhang, Shanghang, et al.
Pubblicazione: (2024)
MoSA: Mixture of Sparse Adapters for Visual Efficient Tuning
di: Zhang, Qizhe, et al.
Pubblicazione: (2023)
di: Zhang, Qizhe, et al.
Pubblicazione: (2023)
Orochi: Versatile Biomedical Image Processor
di: Dai, Gaole, et al.
Pubblicazione: (2025)
di: Dai, Gaole, et al.
Pubblicazione: (2025)
Decomposing the Neurons: Activation Sparsity via Mixture of Experts for Continual Test Time Adaptation
di: Zhang, Rongyu, et al.
Pubblicazione: (2024)
di: Zhang, Rongyu, et al.
Pubblicazione: (2024)
Action-Sketcher: From Reasoning to Action via Visual Sketches for Long-Horizon Robotic Manipulation
di: Tan, Huajie, et al.
Pubblicazione: (2026)
di: Tan, Huajie, et al.
Pubblicazione: (2026)
FactorLLM: Factorizing Knowledge via Mixture of Experts for Large Language Models
di: Zhao, Zhongyu, et al.
Pubblicazione: (2024)
di: Zhao, Zhongyu, et al.
Pubblicazione: (2024)
SpikePingpong: Spike Vision-based Fast-Slow Pingpong Robot System
di: Wang, Hao, et al.
Pubblicazione: (2025)
di: Wang, Hao, et al.
Pubblicazione: (2025)
RoboBrain 2.5: Depth in Sight, Time in Mind
di: Tan, Huajie, et al.
Pubblicazione: (2026)
di: Tan, Huajie, et al.
Pubblicazione: (2026)
AffordGrasp: In-Context Affordance Reasoning for Open-Vocabulary Task-Oriented Grasping in Clutter
di: Tang, Yingbo, et al.
Pubblicazione: (2025)
di: Tang, Yingbo, et al.
Pubblicazione: (2025)
RepCaM++: Exploring Transparent Visual Prompt With Inference-Time Re-Parameterization for Neural Video Delivery
di: Zhang, Rongyu, et al.
Pubblicazione: (2025)
di: Zhang, Rongyu, et al.
Pubblicazione: (2025)
RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics
di: Zhou, Enshen, et al.
Pubblicazione: (2025)
di: Zhou, Enshen, et al.
Pubblicazione: (2025)
MoASE++: Mixture of Activation Sparsity Experts with Domain-Adaptive On-policy Distillation for Continual Test Time Adaptation
di: Zhang, Ronyu, et al.
Pubblicazione: (2026)
di: Zhang, Ronyu, et al.
Pubblicazione: (2026)
Lift3D Foundation Policy: Lifting 2D Large-Scale Pretrained Models for Robust 3D Robotic Manipulation
di: Jia, Yueru, et al.
Pubblicazione: (2024)
di: Jia, Yueru, et al.
Pubblicazione: (2024)
BEVUDA++: Geometric-aware Unsupervised Domain Adaptation for Multi-View 3D Object Detection
di: Zhang, Rongyu, et al.
Pubblicazione: (2025)
di: Zhang, Rongyu, et al.
Pubblicazione: (2025)
Implicit Neural Image Field for Biological Microscopy Image Compression
di: Dai, Gaole, et al.
Pubblicazione: (2024)
di: Dai, Gaole, et al.
Pubblicazione: (2024)
SpikeNVS: Enhancing Novel View Synthesis from Blurry Images via Spike Camera
di: Dai, Gaole, et al.
Pubblicazione: (2024)
di: Dai, Gaole, et al.
Pubblicazione: (2024)
Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought
di: Zhang, Shuyi, et al.
Pubblicazione: (2025)
di: Zhang, Shuyi, et al.
Pubblicazione: (2025)
Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
di: Tan, Huajie, et al.
Pubblicazione: (2025)
di: Tan, Huajie, et al.
Pubblicazione: (2025)
AC-DiT: Adaptive Coordination Diffusion Transformer for Mobile Manipulation
di: Chen, Sixiang, et al.
Pubblicazione: (2025)
di: Chen, Sixiang, et al.
Pubblicazione: (2025)
PIGEON: VLM-Driven Object Navigation via Points of Interest Selection
di: Peng, Cheng, et al.
Pubblicazione: (2025)
di: Peng, Cheng, et al.
Pubblicazione: (2025)
Demo-JEPA: Joint-Embedding Predictive Architecture for One-shot Cross-Embodiment Imitation
di: He, Jingyang, et al.
Pubblicazione: (2026)
di: He, Jingyang, et al.
Pubblicazione: (2026)
BEVUDA: Multi-geometric Space Alignments for Domain Adaptive BEV 3D Object Detection
di: Liu, Jiaming, et al.
Pubblicazione: (2022)
di: Liu, Jiaming, et al.
Pubblicazione: (2022)
Unsupervised Spike Depth Estimation via Cross-modality Cross-domain Knowledge Transfer
di: Liu, Jiaming, et al.
Pubblicazione: (2022)
di: Liu, Jiaming, et al.
Pubblicazione: (2022)
SaPaVe: Towards Active Perception and Manipulation in Vision-Language-Action Models for Robotics
di: Liu, Mengzhen, et al.
Pubblicazione: (2026)
di: Liu, Mengzhen, et al.
Pubblicazione: (2026)
RoboMIND 2.0: A Multimodal, Bimanual Mobile Manipulation Dataset for Generalizable Embodied Intelligence
di: Hou, Chengkai, et al.
Pubblicazione: (2025)
di: Hou, Chengkai, et al.
Pubblicazione: (2025)
EVA: An Embodied World Model for Future Video Anticipation
di: Chi, Xiaowei, et al.
Pubblicazione: (2024)
di: Chi, Xiaowei, et al.
Pubblicazione: (2024)
MapNav: A Novel Memory Representation via Annotated Semantic Maps for Vision-and-Language Navigation
di: Zhang, Lingfeng, et al.
Pubblicazione: (2025)
di: Zhang, Lingfeng, et al.
Pubblicazione: (2025)
AoE: Always-on Egocentric Human Video Collection for Embodied AI
di: Yang, Bowen, et al.
Pubblicazione: (2026)
di: Yang, Bowen, et al.
Pubblicazione: (2026)
$NavA^3$: Understanding Any Instruction, Navigating Anywhere, Finding Anything
di: Zhang, Lingfeng, et al.
Pubblicazione: (2025)
di: Zhang, Lingfeng, et al.
Pubblicazione: (2025)
M$^{2}$Chat: Empowering VLM for Multimodal LLM Interleaved Text-Image Generation
di: Chi, Xiaowei, et al.
Pubblicazione: (2023)
di: Chi, Xiaowei, et al.
Pubblicazione: (2023)
A Vanilla Multi-Task Framework for Dense Visual Prediction Solution to 1st VCL Challenge -- Multi-Task Robustness Track
di: Chen, Zehui, et al.
Pubblicazione: (2024)
di: Chen, Zehui, et al.
Pubblicazione: (2024)
TIGeR: Tool-Integrated Geometric Reasoning in Vision-Language Models for Robotics
di: Han, Yi, et al.
Pubblicazione: (2025)
di: Han, Yi, et al.
Pubblicazione: (2025)
DualVLA: Building a Generalizable Embodied Agent via Partial Decoupling of Reasoning and Action
di: Fang, Zhen, et al.
Pubblicazione: (2025)
di: Fang, Zhen, et al.
Pubblicazione: (2025)
EmpathyAgent: Can Embodied Agents Conduct Empathetic Actions?
di: Chen, Xinyan, et al.
Pubblicazione: (2025)
di: Chen, Xinyan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
SpikeGen: Decoupled "Rods and Cones" Visual Representation Processing with Latent Generative Framework
di: Dai, Gaole, et al.
Pubblicazione: (2025) -
Robo-Dopamine: General Process Reward Modeling for High-Precision Robotic Manipulation
di: Tan, Huajie, et al.
Pubblicazione: (2025) -
METIS: Multi-Source Egocentric Training for Integrated Dexterous Vision-Language-Action Model
di: Fu, Yankai, et al.
Pubblicazione: (2025) -
LLM as Dataset Analyst: Subpopulation Structure Discovery with Large Language Model
di: Luo, Yulin, et al.
Pubblicazione: (2024) -
MoLe-VLA: Dynamic Layer-skipping Vision Language Action Model via Mixture-of-Layers for Efficient Robot Manipulation
di: Zhang, Rongyu, et al.
Pubblicazione: (2025)