Guardado en:
| Autores principales: | Luo, Yulin, Fan, Chun-Kai, Dong, Menghang, Shi, Jiayu, Zhao, Mengdi, Zhang, Bo-Wen, Chi, Cheng, Liu, Jiaming, Dai, Gaole, Zhang, Rongyu, An, Ruichuan, Wu, Kun, Che, Zhengping, Xie, Shaoxuan, Yao, Guocai, Zhao, Zhongxia, Wang, Pengwei, Liu, Guang, Wang, Zhongyuan, Huang, Tiejun, Zhang, Shanghang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2510.17801 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SpikeGen: Decoupled "Rods and Cones" Visual Representation Processing with Latent Generative Framework
por: Dai, Gaole, et al.
Publicado: (2025)
por: Dai, Gaole, et al.
Publicado: (2025)
Robo-Dopamine: General Process Reward Modeling for High-Precision Robotic Manipulation
por: Tan, Huajie, et al.
Publicado: (2025)
por: Tan, Huajie, et al.
Publicado: (2025)
METIS: Multi-Source Egocentric Training for Integrated Dexterous Vision-Language-Action Model
por: Fu, Yankai, et al.
Publicado: (2025)
por: Fu, Yankai, et al.
Publicado: (2025)
LLM as Dataset Analyst: Subpopulation Structure Discovery with Large Language Model
por: Luo, Yulin, et al.
Publicado: (2024)
por: Luo, Yulin, et al.
Publicado: (2024)
MoLe-VLA: Dynamic Layer-skipping Vision Language Action Model via Mixture-of-Layers for Efficient Robot Manipulation
por: Zhang, Rongyu, et al.
Publicado: (2025)
por: Zhang, Rongyu, et al.
Publicado: (2025)
RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete
por: Ji, Yuheng, et al.
Publicado: (2025)
por: Ji, Yuheng, et al.
Publicado: (2025)
Multimodal Large Language Models for Bioimage Analysis
por: Zhang, Shanghang, et al.
Publicado: (2024)
por: Zhang, Shanghang, et al.
Publicado: (2024)
MoSA: Mixture of Sparse Adapters for Visual Efficient Tuning
por: Zhang, Qizhe, et al.
Publicado: (2023)
por: Zhang, Qizhe, et al.
Publicado: (2023)
Orochi: Versatile Biomedical Image Processor
por: Dai, Gaole, et al.
Publicado: (2025)
por: Dai, Gaole, et al.
Publicado: (2025)
Decomposing the Neurons: Activation Sparsity via Mixture of Experts for Continual Test Time Adaptation
por: Zhang, Rongyu, et al.
Publicado: (2024)
por: Zhang, Rongyu, et al.
Publicado: (2024)
Action-Sketcher: From Reasoning to Action via Visual Sketches for Long-Horizon Robotic Manipulation
por: Tan, Huajie, et al.
Publicado: (2026)
por: Tan, Huajie, et al.
Publicado: (2026)
FactorLLM: Factorizing Knowledge via Mixture of Experts for Large Language Models
por: Zhao, Zhongyu, et al.
Publicado: (2024)
por: Zhao, Zhongyu, et al.
Publicado: (2024)
SpikePingpong: Spike Vision-based Fast-Slow Pingpong Robot System
por: Wang, Hao, et al.
Publicado: (2025)
por: Wang, Hao, et al.
Publicado: (2025)
RoboBrain 2.5: Depth in Sight, Time in Mind
por: Tan, Huajie, et al.
Publicado: (2026)
por: Tan, Huajie, et al.
Publicado: (2026)
AffordGrasp: In-Context Affordance Reasoning for Open-Vocabulary Task-Oriented Grasping in Clutter
por: Tang, Yingbo, et al.
Publicado: (2025)
por: Tang, Yingbo, et al.
Publicado: (2025)
RepCaM++: Exploring Transparent Visual Prompt With Inference-Time Re-Parameterization for Neural Video Delivery
por: Zhang, Rongyu, et al.
Publicado: (2025)
por: Zhang, Rongyu, et al.
Publicado: (2025)
RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics
por: Zhou, Enshen, et al.
Publicado: (2025)
por: Zhou, Enshen, et al.
Publicado: (2025)
MoASE++: Mixture of Activation Sparsity Experts with Domain-Adaptive On-policy Distillation for Continual Test Time Adaptation
por: Zhang, Ronyu, et al.
Publicado: (2026)
por: Zhang, Ronyu, et al.
Publicado: (2026)
Lift3D Foundation Policy: Lifting 2D Large-Scale Pretrained Models for Robust 3D Robotic Manipulation
por: Jia, Yueru, et al.
Publicado: (2024)
por: Jia, Yueru, et al.
Publicado: (2024)
BEVUDA++: Geometric-aware Unsupervised Domain Adaptation for Multi-View 3D Object Detection
por: Zhang, Rongyu, et al.
Publicado: (2025)
por: Zhang, Rongyu, et al.
Publicado: (2025)
Implicit Neural Image Field for Biological Microscopy Image Compression
por: Dai, Gaole, et al.
Publicado: (2024)
por: Dai, Gaole, et al.
Publicado: (2024)
SpikeNVS: Enhancing Novel View Synthesis from Blurry Images via Spike Camera
por: Dai, Gaole, et al.
Publicado: (2024)
por: Dai, Gaole, et al.
Publicado: (2024)
Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought
por: Zhang, Shuyi, et al.
Publicado: (2025)
por: Zhang, Shuyi, et al.
Publicado: (2025)
Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
por: Tan, Huajie, et al.
Publicado: (2025)
por: Tan, Huajie, et al.
Publicado: (2025)
AC-DiT: Adaptive Coordination Diffusion Transformer for Mobile Manipulation
por: Chen, Sixiang, et al.
Publicado: (2025)
por: Chen, Sixiang, et al.
Publicado: (2025)
PIGEON: VLM-Driven Object Navigation via Points of Interest Selection
por: Peng, Cheng, et al.
Publicado: (2025)
por: Peng, Cheng, et al.
Publicado: (2025)
Demo-JEPA: Joint-Embedding Predictive Architecture for One-shot Cross-Embodiment Imitation
por: He, Jingyang, et al.
Publicado: (2026)
por: He, Jingyang, et al.
Publicado: (2026)
BEVUDA: Multi-geometric Space Alignments for Domain Adaptive BEV 3D Object Detection
por: Liu, Jiaming, et al.
Publicado: (2022)
por: Liu, Jiaming, et al.
Publicado: (2022)
Unsupervised Spike Depth Estimation via Cross-modality Cross-domain Knowledge Transfer
por: Liu, Jiaming, et al.
Publicado: (2022)
por: Liu, Jiaming, et al.
Publicado: (2022)
SaPaVe: Towards Active Perception and Manipulation in Vision-Language-Action Models for Robotics
por: Liu, Mengzhen, et al.
Publicado: (2026)
por: Liu, Mengzhen, et al.
Publicado: (2026)
RoboMIND 2.0: A Multimodal, Bimanual Mobile Manipulation Dataset for Generalizable Embodied Intelligence
por: Hou, Chengkai, et al.
Publicado: (2025)
por: Hou, Chengkai, et al.
Publicado: (2025)
EVA: An Embodied World Model for Future Video Anticipation
por: Chi, Xiaowei, et al.
Publicado: (2024)
por: Chi, Xiaowei, et al.
Publicado: (2024)
MapNav: A Novel Memory Representation via Annotated Semantic Maps for Vision-and-Language Navigation
por: Zhang, Lingfeng, et al.
Publicado: (2025)
por: Zhang, Lingfeng, et al.
Publicado: (2025)
AoE: Always-on Egocentric Human Video Collection for Embodied AI
por: Yang, Bowen, et al.
Publicado: (2026)
por: Yang, Bowen, et al.
Publicado: (2026)
$NavA^3$: Understanding Any Instruction, Navigating Anywhere, Finding Anything
por: Zhang, Lingfeng, et al.
Publicado: (2025)
por: Zhang, Lingfeng, et al.
Publicado: (2025)
M$^{2}$Chat: Empowering VLM for Multimodal LLM Interleaved Text-Image Generation
por: Chi, Xiaowei, et al.
Publicado: (2023)
por: Chi, Xiaowei, et al.
Publicado: (2023)
A Vanilla Multi-Task Framework for Dense Visual Prediction Solution to 1st VCL Challenge -- Multi-Task Robustness Track
por: Chen, Zehui, et al.
Publicado: (2024)
por: Chen, Zehui, et al.
Publicado: (2024)
TIGeR: Tool-Integrated Geometric Reasoning in Vision-Language Models for Robotics
por: Han, Yi, et al.
Publicado: (2025)
por: Han, Yi, et al.
Publicado: (2025)
DualVLA: Building a Generalizable Embodied Agent via Partial Decoupling of Reasoning and Action
por: Fang, Zhen, et al.
Publicado: (2025)
por: Fang, Zhen, et al.
Publicado: (2025)
EmpathyAgent: Can Embodied Agents Conduct Empathetic Actions?
por: Chen, Xinyan, et al.
Publicado: (2025)
por: Chen, Xinyan, et al.
Publicado: (2025)
Ejemplares similares
-
SpikeGen: Decoupled "Rods and Cones" Visual Representation Processing with Latent Generative Framework
por: Dai, Gaole, et al.
Publicado: (2025) -
Robo-Dopamine: General Process Reward Modeling for High-Precision Robotic Manipulation
por: Tan, Huajie, et al.
Publicado: (2025) -
METIS: Multi-Source Egocentric Training for Integrated Dexterous Vision-Language-Action Model
por: Fu, Yankai, et al.
Publicado: (2025) -
LLM as Dataset Analyst: Subpopulation Structure Discovery with Large Language Model
por: Luo, Yulin, et al.
Publicado: (2024) -
MoLe-VLA: Dynamic Layer-skipping Vision Language Action Model via Mixture-of-Layers for Efficient Robot Manipulation
por: Zhang, Rongyu, et al.
Publicado: (2025)