RynnBrain: Open Embodied Foundation Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Dang, Ronghao, Guo, Jiayan, Hou, Bohan, Leng, Sicong, Li, Kehan, Li, Xin, Liu, Jiangpin, Mao, Yunxuan, Wang, Zhikai, Yuan, Yuqian, Zhu, Minghao, Lin, Xiao, Bai, Yang, Jiang, Qian, Zhao, Yaxi, Zeng, Minghua, Gao, Junlong, Jiang, Yuming, Cen, Jun, Huang, Siteng, Wang, Liuyi, Zhang, Wenqiao, Liu, Chengju, Yang, Jianfei, Lu, Shijian, Zhao, Deli |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
RynnEC: Bringing MLLMs into Embodied World
por: Dang, Ronghao, et al.
Publicado: (2025)
por: Dang, Ronghao, et al.
Publicado: (2025)
RynnVLA-001: Using Human Demonstrations to Improve Robot Manipulation
por: Jiang, Yuming, et al.
Publicado: (2025)
por: Jiang, Yuming, et al.
Publicado: (2025)
RynnVLA-002: A Unified Vision-Language-Action and World Model
por: Cen, Jun, et al.
Publicado: (2025)
por: Cen, Jun, et al.
Publicado: (2025)
InterLV-Search: Benchmarking Interleaved Multimodal Agentic Search
por: Hou, Bohan, et al.
Publicado: (2026)
por: Hou, Bohan, et al.
Publicado: (2026)
Causality-based Cross-Modal Representation Learning for Vision-and-Language Navigation
por: Wang, Liuyi, et al.
Publicado: (2024)
por: Wang, Liuyi, et al.
Publicado: (2024)
Vision-and-Language Navigation via Causal Learning
por: Wang, Liuyi, et al.
Publicado: (2024)
por: Wang, Liuyi, et al.
Publicado: (2024)
Towards Affordance-Aware Robotic Dexterous Grasping with Human-like Priors
por: Zhao, Haoyu, et al.
Publicado: (2025)
por: Zhao, Haoyu, et al.
Publicado: (2025)
A Dual Semantic-Aware Recurrent Global-Adaptive Network For Vision-and-Language Navigation
por: Wang, Liuyi, et al.
Publicado: (2023)
por: Wang, Liuyi, et al.
Publicado: (2023)
WorldVLA: Towards Autoregressive Action World Model
por: Cen, Jun, et al.
Publicado: (2025)
por: Cen, Jun, et al.
Publicado: (2025)
High-Fidelity Simulated Data Generation for Real-World Zero-Shot Robotic Manipulation Learning with Gaussian Splatting
por: Zhao, Haoyu, et al.
Publicado: (2025)
por: Zhao, Haoyu, et al.
Publicado: (2025)
EOC-Bench: Can MLLMs Identify, Recall, and Forecast Objects in an Egocentric World?
por: Yuan, Yuqian, et al.
Publicado: (2025)
por: Yuan, Yuqian, et al.
Publicado: (2025)
Chain of Ideas: Revolutionizing Research Via Novel Idea Development with LLM Agents
por: Li, Long, et al.
Publicado: (2024)
por: Li, Long, et al.
Publicado: (2024)
MAGIC: Meta-Ability Guided Interactive Chain-of-Distillation for Effective-and-Efficient Vision-and-Language Navigation
por: Wang, Liuyi, et al.
Publicado: (2024)
por: Wang, Liuyi, et al.
Publicado: (2024)
NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization
por: He, Zongtao, et al.
Publicado: (2025)
por: He, Zongtao, et al.
Publicado: (2025)
The Curse of Multi-Modalities: Evaluating Hallucinations of Large Multimodal Models across Language, Visual, and Audio
por: Leng, Sicong, et al.
Publicado: (2024)
por: Leng, Sicong, et al.
Publicado: (2024)
Pathway‐Dependent Self‐Assembly for Control over Helical Nanostructures and Topochemical Photopolymerization
por: Sifan Du, et al.
Publicado: (2024)
por: Sifan Du, et al.
Publicado: (2024)
Breaking the Memory Barrier: Near Infinite Batch Size Scaling for Contrastive Loss
por: Cheng, Zesen, et al.
Publicado: (2024)
por: Cheng, Zesen, et al.
Publicado: (2024)
Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs
por: Jiang, Xueying, et al.
Publicado: (2026)
por: Jiang, Xueying, et al.
Publicado: (2026)
VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding
por: Zhang, Boqiang, et al.
Publicado: (2025)
por: Zhang, Boqiang, et al.
Publicado: (2025)
Fine-Grained Spatiotemporal Motion Alignment for Contrastive Video Representation Learning
por: Zhu, Minghao, et al.
Publicado: (2023)
por: Zhu, Minghao, et al.
Publicado: (2023)
Domain-Conditioned Scene Graphs for State-Grounded Task Planning
por: Herzog, Jonas, et al.
Publicado: (2025)
por: Herzog, Jonas, et al.
Publicado: (2025)
Intrapersonal Interactions on Social Media: Self‐Curatorship within the Museum of Self
por: Sicong Zhao
Publicado: (2025)
por: Sicong Zhao
Publicado: (2025)
MLANet: Multi-Level Attention Network with Sub-instruction for Continuous Vision-and-Language Navigation
por: He, Zongtao, et al.
Publicado: (2023)
por: He, Zongtao, et al.
Publicado: (2023)
Temporal-Guided Visual Foundation Models for Event-Based Vision
por: Xia, Ruihao, et al.
Publicado: (2025)
por: Xia, Ruihao, et al.
Publicado: (2025)
GP3: A 3D Geometry-Aware Policy with Multi-View Images for Robotic Manipulation
por: Qian, Quanhao, et al.
Publicado: (2025)
por: Qian, Quanhao, et al.
Publicado: (2025)
RoboSVG: A Unified Framework for Interactive SVG Generation with Multi-modal Guidance
por: Wang, Jiuniu, et al.
Publicado: (2025)
por: Wang, Jiuniu, et al.
Publicado: (2025)
On isolated singularities of the conformal Gaussian curvature equation and $Q$-curvature equation
por: Yang, Hui, et al.
Publicado: (2025)
por: Yang, Hui, et al.
Publicado: (2025)
SignalLLM: A General-Purpose LLM Agent Framework for Automated Signal Processing
por: Ke, Junlong, et al.
Publicado: (2025)
por: Ke, Junlong, et al.
Publicado: (2025)
Joint Optimization of STAR-RIS Assisted SWIPT Communication Systems
por: Yang, Junlong
Publicado: (2024)
por: Yang, Junlong
Publicado: (2024)
Classification of Transposed Poisson 3-Lie algebras of dimension 3
por: Yaxi, Jiang, et al.
Publicado: (2024)
por: Yaxi, Jiang, et al.
Publicado: (2024)
Manin triples, bialgebras and Yang-Baxter equation of $A_3$-associative algebras
por: Jiang, Yaxi, et al.
Publicado: (2025)
por: Jiang, Yaxi, et al.
Publicado: (2025)
Rethinking the Embodied Gap in Vision-and-Language Navigation: A Holistic Study of Physical and Visual Disparities
por: Wang, Liuyi, et al.
Publicado: (2025)
por: Wang, Liuyi, et al.
Publicado: (2025)
Deconfounded Lifelong Learning for Autonomous Driving via Dynamic Knowledge Spaces
por: Du, Jiayuan, et al.
Publicado: (2026)
por: Du, Jiayuan, et al.
Publicado: (2026)
REI-Bench: Can Embodied Agents Understand Vague Human Instructions in Task Planning?
por: Jiang, Chenxi, et al.
Publicado: (2025)
por: Jiang, Chenxi, et al.
Publicado: (2025)
PASTS: Progress-Aware Spatio-Temporal Transformer Speaker For Vision-and-Language Navigation
por: Wang, Liuyi, et al.
Publicado: (2023)
por: Wang, Liuyi, et al.
Publicado: (2023)
Handedness‐Inverted and Stimuli‐Responsive Circularly Polarized Luminescent Nano/Micromaterials Through Pathway‐Dependent Chiral Supramolecular Polymorphism
por: Chenyang Zhao, et al.
Publicado: (2024)
por: Chenyang Zhao, et al.
Publicado: (2024)
PixelRefer: A Unified Framework for Spatio-Temporal Object Referring with Arbitrary Granularity
por: Yuan, Yuqian, et al.
Publicado: (2025)
por: Yuan, Yuqian, et al.
Publicado: (2025)
ECBench: Can Multi-modal Foundation Models Understand the Egocentric World? A Holistic Embodied Cognition Benchmark
por: Dang, Ronghao, et al.
Publicado: (2025)
por: Dang, Ronghao, et al.
Publicado: (2025)
CLASH: Collaborative Large-Small Hierarchical Framework for Continuous Vision-and-Language Navigation
por: Wang, Liuyi, et al.
Publicado: (2025)
por: Wang, Liuyi, et al.
Publicado: (2025)
CleanPose: Category-Level Object Pose Estimation via Causal Learning and Knowledge Distillation
por: Lin, Xiao, et al.
Publicado: (2025)
por: Lin, Xiao, et al.
Publicado: (2025)
Ejemplares similares
-
RynnEC: Bringing MLLMs into Embodied World
por: Dang, Ronghao, et al.
Publicado: (2025) -
RynnVLA-001: Using Human Demonstrations to Improve Robot Manipulation
por: Jiang, Yuming, et al.
Publicado: (2025) -
RynnVLA-002: A Unified Vision-Language-Action and World Model
por: Cen, Jun, et al.
Publicado: (2025) -
InterLV-Search: Benchmarking Interleaved Multimodal Agentic Search
por: Hou, Bohan, et al.
Publicado: (2026) -
Causality-based Cross-Modal Representation Learning for Vision-and-Language Navigation
por: Wang, Liuyi, et al.
Publicado: (2024)