See and Think: Embodied Agent in Virtual Environment
Fuente:
arXiv
Saved in:
| Main Authors: | Zhao, Zhonghan, Chai, Wenhao, Wang, Xuan, Boyi, Li, Hao, Shengyu, Cao, Shidong, Ye, Tian, Wang, Gaoang |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Do We Really Need a Complex Agent System? Distill Embodied Agent into a Single Model
by: Zhao, Zhonghan, et al.
Published: (2024)
by: Zhao, Zhonghan, et al.
Published: (2024)
EMMOE: A Comprehensive Benchmark for Embodied Mobile Manipulation in Open Environments
by: Li, Dongping, et al.
Published: (2025)
by: Li, Dongping, et al.
Published: (2025)
Adaptive Graph Pruning for Multi-Agent Communication
by: Li, Boyi, et al.
Published: (2025)
by: Li, Boyi, et al.
Published: (2025)
LLaVA-Ultra: Large Chinese Language and Vision Assistant for Ultrasound
by: Guo, Xuechen, et al.
Published: (2024)
by: Guo, Xuechen, et al.
Published: (2024)
DynaHOI: Benchmarking Hand-Object Interaction for Dynamic Target
by: Hu, BoCheng, et al.
Published: (2026)
by: Hu, BoCheng, et al.
Published: (2026)
See, Plan, Snap: Evaluating Multimodal GUI Agents in Scratch
by: Zhang, Xingyi, et al.
Published: (2026)
by: Zhang, Xingyi, et al.
Published: (2026)
See, Act, Adapt: Active Perception for Unsupervised Cross-Domain Visual Adaptation via Personalized VLM-Guided Agent
by: Tang, Tianci, et al.
Published: (2026)
by: Tang, Tianci, et al.
Published: (2026)
Hierarchical Auto-Organizing System for Open-Ended Multi-Agent Navigation
by: Zhao, Zhonghan, et al.
Published: (2024)
by: Zhao, Zhonghan, et al.
Published: (2024)
EmbodiSkill: Skill-Aware Reflection for Self-Evolving Embodied Agents
by: Ju, Ruofei, et al.
Published: (2026)
by: Ju, Ruofei, et al.
Published: (2026)
Seeing Isn't Believing: Mitigating Belief Inertia via Active Intervention in Embodied Agents
by: Wang, Hanlin, et al.
Published: (2026)
by: Wang, Hanlin, et al.
Published: (2026)
Video-MMLU: A Massive Multi-Discipline Lecture Understanding Benchmark
by: Song, Enxin, et al.
Published: (2025)
by: Song, Enxin, et al.
Published: (2025)
See and Remember: A Multimodal Agent for Web Traversal
by: Wang, Xinjun, et al.
Published: (2026)
by: Wang, Xinjun, et al.
Published: (2026)
CLEA: Closed-Loop Embodied Agent for Enhancing Task Execution in Dynamic Environments
by: Lei, Mingcong, et al.
Published: (2025)
by: Lei, Mingcong, et al.
Published: (2025)
STEVE Series: Step-by-Step Construction of Agent Systems in Minecraft
by: Zhao, Zhonghan, et al.
Published: (2024)
by: Zhao, Zhonghan, et al.
Published: (2024)
EmbodiedCity: A Benchmark Platform for Embodied Agent in Real-world City Environment
by: Gao, Chen, et al.
Published: (2024)
by: Gao, Chen, et al.
Published: (2024)
Hand3R: Online 4D Hand-Scene Reconstruction in the Wild
by: Hu, Wendi, et al.
Published: (2026)
by: Hu, Wendi, et al.
Published: (2026)
Generative Multi-Agent Collaboration in Embodied AI: A Systematic Review
by: Wu, Di, et al.
Published: (2025)
by: Wu, Di, et al.
Published: (2025)
Concept Learning for Cooperative Multi-Agent Reinforcement Learning
by: Ge, Zhonghan, et al.
Published: (2025)
by: Ge, Zhonghan, et al.
Published: (2025)
RIG: Synergizing Reasoning and Imagination in End-to-End Generalist Policy
by: Zhao, Zhonghan, et al.
Published: (2025)
by: Zhao, Zhonghan, et al.
Published: (2025)
SIMA 2: A Generalist Embodied Agent for Virtual Worlds
by: SIMA team, et al.
Published: (2025)
by: SIMA team, et al.
Published: (2025)
SimWorld Studio: Automatic Environment Generation with Evolving Coding Agent for Embodied Agent Learning
by: Kang, Haoqiang, et al.
Published: (2026)
by: Kang, Haoqiang, et al.
Published: (2026)
See, Think, Act: Online Shopper Behavior Simulation with VLM Agents
by: Zhang, Yimeng, et al.
Published: (2025)
by: Zhang, Yimeng, et al.
Published: (2025)
KARMA: Augmenting Embodied AI Agents with Long-and-short Term Memory Systems
by: Wang, Zixuan, et al.
Published: (2024)
by: Wang, Zixuan, et al.
Published: (2024)
Think Twice, Act Once: Verifier-Guided Action Selection For Embodied Agents
by: Singhi, Nishad, et al.
Published: (2026)
by: Singhi, Nishad, et al.
Published: (2026)
ERA: Transforming VLMs into Embodied Agents via Embodied Prior Learning and Online Reinforcement Learning
by: Chen, Hanyang, et al.
Published: (2025)
by: Chen, Hanyang, et al.
Published: (2025)
MultiMind: Enhancing Werewolf Agents with Multimodal Reasoning and Theory of Mind
by: Zhang, Zheng, et al.
Published: (2025)
by: Zhang, Zheng, et al.
Published: (2025)
MCP-Persona: Benchmarking LLM Agents on Real-World Personal Applications via Environment Simulation
by: Wang, Wenhao, et al.
Published: (2026)
by: Wang, Wenhao, et al.
Published: (2026)
MADRA: Multi-Agent Debate for Risk-Aware Embodied Planning
by: Wang, Junjian, et al.
Published: (2025)
by: Wang, Junjian, et al.
Published: (2025)
OpenDeepThink: Parallel Reasoning via Bradley-Terry Aggregation
by: Zhou, Shang, et al.
Published: (2026)
by: Zhou, Shang, et al.
Published: (2026)
UnrealZoo: Enriching Photo-realistic Virtual Worlds for Embodied AI
by: Zhong, Fangwei, et al.
Published: (2024)
by: Zhong, Fangwei, et al.
Published: (2024)
Test-Time Mixture of World Models for Embodied Agents in Dynamic Environments
by: Jang, Jinwoo, et al.
Published: (2026)
by: Jang, Jinwoo, et al.
Published: (2026)
Embodied Instruction Following in Unknown Environments
by: Wu, Zhenyu, et al.
Published: (2024)
by: Wu, Zhenyu, et al.
Published: (2024)
What You Think is What You See: Driving Exploration in VLM Agents via Visual-Linguistic Curiosity
by: Li, Haoxi, et al.
Published: (2026)
by: Li, Haoxi, et al.
Published: (2026)
CausalMACE: Causality Empowered Multi-Agents in Minecraft Cooperative Tasks
by: Chai, Qi, et al.
Published: (2025)
by: Chai, Qi, et al.
Published: (2025)
Reinforced Reasoning for Embodied Planning
by: Wu, Di, et al.
Published: (2025)
by: Wu, Di, et al.
Published: (2025)
VidEgoThink: Assessing Egocentric Video Understanding Capabilities for Embodied AI
by: Cheng, Sijie, et al.
Published: (2024)
by: Cheng, Sijie, et al.
Published: (2024)
Embodied Agent Interface: Benchmarking LLMs for Embodied Decision Making
by: Li, Manling, et al.
Published: (2024)
by: Li, Manling, et al.
Published: (2024)
See, Think, Act: Teaching Multimodal Agents to Effectively Interact with GUI by Identifying Toggles
by: Wu, Zongru, et al.
Published: (2025)
by: Wu, Zongru, et al.
Published: (2025)
VirtualEnv: A Platform for Embodied AI Research
by: Swain, Kabir, et al.
Published: (2026)
by: Swain, Kabir, et al.
Published: (2026)
VistaWise: Building Cost-Effective Agent with Cross-Modal Knowledge Graph for Minecraft
by: Fu, Honghao, et al.
Published: (2025)
by: Fu, Honghao, et al.
Published: (2025)
Similar Items
-
Do We Really Need a Complex Agent System? Distill Embodied Agent into a Single Model
by: Zhao, Zhonghan, et al.
Published: (2024) -
EMMOE: A Comprehensive Benchmark for Embodied Mobile Manipulation in Open Environments
by: Li, Dongping, et al.
Published: (2025) -
Adaptive Graph Pruning for Multi-Agent Communication
by: Li, Boyi, et al.
Published: (2025) -
LLaVA-Ultra: Large Chinese Language and Vision Assistant for Ultrasound
by: Guo, Xuechen, et al.
Published: (2024) -
DynaHOI: Benchmarking Hand-Object Interaction for Dynamic Target
by: Hu, BoCheng, et al.
Published: (2026)