EmbRACE-3K: Embodied Reasoning and Action in Complex Environments
Fuente:
arXiv
Salvato in:
| Autori principali: | Lin, Mingxian, Huang, Wei, Li, Yitang, Jiang, Chengjie, Wu, Kui, Zhong, Fangwei, Qian, Shengju, Wang, Xin, Qi, Xiaojuan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FreeMotion: MoCap-Free Human Motion Synthesis with Multimodal Large Language Models
di: Zhang, Zhikai, et al.
Pubblicazione: (2024)
di: Zhang, Zhikai, et al.
Pubblicazione: (2024)
EmbSpatial-Bench: Benchmarking Spatial Understanding for Embodied Tasks with Large Vision-Language Models
di: Du, Mengfei, et al.
Pubblicazione: (2024)
di: Du, Mengfei, et al.
Pubblicazione: (2024)
Empowering Embodied Visual Tracking with Visual Foundation Models and Offline RL
di: Zhong, Fangwei, et al.
Pubblicazione: (2024)
di: Zhong, Fangwei, et al.
Pubblicazione: (2024)
Embodied-Reasoner: Synergizing Visual Search, Reasoning, and Action for Embodied Interactive Tasks
di: Zhang, Wenqi, et al.
Pubblicazione: (2025)
di: Zhang, Wenqi, et al.
Pubblicazione: (2025)
Hierarchical Instruction-aware Embodied Visual Tracking
di: Wu, Kui, et al.
Pubblicazione: (2025)
di: Wu, Kui, et al.
Pubblicazione: (2025)
TrackVLA++: Unleashing Reasoning and Memory Capabilities in VLA Models for Embodied Visual Tracking
di: Liu, Jiahang, et al.
Pubblicazione: (2025)
di: Liu, Jiahang, et al.
Pubblicazione: (2025)
UnrealZoo: Enriching Photo-realistic Virtual Worlds for Embodied AI
di: Zhong, Fangwei, et al.
Pubblicazione: (2024)
di: Zhong, Fangwei, et al.
Pubblicazione: (2024)
VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models
di: Wu, Kui, et al.
Pubblicazione: (2025)
di: Wu, Kui, et al.
Pubblicazione: (2025)
RescueBench: Can Embodied Agents Save Lives in the Wild ?
di: Wu, Kui, et al.
Pubblicazione: (2026)
di: Wu, Kui, et al.
Pubblicazione: (2026)
Reinforced Context Order Recovery for Adaptive Reasoning and Planning
di: Ma, Long, et al.
Pubblicazione: (2025)
di: Ma, Long, et al.
Pubblicazione: (2025)
TrackVLA: Embodied Visual Tracking in the Wild
di: Wang, Shaoan, et al.
Pubblicazione: (2025)
di: Wang, Shaoan, et al.
Pubblicazione: (2025)
ReVSeg: Incentivizing the Reasoning Chain for Video Segmentation with Reinforcement Learning
di: Li, Yifan, et al.
Pubblicazione: (2025)
di: Li, Yifan, et al.
Pubblicazione: (2025)
EnerVerse-AC: Envisioning Embodied Environments with Action Condition
di: Jiang, Yuxin, et al.
Pubblicazione: (2025)
di: Jiang, Yuxin, et al.
Pubblicazione: (2025)
CoLT: Reasoning with Chain of Latent Tool Calls
di: Zhu, Fangwei, et al.
Pubblicazione: (2026)
di: Zhu, Fangwei, et al.
Pubblicazione: (2026)
Simulated Adoption: Decoupling Magnitude and Direction in LLM In-Context Conflict Resolution
di: Zhang, Long, et al.
Pubblicazione: (2026)
di: Zhang, Long, et al.
Pubblicazione: (2026)
EmbBERT: Attention Under 2 MB Memory
di: Bravin, Riccardo, et al.
Pubblicazione: (2025)
di: Bravin, Riccardo, et al.
Pubblicazione: (2025)
CoMet: Metaphor-Driven Covert Communication for Multi-Agent Language Games
di: Xu, Shuhang, et al.
Pubblicazione: (2025)
di: Xu, Shuhang, et al.
Pubblicazione: (2025)
See, Remember, Explore: A Benchmark and Baselines for Streaming Spatial Reasoning
di: Wei, Yuxi, et al.
Pubblicazione: (2026)
di: Wei, Yuxi, et al.
Pubblicazione: (2026)
V-ReasonBench: Toward Unified Reasoning Benchmark Suite for Video Generation Models
di: Luo, Yang, et al.
Pubblicazione: (2025)
di: Luo, Yang, et al.
Pubblicazione: (2025)
Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models
di: Ling, Yiran, et al.
Pubblicazione: (2026)
di: Ling, Yiran, et al.
Pubblicazione: (2026)
EmbGen: Teaching with Reassembled Corpora
di: Lenin, Arun K, et al.
Pubblicazione: (2026)
di: Lenin, Arun K, et al.
Pubblicazione: (2026)
Collaborating Action by Action: A Multi-agent LLM Framework for Embodied Reasoning
di: White, Isadora, et al.
Pubblicazione: (2025)
di: White, Isadora, et al.
Pubblicazione: (2025)
Make Interaction Situated: Designing User Acceptable Interaction for Situated Visualization in Public Environments
di: Zhu, Qian, et al.
Pubblicazione: (2024)
di: Zhu, Qian, et al.
Pubblicazione: (2024)
Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning
di: Sun, Qi, et al.
Pubblicazione: (2024)
di: Sun, Qi, et al.
Pubblicazione: (2024)
GraphPilot: GUI Task Automation with One-Step LLM Reasoning Powered by Knowledge Graph
di: Yu, Mingxian, et al.
Pubblicazione: (2026)
di: Yu, Mingxian, et al.
Pubblicazione: (2026)
Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
di: Yang, Ganlin, et al.
Pubblicazione: (2025)
di: Yang, Ganlin, et al.
Pubblicazione: (2025)
World Action Models: The Next Frontier in Embodied AI
di: Wang, Siyin, et al.
Pubblicazione: (2026)
di: Wang, Siyin, et al.
Pubblicazione: (2026)
Prompt Highlighter: Interactive Control for Multi-Modal LLMs
di: Zhang, Yuechen, et al.
Pubblicazione: (2023)
di: Zhang, Yuechen, et al.
Pubblicazione: (2023)
DualVLA: Building a Generalizable Embodied Agent via Partial Decoupling of Reasoning and Action
di: Fang, Zhen, et al.
Pubblicazione: (2025)
di: Fang, Zhen, et al.
Pubblicazione: (2025)
Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models
di: Zhou, Shengchao, et al.
Pubblicazione: (2025)
di: Zhou, Shengchao, et al.
Pubblicazione: (2025)
MEIA: Multimodal Embodied Perception and Interaction in Unknown Environments
di: Liu, Yang, et al.
Pubblicazione: (2024)
di: Liu, Yang, et al.
Pubblicazione: (2024)
MindChat: Enhancing BCI Spelling with Large Language Models in Realistic Scenarios
di: Wang, JIaheng, et al.
Pubblicazione: (2025)
di: Wang, JIaheng, et al.
Pubblicazione: (2025)
CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning
di: Li, Kailing, et al.
Pubblicazione: (2025)
di: Li, Kailing, et al.
Pubblicazione: (2025)
CoDiEmb: A Collaborative yet Distinct Framework for Unified Representation Learning in Information Retrieval and Semantic Textual Similarity
di: Zhang, Bowen, et al.
Pubblicazione: (2025)
di: Zhang, Bowen, et al.
Pubblicazione: (2025)
Visual Environment-Interactive Planning for Embodied Complex-Question Answering
di: Lan, Ning, et al.
Pubblicazione: (2025)
di: Lan, Ning, et al.
Pubblicazione: (2025)
Pruning Minimal Reasoning Graphs for Efficient Retrieval-Augmented Generation
di: Wang, Ning, et al.
Pubblicazione: (2026)
di: Wang, Ning, et al.
Pubblicazione: (2026)
Self-Supervised Bootstrapping of Action-Predictive Embodied Reasoning
di: Ganai, Milan, et al.
Pubblicazione: (2026)
di: Ganai, Milan, et al.
Pubblicazione: (2026)
Learning Additively Compositional Latent Actions for Embodied AI
di: Wei, Hangxing, et al.
Pubblicazione: (2026)
di: Wei, Hangxing, et al.
Pubblicazione: (2026)
What Can Student-AI Dialogues Tell Us About Students' Self-Regulated Learning? An exploratory framework
di: Zhang, Long, et al.
Pubblicazione: (2025)
di: Zhang, Long, et al.
Pubblicazione: (2025)
LLM Enhanced Action Recognition via Hierarchical Global-Local Skeleton-Language Model
di: Wang, Ruosi, et al.
Pubblicazione: (2026)
di: Wang, Ruosi, et al.
Pubblicazione: (2026)
Documenti analoghi
-
FreeMotion: MoCap-Free Human Motion Synthesis with Multimodal Large Language Models
di: Zhang, Zhikai, et al.
Pubblicazione: (2024) -
EmbSpatial-Bench: Benchmarking Spatial Understanding for Embodied Tasks with Large Vision-Language Models
di: Du, Mengfei, et al.
Pubblicazione: (2024) -
Empowering Embodied Visual Tracking with Visual Foundation Models and Offline RL
di: Zhong, Fangwei, et al.
Pubblicazione: (2024) -
Embodied-Reasoner: Synergizing Visual Search, Reasoning, and Action for Embodied Interactive Tasks
di: Zhang, Wenqi, et al.
Pubblicazione: (2025) -
Hierarchical Instruction-aware Embodied Visual Tracking
di: Wu, Kui, et al.
Pubblicazione: (2025)