Salvato in:
| Autori principali: | Sarch, Gabriel, Somani, Sahil, Kapoor, Raghav, Tarr, Michael J., Fragkiadaki, Katerina |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2404.19065 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VLM Agents Generate Their Own Memories: Distilling Experience into Embodied Programs of Thought
di: Sarch, Gabriel, et al.
Pubblicazione: (2024)
di: Sarch, Gabriel, et al.
Pubblicazione: (2024)
Grounded Reinforcement Learning for Visual Reasoning
di: Sarch, Gabriel, et al.
Pubblicazione: (2025)
di: Sarch, Gabriel, et al.
Pubblicazione: (2025)
Unifying 2D and 3D Vision-Language Understanding
di: Jain, Ayush, et al.
Pubblicazione: (2025)
di: Jain, Ayush, et al.
Pubblicazione: (2025)
ODIN: A Single Model for 2D and 3D Segmentation
di: Jain, Ayush, et al.
Pubblicazione: (2024)
di: Jain, Ayush, et al.
Pubblicazione: (2024)
Revealing the Inherent Instructability of Pre-Trained Language Models
di: An, Seokhyun, et al.
Pubblicazione: (2024)
di: An, Seokhyun, et al.
Pubblicazione: (2024)
Reanimating Images using Neural Representations of Dynamic Stimuli
di: Yeung, Jacob, et al.
Pubblicazione: (2024)
di: Yeung, Jacob, et al.
Pubblicazione: (2024)
Unified Multimodal Discrete Diffusion
di: Swerdlow, Alexander, et al.
Pubblicazione: (2025)
di: Swerdlow, Alexander, et al.
Pubblicazione: (2025)
Scaling Instructable Agents Across Many Simulated Worlds
di: SIMA Team, et al.
Pubblicazione: (2024)
di: SIMA Team, et al.
Pubblicazione: (2024)
DreamScene4D: Dynamic Multi-Object Scene Generation from Monocular Videos
di: Chu, Wen-Hsuan, et al.
Pubblicazione: (2024)
di: Chu, Wen-Hsuan, et al.
Pubblicazione: (2024)
Neurosymbolic AI for Enhancing Instructability in Generative AI
di: Sheth, Amit, et al.
Pubblicazione: (2024)
di: Sheth, Amit, et al.
Pubblicazione: (2024)
SALMON: Self-Alignment with Instructable Reward Models
di: Sun, Zhiqing, et al.
Pubblicazione: (2023)
di: Sun, Zhiqing, et al.
Pubblicazione: (2023)
Environmental Understanding Vision-Language Model for Embodied Agent
di: Bang, Jinsik, et al.
Pubblicazione: (2026)
di: Bang, Jinsik, et al.
Pubblicazione: (2026)
Memory-Augmented Vision-Language Agents for Persistent and Semantically Consistent Object Captioning
di: Galliena, Tommaso, et al.
Pubblicazione: (2026)
di: Galliena, Tommaso, et al.
Pubblicazione: (2026)
EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents
di: Yang, Rui, et al.
Pubblicazione: (2025)
di: Yang, Rui, et al.
Pubblicazione: (2025)
3D Diffuser Actor: Policy Diffusion with 3D Scene Representations
di: Ke, Tsung-Wei, et al.
Pubblicazione: (2024)
di: Ke, Tsung-Wei, et al.
Pubblicazione: (2024)
Dex4D: Task-Agnostic Point Track Policy for Sim-to-Real Dexterous Manipulation
di: Kuang, Yuxuan, et al.
Pubblicazione: (2026)
di: Kuang, Yuxuan, et al.
Pubblicazione: (2026)
Learning to Assist: Physics-Grounded Human-Human Control via Multi-Agent Reinforcement Learning
di: Shibata, Yuto, et al.
Pubblicazione: (2026)
di: Shibata, Yuto, et al.
Pubblicazione: (2026)
RetroMotion: Retrocausal Motion Forecasting Models are Instructable
di: Wagner, Royden, et al.
Pubblicazione: (2025)
di: Wagner, Royden, et al.
Pubblicazione: (2025)
Aligning Text-to-Image Diffusion Models with Reward Backpropagation
di: Prabhudesai, Mihir, et al.
Pubblicazione: (2023)
di: Prabhudesai, Mihir, et al.
Pubblicazione: (2023)
TAPIP3D: Tracking Any Point in Persistent 3D Geometry
di: Zhang, Bowei, et al.
Pubblicazione: (2025)
di: Zhang, Bowei, et al.
Pubblicazione: (2025)
Ella: Embodied Social Agents with Lifelong Memory
di: Zhang, Hongxin, et al.
Pubblicazione: (2025)
di: Zhang, Hongxin, et al.
Pubblicazione: (2025)
Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models
di: Ling, Yiran, et al.
Pubblicazione: (2026)
di: Ling, Yiran, et al.
Pubblicazione: (2026)
Mema: Memory-Augmented Adapter for Enhanced Vision-Language Understanding
di: Liu, Ying, et al.
Pubblicazione: (2026)
di: Liu, Ying, et al.
Pubblicazione: (2026)
AgentThink: A Unified Framework for Tool-Augmented Chain-of-Thought Reasoning in Vision-Language Models for Autonomous Driving
di: Qian, Kangan, et al.
Pubblicazione: (2025)
di: Qian, Kangan, et al.
Pubblicazione: (2025)
Vision-Language Agents for Interactive Forest Change Analysis
di: Brock, James, et al.
Pubblicazione: (2026)
di: Brock, James, et al.
Pubblicazione: (2026)
LLM-Empowered Embodied Agent for Memory-Augmented Task Planning in Household Robotics
di: Glocker, Marc, et al.
Pubblicazione: (2025)
di: Glocker, Marc, et al.
Pubblicazione: (2025)
Aerial Vision-Language Navigation with a Unified Framework for Spatial, Temporal and Embodied Reasoning
di: Xu, Huilin, et al.
Pubblicazione: (2025)
di: Xu, Huilin, et al.
Pubblicazione: (2025)
EVLP:Learning Unified Embodied Vision-Language Planner with Reinforced Supervised Fine-Tuning
di: Cai, Xinyan, et al.
Pubblicazione: (2025)
di: Cai, Xinyan, et al.
Pubblicazione: (2025)
An Embodied AR Navigation Agent: Integrating BIM with Retrieval-Augmented Generation for Language Guidance
di: Yang, Hsuan-Kung, et al.
Pubblicazione: (2025)
di: Yang, Hsuan-Kung, et al.
Pubblicazione: (2025)
Provable Ordering and Continuity in Vision-Language Pretraining for Generalizable Embodied Agents
di: Zhang, Zhizhen, et al.
Pubblicazione: (2025)
di: Zhang, Zhizhen, et al.
Pubblicazione: (2025)
Uni-LaViRA: Language-Vision-Robot Actions Translation for Unified Embodied Navigation
di: Ding, Hongyu, et al.
Pubblicazione: (2026)
di: Ding, Hongyu, et al.
Pubblicazione: (2026)
Values in the Wild: Discovering and Analyzing Values in Real-World Language Model Interactions
di: Huang, Saffron, et al.
Pubblicazione: (2025)
di: Huang, Saffron, et al.
Pubblicazione: (2025)
StableSemantics: A Synthetic Language-Vision Dataset of Semantic Representations in Naturalistic Images
di: Zawar, Rushikesh, et al.
Pubblicazione: (2024)
di: Zawar, Rushikesh, et al.
Pubblicazione: (2024)
Energy-based Models are Zero-Shot Planners for Compositional Scene Rearrangement
di: Gkanatsios, Nikolaos, et al.
Pubblicazione: (2023)
di: Gkanatsios, Nikolaos, et al.
Pubblicazione: (2023)
OmniACT: A Dataset and Benchmark for Enabling Multimodal Generalist Autonomous Agents for Desktop and Web
di: Kapoor, Raghav, et al.
Pubblicazione: (2024)
di: Kapoor, Raghav, et al.
Pubblicazione: (2024)
Vero: An Open RL Recipe for General Visual Reasoning
di: Sarch, Gabriel, et al.
Pubblicazione: (2026)
di: Sarch, Gabriel, et al.
Pubblicazione: (2026)
G-MAP: General Memory-Augmented Pre-trained Language Model for Domain Tasks
di: Wan, Zhongwei, et al.
Pubblicazione: (2022)
di: Wan, Zhongwei, et al.
Pubblicazione: (2022)
Embodied4C: Measuring What Matters for Embodied Vision-Language Navigation
di: Sohn, Tin Stribor, et al.
Pubblicazione: (2025)
di: Sohn, Tin Stribor, et al.
Pubblicazione: (2025)
Video Diffusion Alignment via Reward Gradients
di: Prabhudesai, Mihir, et al.
Pubblicazione: (2024)
di: Prabhudesai, Mihir, et al.
Pubblicazione: (2024)
Diffusion Beats Autoregressive in Data-Constrained Settings
di: Prabhudesai, Mihir, et al.
Pubblicazione: (2025)
di: Prabhudesai, Mihir, et al.
Pubblicazione: (2025)
Documenti analoghi
-
VLM Agents Generate Their Own Memories: Distilling Experience into Embodied Programs of Thought
di: Sarch, Gabriel, et al.
Pubblicazione: (2024) -
Grounded Reinforcement Learning for Visual Reasoning
di: Sarch, Gabriel, et al.
Pubblicazione: (2025) -
Unifying 2D and 3D Vision-Language Understanding
di: Jain, Ayush, et al.
Pubblicazione: (2025) -
ODIN: A Single Model for 2D and 3D Segmentation
di: Jain, Ayush, et al.
Pubblicazione: (2024) -
Revealing the Inherent Instructability of Pre-Trained Language Models
di: An, Seokhyun, et al.
Pubblicazione: (2024)