Words into World: A Task-Adaptive Agent for Language-Guided Spatial Retrieval in AR
Fuente:
arXiv
Guardado en:
| Autores principales: | Guo, Lixing, Höllerer, Tobias |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Comparing Zealous and Restrained AI Recommendations in a Real-World Human-AI Collaboration Task
por: Xu, Chengyuan, et al.
Publicado: (2024)
por: Xu, Chengyuan, et al.
Publicado: (2024)
Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble
por: Duan, Lin, et al.
Publicado: (2025)
por: Duan, Lin, et al.
Publicado: (2025)
Multimodal 3D Fusion and In-Situ Learning for Spatially Aware AI
por: Xu, Chengyuan, et al.
Publicado: (2024)
por: Xu, Chengyuan, et al.
Publicado: (2024)
ScreenAgent: A Vision Language Model-driven Computer Control Agent
por: Niu, Runliang, et al.
Publicado: (2024)
por: Niu, Runliang, et al.
Publicado: (2024)
GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents
por: Ouyang, Mingyu, et al.
Publicado: (2026)
por: Ouyang, Mingyu, et al.
Publicado: (2026)
Encode-Store-Retrieve: Augmenting Human Memory through Language-Encoded Egocentric Perception
por: Shen, Junxiao, et al.
Publicado: (2023)
por: Shen, Junxiao, et al.
Publicado: (2023)
Do Vision Language Models Understand Human Engagement in Games?
por: Wang, Ziyi, et al.
Publicado: (2026)
por: Wang, Ziyi, et al.
Publicado: (2026)
OpenMobile: Building Open Mobile Agents with Task and Trajectory Synthesis
por: Cheng, Kanzhi, et al.
Publicado: (2026)
por: Cheng, Kanzhi, et al.
Publicado: (2026)
GUIDE: A Benchmark for Understanding and Assisting Users in Open-Ended GUI Tasks
por: Yang, Saelyne, et al.
Publicado: (2026)
por: Yang, Saelyne, et al.
Publicado: (2026)
Yume: An Interactive World Generation Model
por: Mao, Xiaofeng, et al.
Publicado: (2025)
por: Mao, Xiaofeng, et al.
Publicado: (2025)
Smoothing Grounding and Reasoning for MLLM-Powered GUI Agents with Query-Oriented Pivot Tasks
por: Wu, Zongru, et al.
Publicado: (2025)
por: Wu, Zongru, et al.
Publicado: (2025)
OS-Genesis: Automating GUI Agent Trajectory Construction via Reverse Task Synthesis
por: Sun, Qiushi, et al.
Publicado: (2024)
por: Sun, Qiushi, et al.
Publicado: (2024)
Not There Yet: Evaluating Vision Language Models in Simulating the Visual Perception of People with Low Vision
por: Natalie, Rosiana, et al.
Publicado: (2025)
por: Natalie, Rosiana, et al.
Publicado: (2025)
A Picture is Worth a Thousand Prompts? Efficacy of Iterative Human-Driven Prompt Refinement in Image Regeneration Tasks
por: Trinh, Khoi, et al.
Publicado: (2025)
por: Trinh, Khoi, et al.
Publicado: (2025)
AutoTour: Automatic Photo Tour Guide with Smartphones and LLMs
por: Xu, Huatao, et al.
Publicado: (2026)
por: Xu, Huatao, et al.
Publicado: (2026)
See-Control: A Multimodal Agent Framework for Smartphone Interaction with a Robotic Arm
por: Zhao, Haoyu, et al.
Publicado: (2025)
por: Zhao, Haoyu, et al.
Publicado: (2025)
SASG-DA: Sparse-Aware Semantic-Guided Diffusion Augmentation For Myoelectric Gesture Recognition
por: Liu, Chen, et al.
Publicado: (2025)
por: Liu, Chen, et al.
Publicado: (2025)
ChartGen: Scaling Chart Understanding Via Code-Guided Synthetic Chart Generation
por: Kondic, Jovana, et al.
Publicado: (2025)
por: Kondic, Jovana, et al.
Publicado: (2025)
CutVerse: A Compositional GUI Agents Benchmark for Media Post-Production Editing
por: Hu, Haobo, et al.
Publicado: (2026)
por: Hu, Haobo, et al.
Publicado: (2026)
Adaptive 3D UI Placement in Mixed Reality Using Deep Reinforcement Learning
por: Lu, Feiyu, et al.
Publicado: (2025)
por: Lu, Feiyu, et al.
Publicado: (2025)
Regressor-Guided Generative Image Editing Balances User Emotions to Reduce Time Spent Online
por: Gebhardt, Christoph, et al.
Publicado: (2025)
por: Gebhardt, Christoph, et al.
Publicado: (2025)
HandS3C: 3D Hand Mesh Reconstruction with State Space Spatial Channel Attention from RGB images
por: Jiao, Zixun, et al.
Publicado: (2024)
por: Jiao, Zixun, et al.
Publicado: (2024)
A Backbone for Long-Horizon Robot Task Understanding
por: Chen, Xiaoshuai, et al.
Publicado: (2024)
por: Chen, Xiaoshuai, et al.
Publicado: (2024)
T2I-Copilot: A Training-Free Multi-Agent Text-to-Image System for Enhanced Prompt Interpretation and Interactive Generation
por: Chen, Chieh-Yun, et al.
Publicado: (2025)
por: Chen, Chieh-Yun, et al.
Publicado: (2025)
GUICourse: From General Vision Language Models to Versatile GUI Agents
por: Chen, Wentong, et al.
Publicado: (2024)
por: Chen, Wentong, et al.
Publicado: (2024)
Code2World: A GUI World Model via Renderable Code Generation
por: Zheng, Yuhao, et al.
Publicado: (2026)
por: Zheng, Yuhao, et al.
Publicado: (2026)
BdSLW401: Transformer-Based Word-Level Bangla Sign Language Recognition Using Relative Quantization Encoding (RQE)
por: Rubaiyeat, Husne Ara, et al.
Publicado: (2025)
por: Rubaiyeat, Husne Ara, et al.
Publicado: (2025)
ShowUI: One Vision-Language-Action Model for GUI Visual Agent
por: Lin, Kevin Qinghong, et al.
Publicado: (2024)
por: Lin, Kevin Qinghong, et al.
Publicado: (2024)
Forest-Chat: Adapting Vision-Language Agents for Interactive Forest Change Analysis
por: Brock, James, et al.
Publicado: (2026)
por: Brock, James, et al.
Publicado: (2026)
Trust in Vision-Language Models: Insights from a Participatory User Workshop
por: Chiatti, Agnese, et al.
Publicado: (2025)
por: Chiatti, Agnese, et al.
Publicado: (2025)
Large Language Models estimate fine-grained human color-concept associations
por: Mukherjee, Kushin, et al.
Publicado: (2024)
por: Mukherjee, Kushin, et al.
Publicado: (2024)
VLM-driven Behavior Tree for Context-aware Task Planning
por: Wake, Naoki, et al.
Publicado: (2025)
por: Wake, Naoki, et al.
Publicado: (2025)
OLMD: Orientation-aware Long-term Motion Decoupling for Continuous Sign Language Recognition
por: Yu, Yiheng, et al.
Publicado: (2025)
por: Yu, Yiheng, et al.
Publicado: (2025)
Constructive Apraxia: An Unexpected Limit of Instructible Vision-Language Models and Analog for Human Cognitive Disorders
por: Noever, David, et al.
Publicado: (2024)
por: Noever, David, et al.
Publicado: (2024)
Achieving Effective Virtual Reality Interactions via Acoustic Gesture Recognition based on Large Language Models
por: Zhang, Xijie, et al.
Publicado: (2025)
por: Zhang, Xijie, et al.
Publicado: (2025)
PixelWeb: The First Web GUI Dataset with Pixel-Wise Labels
por: Yang, Qi, et al.
Publicado: (2025)
por: Yang, Qi, et al.
Publicado: (2025)
UI-UG: A Unified MLLM for UI Understanding and Generation
por: Yang, Hao, et al.
Publicado: (2025)
por: Yang, Hao, et al.
Publicado: (2025)
See What I Mean: Aligning Vision and Language Representations for Video Fine-grained Object Understanding
por: Sun, Boyuan, et al.
Publicado: (2026)
por: Sun, Boyuan, et al.
Publicado: (2026)
ImageTalk: Designing a Multimodal AAC Text Generation System Driven by Image Recognition and Natural Language Generation
por: Yang, Boyin, et al.
Publicado: (2025)
por: Yang, Boyin, et al.
Publicado: (2025)
VerSe: Integrating Multiple Queries as Prompts for Versatile Cardiac MRI Segmentation
por: Guo, Bangwei, et al.
Publicado: (2024)
por: Guo, Bangwei, et al.
Publicado: (2024)
Ejemplares similares
-
Comparing Zealous and Restrained AI Recommendations in a Real-World Human-AI Collaboration Task
por: Xu, Chengyuan, et al.
Publicado: (2024) -
Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble
por: Duan, Lin, et al.
Publicado: (2025) -
Multimodal 3D Fusion and In-Situ Learning for Spatially Aware AI
por: Xu, Chengyuan, et al.
Publicado: (2024) -
ScreenAgent: A Vision Language Model-driven Computer Control Agent
por: Niu, Runliang, et al.
Publicado: (2024) -
GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents
por: Ouyang, Mingyu, et al.
Publicado: (2026)